Kurz gesagt

  • Google stellte am Mittwoch Gemini 4 Argon vor, das 77,9 % bei DeepSWE v1.1 erreichte und in seiner eigenen Vergleichstabelle 12 von 18 Benchmarks anführt.
  • Es verzeichnete eine Erfolgsrate von 0,7 % bei Gray Swans Prompt-Injection-Test und lag damit vor Claude Opus 5.5 und Claude Fable 5.1, die beide 1,0 % erreichten.
  • Argon geht zuerst über das Fairwind-Programm an geprüfte Cyber-Verteidiger, ohne Cyber-Schutzmaßnahmen, bevor es zahlende API-Kunden und Google AI Ultra-Abonnenten erreicht.

Gemini 4 ist endlich da, eine Woche nach der Veröffentlichung von Claude Opus 5.5 und einen Tag nach GPT 6.1 Sol, was beweist, dass amerikanische Labore sehr wohl darauf bedacht sind, die KI-Entwicklung zu verlangsamen. Bitte entschuldigen Sie unseren Sarkasmus.

Google stellte Gemini 4 Argon vor am Mittwoch und nannte es sein Frontier-Modell, was bedeutet, dass es sein leistungsfähigstes für Programmierung, Büroarbeit und Cyber-Verteidigung ist.

Myriad: Wie tief wird Nvidia fallen? Klicken Sie, um Ihre Vorhersage zu treffen.
Myriad: Wie tief wird Nvidia fallen? Klicken Sie, um Ihre Vorhersage zu treffen.

Bei DeepSWE v1.1, einem Test, der misst, ob eine KI lange, unübersichtliche, reale Software-Engineering-Aufgaben erledigen kann, und als Prozentsatz bewertet wird, erreichte Argon 77,9 %. Claude Opus 5.5 erzielte 74,2 %, GPT-6 Astra 74,1 % und Claude Fable 5.1 67,4 %.

Zum Vergleich: Gemini 3.6 Flash erreichte im Juli 49 % bei demselben Test. Argon kann außerdem bis zu 1 Million Token in einer einzigen Antwort schreiben, gegenüber 64.000. Ein Token ist ein Textabschnitt, ungefähr drei Viertel eines Wortes, das sind also etwa 750.000 Wörter gegenüber etwa 48.000.

Diese Zahlen sollte man jedoch mit Vorsicht genießen. Google berechnete seinen eigenen DeepSWE-Wert, während die Zahlen der Konkurrenten aus einem öffentlichen Leaderboard und Unternehmensberichten stammten. Die Tabelle räumt auch Schwächen ein. Argon führt bei 12 von 18 Benchmarks, liegt bei einem gleichauf und liegt bei fünf zurück, einer Mischung aus Coding-, Wissenschafts- und Computersteuerungstests.

Doch die auffälligste Funktion des Modells sind seine Cyber-Fähigkeiten. Verstecken Sie eine geheime Anweisung in einer E-Mail, warten Sie, bis ein KI-Assistent sie liest, und sehen Sie, ob die KI dem Fremden statt Ihnen gehorcht. Das ist indirekte Prompt-Injection, und sie ist der Albtraum für jeden, der einer KI seinen Posteingang oder Einkaufswagen anvertrauen möchte.

Beim Indirect Prompt Injection Benchmark von Gray Swan, bei dem bösartige Anweisungen in Inhalten versteckt werden, die Agenten lesen, und bewertet wird, wie oft die Angriffe innerhalb von 15 Versuchen erfolgreich sind, landete Argon bei 0,7 %. Niedriger ist besser. Claude Opus 5.5 und Claude Fable 5.1 erzielten beide 1,0 %.

GPT-6 Astra kam auf 8,5 %. Grok 4.6 und Kimi K3 wurden in etwas mehr als der Hälfte der Fälle getäuscht, mit 51,8 % und 52,7 %.

Argon geht an geprüfte Sicherheitsteams über das Fairwind-Programm, Googles Cyberverteidigungsinitiative mit begrenztem Zugang, die am 2. September mit mehr als 650 Partnern startete, darunter Regierungen und Betreiber kritischer Infrastrukturen. Und es wird „ohne Cyber-Schutzgeländer“ ausgeliefert, die integrierten Verweigerungen, die ein Modell normalerweise daran hindern, beim Hacken zu helfen.

BitcoinBTC · USD

$83,662−0.87%

Sep 24Sep 25Sep 27Sep 29Sep 30

$85.3k$84.4k$83.5k$82.7k

24h HighHigh$85,518

24h LowLow$82,951

VolVol$1.5B

→

Kaufe Bitcoin mit USDT

Bereitgestellt von Jupiter

Preisdaten von CoinGeckoCoinGeckoMehr Bitcoin-Nachrichten und Prognosen →

Die Logik hinter einem solchen Schritt ist, dass Verteidiger ein Modell benötigen, das wie ein Angreifer denken kann, um Lücken zu schließen, bevor Kriminelle sie finden. Der Haken ist, dass dieselbe Fähigkeit in beide Richtungen wirkt, weshalb Google sagt, dass eine schrittweise Einführung der einzige sichere Weg ist. Das Unternehmen beteiligt sich auch am freiwilligen Verfahren der US-Regierung für den Zugang zu Modellen vor der Veröffentlichung.

Google ist nicht der Erste, der ein Cyber-Modell hinter einen Samtseil stellt. Eine frühe Version von Anthropics Claude Mythos half dabei, 271 Schwachstellen in Firefox zu finden, was bedeutet, dass Mozilla anschließend 271 Sicherheitslücken schloss. OpenAI hat mit seinem Trusted Access for Cyber-Programm einen ähnlichen Weg eingeschlagen.

Argons Cyber-Werte übertreffen Gemini 3.8 Flash Cyber, das eingeschränkte Modell, das Google mit Fairwind auf den Markt gebracht hat. Beim Wiz Penetration Test Benchmark, einem internen Google-Test, bei dem eine KI funktionierende Exploits gegen echte Webanwendungsschwachstellen schreiben soll, ohne den Code zu sehen, und bei dem der Anteil der beim ersten Versuch gelösten Aufgaben bewertet wird, erreichte Argon 70,9 % gegenüber 58,2 %.

Google sagt außerdem, dass Argon dem Sicherheitsunternehmen Wiz geholfen hat, eine kritische Schwachstelle in einer von Krankenhäusern weltweit genutzten Gesundheitssoftware zu finden, die frühere Frontier-Modelle übersehen hatten.

Die Veröffentlichung folgt auf einen rauen Sommer für Google. Im Juli lieferte es kleinere Flash-Modelle aus, ließ aber das versprochene Gemini 3.5 Pro aus, und die Alphabet-Aktien fielen um etwa 4,4 %. Argon erschien zudem am selben Tag, an dem Präsident Trump eine freiwillige, straffreie KI-Vereinbarung vorstellte, die von Googles Führung unterzeichnet wurde.

Google sagt, eine breitere Veröffentlichung erfolge so bald wie möglich, beginnend mit zahlenden API-Kunden und Google AI Ultra-Abonnenten.

Der Einführungspreis beträgt 2 $ pro Million Eingabe-Token und 10 $ pro Million Ausgabe-Token. Google hat nicht gesagt, wann dieser Zeitraum endet, nur dass die Standardpreise 4 $ und 20 $ betragen.