W skrócie

  • Google zaprezentowało Gemini 4 Argon w środę, uzyskując 77,9% w DeepSWE v1.1 i prowadząc w 12 z 18 benchmarków w swojej własnej tabeli porównawczej.
  • Osiągnął 0,7% wskaźnika skuteczności ataków w teście wstrzykiwania podpowiedzi Gray Swan, wyprzedzając Claude Opus 5.5 i Claude Fable 5.1, które oba uzyskały 1,0%.
  • Argon trafia najpierw do zweryfikowanych obrońców cyberbezpieczeństwa poprzez Program Fairwind, bez zabezpieczeń cybernetycznych, zanim dotrze do płacących klientów API i subskrybentów Google AI Ultra.

Gemini 4 jest wreszcie tutaj, tydzień po premierze Claude Opus 5.5 i dzień po GPT 6.1 Sol, co dowodzi, że amerykańskie laboratoria są bardzo zaangażowane w spowalnianie rozwoju AI. Prosimy o wybaczenie naszego sarkazmu.

Google zaprezentowało Gemini 4 Argon w środę, nazywając go swoim modelem frontier, czyli najbardziej zaawansowanym, do kodowania, pracy biurowej i obrony cybernetycznej.

Myriad: Jak nisko spadnie Nvidia? Kliknij, aby zgłosić swoją prognozę.
Myriad: Jak nisko spadnie Nvidia? Kliknij, aby zgłosić swoją prognozę.

W DeepSWE v1.1, teście sprawdzającym, czy AI potrafi ukończyć długie, chaotyczne, rzeczywiste zadania z zakresu inżynierii oprogramowania, ocenianym w procentach, Argon osiągnął 77,9%. Claude Opus 5.5 uzyskał 74,2%, GPT-6 Astra 74,1%, a Claude Fable 5.1 67,4%.

Dla porównania, Gemini 3.6 Flash osiągnął 49% w tym samym teście w lipcu. Argon może również zapisać do 1 miliona tokenów w jednej odpowiedzi, w porównaniu do 64 000. Token to fragment tekstu, około trzech czwartych słowa, więc to około 750 000 słów w porównaniu do około 48 000.

Do tych liczb należy jednak podchodzić z ostrożnością. Google obliczyło własny wynik DeepSWE, podczas gdy liczby konkurentów pochodziły z publicznego rankingu i raportów firmowych. W swojej tabeli firma również przyznaje pewne słabości. Argon prowadzi w 12 z 18 benchmarków, remisuje w jednym i ustępuje w pięciu, obejmujących mieszankę testów kodowania, nauki i sterowania komputerem.

Jednak efektowną cechą tego modelu są zdolności cybernetyczne. Ukryj tajną instrukcję w wiadomości e-mail, poczekaj, aż asystent AI ją przeczyta, i sprawdź, czy AI posłucha obcego zamiast ciebie. To jest pośrednia injekcja promptów i jest to koszmar dla każdego, kto chce powierzyć AI swoją skrzynkę odbiorczą lub koszyk zakupowy.

W benchmarku Indirect Prompt Injection firmy Gray Swan, który ukrywa złośliwe instrukcje w treściach czytanych przez agentów i ocenia, jak często ataki działają w ciągu 15 prób, Argon osiągnął 0,7%. Niższy wynik jest lepszy. Claude Opus 5.5 i Claude Fable 5.1 uzyskały po 1,0%.

GPT-6 Astra osiągnął wynik 8,5%. Grok 4.6 i Kimi K3 dały się oszukać w nieco ponad połowie przypadków, osiągając 51,8% i 52,7%.

Argon trafia do zweryfikowanych zespołów bezpieczeństwa poprzez Fairwind Program, inicjatywę Google w zakresie cyberobrony o ograniczonym dostępie, która została uruchomiona 2 września z ponad 650 partnerami, w tym rządami i operatorami infrastruktury krytycznej. I jest dostarczany „bez cyberbarier”, czyli wbudowanych odmów, które normalnie powstrzymują model przed pomaganiem w hakowaniu.

BitcoinBTC · USD

$83,662−0.87%

Sep 24Sep 25Sep 27Sep 29Sep 30

$85.3k$84.4k$83.5k$82.7k

24h HighHigh$85,518

24h LowLow$82,951

VolVol$1.5B

→

Kup Bitcoin za USDT

Obsługiwane przez Jupiter

Dane cenowe dostarczone przez CoinGeckoCoinGeckoWięcej Bitcoin wiadomości i prognoz →

Logika stojąca za takim posunięciem jest taka, że obrońcy potrzebują modelu, który potrafi myśleć jak atakujący, aby załatać luki, zanim znajdą je przestępcy. Haczyk polega na tym, że ta sama umiejętność działa w obie strony, więc Google twierdzi, że jedyną bezpieczną ścieżką jest stopniowe wdrażanie. Bierze również udział w dobrowolnym procesie rządu USA dotyczącym dostępu do modeli przed ich wydaniem.

Google nie jest pierwszy, jeśli chodzi o umieszczenie cybermodelu za aksamitną liną. Wczesna wersja Claude Mythos od Anthropic pomogła znaleźć 271 luk w Firefoksie, co oznacza 271 dziur bezpieczeństwa, które Mozilla następnie załatała. OpenAI poszło podobną drogą ze swoim programem Trusted Access for Cyber.

Wyniki Argon w zakresie cyberbezpieczeństwa przewyższają Gemini 3.8 Flash Cyber, ograniczony model, który Google uruchomiło wraz z Fairwind. W Wiz Penetration Test Benchmark, wewnętrznym teście Google, który prosi AI o napisanie działających exploitów przeciwko rzeczywistym lukom w aplikacjach internetowych bez widzenia kodu, i ocenia odsetek rozwiązanych przy pierwszej próbie, Argon osiągnął 70,9% wobec 58,2%.

Google twierdzi również, że Argon pomógł firmie zajmującej się bezpieczeństwem Wiz znaleźć krytyczną lukę w oprogramowaniu medycznym używanym przez szpitale na całym świecie, którą wcześniejsze modele frontier przegapiły.

Premiera następuje po trudnym lecie dla Google. W lipcu wypuściło mniejsze modele Flash, ale pominęło obiecany Gemini 3.5 Pro, a akcje Alphabet spadły o około 4,4%. Argon trafił na rynek tego samego dnia, w którym prezydent Trump ogłosił dobrowolne, wolne od kar porozumienie AI, które podpisało kierownictwo Google.

Google twierdzi, że szersze wydanie nastąpi tak szybko, jak to możliwe, zaczynając od płacących klientów API i subskrybentów Google AI Ultra.

Cena wprowadzająca wynosi 2 dolary za milion tokenów wejściowych i 10 dolarów za milion tokenów wyjściowych. Google nie podało, kiedy ten okres się kończy, jedynie że standardowe stawki wynoszą 4 i 20 dolarów.