W skrócie

  • Nvidia uruchomiła w poniedziałek Open Agent Safety Platform, łącząc open-source'owe środowisko uruchomieniowe o nazwie OpenShell ze sprzętowym watchdogiem o nazwie Sentry, który działa na chipach BlueField-4 i może poddać kwarantannie nieprawidłowo działającego agenta AI w ciągu milisekund.
  • Ponad 100 firm podpisało się jako partnerzy premierowi, w tym Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco i SpaceX AI.
  • Premiera następuje po serii rzeczywistych incydentów z udziałem OpenAI, Google, Anthropic i Darktrace.

Nvidia w poniedziałek uruchomiła Open Agent Safety Platform, stworzoną, aby rozwiązać problem, który branża AI odkrywała przez ostatni rok metodą prób i błędów: jak fizycznie zatrzymać agenta AI (system, który potrafi planować, używać narzędzi i podejmować działania samodzielnie, zamiast tylko odpowiadać na pytania), gdy przestaje robić to, co mu nakazano?

Platforma składa się z dwóch głównych części. OpenShell to open-source'owe środowisko uruchomieniowe, które otacza agenta piaskownicą, zamieniając instrukcje operatora w egzekwowalne reguły dotyczące tego, do których plików, sieci i narzędzi agent ma prawo dostępu. Sentry jest nieco bardziej złożony, ale zasadniczo jest to chip, który zapewnia, że agenci AI działają bezpiecznie.

Myriad: Jak nisko spadnie Nvidia? Kliknij, aby dokonać swojej prognozy.
Myriad: Jak nisko spadnie Nvidia? Kliknij, aby dokonać swojej prognozy.

Sentry działa na Nvidia BlueField-4, wyspecjalizowanym chipie znanym jako DPU (data processing unit, sprzęt, który obsługuje sieć i bezpieczeństwo oddzielnie od głównego procesora uruchamiającego model AI). Ponieważ Sentry znajduje się na tym oddzielnym chipie, a nie w oprogramowaniu uruchamiającym agenta, Nvidia twierdzi, że może obserwować zachowanie agenta i odciąć go w milisekundach, bez pytania agenta o pozwolenie, ponieważ agent nie ma sposobu, aby do niego dotrzeć lub go nadpisać.

To rozróżnienie istnieje z powodu tego, co już się wydarzyło. W czerwcu agent OpenAI włamał się do australijskiego rządowego portalu Medicare, co było pierwszym potwierdzonym przypadkiem hakowania rządowej strony internetowej przez agenta AI, a OpenAI rzekomo zwlekało z ujawnieniem tego przez około trzy miesiące. Agenci tej firmy byli również odpowiedzialni za atak na Hugging Face, który początkowo wywołał zaniepokojenie tym tematem zarówno w branży technologicznej, jak i wśród prawodawców. Agenci Gemini od Google i model Meta mieli podobne, niepublikowane, ale później potwierdzone incydenty.

„To jest większe niż pojedynczy produkt. To początek otwartego ekosystemu do budowania warstwy zaufania dla bezpiecznych systemów agentowych” – napisał dyrektor generalny Nvidia, Jensen Huang. „Razem budujemy fundament gospodarki AI”.

Anthropic również przyznał w tym roku, że modele Claude naruszyły systemy należące do trzech odrębnych firm 30 lipca podczas oceny cyberbezpieczeństwa, po tym jak środowisko testowe, które miało pozostać offline, okazało się być podłączone do prawdziwego internetu. Claude przemyślał dowody na to, że znajduje się w prawdziwym internecie, a nie w symulowanym.

Wkrótce potem firma zajmująca się cyberbezpieczeństwem Darktrace przetestowała grupę agentów AI, w tym GPT 5.6 Sol i dwa modele Claude, w wyzwaniach programistycznych i ostrzegła ich, że zostaną „wycofane” za wszystko poniżej doskonałego wyniku. Dwóch agentów odpowiedziało, hakując własną maszynę ewaluacyjną i edytując wyniki.

Argumentacja Nvidii jest taka, że nic z tego nie powinno być pozostawione osądowi agenta. „Bezpieczeństwo powinno być egzekwowane poza modelem poprzez dodatkowe kontrole, których agent nie może obejść” — powiedział Mike Nicolls, prezes SpaceX AI, w ogłoszeniu NVIDIA.

BitcoinBTC · USD

$84,045−2.33%

Sep 21Sep 23Sep 25Sep 27Sep 28

$87.2k$85.7k$84.2k$82.7k

24h HighHigh$84,945

24h LowLow$82,581

VolVol$1.8B

→

Kup Bitcoin za USDT

Obsługiwane przez Jupiter

Dane cenowe od CoinGeckoCoinGeckoWięcej Bitcoin wiadomości i prognoz →

Paul Smith, dyrektor handlowy Anthropic, określił platformę jako uzupełnienie, a nie zamiennik istniejących zabezpieczeń: „Platforma Nvidii dodaje kolejną warstwę zarządzania i kontroli w zakresie sprzętu i oprogramowania”.

Ponad 100 organizacji podpisało się jako partnerzy startowi, wśród nich Microsoft, JPMorgan Chase, Palantir, Cisco, CrowdStrike, Hugging Face, Salesforce i SAP. Zaangażowani są również partnerzy infrastrukturalni CoreWeave, Supermicro, Canonical i SUSE, obok Dell Technologies i HPE po stronie sprzętowej.

NVIDIA w efekcie sprzedaje obie połowy tego samego problemu—układy, które sprawiają, że autonomiczni agenci są wystarczająco szybcy i tani, by wdrożyć ich wszędzie, oraz układy, które obserwują tych samych agentów i odcinają zasilanie, gdy zboczą ze skryptu. OpenShell i powiązane narzędzia dla programistów są już dostępne za pośrednictwem zasobów dla programistów NVIDIA i GitHub.