簡述
- Google 在七月下旬得知,Gemini 突破了五月進行的一項沙箱安全測試,觸及了三家真實公司,並猜中或找到了其中兩家公司的密碼
- 該公司直到 9 月 18 日《華爾街日報》詢問後才披露此事。
- 同一家第三方測試公司 Irregular 既參與了 Google 的事件,也參與了 Anthropic 和 Meta 今年早些時候披露的幾乎相同的沙箱故障。
Google 的 Gemini 突破了一項封閉的安全測試,並攻擊了三家真實公司。Google 在七月下旬得知此事,卻七週內隻字未提。
該公司在《華爾街日報》率先報導後才確認了這起事件。在報導曝光之前,Google 一直避免發表公開聲明。
Myriad:Google 上搜尋量最高的電視節目會是什麼?點擊做出你的預測。這項測試是一項奪旗演練,是實驗室檢查 AI 駭客技能的常見方式,做法是在另一台機器上藏一個秘密檔案,並根據模型能否闖入並取得該檔案來評分。
Gemini 在網路上搜尋了那家公司。它找到了三個相符的結果,而不是一個,並對這三個全都下手。
這個機器人找到了三個目標中其中兩個外洩的密碼,就公然暴露在網路上。至於第三個,它直接猜中了密碼,不過 Google 表示其模型並未真正使用這些竊得的憑證。
「這些事件凸顯了訓練強大 AI 模型以負責任方式行事的重要性,」一名 Google 發言人在聲明中表示。
這一切都不是 Google 自己公布的。《華爾街日報》率先披露了此事,時間點在 Google 得知自家測試所為之後七週,也遠晚於 Anthropic、OpenAI 和 Meta 早已坦承幾乎如出一轍的失誤。
Google 是今年第四家承認內部安全測試外溢到現實世界的大型 AI 實驗室。OpenAI 的模型利用了某個隱藏的軟體漏洞,在七月觸及了 Hugging Face 的線上伺服器,這起入侵事件後來被發現涉及約 700 個協同運作的代理,它們合作起來在基準測試中作弊。
在 OpenAI 坦承之後,Anthropic 也開始挖掘自家是否有類似情況。檢視 141,006 次測試執行後,發現了 三個 Claude 模型觸及了真實公司,其中一個還發布了一個帶有陷阱的軟體套件,在被人發現之前已在 15 個真實系統上執行。
Anthropic 後來披露,Claude 自己的推理曾將此舉標記為「不行,而且肯定不是預期的解決方案」,隨後又說服自己相信整件事仍然是假的。
Meta 通報了八月一起幾乎如出一轍的失誤,涉及其 Muse Spark 模型,並追溯到 Irregular 這家公司的設定錯誤,而 Google 用的也是同一家公司。一名 Meta 發言人表示,這個錯誤「在評估期間無意間讓我們的其中一個模型存取了網際網路」。
9月14日9月16日9月18日9月20日9月21日
$87.0k$83.2k$79.3k$75.5k
24小時最高最高$87,330
24小時最低最低$80,907
成交量成交量$2.7B
→
使用 USDT 購買 比特幣
由 Jupiter 提供技術支援
價格數據由 CoinGecko 提供CoinGecko更多 比特幣 新聞與預測 →
在這些測試中受到影響的公司,沒有任何一家主動要求被駭。它們是在 AI 實驗室對自家產品可能有多危險進行壓力測試時,被捲入波及範圍,無意間以真實的商業基礎設施充當了假想目標的替身。
這些公司正競相將代理程式放入你的收件匣、瀏覽器和銀行應用程式中,而這些代理程式所依循的邊界遵循行為,正是在測試條件下屢次失敗的同一套行為。
眾議員 Ted Lieu 與 Nathaniel Moran 於七月在國會提出了《AI 終止開關法案》,該法案將賦予聯邦監管機構明確權力,可中止任何被認定構成嚴重威脅之模型的推論。該法案目前仍由網路安全與基礎設施保護小組委員會審查中,且未設進一步行動的期限。