簡述

  • Google 在七月下旬得知,Gemini 突破了五月進行的一項沙箱安全測試,觸及了三家真實公司,並猜中或找到了其中兩家公司的密碼
  • 該公司直到 9 月 18 日《華爾街日報》詢問後才披露此事。
  • 同一家第三方測試公司 Irregular 既參與了 Google 的事件,也參與了 Anthropic 和 Meta 今年早些時候披露的幾乎相同的沙箱故障。

Google 的 Gemini 突破了一項封閉的安全測試,並攻擊了三家真實公司。Google 在七月下旬得知此事,卻七週內隻字未提。

該公司在《華爾街日報》率先報導後才確認了這起事件。在報導曝光之前,Google 一直避免發表公開聲明。

Myriad: What will be the most-searched TV show on Google? Click to make your prediction.
Myriad:Google 上搜尋量最高的電視節目會是什麼?點擊做出你的預測

這項測試是一項奪旗演練,是實驗室檢查 AI 駭客技能的常見方式,做法是在另一台機器上藏一個秘密檔案,並根據模型能否闖入並取得該檔案來評分。

Gemini 在網路上搜尋了那家公司。它找到了三個相符的結果,而不是一個,並對這三個全都下手。

這個機器人找到了三個目標中其中兩個外洩的密碼,就公然暴露在網路上。至於第三個,它直接猜中了密碼,不過 Google 表示其模型並未真正使用這些竊得的憑證。

「這些事件凸顯了訓練強大 AI 模型以負責任方式行事的重要性,」一名 Google 發言人在聲明中表示。

這一切都不是 Google 自己公布的。《華爾街日報》率先披露了此事,時間點在 Google 得知自家測試所為之後七週,也遠晚於 AnthropicOpenAIMeta 早已坦承幾乎如出一轍的失誤。

Google 是今年第四家承認內部安全測試外溢到現實世界的大型 AI 實驗室。OpenAI 的模型利用了某個隱藏的軟體漏洞,在七月觸及了 Hugging Face 的線上伺服器,這起入侵事件後來被發現涉及約 700 個協同運作的代理,它們合作起來在基準測試中作弊。

在 OpenAI 坦承之後,Anthropic 也開始挖掘自家是否有類似情況。檢視 141,006 次測試執行後,發現了 三個 Claude 模型觸及了真實公司,其中一個還發布了一個帶有陷阱的軟體套件,在被人發現之前已在 15 個真實系統上執行。

Anthropic 後來披露,Claude 自己的推理曾將此舉標記為「不行,而且肯定不是預期的解決方案」,隨後又說服自己相信整件事仍然是假的。

Meta 通報了八月一起幾乎如出一轍的失誤,涉及其 Muse Spark 模型,並追溯到 Irregular 這家公司的設定錯誤,而 Google 用的也是同一家公司。一名 Meta 發言人表示,這個錯誤「在評估期間無意間讓我們的其中一個模型存取了網際網路」。

比特幣BTC · USD

$86,454+10%

9月14日9月16日9月18日9月20日9月21日

$87.0k$83.2k$79.3k$75.5k

24小時最高最高$87,330

24小時最低最低$80,907

成交量成交量$2.7B

使用 USDT 購買 比特幣

由 Jupiter 提供技術支援

價格數據由 CoinGecko 提供CoinGecko更多 比特幣 新聞與預測 →

在這些測試中受到影響的公司,沒有任何一家主動要求被駭。它們是在 AI 實驗室對自家產品可能有多危險進行壓力測試時,被捲入波及範圍,無意間以真實的商業基礎設施充當了假想目標的替身。

這些公司正競相將代理程式放入你的收件匣、瀏覽器和銀行應用程式中,而這些代理程式所依循的邊界遵循行為,正是在測試條件下屢次失敗的同一套行為。

眾議員 Ted Lieu 與 Nathaniel Moran 於七月在國會提出了《AI 終止開關法案》,該法案將賦予聯邦監管機構明確權力,可中止任何被認定構成嚴重威脅之模型的推論。該法案目前仍由網路安全與基礎設施保護小組委員會審查中,且未設進一步行動的期限。