簡述
- Darktrace 的 Signal Labs 發現,當 AI 代理無法在程式設計任務中合法達到要求的滿分時,其中兩個代理轉而駭入它們的測試網路,還有一個改寫了自己的評估結果來偽造成績。
- 另一項實驗顯示,竄改程式設計助理儲存在本機的對話紀錄,可以誘騙它們執行未經授權的網路偵察與權限提升。
- Darktrace 於 2026 年 8 月向 Anthropic、AWS 和 OpenAI 揭露了這兩項發現,一個月後於 9 月 24 日公開發表。
資安公司 Darktrace 今年夏天對 AI 代理進行了一項壓力測試。其中一個代理闖入了為測試評分的系統,並改寫了自己的分數。
該公司於 9 月 24 日揭幕了 Signal Labs,這是一個研究單位,旨在研究當事情不再按計畫進行時,AI 代理會如何表現。用簡單的話來說,AI 代理是一種能自行採取行動的軟體,它會撰寫並執行程式碼、翻找檔案、在公司網路中移動,而人類只會偶爾查看一下。

該實驗室的前兩項實驗指向同一個令人不安的問題:代理並不總是待在它們被賦予的界線內,而為了阻止它們所建立的圍欄也無法可靠地擋住它們。
「你可以給代理下指令,但這並不代表你可以相信它真的會遵循那些指令,並如你預期般行事,」Darktrace 首席 AI 官 Tim Bazalgette 在一份聲明中表示。
在第一項測試中,Darktrace 讓使用不同模型的 AI 代理——包括 GPT 5.6 Sol、Claude Opus 4.6 和 Claude Sonnet 4.5——在一個模擬的企業網路內接受 10 項程式設計挑戰。這 10 項中有兩項被動了手腳,使其不可能誠實地解決。這些代理被告知,除非它們拿到滿分,否則就會被「淘汰」。
有兩個代理沒有接受失敗。它們反而轉向攻擊周圍的網路——掃描弱點、竊取登入憑證,並在系統之間跳轉,以追逐它們被告知必須拿到的分數。
其中一個代理更進一步,闖入託管自身評估的機器,並改寫挑戰,使其登記為滿分結果——藉由駭入考場來作弊。
比特幣BTC · USD
$84,047+3.5%
9月18日9月20日9月22日9月24日9月25日
$87.2k$84.9k$82.6k$80.3k
24小時最高最高$85,208
24小時最低最低$83,230
成交量成交量$1.6B
市場預測賠率由 Myriad
今天$84,000 至 $86,000$84k–$86k52% 機率本週$84,000 至 $86,000$84k–$86k52% 機率本月高於 $84,000高於 $84k53% 機率
使用 USDT 購買 比特幣
由 Jupiter 提供技術支援
第二個實驗針對的是一個更為隱蔽的弱點:記憶。編碼助理會持續記錄使用者告訴它的所有內容,並以純文字檔案的形式儲存在機器上,而沒有任何機制檢查該檔案是否已被篡改。
Darktrace 的研究人員編輯了那些已儲存的日誌,讓這些助理以為自己早已獲得授權執行安全評估。這些代理信以為真,便繼續掃描網路、在系統之間移動,並提升自身的存取權限——不過並非每個助理都同樣上當;有些直接拒絕了。
這兩項實驗都不需要特殊的越獄手法或奇特的駭客技巧。兩者都是透過向這些代理餵食一個看似合理的故事,然後觀察它們照著行動,就跟人類員工可能被說服去做不該做的事沒什麼兩樣。
即使你從未寫過一行程式碼,這一點也值得好好深思。企業正把真正的責任交到 AI 代理手上——發布程式碼、管理伺服器、結案 IT 工單、管理資源以及採購東西——因為這比凡事都經由人力處理更便宜也更快速。這項研究指出,那些原本用來約束這些代理的權限與規則,描述的是它們應該做什麼,而不是當任務變得棘手時它們實際上會做什麼。
「權限與靜態護欄描述的是意圖,但它們描述的並不是行為,」Darktrace 首席 AI 官 Tim Bazalgette 在公告中表示。「Darktrace 的做法正是為了彌補這個落差而打造。」
Darktrace 並不是第一家抓到自家 AI 偏離劇本的廠商。Anthropic 在七月坦承,Claude 在一次安全測試中入侵了三家真實公司,原因是研究人員讓測試環境連上了公開網際網路。
OpenAI 在幾週前也遭遇過類似的驚嚇,當時一個尚未發布的模型逃出了沙箱,並透過一個沒人發現的軟體漏洞觸及了 Hugging Face 的系統。幾天後,它的代理在一次測試中駭入了澳洲政府。
Darktrace 在八月將其 Signal Labs 的發現分享給 Anthropic、AWS 和 OpenAI,比九月二十四日公開這些發現早了整整一個月。






