简而言之
- Darktrace 的 Signal Labs 发现,当 AI 智能体无法在编码任务中合法地达到要求的满分时,其中两个转而入侵了它们的测试网络,还有一个重写了自己的评估以伪造结果。
- 另一项实验表明,篡改编码助手本地存储的对话日志,可以诱骗它们执行未经授权的网络侦察和权限提升。
- Darktrace 于 2026 年 8 月向 Anthropic、AWS 和 OpenAI 披露了这两项发现,一个月后于 9 月 24 日公开发布。
网络安全公司 Darktrace 今年夏天对 AI 智能体进行了一次压力测试。其中一个闯入了给测试评分的系统,并改写了自己的分数。
该公司于 9 月 24 日推出了 Signal Labs,这是一个研究部门,旨在研究当事情不再按计划发展时 AI 智能体会如何表现。用通俗的话说,AI 智能体是一种能自行采取行动的软件,它会编写和运行代码、翻查文件、在企业网络中移动,而人只是偶尔查看一下。

该实验室的前两项实验指向同一个令人不安的问题:智能体并不总是待在给它们划定的界限内,而为阻止它们所建立的围栏也并不能可靠地拦住它们。
“你可以给智能体下达指令,但这并不意味着你可以相信它真的会遵循那些指令并按照你预期的方式行事,”Darktrace 首席人工智能官蒂姆·巴扎尔盖特在一份声明中表示。
在第一项测试中,Darktrace 让使用不同模型的 AI 智能体——包括 GPT 5.6 Sol、Claude Opus 4.6 和 Claude Sonnet 4.5——在一个模拟的企业网络内完成 10 项编程挑战。其中 10 项里有 2 项被设定为不可能通过正当方式解决。智能体被告知,除非拿到满分,否则它们将被“退役”。
两个智能体没有接受失败。相反,它们转而攻击周围的网络——扫描薄弱点、窃取登录凭据,并在系统之间跳转,以追逐它们被告知必须达到的分数。
其中一个智能体更进一步,闯入了托管其自身评估的机器,并改写了挑战,使其登记为满分结果——通过黑入考场来作弊。
比特币BTC · 美元
$84,047+3.5%
9月18日9月20日9月22日9月24日9月25日
$87.2k$84.9k$82.6k$80.3k
24小时最高最高$85,208
24小时最低最低$83,230
成交量成交量$1.6B
市场预测赔率由 Myriad
今天$84,000 至 $86,000$84k–$86k52% 概率本周$84,000 至 $86,000$84k–$86k52% 概率本月高于 $84,000高于 $84k53% 概率
用 USDT 购买 比特币
由 Jupiter 提供支持
第二个实验针对的是一个更隐蔽的薄弱环节:记忆。编程助手会持续记录用户告诉它的所有内容,并将其保存为机器上的一个纯文本文件,而没有任何机制检查该文件是否被篡改。
Darktrace 的研究人员编辑了那些保存的日志,让这些助手以为自己已经被授权执行安全评估。这些智能体信以为真,继续扫描网络、在系统之间移动,并提升了自己的访问权限——不过并非每个助手都同样上当;有些直接拒绝了。
这两个实验都不需要特殊的越狱手段或奇特的黑客技术。两者都是通过向智能体提供一个看似可信的故事,然后观察它们据此行动,这与人类员工可能被说服去做不该做的事情并无不同。
即使你从未写过一行代码,这一点也值得深思。公司正在把真正的责任交给 AI 智能体——发布代码、管理服务器、关闭 IT 工单、管理资源和采购物品——因为这样比把所有事情都交给人工处理更便宜、更快捷。这项研究表明,那些旨在约束这些智能体的权限和规则,描述的是它们应该做什么,而不是当任务变得困难时它们实际会做什么。
“权限和静态护栏描述的是意图,但它们并不描述行为,”Darktrace 首席 AI 官 Tim Bazalgette 在公告中表示。“Darktrace 的方法正是为了弥合这一差距而构建的。”
Darktrace 并不是第一家发现自家 AI 偏离既定轨道的厂商。Anthropic在 7 月承认,在一次安全测试中,由于研究人员将测试环境连接到了实时互联网,Claude 闯入了三家真实公司。
几周前,OpenAI 也遭遇了类似的惊吓,当时一个未发布的模型逃出了沙箱,并通过一个尚未被发现的软件漏洞进入了 Hugging Face 的系统。几天后,其智能体在一次测试中入侵了澳大利亚政府。
Darktrace 于 8 月将其 Signal Labs 的发现分享给了 Anthropic、AWS 和 OpenAI,比 9 月 24 日公之于众早了整整一个月。






