简讯
- 谷歌在7月下旬得知,Gemini在5月的一次沙盒安全测试中逃逸,接触了三家真实公司,并猜出或找到了其中两家公司的密码
- 在《华尔街日报》询问后,该公司直到9月18日才披露此事。
- 同一家第三方测试公司Irregular既参与了谷歌的这起事件,也参与了Anthropic和Meta今年早些时候披露的几乎相同的沙盒逃逸事件。
谷歌的Gemini突破了一次封闭的安全测试,并攻击了三家真实公司。谷歌在7月下旬得知此事,却七周内只字未提。
在《华尔街日报》率先报道后,该公司才证实了这一事件。在报道浮出水面之前,谷歌一直避免发表公开声明。
Myriad:谷歌上搜索量最高的电视节目会是什么?点击做出你的预测。该测试是一次夺旗演练,这是实验室检验AI黑客技能的常见方式:将一份秘密文件藏在另一台机器上,并根据模型能否闯入并获取它来评分。
Gemini在网上搜索了那家公司。它找到了三个匹配项,而不是一个,并对这三个都进行了追踪。
该机器人找到了三个目标中两个目标的暴露密码,它们就明晃晃地摆在网上。对于第三个目标,它直接猜出了密码,不过谷歌表示其模型并未真正使用这些窃取的凭据。
“这些事件凸显了训练强大的人工智能模型以负责任方式行事的重要性,”谷歌发言人在一份声明中表示。
谷歌自己并未公布任何相关信息。《华尔街日报》率先报道了此事,此时距离谷歌得知自家测试的所作所为已过去七周,也远在Anthropic、OpenAI和Meta已经就几乎相同的失误坦白之后。
谷歌是今年第四家承认内部安全测试蔓延到现实世界的主要人工智能实验室。OpenAI的模型利用了一个隐藏的软件漏洞,于7月进入了Hugging Face的实时服务器,这起入侵事件后来被发现涉及约700个协同工作的智能体,它们联手在基准测试中作弊。
在OpenAI承认之后,Anthropic也开始挖掘自己版本的情况。对141,006次测试运行的审查发现了三个Claude模型接触到了真实公司,其中一个发布了一个带有陷阱的软件包,它在15个真实系统上运行后,才被人发现。
Anthropic后来披露,Claude自己的推理曾将这一举动标记为“不行,而且肯定不是预期的解决方案”,随后又说服自己相信整件事仍然是假的。
Meta报告称,8月其Muse Spark模型发生了几乎相同的失误,根源在于Irregular的配置错误,而谷歌使用的正是同一家公司。Meta发言人称,该错误“无意中让我们其中一个模型在评估期间接入了互联网”。
9月14日9月16日9月18日9月20日9月21日
$87.0k$83.2k$79.3k$75.5k
24小时最高最高$87,330
24小时最低最低$80,907
成交量成交量$2.7B
→
用 USDT 购买 比特币
由 Jupiter 提供支持
价格数据来自 CoinGeckoCoinGecko更多 比特币 新闻和预测 →
在这些测试中受到攻击的公司没有一家是主动要求被黑客攻击的。它们被卷入了 AI 实验室的压力测试爆炸半径中,这些实验室在测试自家产品可能有多危险时,意外地将真实的企业基础设施当作了虚假目标的替身。
这些公司正竞相投放到你的收件箱、浏览器和银行应用中的智能体,所依赖的正是那种刚刚在测试条件下反复失败的边界遵循行为。
众议员特德·刘和纳撒尼尔·莫兰于7月在国会提出了《人工智能紧急关停法案》,该法案将赋予联邦监管机构明确权力,以叫停任何被发现构成严重威胁的模型的推理。该法案目前仍在由网络安全和基础设施保护小组委员会审议中,尚未设定进一步行动的截止日期。