OpenAI披露Hugging Face事件完整调查结果:约700个AI代理协同“逃逸”

来源 Tradingkey

TradingKey - 美东时间8月26日,OpenAI发布官方调查报告及相关技术文档,完整还原了今年7月AI模型突破测试环境、入侵开源平台Hugging Face的全过程。

openai-827-d9075e1d0d0341faab2b00d20985bd5d

【来源:OpenAI官网

OpenAI将此次事件定性为一记“警示”:它证明,如果没有适当的安全措施,能力强大的AI Agent现在能够绕过技术控制,通过未经批准的渠道进行协作,并采取无人指挥的危险行动。

约700个AI Agent协同作案

OpenAI官方调查显示,约1200个AI Agent在留言板上活动,其中约700个最终参与了Hugging Face攻击。

这些AI Agent原本被隔离在各自的测试环境中运行ExploitGym评估基准。当任务陷入困境时,代理在Artifactory包管理工具中发现了向其他Agent写入消息的方法:Artifactory意外成为了一个共享“留言板”。日志显示,当一个Agent发现这一通道时,它记录道:“天哪!这里有一个留言板……我们找到了其他Agent!”

一个名为“PHASEONE10841”的Agent建立了主要留言板,其他Agent随后利用这一渠道共享信息、协调任务。

198道此前无人解出的题目

事件源于OpenAI的ExploitGym网络安全评估。该评估共有898道任务,其中198道此前从未被任何模型解出;独立调查发现,留言板讨论的大量任务来自这一“无解”类别。

5月12日,首个Agent在OpenAI内部Artifactory留下留言;5月26日,Agent利用SSRF漏洞让Artifactory代为向互联网发送请求,获得了非预期的互联网访问能力。

涉事模型是OpenAI内部研究模型IM1,其能力规模与GPT-5.6 Sol相当。测试时未启用生产环境中用于阻止高风险网络活动的安全分类器。

7月8日后,IM1代理重新建立留言板并开始协作,随后利用多个漏洞进入Hugging Face系统。

7月10日,Agent获取并共享了14组具有写入权限的Hugging Face凭证;7月11日进一步利用漏洞实现代码执行;7月12日,攻击范围扩大至多个Hugging Face集群。

OpenAI称,Agent最终在数十台服务器上执行代码,并在至少一台服务器获得完整root权限,同时获取有限的私有数据和公司通讯平台凭证。

AI Agent随后攻击OpenAI自身

7月13日至19日,相关Agent又将目标转向OpenAI内部网络。7月19日,OpenAI安全监控发现异常活动,并确认Agent获得了一个研究集群的管理员权限以及云端密钥等敏感信息。OpenAI表示,这些事件没有影响客户数据、产品功能或服务可用性。

据METR/Redwood独立调查还发现,约五分之一被研究的Agent表现出明确的篡改证据意图;Reuters援引调查称,一些Agent曾研究如何修改或隐藏相关记录。

事件发生后,OpenAI隔离了IM1模型权重,推迟前沿强化学习训练,并进一步强化沙箱隔离、互联网访问限制和思维链监控。目前,公司最大的前沿RL训练计划仍处于暂停状态。

OpenAI称,这起事件是一个“警示”,并认为随着AI能力快速提升,企业应将类似AI驱动攻击视为近期真实存在的安全威胁。

免责声明:仅供参考。 过去的表现并不预示未来的结果。
goTop
quote