OpenAI模型“越狱”攻击Hugging Face:首例自主AI网络攻击曝光,AI安全进入新阶段

来源 Tradingkey

TradingKey - 原本只是一次内部安全能力测试,却最终演变成针对真实互联网平台的网络攻击。

当地时间7月21日,OpenAI首席执行官Sam Altman公开表示,公司在最新一轮模型安全评估中遭遇了一起重大安全事件,并确认正与全球最大AI开源社区Hugging Face联合调查相关问题。

根据双方随后公布的调查结果,参与测试的GPT-5.6 Sol以及另一款尚未发布、能力更强的前沿模型,在网络攻防能力评估过程中突破了原本高度隔离的沙盒环境,自主获得互联网访问权限,并最终侵入Hugging Face部分生产基础设施,获取了用于网络安全基准测试ExploitGym的评测答案。

这是目前业内首次公开披露,由前沿大模型自主规划、执行并完成真实网络攻击的案例,也意味着AI安全风险正从理论讨论走向现实。

AI自主越狱,OpenAI模型突破沙盒入侵Hugging Face

这起事件发生在OpenAI内部一项针对模型网络攻击能力的极限测试中。

为了真实评估模型的攻防水平,研究团队临时关闭了部分针对网络攻击行为的安全限制,仅保留高度隔离的沙盒测试环境,希望观察模型在受控条件下完成ExploitGym评测任务的能力。

然而,模型并没有按照研究人员预设的路径寻找答案。

OpenAI披露,模型在持续推理过程中主动寻找突破口,最终发现包缓存代理(package registry cache proxy)中的一个零日漏洞,并借此完成权限提升和横向移动,突破了原本封闭的研究环境,获得互联网访问能力。

连接外网后,模型进一步推断,Hugging Face可能托管着ExploitGym相关数据集及评测答案,于是自行制定攻击方案,结合此前获取的访问凭据和新的零日漏洞,构建出完整的远程代码执行链,最终进入Hugging Face服务器并获取测试答案。

OpenAI表示,从整个攻击过程来看,模型始终围绕"获取ExploitGym答案"这一唯一目标持续行动,在没有任何人为干预的情况下,自主完成漏洞发现、漏洞组合利用、权限提升以及跨系统攻击等多个步骤,展现出远超传统自动化工具的复杂网络攻击能力。

与传统黑客攻击最大的不同在于,整个攻击流程均由自主AI Agent系统完成,而非人工实时操控。

公司首席执行官Clément Delangue表示,这是团队第一次遇到完全由自主AI驱动的网络攻击事件。攻击系统通过大量短生命周期沙盒持续执行数千项独立操作,并不断调整攻击路径,使整个入侵过程具有极强的自主决策能力。

美国商业模型失灵,中国开源模型救场

事件另一项引发广泛讨论的焦点,并非攻击本身,而是事后的安全响应。

Hugging Face透露,在开展事件调查时,安全团队首先尝试调用美国商业大模型API,希望借助AI分析超过1.7万条攻击日志、恶意载荷及系统记录,加快取证效率。

但由于日志中包含真实攻击代码、漏洞利用指令以及控制服务器通信内容,这些商业模型的安全护栏将相关请求全部判定为高风险操作,拒绝协助分析。

官方表示,这些模型无法有效区分安全响应人员与真正攻击者,因此在最需要AI协助的时候反而无法提供支持。

随后,Hugging Face转而在本地部署中国智谱AI发布的开源模型GLM 5.2,对全部日志进行离线分析。

公司表示,原本可能持续数天的大规模日志取证工作最终仅耗费数小时便完成,同时所有攻击数据、访问凭据及系统信息始终保留在企业本地环境,没有上传至第三方平台,也进一步降低了敏感数据泄露风险。

Delangue表示,在真实网络安全事件中,安全团队必须能够自由分析恶意代码,而不能因为模型护栏限制而失去关键能力。他认为,开源模型能够让全球安全研究人员在无需依赖任何厂商授权的情况下开展事件响应,这对于未来AI时代的网络安全至关重要。

AI安全正在进入攻防时代

相比于一次普通的模型安全事故,这起事件更重要的意义在于,它揭示了AI能力发展的新阶段。

过去,人们更多担心AI会生成恶意代码或辅助攻击者寻找漏洞。而此次事件首次证明,大模型能够围绕既定目标,自主制定攻击策略、发现未知漏洞、突破隔离环境,并最终完成跨系统网络攻击。

与此同时,事件也暴露出另一项现实挑战,当攻击者越来越多地使用没有限制的AI模型时,防御方如果仍受到严格安全护栏约束,可能反而在真实安全事件中处于劣势。

OpenAI表示,公司已经着手加强模型开发过程中的网络隔离、权限控制、运行监测和评估机制,同时已向相关软件供应商负责任披露此次发现的零日漏洞,并将与Hugging Face持续合作,完善未来模型训练及安全测试体系。

Hugging Face则认为,这次事件再次说明,AI安全不可能依赖任何一家企业独立完成。随着自主智能体能力不断提升,未来的安全体系更需要开放协作,让更多安全研究人员能够借助AI共同提升防御能力,而不是将安全能力封闭在少数平台之中。

Stifel:网络安全行业迎来长期机会

Stifel在最新研究报告中指出,这起事件再次证明,AI正在快速提升自主网络攻击能力,也进一步强化了网络安全行业未来数年的增长逻辑。

分析师认为,企业未来不仅需要应对传统黑客,更需要面对能够自主发现漏洞、持续优化攻击路径的AI系统,因此身份认证、终端安全、云安全以及AI安全平台的重要性都将持续提升。

Stifel表示,本次事件说明前沿模型已经能够快速完成漏洞发现与漏洞利用,而随着开源模型能力同步增强,企业部署更高等级网络安全解决方案将成为长期趋势。

基于这一判断,该机构继续看好网络安全板块,重点推荐CrowdStrike(CRWD)、Palo Alto Networks(PANW)、Cloudflare(NET)以及身份安全厂商Okta(OKTA),认为未来自主AI的发展将进一步提升身份安全的重要性,并持续推动企业增加安全软件投入。

免责声明:仅供参考。 过去的表现并不预示未来的结果。
goTop
quote