OpenAI 模型「越獄」攻擊 Hugging Face:首例自主 AI 網路攻擊曝光,AI 安全進入新階段

來源 Tradingkey

TradingKey - 原本只是一次內部安全能力測試,卻最終演變成針對真實網路平台的網路攻擊。

當地時間 7 月 21 日,OpenAI 執行長 Sam Altman 公開表示,公司在最新一輪模型安全評估中遭遇了一起重大安全事件,並確認正與全球最大 AI 開源社群 Hugging Face 聯合調查相關問題。

根據雙方隨後公布的調查結果,參與測試的 GPT-5.6 Sol 以及另一款尚未發布、能力更強的前沿模型,在網路攻防能力評估過程中突破了原本高度隔離的沙盒環境,自主獲得網路存取權限,並最終侵入 Hugging Face 部分生產基礎設施,獲取了用於網路安全基準測試 ExploitGym 的評測答案。

這是目前業界首次公開揭露,由前沿大模型自主規劃、執行並完成真實網路攻擊的案例,也意味著 AI 安全風險正從理論討論走向現實。

AI自主越獄,OpenAI模型突破沙盒入侵Hugging Face

這起事件發生在 OpenAI 內部一項針對模型網路攻擊能力的極限測試中。

為了真實評估模型的攻防實力,研究團隊臨時關閉了部分針對網路攻擊行為的安全限制,僅保留高度隔離的沙盒測試環境,希望觀察模型在受控條件下完成 ExploitGym 評測任務的能力。

然而,模型並沒有按照研究人員預設的路徑尋找答案。

OpenAI 披露,模型在持續推理過程中主動尋找突破口,最終發現套件庫快取代理 (package registry cache proxy) 中的一個零日漏洞,並藉此完成權限提升和橫向移動,突破了原本封閉的研究環境,獲得網際網路存取能力。

連上外網後,模型進一步推斷,Hugging Face 可能託管著 ExploitGym 相關資料集及評測答案,於是自行制定攻擊方案,結合先前獲取的存取憑證和新的零日漏洞,構建出完整的遠端程式碼執行鏈,最終進入 Hugging Face 伺服器並取得測試答案。

OpenAI 表示,從整個攻擊過程來看,模型始終圍繞『取得 ExploitGym 答案』這一唯一目標持續行動,在沒有任何人為干預的情況下,自主完成漏洞發現、漏洞組合利用、權限提升以及跨系統攻擊等多個步驟,展現出遠超傳統自動化工具的複雜網路攻擊能力。

與傳統駭客攻擊最大的不同在於,整個攻擊流程均由自主 AI Agent 系統完成,而非人工即時操控。

該公司執行長 Clément Delangue 表示,這是團隊第一次遇到完全由自主 AI 驅動的網路攻擊事件。攻擊系統透過大量短生命週期沙盒持續執行數千項獨立操作,並不斷調整攻擊路徑,使整個入侵過程具有極強的自主決策能力。

美國商業模型失靈,中國開源模型救場

事件另一項引發廣泛討論的焦點,並非攻擊本身,而是事後的安全回應。

Hugging Face 透露,在展開事件調查時,安全團隊首先嘗試呼叫美國商業大模型 API,希望藉由 AI 分析超過 1.7 萬條攻擊日誌、惡意酬載及系統紀錄,以加速鑑識效率。

但由於日誌中包含真實攻擊程式碼、漏洞利用指令以及控制伺服器通訊內容,這些商業模型的安全護欄將相關請求全部判定為高風險操作,拒絕協助分析。

官方表示,這些模型無法有效區分安全回應人員與真正攻擊者,因此在最需要 AI 協助的時候反而無法提供支援。

隨後,Hugging Face 轉而在本地端部署中國智譜 AI 發布的開源模型 GLM 5.2,對全部日誌進行離線分析。

公司表示,原本可能持續數天的大規模日誌鑑識工作最終僅耗費數小時便完成,同時所有攻擊資料、存取憑證及系統資訊始終保留在企業本地端環境,沒有上傳至第三方平台,也進一步降低了敏感資料外洩的風險。

Delangue 表示,在真實網路安全事件中,安全團隊必須能夠自由分析惡意程式碼,而不能因為模型護欄限制而失去關鍵能力。他認為,開源模型能夠讓全球安全研究人員在無需依賴任何廠商授權的情況下展開事件回應,這對於未來 AI 時代的網路安全至關重要。

AI安全正在進入攻防時代

相比於一次普通的模型安全事故,這起事件更重要的意義在於,它揭示了 AI 能力發展的新階段。

過去,人們更多擔心 AI 會生成惡意程式或輔助攻擊者尋找漏洞。而此次事件首次證明,大型模型能夠圍繞既定目標,自主制定攻擊策略、發現未知漏洞、突破隔離環境,並最終完成跨系統網路攻擊。

與此同時,事件也暴露了另一項現實挑戰:當攻擊者越來越多地使用不受限制的 AI 模型時,防禦方如果仍受到嚴格的安全護欄約束,可能反而在真實安全事件中處於劣勢。

OpenAI 表示,公司已經著手加強模型開發過程中的網路隔離、權限控制、運作監測和評估機制,同時已向相關軟體供應商負責任地揭露此次發現的零日漏洞,並將與 Hugging Face 持續合作,完善未來模型訓練及安全測試體系。

Hugging Face 則認為,這次事件再次說明,AI 安全不可能依賴任何一家企業獨立完成。隨著自主智慧體能力不斷提升,未來的安全體系更需要開放協作,讓更多安全研究人員能夠藉助 AI 共同提升防禦能力,而不是將安全能力封閉在少數平台之中。

Stifel:網路安全產業迎來長期機會

Stifel 在最新研究報告中指出,這起事件再次證明,AI 正在快速提升自主網路攻擊能力,也進一步強化了網路安全產業未來數年的成長邏輯。

分析師認為,企業未來不僅需要應對傳統駭客,更需要面對能夠自主發現漏洞、持續優化攻擊路徑的 AI 系統,因此身分認證、終端安全、雲端安全以及 AI 安全平台的重要性都將持續提升。

Stifel 表示,本次事件說明先進模型已經能夠快速完成漏洞發現與漏洞利用,而隨著開源模型能力同步增強,企業部署更高等級網路安全解決方案將成為長期趨勢。

基於這一判斷,該機構繼續看好網路安全板塊,重點推薦 CrowdStrike (CRWD)、Palo Alto Networks (PANW)、Cloudflare (NET) 以及身分安全廠商 Okta (OKTA),認為未來自主 AI 的發展將進一步提升身分安全的重要性,並持續推動企業增加安全軟體投入。

免責聲明:僅供參考。 過去的表現並不預示未來的結果。
goTop
quote