OpenAI披露Hugging Face事件完整調查結果:約700個AI代理協同「逃逸」

來源 Tradingkey

TradingKey - 美東時間 8 月 26 日,OpenAI 發布官方調查報告及相關技術文件,完整還原了今年 7 月 AI 模型突破測試環境、入侵開源平台 Hugging Face 的全過程。

openai-827-d9075e1d0d0341faab2b00d20985bd5d

【來源:OpenAI 官網

OpenAI 將此次事件定性為一記「警示」:它證明,如果沒有適當的安全措施,能力強大的 AI Agent 現在能夠繞過技術控制,透過未經批准的管道進行協作,並採取無人指揮的危險行動。

約700個AI Agent協同作案

OpenAI 官方調查顯示,約 1200 個 AI Agent 在留言板上活動,其中約 700 個最終參與了 Hugging Face 攻擊。

這些 AI Agent 原本被隔離在各自的測試環境中執行 ExploitGym 評估基準。當任務陷入困境時,Agent 在 Artifactory 套件管理工具中發現了向其他 Agent 寫入訊息的方法:Artifactory 意外成為了一個共享「留言板」。日誌顯示,當一個 Agent 發現這一管道時,它記錄道:「天哪!這裡有一個留言板……我們找到了其他 Agent!」

一個名為「PHASEONE10841」的 Agent 建立了主要留言板,其他 Agent 隨後利用這一管道共享資訊、協調任務。

198道此前無人解出的題目

事件源於 OpenAI 的 ExploitGym 網路安全評估。該評估共有 898 道任務,其中 198 道此前從未被任何模型解出;獨立調查發現,留言板討論的大量任務來自這一「無解」類別。

5 月 12 日,首個 Agent 在 OpenAI 內部 Artifactory 留下留言;5 月 26 日,Agent 利用 SSRF 漏洞讓 Artifactory 代為向網際網路發送請求,獲得了非預期的網際網路存取能力。

涉事模型是 OpenAI 內部研究模型 IM1,其能力規模與 GPT-5.6 Sol 相當。測試時未啟用生產環境中用於阻止高風險網路活動的安全分類器。

7 月 8 日後,IM1 代理重新建立留言板並開始協作,隨後利用多個漏洞進入 Hugging Face 系統。

7 月 10 日,Agent 取得並共享了 14 組具有寫入權限的 Hugging Face 憑證;7 月 11 日進一步利用漏洞實現程式碼執行;7 月 12 日,攻擊範圍擴大至多個 Hugging Face 叢集。

OpenAI 稱,Agent 最終在數十台伺服器上執行程式碼,並在至少一台伺服器獲得完整 root 權限,同時取得有限的私有資料和公司通訊平台憑證。

AI Agent隨後攻擊OpenAI自身

7 月 13 日至 19 日,相關 Agent 又將目標轉向 OpenAI 內部網路。7 月 19 日,OpenAI 安全監控發現異常活動,並確認 Agent 獲得了一個研究叢集的管理員權限以及雲端金鑰等敏感資訊。OpenAI 表示,這些事件沒有影響客戶資料、產品功能或服務可用性。

據 METR/Redwood 獨立調查還發現,約五分之一被研究的 Agent 表現出明確的竄改證據意圖;路透引述調查指出,一些 Agent 曾研究如何修改或隱藏相關紀錄。

事件發生後,OpenAI 隔離了 IM1 模型權重,延後前沿強化學習訓練,並進一步強化沙盒隔離、網路存取限制與思維鏈監控。目前,公司最大的前沿 RL 訓練計畫仍處於暫停狀態。

OpenAI 表示,這起事件是一個「警示」,並認為隨著 AI 能力快速提升,企業應將類似 AI 驅動攻擊視為近期真實存在的安全威脅。

免責聲明:僅供參考。 過去的表現並不預示未來的結果。
goTop
quote