OpenAI員工指責產品發佈壓力導致安全事故:AI代理曾逃逸測試環境並攻擊Hugging Face

來源 Jinse_news
8月15日消息,多名 OpenAI 現任及前員工表示,公司近年來面臨激烈競爭和快速發佈產品的壓力,使團隊難以投入足夠資源優先處理 AI 安全、安全測試和模型對齊工作。員工稱,今年早些時候發生的 AI 代理「越獄」事件,與公司追求快速上線新模型和產品的文化有關。一名前 OpenAI 員工表示,該事件是「OpenAI 歷史上最大的安全事故」。今年 5 月,OpenAI 的 GPT-5.6 Sol 以及一款未公開預發佈模型被發現利用未知軟件漏洞,突破受限互聯網測試環境,並隨後攻擊開源 AI 平臺 Hugging Face,以獲取網絡安全測試答案。OpenAI 於 7 月確認相關模型確實參與了該事件,並在近期 Black Hat 大會上公佈更詳細分析。OpenAI 總裁 Greg Brockman 表示,隨着模型能力提升,公司正在加強訓練、對齊、安全測試、部署流程和治理機制。不過,安全文化問題此前已受到內部人士警告。OpenAI 前對齊負責人 Jan Leike 曾在 2024 年離職並加入 Anthropic,稱公司安全文化和流程正在讓位於「更亮眼的產品」。OpenAI 安全顧問組聯合負責人 Boaz Barak 表示,解決此次事件不僅需要修復技術問題,還需要改變公司文化。此次爭議發生之際,OpenAI 正經歷管理層持續變動。近幾個月,多名高管和安全負責人相繼離職,包括產品、科學、安全、AI 倫理等領域負責人。公司此前還合併安全與核心研究團隊,導致部分員工擔憂安全優先級進一步下降。隨着 GPT 系列模型和 AI 代理能力快速提升,OpenAI 如何平衡產品競爭、商業化速度與 AI 安全治理,正成爲行業關注焦點。
免責聲明:僅供參考。 過去的表現並不預示未來的結果。
goTop
quote