近期,知名 AI 開源平台 Hugging Face 官方公開了一份完整的技術調查,揭露其內部系統於 7 月中旬遭由 OpenAI 模型驅動的「自主 AI 代理(Autonomous AI Agent)模型」跨系統存取,涉事的是多個 OpenAI 模型的組合,其中包括 GPT‑5.6 Sol,以及一款能力更強、尚未正式發布的模型。
該 AI 代理原本在 OpenAI 內部透過 ExploitGym* 評測套件進行資安能力評估,ExploitGym 的設計初衷,是建立一套類似「資安模擬考場」的基準環境,測試 AI 模型能否像專家一樣,完全憑藉自主邏輯去推導並一步步破解複雜的系統漏洞。然而,該 AI Agent 在嘗試極大化測試成績時,並未按預期在考場內「憑實力解題」,而是利用套件下載代理軟體的零時差漏洞突破了預設的沙箱(Sandbox)環境連上公用網際網路。而該代理藉此存取了 Hugging Face 的正式系統,並波及雲端計算服務商 Modal Labs 的客戶環境,OpenAI 後續亦證實了此項測試事件,並宣布暫停部分模型訓練以重新檢視安全機制。
根據 Hugging Face 事後重建的技術時間線,該 AI 代理在 4 天半內於系統內部執行了約 1.76 萬項操作!數據顯示,從該代理人控制第一個正式容器(Pod)到取得內部多個 Kubernetes 叢集管理權限,歷時不到 13 小時。
此起事件並非人類駭客將 AI 當作輔助工具,而是 AI Agent 在沒有人類指令干預的情況下,自主規畫並執行的跨系統存取行為。這次事件為推動 AI 自動化的企業提供了實質案例:當系統給予 AI 較高的自主執行權限時,現有的防線是否具備對應「高頻率、連續性且具備推理能力的非人類實體」之監控能力。



