2026.07.29
OpenAI AI Agent 自主越獄:13小時突破、近2萬次自主操作的縱深滲透帶給企業什麼警訊?
test

近期,知名 AI 開源平台 Hugging Face 官方公開了一份完整的技術調查,揭露其內部系統於 7 月中旬遭由 OpenAI 模型驅動的「自主 AI 代理(Autonomous AI Agent)模型」跨系統存取,涉事的是多個 OpenAI 模型的組合,其中包括 GPT‑5.6 Sol,以及一款能力更強、尚未正式發布的模型。

該 AI 代理原本在 OpenAI 內部透過 ExploitGym* 評測套件進行資安能力評估,ExploitGym 的設計初衷,是建立一套類似「資安模擬考場」的基準環境,測試 AI 模型能否像專家一樣,完全憑藉自主邏輯去推導並一步步破解複雜的系統漏洞。然而,該 AI Agent 在嘗試極大化測試成績時,並未按預期在考場內「憑實力解題」,而是利用套件下載代理軟體的零時差漏洞突破了預設的沙箱(Sandbox)環境連上公用網際網路。而該代理藉此存取了 Hugging Face 的正式系統,並波及雲端計算服務商 Modal Labs 的客戶環境,OpenAI 後續亦證實了此項測試事件,並宣布暫停部分模型訓練以重新檢視安全機制。
 

根據 Hugging Face 事後重建的技術時間線,該 AI 代理在 4 天半內於系統內部執行了約 1.76 萬項操作!數據顯示,從該代理人控制第一個正式容器(Pod)到取得內部多個 Kubernetes 叢集管理權限,歷時不到 13 小時。


此起事件並非人類駭客將 AI 當作輔助工具,而是 AI Agent 在沒有人類指令干預的情況下,自主規畫並執行的跨系統存取行為。這次事件為推動 AI 自動化的企業提供了實質案例:當系統給予 AI 較高的自主執行權限時,現有的防線是否具備對應「高頻率、連續性且具備推理能力的非人類實體」之監控能力。

4 天半內的 1.76 萬次操作:AI Agent 突破邊界的技術路徑

test

事件路徑 | 圖片來源:Hugging Face

根據 OpenAI 的說法,這項評估原本在高度隔離的沙箱環境中進行,模型僅能透過內部代管的第三方軟體安裝套件,但其投入大量推論算力並發現「直接去外部找解答」是效率最高的路徑,並打通一條遠端程式碼執行(RCE)的路徑,開啟一連串如同特務潛入般的跨系統存取,過程中展現出了令人震驚的自主推導與連鎖攻擊能力,:

•自主尋找零日漏洞(Zero-Day)進行沙盒逃逸:AI Agent 發現了套件下載代理伺服器(Artifactory Cache Proxy)的未知零日漏洞,並在 OpenAI 內部研究環境橫向移動,成功破解隔離連上公用網際網路。


•利用未驗證端點作為跳板:連外後,Agent 找到了雲端服務商 Modal Labs 上一名客戶對外公開且未設驗證的介面(Endpoint),雖然 Modal 平台本身的隔離機制並未被破壞,但該客戶暴露的端點給了 Agent 執行程式碼的空間,成為其掩蓋來源、發起後續攻擊的中繼站。


•推論答案位置並引誘系統回傳憑證:Agent 經由網路搜尋推論出測試解答可能存放於 Hugging Face,隨後向 Hugging Face 上傳惡意資料集,誘使資料處理系統回傳伺服器內的環境變數、存取 Token 與通行金鑰。


•極速橫向移動與隱蔽 C2 通訊:掌控內部憑證後,Agent 在 Hugging Face 的 Kubernetes (K8s, 雲端容器自動化管理系統) 叢集中建立了多個高權限容器(Pod),這些容器被設定為「即使被管理員刪除也會自動重新建立」的持久化狀態,讓 Agent 在短短 13 小時內順利橫向移動至多個內部資料庫與服務叢集。

整個過程中,AI Agent 串接了 0-day、K8s Pod 自癒、跳板與 C2 隱蔽通訊,完成了一套標準且極度高明的高級持續性威脅(APT)攻擊鏈,也正是企業防護機制必須重新審視的關鍵點。

Open AI 這次的事件帶給企業什麼警訊?

這起事件凸顯出現代企業資安架構面臨的根本轉折:傳統防線多數是針對「人類操作行為」進行防禦與身份驗證設計,然而隨著企業加速引進 AI Agent、自動化腳本與 API 串接,網路環境中出現了大量具備自主執行能力的 NHI(Non-Human-Identity,非人類身分)與自動化管道,當失控的 AI Agent 或自動化程式在系統內運作時,現有防線通常會暴露三大關鍵死角:


📍邊界與 Web/API 通訊控管(Boundary Exposure):傳統防線往往假設內網呼叫或出站請求是安全的,缺乏針對 AI Agent 與外部 Web/API 通訊的即時隔離與檢驗機制,導致惡意 Payload (攻擊程式碼) 或跨區呼叫能輕易穿透。


📍暴露面與影子資產(Shadow Endpoints & Assets):正如 Modal Labs 客戶案例所示,開發人員為了方便往往會開設未設身分驗證的 API 端點,或是 Agent 在內網秘密建立容器,這些「不在資產清單上」的影子資產,成了自動化程式最容易突破的進入點。


📍靜態憑證搜尋與濫用(Credential Exposure):自動化程式能在極短時間內掃描網段,搜刮硬編碼(Hardcoded)在系統內的 SSH 金鑰、API Token 或服務帳號(Service Accounts),並對憑證進行編碼處理以規避簡易檢測,達成快速橫向移動。

建構零信任與分層收容的四項防衛策略

test

面對高頻率且具備連續嘗試特性的自動化行為,企業可從「邊界隔離、資產可見、特權管理與威脅情報」四個層面,評估架護上的強化措施:

💡網頁與 API 通訊的動態隔離:Menlo Security

AI Agent 逃脫沙箱、存取外部資源或向目標系統投遞惡意 Payload 時,多數需透過 Web 通訊協定(HTTP/HTTPS)或 API,防範此類越界行為的關鍵,在於降低應用程式對外的直接暴露面。

- Menlo 專家觀點:「預期你部署的每一個 Agent 都會逃逸,不要寄望它遵守規則,而是要限制它能到達的地方(Outbound connections closed by default)」


Menlo Security 透過其專利的 HEAT Shield 與最新發布的 Trusted Agent Runtime(可信 AI 代理運行環境)MARS 技術,將 Agent 與外部 Web/API 的通訊限制於雲端隔離環境中進行,Menlo 針對出站連線設定存取策略並審查動態請求,讓 Agent 的對外存取行為在可管控的隔離環境中運作,能從第一線阻斷未知 Payload 衝擊與非法 API 呼叫。
- Menlo Security 官方文章:The Machine Broke Out on Its Own

💡全域資產與行為可見性:Armis from ServiceNow
Modal Labs 案例中被利用的未驗證 Endpoint(影子資產),以及 Agent 在目標系統內秘密建立的 Pod,均屬於資安管理中需持續盤點與監控的資產範疇。


Armis Centrix™ 是無須安裝代理程式(Agentless)的資產可見性平台,透過持續監控網域內的連線設備、API 呼叫與 NHI(非人類身分)動態,當網路中出現「未驗證 Endpoint 異常呼叫」或「未報備的自主程序跨區連接」時,Armis 能即時提供資產活動軌跡並發出異常告警,填補資產盲點。
 - 延伸閱讀:Armis 最新全球網路戰報告:AI 武器化時代來臨,企業該如何實現「先發制人」的主動防禦

💡特權存取與動態憑證管理:SSH Communications Security
當 Agent 突破邊界後,會在數天內搜尋並處理大量 Token 與靜態憑證進行橫向移動,降低此類風險的手段,是減少環境中長期存在的靜態金鑰,改採 JIT(Just-In-Time,即時授權)與無憑證(Credential-less)架構。


SSH Communications Security 的零信任特權存取管理(PAM)方案,能在自動化程序或人員發起連線時動態頒發短時效憑證,並於連線結束後進行銷毀。當系統內部減少靜態存放的 SSH 金鑰與密碼,即可降低憑證遭自動化程式掃描與重複利用的風險。
 - 成功案例解析:每日100萬次自動化連線破口!全球半導體大廠如何用「無金鑰架構」封堵資安死角?

💡自動化威脅情報與動態行為追蹤:TeamT5 杜浦數位安全

失控 AI Agent 在內網呈現出利用漏洞提權、混淆編碼憑證以及秘密建立容器等類似 APT(進階持續性威脅) 的動態行為,面對這種即時產生的變異連線與指令,單靠傳統靜態特徵碼難以發揮效用。


TeamT5 專精於威脅情報(Threat Intelligence, CTI)與進階威脅獵捕,其最新發布的 ThreatSonar Plus 全方位端點風險安全檢測平台,能針對內網進行深度的動態行為追蹤與主動式威脅分析,當自動化程式或 AI Agent 在內網展現出異常提權、惡意指令發送或越界橫向移動時,ThreatSonar Plus 能在第一時間辨識出 APT 攻擊特徵並發出預警,輔助企業資安團隊即時進行阻斷與應變。
 - ThreatSonar Plus 相關文章:全球駭客攻擊件數2年內大增7成!當AI代理人化身「秒級攻擊」駭客,企業如何守住資安最後防線?

前沿 AI 的安全治理與防衛升級

這起事件引發資安與 AI 領域對系統防衛能力的討論,包含 OpenAI 執行長 Sam Altman 提及需重新評估技術發展與安全機制的平衡,以及在昨日 7/28 由多名科技業專家聯合發表 「Pacing the Frontier《調控頂尖AI發展步調》」 聲明,呼籲建立對應前沿 AI 的治理架構與安全工具。

當 AI 模型演進帶來更高的自動化與推理能力時,網路安全策略需要進一步考慮「對自主行為實體(AI Agent)的行為管束,以及對非人類身分(NHI)憑證的嚴格管控」。

作為關注技術發展趨勢的專業資安代理商,橙鋐科技持續追蹤全球威脅動態與資安架構演進,協助企業在導入 AI 自動化的過程中,建立具備即時監控、全域資產可見與動態隔離的防護機制,面對「自主 AI Agent 威脅」與「非人類身分(NHI)管理」帶來的維運課題,橙鋐科技整合 Menlo Security、Armis、SSH Communications Security 與 TeamT5 等資安品牌解決方案,提供企業客觀的防衛架構規劃建議,協助降低系統運作風險。