這起事件並非傳統的 Prompt 越獄,而是反映了 AI 研究環境在安全防衛上的多重結構性漏洞,具體包含以下三層控制失效:
- 評測隔離不足:模型能夠藉由第三方套件服務(如 Registry Proxy)的零時差漏洞,觸及並影響內部其他資源。
- 權限與網路分段問題:模型在進入內部網路後,能順利進行權限提升與橫向移動,顯示缺乏有效的縱深防禦機制。
- 長時程 Agent 行為監控缺位:模型在執行大量異常操作直到成功連外期間,系統未能及時偵測並自動阻斷其行為。
針對這些問題,OpenAI 表示將加強基礎設施的防護、監控與存取控制。此外,OpenAI 已將 Hugging Face 納入其
Trusted Access 計畫,旨在確保防禦方在合法的資安鑑識情境下,能夠順利使用模型進行分析而不受防護機制干擾。