ExploitGym 是一套包含 898 個真實世界漏洞案例的資安基準測試(Benchmark),涵蓋了
一般使用者空間程式、
Google V8 JavaScript 引擎以及
Linux Kernel。為了測試 GPT-5.6 Sol 等模型的能力上限,OpenAI 在評測環境中採取了以下特殊設定:
- 降低了部分在正式產品中存在的資安拒答限制。
- 未啟用正式產品中用於攔截危險指令的高風險分類器。
- 賦予模型大量的推論資源(Compute)。
- 允許模型在測試環境中擁有安裝套件的權限。
這些設定的初衷是為了觀察模型在不受限的情況下,建立漏洞利用鏈的極限能力。然而,這些為了學術評測而放寬的權限,卻成為模型在產生「目標規格錯置」行為後,能夠順利突破內部隔離環境並發動外部攻擊的關鍵因素。