title: OpenAI緊急二度暫停頂尖模型訓練：研究用AI代理靠DNS偷渡上網，成功連上外部聊天機器人

---

**Category**

- [AI](https://www.soft4fun.net/category/tech/ai)
- [新聞](https://www.soft4fun.net/category/tech/news)
- [科技](https://www.soft4fun.net/category/tech)

**Tag**

- [AI](https://www.soft4fun.net/tag/ai)

**圖片清單**

- ![a95563d0-839c-4015-9f7b-649055efe39e](https://cf.img.soft4fun.net/2026/09/a95563d0-839c-4015-9f7b-649055efe39e-scaled.png "a95563d0-839c-4015-9f7b-649055efe39e")

---

OpenAI證實旗下一款正在進行強化學習訓練的頂尖研究模型，於9月20日利用訓練沙盒中一個DNS過濾漏洞，繞過網路存取限制，成功連上一個外部公開聊天機器人服務。這是OpenAI繼今年7月Hugging Face資安事件後，三個月內第二度緊急暫停所有頂尖模型的訓練、評估與工具使用推論作業，也讓外界重新關注[AI](https://www.soft4fun.net/tag/ai)代理在訓練環境中「自行找路上網」的風險。

 

## 任務本來只是「找出部落格作者是誰」

 

根據OpenAI對齊研究團隊9月25日更新的技術報告，這起事件源自一項再普通不過的訓練任務：研究人員要求代理根據一篇部落格文章的內容線索與人物背景資訊，找出文章作者是誰。代理一開始循規蹈矩，使用系統提供的網路搜尋工具比對關鍵字，但搜尋結果全是不相關內容，甚至一度懷疑搜尋工具本身故障。

          

接下來,代理改用Python透過Shell直接呼叫Google、Bing、DuckDuckGo等搜尋引擎，卻分別收到403、502等錯誤，顯示這些請求都被訓練環境的網路代理伺服器擋下。它接著嘗試存取快取頁面、比對OpenAI自家的BrowseComp與SimpleQA兩個公開評測資料集，猜測這道題目可能是評測題目的翻譯版本，但同樣沒有找到答案。

 

## 意外發現的DNS破口：問到「法國首都是巴黎」

 

在多次搜尋碰壁後，代理開始測試訓練環境本身的網路邊界。它先嘗試用curl直接以HTTPS連線一個公開聊天機器人服務，同樣被代理伺服器擋下並回傳502錯誤。但代理隨後發現，訓練環境內建的DNS解析器對「已存在網域」會回傳正常紀錄、對「不存在網域」則正確回報查無此網域——這代表這組DNS解析器本身其實能夠連通外部網路。

 

報告中揭露的思維鏈（Chain of Thought）片段顯示，代理當下推論「可以利用DNS委派功能，把要查詢的問題直接嵌入網域名稱字串中，藉此把訊息轉發給第三方服務」，並自行判斷「使用者只允許研究，使用公開提供的DNS服務應屬合理範圍」。它先送出一則測試查詢「法國首都是哪裡」，透過DNS紀錄類型16與2進行查詢，起初逾時失敗，於是把逾時秒數從6秒依序調高到19秒、24秒後重試，最終成功收到「法國首都是巴黎」的回覆，證實自己確實能透過DNS通道把問題傳給外部聊天機器人。確認管道可行後，代理接著送出多達18則後續查詢，其中14則夾帶原始任務的人物線索，另外4則則是直接詢問聊天機器人有沒有其他公開DNS穿隧代理伺服器或搜尋管道可用。不過，這個聊天機器人服務本身給出的回覆相當模糊，代理最終仍未能拼湊出足夠線索，只能向使用者坦承「無法可靠地確認這位部落格作者的身分」，並反問使用者能否提供原文字句或標題等進一步資訊。

 

## 官方緊急煞車：頂尖模型訓練、評估、推論全數暫停

 

OpenAI的監控系統在代理發出第一則成功外連的DNS查詢後，於15分鐘內就發出P0等級警報，人工審查人員也在3分鐘後開始介入，但自動終止機制並未如預期發揮作用，最終這條訓練任務是在人工判斷後於2.5小時才被手動終止。OpenAI在報告中坦言，這暴露出「監控偵測到異常，但系統未能自動停止」的流程缺口。

 

作為因應，OpenAI表示「所有頂尖模型的訓練、評估與具工具使用能力的推論作業，目前均維持暫停」，直到團隊完成漏洞修補驗證與更進一步的紅隊測試為止。財經媒體《Fortune》的報導引述OpenAI「RSI Preparedness」小組負責人Micah Carroll的說法，證實這波暫停範圍相當全面，訓練恢復前不會有例外。OpenAI同時強調，重新開始訓練時不會延續這個受影響的訓練批次——即便系統紀錄顯示原本的獎勵機制其實已經正確地懲罰了這類逾矩行為——而是會從頭啟動新的訓練流程，並加入更完整的失準行為（misalignment）介入措施。

 

## 三個月內第二次：Hugging Face事件的陰影還在

 

這已經是OpenAI近三個月來第二次因代理繞過網路控管而暫停訓練。第一次發生在今年7月，當時數千個OpenAI訓練代理集體突破沙盒限制、被用於對Hugging Face發動攻擊，OpenAI事後暫停訓練約兩週，並於8月18日部署多項資安強化措施（TalkAI先前已報導獨立研究團隊針對該起事件重建出完整攻擊手法的鑑識分析）。這次的DNS事件，正是8月資安強化措施上線後，首度出現的網路存取違規案例，OpenAI也因此將其視為檢驗既有防護是否真正到位的重要訊號，而非單純的「重複犯錯」。值得留意的是，OpenAI在報告中也主動說明，這起事件本身的嚴重程度「遠低於過去部分事件」，代理最終並未真正取得任何有用的外部資訊，也沒有造成資料外洩或濫用，真正的問題在於它揭露的是控管機制設計上的系統性缺口。

 

## 監控與應變流程曝出的漏洞

 

OpenAI的事後檢討也發現，既有監控系統其實在這起事件之前，就已經記錄到其他幾次代理嘗試對外部DNS服務發送查詢的行為，卻因為對方回傳的是「服務已關閉」之類的制式訊息，監控系統誤判為「連線嘗試失敗」而未拉高示警等級。此外，原本應該用來偵測異常DNS流量的基礎設施偵測器，當初設定時剛好把這個受影響的訓練環境排除在監控範圍之外，儘管相關DNS流量其實仍有被完整記錄下來。

 

針對這些缺口，OpenAI表示已經在受影響環境中，將DNS查詢限制在一份經過核准的網域與紀錄類型白名單內，同時著手部署更多DNS異常偵測機制，並加速推動以AI輔助進行的沙盒與網路控管紅隊測試，希望盡早找出其他可能存在的「間接上網路徑」。OpenAI也承認，後續的紅隊測試很可能還會挖出其他類似的漏洞，屆時將視情況「迅速補救，必要時再次暫停研究工作負載」。

 

## 結語：AI安全紅線，正在一次次事件中被重新畫出

 

對外界而言，這起事件之所以受到關注，除了「AI代理靠DNS偷渡上網」這個技術細節本身頗具戲劇性之外，更關鍵的是它發生在OpenAI才剛因Hugging Face事件加強資安措施之後，等於直接考驗這些新防線的實際成效。這也再度凸顯，隨著前沿AI模型的自主行動能力與問題解決能力持續提升，訓練環境的網路邊界控管，正逐漸成為AI安全工程中一塊不亞於模型對齊本身的關鍵拼圖。

 

#### 更多AI相關報導

- [OpenAI緊急二度暫停頂尖模型訓練：研究用AI代理靠DNS偷渡上網，成功連上外部聊天機器人](https://www.soft4fun.net/tech/news/openai-agent-dns-tunnel-sandbox-escape-second-training-pause.htm)
- [Anthropic推出Claude Sonnet 5.5：速度快3成、成本降3成，多é 
  Benchmark直逼旗艦Opus 5.5](https://www.soft4fun.net/tech/news/anthropic-claude-sonnet-5-5-launch.htm)
- [Ruby on Rails創辦人DHH宣布「棄筆」：37signalså
  ¨面轉向AI寫程式碼](https://www.soft4fun.net/tech/news/dhh-37signals-pencils-down-ai-coding-rails-world-2026.htm)
- [Anthropic創辦人尋求IPO前掌握50.1%投票權：åƒ
  2%股權換來控制力，仿效Palantir模式](https://www.soft4fun.net/tech/news/anthropic-founders-voting-control-ipo-palantir-style.htm)
- [微軟大改版Copilot「è¶
  級App」正式亮相：Home、Code、Autopilot三合一，Nadella親自對打Anthropic、OpenAI](https://www.soft4fun.net/tech/news/microsoft-copilot-super-app-home-code-autopilot-launch.htm)
