Google 於 9 月 30 日正式發表新一代旗艦模型 Gemini 4 Argon,主打真實世界軟體工程、法律與金融等企業知識工作,以及資安防禦。Gemini 4 Argon 的輸出上限一口氣拉到 100 萬 token,導入期價格為每百萬 token 輸入 2 美元、輸出 10 美元,約為 OpenAI GPT-6 Astra 的五分之一,但目前僅向受信任的資安防禦者限量開放。
限量開放:先給資安防禦者,全面上線時程未定
Google 表示,Gemini 4 Argon 目前透過「Fairwind 計畫」,先提供給一組受信任的資安防禦者使用,同時 Google 也參與美國政府自願性的模型發布前取用機制,之後才會逐步擴大。官方說法是「盡快」向開發者、企業與一般使用者開放,順序會從付費 API 客戶與 Google AI Ultra 訂閱者開始,但沒有給出具體日期。Gemini API、Vertex AI、Workspace 等各平台的實際上線細節,也尚待官方進一步公布。
Benchmark:13 項領先或並列,但並非全面通吃
官方公布的成績中,DeepSWE v1.1 為 77.9%,被 Google 稱為真實世界長時程軟體工程任務的新最佳紀錄;Zapier 的 AutomationBench 為 51.3%,排名第一;CWE-bench v1 為 68%,與對手並列第一;長影片理解的 LVBench 則達 91.7%。

VentureBeat 統計,在 Google 揭露的 18 項基準測試中,Argon 有 13 項領先或並列,多於 GPT-6 Astra(4 項單獨領先)與 Claude Opus 5.5(2 項單獨領先)。例如 DeepSWE v1.1 對上 Opus 的 74.2%、AutomationBench 對上 Opus 的 42.5%,法律分析的 Harvey 基準則是 19.6% 對 Astra 的 5.4%。
不過勝負並非一面倒:在 FrontierSWE v2 上,Astra 以 65.5% 領先 Argon 的 55.0%,Opus 在 Terminal-bench 類任務上也仍高於 Argon。VentureBeat 的結論是,模型選擇仍得看實際工作負載。
100 萬 token 輸出與價格:導入期只要 Astra 五分之一
在規格上,Argon 的輸出上限從前代的 6.4 萬 token 提高到 100 萬 token,Google 稱之為業界最高,對大型程式碼庫遷移、長篇法律文件審閱這類需要一次產出大量內容的工作最有感。
價格方面,導入期為每百萬 token 輸入 2 美元、輸出 10 美元,與昨天剛發佈的 GPT-6.1 Sol 相同價格;快取輸入享 95% 折扣;導入期結束後調整為輸入 4 美元、輸出 20 美元,與 Opus 5.5 的標準價相同,仍低於 Astra 的 10 美元與 50 美元。
資安與安全:間接提示注入成功率 0.7%
Google 說明 Argon 的安全機制涵蓋四個面向:拒絕有害請求並加入內部啟動監控、抵禦提示注入、以思維鏈監控在必要時中止執行,以及把模型運作限制在密封的沙盒環境。VentureBeat 引述的數據顯示,Argon 在間接提示注入測試中的攻擊成功率為 0.7%,Astra 則為 8.5%。
資安也是這次限量發布的核心。Google 提到,Wiz 利用 Argon 找出一個先前模型遺漏的醫療軟體嚴重漏洞;內部範例還包括把量子運算最佳化任務改善 40%(相較已發表的基準)、替 Google 資料中心釋出 300 TiB 記憶體,以及把 libgav1 影片解碼器改寫成快 2.7 倍且記憶體安全的版本。這些成果皆為 Google 自行公布,尚無第三方重現。
為什麼值得關注
Gemini 3.1 Pro 自今年 2 月後,旗艦位置一直沒有更新,Google 只持續迭代 Flash 系列。這次 Argon 被視為 Google 在旗艦等級重新追上 OpenAI 與 Anthropic 的第一步,而且以接近 Opus 的價位、更長的輸出上限切入企業工作流。真正的關鍵,是後續全面開放的時間點,以及實際企業使用情境能否複製官方 benchmark 的表現。
資料來源
Google 官方部落格:Gemini 4 Argon、VentureBeat:Google unveils Gemini 4 Argon、9to5Google、The New Stack





