Gemini 3.7 Flash 正式登場!Google 在 Gemini 3.6 Flash 推出僅三週後,再次更新主力 Flash 系列。這次升級的重點不只是一般推理分數,而是直接瞄準程式開發、代理工作流、企業自動化與複雜文件處理;搭配優惠期間每百萬輸入 token 0.75 美元的價格,Google 顯然希望讓開發者以更低成本部署可長時間執行的 AI 代理。

Gemini 3.7 Flash 改進了什麼?
根據 Google AI Studio 官方公告與 Google DeepMind 模型卡,Gemini 3.7 Flash 建立在 3.6 Flash 基礎上,透過演算法改善核心推理能力,並支援可調整的 thinking 設定,讓開發者依照品質、成本與延遲需求配置推理強度。模型可接收文字、圖片、音訊與影片,脈絡視窗最高為 100 萬 token,單次文字輸出上限為 6.4 萬 token。
Google 將這次升級的主要使用情境鎖定在代理工作流、程式開發及企業流程。官方表示,新模型在遇到障礙時更能調整策略,也會在需要時釐清意圖,並改善多步驟規劃、工具呼叫與指令遵循表現。對實際建置 AI Agent 的團隊而言,這些能力若能在真實環境中重現,可能比單純提高問答分數更有價值,因為它直接影響重試次數、人工介入程度與整體執行成本。
官方評測顯示,程式開發與自動化進步最明顯
Google 公布的模型卡顯示,Gemini 3.7 Flash 在 FrontierCode 1.1 Main 的生產級程式碼品質測試取得 43.6%,高於 3.6 Flash 的 34.4%;DeepSWE v1.1 長時間軟體工程測試則為 65.3%,高於前代的 48.6%。在 Code Arena 網頁開發評測中,新模型的 Elo 分數為 1588,前代為 1538。
企業工作流方面,Gemini 3.7 Flash 在 AutomationBench 私有測試集取得 30.4%,高於 3.6 Flash 的 17.0%;評估專業 PDF 理解能力的 GDP.pdf 則由 22.0% 提升至 34.0%。Artificial Analysis Intelligence Index 在模型卡中的分數也由 52 提高至 56,接近同表列出的 GPT-5.6 Terra 與 Muse Spark 1.2 的 57。
上述數據均來自 Google 官方模型卡彙整的評測結果,部分基準雖由第三方設計,但測試設定、推理預算、工具使用方式與版本都可能影響結果,因此應視為選型參考,而不是所有實際工作負載都能獲得相同比例的提升。
Gemini 3.7 Flash 與各家模型評測比較





優惠價延續到年底,正式價格明年恢復
Gemini 3.7 Flash 在 2026 年 12 月 31 日前採用優惠價格,每百萬輸入 token 為 0.75 美元、輸出 token 為 3.75 美元;Gemini 3.6 Flash 同期也適用相同優惠。自 2027 年 1 月 1 日起,兩款模型將調整為每百萬輸入 token 1.50 美元、輸出 token 7.50 美元。
這項定價策略讓 3.7 Flash 在推出初期具備相當強的部署吸引力。不過,AI Agent 的實際費用不能只看單價,仍須把思考 token、工具呼叫、失敗重試、脈絡累積與快取機制納入估算;能力較強的模型若能減少重試,有時反而比單價更低但需反覆執行的模型節省成本。
Gemini Spark 同步升級,從 API 延伸到全天候個人代理
Gemini 3.7 Flash 已提供給 Google AI Studio、Gemini API、Google Antigravity、Gemini Enterprise App 與 Gemini Enterprise Agent Platform 使用。Google 也將 Gemini Spark 的底層模型升級為 3.7 Flash;Spark 是提供給 Google AI Pro 與 Ultra 訂閱者的全天候個人代理,可在使用者指示下持續執行任務,並透過 Google Workspace 工具完成知識工作。
這表示 3.7 Flash 不只是 API 型號更新,也會直接影響 Google 面向個人與企業的代理產品。對台灣開發者與企業而言,值得觀察的不是單次聊天回答是否更聰明,而是它在長時間任務、Workspace 工具操作、程式修正與複雜文件處理上的穩定度。
安全性與已知限制仍需留意
Google DeepMind 表示,Gemini 3.7 Flash 已更新化學、生物、放射與核子風險以及網路攻擊相關防護。模型卡同時指出,它在網路安全能力評估中達到警戒門檻,但尚未達到 Google 定義的關鍵能力等級;在機器學習研發方面,模型能完成個別程式任務,但仍無法在缺乏人工介入下串連成完整研究流程。
模型仍可能產生幻覺,也可能偶爾發生速度緩慢或逾時。Google 標示的主要知識截止時間為 2026 年 3 月,但部分領域的知識可能仍停留在 2025 年 1 月左右,因此涉及即時資訊或高風險決策時,仍需外部資料查核與人工審閱。





