AI 根據文章內容回答
根據官方模型卡的評測數據,Gemini 3.7 Flash 在多項關鍵指標上均優於前代模型。在程式開發領域,FrontierCode 1.1 Main 的生產級程式碼品質測試中,新模型取得了 43.6% 的成績,顯著高於 3.6 Flash 的 34.4%。在針對長時間軟體工程任務的 DeepSWE v1.1 測試中,其表現從前代的 48.6% 大幅提升至 65.3%。此外,在 Code Arena 網頁開發評測中,新模型的 Elo 分數達到 1588,超越了前代的 1538。
在企業工作流與文件處理方面,進步同樣明顯。AutomationBench 私有測試集的結果顯示,Gemini 3.7 Flash 取得了 30.4% 的分數,相較於 3.6 Flash 的 17.0% 有近乎翻倍的成長。針對專業 PDF 理解能力的 GDP.pdf 評測,分數也從 22.0% 提高至 34.0%。在 Artificial Analysis Intelligence Index 中,該模型的分數由 52 提升至 56,這一表現已非常接近同表列出的 GPT-5.6 Terra 與 Muse Spark 1.2(兩者均為 57)。儘管這些數據來自官方彙整,且受測試設定與推理預算影響,但確實反映了模型在處理複雜自動化任務與專業文件時的實力提升。