Google 發布 Gemini 3.8 Live:語音對語音指數 82.6 登頂,邊說邊推理與呼叫工具

-

廣告spot_imgspot_img

Google 於 9 月 15 日正式推出 Gemini 3.8 LiveGemini 3.8 Live Extended Thinking 兩款即時語音模型。前者鎖定大量部署、成本效率與流暢對話,後者則把更多運算資源放在複雜任務與多步推理,並主打模型能一邊說話、一邊處理背景工作。

這次更新最醒目的成績,是 Extended Thinking 版本以 82.6 分登上 Artificial Analysis 語音轉語音綜合指數首位。這不只是單項語音辨識或合成分數,而是把語音推理、代理任務表現、真人偏好與任務成功率納入同一套評估,讓語音模型的比較更接近實際代理應用。

Google 發布 Gemini 3.8 Live:語音對語音指數 82.6 登頂,邊說邊推理與呼叫工具 image-88-1500x829

兩款模型分工:一款拚規模,一款拚複雜任務

依據 Google 官方公告,Gemini 3.8 Live 結合即時對話、視覺定位與成本效率,適合需要大量同時服務使用者的語音產品;Extended Thinking 則針對需要較深推理的工作,讓模型在維持對話的同時拆解與執行多步驟任務。

這個分流反映語音代理的兩種需求。客服、搜尋與一般助理重視回應速度、自然插話和營運成本;訂位、故障排除、金融服務或企業流程則更在意模型能否查找資訊、呼叫多個工具並取得正確結果。Google 沒有用單一設定涵蓋所有情境,而是讓開發者依任務複雜度選擇速度與推理深度。

Google 發布 Gemini 3.8 Live:語音對語音指數 82.6 登頂,邊說邊推理與呼叫工具 image-89
Google 發布 Gemini 3.8 Live:語音對語音指數 82.6 登頂,邊說邊推理與呼叫工具 image-90
Google 發布 Gemini 3.8 Live:語音對語音指數 82.6 登頂,邊說邊推理與呼叫工具 image-91-1500x844

82.6 分代表什麼?不是單一語音測試

Artificial Analysis 說明,Speech to Speech Index 是語音推理、代理任務表現、Arena 偏好與任務成功率的等權重綜合分數,而且只有完成全部評測的模型才會列入。榜單顯示,Gemini 3.8 Live Extended Thinking(High)取得 82.6 分,高於 OpenAI GPT-Live-1 Astra 的 81.5 分與 Grok Voice Think Fast 2.0 High 的 81.3 分;一般版 Gemini 3.8 Live 則為 76.0 分。

Google 發布 Gemini 3.8 Live:語音對語音指數 82.6 登頂,邊說邊推理與呼叫工具 Artificial-Analysis-Speech-to-Speech-Index-1500x531

拆開來看,Extended Thinking 在 Artificial Analysis 的 Big Bench Audio 語音推理項目為 98%,在模擬客服使用工具處理真實任務的 τ-Voice 為 68.6%,任務成功率為 89.1%,首段語音平均等待時間為 1.35 秒。這些數字顯示它的優勢主要落在推理與代理操作,而不是每個語音維度都全面領先;例如一般版 3.8 Live 的對話動態分數反而較高,首段語音也更快。

Google DeepMind 的評測方法文件進一步說明,Artificial Analysis 與 τ-Bench 測試使用 Gemini API,模型 ID 分別為 gemini-3.8-live-previewgemini-3.8-live-extended-thinking;Extended Thinking 採高思考設定與預設取樣,結果原則上以單次作答計算,沒有透過多數決或平行測試增加測試時計算量。

真正的改變,是模型能在對話背後繼續工作

Google 表示,Gemini 3.8 Live 可以在接近即時的速度處理視覺輸入,並在同一段對話中自動辨識與切換 97 種支援語言。更重要的是,工具與 API 呼叫可在背景執行,模型能先確認已收到要求,接著維持交談,不必讓使用者在一片沉默中等待外部系統回傳結果。

Extended Thinking 則會同時推理與說話。它可以用簡短語句先回應使用者,再持續口述多步任務的進度。對語音代理而言,這不只是介面更像真人,而是把過去「停下來想、完成後再回答」的同步流程,改成可以持續互動的非同步工作模式。

這種能力特別適合訂位、查詢企業資料、現場故障排除與客戶服務。使用者可以在代理查資料或呼叫工具時補充條件,模型也能把新資訊帶回仍在進行的任務;若實作得當,語音介面就不再只是聊天視窗的朗讀版,而是能持續協調工具與人的工作入口。

從測試榜單到產品,仍要看任務設計

82.6 分證明 Extended Thinking 在目前這套綜合指標下取得領先,但不等於任何語音應用都會自動變得可靠。Artificial Analysis 的 τ-Voice 是在模擬客服環境裡,讓模型依政策文件與工具完成具備唯一正確資料庫狀態的任務;Big Bench Audio 則用 1,000 道音訊題目測量原生語音推理。這些測試比只比較音色自然度更貼近代理使用情境,但仍無法取代企業自己的口音、噪音、權限、延遲與失敗復原測試。

榜單也顯示不同設定各有取捨。Extended Thinking 的綜合分數最高,一般版 3.8 Live 則在 Artificial Analysis 的資料中擁有更快的 1.18 秒首段語音時間,以及 96.1% 的對話動態分數。開發團隊需要依照任務風險與等待容忍度決定模型,而不是只選榜單最高的一個。

開發者、企業與一般使用者從哪裡使用

兩款模型都已開始透過 Gemini API 與 Google AI Studio 向開發者推出。Gemini 3.8 Live 也進入 Search Live;企業端先以 Gemini Enterprise 私人預覽提供,之後將擴展至 Gemini Enterprise for Customer Experience。

Extended Thinking 同步進入 Gemini Live,並提供給 Google AI Pro 與 Ultra 訂閱者在 Google 文件中的 Workspace 體驗;Gmail 與 Keep 則向 Google AI 訂閱者推出。企業可在 Gemini Enterprise 私人預覽使用,Google 也預告將提供給 Workspace 商務客戶。實際可用時間仍可能因帳號、地區與逐步推出進度而不同。

語音代理生態系已經提前接軌

Google 同時列出 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 與 Vision Agents 等開發平台,這些服務可透過 Gemini Live API 處理即時媒體串流與語音介面。Salesforce、Genspark、Lumeris 等企業也在合作名單中,顯示 Google 希望把 Gemini 3.8 Live 放進客服、企業工作流與垂直應用,而不只留在 Gemini 自家產品。

這項策略的關鍵,是讓開發者不必自行拼接語音轉文字、文字模型與文字轉語音三個階段。原生語音模型能直接理解與產生音訊,理論上可保留語氣、停頓與插話等資訊,也更容易維持全雙工對話;但產品端仍須處理電話網路、回音消除、工具權限、敏感資料與人工轉接等工程問題。

所有生成音訊都加入 SynthID 浮水印

Google 表示,旗下 AI 產品產生的所有音訊都會嵌入不可感知的 SynthID 浮水印,以便後續辨識 AI 生成內容。這項設計不會替代平台的揭露、同意與防詐機制,但在語音模型愈來愈自然、又能大規模部署後,提供了一層可追溯性。

對開發者來說,Gemini 3.8 Live 的新聞價值不只是一張榜單。真正值得觀察的是,Google 正把視覺理解、即時語音、多語切換、背景工具呼叫與多步推理整合成同一個 Live API。若這些能力在實際網路延遲與複雜企業系統中仍能維持穩定,語音 AI 的主戰場將從「說得像不像人」,快速轉向「能不能一邊溝通、一邊把事情完成」。

資料來源

更多AI相關報導

相關文章/報導
手哥 HANDBRO
手哥 HANDBRO
硬是要學共同創辦人兼職打雜編輯,熱愛網路、熱愛 3C!腦袋是個不定時炸彈,隨時會炸出新玩意兒!如有開箱、評測或各種合作需求,請洽:contact@soft4fun.net。 YouTube 頻道:手哥科科

留下一個評論

請輸入你的評論!
請在這裡輸入你的名字

網站搜尋
我們的頻道
看更多新聞
- 廣告 -
分享給朋友