Salesforce 與 nVidia 在 Dreamforce 發表 Koa,這是 Salesforce 首款專為 Agentforce 打造的 CRM 推理模型。Koa 以 NVIDIA Nemotron 3 Super 120B 為基礎,透過企業工作流模擬與強化學習,強化 AI 代理進行多步推理、選擇工具及執行 CRM 動作的能力。
Koa 不是通用聊天模型,而是 Agentforce 的 CRM 執行引擎
根據 Salesforce 官方公告,Koa 的目標不是回答一般知識問題,而是協助 Agentforce 代理處理具備狀態、權限與商業規則的工作,例如更新商機、分派客服案件、安排後續聯絡,以及跨多個步驟選擇正確工具。這些任務需要模型理解資料結構與流程結果,不能只生成看起來合理的文字。
Salesforce 以 NVIDIA 的開放權重 Nemotron 3 Super 為起點,再針對 CRM 與代理工具使用進行後訓練。Salesforce AI Research 論文指出,基礎模型規模約為 120B,Koa 的核心價值在於把企業代理規格直接轉為可訓練、可評分的多輪任務。
沒有使用客戶資料,訓練素材來自公開與合成情境
Salesforce 表示,Koa 沒有使用客戶資料訓練,資料集由公開資料與合成情境構成。團隊依照近三十年的 CRM 部署經驗,模擬製造、金融服務、醫療與旅遊等超過 14 個產業的工作流程,讓每個情境包含角色、任務、工具與預期狀態變化。
這項設計的差別在於,模型學習的不是某家公司的真實交易紀錄,而是「一筆業務流程應該如何進行」的抽象結構。例如判斷潛在客戶是否合格時,模型需要取得必要欄位、遵循既定規則、呼叫對應工具,並確認 CRM 狀態真的完成更新。
以 Agent Script 建立模擬環境,再用 GRPO 強化工具操作
Koa 的訓練管線會讀取 Salesforce 用於定義 Agentforce 代理的 Agent Script,把路由、子代理、工具範圍、參數格式與終止條件編譯成可執行的工作流圖。系統接著產生不同人物與任務情境,交由 NVIDIA NeMo Gym 執行多輪模擬。
模型的獎勵不只看回答是否流暢,而是檢查任務是否透過正確工具真正完成。Salesforce 使用 Group Relative Policy Optimization(GRPO)進行強化學習,讓模型在反覆嘗試中提高多步工具調用成功率。論文也說明,這種「規格到獎勵」的方法能把企業既有的代理設定,直接轉成後訓練所需的任務與成功條件。
原廠測試顯示有進步,但仍未全面超越前沿模型
Salesforce 公開的論文同時列出 Koa、原始 Nemotron 3 Super 與三款專有模型的結果,避免只用單一總分宣稱領先。Koa 在三項測試的表現如下:
- Tau2Bench:Koa 加權平均為 69.41,高於 Nemotron 基礎模型的 68.64 與 GPT-4.1 的 54.48,但低於 Claude Opus 4.8 的 74.00 與 GPT-5.5 的 83.99。
- BFCL:Koa 為 66.63%,高於基礎模型的 64.73% 與 GPT-4.1 的 53.96%,接近 GPT-5.5 的 67.63%,但仍低於 Claude Opus 4.8 的 78.18%。
- CRM Bench:Koa 加權平均為 0.86,高於基礎模型的 0.84 與 GPT-4.1 的 0.81,略低於 Claude Opus 4.8 的 0.87 及 GPT-5.5 的 0.90。
Salesforce 新聞稿另宣稱,Koa 在 CRM 動作上可將錯誤減少至約三分之一;這個倍數屬原廠測試說法。論文公開表格以各項準確率呈現,沒有提供可用同一公式獨立重算的統一錯誤率欄位。研究團隊也直接承認,Koa 雖超越 GPT-4.1 這個比較基準,整體仍低於最強的前沿模型。
權重與推論都留在 Salesforce 信任邊界
NVIDIA 提供可控制權重的 Nemotron 基礎模型,Salesforce 則掌握 Koa 的後訓練成果與模型權重,並在自有基礎設施內完成推論。原廠表示,客戶資料在推論時不必跨出 Salesforce 信任邊界;對金融、醫療與政府等受監管產業而言,這提供了不同於直接把 CRM 資料送往外部通用模型 API 的部署選項。
Koa 已在 Salesforce 內部使用,包括協助員工在 Slack 查詢資訊與完成日常任務的代理。現階段客戶測試名單包含 1-800Accountant、Baxter Credit Union、Engine、Formula 1、UChicago Medicine 與 Xero,但這些導入案例與效益仍主要來自合作企業及原廠描述。
從開放基礎模型走向企業專用模型
Koa 顯示企業 AI 的競爭焦點正從「哪個模型最會聊天」轉向「哪個模型最懂工作流程,而且能正確呼叫工具」。Salesforce 沒有從頭預訓練一款通用大型模型,而是利用 Nemotron 的開放權重,在既有模型上加入 CRM 規格、模擬環境與可驗證的任務獎勵。
這也代表開放權重基礎模型可能成為大型軟體平台打造垂直 AI 的原料。企業真正取得的並不是一份通用模型排行榜冠軍,而是一個能在既有權限、資料與工作流之內運作的專用推理引擎。Koa 是否能把論文中的工具調用進步轉化為實際生產穩定性,仍要等待更多客戶測試與正式上線後的資料。
目前僅限特定客戶測試,冬季才會全面推出
Koa 現已在 Agentforce 提供特定客戶試用,Salesforce 預計於 2026 年冬季在美國地區正式推出,尚未公布獨立價格。Salesforce AI Research 與 官方 X 帳號也在 9 月 15 日公開論文與模型定位,讓外界能檢視訓練方式、比較基準與限制。
Salesforce 與 NVIDIA 也準備把 Nemotron 模型與加速運算帶入 Missionforce,支援私有雲與隔離網路等高敏感環境。不過這部分是另一條政府及受監管產業產品線,與 Koa 在 Agentforce 的上市時程不同;現階段對一般企業最實際的觀察重點,仍是 Koa 在多步 CRM 任務中的成功率、延遲、成本與人工介入比例。







