OpenAI 推出 GPT-6.1 Sol:五分之一價格逼近旗艦 Astra,速度版最高快 8 倍

-

廣告刊登廣告? 點此聯絡

OpenAI 宣布推出 GPT-6.1 Sol,官方形容它以約五分之一的價格,提供接近旗艦 GPT-6 Astra 的智慧能力,是目前同等效能下最具成本效益的模型。GPT-6.1 Sol 是中階 GPT-6 Sol 的升級版,標準 API 價格為每百萬輸入 Token 2 美元、輸出 10 美元,在程式開發、電腦操作與專業文件處理上都有明顯進步。這篇文章整理它的定位、官方公布的 benchmark 數字、價格與速度版本,以及誰現在用得到。

OpenAI 推出 GPT-6.1 Sol:五分之一價格逼近旗艦 Astra,速度版最高快 8 倍 GPT-6-1-Sol_16x9
OpenAI 為 GPT-6.1 Sol 發表準備的官方主視覺。 圖片來源:OpenAI 官方公告〈Introducing GPT-6.1 Sol〉

定位:接近 Astra 的能力,只要五分之一的價格

官方明確表示,GPT-6 Astra 仍是整體能力最強的前沿模型,適合最需要頂尖結果的關鍵工作;GPT-6.1 Sol 則是在許多任務上逼近 Astra、但成本大幅降低的選項。OpenAI 也說,它相較 GPT-6 Sol 在程式碼編寫與除錯、複雜文件理解、多步驟業務流程、電腦操作與科學研究工作流程上都更強,事實準確度與安全對齊也一併改善。官方在公告中以「以不到 Astra 標準 API Token 價格的一半,取得更多迭代空間」形容開發者的好處,讓相同預算可以建構並執行更強大的代理。

TechCrunch 的報導也提到,GPT-6.1 Sol 在代理式程式開發、電腦操作與專業工作上幾乎追平 GPT-6 Astra,而價格約為 Astra 標準 Token 價格的五分之一。

價格:每百萬輸入 2 美元、輸出 10 美元

根據官方公告,GPT-6.1 Sol 的標準 API 價格為每百萬輸入 Token 2 美元、快取輸入 Token 0.10 美元、輸出 Token 10 美元,快取輸入價格比標準輸入低了 95%。作為對照,官方列出的 GPT-6 Astra 是輸入 10 美元、快取輸入 1 美元、輸出 50 美元,GPT-6 Luna 則是輸入 0.10 美元、快取輸入 0.01 美元、輸出 0.50 美元。API 模型名稱為 gpt-6.1-sol。官方頁面沒有列出 context window 大小。

OpenAI 推出 GPT-6.1 Sol:五分之一價格逼近旗艦 Astra,速度版最高快 8 倍 desktop-transparent-2-scaled
官方公告中的模型對比卡,比較 GPT-6 Astra、GPT-6.1 Sol 與 GPT-6 Luna。 圖片來源:OpenAI 官方公告〈Introducing GPT-6.1 Sol〉

Benchmark:幾乎追平 Astra,明顯勝過前代 Sol

在軟體工程評測 DeepSWE v1.1 上,官方指出 GPT-6.1 Sol 以約五分之一的成本達到與 GPT-6 Astra 相同的表現,並比 GPT-6 Sol 的最佳成績高出 6.4 個百分點。在複雜 PDF 文件理解的 GDP.pdf 上,GPT-6.1 Sol 的得分高於含備援機制的 Opus 5.5,每項任務成本不到後者的一半,並以約五分之一的每項任務成本,達到接近 GPT-6 Astra 的頂尖效能。

OpenAI 推出 GPT-6.1 Sol:五分之一價格逼近旗艦 Astra,速度版最高快 8 倍 DeepSWE

在多步驟業務流程的 AutomationBench 1.0.6 上,中推理強度下的 GPT-6.1 Sol 比 Opus 5.5 高出 2.2 個百分點,成本僅約三分之一,也比相同設定的 GPT-6 Sol 高出 4.8 個百分點。電腦操作評測 OSWorld 2.0 上,最高推理強度的 GPT-6.1 Sol 比 GPT-6 Sol 高出 7 個百分點,和 Astra 只差 2.1 個百分點,每項任務成本約為 Astra 的七分之一。

OpenAI 推出 GPT-6.1 Sol:五分之一價格逼近旗艦 Astra,速度版最高快 8 倍 AutomationBench

科學研究評測 Terminal-Bench Science 0.1 的落差最大:最高推理強度下,GPT-6.1 Sol 的得分超過 GPT-6 Sol 的兩倍,每項任務平均成本 5.47 美元,相較之下 Opus 5.5 是 23.21 美元、Astra 是 23.80 美元,成本低了逾 75%。不過這項評測的最高分仍屬於 GPT-6 Astra,為 68.1%。

OpenAI 推出 GPT-6.1 Sol:五分之一價格逼近旗艦 Astra,速度版最高快 8 倍 Terminal-Bench-Science-0.1

事實正確性與安全:錯誤率更接近 Astra

官方公布,在特高推理強度下,GPT-6.1 Sol 的事實錯誤率為 4.1%,低於 GPT-6 Sol 的 4.5%,接近相同設定下 Astra 的 4.0%,每項任務成本則比 Astra 低約 83%。TechCrunch 引述的另一組數字是,在低推理強度下錯誤率從 11.4% 降到 7.7%,各種推理設定下與 Astra 的差距都在 1.9 個百分點以內。

對齊評估方面,OpenAI 說 GPT-6.1 Sol 比 GPT-6 Sol 大幅進步、更接近 Astra。以「搜尋工具故障時是否告知使用者」為例,GPT-6.1 Sol 有 2.8% 的情況沒有說明,GPT-6 Sol 是 4.9%,GPT-6 Astra 為 1.5%,GPT-6 Luna 則高達 28.7%。官方也強調,公告中的多項評估刻意選用高難度情境,並不代表一般使用情況,部分數據來自公開報告,部分則在 OpenAI 的研究環境中完成。

Ultrafast:速度最高 8 倍,搭配新的 500 美元 Pro 方案

除了標準版,OpenAI 同步推出 GPT-6.1 Sol Ultrafast,API 名稱為 gpt-6.1-sol-ultrafast,官方表示速度最高可達標準版的 8 倍,讓開發者以接近過去使用 GPT-6 Astra 的 API 費用,取得接近 Astra 的能力與快 8 倍的速度。Engadget 的報導提到它每秒最高可生成約 300 個 Token,可用於 Codex 與 Work,也開放給 API 使用者。

在 ChatGPT 方面,Ultrafast 提供給新的 Pro 級別訂閱,官方公告寫明此級別每月 500 美元、提供最高用量額度。Engadget 同時報導,現有的 200 美元 Pro 方案內容被調降:Codex 與 Work 的用量從 Plus 的 20 倍降為 10 倍,GPT-6 Pro 每週訊息上限從 200 則降為 100 則,現有訂閱者會暫時維持原限制,之後獲得一次性補償額度。

誰現在用得到:先在 ChatGPT Work 與 Codex 上線

GPT-6.1 Sol 目前提供給 ChatGPT Plus、Pro、Business、Enterprise 與 Edu 使用者,可在「ChatGPT 工作」與 Codex 中使用,尚未開放在一般對話中,開發者則可透過 OpenAI API 以 gpt-6.1-sol 呼叫。對多數用戶來說,這代表原本需要動用 Astra 才能完成的長流程工作,現在可以改用成本低得多的模型,把 Astra 留給最關鍵的任務。

編輯觀察:命名容易混淆,安全故事仍是背景

這次發表最容易讓人搞混的是名稱:GPT-6.1 Sol 順利上線,但前一天才被報導取消的是另一款 GPT-6.1 Astra,OpenAI 當時的說法是該模型顯示出較高程度的欺騙,並會在未經許可的情況下繼續執行任務。也就是說,OpenAI 一邊把 Astra 級能力以低價下放,一邊在旗艦模型的安全評估上踩了煞車;官方特別把對齊評估的改善放進 GPT-6.1 Sol 的公告,也呼應這樣的背景。實際用起來,這些跑分能否在不同工作流程上重現,仍要等開發者實測,尤其是官方自己選定的評測與推理強度設定。

資料來源

更多AI相關報導

相關文章/報導
手哥 HANDBRO
手哥 HANDBRO
硬是要學共同創辦人兼職打雜編輯,熱愛網路、熱愛 3C!腦袋是個不定時炸彈,隨時會炸出新玩意兒!如有開箱、評測或各種合作需求,請洽:contact@soft4fun.net。 YouTube 頻道:手哥科科

留下一個評論

請輸入你的評論!
請在這裡輸入你的名字

網站搜尋
我們的頻道
看更多新聞
- 廣告 -
分享給朋友