點 ☆ 釘選模型或指標;按住滑鼠左鍵拖曳表格可橫向移動。
0 個模型 · 0 個指標已釘選
評測與規格
Decision guide

從你的工作方式出發。

這是選型建議,不是訂閱方案的官方配額承諾。

01 / 能力 × 互動速度

重要專案的日常主力

Astra 的較高綜合能力與 Medium 的短等待時間搭配得好。你已習慣這個檔位且成本可接受時,適合維持為主要選擇。

GPT‑6 Astra · Medium
02 / 智力 × 成本

高頻開發與一般任務

Sol High 以更低單價提供良好的 coding 能力;實測 500 token 回應約 14.10 秒。適合已明確規劃、需要頻繁實作與迭代的工作。

GPT‑6 Sol · High
03 / 極致單價 × 複雜工作

便宜的深度推理 worker

Luna Max 的 token 單價最低,DeepSWE 達 66.6%;但實測首字等待超過兩分鐘,不適合需要即時回應的遊戲決策。

GPT‑6 Luna · Max

閱讀方式與資料來源

資料:OpenAI Sol / Luna 發布與評測 · OpenAI Astra 發布 · AA 分項成績 · AA Sol / Luna 分析 · AA Coding Agent Index。離線開啟後資料不會自動更新。

推出 GPT-6 Sol 與 Luna

本月稍早,我們推出了 GPT‑6 Astra——全球智慧程度最高、對齊表現最好的模型。要求最嚴苛、最重要的專案仍需要 Astra 的完整深度,但工作本來就有不同的規模、節奏與預算。

因此,我們將 GPT‑6 家族擴展至 GPT‑6 SolGPT‑6 Luna。GPT‑6 Astra 開啟了新一代智慧模型;Sol 與 Luna 則推進成本效益的前緣,讓更多人能享受到這些智慧進展。我們採用與 GPT‑6 Astra 相近的方法訓練 Sol 和 Luna,把 Astra 在專業工作、事實準確性、程式開發、電腦操作及對齊方面達到領先水準的成果,帶到速度更快、價格更親民的模型上。

GPT‑6 系列在成本與智慧的關係上處於領先位置:各個級距都具備出色能力,並透過可大規模提供服務的基礎設施提高效率。快取與推論的改善降低了模型的服務成本;我們也將節省的成本直接回饋給使用者與客戶:與 GPT‑5.6 的促銷價格相比,Sol 和 Luna 的 API 價格降低了 50%。這些改善使先進 AI 更適合大規模應用於日常工作與產品。

GPT‑6 API 價格

模型 輸入 輸出 價格降幅
GPT‑5.6 Sol → GPT‑6 Sol $4 → $2 $20 → $10 降低 50%
GPT‑5.6 Luna → GPT‑6 Luna $0.20 → $0.10 $1.20 → $0.50 降低 50%

價格以每 100 萬個 token 計算。

GPT‑6 Astra 仍然是我們在各方面表現最好的模型。如果你希望得到最佳結果,並追求毫不妥協的使用體驗,請選擇 Astra。

整個模型家族的能力提升

GPT‑6 Sol 與 Luna 為你熟悉並正在使用的模型帶來智慧升級與更好的成本效益,尤其是在完成複雜工作最需要的能力上。

專業工作

GPT‑6 Sol 能處理困難的工作任務,同時以更高的使用額度和更低的成本,讓你有更多反覆調整的空間;與價格相近的競品相比,也能提供更高的智慧程度與更好的成果。

在測試跨應用程式商業工作流程的 AutomationBench 中,GPT‑6 Sol 使用 xhigh 思考檔位的表現優於使用 max 檔位的 Claude Opus 5,而每項任務的成本僅為後者的 9%。使用 high 檔位的 GPT‑6 Luna 則比上一代提高 5.4 個百分點,每項任務的成本降低 58%。

AutomationBench 官方評測圖

AutomationBench 1.0.6 中,AI 代理使用 47 種工具,完成涵蓋銷售、行銷、營運、客服、財務及人資的端到端工作流程。Claude Fable 5.1 的資料點低估了實際成本,因為其中未計入約 40% 任務中使用 Opus 5 後備模型的成本。

GPT‑6 Sol 的表現也優於 Claude Fable 5.1,成本卻低得多;甚至超過使用 low 思考檔位的 GPT‑6 Astra。

模型與思考檔位 分數 每項任務成本
GPT‑6 Sol(xhigh) 33.2% $0.27
GPT‑6 Astra(low) 30.3% Sol 的 3.9 倍
Claude Opus 5(max) 26.9% Sol 的 11.1 倍
Claude Fable 5.1+Opus 5 後備模型(max) 31.4% 超過 Sol 的 8.9 倍(未公布後備模型成本)

在評測代理完成複雜專業工作流程能力的 Agents’ Last Exam 中,GPT‑6 Sol 使用 max 檔位取得 56.4% 的成績,超過 Claude Opus 5 在這項評測中的最高分,而每項任務的成本降低 60%。

Agents’ Last Exam 官方評測圖

Agents’ Last Exam V1 中,AI 代理接受長時間跨度、具經濟價值的任務評測。任務涵蓋 55 個子產業,以及多數主要的電腦上專業工作領域。

事實準確性

答案是否有用,取決於事實是否正確;我們持續提升模型的事實可靠性。在我們的內部事實準確性評測中,測試題目來自經去識別化處理、且使用者曾指出模型出錯的真實對話。GPT‑6 Sol 的錯誤約為上一代的一半,以低得多的成本接近 Astra 的可靠程度。GPT‑6 Luna 也有顯著改善:在較高思考檔位下,它以約百分之一的成本,達到與 GPT‑5.6 Sol 相當的表現。

困難提示中的事實錯誤率官方評測圖

此處使用經去識別化處理的 ChatGPT 對話評測事實準確性;使用者曾指出舊模型在這些對話中犯下事實錯誤。這些容易引發錯誤的對話不代表一般使用情況,日常使用中的事實錯誤較少。分數未控制回答長度;不過,我們對回答詳略的測試顯示,錯誤率與回答長度幾乎沒有關聯。

程式開發

今年,程式開發代理開始承接比以往更複雜、範圍更廣、時間更長的任務。在 OpenAI 內部,我們的使用量呈指數成長。若以 API 價格估算,每日 token 用量的價值,在研究員中位數已超過 600 美元,在第 90 百分位的研究員則超過 7,000 美元(參見《研究加速:從 OpenAI 內部觀察》)。隨著程式開發代理承擔更長、更困難的任務,持續使用的成本也變得更加重要。GPT‑6 Sol 與 Luna 結合強大的程式開發能力和更低的 API 價格,讓開發者有更多迭代空間,也讓團隊更有信心把更具挑戰性的工作交給 Codex。

在評測程式開發代理能否產出可合併至實際程式庫的修改的 FrontierCode 中,GPT‑6 Sol 相較 GPT‑5.6 Sol 大幅進步,並能以低得多的成本達到 Claude Fable 5.1 xhigh 的水準。

FrontierCode 官方評測圖

FrontierCode 1.1 Main 中,AI 代理所寫的程式碼不只按正確性評分,還會評估是否適合合併,例如測試品質、修改範圍是否恰當、程式風格,以及是否符合程式庫規範。

在測試實際程式庫中複雜軟體工程任務的 DeepSWE v1.1 中,GPT‑6 Sol 使用 max 檔位取得 68.8%;與 Claude Fable 5 在這項評測中的最高成績——xhigh 檔位的 69.9%——僅差 1.1 個百分點,但每項任務的成本約低 80%。

GPT‑6 Luna 使用 max 檔位取得 66.6%,與 Claude Opus 5 和 Fable 5 使用 medium 檔位時相當。在這些比較中,Luna 的每項任務成本分別比 Opus 5 低 93%、比 Fable 5 低 96%。

DeepSWE 官方評測圖

DeepSWE 1.1 中,AI 代理解決原創、需要長時間完成的軟體工程任務。

電腦操作

GPT‑6 Astra 仍是全球電腦操作能力最強的模型;GPT‑6 Sol 與 Luna 則比各自的上一代更具成本效益。在 OSWorld 2.0 offline 中,使用 xhigh 檔位的 GPT‑6 Sol 與使用 medium 檔位的 Claude Opus 5 分數相近,分別為 60.5% 與 60.3%,而每項任務的成本約低 80%。使用 max 檔位的 GPT‑6 Luna,則能以十分之一的成本超過使用 medium 檔位的 GPT‑5.6 Sol。

OSWorld 2.0 離線資料集官方評測圖

OSWorld 2.0 中,AI 代理嘗試完成涵蓋日常及專業工作的長時間電腦操作流程。此處公布的是 v2026.08.08 版本離線資料集的部分獎勵分數。

協作風格

我們也將 GPT‑6 Astra 改善後的溝通風格帶到 Sol 和 Luna;我們認為,在技術與程式開發對話中,這項改變會特別明顯。回答會更清楚、術語更少、奇怪的措辭更少、價值不高的細節更少,而且整體略為精簡,同時保留實質內容。

提示詞

網站看起來很清爽!可以改成 Bento Box 設計風格,並在右上角加上一個用來切換頁面的滑動選單嗎?你可能需要深入研究 React……

GPT-5.6 Sol

當然可以。我可以做出 Bento Box 的感覺,並加入右上角可滑動的頁面切換器,而不需要引入 React——這個互動很小,維持現有架構就能兼顧速度和流暢度。我現在會把四個頁面都改成這套設計。


完成了,請打開已上線的網站。

四個頁面現在都有繽紛的 Bento Box 版型,右上角也有可在 Home/Play/Place/Taste 之間滑動的切換器。不需要 React;原生頁面轉場就能保持輕快流暢。

內建圖片工具製作了食物插畫。提示詞:「一幅充滿活力、結合水粉與墨線的編輯插畫,以餃子和辣麵為主題,帶有繚繞熱氣與香料色彩;不含文字或標誌。」

GPT-6 Sol

我會把頁面重新編排成 Bento 格狀版型,並讓右上角的連結成為可滑動的頁面切換器。我會沿用現有網站,並在調整架構前確認這個互動是否需要 React。


更新後的網站已上線。現在每個頁面都有活潑的 Bento 版型,右上角的切換器可在各區塊間滑動。我已在桌面與窄螢幕手機上檢查,包括瀏覽器返回操作。現有網站無須引入 React 即可完成。

雖然風格帶有主觀性,我們在這個例子中較喜歡 GPT‑6 Sol 的回答。它較不會急著下結論,較少重複對提問者可能已很明顯的細節(例如網站有四個頁面),使用較少模糊措辭(例如「Bento 的感覺」或「以這套設計重新打造」),更清楚說明自己做了哪些檢查,也不會無必要地分享圖片工具提示詞等實作細節。

改善代理與長對話的快取

除了降低 token 價格,我們也協助使用 GPT‑6 開發產品的開發者,在應用程式重複使用的上下文上節省更多成本。我們改善了 GPT‑6 的提示詞快取,預設就能達到更高的快取命中率,幫助代理重複使用更多上下文、更快回應,並讓已快取輸入 token 的讀取享有 90% 折扣

開發者也有更多方式衡量與改善快取效果:

  • 監控與診斷。 提示詞快取儀表板可顯示快取了多少輸入內容,以及這個數字如何隨時間變化。診斷工具則有助於找出未能命中快取的原因與修正方式。
  • 調整思考檔位與工具可用性,而不破壞快取。 遇到較難的任務時,可以提高思考檔位;後續任務較簡單時則可降低檔位。代理需求改變時,也能啟用或停用工具。這兩項控制現在都能保留先前上下文,供快取重複使用。
  • 最佳化快取前綴的範圍。 明確設定的分界點可讓開發者指定快取的提示詞前綴在哪裡結束,更精確地控制上下文重複使用,並可能改善效能。

GitHub 表示,過去幾個月中,這些改善讓 Copilot 在數十億次對 OpenAI 模型的請求中,需要重新處理的提示詞 token 比例降低了超過 50%,從而加快回應速度。

持續改善對齊表現

GPT‑6 Sol 與 Luna 延續了 Astra 的對齊工作;Astra 是我們迄今對齊表現最好的模型。在我們的對齊評測中,Sol 和 Luna 都比各自的 GPT‑5.6 版本進步,包括在描述自身程式開發工作時,誤導性說法的發生率更低。

以下評測刻意使用具有挑戰性的情境,不代表一般使用情況下的失敗率。完整結果請參閱系統卡

程式開發中的欺瞞

程式開發中的欺瞞評測圖

在我們的內部程式開發欺瞞評測中,AI 代理會收到刻意挑選、容易誘發不誠實行為的任務。一般使用情況下,欺瞞行為要少得多。欺瞞率是指被偵測出任何欺瞞行為的回答所占比例;思考檔位設定為 max。

搜尋工具故障未揭露

搜尋工具故障未揭露評測圖

規避審查

規避審查評測圖

規避警告

規避警告評測圖

未經授權的互動

未經授權互動評測圖

使用方式與供應情況

GPT‑6 Sol 與 GPT‑6 Luna 即日起在 ChatGPT Work 和 Codex 提供給所有 Plus、Pro、Business、Enterprise 與 Edu 使用者。Free 與 Go 使用者可在桌面應用程式使用 GPT‑6 Luna。這些模型目前尚未在 Chat 中提供。在 OpenAI API 中,模型名稱分別為 gpt-6-solgpt-6-luna

為了維持對所有人的服務穩定,我們計畫在今天逐步將這些模型推向 ChatGPT 使用者。如果你在 ChatGPT Work 或 Codex 中尚未看到新模型,請稍後再試。


GPT 模型的評測在我們的研究環境或透過 API 進行;系統提示詞、可用工具等條件可能與正式版 ChatGPT 不同,因此輸出也可能略有差異。競品模型的評測成績取自公開報告。當 Claude Fable 5.1 的分數無法取得時,使用 Claude Fable 5 的分數。