GPT-6.1 Sol 的標準 API token 單價約為 GPT-6 Astra 的五分之一,OpenAI 也表示它在部分程式開發、電腦操作與專業工作評測中接近 Astra。價格差距很醒目,但這不代表每個團隊都該立刻換模型。模型選型要先回答一個更實際的問題:完成同一項工作時,品質、速度、重試和人工覆核合計要花多少?
OpenAI 將 GPT-6.1 Sol 定位為 GPT-6 Sol 的升級版,並在 2026 年 9 月 29 日公布。以下會把廠商評測、API 單價和實際流程成本分開看,再整理一種小規模比較方法,讓團隊依自己的任務決定 Sol 與 Astra 的分工。
GPT-6.1 Sol 價格較低,先釐清比較的是哪種成本
以標準 API 的未快取輸入與輸出 token 單價計算,GPT-6.1 Sol 約為 Astra 的五分之一;快取輸入另有單價,不能把各種 token 價格混成同一個比例。
以官方定價頁的標準方案、短上下文價格計算,GPT-6.1 Sol 每百萬輸入 token 為 2 美元、輸出 token 為 10 美元;GPT-6 Astra 則為 10 美元與 50 美元。相同數量的未快取輸入與輸出 token,兩項單價都是五分之一。快取輸入另計,短上下文價格為 Sol 0.10 美元、Astra 1 美元;長上下文及其他處理模式的價格不同,估算前要先確認採用的方案與上下文級距。OpenAI API 定價頁
| 比較項目(標準方案、短上下文,每百萬 token) | GPT-6.1 Sol | GPT-6 Astra | 解讀 |
|---|---|---|---|
| 標準輸入 | US$2 | US$10 | Sol 為 Astra 的五分之一 |
| 快取輸入 | US$0.10 | US$1 | 兩者有各自快取價格 |
| 標準輸出 | US$10 | US$50 | Sol 為 Astra 的五分之一 |
| 預覽中的任務總成本 | 依實際流程記錄 | 依實際流程記錄 | 還要計入重試及人工時間 |
這些數字描述的是 API token 計價,並非 ChatGPT 訂閱費或每個任務的固定費用。使用 ChatGPT Work 或 Codex 時,模型可用性、方案額度及使用限制可能依帳戶與產品而不同;API 使用者則依實際 token 數和適用計價方式付費。評估預算時,先辨認自己使用的管道,避免拿 API 單價直接推算訂閱方案價值。
每項工作的費用還會受到輸入內容長度、輸出長度、推理設定、重複提供的背景資料、工具呼叫與失敗重跑影響。若答案要由員工逐一檢查,人工時間也應納入。較公平的單位是「一項符合驗收標準的完成工作」,而非「一次模型呼叫」或「一百萬 token」。
假設一項工作使用 2 萬個未快取輸入 token 和 2 千個輸出 token,按上述標準單價估算,Sol 的 token 費約為 0.06 美元,Astra 約為 0.30 美元。這只是輸入與輸出 token 數相同時的簡化算式,沒有納入工具、重試、快取、延遲方案或人工時間。若模型為了產出可用答案使用了不同數量的 token,帳單比例也會跟著改變。
- 標準輸入與輸出單價都約為 GPT-6 Astra 的五分之一,快取輸入另計。
- 模型總成本須按完成一項合格任務計算,包含重試及人工覆核。
- 使用前確認管道、方案額度與當下定價頁。
OpenAI 的評測顯示 Sol 接近 Astra,但結果有適用範圍
還沒有。OpenAI 公布的多項評測中,Sol 在部分程式、專業工作及電腦操作項目接近 Astra;這些結果只代表指定測試條件,不能直接代替每個團隊的實際驗收。
「接近」要連著測試項目一起讀。OpenAI 表示,在 DeepSWE v1.1 的複雜軟體工程任務中,GPT-6.1 Sol 的分數與 GPT-6 Astra 相同,任務成本約為其五分之一;在 OSWorld 2.0 的離線電腦操作評測中,Sol 的分數落後 Astra 2.1 個百分點,單項任務成本約為七分之一。GDP.pdf 評估模型依複雜 PDF 回答專業問題,也測到 Sol 接近 Astra 的表現。OpenAI 發布說明
這些測試各自回答有限的問題。軟體工程測試觀察模型能否處理既有程式碼庫中的長程任務;電腦操作測試檢查代理能否在應用程式裡完成多步驟操作;文件評測則測試模型能否讀懂含表格、圖表與細節的專業 PDF。它們不會自動回答模型能否符合某個團隊的程式規範、資料權限、表單欄位或交付格式。
成本欄也要留意「每任務」的定義。評測可能把一次任務中的多輪模型互動、推理設定或特定工具計入成本,並以特定方法統計完成結果。若把這類任務成本直接和標準 token 價格並列,讀者容易以為兩者是同一種計價單位。引用評測時應保留它自己的任務與成本口徑,再用本地流程資料另外估算。
官方也交代,評測使用研究環境或 API,和正式版 ChatGPT 可能因系統提示、可用工具與推理設定等因素產生不同輸出。部分基準還刻意挑選容易出錯的問題,因此不能直接代表一般使用者的錯誤率。閱讀 benchmark(基準測試)時,至少要一併看測試任務、設定、分數口徑和成本計算方式。
「研究環境或 API 的評測輸出,可能因系統提示、可用工具及推理力度等差異,而與正式版 ChatGPT 稍有不同。」— OpenAI,GPT-6.1 Sol 發布說明(譯)
對團隊來說,評測的用途是縮小試用範圍,而非替實際導入背書。若工作需要操作內部網站,公開電腦操作測試未必涵蓋登入流程、權限控管或系統偶發狀況;若任務涉及公司文件,公開 PDF 測試也不會替組織驗證資料處理和保密流程。官方數字提供比較起點,團隊仍需用自己的任務測量差異。
哪些任務可以先交給 Sol,哪些仍應保留 Astra?
先從重複、可驗收、錯誤容易發現且影響有限的任務測起;遇到需求含糊、推理層次深或錯誤代價高的工作,先保留升級至 Astra 或人工覆核的路徑。
模型選型要先定義失敗的代價。若模型把內部文件摘要漏掉一個次要段落,工作人員可在送出前核對,錯誤較容易攔截;若模型直接修改正式程式、送出付款資料或操作客戶帳戶,錯誤可能外溢至系統或使用者。這些任務的驗收方式、權限設計和回復機制不能因模型單價下降而省略。
| 任務特徵 | 可先評估 Sol 的情況 | 宜保留 Astra 或人工關卡的情況 |
|---|---|---|
| 規則清楚 | 格式轉換、分類、固定欄位摘要,有明確範例 | 需求互相衝突,需先釐清目標或推論隱含條件 |
| 錯誤後果 | 結果有第二人檢查,修正成本低 | 涉及正式環境、法務承諾、財務或安全影響 |
| 成功判定 | 可用測試、欄位檢查或標準答案核對 | 品質依賴專業判斷,難以用單一門檻判分 |
| 工作流程 | 可在隔離環境試跑,保留人工核准 | 模型可直接對外發送、付款或改動正式資料 |

使用 Astra 也不表示可以取消人工責任。當輸出牽涉重大決策、敏感資料或難以復原的操作,工作流程應界定誰批准、模型能讀寫哪些資料、何時停止並轉交人員。模型本身的評測分數無法替代存取控制或審核紀錄。
「GPT-6 Astra 在受測模型中仍取得最高分(68.1%),最困難的科學研究任務應使用 Astra。」— OpenAI,GPT-6.1 Sol 發布說明(譯)
這句話反映的是分層使用的思路:一般或可驗收的工作可評估較低成本模型,難題與高影響工作則留有更強模型或人工接手的空間。實際要不要升級,應由團隊設定可量測條件,例如關鍵欄位錯誤、測試未通過、同一任務重試超過限制,或模型表明資訊不足。條件先訂好,才不會每次遇到失敗都臨時決定。
用同一批真實任務比較能力、延遲與總成本
讓兩個模型處理相同任務、相同資料與相同工具條件,再以同一套品質門檻評分;同時記錄完成時間、重試次數、token 費用及人工處理時間。
試行前先挑一批近期實際工作,涵蓋常見情況,也包括容易出錯的邊界案例。每項任務都要有預先定義的完成條件,例如程式是否通過既有測試、摘要是否涵蓋指定資訊、資料欄位是否正確填入。若只挑模型容易答對的案例,結果無法代表日常分布;若兩邊提示、工具或可用資料不同,差異也不一定來自模型本身。
延遲應記錄使用者真正等待的時間,包含排隊、工具執行與必要重試。若採非同步批次作業,使用者等待時間與服務端執行時間可能是兩個不同指標。
成本則按同一項工作合計 API 輸入、輸出、快取或工具費用,以及人工檢查與返工時間。若任務一次沒有成功,下一次嘗試產生的費用也要加回同一筆任務帳。
- 選出可代表日常工作、且能安全重跑的任務樣本,先寫下合格標準與不可接受的錯誤。
- 固定輸入資料、提示、工具、權限和推理設定,分別讓 Sol 與 Astra 完成同一批任務。
- 逐項記錄是否合格、總耗時、重試次數、API 費用與人工修改時間,保留失敗原因。
- 比較合格任務的單位成本與完成率;若品質落差超出門檻,維持 Astra 或加入人工覆核,再重新測試。
這個方法同時看「成功完成」和「花了多少」。例如 Sol 的 token 花費較低,但若特定任務常需重試兩次、每次都要人員大幅修改,整體成本優勢可能縮小;反過來,如果它在大量規則明確的工作上維持品質,節省的費用才有機會累積。這需要實測數據,不能只由標價推定。
比較時可將通過率和成本放在一起讀:先排除未達品質門檻的輸出,再計算合格任務的平均或中位成本;另外列出耗時較長的個案與失敗原因。平均值能呈現整體負擔,中位數則較不受少數極端任務影響。若兩個模型的任務完成方式不同,也要記下工具回合和人工修改幅度,避免把「看起來完成」與「達到交付條件」算成同一結果。

測試資料也要符合真實使用中的隱私和授權要求。若不能把客戶資料送入特定服務,就先用合成資料或已核准的測試資料,並確認產品方案的資料處理條件。這不是模型能力指標,卻是工作能否安全上線的必要前提。
從小範圍分流開始,依結果調整模型配置
將結果按任務類型分組,只有在品質門檻、完成時間與總成本都符合需求時才擴大 Sol 的使用;為不合格案例預設升級 Astra 或人工覆核的條件。
全體平均值容易掩蓋差異。可以依任務長度、是否使用工具、輸入資料品質、錯誤嚴重度或工作部門分組,觀察 Sol 的表現在哪些情境穩定,哪些情境仍需 Astra。若某一組樣本少,先延長觀察或增加案例,不要因少數順利結果就擴大部署。
OpenAI 的模型選擇指南將 GPT-6.1 Sol 描述為適合兼顧品質、時間與成本的複雜任務,並建議把它與 Astra 放在相同任務中比較;指南也提醒,可用性、工具、推理設定與使用限制會因產品和模型版本而異。OpenAI 模型選擇指南 因此,透過 API、Codex 或 ChatGPT Work 使用時,應各自查看當下可用模型和方案條件。官方發布頁指出,GPT-6.1 Sol 可透過 API 使用,也列出 ChatGPT Work 與 Codex 的推出安排;介面尚未顯示模型時,不能直接推論帳戶永久無法使用。
結語:先定義驗收,再決定是否移交
先確認哪種任務能被可靠驗收,再比較完成該任務的品質、延遲與總成本。單價差距提供試用理由,實際分工仍取決於工作流程中的結果。
對多數團隊,合理起點是選一批錯誤影響有限、結果可檢查的工作,讓 Sol 與 Astra 在同一條件下試跑。保留失敗升級、人工覆核與停止條件,再依實測結果擴大或縮小分流範圍。價格或模型版本日後若有變動,也應重新核對官方價格和可用性,避免沿用過期假設。
如果正在規劃 AI 系統導入,可以先整理一份任務清單,標出每項工作的驗收方式、出錯影響和人工接手點,再開始測模型。對 AI 系統設計與落地有興趣,也可從這些流程條件交流討論。
常見問題
Q1:GPT-6.1 Sol 的 API 價格真的是 GPT-6 Astra 的五分之一嗎?
依 OpenAI 公布的標準 API 未快取輸入與輸出單價,Sol 每百萬 token 為 2/10 美元,Astra 為 10/50 美元,兩種 token 單價分別都是五分之一。快取輸入、不同處理模式與實際工作量要另看定價頁。
Q2:GPT-6.1 Sol 是否已全面追上 GPT-6 Astra?
不能這樣概括。OpenAI 表示 Sol 在部分程式開發、電腦操作與專業工作評測中接近 Astra,但不同評測的分數和成本比例不同,官方也說明研究環境與正式產品輸出可能有差異。
Q3:沒有 API 開發團隊,可以使用 GPT-6.1 Sol 嗎?
OpenAI 發布時列出 ChatGPT Work 與 Codex 等使用管道,是否看得到模型仍依方案、帳戶和產品推出進度而定。使用前請查閱官方當下的模型清單與方案說明。
Q4:應該用什麼資料估算每項 AI 工作的成本?
至少記錄模型 token 費用、工具費、重試次數、從開始到完成的時間,以及人工檢查與返工時間。另要追蹤是否符合預先設定的品質標準,才知道低單價是否帶來可用的總成本差異。