GPT-6 Astra 是 OpenAI 於 2026 年 9 月 3 日發布的新一代模型,官方系統卡定位涵蓋複雜推理、程式設計、電腦操作、研究與文件工作。99.9% 指 Astra 在 ARC-AGI-3 的分數,描述的是一套特定互動測試的完成與效率表現,不能直接延伸成 AI 已全面超越人類。想先了解企業如何比較模型的任務、資料與部署條件,可讀AI模型選型評估成本、資料與部署的方法。
99.9% 到底測了什麼
ARC Prize 將 ARC-AGI-3 定義為互動式推理基準,測試者不會先拿到遊戲規則,必須在 135 個抽象環境中探索、推測規則,再採取行動。ARC Prize 官方人類測試說明把它和靜態題庫區分開來;OpenAI 發布頁則引述 ARC Prize Foundation 表示,Astra 在 96% 的關卡超過人類行動效率基準。這些資訊支持「Astra很會解這類互動任務」,範圍仍落在 ARC-AGI-3 的測試設計內。
ARC-AGI-3 的分數怎麼算
ARC-AGI-3 採用相對人類行動效率(RHAE)計分。每個關卡先看 AI 是否完成,再比較 AI 使用的行動次數與首次接觸該環境的人類基準,單關分數為「人類基準行動數除以 AI 行動數」的平方,最高封頂為人類基準的 1.15 倍;遊戲分數再按關卡順序加權,最後取全部遊戲平均。ARC Prize 的評分規格也說明,拿到 100% 必須完成所有遊戲與關卡,且效率達到人類基準。99.9% 因此接近這套量尺的上限,不能當成通用智力百分比。
為什麼分數可能快速接近滿分
原因要拆成兩部分看。模型本身可能在探索、規則歸納與多步操作上進步,2026 年《International AI Safety Report》也指出,推理系統能在回答前投入更多推理運算;同時,ARC-AGI-3 的任務範圍與計分方式已經明確,模型只要在這些環境中完成關卡並接近人類行動效率,總分就會往 100% 靠近。OpenAI 的發布頁沒有完整交代這次測試的提示內容、工具設定與推理資源,因此單靠 99.9% 無法拆出每一項因素各自貢獻多少。
高分和實際應用能力有多遠
2026 年《International AI Safety Report》指出,基準測試常在受控環境中進行,模型可能因資料污染、題型捷徑或測試條件固定而拿到偏高分數;基準表現也不能可靠預測真實世界行為,實際效用要看使用者、流程與後果。OpenAI 先前提出的Deployment Simulation 真實對話重放方法,正好提供一個服務型判讀方向:模型換版前,拿自家真實任務回放,檢查新舊輸出在正確性、格式與錯誤成本上的差異。
這個數字應該怎麼讀
可以把 99.9% 讀成「Astra 在 ARC-AGI-3 設計的互動推理任務中,已接近量尺上限」。讀者若要評估採用,還要補看語言與地區、長對話、工具使用、資料正確性、拒答、資安及人工複核等條件。基準分數適合做初篩,實際部署仍要用自己的任務建立驗收題庫;同一個模型在其他官方測試的分數也不同,PTT Stock板整理的OpenAI公開表中 FrontierMath Tier 4 為 97.6%、GPQA Diamond 為 96.0%、Terminal-Bench 4.0 為 57.9%。
常見問題
GPT-6 Astra 是什麼模型?
OpenAI 將 GPT-6 Astra 定位為處理複雜推理、程式設計、電腦操作、研究與文件工作的模型,API 文件列出 `gpt-6-astra` 這個模型名稱。它的推出方式與可用方案仍以OpenAI 官方模型文件更新內容為準。
GPT-6 Astra 的 99.9% 是不是代表推理能力 99.9 分?
不是。99.9% 是 ARC-AGI-3 的總分,混合關卡完成與相對人類行動效率;它沒有涵蓋所有語言理解、常識判斷、社交溝通與現實工作責任。
企業可以只看 ARC-AGI-3 分數選模型嗎?
不宜只看單一分數。企業應用自己的真實任務做回放,另測輸出正確性、延遲、成本、資料權限、錯誤處理與人工複核,再決定模型是否符合工作流程。
參考來源
- GPT-6 Astra System Card (OpenAI Deployment Safety Hub) GPT-6 Astra發布日期、模型訓練與安全評估資料
- ARC-AGI-3 Scoring Methodology (ARC Prize) ARC-AGI-3的評分方法、人類基準與分數解讀
- Measuring Human Performance on ARC-AGI-3 (ARC Prize) ARC-AGI-3的互動環境與人類測試資料
- International AI Safety Report 2026 (International AI Safety Report) 基準測試與真實世界表現之間的評測落差
- GPT-6 Astra來了!AI推理得分99.9%、還能自己操作電腦做事 (PTT Stock板) 本批工單指定的討論線索,轉載OpenAI公開評測摘要