GPT-6 Astra 是 OpenAI 於 2026 年 9 月 3 日發布的新一代模型,官方系統卡定位涵蓋複雜推理、程式設計、電腦操作、研究與文件工作。99.9% 指 Astra 在 ARC-AGI-3 的分數,描述的是一套特定互動測試的完成與效率表現,不能直接延伸成 AI 已全面超越人類。想先了解企業如何比較模型的任務、資料與部署條件,可讀AI模型選型評估成本、資料與部署的方法

使用者對話被整理成測試資料,象徵模型評測需要連結真實情境

99.9% 到底測了什麼

ARC Prize 將 ARC-AGI-3 定義為互動式推理基準,測試者不會先拿到遊戲規則,必須在 135 個抽象環境中探索、推測規則,再採取行動。ARC Prize 官方人類測試說明把它和靜態題庫區分開來;OpenAI 發布頁則引述 ARC Prize Foundation 表示,Astra 在 96% 的關卡超過人類行動效率基準。這些資訊支持「Astra很會解這類互動任務」,範圍仍落在 ARC-AGI-3 的測試設計內。

長條圖比較GPT-6 Astra在ARC-AGI-3、FrontierMath Tier 4、GPQA Diamond與Terminal-Bench 4.0的官方公開分數

ARC-AGI-3 的分數怎麼算

ARC-AGI-3 採用相對人類行動效率(RHAE)計分。每個關卡先看 AI 是否完成,再比較 AI 使用的行動次數與首次接觸該環境的人類基準,單關分數為「人類基準行動數除以 AI 行動數」的平方,最高封頂為人類基準的 1.15 倍;遊戲分數再按關卡順序加權,最後取全部遊戲平均。ARC Prize 的評分規格也說明,拿到 100% 必須完成所有遊戲與關卡,且效率達到人類基準。99.9% 因此接近這套量尺的上限,不能當成通用智力百分比。

電腦螢幕顯示程式碼與形式化驗證內容,象徵推理結果需要依規則檢查

為什麼分數可能快速接近滿分

原因要拆成兩部分看。模型本身可能在探索、規則歸納與多步操作上進步,2026 年《International AI Safety Report》也指出,推理系統能在回答前投入更多推理運算;同時,ARC-AGI-3 的任務範圍與計分方式已經明確,模型只要在這些環境中完成關卡並接近人類行動效率,總分就會往 100% 靠近。OpenAI 的發布頁沒有完整交代這次測試的提示內容、工具設定與推理資源,因此單靠 99.9% 無法拆出每一項因素各自貢獻多少。

使用者在平板與電腦前比較人工智慧模型的資料與程式輸出

高分和實際應用能力有多遠

2026 年《International AI Safety Report》指出,基準測試常在受控環境中進行,模型可能因資料污染、題型捷徑或測試條件固定而拿到偏高分數;基準表現也不能可靠預測真實世界行為,實際效用要看使用者、流程與後果。OpenAI 先前提出的Deployment Simulation 真實對話重放方法,正好提供一個服務型判讀方向:模型換版前,拿自家真實任務回放,檢查新舊輸出在正確性、格式與錯誤成本上的差異。

工作者查看螢幕上的資料圖表,象徵評測結果仍需回到實際工作判讀

這個數字應該怎麼讀

可以把 99.9% 讀成「Astra 在 ARC-AGI-3 設計的互動推理任務中,已接近量尺上限」。讀者若要評估採用,還要補看語言與地區、長對話、工具使用、資料正確性、拒答、資安及人工複核等條件。基準分數適合做初篩,實際部署仍要用自己的任務建立驗收題庫;同一個模型在其他官方測試的分數也不同,PTT Stock板整理的OpenAI公開表中 FrontierMath Tier 4 為 97.6%、GPQA Diamond 為 96.0%、Terminal-Bench 4.0 為 57.9%。

手持紅色卡片的裁判意象,象徵評測結果需要檢查評分規則與裁判角色

常見問題

GPT-6 Astra 是什麼模型?
OpenAI 將 GPT-6 Astra 定位為處理複雜推理、程式設計、電腦操作、研究與文件工作的模型,API 文件列出 `gpt-6-astra` 這個模型名稱。它的推出方式與可用方案仍以OpenAI 官方模型文件更新內容為準。

彩色分子結構的近距離畫面,象徵人工智慧模型投入科學研究與專業工作的情境

GPT-6 Astra 的 99.9% 是不是代表推理能力 99.9 分?
不是。99.9% 是 ARC-AGI-3 的總分,混合關卡完成與相對人類行動效率;它沒有涵蓋所有語言理解、常識判斷、社交溝通與現實工作責任。

使用者拿著平板閱讀資訊並仔細查看內容,象徵讀者需要辨認評測分數的適用範圍

企業可以只看 ARC-AGI-3 分數選模型嗎?
不宜只看單一分數。企業應用自己的真實任務做回放,另測輸出正確性、延遲、成本、資料權限、錯誤處理與人工複核,再決定模型是否符合工作流程。

三名工作者檢視人工智慧任務輸出與圖表,象徵企業部署前進行人工驗收