很多人看到 GPT-6 Astra 控制真車完成路線,第一個問題會是:通用 AI 模型已經會開車了嗎?這項 DrivingBench 測試確實讓模型透過攝影機畫面和工具介面,直接下達車輛方向與速度指令;但它測的是一段低速、固定、由安全駕駛員監督的停車場錐筒路線。結果展示了模型在特定條件下執行實體任務的能力,不能直接推論它已能在公共道路安全行駛。

一、GPT-6 Astra完成的是哪一種駕駛測試?

DrivingBench讓四款通用視覺語言模型透過工具讀取Toyota Corolla的攝影機畫面,並控制車輛轉向與速度,在停車場完成固定錐筒路線。GPT-6 Astra在第二次嘗試抵達終點,是四款受測模型中唯一完成者。

研究團隊Aditya Ramabadran、Simon Mahns與Tobias Gessler在2026年9月公開的DrivingBench論文中,說明測試使用一輛2022年Toyota Corolla,改裝comma four裝置並運行修改版openpilot。模型透過三個工具觀察影像、設定行進指令或要求立即停車。車輛沿著127公尺的錐筒路線行駛,速度受到限制,測試場地沒有一般道路上的車流、行人和號誌互動。

每個受測模型最多有三次嘗試,且失敗後會收到固定的反思提示,再於同一段對話脈絡中繼續。Astra第一次走到約49%路程,偏離錐筒邊界後由現場操作員踩煞車;第二次調整轉彎附近的行進速度與觀察方式,完成全程。研究團隊記錄的其他模型結果則未超過路線的一半。

受測模型操作介面最佳路線進度測試結果
GPT-6 AstraCodex100%(第2次)完成錐筒路線
Claude Fable 5.1Claude Code45%(第3次)未完成
Grok 4.6Cursor11%(第2次)未完成
GPT-5.6 SolCodex6%(3次皆同)未完成

因此,「唯一完成」描述的是這四個模型與各自操作介面,在這套測試安排中的結果。研究把模型分別放進Codex、Claude Code與Cursor等原生操作環境;模型、系統提示、工具格式與介面延遲共同構成受測單位。這不是把所有通用模型、自駕系統或車廠產品放在同一場競賽後得出的總排名。

「四款模型中只有一款完成路線,GPT-6 Astra在第二次嘗試完成。」— DrivingBench研究團隊,2026

這項測試也和「AI自己在一般道路上載人或去得來速」不是同一件事。新聞報導提到研究人員曾讓模型控制車輛前往得來速的實驗情境;評估結果所依據的DrivingBench基準,則是停車場錐筒路線。理解測試邊界時,應優先看原始論文實際定義的場景、控制方式與計分規則。

二、這次測試展示了通用模型哪些能力?

測試呈現模型把影像觀察、工具操作、連續規劃與回饋修正串成一段實體任務的能力,也讓推論延遲直接影響車輛控制。這些能力仍只在指定路線與安全監督條件下得到觀察。

模型先透過攝影機影像辨識錐筒與車輛位置,再使用工具輸入方向和速度。這個流程不只是回答「下一步應該怎麼開」,而是要將判讀轉成會改變車輛狀態的指令。車輛行進後,模型再讀取新影像,判斷原本的方向和速度是否需要修正。從AI代理的角度看,關鍵在感知、規劃、工具呼叫和回饋形成了持續循環。

路線雖然固定,模型仍要估計錐筒邊界、選擇轉向幅度、控制移動距離,並在偏移時調整策略。Astra第一次嘗試失敗後,第二次採取較短的移動指令,在彎道附近放慢速度並增加觀察。論文記錄兩款模型在同一對話中跨嘗試有所進步,顯示先前操作與反思內容可能影響後續行動;但每款模型只有一次獨立對話測試,不能據此確認穩定的學習能力。

延遲也成為測試的一部分。模型思考期間,車輛可能仍在執行上一個速度與轉向命令。等新指令送達時,影像已經過時,車身位置也可能改變。研究團隊指出,模型反應間隔與是否能適時替換尚未結束的移動命令,都影響了路線表現。這表示在實體控制中,答案正確與否之外,何時取得資料、何時採取行動也會影響結果。

攝影機畫面傳給模型,模型下達方向與速度指令,車輛移動後再回傳新畫面的循環示意
車輛持續執行上一道命令時,模型看到的畫面可能已經過時,反應時機也會影響控制結果。

三、為什麼完成路線仍不能證明能上公共道路?

不能。固定路線的成功只說明特定模型與工具組合曾在特定條件下完成一項任務,無法證明它能處理公共道路的多變情境、低機率危險、感測器故障或長時間運作。

錐筒路線把道路邊界與行進方向簡化成可辨識的視覺線索。公共道路則會同時出現車輛、行人、腳踏車、施工區、交通號誌、遮蔽、天候變化與其他用路人的非預期行為。模型可能遇到沒有在測試中出現的畫面,也可能看到錯誤、模糊或過時的影像。測試中能修正一次偏移,不代表遇到突然切入的車輛時可以在足夠時間內辨識風險、採取安全動作並避免碰撞。

失敗時由誰接手同樣重要。DrivingBench每次失敗都由坐在駕駛座的操作員踩煞車,操作員也在行駛全程將腳置於煞車踏板上方。這是測試的安全安排,同時代表成功結果是在有人監督與可即時中止的條件下取得。若把模型接到實際車輛,系統要能辨認何時不確定、何時停止接受新命令、如何切入最低風險狀態,以及人類接管需要多少時間;單次抵達終點沒有回答這些問題。

測試數量也限制了解讀。研究團隊讓每個模型在同一段對話中最多嘗試三次,各次共享此前的影像、失誤與反思。這種安排適合研究模型能否在脈絡中調整策略,卻不能把三次嘗試當成三份互相獨立的樣本。一次完成也無法估算不同天候、起始角度、場地變化或硬體狀態下的成功率。研究團隊亦提醒,路線進度百分比未必等於一般意義上的「駕駛能力」。

「具身AI」指能透過感測器取得環境資訊,並以動作影響實體世界的人工智慧系統。車輛控制是高風險的具身任務,錯誤指令會造成碰撞或人身傷害。要從能力展示走向道路部署,需要有明確的操作設計範圍、失效偵測、冗餘安全措施、責任分工與反覆驗證;還要確定模型、控制器和車輛之間的軟硬體整合,在預期條件以外如何安全退場。

「所有設計決策都應經過測試、驗證與確認,並納入整車架構評估。」— 美國國家公路交通安全管理局(NHTSA),《自動駕駛系統:安全願景》

NHTSA的自動駕駛安全指引將系統安全、操作設計範圍、失效時的最低風險狀態、驗證方法、人機介面與網路安全等列為重要考量。這些項目說明,評估道路系統要看整體設計和運作條件,不能只拿一項任務的完成畫面作結論。這份指引是美國的非強制性參考文件,並不代表DrivingBench已接受法規審查或取得認證。

四、評估AI駕駛能力時要檢查哪些安全邊界?

先查任務範圍、模型與控制介面、樣本數和失敗處置,再看是否涵蓋多種道路情境、系統退場方法與人類監督責任。完成率只是證據的一部分,不能取代安全驗證。

NHTSA沿用SAE的駕駛自動化分級,以系統在駕駛任務中扮演的角色區分自動化程度。判讀相關宣稱時,要確認談的是單一功能、特定操作範圍,還是能在指定條件內完成完整動態駕駛任務的系統。DrivingBench讓模型產生方向與速度控制指令,卻沒有依此測試授予任何自動駕駛等級;測試名稱或實車畫面也不等同於車輛認證。

評估時可以逐項詢問:

  1. 任務與操作範圍是什麼?確認路線、速度、天候、道路類型、感測器和可控制的車輛功能,並辨認哪些情況未納入測試。
  2. 實際比較的是什麼?查清楚模型版本、提示、工具、操作介面、運算延遲和硬體配置,避免把整套系統的結果只歸功於模型本身。
  3. 測試是否可重複?查看獨立測試次數、起始條件、失敗紀錄、評分方法與公開資料,確認結果是否能由其他團隊重現。
  4. 出錯時如何保護用路人?檢查是否有人類監督、故障偵測、緊急停車、最低風險退場、資料記錄與事故責任安排。
  5. 驗證是否逐步擴大?確認團隊是否從模擬、封閉場地和多種測試案例逐步增加難度,再評估是否適合進入更複雜的環境。

NHTSA對自動駕駛系統測試框架的研究,也把模擬、測試場地和開放道路測試列為不同驗證方式,並要求先界定操作設計範圍與評估情境。不同階段提供的證據不一樣:模擬有利於大量測試罕見情境,封閉場地能控制風險並檢視車輛行為,道路測試則面對更豐富的真實互動。任何一階段的結果都需要配合測試目的解讀。

由模擬、封閉場地測試到有人監督的道路評估,並列出各階段需檢查的操作範圍、失效處置與人類監督
驗證要逐步走向更複雜的環境,每一階段都得確認操作範圍、失效處置與監督安排。

五、讀者可以如何解讀具身AI測試結果?

這是通用視覺語言模型在一項受控實車測試中完成路線的證據,也提供研究者檢視模型如何觀察、行動與修正的素材。它還不是公共道路安全性、商用自駕能力或法規認證的證明。

要讀懂類似消息,可以把證據分成三層。第一層是能力展示:模型在特定條件下做出動作,例如辨認影像並控制車輛。第二層是基準測試:用說明清楚、可重複的任務,比較不同模型或系統的表現。第三層是可部署系統:除了任務成功,還要交代適用範圍、預期失效、備援設計、更新管理、監督角色和長期安全資料。DrivingBench對第一、二層提供了初步資料,但沒有涵蓋第三層所需的完整證據。

研究價值不必靠誇大來成立。這項測試讓車輛控制不再只是模擬器中的規劃題,並具體呈現視覺誤判、延遲、工具介面與跨嘗試調整如何影響實體動作。對AI代理研究而言,這些是可以繼續驗證的問題;對一般讀者而言,最有用的判讀方式是追問測試條件、比較對象、失敗處理和獨立重現結果,再決定新聞標題中的「會開車」究竟指哪一種能力。

  • GPT-6 Astra在DrivingBench固定錐筒路線中第二次完成,是四款受測模型與介面組合中的唯一完成者。
  • 測試展示模型在特定條件下透過影像和工具控制真車,不足以證明具備公共道路部署能力。
  • 判讀類似成果時,應確認操作範圍、測試可重複性、失敗處置與人類監督安排。

常見問題

Q1:GPT-6 Astra已經證明能安全上路嗎?

沒有。研究只顯示它在有人監督的低速錐筒路線中,第二次嘗試完成測試。研究沒有評估一般公共道路所需的情境覆蓋、長期可靠性或部署安全性。

Q2:DrivingBench裡的「唯一完成」代表什麼?

它指GPT-6 Astra是論文中四款模型與各自操作介面組合裡,唯一完成該固定路線的系統。受測範圍不包括所有通用AI模型,也不等於與所有商用自駕系統比較。

Q3:模型在第二次嘗試成功,能算學會開車嗎?

不能這樣推論。第二次嘗試可以顯示模型利用同一對話中的先前結果調整策略,但每款模型只有一次獨立對話測試,還需要更多獨立、可重複的測試才能判斷穩定程度。