通用模型臨場上陣,沙盒提示詞解鎖駕駛權限

新創公司 Axiom 的三名工程師進行了一項大膽實驗,將通用大型語言模型直接串接至 Toyota Corolla 的攝影機與轉向系統,目標是開車到舊金山灣區的 In-N-Out 得來速取餐。起初,包括 Grok 與 Anthropic 最新模型在內的測試對象均拒絕操控實體車輛,直到工程師將情境標記為「沙盒」後,模型才願意接管。最終,只有 OpenAI 的 GPT-6 Astra 成功完成任務,雖然行駛速度緩慢,但全程無需人類駕駛介入,僅由安全員腳懸煞車備援。

DrivingBench 數據揭曉,Astra 獨佔鰲頭

為了量化駕駛能力,團隊建立了「DrivingBench」測試,在停車場以三角錐圍出路線。結果顯示,GPT-6 Astra 是唯一跑完全程的模型,第二次嘗試以 5 分 22 秒完成 134.7 公尺,單次消耗約 660 萬個 Token,成本約 7.74 至 9.75 美元。相比之下,Anthropic 的 Claude Fable 5.1 僅完成 45%,xAI 的 Grok 只有 11%,而 OpenAI 自家的 GPT-5.6 Sol 也因無法正確判讀三角錐空間配置而失敗。多數失敗原因歸咎於模型對實體空間的誤判。

實體推理成新戰場,駕駛或是多模態副產品

工程師分析指出,各大 AI 公司正提升空間推理能力,駕駛表現可能是擴大模型多模態能力後的「湧現能力」,而非專門訓練結果。最新模型展現出根據錯誤即時修正的能力,能逐漸適應車輛控制。然而,讓通用模型操控重達兩噸的車輛仍屬高風險。目前「實體推理」仍是 AI 業者的未攻克領域,專家認為這是家用機器人落地的關鍵,未來如何讓 AI 更精準理解真實物理場景,將是技術競爭的核心。