ox-alpha 基準測試:數字真正說明了什麼
瘋傳的「DeepSWE 80%、擊敗 GPT-5.6 Sol」出自 10 個任務的樣本。113 個任務的完整跑分是 58.4%。本文整理所有數字、工具呼叫失敗的變數,以及對代理人工作的實際意義。
簡短回答:ox-alpha 沒有擊敗 GPT-5.6 Sol。瘋傳的 80% 來自作者本人都提醒變異數很大的 10 個任務樣本。113 個任務的完整跑分為 58.4%(95% CI:49.2–67.1%),更大規模的評估收斂在 62.8–63%——DeepSeek V4 Pro 的地盤,距前沿頭部還差幾步。 不過按每 token $0 計算,它仍是當下 CP 值最高的編碼模型。以下是全貌。
80% 標題是怎麼來的
ox-alpha 登陸 OpenRouter 幾天後,一位署名 @davis7 的開發者發布了 DeepSWE 比較:ox-alpha 超過 80%,對比 Claude Fable 5 的 65% 和 GPT-5.6-sol 的 52%。截圖四處流傳,「隱身模型擊敗前沿」的敘事自動成形。
值得肯定的是,@davis7 本人在貼文中就警告10 個任務的樣本變異數巨大。完整跑分證明了這一警告的正確。
連接你已經付費的 Claude 或 Codex,其餘交給成本只有零頭的工作模型。
下載 meshcode →完整跑分測出了什麼
對全部 113 個 DeepSWE 任務的獨立完整測試(MatchaOnMuffins/oxalpha)量出:
- 解決率 58.4%(66/113),95% CI [49.2%, 67.1%]
- 80% 的任務通過了 ≥90% 的 fail-to-pass 測試——能解的任務是真的解開了
- 基準損失的 9.7% 來自工具呼叫格式失敗——不是推理失敗
更大規模的第三方評估收斂在約 62.8–63%。誠實的解讀:ox-alpha 位於 60 出頭,信賴區間兩端仍有真實的不確定性。
在榜單上的位置
| 模型(配置) | DeepSWE |
|---|---|
| Claude Opus 5,max reasoning | 74% ±4% |
| GPT-5.6 Sol,max reasoning | 73% ±3% |
| Claude Fable 5 | 70% ±4% |
| GLM-5.3 / Kimi K3 | 69% |
| DeepSeek V4 Pro | 63% ±6% |
| Ox Alpha(第三方跑分) | 約 58–63% |
這張表底下應該掛兩條注。第一,ox-alpha 沒有官方榜單項目——所有數字都出自別人家的測試框架。第二,早期「與 GPT-5.6-sol 同級」的比較對象是中階 Sol 配置;max reasoning 的 Sol 仍高出約 10 個點。
最有意思的數字不是分數
是因工具呼叫格式失敗丟掉的 9.7%。那些任務裡模型的推理是對的,但工具呼叫輸出格式錯誤,被測試框架判為失敗。兩點含義:
- 天花板高於分數。 近 10 個點的餘裕是管線問題,不是智慧問題——而管線問題在模型更新和框架修復兩側都會快速改善。
- 你的測試框架會改變分數。 一個真正串流顯示工具呼叫、驗證並乾淨重試的編碼代理人,能拿回裸 API 迴圈丟掉的分。這正是完整代理人環境存在的意義——你不用猜模型「到底想做什麼」,而是看著每一次工具呼叫即時落地。
給實務工作者的結論
- 不是「擊敗 GPT-5.6 Sol」。還在複讀 80% 的人,引的是 10 個任務的樣本。
- 是「$0 的 DeepSeek-V4-Pro 級性能」——按 DeepSWE 每分成本算,它是今天能買到的最便宜的編碼模型。
- 最適合大批量代理人工作:長會話、平行窗格、扇出子代理人——那些成本主導、而 60 出頭加百萬上下文綽綽有餘的負載。
想看懸疑那一面?ox-alpha 是誰做的按證據強度整理了全部身分線索。要實際跑起來——四個窗格平行、每 token $0——見 MeshCode 中的 ox-alpha。
基準數字為截至 2026 年 8 月 26 日的第三方測量,非官方榜單項目,會隨測試框架與模型版本變化。Ox Alpha 經 OpenRouter 匿名分發;MeshCode 與其開發者無關聯。