arrow_back 記事一覧
2026年8月26日 · 5 分で読了 · meshcode

ox-alphaベンチマーク:数字が語ること

話題の「DeepSWEで80% — GPT-5.6 Solを撃破」は10タスクのサンプルでした。113タスクのフルランは58.4%。全数字とツール呼び出し失敗の変数、エージェント作業の観点での意味をまとめます。

要約:ox-alphaはGPT-5.6 Solに勝っていません。話題の80%は、本人が高分散と警告した10タスクのサンプルから出たものです。113タスクのフルランは58.4%(95% CI 49.2〜67.1%)、より大きな評価は62.8〜63%に収束します — DeepSeek V4 Proの領域で、フロンティア先頭の数段下です。 それでもトークンあたり$0なら、現時点でコーディングモデルの最高コスパです。全体像を整理します。

80%のヘッドラインが生まれた経緯

ox-alphaがOpenRouterに現れた数日後、@davis7を名乗る開発者がDeepSWE比較を投稿しました。ox-alphaが80%超、対してClaude Fable 5が65%GPT-5.6-solが52%。スクリーンショットは拡散し、「ステルスモデルがフロンティアを破った」という物語が勝手に書き上がりました。

当の@davis7自身、投稿の中で10タスクのサンプルは分散が大きいと警告していました。フルランはその警告が正しかったことを証明しました。

すでに契約しているClaude・Codexをそのまま接続。あとは数分の一のコストで動くワーカーに任せます。

meshcode をダウンロード →

フルランが測定したもの

113のDeepSWEタスク全てを通しで回した独立測定(MatchaOnMuffins/oxalpha)の結果:

  • 解決率58.4%(66/113)、95% CI [49.2%, 67.1%]
  • タスクの80%でfail-to-passテストの90%以上を通過 — 解けるタスクは本当に解いている
  • ベンチマーク損失の9.7%はツール呼び出しフォーマットの失敗 — 推論の失敗ではない

より大きなサードパーティ評価は約62.8〜63%に収束します。誠実な読み方:ox-alphaは60台前半に位置し、信頼区間の端には不確実性が残ります。

リーダーボードでの位置

モデル(設定) DeepSWE
Claude Opus 5, max reasoning 74% ±4%
GPT-5.6 Sol, max reasoning 73% ±3%
Claude Fable 5 70% ±4%
GLM-5.3 / Kimi K3 69%
DeepSeek V4 Pro 63% ±6%
Ox Alpha(サードパーティラン) 約58〜63%

この表の下には注意が2つ付くべきです。第一に、ox-alphaには公式リーダーボードの項目がありません — 全ての数字は他人のハーネスによるサードパーティ測定です。第二に、初期の「GPT-5.6-solと同水準」比較はmid-tier Sol設定基準であり、max reasoningのSolは今も約10ポイント上です。

最も興味深い数字はスコアではない

**ツール呼び出しフォーマット失敗で失われた9.7%**です。モデルの推論は正しかったのに、ツール呼び出しが不正な形で出力され、ハーネスが失敗と判定したタスクです。含意は2つ:

  1. 天井はスコアより高い。 10ポイント近い余裕は知性ではなく配管の問題で、配管は(モデル更新とハーネス修正の両面で)速く改善します。
  2. ハーネスがスコアを変える。 実際のツール呼び出しをストリーミングし、検証し、きれいにリトライするコーディングエージェントは、素のAPIループが落とすポイントを回収します。エージェント環境が存在する理由がまさにこれです — モデルの「本当の意図」を推測する代わりに、全ツール呼び出しがリアルタイムで流れるのを見られるのですから。

実務家向けの結論

  • 「GPT-5.6 Solに勝つ」 — 違います。 まだ80%を繰り返す人は10タスクのサンプルを引用しています。
  • 「$0でDeepSeek-V4-Pro級」 — そうです。 DeepSWEのポイントあたり価格としては、今日手に入る最安のコーディングモデルです。
  • 最も合う用途はボリュームのエージェント作業:長いセッション、並列ペイン、fan-outサブエージェント — コストが支配し、100万コンテキストの60台前半モデルで十分なワークロード。

ミステリー側の話は、ox-alphaを作ったのは誰かで正体の手がかりを強度順に整理しています。実際に動かす方法 — ペイン4つ並列、トークンあたり$0 — は MeshCodeのox-alpha で。


ベンチマーク数値は2026年8月26日時点のサードパーティ測定であり、公式リーダーボードの項目ではありません。ハーネスやモデルバージョンにより変わり得ます。Ox AlphaはOpenRouter経由で匿名配布されており、MeshCodeはその開発者と提携していません。

ox-alphaベンチマークDeepSWEGPT-5.6コーディングエージェントOpenRouterステルスモデル