arrow_back 全部文章
2026年8月26日 · 5 分钟阅读 · meshcode

ox-alpha 基准测试:数字真正说明了什么

疯传的"DeepSWE 80%、击败 GPT-5.6 Sol"出自 10 个任务的样本。113 个任务的完整跑分是 58.4%。本文整理所有数字、工具调用失败的变数,以及对智能体工作的实际意义。

简短回答:ox-alpha 没有击败 GPT-5.6 Sol。疯传的 80% 来自作者本人都提醒方差很大的 10 个任务样本。113 个任务的完整跑分为 58.4%(95% CI:49.2–67.1%),更大规模的评估收敛在 62.8–63%——DeepSeek V4 Pro 的地盘,距前沿头部还差几步。 不过按每 token $0 计算,它仍是当下性价比最高的编码模型。以下是全貌。

80% 标题是怎么来的

ox-alpha 登陆 OpenRouter 几天后,一位署名 @davis7 的开发者发布了 DeepSWE 对比:ox-alpha 超过 80%,对比 Claude Fable 5 的 65%GPT-5.6-sol 的 52%。截图四处传播,"隐身模型击败前沿"的叙事自动成形。

值得肯定的是,@davis7 本人在帖子中就警告10 个任务的样本方差巨大。完整跑分证明了这一警告的正确。

接入你已经付费的 Claude 或 Codex,其余交给成本只有零头的工作模型。

下载 meshcode →

完整跑分测出了什么

对全部 113 个 DeepSWE 任务的独立完整测试(MatchaOnMuffins/oxalpha)量出:

  • 解决率 58.4%(66/113),95% CI [49.2%, 67.1%]
  • 80% 的任务通过了 ≥90% 的 fail-to-pass 测试——能解的任务是真的解开了
  • 基准损失的 9.7% 来自工具调用格式失败——不是推理失败

更大规模的第三方评估收敛在 约 62.8–63%。诚实的解读:ox-alpha 位于 60 出头,置信区间两端仍有真实的不确定性。

在榜单上的位置

模型(配置) DeepSWE
Claude Opus 5,max reasoning 74% ±4%
GPT-5.6 Sol,max reasoning 73% ±3%
Claude Fable 5 70% ±4%
GLM-5.3 / Kimi K3 69%
DeepSeek V4 Pro 63% ±6%
Ox Alpha(第三方跑分) 约 58–63%

这张表底下应该挂两条注。第一,ox-alpha 没有官方榜单条目——所有数字都出自别人家的测试框架。第二,早期"与 GPT-5.6-sol 同级"的比较对象是中档 Sol 配置;max reasoning 的 Sol 仍高出约 10 个点。

最有意思的数字不是分数

因工具调用格式失败丢掉的 9.7%。那些任务里模型的推理是对的,但工具调用输出格式错误,被测试框架判为失败。两点含义:

  1. 天花板高于分数。 近 10 个点的余量是管道问题,不是智能问题——而管道问题在模型更新和框架修复两侧都会快速改善。
  2. 你的测试框架会改变分数。 一个真正流式展示工具调用、校验并干净重试的编码智能体,能拿回裸 API 循环丢掉的分。这正是完整智能体环境存在的意义——你不用猜模型"到底想干什么",而是看着每一次工具调用实时落地。

给实践者的结论

  • 不是"击败 GPT-5.6 Sol"。还在复读 80% 的人,引的是 10 个任务的样本。
  • "$0 的 DeepSeek-V4-Pro 级性能"——按 DeepSWE 每分成本算,它是今天能买到的最便宜的编码模型。
  • 最适合大批量智能体工作:长会话、并行窗格、扇出子智能体——那些成本主导、而 60 出头加百万上下文绰绰有余的负载。

想看悬疑那一面?ox-alpha 是谁做的按证据强度整理了全部身份线索。要实际跑起来——四个窗格并行、每 token $0——见 MeshCode 中的 ox-alpha


基准数字为截至 2026 年 8 月 26 日的第三方测量,非官方榜单条目,会随测试框架与模型版本变化。Ox Alpha 经 OpenRouter 匿名分发;MeshCode 与其开发者无关联。

ox-alpha基准测试DeepSWEGPT-5.6编码智能体OpenRouter隐身模型