arrow_back Alle Beiträge
26. August 2026 · 5 Min. Lesezeit · meshcode

ox-alpha-Benchmarks erklärt: was die Zahlen wirklich sagen

Das virale „80 % in DeepSWE – schlägt GPT-5.6 Sol" stammte aus einer 10-Aufgaben-Stichprobe. Der komplette 113-Aufgaben-Lauf ergab 58,4 %. Alle Zahlen, die Variable der fehlgeschlagenen Tool-Calls und was das für agentische Arbeit bedeutet.

Kurzantwort: Nein, ox-alpha schlägt nicht GPT-5.6 Sol. Die viralen 80 % stammen aus einer 10-Aufgaben-Stichprobe, deren hohe Varianz der Autor selbst warnte. Der komplette Lauf über alle 113 Aufgaben ergab 58,4 % (95-%-KI: 49,2–67,1 %), größere Evaluierungen konvergieren bei 62,8–63 % — DeepSeek-V4-Pro-Territorium, mehrere Stufen unter der Frontier-Spitze. Pro Token zu $0 bleibt es trotzdem der beste Wert unter den Coding-Modellen heute. Hier das Gesamtbild.

Wie die 80-%-Schlagzeile entstand

Wenige Tage nach dem Auftauchen von ox-alpha auf OpenRouter veröffentlichte ein Entwickler namens @davis7 einen DeepSWE-Vergleich: über 80 % für ox-alpha, gegen 65 % für Claude Fable 5 und 52 % für GPT-5.6-sol. Die Screenshots machten die Runde, und die Erzählung „Stealth-Modell schlägt die Frontier" schrieb sich von selbst.

Man muss ihm lassen: @davis7 warnte im selben Thread, dass eine 10-Aufgaben-Stichprobe eine riesige Varianz hat. Der komplette Lauf bestätigte die Warnung.

Verbinde das Claude oder Codex, das du schon bezahlst — den Rest übernehmen Worker, die einen Bruchteil kosten.

meshcode herunterladen →

Was der komplette Lauf gemessen hat

Eine unabhängige Messung aller 113 DeepSWE-Aufgaben (MatchaOnMuffins/oxalpha) ergab:

  • Lösungsrate 58,4 % (66/113), 95-%-KI [49,2 %, 67,1 %]
  • In 80 % der Aufgaben wurden ≥90 % der Fail-to-Pass-Tests bestanden — wenn es löst, dann wirklich
  • 9,7 % des Benchmark-Verlusts waren Formatfehler bei Tool-Calls — keine Denkfehler

Größere unabhängige Evaluierungen konvergieren bei rund 62,8–63 %. Ehrliche Lesart: ox-alpha liegt in den frühen 60ern, mit echter Unsicherheit an beiden Enden des Intervalls.

Wo es in der Tabelle landet

Modell (Konfiguration) DeepSWE
Claude Opus 5, max reasoning 74 % ±4 %
GPT-5.6 Sol, max reasoning 73 % ±3 %
Claude Fable 5 70 % ±4 %
GLM-5.3 / Kimi K3 69 %
DeepSeek V4 Pro 63 % ±6 %
Ox Alpha (Fremdlauf) ~58–63 %

Zu dieser Tabelle gehören zwei Fußnoten. Erstens: ox-alpha hat keinen offiziellen Leaderboard-Eintrag — jede Zahl stammt aus dem Harness jemand anderen. Zweitens: Der frühe Vergleich „auf Augenhöhe mit GPT-5.6-sol" bezog sich auf eine Mid-Tier-Sol-Konfiguration; Sol mit max reasoning liegt weiterhin etwa 10 Punkte darüber.

Die interessanteste Zahl ist kein Score

Es sind die 9,7 %, die an Formatfehlern in Tool-Calls verloren gingen: Aufgaben, wo das Reasoning des Modells korrekt war, aber der Tool-Call in ungültigem Format herauskam und der Harness ihn als Fehlschlag wertete. Zwei Implikationen:

  1. Die Decke liegt höher als der Score. Fast 10 Punkte sind Verrohrung, keine Intelligenz — und Verrohrung bessert sich schnell, sowohl über Modellupdates als auch über Harness-Fixes.
  2. Dein Harness verändert den Score. Ein Coding-Agent, der echte Tool-Calls streamt, sie validiert und sauber wiederholt, holt Punkte zurück, die eine nackte API-Schleife verliert. Genau dafür existiert eine vollständige agentische Umgebung — statt zu raten, was das Modell eigentlich wollte, sieht man jeden Tool-Call in Echtzeit landen.

Takeaways für Praktiker

  • „Schlägt GPT-5.6 Sol" — nein. Wer weiterhin die 80 % wiederholt, zitiert die 10-Aufgaben-Stichprobe.
  • „DeepSeek-V4-Pro-Leistung für $0" — ja. Pro DeepSWE-Punkt ist es heute das günstigste verfügbare Coding-Modell.
  • Am besten geeignet für volumetrische agentische Arbeit: lange Sessions, parallele Panes, Fan-out-Subagenten — Workloads, wo die Kosten dominieren und ein Modell der frühen 60er mit 1M Kontext locker reicht.

Mehr die Mystery-Seite? In wer ox-alpha gebaut hat sortieren wir alle Identitäts-Hinweise nach Beweiskraft. Zum Loslegen — vier Panes parallel, $0 pro Token — geht's zu ox-alpha in MeshCode.


Benchmark-Zahlen sind Drittmessungen Stand 26. August 2026; es gibt keinen offiziellen Leaderboard-Eintrag, und je nach Harness oder Modellversion können sie anders ausfallen. Ox Alpha wird anonym über OpenRouter vertrieben; MeshCode steht in keiner Verbindung zum Entwickler.

ox-alphaBenchmarksDeepSWEGPT-5.6Coding-AgentenOpenRouterStealth-Modell