ox-alpha-Benchmarks erklärt: was die Zahlen wirklich sagen
Das virale „80 % in DeepSWE – schlägt GPT-5.6 Sol" stammte aus einer 10-Aufgaben-Stichprobe. Der komplette 113-Aufgaben-Lauf ergab 58,4 %. Alle Zahlen, die Variable der fehlgeschlagenen Tool-Calls und was das für agentische Arbeit bedeutet.
Kurzantwort: Nein, ox-alpha schlägt nicht GPT-5.6 Sol. Die viralen 80 % stammen aus einer 10-Aufgaben-Stichprobe, deren hohe Varianz der Autor selbst warnte. Der komplette Lauf über alle 113 Aufgaben ergab 58,4 % (95-%-KI: 49,2–67,1 %), größere Evaluierungen konvergieren bei 62,8–63 % — DeepSeek-V4-Pro-Territorium, mehrere Stufen unter der Frontier-Spitze. Pro Token zu $0 bleibt es trotzdem der beste Wert unter den Coding-Modellen heute. Hier das Gesamtbild.
Wie die 80-%-Schlagzeile entstand
Wenige Tage nach dem Auftauchen von ox-alpha auf OpenRouter veröffentlichte ein Entwickler namens @davis7 einen DeepSWE-Vergleich: über 80 % für ox-alpha, gegen 65 % für Claude Fable 5 und 52 % für GPT-5.6-sol. Die Screenshots machten die Runde, und die Erzählung „Stealth-Modell schlägt die Frontier" schrieb sich von selbst.
Man muss ihm lassen: @davis7 warnte im selben Thread, dass eine 10-Aufgaben-Stichprobe eine riesige Varianz hat. Der komplette Lauf bestätigte die Warnung.
Verbinde das Claude oder Codex, das du schon bezahlst — den Rest übernehmen Worker, die einen Bruchteil kosten.
meshcode herunterladen →Was der komplette Lauf gemessen hat
Eine unabhängige Messung aller 113 DeepSWE-Aufgaben (MatchaOnMuffins/oxalpha) ergab:
- Lösungsrate 58,4 % (66/113), 95-%-KI [49,2 %, 67,1 %]
- In 80 % der Aufgaben wurden ≥90 % der Fail-to-Pass-Tests bestanden — wenn es löst, dann wirklich
- 9,7 % des Benchmark-Verlusts waren Formatfehler bei Tool-Calls — keine Denkfehler
Größere unabhängige Evaluierungen konvergieren bei rund 62,8–63 %. Ehrliche Lesart: ox-alpha liegt in den frühen 60ern, mit echter Unsicherheit an beiden Enden des Intervalls.
Wo es in der Tabelle landet
| Modell (Konfiguration) | DeepSWE |
|---|---|
| Claude Opus 5, max reasoning | 74 % ±4 % |
| GPT-5.6 Sol, max reasoning | 73 % ±3 % |
| Claude Fable 5 | 70 % ±4 % |
| GLM-5.3 / Kimi K3 | 69 % |
| DeepSeek V4 Pro | 63 % ±6 % |
| Ox Alpha (Fremdlauf) | ~58–63 % |
Zu dieser Tabelle gehören zwei Fußnoten. Erstens: ox-alpha hat keinen offiziellen Leaderboard-Eintrag — jede Zahl stammt aus dem Harness jemand anderen. Zweitens: Der frühe Vergleich „auf Augenhöhe mit GPT-5.6-sol" bezog sich auf eine Mid-Tier-Sol-Konfiguration; Sol mit max reasoning liegt weiterhin etwa 10 Punkte darüber.
Die interessanteste Zahl ist kein Score
Es sind die 9,7 %, die an Formatfehlern in Tool-Calls verloren gingen: Aufgaben, wo das Reasoning des Modells korrekt war, aber der Tool-Call in ungültigem Format herauskam und der Harness ihn als Fehlschlag wertete. Zwei Implikationen:
- Die Decke liegt höher als der Score. Fast 10 Punkte sind Verrohrung, keine Intelligenz — und Verrohrung bessert sich schnell, sowohl über Modellupdates als auch über Harness-Fixes.
- Dein Harness verändert den Score. Ein Coding-Agent, der echte Tool-Calls streamt, sie validiert und sauber wiederholt, holt Punkte zurück, die eine nackte API-Schleife verliert. Genau dafür existiert eine vollständige agentische Umgebung — statt zu raten, was das Modell eigentlich wollte, sieht man jeden Tool-Call in Echtzeit landen.
Takeaways für Praktiker
- „Schlägt GPT-5.6 Sol" — nein. Wer weiterhin die 80 % wiederholt, zitiert die 10-Aufgaben-Stichprobe.
- „DeepSeek-V4-Pro-Leistung für $0" — ja. Pro DeepSWE-Punkt ist es heute das günstigste verfügbare Coding-Modell.
- Am besten geeignet für volumetrische agentische Arbeit: lange Sessions, parallele Panes, Fan-out-Subagenten — Workloads, wo die Kosten dominieren und ein Modell der frühen 60er mit 1M Kontext locker reicht.
Mehr die Mystery-Seite? In wer ox-alpha gebaut hat sortieren wir alle Identitäts-Hinweise nach Beweiskraft. Zum Loslegen — vier Panes parallel, $0 pro Token — geht's zu ox-alpha in MeshCode.
Benchmark-Zahlen sind Drittmessungen Stand 26. August 2026; es gibt keinen offiziellen Leaderboard-Eintrag, und je nach Harness oder Modellversion können sie anders ausfallen. Ox Alpha wird anonym über OpenRouter vertrieben; MeshCode steht in keiner Verbindung zum Entwickler.