Benchmarks de ox-alpha explicados: qué dicen realmente los números
El viral «80% en DeepSWE — supera a GPT-5.6 Sol» venía de una muestra de 10 tareas. La ejecución completa de 113 tareas dio 58,4%. Todos los números, la variable de las llamadas a herramientas fallidas y lo que significa para trabajo agéntico.
Respuesta corta: no, ox-alpha no supera a GPT-5.6 Sol. El 80% viral salió de una muestra de 10 tareas que el propio autor advirtió que tenía alta varianza. La ejecución completa de 113 tareas dio un 58,4% (IC 95%: 49,2–67,1%) y las evaluaciones más grandes convergen en 62,8–63% — territorio de DeepSeek V4 Pro, varios peldaños por debajo de la cima frontier. Aun así, a $0 por token sigue siendo el mejor valor entre los modelos de código hoy. Esto es todo lo que sabemos.
Cómo nació el titular del 80%
Días después de que ox-alpha apareciera en OpenRouter, un desarrollador que se hace llamar @davis7 publicó una comparativa en DeepSWE: más del 80% para ox-alpha, frente al 65% de Claude Fable 5 y el 52% de GPT-5.6-sol. Las capturas circularon y la narrativa de "el modelo stealth derrota a la frontera" se escribió sola.
Hay que reconocerlo: @davis7 advirtió en el mismo hilo que una muestra de 10 tareas tiene una varianza enorme. La ejecución completa demostró que la advertencia era correcta.
Conecta el Claude o Codex que ya pagas; el resto lo hacen workers que cuestan una fracción.
Descargar meshcode →Qué midió la ejecución completa
Una medición independiente de las 113 tareas completas de DeepSWE (MatchaOnMuffins/oxalpha) arrojó:
- Tasa de resolución del 58,4% (66/113), IC 95% de [49,2%, 67,1%]
- En el 80% de las tareas pasó ≥90% de los tests fail-to-pass — cuando resuelve, resuelve de verdad
- El 9,7% de las pérdidas del benchmark fueron fallos de formato en llamadas a herramientas — no fallos de razonamiento
Las evaluaciones independientes más grandes convergen en torno al 62,8–63%. Lectura honesta: ox-alpha está en los bajos 60, con incertidumbre real en ambos extremos del intervalo.
Dónde cae en la tabla
| Modelo (configuración) | DeepSWE |
|---|---|
| Claude Opus 5, max reasoning | 74% ±4% |
| GPT-5.6 Sol, max reasoning | 73% ±3% |
| Claude Fable 5 | 70% ±4% |
| GLM-5.3 / Kimi K3 | 69% |
| DeepSeek V4 Pro | 63% ±6% |
| Ox Alpha (ejecución independiente) | ~58–63% |
Esta tabla necesita dos notas al pie. Primera: ox-alpha no tiene entrada oficial en ningún ranking — cada número proviene del harness de otra persona. Segunda: la comparación temprana "a la par con GPT-5.6-sol" se hacía contra una configuración Sol de gama media; el Sol en max reasoning sigue unos 10 puntos por encima.
El número más interesante no es la puntuación
Es el 9,7% perdido por fallos de formato en llamadas a herramientas: tareas donde el razonamiento del modelo era correcto pero emitió la llamada a la herramienta en un formato inválido y el harness la marcó como fallo. Dos implicaciones:
- El techo está más alto que la puntuación. Casi 10 puntos son fontanería, no inteligencia — y la fontanería mejora rápido, tanto con actualizaciones del modelo como con correcciones del harness.
- Tu harness cambia la puntuación. Un agente de código que transmite las llamadas a herramientas reales, las valida y reintenta limpiamente recupera puntos que un bucle API pelado pierde. Para eso existe exactamente un entorno agéntico completo — en lugar de adivinar qué quiso hacer el modelo, ves cada llamada a herramienta aterrizar en tiempo real.
Conclusiones para quien trabaja con esto
- "Supera a GPT-5.6 Sol" — no. Quien aún repite el 80% cita la muestra de 10 tareas.
- "Rendimiento de DeepSeek-V4-Pro por $0" — sí. Por coste por punto de DeepSWE, es el modelo de código más barato disponible hoy.
- Encaja mejor en trabajo agéntico de volumen: sesiones largas, paneles paralelos, subagentes fan-out — cargas donde manda el coste y un modelo de bajos 60 con contexto de 1M sobra.
¿Quieres el lado del misterio? En quién hizo ox-alpha ordenamos todas las pistas de identidad por fuerza. Para ponerlo en marcha — cuatro paneles en paralelo, $0 por token — ve a ox-alpha en MeshCode.
Cifras de benchmark medidas por terceros a fecha de 26 de agosto de 2026; no hay entrada oficial en rankings y pueden cambiar según harness o versión del modelo. Ox Alpha se distribuye de forma anónima vía OpenRouter; MeshCode no está afiliado a su desarrollador.