arrow_back Todas las publicaciones
26 de agosto de 2026 · 5 min de lectura · meshcode

Benchmarks de ox-alpha explicados: qué dicen realmente los números

El viral «80% en DeepSWE — supera a GPT-5.6 Sol» venía de una muestra de 10 tareas. La ejecución completa de 113 tareas dio 58,4%. Todos los números, la variable de las llamadas a herramientas fallidas y lo que significa para trabajo agéntico.

Respuesta corta: no, ox-alpha no supera a GPT-5.6 Sol. El 80% viral salió de una muestra de 10 tareas que el propio autor advirtió que tenía alta varianza. La ejecución completa de 113 tareas dio un 58,4% (IC 95%: 49,2–67,1%) y las evaluaciones más grandes convergen en 62,8–63% — territorio de DeepSeek V4 Pro, varios peldaños por debajo de la cima frontier. Aun así, a $0 por token sigue siendo el mejor valor entre los modelos de código hoy. Esto es todo lo que sabemos.

Cómo nació el titular del 80%

Días después de que ox-alpha apareciera en OpenRouter, un desarrollador que se hace llamar @davis7 publicó una comparativa en DeepSWE: más del 80% para ox-alpha, frente al 65% de Claude Fable 5 y el 52% de GPT-5.6-sol. Las capturas circularon y la narrativa de "el modelo stealth derrota a la frontera" se escribió sola.

Hay que reconocerlo: @davis7 advirtió en el mismo hilo que una muestra de 10 tareas tiene una varianza enorme. La ejecución completa demostró que la advertencia era correcta.

Conecta el Claude o Codex que ya pagas; el resto lo hacen workers que cuestan una fracción.

Descargar meshcode →

Qué midió la ejecución completa

Una medición independiente de las 113 tareas completas de DeepSWE (MatchaOnMuffins/oxalpha) arrojó:

  • Tasa de resolución del 58,4% (66/113), IC 95% de [49,2%, 67,1%]
  • En el 80% de las tareas pasó ≥90% de los tests fail-to-pass — cuando resuelve, resuelve de verdad
  • El 9,7% de las pérdidas del benchmark fueron fallos de formato en llamadas a herramientas — no fallos de razonamiento

Las evaluaciones independientes más grandes convergen en torno al 62,8–63%. Lectura honesta: ox-alpha está en los bajos 60, con incertidumbre real en ambos extremos del intervalo.

Dónde cae en la tabla

Modelo (configuración) DeepSWE
Claude Opus 5, max reasoning 74% ±4%
GPT-5.6 Sol, max reasoning 73% ±3%
Claude Fable 5 70% ±4%
GLM-5.3 / Kimi K3 69%
DeepSeek V4 Pro 63% ±6%
Ox Alpha (ejecución independiente) ~58–63%

Esta tabla necesita dos notas al pie. Primera: ox-alpha no tiene entrada oficial en ningún ranking — cada número proviene del harness de otra persona. Segunda: la comparación temprana "a la par con GPT-5.6-sol" se hacía contra una configuración Sol de gama media; el Sol en max reasoning sigue unos 10 puntos por encima.

El número más interesante no es la puntuación

Es el 9,7% perdido por fallos de formato en llamadas a herramientas: tareas donde el razonamiento del modelo era correcto pero emitió la llamada a la herramienta en un formato inválido y el harness la marcó como fallo. Dos implicaciones:

  1. El techo está más alto que la puntuación. Casi 10 puntos son fontanería, no inteligencia — y la fontanería mejora rápido, tanto con actualizaciones del modelo como con correcciones del harness.
  2. Tu harness cambia la puntuación. Un agente de código que transmite las llamadas a herramientas reales, las valida y reintenta limpiamente recupera puntos que un bucle API pelado pierde. Para eso existe exactamente un entorno agéntico completo — en lugar de adivinar qué quiso hacer el modelo, ves cada llamada a herramienta aterrizar en tiempo real.

Conclusiones para quien trabaja con esto

  • "Supera a GPT-5.6 Sol" — no. Quien aún repite el 80% cita la muestra de 10 tareas.
  • "Rendimiento de DeepSeek-V4-Pro por $0" — sí. Por coste por punto de DeepSWE, es el modelo de código más barato disponible hoy.
  • Encaja mejor en trabajo agéntico de volumen: sesiones largas, paneles paralelos, subagentes fan-out — cargas donde manda el coste y un modelo de bajos 60 con contexto de 1M sobra.

¿Quieres el lado del misterio? En quién hizo ox-alpha ordenamos todas las pistas de identidad por fuerza. Para ponerlo en marcha — cuatro paneles en paralelo, $0 por token — ve a ox-alpha en MeshCode.


Cifras de benchmark medidas por terceros a fecha de 26 de agosto de 2026; no hay entrada oficial en rankings y pueden cambiar según harness o versión del modelo. Ox Alpha se distribuye de forma anónima vía OpenRouter; MeshCode no está afiliado a su desarrollador.

ox-alphabenchmarksDeepSWEGPT-5.6agentes de códigoOpenRoutermodelo stealth