ox-alpha 벤치마크: 숫자가 실제로 말하는 것
화제가 된 'DeepSWE 80% — GPT-5.6 Sol 격파'는 10개 태스크 샘플이었습니다. 113개 전체 풀런은 58.4%. 모든 숫자와 툴콜 실패 변수, 에이전트 작업 관점의 의미를 정리했습니다.
요약: ox-alpha는 GPT-5.6 Sol을 이기지 못했습니다. 화제의 80%는 본인도 고분산이라 경고한 10개 태스크 샘플에서 나왔습니다. 113개 태스크 전체 풀런은 58.4%(95% CI 49.267.1%), 더 큰 평가들은 62.863%에 수렴합니다 — DeepSeek V4 Pro급이고 프론티어 선두보다 몇 계단 아래입니다. 그래도 토큰당 $0이면 지금 코딩 모델 중 가성비는 최고입니다. 전체 그림을 정리합니다.
80% 헤드라인이 나온 과정
ox-alpha가 OpenRouter에 나온 며칠 뒤, @davis7라는 개발자가 DeepSWE 비교를 올렸습니다. ox-alpha 80% 초반 vs Claude Fable 5 65%, GPT-5.6-sol 52%. 스크린샷이 돌았고 "스텔스 모델이 프론티어를 이겼다"는 서사가 저절로 쓰였습니다.
정작 @davis7의 글 자체가 10개 태스크 샘플은 분산이 크다고 경고하고 있었고, 풀런은 그 경고가 맞았음을 보여줬습니다.
쓰던 Claude·Codex를 그대로 연결하고, 나머지는 몇십 분의 일 가격의 워커가 처리합니다.
meshcode 다운로드 →풀런이 측정한 것
113개 DeepSWE 태스크 전체를 돌린 독립 측정(MatchaOnMuffins/oxalpha)의 결과:
- 해결률 58.4% (66/113), 95% CI [49.2%, 67.1%]
- 태스크의 80%에서 fail-to-pass 테스트의 90% 이상을 통과 — 풀면 진짜로 풉니다
- 벤치마크 손실의 9.7%는 툴콜 포맷 실패 — 추론 실패가 아님
더 큰 서드파티 평가들은 **약 62.8~63%**로 수렴합니다. 정직한 해석: ox-alpha는 60 초반대이고 신뢰구간 가장자리에는 불확실성이 큽니다.
리더보드에서의 위치
| 모델 (설정) | DeepSWE |
|---|---|
| Claude Opus 5, max reasoning | 74% ±4% |
| GPT-5.6 Sol, max reasoning | 73% ±3% |
| Claude Fable 5 | 70% ±4% |
| GLM-5.3 / Kimi K3 | 69% |
| DeepSeek V4 Pro | 63% ±6% |
| Ox Alpha (서드파티 런) |
이 표 밑에 붙어야 할 주의가 두 가지입니다. 첫째, ox-alpha는 공식 리더보드 항목이 없습니다 — 모든 숫자는 남의 하네스에서 나온 서드파티 측정입니다. 둘째, 초기의 "GPT-5.6-sol과 동급" 비교는 mid-tier Sol 설정 기준이었고, max reasoning Sol은 여전히 ~10포인트 위입니다.
가장 흥미로운 숫자는 점수가 아니다
**툴콜 포맷 실패로 잃은 9.7%**입니다. 모델의 추론은 맞았는데 툴콜이 잘못 나와 하네스가 실패로 처리한 태스크들입니다. 두 가지 의미가 있습니다.
- 천장은 점수보다 높습니다. 10포인트 가까운 여유가 배관 문제지 지능 문제가 아니고, 배관은 (모델 업데이트와 하네스 수정 양쪽에서) 빠르게 개선됩니다.
- 하네스가 점수를 바꿉니다. 실제 툴콜을 스트리밍하고 검증하고 깨끗하게 재시도하는 코딩 에이전트는 날벼락 API 루프가 놓치는 포인트를 회수합니다. 에이전트 환경이 존재하는 이유가 정확히 이것입니다 — 모델의 "진짜 의도"를 추측하는 대신 모든 툴콜이 실시간으로 지나가는 걸 볼 수 있으니까요.
실무자를 위한 결론
- "GPT-5.6 Sol을 이긴다" — 아닙니다. 아직 80%를 반복하는 사람은 10개 태스크 샘플을 인용 중입니다.
- "$0에 DeepSeek-V4-Pro급" — 맞습니다. DeepSWE 포인트당 가격으로는 오늘 가장 싼 코딩 모델입니다.
- 가장 잘 맞는 용도는 볼륨 에이전트 작업: 긴 세션, 병렬 패널, fan-out 서브에이전트 — 비용이 지배하고 100만 컨텍스트의 60 초반대 모델이면 충분한 워크로드.
미스터리 쪽이 궁금하면 ox-alpha는 누가 만들었나에서 정체 클루를 근거 순으로 정리했습니다. 실제로 돌리는 방법 — 패널 4개 병렬, 토큰당 $0 — 은 MeshCode의 ox-alpha에서.
벤치마크 수치는 2026년 8월 26일 기준 서드파티 측정이며 공식 리더보드 항목이 아닙니다. 하네스와 모델 버전에 따라 달라질 수 있습니다. Ox Alpha는 OpenRouter를 통해 익명 유통 중이며 MeshCode는 해당 개발사와 제휴하지 않습니다.