arrow_back 전체 글
2026년 8월 26일 · 5 분 읽기 · meshcode

ox-alpha 벤치마크: 숫자가 실제로 말하는 것

화제가 된 'DeepSWE 80% — GPT-5.6 Sol 격파'는 10개 태스크 샘플이었습니다. 113개 전체 풀런은 58.4%. 모든 숫자와 툴콜 실패 변수, 에이전트 작업 관점의 의미를 정리했습니다.

요약: ox-alpha는 GPT-5.6 Sol을 이기지 못했습니다. 화제의 80%는 본인도 고분산이라 경고한 10개 태스크 샘플에서 나왔습니다. 113개 태스크 전체 풀런은 58.4%(95% CI 49.267.1%), 더 큰 평가들은 62.863%에 수렴합니다 — DeepSeek V4 Pro급이고 프론티어 선두보다 몇 계단 아래입니다. 그래도 토큰당 $0이면 지금 코딩 모델 중 가성비는 최고입니다. 전체 그림을 정리합니다.

80% 헤드라인이 나온 과정

ox-alpha가 OpenRouter에 나온 며칠 뒤, @davis7라는 개발자가 DeepSWE 비교를 올렸습니다. ox-alpha 80% 초반 vs Claude Fable 5 65%, GPT-5.6-sol 52%. 스크린샷이 돌았고 "스텔스 모델이 프론티어를 이겼다"는 서사가 저절로 쓰였습니다.

정작 @davis7의 글 자체가 10개 태스크 샘플은 분산이 크다고 경고하고 있었고, 풀런은 그 경고가 맞았음을 보여줬습니다.

쓰던 Claude·Codex를 그대로 연결하고, 나머지는 몇십 분의 일 가격의 워커가 처리합니다.

meshcode 다운로드 →

풀런이 측정한 것

113개 DeepSWE 태스크 전체를 돌린 독립 측정(MatchaOnMuffins/oxalpha)의 결과:

  • 해결률 58.4% (66/113), 95% CI [49.2%, 67.1%]
  • 태스크의 80%에서 fail-to-pass 테스트의 90% 이상을 통과 — 풀면 진짜로 풉니다
  • 벤치마크 손실의 9.7%는 툴콜 포맷 실패 — 추론 실패가 아님

더 큰 서드파티 평가들은 **약 62.8~63%**로 수렴합니다. 정직한 해석: ox-alpha는 60 초반대이고 신뢰구간 가장자리에는 불확실성이 큽니다.

리더보드에서의 위치

모델 (설정) DeepSWE
Claude Opus 5, max reasoning 74% ±4%
GPT-5.6 Sol, max reasoning 73% ±3%
Claude Fable 5 70% ±4%
GLM-5.3 / Kimi K3 69%
DeepSeek V4 Pro 63% ±6%
Ox Alpha (서드파티 런) 5863%

이 표 밑에 붙어야 할 주의가 두 가지입니다. 첫째, ox-alpha는 공식 리더보드 항목이 없습니다 — 모든 숫자는 남의 하네스에서 나온 서드파티 측정입니다. 둘째, 초기의 "GPT-5.6-sol과 동급" 비교는 mid-tier Sol 설정 기준이었고, max reasoning Sol은 여전히 ~10포인트 위입니다.

가장 흥미로운 숫자는 점수가 아니다

**툴콜 포맷 실패로 잃은 9.7%**입니다. 모델의 추론은 맞았는데 툴콜이 잘못 나와 하네스가 실패로 처리한 태스크들입니다. 두 가지 의미가 있습니다.

  1. 천장은 점수보다 높습니다. 10포인트 가까운 여유가 배관 문제지 지능 문제가 아니고, 배관은 (모델 업데이트와 하네스 수정 양쪽에서) 빠르게 개선됩니다.
  2. 하네스가 점수를 바꿉니다. 실제 툴콜을 스트리밍하고 검증하고 깨끗하게 재시도하는 코딩 에이전트는 날벼락 API 루프가 놓치는 포인트를 회수합니다. 에이전트 환경이 존재하는 이유가 정확히 이것입니다 — 모델의 "진짜 의도"를 추측하는 대신 모든 툴콜이 실시간으로 지나가는 걸 볼 수 있으니까요.

실무자를 위한 결론

  • "GPT-5.6 Sol을 이긴다" — 아닙니다. 아직 80%를 반복하는 사람은 10개 태스크 샘플을 인용 중입니다.
  • "$0에 DeepSeek-V4-Pro급" — 맞습니다. DeepSWE 포인트당 가격으로는 오늘 가장 싼 코딩 모델입니다.
  • 가장 잘 맞는 용도는 볼륨 에이전트 작업: 긴 세션, 병렬 패널, fan-out 서브에이전트 — 비용이 지배하고 100만 컨텍스트의 60 초반대 모델이면 충분한 워크로드.

미스터리 쪽이 궁금하면 ox-alpha는 누가 만들었나에서 정체 클루를 근거 순으로 정리했습니다. 실제로 돌리는 방법 — 패널 4개 병렬, 토큰당 $0 — 은 MeshCode의 ox-alpha에서.


벤치마크 수치는 2026년 8월 26일 기준 서드파티 측정이며 공식 리더보드 항목이 아닙니다. 하네스와 모델 버전에 따라 달라질 수 있습니다. Ox Alpha는 OpenRouter를 통해 익명 유통 중이며 MeshCode는 해당 개발사와 제휴하지 않습니다.

ox-alpha벤치마크DeepSWEGPT-5.6코딩 에이전트OpenRouter스텔스 모델