Benchmark ox-alpha Dijelaskan: Apa Arti Angka-angkanya Sebenarnya
Viral '80% di DeepSWE — mengalahkan GPT-5.6 Sol' berasal dari sampel 10 tugas. Run lengkap 113 tugas menghasilkan 58,4%. Semua angka, variabel kegagalan tool-call, dan artinya untuk kerja agen.
Jawaban singkat: tidak, ox-alpha tidak mengalahkan GPT-5.6 Sol. Angka viral 80% itu berasal dari sampel 10 tugas yang pembuatnya sendiri memperingatkan variansnya tinggi. Run lengkap 113 tugas menghasilkan 58,4% (CI 95%: 49,2–67,1%), evaluasi yang lebih besar konvergen di 62,8–63% — wilayah DeepSeek V4 Pro, beberapa anak tangga di bawah puncak frontier. Tetap saja dengan harga $0 per token, ini nilai terbaik di antara model coding hari ini. Ini gambaran lengkapnya.
Bagaimana judul 80% itu lahir
Beberapa hari setelah ox-alpha muncul di OpenRouter, seorang developer bernama @davis7 memposting perbandingan DeepSWE: lebih dari 80% untuk ox-alpha, dibanding 65% untuk Claude Fable 5 dan 52% untuk GPT-5.6-sol. Screenshot beredar, dan narasi "model stealth mengalahkan frontier" menulis dirinya sendiri.
Yang harus diakui: @davis7 memperingatkan di utas yang sama bahwa sampel 10 tugas punya varian sangat besar. Run lengkap membuktikan peringatan itu benar.
Hubungkan Claude atau Codex yang sudah kamu bayar — sisanya dikerjakan worker yang biayanya cuma sebagian kecil.
Unduh meshcode →Apa yang diukur run lengkap
Pengukuran independen atas seluruh 113 tugas DeepSWE (MatchaOnMuffins/oxalpha) menghasilkan:
- Tingkat penyelesaian 58,4% (66/113), CI 95% [49,2%, 67,1%]
- 80% tugas lulus ≥90% tes fail-to-pass — saat bisa menyelesaikan, benar-benar selesai
- 9,7% kerugian benchmark adalah kegagalan format tool-call — bukan kegagalan penalaran
Evaluasi pihak ketiga yang lebih besar konvergen di sekitar 62,8–63%. Pembacaan jujur: ox-alpha ada di awal 60-an, dengan ketidakpastian nyata di kedua ujung interval.
Posisinya di tabel
| Model (konfigurasi) | DeepSWE |
|---|---|
| Claude Opus 5, max reasoning | 74% ±4% |
| GPT-5.6 Sol, max reasoning | 73% ±3% |
| Claude Fable 5 | 70% ±4% |
| GLM-5.3 / Kimi K3 | 69% |
| DeepSeek V4 Pro | 63% ±6% |
| Ox Alpha (run pihak ketiga) | ~58–63% |
Tabel ini butuh dua catatan kaki. Pertama, ox-alpha tidak punya entri leaderboard resmi — setiap angka datang dari harness orang lain. Kedua, perbandingan awal "sejajar dengan GPT-5.6-sol" membandingkan terhadap konfigurasi Sol kelas menengah; Sol pada max reasoning masih sekitar 10 poin di atasnya.
Angka paling menarik bukan skornya
Yaitu 9,7% yang hilang karena kegagalan format tool-call: tugas-tugas di mana penalaran model benar tapi tool-call keluar dalam format tidak valid dan harness menyebutnya gagal. Dua implikasi:
- Langit-langit lebih tinggi dari skor. Hampir 10 poin adalah soal perpipaan, bukan kecerdasan — dan perpipaan membaik cepat, lewat pembaruan model maupun perbaikan harness.
- Harness Anda mengubah skor. Agen coding yang benar-benar men-streaming tool-call asli, memvalidasinya, dan mencoba ulang dengan bersih akan mengambil kembali poin yang hilang oleh loop API telanjang. Justru itulah gunanya lingkungan agen lengkap — alih-alih menebak apa yang ingin dilakukan model, Anda melihat setiap tool-call mendarat secara real-time.
Kesimpulan untuk praktisi
- "Mengalahkan GPT-5.6 Sol" — bukan. Yang masih mengulang angka 80% mengutip sampel 10 tugas.
- "Performa DeepSeek-V4-Pro dengan $0" — ya. Per biaya per poin DeepSWE, ini model coding termurah yang tersedia hari ini.
- Paling cocok untuk kerja agen bervolume: sesi panjang, panel paralel, subagen fan-out — beban kerja yang didominasi biaya dan model awal 60-an dengan konteks 1M sudah lebih dari cukup.
Ingin sisi misterinya? Di siapa yang membuat ox-alpha kami mengurutkan semua petunjuk identitas berdasarkan kekuatannya. Untuk mulai menjalankannya — empat panel paralel, $0 per token — lihat ox-alpha di MeshCode.
Angka benchmark adalah pengukuran pihak ketiga per 26 Agustus 2026; tidak ada entri leaderboard resmi dan bisa berubah tergantung harness atau versi model. Ox Alpha didistribusikan secara anonim melalui OpenRouter; MeshCode tidak berafiliasi dengan pengembangnya.