arrow_back Semua postingan
26 Agustus 2026 · 5 menit baca · meshcode

Benchmark ox-alpha Dijelaskan: Apa Arti Angka-angkanya Sebenarnya

Viral '80% di DeepSWE — mengalahkan GPT-5.6 Sol' berasal dari sampel 10 tugas. Run lengkap 113 tugas menghasilkan 58,4%. Semua angka, variabel kegagalan tool-call, dan artinya untuk kerja agen.

Jawaban singkat: tidak, ox-alpha tidak mengalahkan GPT-5.6 Sol. Angka viral 80% itu berasal dari sampel 10 tugas yang pembuatnya sendiri memperingatkan variansnya tinggi. Run lengkap 113 tugas menghasilkan 58,4% (CI 95%: 49,2–67,1%), evaluasi yang lebih besar konvergen di 62,8–63% — wilayah DeepSeek V4 Pro, beberapa anak tangga di bawah puncak frontier. Tetap saja dengan harga $0 per token, ini nilai terbaik di antara model coding hari ini. Ini gambaran lengkapnya.

Bagaimana judul 80% itu lahir

Beberapa hari setelah ox-alpha muncul di OpenRouter, seorang developer bernama @davis7 memposting perbandingan DeepSWE: lebih dari 80% untuk ox-alpha, dibanding 65% untuk Claude Fable 5 dan 52% untuk GPT-5.6-sol. Screenshot beredar, dan narasi "model stealth mengalahkan frontier" menulis dirinya sendiri.

Yang harus diakui: @davis7 memperingatkan di utas yang sama bahwa sampel 10 tugas punya varian sangat besar. Run lengkap membuktikan peringatan itu benar.

Hubungkan Claude atau Codex yang sudah kamu bayar — sisanya dikerjakan worker yang biayanya cuma sebagian kecil.

Unduh meshcode →

Apa yang diukur run lengkap

Pengukuran independen atas seluruh 113 tugas DeepSWE (MatchaOnMuffins/oxalpha) menghasilkan:

  • Tingkat penyelesaian 58,4% (66/113), CI 95% [49,2%, 67,1%]
  • 80% tugas lulus ≥90% tes fail-to-pass — saat bisa menyelesaikan, benar-benar selesai
  • 9,7% kerugian benchmark adalah kegagalan format tool-call — bukan kegagalan penalaran

Evaluasi pihak ketiga yang lebih besar konvergen di sekitar 62,8–63%. Pembacaan jujur: ox-alpha ada di awal 60-an, dengan ketidakpastian nyata di kedua ujung interval.

Posisinya di tabel

Model (konfigurasi) DeepSWE
Claude Opus 5, max reasoning 74% ±4%
GPT-5.6 Sol, max reasoning 73% ±3%
Claude Fable 5 70% ±4%
GLM-5.3 / Kimi K3 69%
DeepSeek V4 Pro 63% ±6%
Ox Alpha (run pihak ketiga) ~58–63%

Tabel ini butuh dua catatan kaki. Pertama, ox-alpha tidak punya entri leaderboard resmi — setiap angka datang dari harness orang lain. Kedua, perbandingan awal "sejajar dengan GPT-5.6-sol" membandingkan terhadap konfigurasi Sol kelas menengah; Sol pada max reasoning masih sekitar 10 poin di atasnya.

Angka paling menarik bukan skornya

Yaitu 9,7% yang hilang karena kegagalan format tool-call: tugas-tugas di mana penalaran model benar tapi tool-call keluar dalam format tidak valid dan harness menyebutnya gagal. Dua implikasi:

  1. Langit-langit lebih tinggi dari skor. Hampir 10 poin adalah soal perpipaan, bukan kecerdasan — dan perpipaan membaik cepat, lewat pembaruan model maupun perbaikan harness.
  2. Harness Anda mengubah skor. Agen coding yang benar-benar men-streaming tool-call asli, memvalidasinya, dan mencoba ulang dengan bersih akan mengambil kembali poin yang hilang oleh loop API telanjang. Justru itulah gunanya lingkungan agen lengkap — alih-alih menebak apa yang ingin dilakukan model, Anda melihat setiap tool-call mendarat secara real-time.

Kesimpulan untuk praktisi

  • "Mengalahkan GPT-5.6 Sol" — bukan. Yang masih mengulang angka 80% mengutip sampel 10 tugas.
  • "Performa DeepSeek-V4-Pro dengan $0" — ya. Per biaya per poin DeepSWE, ini model coding termurah yang tersedia hari ini.
  • Paling cocok untuk kerja agen bervolume: sesi panjang, panel paralel, subagen fan-out — beban kerja yang didominasi biaya dan model awal 60-an dengan konteks 1M sudah lebih dari cukup.

Ingin sisi misterinya? Di siapa yang membuat ox-alpha kami mengurutkan semua petunjuk identitas berdasarkan kekuatannya. Untuk mulai menjalankannya — empat panel paralel, $0 per token — lihat ox-alpha di MeshCode.


Angka benchmark adalah pengukuran pihak ketiga per 26 Agustus 2026; tidak ada entri leaderboard resmi dan bisa berubah tergantung harness atau versi model. Ox Alpha didistribusikan secara anonim melalui OpenRouter; MeshCode tidak berafiliasi dengan pengembangnya.

ox-alphabenchmarkDeepSWEGPT-5.6agen codingOpenRoutermodel stealth