Penanda Aras Ox Alpha Dijelaskan: Apa Angka Sebenarnya Katakan
Dakwaan viral '80% dalam DeepSWE — kalahkan GPT-5.6 Sol' datang daripada sampel 10 tugasan. Run penuh 113 tugasan memberi 58.4%. Semua angka, pemboleh ubah kegagalan tool-call, dan maksudnya untuk kerja agentic.
Jawapan ringkas: tidak, ox-alpha tidak mengalahkan GPT-5.6 Sol. Angka viral 80% itu datang daripada sampel 10 tugasan yang penulisnya sendiri mengingatkan variansnya tinggi. Run penuh semua 113 tugasan memberi 58.4% (CI 95%: 49.2–67.1%), dan penilaian yang lebih besar konvergen pada 62.8–63% — wilayah DeepSeek V4 Pro, beberapa anak tangga di bawah puncak frontier. Namun pada harga $0 setoken, ia tetap model pengekodan bernilai terbaik hari ini. Ini gambaran penuhnya.
Bagaimana tajuk 80% itu lahir
Beberapa hari selepas ox-alpha muncul di OpenRouter, seorang pembangun bernama @davis7 menyiarkan perbandingan DeepSWE: melebihi 80% untuk ox-alpha, berbanding 65% untuk Claude Fable 5 dan 52% untuk GPT-5.6-sol. Tangkapan skrin tersebar, dan naratif "model stealth kalahkan frontier" menulis dirinya sendiri.
Adil untuk akui: @davis7 sendiri mengingatkan dalam bebenang yang sama bahawa sampel 10 tugasan mempunyai varians sangat besar. Run penuh membuktikan amaran itu betul.
Sambungkan Claude atau Codex yang anda sudah bayar — selebihnya dibuat pekerja yang kosnya cuma sebahagian kecil.
Muat turun meshcode →Apa yang diukur oleh run penuh
Pengukuran bebas atas kesemua 113 tugasan DeepSWE (MatchaOnMuffins/oxalpha) mencatat:
- Kadar penyelesaian 58.4% (66/113), CI 95% [49.2%, 67.1%]
- 80% tugasan lulus ≥90% ujian fail-to-pass — tugasan yang diselesaikan memang selesai betul-betul
- 9.7% kerugian penanda aras ialah kegagalan format tool-call — bukan kegagalan penaakulan
Penilaian pihak ketiga yang lebih besar konvergen sekitar 62.8–63%. Bacaan jujur: ox-alpha berada di awal 60-an, dengan ketidakpastian sebenar di kedua-dua hujung selang keyakinan.
Kedudukan dalam jadual
| Model (konfigurasi) | DeepSWE |
|---|---|
| Claude Opus 5, max reasoning | 74% ±4% |
| GPT-5.6 Sol, max reasoning | 73% ±3% |
| Claude Fable 5 | 70% ±4% |
| GLM-5.3 / Kimi K3 | 69% |
| DeepSeek V4 Pro | 63% ±6% |
| Ox Alpha (run pihak ketiga) | ~58–63% |
Jadual ini perlukan dua nota kaki. Pertama, ox-alpha tiada entri leaderboard rasmi — setiap angka datang daripada harness orang lain. Kedua, perbandingan awal "setara dengan GPT-5.6-sol" dibuat terhadap konfigurasi Sol pertengahan; Sol pada max reasoning masih kira-kira 10 mata di atasnya.
Angka paling menarik bukan skornya
Ia ialah 9.7% yang hilang kerana kegagalan format tool-call: tugasan di mana penaakulan model betul tetapi panggilan alat keluar dalam format tidak sah, lalu harness mengira ia gagal. Dua implikasi:
- Siling lebih tinggi daripada skor. Hampir 10 mata adalah soal perpaipan, bukan kecerdasan — dan perpaipan bertambah baik dengan pantas, sama ada melalui kemas kini model mahupun pembaikan harness.
- Harness anda mengubah skor. Ejen pengekodan yang benar-benar menstrim setiap panggilan alat, mengesahkannya, dan mencuba semula dengan bersih akan mendapat semula mata yang hilang oleh gelung API kosong. Itulah tepat sebab persekitaran agentic penuh wujud — alih-alih meneka apa yang mahu dilakukan model, anda melihat setiap panggilan alat mendarat secara masa nyata.
Kesimpulan untuk pengamal
- "Kalahkan GPT-5.6 Sol" — tidak. Sesiapa yang masih mengulang angka 80% sedang memetik sampel 10 tugasan.
- "Prestasi aras DeepSeek-V4-Pro pada $0" — ya. Ikut kos setiap mata DeepSWE, inilah model pengekodan termurah yang boleh dibeli hari ini.
- Paling sesuai untuk kerja agentic ber volum: sesi panjang, pane selari, sub-ejen fan-out — beban kerja yang didominasi kos, dan model awal 60-an dengan konteks 1M sudah berkali-kali ganda cukup.
Nak sisi misterinya? Siapa membina ox-alpha menyusun semua petunjuk identiti ikut kekuatan bukti. Untuk mula menjalankannya — empat pane selari, $0 setoken — lihat ox-alpha dalam MeshCode.
Angka penanda aras ialah pengukuran pihak ketiga pada 26 Ogos 2026; tiada entri leaderboard rasmi dan ia boleh berbeza ikut harness atau versi model. Ox Alpha diedarkan secara tanpa nama melalui OpenRouter; MeshCode tidak bergabung dengan pembangunnya.