arrow_back Semua catatan
26 Ogos 2026 · 5 minit bacaan · meshcode

Penanda Aras Ox Alpha Dijelaskan: Apa Angka Sebenarnya Katakan

Dakwaan viral '80% dalam DeepSWE — kalahkan GPT-5.6 Sol' datang daripada sampel 10 tugasan. Run penuh 113 tugasan memberi 58.4%. Semua angka, pemboleh ubah kegagalan tool-call, dan maksudnya untuk kerja agentic.

Jawapan ringkas: tidak, ox-alpha tidak mengalahkan GPT-5.6 Sol. Angka viral 80% itu datang daripada sampel 10 tugasan yang penulisnya sendiri mengingatkan variansnya tinggi. Run penuh semua 113 tugasan memberi 58.4% (CI 95%: 49.2–67.1%), dan penilaian yang lebih besar konvergen pada 62.8–63% — wilayah DeepSeek V4 Pro, beberapa anak tangga di bawah puncak frontier. Namun pada harga $0 setoken, ia tetap model pengekodan bernilai terbaik hari ini. Ini gambaran penuhnya.

Bagaimana tajuk 80% itu lahir

Beberapa hari selepas ox-alpha muncul di OpenRouter, seorang pembangun bernama @davis7 menyiarkan perbandingan DeepSWE: melebihi 80% untuk ox-alpha, berbanding 65% untuk Claude Fable 5 dan 52% untuk GPT-5.6-sol. Tangkapan skrin tersebar, dan naratif "model stealth kalahkan frontier" menulis dirinya sendiri.

Adil untuk akui: @davis7 sendiri mengingatkan dalam bebenang yang sama bahawa sampel 10 tugasan mempunyai varians sangat besar. Run penuh membuktikan amaran itu betul.

Sambungkan Claude atau Codex yang anda sudah bayar — selebihnya dibuat pekerja yang kosnya cuma sebahagian kecil.

Muat turun meshcode →

Apa yang diukur oleh run penuh

Pengukuran bebas atas kesemua 113 tugasan DeepSWE (MatchaOnMuffins/oxalpha) mencatat:

  • Kadar penyelesaian 58.4% (66/113), CI 95% [49.2%, 67.1%]
  • 80% tugasan lulus ≥90% ujian fail-to-pass — tugasan yang diselesaikan memang selesai betul-betul
  • 9.7% kerugian penanda aras ialah kegagalan format tool-call — bukan kegagalan penaakulan

Penilaian pihak ketiga yang lebih besar konvergen sekitar 62.8–63%. Bacaan jujur: ox-alpha berada di awal 60-an, dengan ketidakpastian sebenar di kedua-dua hujung selang keyakinan.

Kedudukan dalam jadual

Model (konfigurasi) DeepSWE
Claude Opus 5, max reasoning 74% ±4%
GPT-5.6 Sol, max reasoning 73% ±3%
Claude Fable 5 70% ±4%
GLM-5.3 / Kimi K3 69%
DeepSeek V4 Pro 63% ±6%
Ox Alpha (run pihak ketiga) ~58–63%

Jadual ini perlukan dua nota kaki. Pertama, ox-alpha tiada entri leaderboard rasmi — setiap angka datang daripada harness orang lain. Kedua, perbandingan awal "setara dengan GPT-5.6-sol" dibuat terhadap konfigurasi Sol pertengahan; Sol pada max reasoning masih kira-kira 10 mata di atasnya.

Angka paling menarik bukan skornya

Ia ialah 9.7% yang hilang kerana kegagalan format tool-call: tugasan di mana penaakulan model betul tetapi panggilan alat keluar dalam format tidak sah, lalu harness mengira ia gagal. Dua implikasi:

  1. Siling lebih tinggi daripada skor. Hampir 10 mata adalah soal perpaipan, bukan kecerdasan — dan perpaipan bertambah baik dengan pantas, sama ada melalui kemas kini model mahupun pembaikan harness.
  2. Harness anda mengubah skor. Ejen pengekodan yang benar-benar menstrim setiap panggilan alat, mengesahkannya, dan mencuba semula dengan bersih akan mendapat semula mata yang hilang oleh gelung API kosong. Itulah tepat sebab persekitaran agentic penuh wujud — alih-alih meneka apa yang mahu dilakukan model, anda melihat setiap panggilan alat mendarat secara masa nyata.

Kesimpulan untuk pengamal

  • "Kalahkan GPT-5.6 Sol" — tidak. Sesiapa yang masih mengulang angka 80% sedang memetik sampel 10 tugasan.
  • "Prestasi aras DeepSeek-V4-Pro pada $0" — ya. Ikut kos setiap mata DeepSWE, inilah model pengekodan termurah yang boleh dibeli hari ini.
  • Paling sesuai untuk kerja agentic ber volum: sesi panjang, pane selari, sub-ejen fan-out — beban kerja yang didominasi kos, dan model awal 60-an dengan konteks 1M sudah berkali-kali ganda cukup.

Nak sisi misterinya? Siapa membina ox-alpha menyusun semua petunjuk identiti ikut kekuatan bukti. Untuk mula menjalankannya — empat pane selari, $0 setoken — lihat ox-alpha dalam MeshCode.


Angka penanda aras ialah pengukuran pihak ketiga pada 26 Ogos 2026; tiada entri leaderboard rasmi dan ia boleh berbeza ikut harness atau versi model. Ox Alpha diedarkan secara tanpa nama melalui OpenRouter; MeshCode tidak bergabung dengan pembangunnya.

ox-alphapenanda arasDeepSWEGPT-5.6ejen pengekodanOpenRoutermodel stealth