Giải thích benchmark của ox-alpha: những con số thực sự nói lên điều gì
Con số viral '80% trên DeepSWE — vượt mặt GPT-5.6 Sol' đến từ mẫu 10 nhiệm vụ. Chạy đủ 113 nhiệm vụ chỉ đạt 58,4%. Tất cả các con số, biến số lỗi tool-call và ý nghĩa với công việc agent.
Trả lời ngắn: không, ox-alpha chưa vượt mặt GPT-5.6 Sol. Con số 80% viral đến từ một mẫu 10 nhiệm vụ mà chính tác giả đã cảnh báo phương sai rất cao. Chạy đủ 113 nhiệm vụ đạt 58,4% (CI 95%: 49,2–67,1%), còn các đánh giá quy mô lớn hơn hội tụ quanh 62,8–63% — vùng đất của DeepSeek V4 Pro, cách đỉnh frontier vài bậc. Thế nhưng với giá $0 mỗi token, nó vẫn là model lập trình đáng tiền nhất hiện nay. Đây là toàn cảnh.
Cái tiêu đề 80% ra đời thế nào
Vài ngày sau khi ox-alpha xuất hiện trên OpenRouter, một developer tự xưng là @davis7 đăng so sánh trên DeepSWE: trên 80% cho ox-alpha, đối với 65% của Claude Fable 5 và 52% của GPT-5.6-sol. Ảnh chụp lan truyền và câu chuyện "mô hình stealth đánh bại frontier" tự viết lấy mình.
Công bằng thì phải nói: chính @davis7 đã cảnh báo trong cùng thread rằng mẫu 10 nhiệm vụ có phương sai khổng lồ. Chạy đủ 113 nhiệm vụ chứng minh cảnh báo đó đúng.
Kết nối Claude hoặc Codex bạn đã trả tiền — phần còn lại do worker chi phí chỉ bằng một phần nhỏ đảm nhiệm.
Tải meshcode →Chạy đầy đủ đo được gì
Một phép đo độc lập trên toàn bộ 113 nhiệm vụ DeepSWE (MatchaOnMuffins/oxalpha) cho kết quả:
- Tỷ lệ giải được 58,4% (66/113), CI 95% [49,2%, 67,1%]
- 80% số nhiệm vụ pass ≥90% test fail-to-pass — nhiệm vụ nào giải được là giải thật
- 9,7% tổn thất benchmark do lỗi định dạng tool-call — không phải lỗi suy luận
Các đánh giá bên thứ ba quy mô lớn hơn hội tụ quanh 62,8–63%. Đọc cho tử tế: ox-alpha nằm ở đầu khoảng 60, vẫn còn bất định thật sự ở hai đầu khoảng tin cậy.
Vị trí trên bảng xếp hạng
| Mô hình (cấu hình) | DeepSWE |
|---|---|
| Claude Opus 5, max reasoning | 74% ±4% |
| GPT-5.6 Sol, max reasoning | 73% ±3% |
| Claude Fable 5 | 70% ±4% |
| GLM-5.3 / Kimi K3 | 69% |
| DeepSeek V4 Pro | 63% ±6% |
| Ox Alpha (chạy bởi bên thứ ba) | ~58–63% |
Bảng này cần hai chú thích. Một: ox-alpha không có mục chính thức trên leaderboard nào — mọi con số đều đến từ harness của người khác. Hai: so sánh ban đầu "ngang ngửa GPT-5.6-sol" là so với cấu hình Sol tầm trung; Sol ở max reasoning vẫn cao hơn khoảng 10 điểm.
Con số thú vị nhất không phải là điểm số
Đó là 9,7% bị mất vì lỗi định dạng tool-call: những nhiệm vụ mà suy luận của model đúng nhưng phát lệnh gọi công cụ sai định dạng nên harness tính là thất bại. Hai hệ quả:
- Trần cao hơn điểm số. Gần 10 điểm là vấn đề đường ống chứ không phải trí tuệ — mà đường ống cải thiện nhanh, cả qua cập nhật model lẫn sửa harness.
- Harness của bạn thay đổi điểm số. Một coding agent thực sự stream từng lệnh gọi công cụ, kiểm tra hợp lệ và retry sạch sẽ sẽ lấy lại những điểm mà vòng lặp API trần trụi làm rơi. Đó chính xác là lý do môi trường agent đầy đủ tồn tại — thay vì đoán model muốn làm gì, bạn nhìn thấy từng lệnh gọi công cụ hạ cánh theo thời gian thực.
Kết luận cho người dùng thực chiến
- "Đánh bại GPT-5.6 Sol" — không. Ai còn nhại số 80% là đang trích mẫu 10 nhiệm vụ.
- "Hiệu năng tầm DeepSeek-V4-Pro với $0" — có. Tính theo chi phí mỗi điểm DeepSWE, đây là model lập trình rẻ nhất có thể mua hôm nay.
- Phù hợp nhất với công việc agent quy mô lớn: session dài, pane song song, sub-agent fan-out — những workload mà chi phí thống trị, và model đầu khoảng 60 với context 1M là dư dả.
Muốn đọc phía bí ẩn? Ai đã tạo ra ox-alpha xếp mọi manh mối danh tính theo độ mạnh của bằng chứng. Còn để chạy thật — bốn pane song song, $0 mỗi token — xem ox-alpha trong MeshCode.
Các con số benchmark là phép đo của bên thứ ba tính đến 26 tháng 8 năm 2026; không có mục leaderboard chính thức và có thể khác đi tùy harness hoặc phiên bản model. Ox Alpha được phân phối ẩn danh qua OpenRouter; MeshCode không liên kết với nhà phát triển.