arrow_back บทความทั้งหมด
26 สิงหาคม 2569 · 5 นาทีในการอ่าน · meshcode

อธิบายคะแนนเบนช์มาร์ก ox-alpha: ตัวเลขพูดอะไรกันแน่

ข่าวไวรัล '80% ใน DeepSWE — เอาชนะ GPT-5.6 Sol' มาจากตัวอย่าง 10 งาน รันเต็ม 113 งานได้ 58.4% รวมทุกตัวเลข ปัจจัย tool-call ล้มเหลว และความหมายต่องานเอเจนต์

คำตอบสั้น: ไม่ใช่ ox-alpha เอาชนะ GPT-5.6 Sol ไม่ได้ ตัวเลข 80% ที่ไวรัลมาจากตัวอย่าง 10 งานที่ผู้เขียนเองเตือนว่าความแปรปรวนสูง รันเต็มทั้ง 113 งานได้ 58.4% (CI 95%: 49.2–67.1%) และการประเมินที่ใหญ่กว่าลู่เข้าที่ 62.8–63% — ดินแดนของ DeepSeek V4 Pro ต่ำกว่ายอด frontier อยู่หลายขั้น แต่ด้วยราคา $0 ต่อ token ก็ยังเป็นโมเดลโค้ดดิ้งที่คุ้มค่าที่สุดตอนนี้ นี่คือภาพเต็ม

พาดหัว 80% เกิดขึ้นได้อย่างไร

ไม่กี่วันหลัง ox-alpha ปรากฏบน OpenRouter นักพัฒนาที่ใช้ชื่อ @davis7 โพสต์การเทียบ DeepSWE: ox-alpha ได้เกิน 80% เทียบกับ Claude Fable 5 ที่ 65% และ GPT-5.6-sol ที่ 52% ภาพหน้าจอแพร่กระจาย และเรื่องเล่า "โมเดลสเตลธ์เอาชนะ frontier" ก็ถูกเขียนขึ้นเอง

ต้องยกให้เขาตรงนี้: @davis7 เตือนไว้ในเธรดเดียวกันว่า ตัวอย่าง 10 งานมีความแปรปรวนมหาศาล รันเต็มพิสูจน์ว่าคำเตือนนั้นถูก

เชื่อมต่อ Claude หรือ Codex ที่คุณจ่ายอยู่แล้ว — ที่เหลือให้เวิร์กเกอร์ที่ต้นทุนถูกกว่าหลายเท่าจัดการ

ดาวน์โหลด meshcode →

รันเต็มวัดอะไรได้

การวัดอิสระครบทั้ง 113 งานของ DeepSWE (MatchaOnMuffins/oxalpha) ให้ผล:

  • อัตราการแก้ปัญหา 58.4% (66/113) CI 95% [49.2%, 67.1%]
  • 80% ของงานผ่านเทส fail-to-pass ≥90% — งานที่แก้ได้คือแก้จริง
  • 9.7% ของความสูญเสียในเบนช์มาร์กคือ tool-call รูปแบบผิดพลาด — ไม่ใช่ความล้มเหลวของการให้เหตุผล

การประเมินภายนอกที่ใหญ่กว่าลู่เข้าที่ราว 62.8–63% การอ่านอย่างซื่อตรง: ox-alpha อยู่แถว ต้น 60 โดยยังมีความไม่แน่นอนจริงทั้งสองปลายช่วงเชื่อมั่น

จุดยืนในตาราง

โมเดล (การตั้งค่า) DeepSWE
Claude Opus 5, max reasoning 74% ±4%
GPT-5.6 Sol, max reasoning 73% ±3%
Claude Fable 5 70% ±4%
GLM-5.3 / Kimi K3 69%
DeepSeek V4 Pro 63% ±6%
Ox Alpha (รันโดยบุคคลที่สาม) ~58–63%

ตารางนี้ต้องมีเชิงอรรถสองข้อ หนึ่ง ox-alpha ไม่มีช่องในลีดเดอร์บอร์ดทางการ — ทุกตัวเลขมาจาก harness ของคนอื่น สอง การเทียบช่วงแรก "เทียบเท่า GPT-5.6-sol" เทียบกับ การตั้งค่า Sol ระดับกลาง ส่วน Sol ที่ max reasoning ยังสูงกว่าอยู่ราว 10 คะแนน

ตัวเลขที่น่าสนใจที่สุดไม่ใช่คะแนน

แต่คือ 9.7% ที่หายไปเพราะ tool-call รูปแบบผิดพลาด: งานที่การให้เหตุผลของโมเดลถูกต้อง แต่ปล่อย tool-call ออกมาในรูปแบบที่ใช้ไม่ได้ harness จึงนับเป็นความล้มเหลว มีนัยสองข้อ:

  1. เพดานสูงกว่าคะแนน คะแนนเกือบ 10 คือเรื่องท่อประปา ไม่ใช่ความฉลาด — และท่อประปาดีขึ้นเร็ว ทั้งจากอัปเดตโมเดลและแก้ harness
  2. harness ของคุณเปลี่ยนคะแนนได้ เอเจนต์โค้ดดิ้งที่ stream tool-call จริง ตรวจสอบ แล้ว retry อย่างสะอาด จะเก็บคะแนนคืนที่ API loop เปล่าๆ ทำหล่น นั่นแหละคือเหตุผลที่สภาพแวดล้อมเอเจนต์เต็มรูปแบบมีอยู่ — แทนที่จะเดาว่าโมเดลตั้งใจทำอะไร คุณเห็นทุก tool-call ลงจอแบบ real-time

บทสรุปสำหรับผู้ใช้จริง

  • "เอาชนะ GPT-5.6 Sol" — ไม่จริง คนที่ยังพูดซ้ำ 80% กำลังอ้างตัวอย่าง 10 งาน
  • "ประสิทธิภาพระดับ DeepSeek-V4-Pro ในราคา $0" — จริง คิดเป็นต้นทุนต่อคะแนน DeepSWE มันคือโมเดลโค้ดดิ้งที่ถูกที่สุดที่ซื้อได้วันนี้
  • เหมาะที่สุดกับ งานเอเจนต์เชิงปริมาณ: เซสชันยาว, pane ขนาน, ซับเอเจนต์แบบ fan-out — เวิร์กโหลดที่ต้นทุนคือพระเจ้า และโมเดลต้น 60 กับคอนเท็กซ์ 1M ฟุ่มเฟือยพอดี

อยากอ่านฝั่งปริศนา? ใครสร้าง ox-alpha เรียงทุกเบาะแสอัตลักษณ์ตามน้ำหนักหลักฐาน ส่วนจะเอาไปใช้จริง — สี่ pane ขนาน $0 ต่อ token — ดูที่ ox-alpha ใน MeshCode


ตัวเลขเบนช์มาร์กเป็นการวัดโดยบุคคลที่สาม ณ วันที่ 26 สิงหาคม 2026; ไม่มีช่องทางการในลีดเดอร์บอร์ด และอาจต่างไปตาม harness หรือเวอร์ชันโมเดล Ox Alpha ถูกเผยแพร่แบบไม่ระบุตัวผ่าน OpenRouter; MeshCode ไม่มีส่วนเกี่ยวข้องกับผู้พัฒนา

ox-alphaเบนช์มาร์กDeepSWEGPT-5.6เอเจนต์โค้ดดิ้งOpenRouterโมเดลสเตลธ์