ox-alpha बेंचमार्क समझाए गए: नंबर असल में क्या कहते हैं
वायरल 'DeepSWE पर 80% — GPT-5.6 Sol को हराया' दावा 10-टास्क के सैंपल से आया था। पूरे 113-टास्क रन में 58.4% मिला। सारे नंबर, टूल-कॉल फेलियर का हिस्सा, और एजेंटिक काम के लिए इसका मतलब।
छोटा जवाब: नहीं, ox-alpha ने GPT-5.6 Sol को नहीं हराया। वायरल 80% एक 10-टास्क सैंपल से आया था — जिसकी ऊँची वैरिएंस की चेतावनी लेखक ने ख़ुद दी थी। पूरे 113-टास्क रन में 58.4% (95% CI: 49.2–67.1%) मिला, और बड़े मूल्यांकन 62.8–63% पर अभिसरित होते हैं — DeepSeek V4 Pro का इलाक़ा, फ्रॉन्टियर शिखर से कई सीढ़ियाँ नीचे। फिर भी $0 प्रति टोकन पर यह आज कोडिंग मॉडलों में सबसे बेहतरीन वैल्यू है। पूरी तस्वीर यहाँ है।
80% वाली हेडलाइन कैसे बनी
ox-alpha के OpenRouter पर उभरने के कुछ दिनों बाद @davis7 नाम के एक डेवलपर ने DeepSWE तुलना पोस्ट की: ox-alpha को 80% से ज़्यादा, मुक़ाबले में Claude Fable 5 के 65% और GPT-5.6-sol के 52%। स्क्रीनशॉट वायरल हो गए और "स्टेल्थ मॉडल ने फ्रॉन्टियर हरा दी" की कहानी अपने आप लिख ली गई।
उन्हें यह देना होगा: @davis7 ने उसी थ्रेड में चेतावनी दी थी कि 10-टास्क सैंपल की वैरिएंस बहुत ऊँची होती है। पूरे रन ने साबित कर दिया कि चेतावनी सही थी।
जो Claude या Codex आप पहले से pay कर रहे हैं उसे connect करें — बाकी सब बहुत कम लागत वाले workers करेंगे।
meshcode डाउनलोड करें →पूरे रन ने क्या मापा
सभी 113 DeepSWE टास्क पर एक स्वतंत्र माप (MatchaOnMuffins/oxalpha) ने दिया:
- सॉल्यूशन रेट 58.4% (66/113), 95% CI [49.2%, 67.1%]
- 80% टास्क में ≥90% fail-to-pass टेस्ट पास — जो हल होता है, सचमुच हल होता है
- बेंचमार्क नुक़सान का 9.7% टूल-कॉल फ़ॉर्मैट फेलियर था — रीज़निंग फेलियर नहीं
बड़े थर्ड-पार्टी मूल्यांकन 62.8–63% के आसपास अभिसरित होते हैं। ईमानदार पढ़ाई: ox-alpha 60 के शुरुआती दशक में बैठता है, और कॉन्फ़िडेंस इंटरवल के दोनों सिरों पर असल अनिश्चितता है।
लीडरबोर्ड में जगह
| मॉडल (कॉन्फ़िगरेशन) | DeepSWE |
|---|---|
| Claude Opus 5, max reasoning | 74% ±4% |
| GPT-5.6 Sol, max reasoning | 73% ±3% |
| Claude Fable 5 | 70% ±4% |
| GLM-5.3 / Kimi K3 | 69% |
| DeepSeek V4 Pro | 63% ±6% |
| Ox Alpha (थर्ड-पार्टी रन) | ~58–63% |
इस टेबल के नीचे दो फ़ुटनोट चाहिए। पहला: ox-alpha का कोई ऑफ़िशियल लीडरबोर्ड एंट्री नहीं है — हर नंबर किसी और के हार्नेस से आता है। दूसरा: शुरुआती "GPT-5.6-sol के बराबर" तुलना mid-tier Sol कॉन्फ़िगरेशन के ख़िलाफ़ थी; max reasoning पर Sol अब भी क़रीब 10 पॉइंट ऊपर है।
सबसे दिलचस्प नंबर स्कोर नहीं है
वह है टूल-कॉल फ़ॉर्मैट फेलियर से खोया हुआ 9.7%: वे टास्क जहाँ मॉडल की रीज़निंग सही थी पर टूल कॉल ग़लत फ़ॉर्मैट में निकला और हार्नेस ने उसे फेल गिना। दो निहितार्थ:
- छत स्कोर से ऊँची है। क़रीब 10 पॉइंट प्लंबिंग की समस्या है, इंटेलिजेंस की नहीं — और प्लंबिंग जल्दी सुधरती है, मॉडल अपडेट और हार्नेस फ़िक्स दोनों से।
- आपका हार्नेस स्कोर बदलता है। एक कोडिंग एजेंट जो असली टूल कॉल स्ट्रीम करता है, उन्हें वैलिडेट करता है और साफ़ तरीक़े से रीट्राइ करता है, वह वे पॉइंट वापस ले लेता है जो नंगे API लूप गिरा देता है। पूरे एजेंटिक एनवायरनमेंट का मौजूद होना ठीक इसीलिए है — मॉडल के "असली इरादे" का अंदाज़ा लगाने की बजाय आप हर टूल कॉल को रीयल-टाइम में उतरते देखते हैं।
प्रैक्टिशनर्स के लिए निष्कर्ष
- "GPT-5.6 Sol को हराया" — नहीं। जो लोग अब भी 80% दोहरा रहे हैं, वे 10-टास्क सैंपल को कोट कर रहे हैं।
- "$0 में DeepSeek-V4-Pro-स्तर की परफ़ॉर्मेंस" — हाँ। हर DeepSWE पॉइंट की क़ीमत के हिसाब से यह आज उपलब्ध सबसे सस्ता कोडिंग मॉडल है।
- सबसे अच्छा फ़िट वॉल्यूम वाला एजेंटिक काम: लंबे सेशन, समानांतर पेन, fan-out सबएजेंट — वे वर्कलोड जहाँ लागत हावी होती है और 60 के शुरुआती दशक का मॉडल, 1M कॉन्टेक्स्ट के साथ, भरपूर है।
मिस्ट्री वाला पहलू? ox alpha किसने बनाया में हमने हर पहचान सुराग़ को मज़बूती के क्रम में रखा है। इसे चलाने के लिए — चार पेन समानांतर, $0 प्रति टोकन — देखें MeshCode में ox-alpha।
बेंचमार्क नंबर 26 अगस्त 2026 तक के थर्ड-पार्टी माप हैं; कोई ऑफ़िशियल लीडरबोर्ड एंट्री नहीं है और हार्नेस या मॉडल वर्ज़न के हिसाब से ये बदल सकते हैं। Ox Alpha OpenRouter के ज़रिए गुमनाम तरीक़े से उपलब्ध है; MeshCode इसके डेवलपर से संबद्ध नहीं है।