arrow_back सभी posts
26 अगस्त 2026 · 5 मिनट का पढ़ना · meshcode

ox-alpha बेंचमार्क समझाए गए: नंबर असल में क्या कहते हैं

वायरल 'DeepSWE पर 80% — GPT-5.6 Sol को हराया' दावा 10-टास्क के सैंपल से आया था। पूरे 113-टास्क रन में 58.4% मिला। सारे नंबर, टूल-कॉल फेलियर का हिस्सा, और एजेंटिक काम के लिए इसका मतलब।

छोटा जवाब: नहीं, ox-alpha ने GPT-5.6 Sol को नहीं हराया। वायरल 80% एक 10-टास्क सैंपल से आया था — जिसकी ऊँची वैरिएंस की चेतावनी लेखक ने ख़ुद दी थी। पूरे 113-टास्क रन में 58.4% (95% CI: 49.2–67.1%) मिला, और बड़े मूल्यांकन 62.8–63% पर अभिसरित होते हैं — DeepSeek V4 Pro का इलाक़ा, फ्रॉन्टियर शिखर से कई सीढ़ियाँ नीचे। फिर भी $0 प्रति टोकन पर यह आज कोडिंग मॉडलों में सबसे बेहतरीन वैल्यू है। पूरी तस्वीर यहाँ है।

80% वाली हेडलाइन कैसे बनी

ox-alpha के OpenRouter पर उभरने के कुछ दिनों बाद @davis7 नाम के एक डेवलपर ने DeepSWE तुलना पोस्ट की: ox-alpha को 80% से ज़्यादा, मुक़ाबले में Claude Fable 5 के 65% और GPT-5.6-sol के 52%। स्क्रीनशॉट वायरल हो गए और "स्टेल्थ मॉडल ने फ्रॉन्टियर हरा दी" की कहानी अपने आप लिख ली गई।

उन्हें यह देना होगा: @davis7 ने उसी थ्रेड में चेतावनी दी थी कि 10-टास्क सैंपल की वैरिएंस बहुत ऊँची होती है। पूरे रन ने साबित कर दिया कि चेतावनी सही थी।

जो Claude या Codex आप पहले से pay कर रहे हैं उसे connect करें — बाकी सब बहुत कम लागत वाले workers करेंगे।

meshcode डाउनलोड करें →

पूरे रन ने क्या मापा

सभी 113 DeepSWE टास्क पर एक स्वतंत्र माप (MatchaOnMuffins/oxalpha) ने दिया:

  • सॉल्यूशन रेट 58.4% (66/113), 95% CI [49.2%, 67.1%]
  • 80% टास्क में ≥90% fail-to-pass टेस्ट पास — जो हल होता है, सचमुच हल होता है
  • बेंचमार्क नुक़सान का 9.7% टूल-कॉल फ़ॉर्मैट फेलियर था — रीज़निंग फेलियर नहीं

बड़े थर्ड-पार्टी मूल्यांकन 62.8–63% के आसपास अभिसरित होते हैं। ईमानदार पढ़ाई: ox-alpha 60 के शुरुआती दशक में बैठता है, और कॉन्फ़िडेंस इंटरवल के दोनों सिरों पर असल अनिश्चितता है।

लीडरबोर्ड में जगह

मॉडल (कॉन्फ़िगरेशन) DeepSWE
Claude Opus 5, max reasoning 74% ±4%
GPT-5.6 Sol, max reasoning 73% ±3%
Claude Fable 5 70% ±4%
GLM-5.3 / Kimi K3 69%
DeepSeek V4 Pro 63% ±6%
Ox Alpha (थर्ड-पार्टी रन) ~58–63%

इस टेबल के नीचे दो फ़ुटनोट चाहिए। पहला: ox-alpha का कोई ऑफ़िशियल लीडरबोर्ड एंट्री नहीं है — हर नंबर किसी और के हार्नेस से आता है। दूसरा: शुरुआती "GPT-5.6-sol के बराबर" तुलना mid-tier Sol कॉन्फ़िगरेशन के ख़िलाफ़ थी; max reasoning पर Sol अब भी क़रीब 10 पॉइंट ऊपर है।

सबसे दिलचस्प नंबर स्कोर नहीं है

वह है टूल-कॉल फ़ॉर्मैट फेलियर से खोया हुआ 9.7%: वे टास्क जहाँ मॉडल की रीज़निंग सही थी पर टूल कॉल ग़लत फ़ॉर्मैट में निकला और हार्नेस ने उसे फेल गिना। दो निहितार्थ:

  1. छत स्कोर से ऊँची है। क़रीब 10 पॉइंट प्लंबिंग की समस्या है, इंटेलिजेंस की नहीं — और प्लंबिंग जल्दी सुधरती है, मॉडल अपडेट और हार्नेस फ़िक्स दोनों से।
  2. आपका हार्नेस स्कोर बदलता है। एक कोडिंग एजेंट जो असली टूल कॉल स्ट्रीम करता है, उन्हें वैलिडेट करता है और साफ़ तरीक़े से रीट्राइ करता है, वह वे पॉइंट वापस ले लेता है जो नंगे API लूप गिरा देता है। पूरे एजेंटिक एनवायरनमेंट का मौजूद होना ठीक इसीलिए है — मॉडल के "असली इरादे" का अंदाज़ा लगाने की बजाय आप हर टूल कॉल को रीयल-टाइम में उतरते देखते हैं।

प्रैक्टिशनर्स के लिए निष्कर्ष

  • "GPT-5.6 Sol को हराया" — नहीं। जो लोग अब भी 80% दोहरा रहे हैं, वे 10-टास्क सैंपल को कोट कर रहे हैं।
  • "$0 में DeepSeek-V4-Pro-स्तर की परफ़ॉर्मेंस" — हाँ। हर DeepSWE पॉइंट की क़ीमत के हिसाब से यह आज उपलब्ध सबसे सस्ता कोडिंग मॉडल है।
  • सबसे अच्छा फ़िट वॉल्यूम वाला एजेंटिक काम: लंबे सेशन, समानांतर पेन, fan-out सबएजेंट — वे वर्कलोड जहाँ लागत हावी होती है और 60 के शुरुआती दशक का मॉडल, 1M कॉन्टेक्स्ट के साथ, भरपूर है।

मिस्ट्री वाला पहलू? ox alpha किसने बनाया में हमने हर पहचान सुराग़ को मज़बूती के क्रम में रखा है। इसे चलाने के लिए — चार पेन समानांतर, $0 प्रति टोकन — देखें MeshCode में ox-alpha


बेंचमार्क नंबर 26 अगस्त 2026 तक के थर्ड-पार्टी माप हैं; कोई ऑफ़िशियल लीडरबोर्ड एंट्री नहीं है और हार्नेस या मॉडल वर्ज़न के हिसाब से ये बदल सकते हैं। Ox Alpha OpenRouter के ज़रिए गुमनाम तरीक़े से उपलब्ध है; MeshCode इसके डेवलपर से संबद्ध नहीं है।

ox-alphaबेंचमार्कDeepSWEGPT-5.6कोडिंग एजेंटOpenRouterस्टेल्थ मॉडल