विचार नेता

ओपन मॉडल लगातार बेहतर होते जा रहे हैं। आर्थिक स्थितियाँ और जटिल होती जा रही हैं।

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

AI मॉडल स्पष्ट रूप से 18 महीने पहले की तुलना में बेहतर हैं। लेकिन जब मैंने गहराई से जांच शुरू की, तो उस प्रगति की सामान्य व्याख्याएँ समझ नहीं आईं।

वे सिर्फ बड़े होने के कारण बेहतर नहीं हुए। “ओपन सोर्स जीत रहा है” केवल आधा सच है। और बेंचमार्क स्कोर देखना एक सलाह के रूप में मेरे अनुमान से काफी कम उपयोगी निकला। यह बात मुझे स्वीकार करने में कुछ समय लगा।

इसलिए मैंने आठ प्रयोगशालाओं के 46 मॉडलों से 18 महीने का डेटा एकत्र किया। मैं यह समझना चाहता था कि क्या बुद्धिमत्ता एक वस्तु बन रही है, क्या ओपन मॉडल फ्रंटियर तक पहुँच रहे हैं, और कंपनियों को सिस्टम चुनते समय किन मापदंडों को देखना चाहिए।

मुख्य निष्कर्ष सरल था: बेंचमार्क स्कोर वास्तव में मॉडल की विशेषता नहीं है। यह मॉडल, उसके आसपास का सॉफ़्टवेयर और संदर्भ, तथा इसे उपयोग करने की अनुमति दी गई समय और कंप्यूटिंग शक्ति को दर्शाता है। एक ही संख्या प्रकाशित करने से आप अन्य दो पहलुओं को छिपा देते हैं।

हालाँकि, निहितार्थ बहुत व्यापक हैं। कंपनियाँ व्यक्तिगत मॉडलों की तुलना कर रही हैं, जबकि उन्हें उस संपूर्ण प्रणाली का मूल्यांकन करना चाहिए जो कार्य को पूरा करती है।

बेंचमार्क सिस्टम को छिपाते हैं

जब मैंने संयुक्त स्कोर देखना बंद कर दिया और मॉडल को परीक्षण दर परीक्षण तुलना की, तो प्रमुख ओपन-वेट और स्वामित्व वाले मॉडलों के बीच अंतर एक ही संख्या नहीं था।

SWE-bench Verified पर, जो कई मॉडल घोषणाओं में दिखाया गया एक पुराना परीक्षण है, अंतर 0.2 अंक था। SWE-bench Pro पर, जो वास्तविक, बहुभाषी सॉफ़्टवेयर कार्य के लिए मानकीकृत सेटअप के साथ डिज़ाइन किया गया नया परीक्षण है, अंतर 18.2 अंक था।

प्रकट मॉडल अंतर बेंचमार्क पर निर्भर करता है

बेंचमार्क अंतर स्थिति
SWE-bench Verified 0.2 pts संतृप्त, दूषितता संकेतित
GPQA Diamond 2.0 pts संतृप्त, सीमा लगभग 92–95%
Terminal-Bench 2.1 4.9 pts लाइव, एजेंटिक
Humanity’s Last Exam 9.8 pts सजीव, फ्रंटियर तर्क
SWE-bench Pro 18.2 pts सजीव, मानकीकृत ढांचा

स्रोत: Jaspreet Singh का अग्रणी ओपन-वेट और स्वामित्व मॉडल विश्लेषण, जुलाई 2026।

एक ही मॉडल को अलग-अलग स्कोर मिल सकते हैं यह इस बात पर निर्भर करता है कि परीक्षण कौन कर रहा है। Kimi K3 ने स्वतंत्र मूल्यांकन में Terminal-Bench 2.1 पर 80.9% स्कोर प्राप्त किया और जब इसके निर्माता ने परिणाम बताया तो 88.3% स्कोर मिला। यह 7.4 अंक का अंतर उन तीन बेंचमार्कों में खुले बनाम फ्रंटियर अंतर से बड़ा है जिन्हें मैंने विश्लेषित किया।

एक मॉडल को आसपास के सॉफ़्टवेयर से निर्देश मिलते हैं, उसे दिए गए संदर्भ पर निर्भर करता है, वह उन उपकरणों का उपयोग करता है जो उसके पास हैं, और डेवलपर द्वारा निर्धारित तर्क बजट के भीतर कार्य करता है। इन शर्तों को बदलने पर परिणाम भी बदल जाता है।

सार्वजनिक बेंचमार्क प्रगति की दिशा को समझने में उपयोगी होते हैं। लेकिन वे यह तय करने के लिए कमजोर आधार हैं कि आपकी कंपनी के भीतर क्या काम करेगा।

एजेंटिक विश्वसनीयता गणित को बदलती है

जैसे-जैसे AI प्रश्नों के उत्तर देने से कार्यों की श्रृंखला पूरी करने की ओर बढ़ता है, यह अधिक महत्वपूर्ण हो जाता है।

एक कार्यप्रवाह जिसमें 20 चरण हों, और AI प्रत्येक चरण को 95% बार सही करता हो, कल्पना करें। यह विश्वसनीय लग सकता है। लेकिन पूरी श्रृंखला में, कार्यप्रवाह केवल 36% समय सफल होता है।

एक बेहतर मॉडल प्रत्येक चरण में संभावना को सुधार सकता है, विशेष रूप से कठिन एजेंटिक कार्यों में। यह आसपास की इंजीनियरिंग तय करती है कि एक खराब चरण काम को बर्बाद कर देता है या नहीं। प्रगति को सहेजना, आउटपुट की पुष्टि करना, सुरक्षित रूप से पुनः प्रयास करना, और विफलता से पुनर्प्राप्त होना अक्सर एक प्रभावशाली प्रदर्शन को भरोसेमंद उत्पाद से अलग करता है।

मॉडल चयन अभी भी महत्वपूर्ण है। लेकिन सबसे अधिक स्कोर वाला मॉडल स्वचालित रूप से सबसे भरोसेमंद प्रणाली नहीं बनाता।

कार्य के आधार पर मॉडल चुनें

डेटा एक संकीर्ण निष्कर्ष का समर्थन करता है, जो आमतौर पर ओपन बनाम स्वामित्व बहस के दोनों पक्षों द्वारा दिया जाता है।

ओपन-वेट मॉडल उन स्पष्ट, अल्पकालिक कार्यों में प्रतिस्पर्धी होते हैं जहाँ परिणाम को सीधे मापा जा सकता है। वर्गीकरण, निष्कर्षण, सारांशण, और संरचित जनरेशन धीरे-धीरे इस श्रेणी में आते जा रहे हैं।

फ्रंटियर मॉडल अभी भी लंबी एजेंटिक कार्यों, दबाव में निर्देशों का पालन, और उन कार्यों में जहाँ विफलता का पता बाद में लगना महंगा होता है, पर अपना प्रीमियम कमाते हैं। यही वह क्षेत्र है जहाँ नए बेंचमार्क शून्य की तुलना में लगभग 18 अंक का अंतर दिखाते हैं, और जहाँ मॉडल विक्रेता द्वारा प्रदान की गई सुरक्षा परत का मूल्य होता है।

कंपनियों को कार्य के अनुसार मॉडल चुनने चाहिए, लेकिन उन्हें यह नहीं मानना चाहिए कि स्विच करना मुफ्त है। संदर्भ, तर्क और प्रॉम्प्ट कैश प्रदाताओं के बीच साफ़‑सुथरे ढंग से नहीं चलते। यदि सिस्टम बदलने से काम को फिर से शुरू करना पड़े या इंजीनियरिंग और गवर्नेंस की अतिरिक्त परतें जुड़ जाएँ, तो सस्ता मॉडल भी अधिक महंगा हो सकता है।

मॉडल का चयन कम स्थायी होता जा रहा है। स्विच करना अभी भी एक वास्तु‑निर्णय है।

जैसे-जैसे बुद्धिमत्ता सस्ती होती जा रही है, निर्णय अभी भी महंगा रहता है

कुशल सामान्य‑उद्देश्य क्षमता अत्यधिक सस्ती होती जा रही है। हालांकि, वक्र के शीर्ष पर प्रत्येक अतिरिक्त प्रदर्शन बिंदु की लागत पिछले से अधिक होती है। क्षमता के अंतिम नौ बिंदुओं की लागत लगभग दस गुना होती है जो उनके नीचे के सभी बिंदुओं की लागत है।

अधिकांश कंपनियों को हर अनुरोध के लिए सबसे शक्तिशाली मॉडल की आवश्यकता नहीं होती। उन्हें यह जानना आवश्यक है कि कौन सा कार्य इसके योग्य है।

सारांश बनाना, निकालना, वर्गीकृत करना, ड्राफ्ट तैयार करना और अनुवाद करना उपयोगिता क्षमता की ओर बढ़ रहे हैं। जो अभी भी दुर्लभ है वह निर्णय है: पाँच संभावित उत्तरों में से सही उत्तर को जानना, यह पहचानना कि प्रश्न गलत था, और यह तय करना कि कब रुककर मानव से पूछना है।

निर्णय स्वामित्व वाले संदर्भ, व्यावसायिक नियम, कार्यप्रवाह, ऐतिहासिक ज्ञान और उस इंजीनियरिंग से आता है जो काम की पुष्टि करती है और विफलता को नियंत्रित करती है।

ऐसी मूल्यांकन प्रणाली बनाएं जिसे कोई और नहीं चला सके

एक उद्यम के लिए सबसे मूल्यवान बेंचमार्क उसके अपने कार्य से निर्मित होता है।

अपने व्यवसाय के 50 से 200 वास्तविक कार्यों के साथ एक निजी मूल्यांकन सेट बनाएं। आसपास की प्रणाली को स्थिर रखें, परीक्षणों को बार‑बार चलाएँ, और यह अंकित करें कि कार्य सही ढंग से पूरा हुआ या नहीं, न कि उत्तर की परिष्कार पर।

लागत पर भी वही अनुशासन लागू करें। टोकन प्रति लागत भ्रामक हो सकती है जब कोई मॉडल अधिक समय तक तर्क करता है, अधिक पुनः प्रयासों की आवश्यकता होती है, या मानव समीक्षक के लिए अधिक काम उत्पन्न करता है। इसके बजाय स्वीकृत परिणाम प्रति लागत को मापें।

छोटे संख्या में मॉडलों से शुरू करें। कार्य को नौकरी की शुरुआत में ही रूट करें, न कि मध्य में प्रदाता बदलें। प्रत्येक अतिरिक्त प्रदाता के सुरक्षा, गवर्नेंस और संचालन भार को उसकी विज्ञापित कीमत के साथ गिनें।

बाजार नए बेंचमार्क विजेताओं का उत्पादन करता रहेगा, और कंपनियां प्रत्येक के आसपास अपनी एआई रणनीति पुनः बनाने के लिए आकर्षित होती रहेंगी। एक बेहतर तरीका यह है कि कार्य के लिए मॉडल चुनें, फिर उस स्थिति में पूरी प्रणाली का मूल्यांकन करें जहाँ उसे प्रदर्शन करना है।

वह बेंचमार्क जो आपके आर्किटेक्चर को दिशा देनी चाहिए, वही है जिसे केवल आपकी कंपनी चला सकती है।

संस्थापक और सीईओ, जसप्रीत सिंह, उत्पाद दृष्टि और सामान्य प्रबंधक अनुभव का संयोजन लाते हैं और उन्होंने Druva को बहु-अरब डॉलर डेटा संरक्षण और प्रबंधन उद्योग में सबसे तेज़ी से बढ़ती कंपनियों में से एक बना दिया है। उनकी उद्यमशील भावना ने उन्हें Druva को शुरू से स्थापित करने में सक्षम बनाया, जो अब $2 बिलियन से अधिक मूल्यांकन वाला है और क्लाउड युग को अपनाने में अग्रणी हजारों कंपनियों द्वारा विश्वभर में भरोसा किया जाता है। उनकी बाजार और प्रौद्योगिकी अंतर्दृष्टियों ने उन्हें पहला क्लाउड-नेटिव डेटा संरक्षण प्लेटफ़ॉर्म बनाने के लिए प्रेरित किया, जो नवाचारी तकनीकी समाधान और एक विशिष्ट उपभोग मॉडल प्रदान करता है, जो पुरानी हार्डवेयर और सॉफ़्टवेयर की विरासत को बाधित करता है।

Druva शुरू करने से पहले, जसप्रीत ने Veritas और Ensim Corp. में बुनियादी भूमिकाएँ निभाई थीं। अतिरिक्त रूप से, उनके पास कई पेटेंट हैं और उन्होंने Indian Institute of Technology, Guwahati से कंप्यूटर विज्ञान में बी.एस. किया है।