एआई मॉडल और प्लेटफ़ॉर्म

एलेन एआई का टुलु 3 डीपसीक का अप्रत्याशित प्रतिद्वंद्वी बन गया है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

समाचार लगातार आ रहे हैं। डीपसीक के मॉडल बेंचमार्क को चुनौती दे रहे हैं, नए मानक स्थापित कर रहे हैं और बहुत शोर कर रहे हैं। लेकिन एआई अनुसंधान दृश्य में कुछ दिलचस्प हुआ है जो आपके ध्यान देने योग्य है।

एलेन एआई ने अपने नए टुलु 3 मॉडल परिवार को चुपचाप जारी किया है, और उनके 405B पैरामीटर संस्करण न केवल डीपसीक के साथ प्रतिस्पर्धा कर रहा है – यह कुंजी बेंचमार्क पर मेल खा रहा है या उन्हें पीछे छोड़ रहा है।

आइए इसे परिप्रेक्ष्य में रखें।

405B टुलु 3 मॉडल शीर्ष प्रदर्शनकर्ताओं जैसे डीपसीक वी3 के खिलाफ कई कार्यों में प्रतिस्पर्धा कर रहा है। हम गणित समस्याओं, कोडिंग चुनौतियों और सटीक निर्देश के पालन जैसे क्षेत्रों में तुलनात्मक या उत्कृष्ट प्रदर्शन देख रहे हैं। और वे पूरी तरह से खुले दृष्टिकोण के साथ ऐसा कर रहे हैं।

उन्होंने पूरी प्रशिक्षण पाइपलाइन, कोड और यहां तक कि उनकी नई प्रतिस्पर्धी सीखने की विधि को भी जारी किया है जिसे प्रतिस्पर्धी सीखने के साथ verifiable पुरस्कार (आरएलवीआर) कहा जाता है।

पिछले कुछ हफ्तों में इस तरह के विकास वास्तव में शीर्ष-स्तरीय एआई विकास के तरीके को बदल रहे हैं। जब एक पूरी तरह से ओपन-सोर्स मॉडल बाहर सबसे अच्छे बंद मॉडल को मेल खा सकता है, तो यह संभावनाओं को खोलता है जो पहले निजी कॉर्पोरेट दीवारों के पीछे बंद थीं।

तकनीकी लड़ाई

टुलु 3 को क्या अलग बनाता है? यह एक अनोखे चार-चरण प्रशिक्षण प्रक्रिया पर नीचे आता है जो पारंपरिक दृष्टिकोण से परे है।

आइए देखें कि एलेन एआई ने इस मॉडल का निर्माण कैसे किया:

चरण 1: रणनीतिक डेटा चयन

टीम जानती थी कि मॉडल की गुणवत्ता डेटा की गुणवत्ता से शुरू होती है। उन्होंने स्थापित डेटासेट जैसे वाइल्डचैट और ओपन असिस्टेंट को कस्टम-जनरेटेड सामग्री के साथ जोड़ा। लेकिन यहाँ मुख्य अंतर्दृष्टि है: उन्होंने बस डेटा एकत्र नहीं किया – उन्होंने गणितीय तर्क और कोडिंग प्रवीणता जैसे विशिष्ट कौशल के लिए लक्षित डेटासेट बनाए।

चरण 2: बेहतर प्रतिक्रियाएं बनाना

दूसरे चरण में, एलेन एआई ने अपने मॉडल को विशिष्ट कौशल सिखाने पर ध्यान केंद्रित किया। उन्होंने गणित, कोडिंग और सामान्य कार्यों के लिए अलग-अलग प्रशिक्षण डेटा सेट बनाए। इन संयोजनों का बार-बार परीक्षण करके, वे देख सकते थे कि मॉडल कहां उत्कृष्ट था और कहां उसे काम करने की आवश्यकता थी। यह पुनरावृत्ति प्रक्रिया ने प्रत्येक क्षेत्र में टुलु 3 द्वारा प्राप्त की जा सकने वाली वास्तविक क्षमता को प्रकट किया।

चरण 3: तुलनाओं से सीखना

यह वह जगह है जहां एलेन एआई ने रचनात्मकता दिखाई। उन्होंने एक प्रणाली बनाई जो टुलु 3 की प्रतिक्रियाओं को तुरंत अन्य शीर्ष मॉडलों के साथ तुलना कर सकती थी। लेकिन उन्होंने एआई में एक स्थायी समस्या का भी समाधान किया – मॉडल की प्रतिक्रियाओं को लंबा करने की प्रवृत्ति केवल लंबाई के लिए। उनका दृष्टिकोण, लंबाई-नॉर्मलाइज्ड डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (डीपीओ) का उपयोग करके, इसका मतलब था कि मॉडल गुणवत्ता पर मात्रा की तुलना में मूल्य सीखता है। परिणाम? प्रतिक्रियाएं जो सटीक और उद्देश्यपूर्ण दोनों हैं।

जब एआई मॉडल प्राथमिकताओं से सीखते हैं (कौन सी प्रतिक्रिया बेहतर है, ए या बी?), तो वे आमतौर पर एक निराशाजनक पूर्वाग्रह विकसित करते हैं: वे लंबी प्रतिक्रियाओं को हमेशा बेहतर मानने लगते हैं। यह जैसे कि वे अधिक बोलकर जीतने की कोशिश कर रहे हों, न कि अच्छी तरह से बोलकर।

लंबाई-नॉर्मलाइज्ड डीपीओ इसे ठीक करता है कि मॉडल प्राथमिकताओं से कैसे सीखता है। यह केवल यह नहीं देखता है कि कौन सी प्रतिक्रिया पसंद की जाती है, बल्कि प्रत्येक प्रतिक्रिया की लंबाई को भी ध्यान में रखता है। इसे प्रतिक्रियाओं को उनके गुणवत्ता प्रति शब्द से निर्णय लेने के रूप में सोचें, न कि केवल उनके कुल प्रभाव से।

यह इतना महत्वपूर्ण क्यों है? क्योंकि यह टुलु 3 को सटीक और कुशल होना सिखाता है। लंबी प्रतिक्रियाओं में अतिरिक्त शब्दों से भरने के बजाय, यह वास्तव में आवश्यक होने पर मूल्य प्रदान करना सीखता है।

यह एक छोटी सी बात लग सकती है, लेकिन यह प्राकृतिक रूप से संवाद करने वाले एआई का निर्माण करने के लिए महत्वपूर्ण है। सर्वश्रेष्ठ मानव विशेषज्ञ जानते हैं कि कब संक्षिप्त और कब विस्तार से बताना है – और यही लंबाई-नॉर्मलाइज्ड डीपीओ मॉडल को सिखाता है।

चरण 4: आरएलवीआर नवाचार

यह तकनीकी सफलता ध्यान देने योग्य है। आरएलवीआर विषयगत पुरस्कार मॉडल को ठोस सत्यापन के साथ बदलता है।

अधिकांश एआई मॉडल एक जटिल पुरस्कार मॉडल प्रणाली के माध्यम से सीखते हैं – मूल रूप से एक अच्छी प्रतिक्रिया के बारे में शिक्षित अनुमान। लेकिन एलेन एआई ने आरएलवीआर के साथ एक अलग मार्ग अपनाया।

अब एआई मॉडल को कैसे प्रशिक्षित किया जाता है, इसके बारे में सोचें। आमतौर पर, हमें अन्य एआई मॉडल (पुरस्कार मॉडल कहा जाता है) की आवश्यकता होती है ताकि यह निर्धारित किया जा सके कि क्या प्रतिक्रिया अच्छी है या नहीं। यह विषयगत, जटिल और अक्सर असंगत है। कुछ प्रतिक्रियाएं अच्छी लग सकती हैं लेकिन उनमें सूक्ष्म त्रुटियां हो सकती हैं जो छूट जाती हैं।

आरएलवीआर इस दृष्टिकोण को उलट देता है। विषयगत निर्णयों पर निर्भर होने के बजाय, यह ठोस, verifiable परिणामों का उपयोग करता है। जब मॉडल एक गणित समस्या का प्रयास करता है, तो कोई ग्रे क्षेत्र नहीं है – उत्तर या तो सही है या गलत। जब यह कोड लिखता है, तो कोड या तो सही से चलता है या नहीं।

यहाँ यह दिलचस्प हो जाता है:

  • मॉडल को तुरंत, द्विआधारी प्रतिक्रिया मिलती है: सही उत्तरों के लिए 10 अंक, गलत के लिए 0
  • आंशिक क्रेडिट या फजी मूल्यांकन के लिए कोई जगह नहीं है
  • सीखने का ध्यान केंद्रित और सटीक हो जाता है
  • मॉडल सटीकता को प्राथमिकता देना सीखता है, प्लॉजिबल-साउंडिंग लेकिन गलत प्रतिक्रियाओं के बजाय

आरएलवीआर प्रशिक्षण (एलेन एआई)

परिणाम? टुलु 3 ने उन कार्यों में महत्वपूर्ण सुधार दिखाया जहां सही होना सबसे ज्यादा मायने रखता है। इसका गणितीय तर्क (जीएसएम8के बेंचमार्क) और कोडिंग चुनौतियों पर प्रदर्शन में उल्लेखनीय वृद्धि हुई। यहां तक कि इसका निर्देश पालन भी अधिक सटीक हो गया क्योंकि मॉडल ने ठोस सटीकता को अनुमानित प्रतिक्रियाओं पर मूल्य देना सीखा।

जो विशेष रूप से उत्साहजनक है वह यह है कि यह खुले स्रोत एआई के लिए खेल को कैसे बदलता है। जब खुले स्रोत मॉडल तकनीकी कार्यों पर सर्वश्रेष्ठ बंद मॉडल की सटीकता हासिल कर सकते हैं, तो यह क्षेत्र में नवाचार को तेज करता है। शोधकर्ता सत्यापित विधियों पर निर्माण कर सकते हैं, जबकि डेवलपर सुधार पर ध्यान केंद्रित कर सकते हैं न कि शून्य से शुरू करने पर।

संख्याओं पर एक नज़र

टुलु 3 का 405B पैरामीटर संस्करण क्षेत्र में शीर्ष मॉडलों के साथ सीधे प्रतिस्पर्धा करता है। आइए देखें कि यह कहां उत्कृष्ट है और इसका खुले स्रोत एआई के लिए क्या मतलब है।

गणित

टुलु 3 जटिल गणितीय तर्क में उत्कृष्ट है। जीएसएम8के और माथ जैसे बेंचमार्क पर, यह डीपसीक के प्रदर्शन से मेल खाता है। मॉडल बहु-चरण समस्याओं को संभालता है और मजबूत गणितीय तर्क क्षमता प्रदर्शित करता है।

कोड

कोडिंग परिणाम समान रूप से प्रभावशाली साबित होते हैं। आरएलवीआर प्रशिक्षण के लिए धन्यवाद, टुलु 3 समस्याओं का समाधान करने वाला कोड लिखता है। इसकी ताकत कोडिंग निर्देशों को समझने और कार्यात्मक समाधान प्रदान करने में निहित है।

सटीक निर्देश पालन

मॉडल की निर्देश पालन करने की क्षमता एक मुख्य ताकत के रूप में खड़ी है। जबकि कई मॉडल अनुमान लगाते हैं या निर्देशों को सामान्य बनाते हैं, टुलु 3 सटीकता से जो कहा जाता है उसे निष्पादित करने में उल्लेखनीय है।

एआई विकास के ब्लैक बॉक्स को खोलना

एलेन एआई ने न केवल एक शक्तिशाली मॉडल जारी किया है, बल्कि अपनी पूरी विकास प्रक्रिया भी जारी की है।

प्रशिक्षण प्रक्रिया के हर पहलू को पूरी तरह से प्रलेखित और सुलभ बनाया गया है। चार-चरण दृष्टिकोण से लेकर डेटा तैयारी विधियों और आरएलवीआर कार्यान्वयन तक – पूरी प्रक्रिया अध्ययन और प्रतिकृति के लिए खुली है। यह पारदर्शिता उच्च-प्रदर्शन एआई विकास में एक नया मानक स्थापित करती है।

डेवलपर्स को व्यापक संसाधन प्राप्त होते हैं:

  • पूर्ण प्रशिक्षण पाइपलाइन
  • डेटा प्रोसेसिंग टूल
  • मूल्यांकन फ्रेमवर्क
  • कार्यान्वयन विशिष्टता

यह उन्हें सक्षम बनाता है:

  • प्रशिक्षण प्रक्रियाओं को संशोधित करना
  • विशिष्ट आवश्यकताओं के लिए तरीकों को अनुकूलित करना
  • सिद्ध दृष्टिकोण पर निर्माण करना
  • विशेषज्ञता वाले कार्यान्वयन बनाना

यह दृष्टिकोण पूरे क्षेत्र में नवाचार को तेज करता है। शोधकर्ता सत्यापित विधियों पर निर्माण कर सकते हैं, जबकि डेवलपर सुधार पर ध्यान केंद्रित कर सकते हैं न कि शून्य से शुरू करने पर।

ओपन सोर्स उत्कृष्टता का उदय

टुलु 3 की सफलता खुले एआई विकास के लिए एक बड़ा क्षण है। जब ओपन सोर्स मॉडल निजी विकल्पों को मेल या पार करते हैं, तो यह उद्योग को मूल रूप से बदलता है। दुनिया भर की शोध टीमें सिद्ध तरीकों तक पहुंच प्राप्त करती हैं, जो उनके काम को तेज करती हैं और नए नवाचारों को जन्म देती हैं। निजी एआई प्रयोगशालाओं को या तो पारदर्शिता बढ़ाने या तकनीकी सीमाओं को और आगे बढ़ाने की आवश्यकता होगी।

आगे देखते हुए, टुलु 3 की verifiable पुरस्कारों और बहु-चरण प्रशिक्षण में सफलता से पता चलता है कि क्या आ रहा है। टीमें इन नींवों पर निर्माण कर सकती हैं, संभावित रूप से प्रदर्शन को और भी अधिक बढ़ा सकती हैं। कोड मौजूद है, विधियां प्रलेखित हैं, और एक नए एआई विकास का अध्याय शुरू हो गया है। डेवलपर्स और शोधकर्ताओं के लिए, इन विधियों के साथ प्रयोग करने और सुधारने का अवसर एक रोमांचक अध्याय की शुरुआत का प्रतीक है।

टुलु 3 के बारे में अक्सर पूछे जाने वाले प्रश्न (एफएक्यू)

टुलु 3 क्या है और इसकी मुख्य विशेषताएं क्या हैं?

टुलु 3 एलेन एआई द्वारा विकसित ओपन-सोर्स एलएलएम का एक परिवार है, जो एलएलएमा 3.1 आर्किटेक्चर पर आधारित है। यह 8बी, 70बी और 405बी पैरामीटर संस्करणों में आता है। टुलु 3 ज्ञान, तर्क, गणित, कोडिंग, निर्देश पालन और सुरक्षा जैसे विविध कार्यों में सुधार के लिए डिज़ाइन किया गया है।

टुलु 3 की प्रशिक्षण प्रक्रिया क्या है और कौन सा डेटा उपयोग किया जाता है?

टुलु 3 का प्रशिक्षण कई महत्वपूर्ण चरणों में होता है। पहले, टीम विशिष्ट कौशलों पर लक्षित सिंथेटिक डेटा के साथ सार्वजनिक डेटासेट को जोड़ती है, सुनिश्चित करती है कि डेटा बेंचमार्क के खिलाफ दूषित नहीं है। दूसरा, निर्देश पालन, गणित और कोडिंग डेटा पर पर्यवेक्षित फाइन-ट्यूनिंग की जाती है। तीसरे, मानव और एलएलएम फीडबैक के माध्यम से प्राथमिकता डेटा के साथ डीपीओ का उपयोग किया जाता है। अंत में, आरएलवीआर का उपयोग मापने योग्य सही उत्तरों वाले कार्यों के लिए किया जाता है। टुलु 3 प्रशिक्षण के प्रत्येक चरण में विशिष्ट डेटासेट का उपयोग करता है, जिसमें व्यक्तित्व-निर्देशित निर्देश, गणित और कोड डेटा शामिल हैं।

टुलु 3 सुरक्षा को कैसे संबोधित करता है और इसका मूल्यांकन कैसे किया जाता है?

सुरक्षा टुलु 3 के विकास का एक मूलभूत घटक है, जिसे प्रशिक्षण प्रक्रिया के दौरान संबोधित किया जाता है। एसएफटी के दौरान एक सुरक्षा-विशिष्ट डेटासेट का उपयोग किया जाता है, जो अन्य कार्य-उन्मुख डेटा से मुख्य रूप से ऑर्थोगोनल होता है।

आरएलवीआर क्या है?

आरएलवीआर एक तकनीक है जहां मॉडल को एक verifiable पुरस्कार के खिलाफ अनुकूलित करने के लिए प्रशिक्षित किया जाता है, जैसे कि एक उत्तर की सही होने की स्थिति। यह पारंपरिक आरएलएचएफ से भिन्न होता है जो एक पुरस्कार मॉडल का उपयोग करता है।

एलेक्स Unite.AI की एआई‑संचालित समाचार संचालन का नेतृत्व करते हैं, जिसमें पत्रकारिता, अनुसंधान और स्वचालन को मिलाकर कृत्रिम बुद्धिमत्ता की समयोचित और स्केलेबल कवरेज को समर्थन मिलता है। उनका कार्य उभरती एआई विकासों को कुशलतापूर्वक उजागर करने में मदद करता है, साथ ही प्रकाशन के संपादकीय मानकों को बनाए रखता है।