एआई मॉडल और प्लेटफ़ॉर्म

माइक्रोसॉफ्ट के Phi-3 Mini के अंदर: एक हल्के वजन वाला एआई मॉडल जो अपने वजन से अधिक पंच मारता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

माइक्रोसॉफ्ट ने हाल ही में अपने नवीनतम हल्के भाषा मॉडल को Phi-3 Mini नाम दिया है, जो कॉम्पैक्ट एआई मॉडल्स की एक तिकड़ी की शुरुआत करता है जो राज्य-ऑफ-द-आर्ट प्रदर्शन प्रदान करने के लिए डिज़ाइन किए गए हैं और सीमित कंप्यूटिंग संसाधनों वाले उपकरणों पर कुशलता से चलने के लिए पर्याप्त छोटे हैं। केवल 3.8 बिलियन पैरामीटर पर, Phi-3 Mini जीपीटी-4 जैसे एआई दिग्गजों के आकार का एक अंश है, फिर भी यह कई कुंजी क्षेत्रों में उनकी क्षमताओं को मैच करने का वादा करता है।

Phi-3 Mini का विकास उन्नत एआई क्षमताओं को व्यापक हार्डवेयर श्रृंखला पर सुलभ बनाने की दिशा में एक महत्वपूर्ण मील का पत्थर है। इसका छोटा आकार इसे स्मार्टफोन, टैबलेट और अन्य एज डिवाइस पर स्थानीय रूप से तैनात करने की अनुमति देता है, जो क्लाउड-आधारित मॉडल से जुड़े देरी और गोपनीयता चिंताओं को पार करता है। यह विभिन्न डोमेन में बुद्धिमान ऑन-डिवाइस अनुभवों के लिए नए अवसर खोलता है, जो आभासी सहायकों और संवादात्मक एआई से लेकर कोडिंग सहायकों और भाषा समझने के कार्यों तक हैं।

4-बिट स्क्वांटाइज्ड फाई-3-मिनी आईफ़ोन पर स्वदेशी रूप से चल रहा है
4-बिट स्क्वांटाइज्ड फाई-3-मिनी आईफ़ोन पर स्वदेशी रूप से चल रहा है

आर्किटेक्चर और प्रशिक्षण के तहत:

इसके मूल में, Phi-3 Mini एक ट्रांसफॉर्मर डिकोडर मॉडल है जो ओपन-सोर्स लामा -2 मॉडल के समान आर्किटेक्चर पर आधारित है। इसमें 32 परतें, 3072 छिपी आयाम और 32 ध्यान सिर हैं, जिसमें 4,000 टोकन की डिफ़ॉल्ट संदर्भ लंबाई है। माइक्रोसॉफ्ट ने लॉन्गरोप जैसी तकनीकों का उपयोग करके संदर्भ लंबाई को 128,000 टोकन तक बढ़ाने वाले एक लंबे संदर्भ संस्करण को भी पेश किया है, जिसे Phi-3 Mini-128K कहा जाता है।

हालांकि, जो Phi-3 Mini को अलग करता है, वह इसकी प्रशिक्षण विधि है। बड़े डेटासेट और कंप्यूट शक्ति पर अकेले भरोसा करने के बजाय, माइक्रोसॉफ्ट ने एक उच्च-गुणवत्ता वाले, तर्कसंगत-घने प्रशिक्षण डेटासेट को बनाने पर ध्यान केंद्रित किया है। यह डेटा भारी फ़िल्टर्ड वेब डेटा और बड़े भाषा मॉडल द्वारा उत्पन्न सिंथेटिक डेटा से बना है।

प्रशिक्षण प्रक्रिया दो-चरण दृष्टिकोण का अनुसरण करती है। पहले चरण में, मॉडल को सामान्य ज्ञान और भाषा समझ सिखाने के लिए विभिन्न वेब स्रोतों के संपर्क में लाया जाता है। दूसरे चरण में, भारी फ़िल्टर्ड वेब डेटा को तर्कसंगत कौशल और निचे डोमेन विशेषज्ञता प्रदान करने के लिए सिंथेटिक डेटा के साथ जोड़ा जाता है।

माइक्रोसॉफ्ट इस दृष्टिकोण को “डेटा ऑप्टिमल रिजीम” कहता है, जो कई बड़े भाषा मॉडल द्वारा नियोजित पारंपरिक “कंप्यूट ऑप्टिमल रिजीम” या “ओवर-ट्रेनिंग रिजीम” से एक विचलन है। लक्ष्य मॉडल के पैमाने से मेल खाने के लिए प्रशिक्षण डेटा को कैलिब्रेट करना है, ज्ञान और तर्क क्षमता का सही स्तर प्रदान करते हुए, जबकि अन्य क्षमताओं के लिए पर्याप्त क्षमता छोड़ देता है।

नए फाई-3 मॉडल की गुणवत्ता, जैसा कि मासिव मुल्टीटास्क लैंग्वेज अंडरस्टैंडिंग (एमएमएलयू) बेंचमार्क पर प्रदर्शन द्वारा मापा जाता है
नए फाई-3 मॉडल की गुणवत्ता, जैसा कि मासिव मुल्टीटास्क लैंग्वेज अंडरस्टैंडिंग (एमएमएलयू) बेंचमार्क पर प्रदर्शन द्वारा मापा जाता है

यह डेटा-केंद्रित दृष्टिकोण ने भुगतान किया है, क्योंकि Phi-3 Mini विभिन्न अकादमिक बेंचमार्क पर उल्लेखनीय प्रदर्शन प्राप्त करता है, अक्सर बड़े मॉडलों को पार या पार करता है। उदाहरण के लिए, यह मल्टी-टास्क लर्निंग और समझने के लिए एमएमएलयू बेंचमार्क पर 69% स्कोर करता है, और गणितीय तर्क के लिए एमटी-बेंच पर 8.38 – मिक्सट्रल 8x7B और जीपीटी-3.5 जैसे मॉडल के साथ परिणाम।

सुरक्षा और मजबूतता

अपने प्रभावशाली प्रदर्शन के साथ-साथ, माइक्रोसॉफ्ट ने Phi-3 Mini के विकास में सुरक्षा और मजबूतता पर मजबूत जोर दिया है। मॉडल ने पर्यवेक्षित फाइन-ट्यूनिंग (एसएफटी) और सीधे वरीयता अनुकूलन (डीपीओ) के साथ एक कठोर पोस्ट-ट्रेनिंग प्रक्रिया को पूरा किया है।

एसएफटी चरण विभिन्न डोमेन में भारी फ़िल्टर्ड डेटा का लाभ उठाता है, जिसमें गणित, कोडिंग, तर्क, संवाद, मॉडल पहचान और सुरक्षा शामिल हैं। यह मॉडल की क्षमताओं को इन क्षेत्रों में मजबूत करने में मदद करता है, जबकि एक मजबूत पहचान और नैतिक व्यवहार को प्रोत्साहित करता है।

डीपीओ चरण, दूसरी ओर, अवांछित व्यवहार से मॉडल को दूर करने पर केंद्रित है, जो अस्वीकृत प्रतिक्रियाओं का उपयोग नकारात्मक उदाहरणों के रूप में करता है। यह प्रक्रिया चैट प्रारूप डेटा, तर्क कार्यों और जिम्मेदार एआई (आरएआई) प्रयासों को कवर करती है, सुनिश्चित करती है कि Phi-3 Mini माइक्रोसॉफ्ट के नैतिक और विश्वसनीय एआई के सिद्धांतों का पालन करता है।

इसकी सुरक्षा प्रोफ़ाइल को और बढ़ाने के लिए, Phi-3 Mini को दर्जनों आरएआई हानि श्रेणियों में व्यापक रेड-टीमिंग और स्वचालित परीक्षण के अधीन किया गया है। माइक्रोसॉफ्ट में एक स्वतंत्र रेड टीम ने मॉडल की जांच की, सुधार के क्षेत्रों की पहचान की, जिन्हें बाद में अतिरिक्त क्यूरेटेड डेटासेट और पुनः प्रशिक्षण के माध्यम से संबोधित किया गया।

यह बहुस्तरीय दृष्टिकोण ने हानिकारक प्रतिक्रियाओं, तथ्यात्मक अशुद्धियों और पूर्वाग्रहों की घटना को काफी कम कर दिया है, जैसा कि माइक्रोसॉफ्ट के आंतरिक आरएआई बेंचमार्क द्वारा प्रदर्शित किया गया है। उदाहरण के लिए, मॉडल हानिकारक सामग्री जारी रखने (0.75%) और सारांश (10%) के लिए कम दोष दर प्रदर्शित करता है, साथ ही साथ एक कम दर अहसास (0.603) भी प्रदर्शित करता है, जो दर्शाता है कि इसके प्रतिक्रियाएं दिए गए संदर्भ में दृढ़ता से आधारित हैं।

अनुप्रयोग और उपयोग के मामले

अपने प्रभावशाली प्रदर्शन और मजबूत सुरक्षा उपायों के साथ, Phi-3 Mini विभिन्न अनुप्रयोगों के लिए अच्छी तरह से अनुकूल है, विशेष रूप से संसाधन-सीमित वातावरण और देरी से बंधे दृश्यों में।

सबसे रोमांचक दृष्टिकोणों में से एक मोबाइल डिवाइस पर बुद्धिमान आभासी सहायकों और संवादात्मक एआई की तैनाती है। स्थानीय रूप से चलने से, इन सहायकों को नेटवर्क कनेक्शन की आवश्यकता के बिना तुरंत प्रतिक्रिया प्रदान करने में सक्षम हैं, जबकि संवेदनशील डेटा को डिवाइस पर बनाए रखने से गोपनीयता चिंताओं को संबोधित किया जाता है।

Phi-3 Mini की मजबूत तर्क क्षमता इसे कोडिंग सहायता और गणितीय समस्या समाधान के लिए एक मूल्यवान संपत्ति बनाती है। डेवलपर और छात्र डिवाइस पर कोड पूर्णता, बग पता लगाने और व्याख्या से लाभान्वित हो सकते हैं, जो विकास और सीखने की प्रक्रिया को सुव्यवस्थित करते हैं।

इन अनुप्रयोगों के परे, मॉडल की बहुमुखी प्रतिभा पाठ समझ, पाठ सारांश और प्रश्न उत्तर जैसे क्षेत्रों में अवसर खोलती है। इसका छोटा आकार और दक्षता इसे विभिन्न उपकरणों और प्रणालियों में एआई क्षमताओं को एम्बेड करने के लिए एक आकर्षक विकल्प बनाता है, स्मार्ट होम उपकरणों से लेकर औद्योगिक स्वचालन प्रणालियों तक।

आगे देख रहे हैं: फाई-3 छोटा और फाई-3 मध्यम

जबकि फाई-3 मिनी अपने आप में एक उल्लेखनीय उपलब्धि है, माइक्रोसॉफ्ट के पास फाई-3 परिवार के लिए और भी बड़ी योजनाएं हैं। कंपनी ने पहले से ही दो बड़े मॉडल, फाई-3 छोटा (7 बिलियन पैरामीटर) और फाई-3 मध्यम (14 बिलियन पैरामीटर) का पूर्वावलोकन किया है, जो कॉम्पैक्ट भाषा मॉडल के लिए प्रदर्शन की सीमाओं को आगे बढ़ाने की उम्मीद है।

फाई-3 छोटे, उदाहरण के लिए, एक अधिक उन्नत टोकनाइज़र (टिक्टोकन) और एक समूहित-प्रश्न ध्यान तंत्र का लाभ उठाता है, साथ ही एक नोवेल ब्लॉकस्पार्स ध्यान परत का उपयोग करके अपने मेमोरी फुटप्रिंट को अनुकूलित करता है, जबकि लंबे संदर्भ पुनर्प्राप्ति प्रदर्शन को बनाए रखता है। यह एक अतिरिक्त 10% बहुसांस्कृतिक डेटा को भी एकीकृत करता है, जो कई भाषाओं में भाषा समझ और पीढ़ी क्षमताओं में सुधार करता है।

फाई-3 मध्यम, दूसरी ओर, पैमाने में एक महत्वपूर्ण कदम है, जिसमें 40 परतें, 40 ध्यान सिर और 5,120 का एम्बेडिंग आयाम है। जबकि माइक्रोसॉफ्ट नोट करता है कि कुछ बेंचमार्क मॉडल की बढ़ी हुई क्षमता का पूरा लाभ उठाने के लिए प्रशिक्षण डेटा मिश्रण को आगे परिष्कृत करने की आवश्यकता हो सकती है, प्रारंभिक परिणाम आशाजनक हैं, जिसमें एमएमएलयू, ट्रिवियाक्यूए और ह्यूमनइवल जैसे कार्यों पर फाई-3 छोटे पर महत्वपूर्ण सुधार हैं।

सीमाएं और भविष्य के निर्देश

अपनी प्रभावशाली क्षमताओं के बावजूद, Phi-3 Mini, जैसे कि सभी भाषा मॉडल, अपनी सीमाओं के बिना नहीं है। सबसे उल्लेखनीय कमजोरियों में से एक इसकी वास्तविक ज्ञान को संग्रहीत करने की सीमित क्षमता है, जैसा कि ट्रिवियाक्यूए जैसे बेंचमार्क पर इसके कम प्रदर्शन से संकेत मिलता है।

हालांकि, माइक्रोसॉफ्ट का मानना है कि इस सीमा को खोज इंजन क्षमताओं के साथ मॉडल को बढ़ाकर कम किया जा सकता है, जिससे यह प्रासंगिक जानकारी को मांग पर पुनर्प्राप्त और तर्क कर सके। यह दृष्टिकोण हगिंग फेस चैट-यूआई में प्रदर्शित किया गया है, जहां फाई-3 मिनी अपनी प्रतिक्रियाओं को बढ़ाने के लिए खोज का लाभ उठा सकता है।

सुधार के लिए एक और क्षेत्र मॉडल की बहुसांस्कृतिक क्षमताएं हैं। जबकि फाई-3 छोटे ने अतिरिक्त बहुसांस्कृतिक डेटा को एकीकृत करके प्रारंभिक कदम उठाए हैं, क्रॉस-लिंगुअल अनुप्रयोगों के लिए इन कॉम्पैक्ट मॉडल की क्षमता को पूरी तरह से अनलॉक करने के लिए और काम की आवश्यकता है।

आगे देखते हुए, माइक्रोसॉफ्ट फाई परिवार के मॉडलों को लगातार आगे बढ़ाने के लिए प्रतिबद्ध है, उनकी सीमाओं को संबोधित करता है और उनकी क्षमताओं का विस्तार करता है। इसमें प्रशिक्षण डेटा और विधि में आगे के परिष्कार शामिल हो सकते हैं, साथ ही कॉम्पैक्ट, उच्च-प्रदर्शन भाषा मॉडल के लिए विशेष रूप से तैयार की गई नई वास्तुकला और तकनीकों की खोज।

निष्कर्ष

माइक्रोसॉफ्ट का फाई-3 मिनी उन्नत एआई क्षमताओं के लोकतंत्रीकरण में एक महत्वपूर्ण छलांग का प्रतिनिधित्व करता है। राज्य-ऑफ-द-आर्ट प्रदर्शन को एक कॉम्पैक्ट, संसाधन-कुशल पैकेज में वितरित करके, यह विभिन्न अनुप्रयोगों में बुद्धिमान ऑन-डिवाइस अनुभवों के लिए नए अवसर खोलता है।

मॉडल का नवीन प्रशिक्षण दृष्टिकोण, जो उच्च-गुणवत्ता, तर्कसंगत-घने डेटा पर जोर देता है, बड़े पैमाने पर गणना शक्ति की तुलना में, एक खेल परिवर्तक साबित हुआ है, जिससे फाई-3 मिनी अपने वजन वर्ग से ऊपर मुक्का मार सकता है। अपने मजबूत सुरक्षा उपायों और निरंतर विकास प्रयासों के साथ मिलकर, फाई-3 मॉडल परिवार बुद्धिमान प्रणालियों के भविष्य को आकार देने में एक महत्वपूर्ण भूमिका निभाने के लिए तैयार है, एआई को अधिक सुलभ, कुशल और विश्वसनीय बनाता है।

जैसा कि तकनीकी उद्योग एआई के साथ संभव की सीमाओं को आगे बढ़ाता है, माइक्रोसॉफ्ट की हल्के वजन वाले मॉडल जैसे फाई-3 मिनी में प्रतिबद्धता एक ताज़ा विचलन है जो “बड़ा सबसे अच्छा” की पारंपरिक बुद्धिमत्ता से है। बड़ा नहीं होने पर आकार को साबित करके, फाई-3 मिनी एआई के मूल्य और प्रभाव को अधिकतम करने पर एक नए नवाचार की लहर को प्रेरित करने की क्षमता रखता है, जो डेटा क्यूरेशन, मॉडल डिज़ाइन और जिम्मेदार विकास प्रथाओं पर ध्यान केंद्रित करता है।

मैं पिछले पांच वर्षों से मशीन लर्निंग और डीप लर्निंग की दुनिया में खुद को डूबो रहा हूं। मेरा जुनून और विशेषज्ञता ने मुझे 50 से अधिक विविध सॉफ्टवेयर इंजीनियरिंग परियोजनाओं में योगदान देने के लिए प्रेरित किया है, जिनमें से अधिकांश में एआई/एमएल पर विशेष ध्यान केंद्रित किया गया है। मेरी जारी जिज्ञासा ने मुझे प्राकृतिक भाषा प्रसंस्करण की ओर आकर्षित किया है, जिस क्षेत्र को मैं आगे अन्वेषण करने के लिए उत्सुक हूं।