एआई मॉडल और प्लेटफ़ॉर्म
क्या आप ChatGPT जैसे बड़े भाषा मॉडल को आधे खर्चे पर बना सकते हैं?
बड़े भाषा मॉडल (LLM) जैसे GPT-3 और ChatGPT ने प्राकृतिक भाषा समझ और सामग्री जनरेशन क्षमताओं की पेशकश करके AI को क्रांतिकारी बनाया है। लेकिन उनका विकास एक बड़े मूल्य पर आता है, जो पहुंच और आगे के शोध को सीमित करता है। शोधकर्ताओं का अनुमान है कि GPT-3 को प्रशिक्षित करने में OpenAI को लगभग $5 मिलियन का खर्च आया। फिर भी, माइक्रोसॉफ्ट ने इसकी संभावना को पहचाना और 2019 में $1 बिलियन और 2023 में $10 बिलियन OpenAI के GPT-3 और ChatGPT उद्यम में निवेश किया।
LLM मशीन लर्निंग मॉडल हैं जो व्यापक पाठ डेटा पर प्रशिक्षित होते हैं और NLP अनुप्रयोगों के लिए उपयोग किए जाते हैं। वे ट्रांसफॉर्मर आर्किटेक्चर पर आधारित हैं और NLP कार्यों जैसे प्रश्न-उत्तर, मशीन अनुवाद, भावना विश्लेषण आदि के लिए ध्यान तंत्र का उपयोग करते हैं।
प्रश्न यह उठता है: क्या इन बड़े मॉडलों की दक्षता बढ़ाई जा सकती है जबकि गणना लागत और प्रशिक्षण समय को कम किया जा सकता है?
कई दृष्टिकोण, जैसे प्रगतिशील न्यूरल नेटवर्क, नेटवर्क मॉर्फिज्म, इन्ट्रा-लेयर मॉडल पैरेललिज्म, ज्ञान विरासत आदि, बड़े भाषा मॉडलों को प्रशिक्षित करने की गणना लागत को कम करने के लिए विकसित किए गए हैं। हम जिस नए LiGO (लीनियर ग्रोथ ऑपरेटर) दृष्टिकोण पर चर्चा करेंगे, वह एक नए मानक को स्थापित कर रहा है। यह बड़े भाषा मॉडलों को प्रशिक्षित करने की गणना लागत को आधा कर देता है।
इस तकनीक पर चर्चा करने से पहले, बड़े भाषा मॉडल बनाने की उच्च लागत में योगदान करने वाले कारकों की जांच करना आवश्यक है।
बड़े भाषा मॉडल बनाने की लागत
बड़े भाषा मॉडल विकसित करने के तीन प्रमुख खर्च निम्नलिखित हैं:
1. गणना संसाधन
बड़े भाषा मॉडल बनाने के लिए बड़ी मात्रा में गणना संसाधनों की आवश्यकता होती है ताकि वे बड़े डेटासेट पर प्रशिक्षित हो सकें। उन्हें अरबों पैरामीटर और बड़े पाठ डेटा से जटिल पैटर्न सीखने होते हैं।
विशेष हार्डवेयर जैसे ग्राफिक्स प्रोसेसिंग यूनिट (GPUs) और टेंसर प्रोसेसिंग यूनिट (TPUs) में निवेश करना बड़े भाषा मॉडल बनाने और प्रशिक्षित करने के लिए आवश्यक है ताकि राज्य-कला प्रदर्शन प्राप्त किया जा सके।
उदाहरण के लिए, GPT-3 को 10000 उद्यम-ग्रेड GPUs (H100 और A100) और 285,000 CPU कोर वाले एक सुपरकंप्यूटर पर प्रशिक्षित किया गया था।
2. ऊर्जा खपत
बड़े भाषा मॉडल बनाने के लिए आवश्यक गहन गणना संसाधनों के परिणामस्वरूप महत्वपूर्ण ऊर्जा खपत होती है। उदाहरण के लिए, 175 बिलियन पैरामीटर GPT-3 को प्रशिक्षित करने में 14.8 दिन लगे, जिसमें 10,000 V100 GPUs का उपयोग किया गया, जो 3.55 मिलियन GPU घंटे के बराबर है। ऐसी उच्च स्तर की ऊर्जा खपत का पर्यावरण पर भी महत्वपूर्ण प्रभाव पड़ता है।
3. डेटा भंडारण और प्रबंधन
बड़े भाषा मॉडल बड़े डेटासेट पर प्रशिक्षित होते हैं। उदाहरण के लिए, GPT-3 को विशाल पाठ डेटा पर प्रशिक्षित किया गया था, जिसमें कॉमन क्रॉल, वेबटेक्स्ट2, बुक्स1, बुक्स2 और विकिपीडिया शामिल थे, साथ ही अन्य स्रोत। इन डेटासेट को इकट्ठा करने, क्यूरेट करने और संग्रहीत करने के लिए महत्वपूर्ण बुनियादी ढांचे में निवेश की आवश्यकता होती है।
इसके अलावा, डेटा भंडारण के लिए क्लाउड स्टोरेज और डेटा प्रीप्रोसेसिंग और संस्करण नियंत्रण के लिए मानव विशेषज्ञता की आवश्यकता होती है। इसके अलावा, यह सुनिश्चित करना कि आपकी डेटा रणनीति जीडीपीआर जैसे नियमों के अनुरूप है, लागत में भी जोड़ती है।
LiGO तकनीक: बड़े भाषा मॉडल बनाने की लागत को आधा करना
LiGO (लीनियर ग्रोथ ऑपरेटर) एक नए तकनीक है जिसे एमआईटी के शोधकर्ताओं द्वारा बड़े भाषा मॉडलों को प्रशिक्षित करने की गणना लागत को 50% कम करने के लिए विकसित किया गया है। यह विधि बड़े मॉडलों के वजन को छोटे पूर्व-प्रशिक्षित मॉडलों से आरंभ करने में शामिल है, जो न्यूरल नेटवर्क को कुशलता से स्केल करने में सक्षम बनाता है।

पेपर से छवि: प्रीट्रेन्ड मॉडल को कुशलता से बढ़ाने के लिए सीखना
यून किम, पेपर के वरिष्ठ लेखक, कहते हैं:
“यह अनुमान लगाया गया है कि ChatGPT जैसे मॉडल को प्रशिक्षित करने में लाखों डॉलर का खर्च आ सकता है, सिर्फ एक प्रशिक्षण रन के लिए। क्या हम प्रशिक्षण विधियों की दक्षता में सुधार कर सकते हैं ताकि हम कम समय और कम पैसे में अच्छे मॉडल प्राप्त कर सकें? हम छोटे भाषा मॉडलों का लाभ उठाने का प्रस्ताव करते हैं जो पहले से प्रशिक्षित हैं।”
यह विधि बड़े मॉडलों के प्रदर्शन लाभों को बनाए रखते हुए कम गणना लागत और प्रशिक्षण समय की तुलना में स्क्रैच से प्रशिक्षित करने की तुलना में कम है। LiGO एक डेटा-चालित लीनियर ग्रोथ ऑपरेटर का उपयोग करता है जो गहराई और चौड़ाई ऑपरेटरों को अधिकतम प्रदर्शन के लिए जोड़ता है।
पेपर में विभिन्न डेटासेट का उपयोग करके पाठ-आधारित प्रयोग किए गए, जिनमें बERT और RoBERTa मॉडल के लिए अंग्रेजी विकिपीडिया कॉर्पस और GPT2 मॉडल के लिए C4 डेटासेट शामिल थे।
LiGO तकनीक के प्रयोग में BERT-Small को BERT-Base, BERT-Base को BERT-Large, RoBERTa-Small को RoBERTa-Base, GPT2-Base को GPT2-Medium, और CaiT-XS को CaiT-S में बढ़ाना शामिल था।
शोधकर्ताओं ने अपने दृष्टिकोण की तुलना अन्य बेसलाइनों से की, जिनमें स्क्रैच से प्रशिक्षण, प्रगतिशील प्रशिक्षण, bert2BERT, और KI शामिल थे।
LiGO तकनीक ने BERT-Base को स्क्रैच से प्रशिक्षित करने की तुलना में 44.7% की बचत FLOPs (फ्लोटिंग-पॉइंट ऑपरेशन प्रति सेकंड) में और 40.7% की बचत दीवार समय में की, BERT-Small मॉडल का पुन: उपयोग करके। LiGO ग्रोथ ऑपरेटर StackBERT, MSLT, bert2BERT, और KI को कुशल प्रशिक्षण में बेहतर प्रदर्शन करता है।
एक प्रशिक्षण अनुकूलन तकनीक जैसे LiGO का उपयोग करने के लाभ
LiGO एक कुशल न्यूरल नेटवर्क प्रशिक्षण विधि है जिसके विभिन्न लाभ हैं:
1. तेज़ प्रशिक्षण
जैसा कि पहले कहा गया है, तेज़ प्रशिक्षण LiGO तकनीक का मुख्य लाभ है। यह बड़े भाषा मॉडलों को आधे समय में प्रशिक्षित करता है, उत्पादकता में वृद्धि करता है और लागत को कम करता है।
2. संसाधन कुशल
LiGO संसाधन-कुशल है क्योंकि यह दीवार समय और FLOPs को कम करता है, जिससे बड़े ट्रांसफॉर्मर मॉडलों को प्रशिक्षित करने के लिए एक अधिक लागत-प्रभावी और पर्यावरण अनुकूल दृष्टिकोण है।
3. सामान्यीकरण
LiGO तकनीक ने भाषा और दृष्टि ट्रांसफॉर्मर दोनों के प्रदर्शन में सुधार किया है, जो दर्शाता है कि यह एक सामान्यizable तकनीक है जो विभिन्न कार्यों पर लागू की जा सकती है।
व्यावसायिक AI उत्पादों का निर्माण AI प्रणालियों से जुड़े खर्चों का केवल एक पहलू है। दैनिक संचालन से एक अन्य महत्वपूर्ण लागत घटक आता है। उदाहरण के लिए, OpenAI को ChatGPT का उपयोग करके प्रश्नों का उत्तर देने में लगभग $700,000 प्रतिदिन का खर्च आता है। शोधकर्ताओं को बड़े भाषा मॉडलों को प्रशिक्षित करने और चलाने के दौरान लागत-प्रभावी बनाने के दृष्टिकोणों का अन्वेषण करने की उम्मीद है।
अधिक AI संबंधित सामग्री के लिए, unite.ai पर जाएं。












