एआई मॉडल और प्लेटफ़ॉर्म
बड़े भाषा मॉडल पैरामीटर और मेमोरी आवश्यकताओं को समझना: एक गहरा गोता

By
Aayush Mittal मित्तल
बड़े भाषा मॉडल (LLMs) ने हाल के वर्षों में उल्लेखनीय प्रगति की है। जीपीटी-4, गूगल के जेमिनी और क्लाउड 3 जैसे मॉडल क्षमताओं और अनुप्रयोगों में नए मानक स्थापित कर रहे हैं। ये मॉडल न केवल पाठ उत्पादन और अनुवाद में सुधार कर रहे हैं, बल्कि मल्टीमोडल प्रोसेसिंग में भी नए क्षेत्रों में प्रवेश कर रहे हैं, जो पाठ, छवि, ऑडियो और वीडियो इनपुट को मिलाकर अधिक व्यापक एआई समाधान प्रदान करते हैं।
उदाहरण के लिए, ओपनएआई के जीपीटी-4 ने मानव-जैसे पाठ को समझने और उत्पन्न करने में महत्वपूर्ण सुधार दिखाया है, जबकि गूगल के जेमिनी मॉडल विभिन्न डेटा प्रकारों को संभालने में उत्कृष्ट हैं, जिनमें पाठ, छवियां और ऑडियो शामिल हैं, जो अधिक सMOOTH और संदर्भ-संबंधी इंटरैक्शन की अनुमति देते हैं। इसी तरह, एंथ्रोपिक के क्लाउड 3 मॉडल अपनी बहुभाषी क्षमताओं और एआई कार्यों में सुधार के लिए जाने जाते हैं।
जैसा कि बड़े भाषा मॉडलों का विकास तेजी से आगे बढ़ रहा है, इन मॉडलों की जटिलताओं, विशेष रूप से उनके पैरामीटर और मेमोरी आवश्यकताओं को समझना महत्वपूर्ण हो जाता है। यह गाइड इन पहलुओं को समझने के लिए एक विस्तृत और आसानी से समझने योग्य व्याख्या प्रदान करने का उद्देश्य रखती है।
बड़े भाषा मॉडल की मूल बातें
बड़े भाषा मॉडल क्या हैं?
बड़े भाषा मॉडल वे न्यूरल नेटवर्क हैं जो विशाल डेटासेट पर प्रशिक्षित होते हैं ताकि वे मानव भाषा को समझ सकें और उत्पन्न कर सकें। वे ट्रांसफॉर्मर जैसी आर्किटेक्चर पर निर्भर करते हैं, जो स्व-ध्यान जैसी तंत्र का उपयोग करके पाठ को संसाधित और उत्पन्न करते हैं।
एलएलएम में पैरामीटर का महत्व
पैरामीटर इन मॉडलों के मुख्य घटक हैं। उनमें वजन और पूर्वाग्रह शामिल हैं, जिन्हें मॉडल प्रशिक्षण के दौरान त्रुटियों को कम करने के लिए समायोजित करता है। पैरामीटर की संख्या अक्सर मॉडल की क्षमता और प्रदर्शन के साथ संबंधित होती है, लेकिन यह इसकी गणनात्मक और मेमोरी आवश्यकताओं को भी प्रभावित करती है।
ट्रांसफॉर्मर आर्किटेक्चर को समझना
विवरण
ट्रांसफॉर्मर आर्किटेक्चर, जिसे “एटेंशन इज ऑल यू नीड” पेपर में वासवानी एट अल। (2017) द्वारा पेश किया गया था, कई बड़े भाषा मॉडलों के लिए आधार बन गया है। इसमें एक एनकोडर और एक डीकोडर शामिल है, जो प्रत्येक कई समान परतों से बना होता है।
एनकोडर और डीकोडर घटक
- एनकोडर: इनपुट अनुक्रम को संसाधित करता है और एक संदर्भ-जागरूक प्रतिनिधित्व बनाता है।
- डीकोडर: एनकोडर के प्रतिनिधित्व और पहले से उत्पन्न टोकन का उपयोग करके आउटपुट अनुक्रम का उत्पादन करता है।
मुख्य निर्माण खंड
- मल्टी-हेड एटेंशन: मॉडल को इनपुट अनुक्रम के विभिन्न भागों पर एक साथ ध्यान केंद्रित करने की अनुमति देता है।
- फीड-फॉरवर्ड न्यूरल नेटवर्क: मॉडल में गैर-रेखीयता और जटिलता जोड़ता है।
- लेयर नॉर्मलाइजेशन: प्रशिक्षण को स्थिर और तेज करता है मध्यवर्ती आउटपुट को सामान्य करके।
पैरामीटर की संख्या की गणना
ट्रांसफॉर्मर-आधारित एलएलएम में पैरामीटर की गणना
आइए ट्रांसफॉर्मर-आधारित एलएलएम के प्रत्येक घटक के लिए पैरामीटर गणना को तोड़ दें।
- एम्बेडिंग लेयर:
- पैरामीटर =
वोकैबुलरी_आकार*d_model
- पैरामीटर =
- मल्टी-हेड एटेंशन:
- हेड की संख्या के लिए
h, जहांd_k = d_v = d_model / h: - पैरामीटर = 4 *
d_model^2 (क्यू, के, वी, और आउटपुट प्रोजेक्शन के लिए)
- हेड की संख्या के लिए
- फीड-फॉरवर्ड नेटवर्क:
- पैरामीटर = 2 *
d_model*d_ff+d_model+d_ff - जहां
d_ffआमतौर पर 4 *d_modelहोता है
- पैरामीटर = 2 *
- लेयर नॉर्मलाइजेशन:
- पैरामीटर = 2 *
d_model(स्केल और पूर्वाग्रह के लिए)
- पैरामीटर = 2 *
एक ट्रांसफॉर्मर लेयर के लिए कुल पैरामीटर:
Parameters_layer=Parameters_attention+Parameters_ffn+ 2 *Parameters_layernorm
N लेयर वाले मॉडल के लिए:
- कुल पैरामीटर =
N*Parameters_layer+Parameters_embedding+Parameters_output
उदाहरण गणना
आइए एक मॉडल की विशिष्टताओं पर विचार करें:
d_model= 768h(ध्यान के सिर की संख्या) = 12N(परतों की संख्या) = 12vocab_size= 50,000
- एम्बेडिंग लेयर:
- 50,000 * 768 = 38,400,000
- मल्टी-हेड एटेंशन:
- 4 * 768^2 = 2,359,296
- फीड-फॉरवर्ड नेटवर्क:
- 2 * 768 * (4 * 768) + 768 + (4 * 768) = 4,719,616
- लेयर नॉर्मलाइजेशन:
- 2 * 768 = 1,536
प्रति लेयर पैरामीटर की कुल संख्या:
- 2,359,296 + 4,719,616 + (2 * 1,536) = 7,081,984
12 लेयर के लिए कुल पैरामीटर:
- 12 * 7,081,984 = 84,983,808
मॉडल के कुल पैरामीटर:
- 84,983,808 + 38,400,000 = 123,383,808
इस मॉडल में लगभग 123 मिलियन पैरामीटर होंगे।
मेमोरी उपयोग के प्रकार
बड़े भाषा मॉडल के साथ काम करते समय, हमें दो मुख्य प्रकार के मेमोरी उपयोग पर विचार करने की आवश्यकता होती है:
- मॉडल मेमोरी: मॉडल पैरामीटर को संग्रहीत करने के लिए आवश्यक मेमोरी।
- कार्य मेमोरी: मध्यवर्ती सक्रियण, ग्रेडिएंट और ऑप्टिमाइज़र राज्यों को संग्रहीत करने के लिए आवश्यक मेमोरी अनुमान या प्रशिक्षण के दौरान।
मॉडल मेमोरी की गणना
मॉडल मेमोरी सीधे पैरामीटर की संख्या से संबंधित है। प्रत्येक पैरामीटर आमतौर पर 32-बिट फ्लोटिंग-पॉइंट संख्या के रूप में संग्रहीत किया जाता है, हालांकि कुछ मॉडल मिश्रित सटीकता प्रशिक्षण के साथ 16-बिट फ्लोट का उपयोग करते हैं।
मॉडल मेमोरी (बाइट) = पैरामीटर की संख्या * प्रति पैरामीटर बाइट
हमारे उदाहरण मॉडल के लिए जिसमें 123 मिलियन पैरामीटर हैं:
- मॉडल मेमोरी (32-बिट) = 123,383,808 * 4 बाइट = 493,535,232 बाइट ≈ 494 एमबी
- मॉडल मेमोरी (16-बिट) = 123,383,808 * 2 बाइट = 246,767,616 बाइट ≈ 247 एमबी
कार्य मेमोरी का अनुमान
कार्य मेमोरी आवश्यकताएं कार्य, बैच आकार और अनुक्रम लंबाई पर आधारित हो सकती हैं। अनुमान के दौरान एक खुराक अनुमान है:
कार्य मेमोरी ≈ 2 * मॉडल मेमोरी
यह मॉडल पैरामीटर और मध्यवर्ती सक्रियण दोनों को संग्रहीत करने के लिए खाता है। प्रशिक्षण के दौरान, मेमोरी आवश्यकताएं ग्रेडिएंट और ऑप्टिमाइज़र राज्यों को संग्रहीत करने की आवश्यकता के कारण भी अधिक हो सकती हैं:
प्रशिक्षण मेमोरी ≈ 4 * मॉडल मेमोरी
हमारे उदाहरण मॉडल के लिए:
- अनुमान कार्य मेमोरी ≈ 2 * 494 एमबी = 988 एमबी ≈ 1 जीबी
- प्रशिक्षण मेमोरी ≈ 4 * 494 एमबी = 1,976 एमबी ≈ 2 जीबी
स्थिर-राज्य मेमोरी उपयोग और शिखर मेमोरी उपयोग
बड़े भाषा मॉडलों को ट्रांसफॉर्मर आर्किटेक्चर पर आधारित प्रशिक्षित करते समय, मेमोरी उपयोग को समझना संसाधन आवंटन के लिए कुशल होने के लिए महत्वपूर्ण है। आइए मेमोरी आवश्यकताओं को दो मुख्य श्रेणियों में विभाजित करें: स्थिर-राज्य मेमोरी उपयोग और शिखर मेमोरी उपयोग।
स्थिर-राज्य मेमोरी उपयोग
स्थिर-राज्य मेमोरी उपयोग में निम्नलिखित घटक शामिल हैं:
- मॉडल वजन: मॉडल पैरामीटर की एफपी32 प्रतियां, जो 4एन बाइट्स की आवश्यकता होती है, जहां एन पैरामीटर की संख्या है।
- ऑप्टिमाइज़र राज्य: एडम ऑप्टिमाइज़र के लिए, यह प्रति पैरामीटर 2 राज्यों की आवश्यकता होती है, जो 8एन बाइट्स होती है।
- ग्रेडिएंट: ग्रेडिएंट की एफपी32 प्रतियां, जो 4एन बाइट्स की आवश्यकता होती है।
- इनपुट डेटा: मान लें कि इंट64 इनपुट हैं, यह 8बीडी बाइट्स की आवश्यकता होती है, जहां बी बैच आकार है और डी इनपुट आयाम है।
कुल स्थिर-राज्य मेमोरी उपयोग को इस प्रकार अनुमानित किया जा सकता है:
- एम_स्टेडी = 16एन + 8बीडी बाइट
शिखर मेमोरी उपयोग
शिखर मेमोरी उपयोग पिछड़े पास के दौरान होता है जब सक्रियण को ग्रेडिएंट गणना के लिए संग्रहीत किया जाता है। मुख्य योगदानकर्ता:
- लेयर नॉर्मलाइजेशन: प्रति लेयर नॉर्म 4ई बाइट्स की आवश्यकता होती है, जहां ई = बीएसएच (बी: बैच आकार, एस: अनुक्रम लंबाई, एच: छुपा आकार)
- ध्यान ब्लॉक:
- क्यूवीकेवी गणना: 2ई बाइट्स
- ध्यान मैट्रिक्स: 4बीएसएस बाइट्स (एस: अनुक्रम लंबाई)
- ध्यान आउटपुट: 2ई बाइट्स
- फीड-फॉरवर्ड ब्लॉक:
- पहली रेखीय परत: 2ई बाइट्स
- जीईएलयू सक्रियण: 8ई बाइट्स
- दूसरी रेखीय परत: 2ई बाइट्स
- क्रॉस-एंट्रोपी हानि:
- लॉगिट: 6बीएसवी बाइट्स (वी: शब्दावली आकार)
कुल सक्रियण मेमोरी को इस प्रकार अनुमानित किया जा सकता है:
- एम_एक्ट = एल * (14ई + 4बीएसएस) + 6बीएसवी बाइट
जहां एल ट्रांसफॉर्मर परतों की संख्या है।
कुल शिखर मेमोरी उपयोग
प्रशिक्षण के दौरान शिखर मेमोरी उपयोग को इस प्रकार अनुमानित किया जा सकता है:
- एम_पीक = एम_स्टेडी + एम_एक्ट + 4बीएसवी बाइट
अतिरिक्त 4बीएसवी शब्द पिछड़े पास की शुरुआत में एक अतिरिक्त आवंटन के लिए खाता है।
इन घटकों को समझकर, हम प्रशिक्षण और अनुमान के दौरान मेमोरी उपयोग को अनुकूलित कर सकते हैं, संसाधन आवंटन को कुशल बना सकते हैं और बड़े भाषा मॉडलों के प्रदर्शन में सुधार कर सकते हैं।
स्केलिंग कानून और कुशलता विचार
एलएलएम के लिए स्केलिंग कानून
शोध से पता चलता है कि एलएलएम का प्रदर्शन पैरामीटर की संख्या में वृद्धि के साथ कertain स्केलिंग कानूनों का पालन करता है। कपलान एट अल। (2020) ने देखा कि मॉडल प्रदर्शन पैरामीटर की संख्या, कंप्यूट बजट और डेटासेट आकार के एक शक्ति कानून के रूप में सुधरता है।
मॉडल प्रदर्शन और पैरामीटर की संख्या के बीच संबंध को इस प्रकार अनुमानित किया जा सकता है:
प्रदर्शन ∝ एन^α
जहां एन पैरामीटर की संख्या है और α एक स्केलिंग सूचक है जो आमतौर पर भाषा मॉडलिंग कार्यों के लिए 0.07 के आसपास होता है।
इसका अर्थ है कि 10% प्रदर्शन सुधार प्राप्त करने के लिए, हमें पैरामीटर की संख्या को 10^(1/α) ≈ 3.7 गुना बढ़ाने की आवश्यकता है।
कुशलता तकनीक
जैसा कि एलएलएम बढ़ते हैं, शोधकर्ताओं और व्यावहारिक लोगों ने कुशलता में सुधार के लिए विभिन्न तकनीकों का विकास किया है:
ए) मिश्रित सटीकता प्रशिक्षण: कुछ ऑपरेशनों के लिए 16-बिट या 8-बिट फ्लोटिंग-पॉइंट संख्याओं का उपयोग करके मेमोरी उपयोग और गणनात्मक आवश्यकताओं को कम करना।
बी) मॉडल समांतर: एकल डिवाइस पर फिट नहीं होने वाले बड़े मॉडलों को संभालने के लिए मॉडल को कई जीपीयू या टीपीयू पर वितरित करना।
सी) ग्रेडिएंट चेकपॉइंटिंग: मेमोरी के लिए गणना का व्यापार करके कुछ सक्रियण को पिछड़े पास के दौरान पुनः गणना करने के बजाय संग्रहीत करना।
डी) छांटना और संकल्पन: प्रशिक्षण के बाद कम महत्वपूर्ण वजन को हटाना या उनकी सटीकता को कम करना ताकि छोटे और अधिक कुशल मॉडल बनाए जा सकें।
ई) संक्षेपण: छोटे मॉडलों को बड़े मॉडलों के व्यवहार की नकल करने के लिए प्रशिक्षित करना, संभावित रूप से कम पैरामीटर के साथ बहुत सारा प्रदर्शन संरक्षित करना।
व्यावहारिक उदाहरण और गणना
जीपीटी-3, सबसे बड़े भाषा मॉडल में से एक, में 175 बिलियन पैरामीटर हैं। यह डीकोडर भाग का उपयोग करता है ट्रांसफॉर्मर आर्किटेक्चर। इसके पैमाने को समझने के लिए, आइए इसके पैरामीटर गणना को तोड़ दें:
d_model = 12288d_ff = 4 * 12288 = 49152- परतों की संख्या = 96
एक डीकोडर परत के लिए:
कुल पैरामीटर = 8 * 12288^2 + 8 * 12288 * 49152 + 2 * 12288 ≈ 1.1 बिलियन
96 परतों के लिए कुल:
1.1 बिलियन * 96 = 105.6 बिलियन
शेष पैरामीटर एम्बेडिंग और अन्य घटकों से आते हैं।
निष्कर्ष
बड़े भाषा मॉडलों के पैरामीटर और मेमोरी आवश्यकताओं को समझना इन शक्तिशाली उपकरणों को प्रभावी ढंग से डिज़ाइन, प्रशिक्षित और तैनात करने के लिए महत्वपूर्ण है। ट्रांसफॉर्मर आर्किटेक्चर के घटकों को तोड़कर और जीपीटी जैसे व्यावहारिक उदाहरणों की जांच करके, हम इन मॉडलों की जटिलता और पैमाने में गहरी अंतर्दृष्टि प्राप्त करते हैं।
बड़े भाषा मॉडलों और उनके अनुप्रयोगों में नवीनतम प्रगति को और अधिक समझने के लिए, इन व्यापक गाइडों पर जाएं:
- जेम्मा 2 पर पूर्ण गाइड का अन्वेषण करें: गूगल का नया ओपन लार्ज लैंग्वेज मॉडल इसके उन्नत प्रदर्शन और नवाचार सुविधाओं के लिए अंतर्दृष्टि प्राप्त करने के लिए।
- आरएजी के लिए एलएलएम एजेंटों का निर्माण सीखें: स्क्रैच से परे एक व्यापक गाइड जो पुनर्प्राप्ति-संवर्धित पीढ़ी में चुनौतियों और समाधानों पर चर्चा करता है।
- नवीदिया जीपीयू और सीयूडीए के साथ एलएलएम के प्रशिक्षण, फ़ाइन-ट्यूनिंग और अनुमान की स्थापना की जटिलताओं का पता लगाएं एआई सिस्टम को अनुकूलित करने के लिए।
मैं पिछले पांच वर्षों से मशीन लर्निंग और डीप लर्निंग की दुनिया में खुद को डूबो रहा हूं। मेरा जुनून और विशेषज्ञता ने मुझे 50 से अधिक विविध सॉफ्टवेयर इंजीनियरिंग परियोजनाओं में योगदान देने के लिए प्रेरित किया है, जिनमें से अधिकांश में एआई/एमएल पर विशेष ध्यान केंद्रित किया गया है। मेरी जारी जिज्ञासा ने मुझे प्राकृतिक भाषा प्रसंस्करण की ओर आकर्षित किया है, जिस क्षेत्र को मैं आगे अन्वेषण करने के लिए उत्सुक हूं।
और जानें


अगर आपका कर्मचारी AI जैसा व्यवहार करता, तो आप अब तक उसे निकाल चुके होते


वॉइस एआई में वास्तविक क्या है और क्या केवल कल्पना है


यदि एक बॉट बच्चों के साथ फ्लर्ट कर सकता है, तो यह आपके डेटा के साथ और क्या कर सकता है?


वैज्ञानिक पत्रों को एआई समीक्षकों से कैसे बचाया जाए


एआई मॉडल मानव लेखन को एआई-जनरेटेड लेखन से अधिक पसंद करते हैं


मixture ऑफ एक्सपर्ट्स क्रांति: उन्नत राउटिंग और विशेषज्ञता कैसे एलएलएम को बदल रही है

