एआई मॉडल और प्लेटफ़ॉर्म
भविष्य के सर्वरलेस अनुमान के लिए बड़े भाषा मॉडल
हाल के वर्षों में बड़े भाषा मॉडल (LLM) जैसे GPT-4, PaLM में हुई प्रगति ने प्राकृतिक भाषा कार्यों में क्रांतिकारी क्षमताओं को जन्म दिया है। LLM को विभिन्न अनुप्रयोगों जैसे कि चैटबॉट, सर्च इंजन और प्रोग्रामिंग सहायक में शामिल किया जा रहा है। हालांकि, LLM को बड़े पैमाने पर परोसना अभी भी चुनौतीपूर्ण है क्योंकि उन्हें महत्वपूर्ण GPU और मेमोरी की आवश्यकता होती है।
इस समस्या का समाधान करने के लिए दो मुख्य दृष्टिकोण हैं:
- मॉडल संपीड़न तकनीक
इन तकनीकों का उद्देश्य मॉडल के आकार को कम करना है जबकि सटीकता बनाए रखना है। सामान्य दृष्टिकोण में शामिल हैं:
- प्रूनिंग – मॉडल से अनावश्यक या कम महत्वपूर्ण पैरामीटर हटाना। इससे एक स्पार्स मॉडल बनता है जिसमें कम पैरामीटर होते हैं।
- क्वांटाइजेशन – वजन को प्रस्तुत करने के लिए कम सटीकता वाले संख्याओं जैसे int8 या bfloat16 का उपयोग करना, fp32 या fp16 के बजाय। इससे मेमोरी फुटप्रिंट कम होता है।
- ज्ञान संक्षेपण – एक छोटे “शिष्य” मॉडल को एक बड़े “शिक्षक” मॉडल की नकल करने के लिए प्रशिक्षित करना। इसके बाद छोटे मॉडल का उपयोग अनुमान के लिए किया जाता है।
- चयनात्मक निष्पादन
इन तकनीकों के बजाय, मॉडल के केवल कुछ हिस्सों को प्रति अनुमान के लिए चयनात्मक रूप से निष्पादित किया जाता है:
- स्पार्स एक्टिवेशन – शून्य एक्टिवेशन पर गणना को छोड़ना।
- सशर्त गणना – केवल निश्चित परतों को इनपुट की स्थिति पर निर्भर करते हुए निष्पादित करना।
सॉफ्टवेयर आर्किटेक्ट के दृष्टिकोण से, LLM को तेजी से तैनात करने के लिए शोधकर्ताओं ने सर्वरलेस अनुमान प्रणाली का प्रस्ताव दिया है। सर्वरलेस आर्किटेक्चर में, LLM को साझा GPU क्लस्टर पर होस्ट किया जाता है और मांग के आधार पर गतिविधि के अनुसार आवंटित किया जाता है। इससे GPU का कुशल उपयोग होता है और विकासकर्ताओं के लिए लागत कम होती है। प्रमुख कार्यान्वयन में अमेज़न सेजमेकर, माइक्रोसॉफ्ट अज़ूर एमएल और केसर्व जैसे ओपन-सोर्स विकल्प शामिल हैं।
सर्वरलेस LLM के वादे के बावजूद, मौजूदा प्रणाली में उच्च विलंबता ओवरहेड होते हैं जो इंटरएक्टिव अनुप्रयोगों में उपयोगकर्ता अनुभव को खराब करते हैं:
- महंगा चेकपॉइंट डाउनलोड: LLM के पास अक्सर गिगाबाइट से टेराबाइट तक का बड़ा मेमोरी फुटप्रिंट होता है। अनुकूलित नेटवर्क के साथ भी रिमोट स्टोरेज से चेकपॉइंट डाउनलोड करना समय लेने वाला होता है, जो 20 सेकंड से अधिक समय ले सकता है।
- अकुशल चेकपॉइंट लोडिंग: यहां तक कि स्थानीय एसएसडी स्टोरेज के साथ, चेकपॉइंट को जीपीयू मेमोरी में लोड करने में टेंसर डिसेरियलाइजेशन और आवंटन जैसे कारकों के कारण दसियों सेकंड लगते हैं। यह कंटेनर शुरू होने के समय से परे महत्वपूर्ण देरी जोड़ता है।
इन मुद्दों को हल करने के लिए, एमआईटी सीएसएआईएल के शोधकर्ताओं ने सर्वरलेसएलएलएम प्रस्तावित किया, जो बड़े भाषा मॉडल के लिए कम विलंबता वाली सर्वरलेस अनुमान प्रणाली है। सर्वरलेसएलएलएम स्थानीयता को बढ़ावा देने के लिए मल्टी-टियर सर्वर स्टोरेज में उपलब्ध लेकिन कम उपयोग की जाने वाली क्षमता और बैंडविड्थ का लाभ उठाता है।
सर्वरलेसएलएलएम में मुख्य नवाचार सर्वरलेस वातावरण में एलएलएम लोडिंग समय को कम करने के लिए कई नए डिज़ाइन शामिल हैं:
- तेज चेकपॉइंट लोडिंग
- लोडिंग-ऑप्टिमाइज्ड चेकपॉइंट प्रारूप जो तेजी से अनुक्रमिक पढ़ने और कुशल इन-मेमोरी टेंसर एड्रेसिंग को सक्षम बनाता है।
- मल्टी-टियर चेकपॉइंट लोडिंग पाइपलाइन जो नेटवर्क, एसएसडी, डीआरएएम और जीपीयू मेमोरी में बैंडविड्थ का उपयोग बढ़ाने के लिए तकनीकों जैसे डायरेक्ट आई/ओ, पिन्ड मेमोरी ट्रांसफर और समांतरता का उपयोग करती है।
- लाइव माइग्रेशन स्थानीयता-निर्देशित अनुमान के लिए
- टोकन-आधारित माइग्रेशन जो केवल आवश्यक प्रॉम्प्ट टोकन को नेटवर्क पर प्रसारित करता है, धीमी स्नैपशॉट ट्रांसफर से बचता है।
- दो-चरण माइग्रेशन जो गंतव्य सर्वर पर असिंक्रोनस रूप से कैश स्टेट्स की पुनर्गणना की अनुमति देता है, जिससे अनुमान में व्यवधान नहीं होता है।
- विलंबता-अनुकूलित सर्वर आवंटन
- प्रत्येक सर्वर के लिए चेकपॉइंट लोडिंग समय और माइग्रेशन समय का अनुमान लगाने के लिए सटीक मॉडल।
- स्थानीयता-जागरूक शेड्यूलर जो अपेक्षित स्टार्टअप विलंबता को कम करने वाले सर्वर का चयन करता है।
इन अनुकूलनों के साथ, सर्वरलेसएलएलएम एलएलएम लोडिंग समय को 4-8 गुना और एंड-टू-एंड स्टार्टअप समय को 25 गुना से अधिक कम कर देता है जो मौजूदा प्रणालियों जैसे पायटोर्च, टेंसोरफ्लो और केसर्व की तुलना में है।
चेकपॉइंट लोडिंग को तेज करना
सर्वरलेसएलएलएम द्वारा संबोधित की जाने वाली पहली प्रमुख बोतलनेक चेकपॉइंट को स्टोरेज से जीपीयू मेमोरी में लोड करने में उच्च विलंबता है।
तेज चेकपॉइंट लोडिंग को सक्षम करने के लिए, सर्वरलेसएलएलएम पेश करता है:
- लोडिंग-ऑप्टिमाइज्ड चेकपॉइंट प्रारूप
पायटोर्च जैसे फ्रेमवर्क द्वारा उपयोग किए जाने वाले मानक चेकपॉइंट मॉडल प्रशिक्षण और डिबगिंग के लिए डिज़ाइन किए गए हैं। लेकिन सर्वरलेस अनुमान के लिए, चेकपॉइंट पढ़ने के लिए ही उपयोग किए जाते हैं और बार-बार एक्सेस किए जाते हैं।
इस तरह के पढ़ने वाले उपयोग के लिए अनुकूलन के लिए, सर्वरलेसएलएलएम चेकपॉइंट को दो मुख्य गुणों के साथ एक प्रारूप में परिवर्तित करता है:
- अनुक्रमिक चंक-आधारित पढ़ना: टेंसर को प्रति-जीपीयू बाइनरी फ़ाइलों में समूहित किया जाता है, जो बड़े अनुक्रमिक पढ़ने की सुविधा प्रदान करता है।
- कुशल टेंसर एड्रेसिंग: एक इंडेक्स टेंसर नामों को मेमोरी ऑफसेट से मैप करता है, जिससे डिसेरियलाइजेशन के बिना सीधे इन-मेमोरी पुनर्स्थापना संभव हो जाती है।
- मल्टी-टियर चेकपॉइंट लोडिंग पाइपलाइन
सर्वरलेसएलएलएम जीपीयू सर्वर की स्तरीकृत वास्तुकला का लाभ उठाता है, जिसमें एसएसडी जैसे स्टोरेज मीडिया और नेटवर्किंग जीपीयू को पीसीआईई, एनवीएमई आदि के माध्यम से जोड़ती है।
प्रणाली एक मल्टी-स्टेज पाइपलाइन को शामिल करती है जो सभी स्तरों में बैंडविड्थ का उपयोग बढ़ाने के लिए:
- पिन्ड मेमोरी का उपयोग जीपीयू ट्रांसफर के लिए इन-मेमोरी डेटा चंक्स को आवंटित करने के लिए किया जाता है।
- डायरेक्ट आई/ओ का उपयोग एसएसडी पढ़ने के लिए किया जाता है जिसमें कैशिंग ओवरहेड्स नहीं होते हैं।
- मल्टीपल थ्रेड्स विभिन्न स्टोरेज चंक्स को समांतर में पढ़ते हैं।
- इंटर-स्टेज समन्वय असिंक्रोनस टास्क क्यू के माध्यम से होता है।
एक साथ, यह तेज़ टियर जैसे एनवीएमई रेड की बैंडविड्थ क्षमता को संतृप्त करने में सक्षम बनाता है। प्रयोगों से पता चलता है कि सर्वरलेसएलएलएम पायटोर्च/टेंसोरफ्लो की तुलना में 6-8 गुना तेजी से लोडिंग हासिल करता है, जिससे बड़े एलएलएम के लिए स्टार्टअप समय एक मिनट से अधिक से 10 सेकंड से कम हो जाता है।
लाइव माइग्रेशन के माध्यम से स्थानीयता-निर्देशित एलएलएम अनुमान
तेजी से लोडिंग के साथ, सर्वरलेसएलएलएम को एक नई चुनौती का सामना करना पड़ता है – कैसे व्यस्त सर्वर पर चल रहे अनुमान को बाधित किए बिना प्रीलोडेड चेकपॉइंट के लिए स्थानीयता का लाभ उठाया जाए?
सर्वरलेसएलएलएम एक नए तकनीक – जीपीयू सर्वर के माध्यम से एलएलएम अनुमान का लाइव माइग्रेशन पेश करता है। यह सर्वर पर निष्पादन को स्थानांतरित करने की अनुमति देता है जिसमें स्थानीय चेकपॉइंट उपलब्ध हैं।
लाइव एलएलएम माइग्रेशन के मुख्य संचालक:
- टोकन-आधारित माइग्रेशन
पूरे मॉडल स्टेट को स्नैपशॉट लेने के बजाय, सर्वरलेसएलएलएम केवल नेटवर्क पर न्यूनतम प्रॉम्प्ट टोकन को माइग्रेट करता है। यह स्नैपशॉट की तुलना में काफी कम डेटा को स्थानांतरित करता है।
- दो-चरण माइग्रेशन
गंतव्य सर्वर प्रॉम्प्ट टोकन से कैश स्टेट्स की प्रारंभिक गणना करता है। एक बार तैयार होने के बाद, स्रोत सर्वर अंतिम टोकन को स्थानांतरित करता है और संसाधनों को रिलीज़ करता है। यह अनुमान में व्यवधान को रोकता है।
प्रयोगों से पता चलता है कि टोकन-आधारित माइग्रेशन लंबी अनुक्रमों के लिए भी माइग्रेशन समय को कुछ सेकंड से कम कर देता है। लाइव माइग्रेशन स्थानीयता-निर्देशित आवंटन को प्राप्त करने के लिए महत्वपूर्ण है।
विलंबता-अनुकूलित मॉडल अनुसूची
एंड-टू-एंड विलंबता को कम करने के लिए, सर्वरलेसएलएलएम अनुसूचक को स्थानीयता को ध्यान में रखते हुए अनुकूलित करता है:
- बारीक विलंबता अनुमान
मॉडल नेटवर्क, एसएसडी कैश और मेमोरी से लोडिंग समय का अनुमान लगाते हैं और प्रत्येक सर्वर के लिए माइग्रेशन समय का अनुमान लगाते हैं, जो क्यू देरी, मॉडल आकार और मापी गई बैंडविड्थ जैसे मेट्रिक्स का उपयोग करते हैं।
- सटीक माइग्रेशन समय पूर्वानुमान
अनुसूचक सर्वर के लिए माइग्रेशन समय का अनुमान लगाता है, प्रॉम्प्ट और आउटपुट टोकन की संख्या का उपयोग करता है। यह अनुमान लगाने के लिए अनुमान प्रगति को असिंक्रोनस रूप से ट्रैक करता है।
- स्थानीयता-जागरूक आवंटन
प्रत्येक अनुमान अनुरोध के लिए, अनुसूचक सर्वर के लिए अनुमानित लोडिंग और माइग्रेशन समय का मूल्यांकन करता है। यह अपेक्षित स्टार्टअप विलंबता को कम करने वाले सर्वर का चयन करता है।
अनुसूचक सर्वर कार्य क्यू भी बनाए रखता है और दोष सहनशीलता के लिए एक मजबूत रूप से संगत स्टोर का लाभ उठाता है। इन नवाचारों के साथ, अनुसूचक विलंबता ओवरहेड को कम करता है और स्थानीयता लाभ को अधिकतम करता है।
सर्वरलेसएलएलएम प्रदर्शन का मूल्यांकन
व्यापक प्रयोग सर्वरलेसएलएलएम की एंड-टू-एंड प्रभावशीलता को मौजूदा प्रणालियों के खिलाफ बेंचमार्क करते हैं, जो वास्तविक दुनिया के मॉडल जैसे ऑप्टी-175बी और अज़ूर ट्रेस के अनुरूप कार्यभार का उपयोग करते हैं।
मुख्य परिणाम:
- माइक्रोबेंचमार्क: सर्वरलेसएलएलएम पायटोर्च/टेंसोरफ्लो की तुलना में 3.6-8.2 गुना तेजी से चेकपॉइंट लोडिंग हासिल करता है। यह स्टोरेज बैंडविड्थ को संतृप्त करता है, यहां तक कि एनवीएमई रेड के लिए भी।
- अनुसूची: सर्वरलेसएलएलएम यादृच्छिक अनुसूची की तुलना में 4-12 गुना आवंटन विलंबता को कम करता है, स्थानीयता जागरूकता के लाभों को उजागर करता है। लाइव माइग्रेशन क्यूइंग देरी को रोकता है।
- एंड-टू-एंड सर्विंग: बड़े मॉडल जैसे ऑप्टी-30बी के लिए, सर्वरलेसएलएलएम 99वें प्रतिशताइल विलंबता को केसर्व और रे सर्व जैसी प्रणालियों की तुलना में 28-200 गुना सुधारता है। यह संसाधन दक्षता में भी सुधार करता है।
इन महत्वपूर्ण लाभों से पता चलता है कि सर्वरलेसएलएलएम मौजूदा सर्वरलेस कार्यान्वयन में बोतलनेक को दूर करने और इंटरैक्टिव सेवाओं के लिए बड़े भाषा मॉडल की शक्ति को अनलॉक करने में सक्षम है।
सर्वरलेसएलएलएम में पेश किए गए अनुकूलन, जैसे कि मल्टी-टियर लोडिंग, लाइव माइग्रेशन और विलंबता-निर्देशित अनुसूची, भविष्य की सर्वरलेस वास्तुकला के डिजाइन को सूचित करने में मदद कर सकते हैं। प्रणाली की क्षमता लोडिंग और स्टार्टअप समय को कम करने से बड़े भाषा मॉडल के व्यावहारिक अनुप्रयोगों के लिए स्केलेबल तैनाती को अनब्लॉक किया जा सकता है।
आगे देखते हुए: जारी चुनौतियाँ
एक महत्वपूर्ण छलांग के बावजूद, सर्वरलेसएलएलएम बड़े भाषा मॉडल के लिए सर्वरलेस अनुमान को अनुकूलित करने में पहला कदम है। कई खुले मुद्दे बने हुए हैं, जिनमें शामिल हैं:
- वास्तविक समय मॉडल मांग की भविष्यवाणी करना तैनाती और प्रीलोडिंग को मार्गदर्शन करने के लिए
- सर्वर पर चेकपॉइंट को रखना ताकि कैश हिट को अधिकतम किया जा सके
- बड़े क्लस्टर को संभालने के लिए अनुसूची अल्गोरिदम को कुशलता से स्केल करना
- मॉडल और विकासकर्ताओं के बीच संसाधन आवंटन में न्याय सुनिश्चित करना
- लाइव माइग्रेशन जैसे नवाचारों को अन्य सर्वरलेस वर्कलोड में सामान्य बनाना
इन क्षेत्रों को संबोधित करने से सर्वरलेस एलएलएम के वादे को और भी अधिक सुलभ बनाने में मदद मिल सकती है। प्रणाली स्तर के अनुकूलन के अलावा, बड़े मॉडल के कार्बन फुटप्रिंट और संभावित हानि को कम करना भी एक तत्काल प्राथमिकता बना हुआ है।
सर्वरलेसएलएलएम यह प्रदर्शित करता है कि अगली पीढ़ी की सर्वरलेस वास्तुकला में एआई वर्कलोड के लिए नवाचार के लिए बहुत सारा अवसर है। जब बड़े भाषा मॉडल अपने आकार और लोकप्रियता में बढ़ते हैं, तो उनकी स्केलेबिलिटी को अनलॉक करने वाले समाधान जैसे सर्वरलेसएलएलएम और भी प्रभावी होंगे। सिस्टम और मशीन लर्निंग अनुसंधान का संयोजन नए दृष्टिकोण पेश कर सकता है जो एआई मॉडल को सुरक्षित और स्थायी रूप से परोसने, साझा करने और स्केल करने में मदद करेगा।













