विचार नेता
एआई अनुमान को बढ़ाना: उन्नत तकनीक और सर्वोत्तम प्रथाएं

जब वास्तविक समय के एआई-संचालित अनुप्रयोगों की बात आती है, जैसे कि स्व-ड्राइविंग कार या स्वास्थ्य देखभाल निगरानी, तो भी एक अतिरिक्त सेकंड की प्रसंस्करण समय गंभीर परिणाम हो सकते हैं। वास्तविक समय एआई अनुप्रयोगों को विश्वसनीय जीपीयू और प्रसंस्करण शक्ति की आवश्यकता होती है, जो बहुत महंगा और लागत-प्रतिबंधक रहा है – अब तक नहीं。
एक अनुकूलन अनुमान प्रक्रिया को अपनाने से, व्यवसाय न केवल एआई की दक्षता को अधिकतम कर सकते हैं, बल्कि वे ऊर्जा की खपत और परिचालन लागत (90% तक) को कम कर सकते हैं; गोपनीयता और सुरक्षा में सुधार करें; और यहां तक कि ग्राहक संतुष्टि में सुधार करें।
सामान्य अनुमान मुद्दे
कुछ सबसे आम मुद्दे जो कंपनियों को एआई की दक्षता को प्रबंधित करने के लिए आते हैं, उनमें अंडरयूटिलाइज्ड जीपीयू क्लस्टर, डिफ़ॉल्ट सामान्य उद्देश्य मॉडल और संबंधित लागत में अंतर्दृष्टि की कमी शामिल हैं।
टीमें अक्सर पीक लोड के लिए जीपीयू क्लस्टर प्रावधान करती हैं, लेकिन 70 और 80 प्रतिशत समय, वे असमान कार्य प्रवाह के कारण कम उपयोग किए जाते हैं।
इसके अलावा, टीमें बड़े सामान्य-उद्देश्य मॉडल (जीपीटी-4, क्लॉड) को डिफ़ॉल्ट रूप से चुनती हैं, भले ही कार्यों को छोटे, सस्ते ओपन-सोर्स मॉडल पर चलाया जा सकता हो। कारण? ज्ञान की कमी और कस्टम मॉडल बनाने में एक तेज़ सीखने की वक्र।
अंत में, इंजीनियरों को प्रत्येक अनुरोध के लिए वास्तविक समय लागत में अंतर्दृष्टि की कमी है, जिससे भारी बिल आते हैं। प्रॉम्प्टलेयर, हेलिकोन जैसे टूल इस अंतर्दृष्टि को प्रदान करने में मदद कर सकते हैं।
मॉडल चयन, बैचिंग और उपयोग पर नियंत्रण की कमी के साथ, अनुमान लागतों में दस गुना तक वृद्धि हो सकती है, संसाधनों को बर्बाद कर सकती है, सटीकता को सीमित कर सकती है और उपयोगकर्ता अनुभव को कम कर सकती है।
ऊर्जा की खपत और परिचालन लागत
बड़े एलएलएम जैसे जीपीटी-4, लामा 3 70बी या मिक्सट्रल-8×7बी को चलाने के लिए काफी अधिक शक्ति प्रति टोकन की आवश्यकता होती है। औसतन, 40 से 50 प्रतिशत ऊर्जा जो एक डेटा सेंटर द्वारा उपयोग की जाती है, वह कंप्यूटिंग उपकरण को शक्ति प्रदान करने के लिए उपयोग की जाती है, और अतिरिक्त 30 से 40 प्रतिशत उपकरण को ठंडा करने के लिए समर्पित है।
इसलिए, एक कंपनी जो पैमाने पर अनुमान के लिए चौबीसों घंटे चलती है, यह एक ऑन-प्रिमाइसेस प्रदाता को एक क्लाउड प्रदाता की तुलना में अधिक लाभदायक हो सकता है ताकि प्रीमियम लागत से बचा जा सके और अधिक ऊर्जा की खपत को रोका जा सके।
गोपनीयता और सुरक्षा
सिस्को के अनुसार2025 डेटा गोपनीयता बेंचमार्क अध्ययन, “64% उत्तरदाता संवेदनशील जानकारी को अनजाने में सार्वजनिक रूप से या प्रतियोगियों के साथ साझा करने के बारे में चिंतित हैं, फिर भी लगभग आधे स्वीकार करते हैं कि वे जेनएआई टूल में व्यक्तिगत कर्मचारी या गैर-सार्वजनिक डेटा इनपुट करते हैं।” यह गैर-उपयुक्त लॉगिंग या कैशिंग के मामले में गैर-उपयुक्तता के जोखिम को बढ़ाता है।
एक और जोखिम का अवसर विभिन्न ग्राहक संगठनों में साझा बुनियादी ढांचे पर मॉडल चलाना है; यह डेटा उल्लंघन और प्रदर्शन समस्याओं को जन्म दे सकता है, और एक उपयोगकर्ता की क्रियाओं के अन्य उपयोगकर्ताओं पर प्रभाव डालने का जोखिम है। इसलिए, उद्यम आमतौर पर अपने क्लाउड में तैनात सेवाओं को पसंद करते हैं।
ग्राहक संतुष्टि
जब प्रतिक्रियाएं कुछ सेकंड से अधिक समय लेती हैं, तो उपयोगकर्ता आमतौर पर गिर जाते हैं, जो इंजीनियरों द्वारा शून्य विलंबता के लिए अति-अनुकूलन के प्रयासों का समर्थन करता है। इसके अलावा, अनुप्रयोगों में “बाधाएं जैसे हॉलुसिनेशन और असटीकता हो सकती हैं जो व्यापक प्रभाव और अपनाने को सीमित कर सकती हैं,” गार्टनर प्रेस रिलीजके अनुसार।
इन मुद्दों को प्रबंधित करने के व्यवसाय लाभ
बैचिंग को अनुकूलित करना, सही आकार के मॉडल (जैसे, लामा 70बी या बंद स्रोत मॉडल जैसे जीपीटी से जेमा 2बी में स्विच करना) और जीपीयू उपयोग में सुधार करने से अनुमान बिल 60 से 80 प्रतिशत तक कम किए जा सकते हैं। वीएलएलएम जैसे टूल का उपयोग करने से मदद मिल सकती है, जैसे कि एक सर्वरलेस पे-एस-यू-गो मॉडल में स्विच करना एक स्पाइकी कार्य प्रवाह के लिए।
क्लीनलैब लें, उदाहरण के लिए। क्लीनलैब नेविश्वसनीय भाषा मॉडल (टीएलएम) लॉन्च कियाप्रत्येक एलएलएम प्रतिक्रिया में एक विश्वसनीयता स्कोर जोड़ने के लिए। यह उच्च-गुणवत्ता वाले आउटपुट और बढ़ी हुई विश्वसनीयता के लिए डिज़ाइन किया गया है, जो उद्यम अनुप्रयोगों के लिए महत्वपूर्ण है ताकि अनियंत्रित हॉलुसिनेशन को रोका जा सके। इन्फरलेस से पहले, क्लीनलैब ने बढ़े हुए जीपीयू लागत का अनुभव किया, क्योंकि जीपीयू तब भी चल रहे थे जब वे सक्रिय रूप से उपयोग नहीं किए जा रहे थे। उनकी समस्याएं पारंपरिक क्लाउड जीपीयू प्रदाताओं के लिए विशिष्ट थीं: उच्च विलंबता, अकुशल लागत प्रबंधन और प्रबंधन के लिए एक जटिल वातावरण। सर्वरलेस अनुमान के साथ, उन्होंने लागत 90 प्रतिशत तक कम कर दी जबकि प्रदर्शन के स्तर को बनाए रखा। अधिक महत्वपूर्ण बात यह है कि वे दो सप्ताह के भीतर किसी अतिरिक्त इंजीनियरिंग ओवरहेड लागत के बिना लाइव हो गए।
मॉडल वास्तुकला को अनुकूलित करना
फाउंडेशन मॉडल जैसे जीपीटी और क्लॉड अक्सर सामान्यीकरण के लिए प्रशिक्षित किए जाते हैं, न कि दक्षता या विशिष्ट कार्यों के लिए। खुले स्रोत मॉडलों को विशिष्ट उपयोग के मामलों के लिए अनुकूलित नहीं करने से, व्यवसायों को स्मृति और कम्प्यूटेशनल समय की बर्बादी होती है जो उन कार्यों के लिए आवश्यक नहीं है।
नए जीपीयू चिप्स जैसे एच100 तेज़ और कुशल हैं। वे विशेष रूप से बड़े पैमाने पर संचालन जैसे वीडियो जेनरेशन या एआई-संबंधित कार्यों के लिए महत्वपूर्ण हैं। अधिक सीउडीए कोर प्रसंस्करण गति में वृद्धि करते हैं, जो छोटे जीपीयू को पार करते हैं; एनवीडिया के टेंसर कोरइन कार्यों को पैमाने पर त्वरित करने के लिए डिज़ाइन किए गए हैं।
जीपीयू मेमोरी मॉडल वास्तुकला को अनुकूलित करने में भी महत्वपूर्ण है, क्योंकि बड़े एआई मॉडल को महत्वपूर्ण स्थान की आवश्यकता होती है। यह अतिरिक्त मेमोरी जीपीयू को बड़े मॉडल चलाने की अनुमति देती है без गति को समझौता किए। इसके विपरीत, छोटे जीपीयू जो कम वीआरएएम हैं, उनका प्रदर्शन खराब होता है, क्योंकि वे धीमी सिस्टम रैम में डेटा ले जाते हैं।
मॉडल वास्तुकला को अनुकूलित करने के कई लाभ हैं, जिनमें समय और पैसे की बचत शामिल है। पहले, घने ट्रांसफॉर्मर से लोरा-अनुकूलित या फ्लैशएटेंशन-आधारित वेरिएंट में स्विच करने से प्रतिक्रिया समय प्रति प्रश्न 200 से 400 मिलीसेकंड तक कम हो सकता है, जो चैटबॉट और गेमिंग में महत्वपूर्ण है। इसके अलावा, क्वांटाइज्ड मॉडल (जैसे 4-बिट या 8-बिट) को कम वीआरएएम की आवश्यकता होती है और सस्ते जीपीयू पर तेजी से चलते हैं।
लंबे समय में, मॉडल वास्तुकला को अनुकूलित करने से अनुमान पर पैसे की बचत होती है, क्योंकि अनुकूलित मॉडल छोटे चिप्स पर चल सकते हैं।
मॉडल वास्तुकला को अनुकूलित करने में निम्नलिखित चरण शामिल हैं:
- क्वांटीकरण — सटीकता को कम करना (एफपी32 → इंट4/इंट8), मेमोरी को बचाना और कम्प्यूटेशनल समय को तेज करना
- प्रूनिंग — कम उपयोगी वजन या परतों (संरचित या असंरचित) को हटाना
- जिलाना — एक छोटे “छात्र” मॉडल को प्रशिक्षित करना ताकि वह एक बड़े मॉडल के आउटपुट की नकल कर सके
मॉडल आकार को संपीड़ित करना
छोटे मॉडल का अर्थ है तेजी से अनुमान और कम महंगा बुनियादी ढांचा। बड़े मॉडल (13बी+, 70बी) को महंगे जीपीयू (ए100, एच100), उच्च वीआरएएम और अधिक शक्ति की आवश्यकता होती है। उन्हें संपीड़ित करने से उन्हें सस्ते हार्डवेयर पर चलाने की अनुमति मिलती है, जैसे कि ए10 या टी4, जिसमें बहुत कम विलंबता होती है।
संपीड़ित मॉडल डिवाइस (फोन, ब्राउज़र, आईओटी) पर अनुमान चलाने के लिए भी महत्वपूर्ण हैं, क्योंकि छोटे मॉडल अधिक समकालिक अनुरोधों की सेवा करने की अनुमति देते हैं बिना बुनियादी ढांचे को स्केल किए। एक चैटबॉट में 1,000 से अधिक समकालिक उपयोगकर्ताओं के साथ, 13बी से 7बी संपीड़ित मॉडल में जाने से एक टीम को प्रति जीपीयू बिना विलंबता के दोगुने से अधिक उपयोगकर्ताओं की सेवा करने की अनुमति मिली।
विशेषज्ञ हार्डवेयर का लाभ उठाना
सामान्य-उद्देश्य सीपीयू टेंसर संचालन के लिए नहीं बनाए गए हैं। विशेषज्ञ हार्डवेयर जैसे एनवीडिया ए100, एच100, गूगल टीपीयू या एएमडब्ल्यू इन्फेरेंटिया एलएलएम के लिए तेजी से अनुमान (10 से 100 गुना तक) प्रदान कर सकते हैं और बेहतर ऊर्जा दक्षता प्रदान कर सकते हैं। प्रति अनुरोध 100 मिलीसेकंड तक की कटौती करना दैनिक रूप से लाखों अनुरोधों के साथ एक अंतर बना सकता है।
इस कल्पनात्मक उदाहरण पर विचार करें:
एक टीम अपने आंतरिक राग सिस्टम के लिए ए10 जीपीयू पर एलएलएमए-13बी चला रही है। विलंबता लगभग 1.9 सेकंड है, और वे वीआरएएम सीमाओं के कारण बहुत अधिक बैच नहीं कर सकते हैं। इसलिए वे एच100 पर स्विच करते हैं जिसमें टेंसरआरटी-एलएलएम, एफपी8 और अनुकूलित ध्यान कERNEL होता है, और बैच आकार को 8 से 64 तक बढ़ाते हैं। परिणाम विलंबता को 400 मिलीसेकंड तक कम करना है और थ्रूपुट में पांच गुना वृद्धि है।
परिणामस्वरूप, वे एक ही बजट पर पांच गुना अधिक अनुरोधों की सेवा कर सकते हैं और इंजीनियरों को बुनियादी ढांचे की बोतलें नेविगेट करने से मुक्त कर सकते हैं।
तैनाती विकल्पों का मूल्यांकन
विभिन्न प्रक्रियाओं के लिए विभिन्न बुनियादी ढांचे की आवश्यकता होती है; 10 उपयोगकर्ताओं वाला एक चैटबॉट और प्रति दिन एक मिलियन क्वेरी को सेवा करने वाला एक खोज इंजन अलग-अलग आवश्यकताओं हैं। क्लाउड (जैसे एएमडब्ल्यू सेजमेकर) या डीआईवाई जीपीयू सर्वर पर पूरी तरह से जाने से बिना लागत-प्रदर्शन अनुपात का मूल्यांकन किए बिना बर्बादी और खराब उपयोगकर्ता अनुभव हो सकता है। ध्यान दें कि यदि आप जल्दी से एक बंद क्लाउड प्रदाता के लिए प्रतिबद्ध हैं, तो बाद में समाधान को स्थानांतरित करना दर्दनाक है। हालांकि, एक पे-एस-यू-गो संरचना के साथ जल्दी से मूल्यांकन करने से आपको आगे के विकल्प मिलते हैं।
मूल्यांकन में निम्नलिखित चरण शामिल हैं:
- मॉडल विलंबता और लागत को प्लेटफ़ॉर्म पर बेंचमार्क करें: एएमडब्ल्यू, एज़्योर, स्थानीय जीपीयू क्लस्टर या सर्वरलेस टूल पर ए/बी परीक्षण चलाएं।
- कोल्ड स्टार्ट प्रदर्शन को मापें: यह सर्वरलेस या इवेंट-ड्रिवन वर्कलोड के लिए विशेष रूप से महत्वपूर्ण है, क्योंकि मॉडल तेजी से लोड होते हैं।
- दृश्यता और स्केलिंग सीमाओं का मूल्यांकन करें: उपलब्ध मेट्रिक्स का मूल्यांकन करें और पहचानें कि प्रति सेकंड अधिकतम क्वेरी क्या है इससे पहले कि यह बिगड़ जाए।
- अनुपालन समर्थन की जांच करें: निर्धारित करें कि क्या आप भौगोलिक-बाध्य डेटा नियम या ऑडिट लॉग लागू कर सकते हैं।
- कुल स्वामित्व लागत का अनुमान लगाएं। इसमें जीपीयू घंटे, स्टोरेज, बैंडविड्थ और टीमों के लिए ओवरहेड शामिल होना चाहिए।
नीचे की रेखा
अनुमान व्यवसायों को अपने एआई प्रदर्शन को अनुकूलित करने, ऊर्जा की खपत और लागत को कम करने, गोपनीयता और सुरक्षा बनाए रखने और ग्राहकों को खुश रखने में सक्षम बनाता है।












