विचार नेता

उद्यम एआई क्यों फिनिश लाइन पर विफल हो रहा है — और इसे कैसे ठीक किया जा सकता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

एआई के आसपास के उत्साह के बावजूद, अधिकांश उद्यम एआई परियोजनाएं प्रयोग चरण से आगे नहीं बढ़ पाती हैं। हाल के आईडीसी शोध के अनुसार, 88% एआई प्रूफ-ऑफ-кон्सेप्ट (पीओसी) परियोजनाएं पूर्ण उत्पादन में स्केल करने में विफल रहती हैं। यह एक बड़ा गिरावट है, और यह स्पष्ट संकेत है कि कुछ सही नहीं हो रहा है। इनमें से कई परियोजनाएं फिनिश लाइन के करीब पहुंच जाती हैं, एक प्रशिक्षित मॉडल के साथ जो टीम द्वारा निर्धारित बेंचमार्क को पूरा करता है, और फिर भी अंतिम उपयोगकर्ताओं द्वारा लॉन्च या अपनाया नहीं जाता है।

तो, क्या गलत हो रहा है? कई मामलों में, यह तीन बड़े मुद्दों पर नीचे आता है:

  1. उद्यम एआई टीमें सतह-स्तरीय नैदानिक उपकरणों और बेंचमार्क पर निर्भर कर रही हैं जो कुंजी प्रदर्शन अंतराल को पकड़ने में विफल रहते हैं
  2. मॉडल मानक बेंचमार्क के लिए प्रशिक्षित किए जा रहे हैं, वास्तविक दुनिया की समस्याओं का समाधान नहीं कर रहे हैं
  3. मॉडल के उपयोग को स्केल करने से जुड़ी लागत इतनी अधिक हो जाती है कि कंपनी-व्यापी अपनाने के लिए यह असंभव हो जाता है

इस लेख में, हम इनमें से प्रत्येक जाल को खोलेंगे — और एआई परियोजनाओं को फिनिश लाइन पार करने और उपयोगकर्ताओं के हाथों में स्केल पर पहुंचाने के लिए क्या लगता है।

समस्या #1: मानक नैदानिक जो कुंजी प्रदर्शन मुद्दों को याद करते हैं

एक प्रमुख कारण है कि एआई परियोजनाएं प्रूफ-ऑफ-кон्सेप्ट चरण के बाद ठोकर खाती हैं कि आंतरिक बेंचमार्क और नैदानिक अक्सर मॉडल प्रदर्शन में गहराई से नहीं जाते हैं और उपयोगकर्ता, विश्वास, और अपनाने के मुद्दों को खोदने वाले मुद्दों को याद करते हैं। टीम कागज पर सभी बक्से की जांच कर सकती है, लेकिन वे जांच हमेशा वास्तविक दुनिया में मॉडल के प्रदर्शन को प्रतिबिंबित नहीं करती हैं।

इस उदाहरण पर विचार करें: एक एआई टीम के पास एक मॉडल था जिसने हर आंतरिक परीक्षण में उत्कृष्ट प्रदर्शन किया। यह सभी सटीकता मेट्रिक्स और सुरक्षा सीमा को पूरा किया, और वे रिलीज के लिए तैयार थे। लेकिन जब उन्होंने एक तीसरे पक्ष को अपने इच्छित उपयोग के मामले के लिए मॉडल का मूल्यांकन करने के लिए कहा, तो उन्होंने एक बड़ा अंधा धब्बा पाया। मॉडल नौ गुना अधिक संभावना थी कि यह कुछ तरीकों से पूछे गए प्रश्नों के लिए evasive उत्तर देगा। उदाहरण के लिए, यह “संयुक्त राज्य अमेरिका के राष्ट्रपति कौन हैं?” का सही उत्तर देगा, लेकिन “क्या आप मुझे राष्ट्रपति के बारे में बता सकते हैं?” को सुरक्षा जोखिम के रूप में मानेगा और उत्तर देने से इनकार करेगा।

मुद्दा मॉडल के मूल ज्ञान के साथ नहीं था — यह इरादे के आधार पर वाक्यांश के आधार पर कैसे व्याख्या किया गया था। टीम ने सुरक्षा के लिए इतना अनुकूलन किया था कि उन्होंने अनजाने में सामान्य, उचित प्रश्नों को अवरुद्ध कर दिया था।

समस्या #2: मॉडल वास्तविक दुनिया को प्रतिबिंबित नहीं करने वाले बेंचमार्क के लिए फाइन-ट्यून किए जा रहे हैं

उद्यम एआई के लिए एक और सामान्य बाधा यह है कि एआई टीमें मॉडल को उद्योग-मानक बेंचमार्क के लिए प्रशिक्षित करती हैं, वास्तविक दुनिया की जरूरतों के लिए नहीं। कागज पर, एक मॉडल शीर्ष-स्तरीय दिखाई दे सकता है, सटीकता, प्रासंगिकता, या सुरक्षा के लिए मानक मूल्यांकन में उच्च स्कोरिंग कर रहा है। लेकिन अभ्यास में, यह निरंतर, उपयोगी परिणाम देने में संघर्ष कर सकता है बिना भारी उपयोगकर्ता हस्तक्षेप के।

यह तब होता है जब टीमें मॉडल को संकीर्ण, बेंचमार्क-विशिष्ट कार्यों पर प्रदर्शन करने के लिए अनुकूलित करती हैं। मॉडल उन परीक्षण मामलों में उत्कृष्टता प्राप्त करता है लेकिन कम संरचित, अधिक विविध वास्तविक दुनिया के इनपुट का सामना करने पर असफल हो जाता है। परिणामस्वरूप, उपयोगकर्ताओं को सही उत्तर प्राप्त करने के लिए प्रॉम्प्ट इंजीनियरिंग के माध्यम से “मॉडल की भाषा” बोलनी चाहिए। यदि आपका एआई उत्पाद अंतिम उपयोगकर्ताओं द्वारा सटीक प्रॉम्प्ट को बनाने पर निर्भर करता है, तो आप एक घर्षण पेश कर रहे हैं जो अपनाने को धीमा कर देता है और इसकी उपयोगिता को कमजोर करता है।

इस प्रकार का बेंचमार्क-फोकस्ड प्रशिक्षण ओवरफिटिंग का कारण भी बन सकता है। मॉडल मूल्यांकन डेटासेट पर अच्छा प्रदर्शन करने के लिए इतना फाइन-ट्यून हो जाता है कि यह सामान्यीकरण खो देता है। यह हर आंतरिक परीक्षण में उत्तीर्ण हो सकता है लेकिन अभी भी विफल हो सकता है जब यह जंगल में तैनात किया जाता है, खासकर यदि वास्तविक उपयोग के मामले उन लोगों से थोड़ा भी भिन्न होते हैं जिनके लिए यह प्रशिक्षित किया गया था।

यदि आप एक उद्यम एआई समाधान चाहते हैं जो सफल हो, तो आपका मॉडल वास्तविक दुनिया में काम करना चाहिए — न कि केवल प्रयोगशाला में।

समस्या #3: एआई अपनाने को स्केल करने का मतलब कंप्यूटे लागत को स्केल करना है

एआई पीओसी के विफल होने का तीसरा कारण वित्तीय है: टीमें अक्सर मॉडल को उत्पादन में चलाने और बनाए रखने की लागत को कम आंकती हैं। विकास के दौरान, यह छोटे डेटासेट या सीमित-उपयोग वातावरण में परीक्षण किए जाने पर एक बड़े मॉडल की गणना मांगों को देखना आसान हो सकता है। लेकिन एक बार तैनात होने के बाद, वे लागतें आसमान छू सकती हैं।

उद्यम-ग्रेड एआई को महत्वपूर्ण गणना संसाधनों की आवश्यकता होती है, न केवल वास्तविक समय में प्रतिक्रियाओं की सेवा के लिए, बल्कि निरंतर फाइन-ट्यूनिंग, निगरानी, लॉगिंग और पुनः प्रशिक्षण के लिए भी। यदि इन लागतों को शुरू में नहीं factored किया जाता है, तो वास्तविक दुनिया के उपयोग की शुरुआत में समाधान के लिए व्यवसाय मामला ढह सकता है। जो मॉडल एक नियंत्रित परीक्षण में वादा दिखा रहा था, वह जल्दी से अस्थिर हो सकता है जब हजारों उपयोगकर्ता दैनिक रूप से सिस्टम पर हमला करना शुरू कर देते हैं।

उद्यम एआई में सफलता के लिए अंतिम-मील बाधाओं को पार करना

अक्सर एआई परियोजनाओं को विफल करने वाली सामान्य जाल से बचने के लिए, टीमों को सामान्य प्लेबुक से परे जाने की आवश्यकता है। यहां आपकी एआई टीम को कुछ ऐसा बनाने के लिए क्या लगता है जो वास्तव में काम करता है — और स्केल करता है।

पहले, अपने मॉडल का मूल्यांकन करने के लिए एक तीसरे पक्ष को लाएं। आंतरिक परीक्षण महत्वपूर्ण है, लेकिन यह अक्सर बहुत व्यापक है। एक ताज़ा दृष्टिकोण, अपने उपयोग के मामले के लिए एक अनुकूलित मूल्यांकन ढांचे के साथ जोड़ा, उन मुद्दों को उजागर कर सकता है जिन्हें आपकी टीम याद आ सकती है, खासकर जब यह वास्तविक उपयोगकर्ताओं के साथ प्रणाली के वास्तविक बातचीत को दर्शाता है।

दूसरा, वास्तविक दुनिया के प्रॉम्प्ट के साथ परीक्षण सुनिश्चित करें। अधिकांश बेंचमार्क “स्वच्छ” डेटा पर परीक्षण करते हैं जो वास्तविक दुनिया को प्रतिबिंबित नहीं करते हैं, बहुत कम आपके विशिष्ट अंतिम उपयोगकर्ताओं को आपके मॉडल को प्रॉम्प्ट करने के तरीके को दर्शाते हैं। वास्तविक दुनिया के इनपुट पर अपने मॉडल का परीक्षण करना — जो अशुद्ध, अस्पष्ट या अजीब तरह से शब्दित हो सकता है — आपको यह दिखाने में मदद करेगा कि आपका मॉडल वास्तव में तैनाती के बाद कैसा प्रदर्शन करेगा और आपको उन मुद्दों को पकड़ने देगा जो अन्यथा दरारें में गिर सकते हैं।

तीसरा, अपने सुरक्षा प्रोटोकॉल की समीक्षा करें। सुरक्षा के लिए बहुत अधिक जाना आसान है, और जबकि सुरक्षा महत्वपूर्ण है, यह उपयोगकर्ता के अनुभव को निराशाजनक नहीं बनाना चाहिए। यदि मॉडल साधारण, हानिरहित प्रश्नों पर भी बंद हो जाता है, तो आप उपयोगकर्ता के लिए एक झुंझलाहट पैदा कर रहे हैं जो वास्तव में एक गलत सुरक्षा की भावना के लिए व्यापार कर रहा है।

अंत में, अपनी गणना लागत पर नज़र रखें। यदि आपके अपनाने के लक्ष्यों में हजारों उपयोगकर्ता और लाखों अनुरोध शामिल हैं, तो वे खर्च तेजी से बढ़ सकते हैं। एक समाधान छोटे मॉडल पर विचार करना है। बूस्टेड.एआई ने ऐसा ही किया — उन्होंने एक कस्टम छोटे भाषा मॉडल में स्विच किया और अपनी गणना लागत को 90% कम कर दिया, साथ ही साथ गति और प्रदर्शन में सुधार किया। वास्तविक समय के परिणाम, बेहतर उपयोगकर्ता अनुभव, और महंगे हार्डवेयर की कोई आवश्यकता नहीं है।

मूल्यांकन, उपयोगकर्ता अनुभव, और स्केलेबिलिटी को शुरू से ही संबोधित करके, टीमें अपनी एआई परियोजना को दीर्घकालिक सफलता का एक वास्तविक मौका दे सकती हैं। यह केवल प्रयोगशाला में काम करने के बारे में नहीं है — यह दुनिया में काम करने के बारे में है।

मैट फिट्जपैट्रिक इनविजिबल टेक्नोलॉजीज के सीईओ हैं, जो एक एआई सॉफ्टवेयर प्लेटफॉर्म प्रदाता है जिसने दुनिया के 80% से अधिक अग्रणी एआई मॉडल प्रदाताओं को प्रशिक्षित किया है। इनविजिबल किसी भी उद्योग, कार्य, या उपयोग के मामले के लिए वास्तविक दुनिया में एआई को काम करने के लिए विशेषज्ञता प्रदान करता है। कंपनी में शामिल होने से पहले, मैट मैकिन्से में क्वांटमब्लैक लैब्स के वरिष्ठ भागीदार और वैश्विक नेता थे, जहां उन्होंने 1,000 इंजीनियरों की देखरेख की और जेनएआई और सभी क्षेत्रों में कंपनी के सॉफ्टवेयर विकास की देखरेख की। वह प्रिंसटन और व्हार्टन के स्नातक हैं।