विचार नेता
चार सबसे महंगी विफलताएं जो खराब परीक्षण वाले एआई की विशेषता हैं

जब कंपनियां मानव निरीक्षण के बिना एआई को तैनात करती हैं, तो वे基本 रूप से एक गैर-निर्धारित स्वचालित प्रणाली से अपने आप को मान्य करने के लिए कहती हैं।
समस्या यह नहीं है कि एआई परीक्षण में खराब है। एआई उन चीजों को करने में उत्कृष्ट है जो पहले से ही की जा चुकी हैं, विशेष रूप से जो नियम आप विशेष रूप से निर्धारित करते हैं। लेकिन विफलताएं जो वास्तव में आपके ब्रांड को नुकसान पहुंचाती हैं? वे मानव निर्णय के लिए सबसे महत्वपूर्ण स्थानों में रहते हैं। एक हॉलुसिनेशन एक रिटर्न नीति के बारे में। एक संवेदनशील शिकायत के लिए एक ऑफ-ब्रांड प्रतिक्रिया। एक सुरक्षा गार्डरेल जो दबाव में नहीं रखता है।
के साथ 70% ग्राहक एक बुरे एआई इंटरैक्शन के बाद स्विच करने के लिए तैयार हैं, दांव ऊंचे हैं। फिर भी, अधिकांश कंपनियां एआई को आउटडेटेड या स्वचालित-ओनली टूल्स द्वारा मान्य किया जा रहा है, जो निर्धारित सॉफ्टवेयर के लिए बनाया गया था। उस स्टैक को कभी भी विफलताओं को पकड़ने के लिए डिज़ाइन नहीं किया गया था जो वास्तव में लोगों को दूर ले जाते हैं।
टेस्लियो द्वारा चलाए गए उद्यम टीमों के लिए, चार विफलता मोड अधिकांश ग्राहक-दृश्य क्षति के लिए जिम्मेदार हैं। उनमें से कोई भी स्वचालित परीक्षण द्वारा पकड़ा नहीं जा सकता है।
1. सुरक्षा और सुरक्षा गार्डरेल जो वास्तव में सुरक्षा नहीं करते हैं
एक ग्राहक आपके चैटबॉट से सही प्रश्न पूछता है सही तरीके से। बॉट उन्हें $10 के लिए $1,000 की वस्तु प्रदान करता है। या यह जानकारी का खुलासा करता है जो यह绝 नहीं होना चाहिए। या यह एक मूलभूत व्यावसायिक नियम तोड़ता है क्योंकि किसी ने सीमा स्थितियों का परीक्षण नहीं किया है।
जोखिम सीधा है। नुकसान तुरंत है और नुकसान सार्वजनिक है।
वास्तविक समस्या स्वचालित नहीं है, हालांकि यह इसका एक हिस्सा है। गार्डरेल्स मानकीकृत नहीं हैं, उन्हें आपके विशिष्ट व्यवसाय संदर्भ में अनुकूलित किया जाना चाहिए। और जब भी सर्वोत्तम प्रथाओं का पालन किया जाता है, गार्डरेल्स अभी भी कमजोर रहते हैं। ” पोएटिक जेलब्रेक जैसी तकनीकें हमें दिखाती हैं कि अच्छी तरह से इरादे वाले गार्डरेल्स को उनके निर्माताओं द्वारा कभी भी अनुमानित तरीके से हेरफेर किया जा सकता है। कंपनियों को जो प्रश्न पूछना चाहिए वह यह नहीं है कि “क्या हमारा गार्डरेल उद्योग मानकों का पालन करता है?” बल्कि “इस मॉडल को हेरफेर करने के नए तरीके क्या हैं?”
इसके लिए विरोधी सोच की आवश्यकता है। रचनात्मक, जांच करने वाले मानव जो गार्डरेल डिजाइन और हमले की सतह दोनों को समझते हैं। किनारों का परीक्षण, तनाव परीक्षण, जटिल प्रश्न पूछना। यह एक गार्डरेल के बीच का अंतर है जो अनुपालन पारित करता है और एक गार्डरेल जो वास्तव में रखता है।
2. हॉलुसिनेशन में छिपी सटीकता और व्यावसायिक तर्क विफलताएं
वास्तविकता यह है कि एआई हॉलुसिनेट करता है। मैंने जो सीखा है वह यह है कि जब आपके पास किसी क्षेत्र में डोमेन विशेषज्ञता है, तो आप तुरंत हॉलुसिनेशन को देखते हैं। आप सीधे इसके माध्यम से देखते हैं।
लेकिन यहाँ एक महत्वपूर्ण दोष है जो केवल आपकी आंतरिक टीम पर निर्भर करता है: वे अंधे धब्बे हैं। जब आप एक उत्पाद को अंदर और बाहर जानते हैं, तो आप जानते हैं कि सही उत्तर प्राप्त करने के लिए कौन से प्रश्न पूछने हैं। आप उन अशुद्धियों को नहीं पा सकते हैं जिन्हें आप नहीं देख रहे हैं। आंतरिक टीमें जानती हैं कि उत्पाद को कैसे काम करना चाहिए, न कि वास्तविक उपयोगकर्ताओं के लिए कैसे काम करता है जिन्हें विभिन्न मानसिक मॉडल, विभिन्न संदर्भ और आपके धारणाओं को तोड़ने के विभिन्न तरीके हैं।
यहीं पर ताज़ा दृष्टिकोण वाले लोगों से पर्यवेक्षण आता है। वे केवल यह नहीं मान्य करते हैं कि एआई वह करता है जो आप उन्हें बताते हैं; वे उन मुद्दों को उजागर करते हैं जो विभिन्न विभागों के लिए रुचिकर हो सकते हैं और वास्तविक दुनिया की विफलता के क्षेत्रों को रेखांकित करते हैं।
जब कंपनियां मुख्य बड़े भाषा मॉडल पर बनाना शुरू करती हैं, जब वे अपनी प्रक्रियाओं और कार्य प्रवाहों को ऊपर जोड़ते हैं, तो परीक्षण आवश्यकताएं और भी महत्वपूर्ण हो जाती हैं।
3. उपयोगकर्ता अनुभव और उपयोगकर्ता अनुभव पर अध्ययन
क्या यह सही लगता है? क्या यह दिखता है सही? क्या भुगतान प्रसंस्करण थोड़ा लंबा लेता है? क्या प्रतिक्रिया एक निराश ग्राहक या एक पहली बार उपयोगकर्ता के लिए सही स्वर और गति लेती है।
यह वह प्रश्न है जिसका उत्तर स्वचालित उपकरण नहीं दे सकते हैं। और वे ग्राहकों के लिए बहुत महत्वपूर्ण हैं।
एक परीक्षण सूट पास करने और वास्तव में अच्छा होने के बीच एक मूलभूत अंतर है। एक एआई इंटरैक्शन आपके स्वीकृति मानदंडों में हर बॉक्स की जांच कर सकता है और फिर भी एक उपयोगकर्ता के लिए गलत माना जा सकता है। यह तकनीकी रूप से सही हो सकता है लेकिन संगठनात्मक रूप से ज़ोरदार हो सकता है। यह सही जानकारी गलत कैडेंस या स्वर में वितरित कर सकता है।
यहां एक मानव-इन-द-लूप आवश्यक है। आपको लोगों की आवश्यकता है जो एआई विफलताओं को पहचानने के लिए प्रशिक्षित हों, जो आपके ग्राहकों के निवास क्षेत्रों में परीक्षण कर रहे हैं, जो वे वास्तव में उपयोग करते हैं उन उपकरणों और भुगतान विधियों के साथ। कोई जो सैन फ्रांसिस्को में एक शीर्ष-अप-द-लाइन आईफ़ोन पर परीक्षण कर रहा है, वह जकार्ता में एक मध्य-श्रेणी के एंड्रॉइड के साथ एक धब्बेदार डेटा कनेक्शन के साथ परीक्षण करने वाले किसी व्यक्ति के अनुभव से अलग अनुभव कर रहा है। यदि आपके पास परीक्षण करने वाले लोगों में विविधता नहीं है, तो आप सिम्युलेटेड परिणाम प्राप्त कर रहे हैं जो आपके उत्पाद को वास्तविकता से मिलने के क्षण में विफल हो जाएंगे।
आपको किसी की आवश्यकता है जो वास्तव में उत्पाद का उपयोग कर रहा है, वास्तव में अनुभव के बारे में सोच रहा है, वास्तव में जब कुछ सही नहीं लगता है तो वापस धक्का दे रहा है।
4. मान्य विशेषज्ञता का भ्रम
यह सबसे सूक्ष्म विफलता है, और शायद सबसे खतरनाक। जब कंपनियां पर्याप्त परीक्षण के बिना एआई को तैनात करती हैं, तो वे अक्सर यह दांव लगा रही हैं कि एआई ने डोमेन को ठीक से संभालने के लिए पर्याप्त ज्ञान吸收 किया है। वे यह मान रहे हैं कि क्योंकि एआई किसी चीज़ के बारे में आत्मविश्वास से बोल सकता है, यह शायद जानता है कि यह क्या कर रहा है।
लेकिन इसमें एक और आयाम है। अधिकांश लोग एआई सुविधाओं का उपयोग करते समय यह मान लेते हैं कि एआई आउटपुट को प्रश्न नहीं करता है। यदि यह अधिकारी लगता है और स्पष्ट रूप से गलत नहीं है, तो वे इस पर विश्वास करते हैं। बुरी चिकित्सा सलाह। गलत कानूनी मार्गदर्शन। दोषपूर्ण वित्तीय सिफारिशें। परिणाम तब जुड़ जाते हैं जब उपयोगकर्ता मानते हैं कि एआई सही है और इसका विरोध करने का कोई कारण नहीं है।
एआई यह जानने में बहुत अच्छा है कि क्या किया गया है। यह निर्णय लेने में अच्छा नहीं है कि नोवेल स्थितियों में क्या किया जाना चाहिए। हर व्यवसाय में नोवेल स्थितियां हैं। हर उत्पाद में एज केस हैं। हर ग्राहक यात्रा में एक क्षण है जहां सही उत्तर वह है जो एआई को देने के लिए प्रशिक्षित नहीं किया गया है।
रिलीज़ तैयारी को पुनः परिभाषित करना
एक परिपक्व एआई रिलीज़ रणनीति में स्वचालित-मात्र दृष्टिकोण से परे जाना शामिल है। इसमें मानव-इन-द-लूप विशेषज्ञता का एक संरचित फ्रेमवर्क बनाना शामिल है।
- इंजीनियरिंग: यह टीम को सिस्टम अखंडता का मालिक होना चाहिए, जो मॉडल और बुनियादी ढांचे के स्तर पर विफलता की तरह दिखता है, और जहां गार्डरेल्स को बैठने की आवश्यकता है।
- उत्पाद: नेताओं को सीमा निर्णयों का मालिक होना चाहिए, जो यह तय करना चाहिए कि कौन से निर्णय एआई स्वचालित रूप से ले सकता है, कौन से मानव अनुमोदन की आवश्यकता है, और कौन से यह छूने के लिए नहीं हैं।
- डिज़ाइन और क्यूए: ये पेशेवर उपयोगकर्ता अनुभव के मालिक होने चाहिए, चाहे उपयोगकर्ता यह समझें कि एआई क्या कर रहा है, यह पहचानें कि यह गलत है और जब यह है तो इसके लिए अर्थपूर्ण उपाय है।
हमें स्वीकार करना चाहिए कि जबकि एआई हमारे ग्राहकों के लिए अविश्वसनीय अनुभव बना सकता है, यह अपना न्यायाधीश और जूरी नहीं हो सकता है। एआई गुणवत्ता की जिम्मेदारी एक संगठनात्मक एक है, जो टीमों में वितरित की जाती है, मानव विशेषज्ञता में निहित है, और वास्तविक दुनिया के परीक्षण में आधारित है।












