विचार नेता

आपके आरएजी पाइपलाइन के हॉलुसिनेशन का वास्तविक कारण

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

आप जानते हैं कि यह कैसे होता है। पाइपलाइन ने एक ग्राहक के सामने हॉलुसिनेट किया, इसलिए आपने एम्बेडिंग मॉडल को बदल दिया। फिर आपने एलएलएम को अपग्रेड किया। फिर आपने एक सिस्टम प्रॉम्प्ट जोड़ा जो बढ़ते डेस्परेट कैपिटल अक्षरों में कहता है, केवल प्रदान किए गए संदर्भ का उपयोग करें। और इस सुबह यह एक ऐसे नीति दस्तावेज का हवाला दिया जो मौजूद नहीं है।

आप अच्छी कंपनी में हैं। जब स्टैनफोर्ड के RegLab और HAI शोधकर्ताओं ने LexisNexis और Thomson Reuters (TRI ) द्वारा बेचे जाने वाले AI कानूनी अनुसंधान उपकरणों का ऑडिट किया, जो “हॉलुसिनेशन-मुक्त” के रूप में विपणन किए जाते हैं क्योंकि उनमें रिट्रीवल-ऑगमेंटेड जेनरेशन है, तो उन्होंने हॉलुसिनेशन दर 17% और 34% के बीच पाई पूर्व-पंजीकृत कानूनी प्रश्नों पर। आरएजी वास्तव में मदद की: कच्चा जीपीटी-4 बहुत अधिक हॉलुसिनेट हुआ। लेकिन “कम” और “समाप्त” के बीच का अंतर उत्पादन प्रणालियों में रहता है, और उस अंतर में एक संरचना है।

आरएजी पाइपलाइन में हॉलुसिनेशन अक्सर एक विफलता नहीं है। यह तीन, साजिश रच रहे हैं: रिट्रीवल शांति से विफल रहता है, मॉडल को किसी भी तरह से उत्तर देने के लिए प्रशिक्षित किया जाता है, और पाइपलाइन में कुछ भी उस अंतर को माप नहीं करता है। मॉडल को बदलना उनमें से किसी को भी संबोधित नहीं करता है।

साजिशकर्ता एक: रिट्रीवल अधिक बार विफल होता है जितना आप सोचते हैं

यहाँ सबसे ताज़ा सबूत भी सबसे असहज है। नवंबर 2025 में, 18 चिकित्सा विशेषज्ञों की एक टीम ने 80,502 एनोटेशन्स के साथ 800 आरएजी आउटपुट्स पर वास्तविक रोगी और यूएसएमएलई-शैली के प्रश्नों पर उत्पादित किया। मानक आरएजी ने न केवल कम डिलीवर किया; इसने तथ्यात्मकता को 6% तक और पूर्णता को 5% तक कम कर दिया जो कि रिट्रीवल के बिना चलने वाले समान मॉडल की तुलना में था। जड़ कारण पूरी तरह से एलएलएम से पहले था: केवल 22% शीर्ष-16 रिट्रीव किए गए पासेज़ प्रश्न से संबंधित थे।

इसे एक कठिन डोमेन समस्या के रूप में खारिज करने से पहले, एंथ्रोपिक ने साफ-सुथरी और क्यूरेटेड निगमों पर रिट्रीवल विफलता को मापा जबकि अपनी संदर्भ रिट्रीवल तकनीक विकसित कर रहा था और पाया कि मानक एम्बेडिंग खोज शीर्ष 20 परिणामों में आवश्यक टुकड़े को सतह पर लाने में विफल रही 5.7% của समय। एक प्रश्न में से अठारह, साफ-सुथरे डेटा पर, कुछ भी असामान्य नहीं हो रहा था।

यही कारण है कि आरएजी विफलताओं की पारंपरिक इंजीनियरिंग टैक्सोनॉमी, बार्नेट एट अल। के सात विफलता बिंदु, इतना मायने रखता है: सात में से तीन (गुम सामग्री, मिस्ड टॉप-रैंक्ड दस्तावेज़, और संदर्भ समेकन विफलताएं) भाषा मॉडल एकल टोकन उत्पन्न करने से पहले होती हैं। Unite.AI ने एक विस्तृत वॉकथ्रू प्रकाशित किया है उस टैक्सोनॉमी और मैपिंग करने वाले मूल्यांकन ढांचे के बारे में, इसलिए मैं यहाँ इसे फिर से नहीं बनाऊंगा। इस लेख का बिंदु प्रोत्साहन के बारे में है: एम्बेडिंग समानता प्रासंगिकता के लिए एक प्रॉक्सी है, इसकी गारंटी नहीं है, और हाल के सैद्धांतिक कार्य से Google DeepMind से पता चलता है कि एकल-वेक्टर एम्बेडिंग में जो संबंधित दस्तावेजों के संयोजन को प्रतिनिधित्व करने की सख्त गणितीय सीमाएं हैं।

साजिशकर्ता दो: मॉडल को अनुमान लगाने के लिए प्रशिक्षित किया गया था

अब उस दोषपूर्ण संदर्भ को एक भाषा मॉडल को सौंप दें, और देखें कि मॉडल को अंतराल के साथ क्या करने के लिए प्रशिक्षित किया गया है।

ओपनएआई ने सीधे अपने सितंबर 2025 के पेपर भाषा मॉडल हॉलुसिनेट क्यों में इसका उत्तर दिया: मानक प्रशिक्षण और मूल्यांकन अनुमान लगाने की तुलना में अनिश्चितता को स्वीकार करने का इनाम देता है। बेंचमार्क द्विआधारी सटीकता स्कोर, संयम स्कोर शून्य, और इसलिए, एक बहुविकल्पी परीक्षा का सामना करने वाले छात्रों की तरह, मॉडल सीखते हैं कि एक आत्मविश्वासी अनुमान एक खाली की तुलना में बेहतर है। पेपर की अपनी तुलना इसे ठोस बनाती है: सिंपलक्यूए पर, एक तर्क मॉडल ने 1% समय अस्वीकार कर दिया और 75% समय गलत था, जबकि एक अलग रूप से ट्यून किए गए भाई ने 52% समय अस्वीकार कर दिया और अपनी त्रुटि दर 26% तक कम कर दी।

आरएजी विशिष्ट बेंचमार्क दिखाते हैं कि उस प्रोत्साहन क्या करता है पाइपलाइन के अंदर। आरजीबी बेंचमार्क ने परीक्षण किया कि मॉडल क्या अनप्रासंगिक दस्तावेजों के साथ हाथ में दिए जाने पर उत्तर देने से इनकार करते हैं। परीक्षण किए गए प्रत्येक मॉडल में नकारात्मक अस्वीकृति दर 45% थी, जिसका अर्थ है कि यहां तक कि सबसे अच्छा मॉडल, केवल कचरा संदर्भ दिया गया, उत्तर देने के लिए आधे से अधिक समय तक गया। क्लैशएवल ने दर्पण-छवि विफलता पाई: जब पुनर्प्राप्त सामग्री मॉडल के पास पहले से मौजूद सही ज्ञान का विरोध करती है, तो मॉडल 60% से अधिक समय तक गलत संदर्भ के पक्ष में अपने सही उत्तर को छोड़ देता है। वफादारी दोनों दिशाओं में विफल रहती है, और सेल्सफोर्स का फेथएवल असहज कोडा जोड़ता है कि बड़े मॉडल विश्वसनीय रूप से अधिक वफादार नहीं हैं।

एंथ्रोपिक की व्याख्यात्मक टीम ने thậmस तंत्र का पता लगाया है। उनके विश्लेषण में, अस्वीकृति मॉडल का डिफ़ॉल्ट सर्किट है; एक “ज्ञात इकाई” सुविधा अस्वीकृति को दबा देती है जब मॉडल कुछ को पहचानता है। हॉलुसिनेशन तब होता है जब सुविधा मिसफायर करती है, जब मॉडल आपके प्रश्न के आकार को पहचानता है, सामग्री की कमी होती है, और अंतराल में चिकनी तरह से बोलता है।

और यदि आप उम्मीद करते हैं कि फ्रंटियर बस इसे बढ़कर पार कर जाएगा: वेक्टारा का हॉलुसिनेशन लीडरबोर्ड कुछ मापता है जो आरएजी से बहुत आसान है, एक दस्तावेज़ का सारांश जो सीधे मॉडल के सामने रखा गया है, और मई 2026 के अपडेट के रूप में, जीपीटी-4ओ अभी भी 9.6% सारांशों में बनावट करता है और क्लॉड ओपस 4 में 12%। यहां तक कि रिट्रीवल को बिल्कुल सही तरीके से हल किया जाने पर भी, पीढ़ी रिसाव होती है।

स्वाभाविक समाधान इसे और खराब बना देता है

इसका सामना करते हुए, अधिकांश टीमें मात्रा के लिए पहुंचती हैं। अधिक टुकड़े पुनर्प्राप्त करें। बड़े संदर्भ विंडो खरीदें। सब कुछ जो मदद कर सकता है उसे भर दें और मॉडल को इसे सॉर्ट करने दें।

सबूत इसके विपरीत दिशा में चलता है। क्रोमा के संदर्भ रोट अध्ययन ने 18 मॉडलों का परीक्षण किया, जिसमें जीपीटी-4.1, क्लॉड 4, और जेमिनी 2.5 शामिल हैं, और पाया कि प्रदर्शन लंबाई बढ़ने के साथ “अधिक अनिश्चित” हो जाता है, एक विकर्षण दस्तावेज़ सटीकता को मापने योग्य रूप से काटता है और चार विकर्षण इसे महत्वपूर्ण रूप से काटते हैं। पहले लॉस्ट इन द मिडल रिसर्च ने अब प्रसिद्ध यू-कर्व पाया: मध्य-संदर्भ में दफन जानकारी को यहां तक कि लंबी संदर्भ मॉडल द्वारा भी अनदेखा किया जाता है। और ऊपर की चिकित्सा ऑडिट यही है जो उन गतिविधियों को अंत से अंत तक दिखता है, एक प्रणाली जो सोलह पासेजों को पुनर्प्राप्त करती है जिनमें से बारह से अधिक अप्रासंगिक हैं, फिर ढेर को एक मॉडल को सौंप देती है जिसे कभी “मुझे नहीं पता” कहने के लिए प्रशिक्षित नहीं किया जाता है।

अधिक रिट्रीवल के बिना अधिक सटीकता बस विकर्षण पैदा करती है। सटीकता रिट्रीवल से अधिक महत्वपूर्ण है, और यह करीब नहीं है।

साजिशकर्ता तीन: कोई भी अंतर को माप नहीं रहा है

बार्नेट एट अल। ने संचालन सत्य एक पंक्ति में रखा है: “एक आरएजी प्रणाली की पुष्टि केवल संचालन के दौरान ही संभव है।” आप एक आरएजी पाइपलाइन को स्टेजिंग में हस्ताक्षर नहीं कर सकते हैं, क्योंकि इसके विफलता मोड आपके निगम, आपके प्रश्नों और आपके उपयोगकर्ताओं की संयुक्त संपत्ति हैं, जिनमें से कोई भी स्थिर नहीं रहता है।

फिर भी, अधिकांश उत्पादन पाइपलाइनें सबसे अच्छा एंड-टू-एंड उत्तर गुणवत्ता को ट्रैक करती हैं, जो उपरोक्त दोनों साजिशकर्ताओं को एक ही अस्पष्ट संख्या में मिलाती है। मानक विभाजन, जिसे कभी-कभी आरएजी त्रिविम कहा जाता है, संदर्भ प्रासंगिकता (क्या रिट्रीवल ने सही सामग्री पाई?), आधारितता (क्या उत्तर उस सामग्री से चिपक जाता है?), और उत्तर प्रासंगिकता (क्या यह प्रश्न को संबोधित करता है?) को अलग करता है। फ्रेमवर्क जैसे आरएजीएएस और ट्रूलेंस इसे लागू करते हैं। मैं ईमानदारी से कहूंगा कि कोई कठोर सर्वेक्षण नहीं है जो यह मापता है कि कितने उत्पादन टीमें इन्हें चलाती हैं; जो मौजूद है वह व्यावहारिक रिकॉर्ड है, और यह मुख्य रूप से मूल्यांकन के बारे में बताता है जो भावनाओं से है। यदि आपकी टीम के पास रिट्रीवल विफलताओं को विश्वासघात विफलताओं से अलग करने वाला कोई डैशबोर्ड नहीं है, तो प्रत्येक हॉलुसिनेशन मॉडल समस्या की तरह दिखेगा, और आप मॉडल-आकार के समाधानों को खरीदना जारी रखेंगे।

क्या वास्तव में काम करता है, क्रम में

रिट्रीवल को पीढ़ी से अलग मापें। यह अनग्लामरस फिक्स हर कोई छोड़ देता है, और मेरे विचार में इस सूची में उच्चतम-लीवरेज आइटम है, क्योंकि यह एक मॉडल खरीदने के बारे में तर्क में परिवर्तित हो जाता है जो एक निदान में परिवर्तित हो जाता है। यदि संदर्भ प्रासंगिकता खराब है, तो कोई जनरेटर आपको नहीं बचा सकता है। यदि संदर्भ के साथ आधारितता खराब है, तो कोई रिट्रीवर आपकo नहीं बचा सकता है।

सटीकता स्टैक बनाएं। एंथ्रोपिक के प्रकाशित संख्या स्टैक्ड रिट्रीवल फिक्स का सबसे साफ प्रदर्शन है: संदर्भ चंक एम्बेडिंग ने शीर्ष-20 रिट्रीवल विफलता को 5.7% से 3.7% तक कम कर दिया, बीएम25 हाइब्रिड सर्च (क्लासिक कीवर्ड मिलान के साथ-साथ वेक्टर सर्च) जोड़ने से यह 2.9% हो गया, और एक रेरैंकर, एक दूसरे चरण का मॉडल जो उम्मीदवार टुकड़ों को वास्तविक प्रासंगिकता के लिए फिर से स्कोर करता है, 1.9% तक पहुंच गया, कुल 67% की कमी। Unite.AI ने दो-चरण रिट्रीवल के लिए रेरैंकर्स और क्यों विस्तार से कवर किया है।

अस्वीकृति को पुरस्कृत करें। ओपनएआई का नुस्खा है आत्मविश्वासी त्रुटियों को अधिक दंडित करना और अनिश्चितता को व्यक्त करने की तुलना में अधिक पुरस्कृत करना। आप स्थानीय संस्करण को आज ही लागू कर सकते हैं: “मुझे नहीं पता” प्रतिक्रियाओं के लिए प्रॉम्प्ट और मूल्यांकन करें, और एक आधार जांच जोड़ें, एक निहितार्थ मॉडल (एनएलआई) जो प्रत्येक उत्पन्न दावे की पुष्टि करता है कि पुनर्प्राप्त पाठ द्वारा समर्थित है इससे पहले कि उत्तर जहाज। आरएजीट्रुथ कार्य ने दिखाया कि एक छोटा सा फाइन-ट्यून डिटेक्टर जीपीटी-4-आधारित प्रॉम्प्टिंग के साथ असमर्थित दावों को पकड़ने में मेल खा सकता है।

प्रश्नों को फिर से लिखें और साक्ष्य को फिल्टर करें। चिकित्सा ऑडिट में, प्रश्न पुनर्गठन प्लस साक्ष्य फिल्टरिंग ने 12 अंकों की तथ्यात्मकता को पुनर्प्राप्त किया। सस्ता, उबाऊ, प्रभावी।

अंत में एजेंटिक रिट्रीवल पर विचार करें। जो क्या लाने के बारे में कारण के साथ बहु-चरण रिट्रीवल (प्राइमर यहाँ) वास्तव में कठिन बहु-कूद प्रश्नों में मदद करता है, लेकिन यह देरी, लागत, और नए विफलता मोड जोड़ता है। यह एक कैपस्टोन है, नींव नहीं।

मॉडल सबसे कम टूटा हुआ हिस्सा था

खुलने वाली रस्म पर वापस देखें। इसके हर चरण ने हॉलुसिनेशन को एक जनरेटर दोष के रूप में माना, एम्बेडिंग स्वैप, मॉडल अपग्रेड, प्रणाली प्रॉम्प्ट जो बढ़ते डेस्परेट कैपिटल अक्षरों में कहता है। साक्ष्य कहता है कि जनरेटर अपने प्रशिक्षण के पुरस्कारों के साथ क्या कर रहा था, जो रिट्रीवर द्वारा दिए गए सामग्री के साथ, किसी भी मीट्रिक द्वारा देखे बिना जो बता सकता था कि उनमें से कौन विफल हो रहा था।

आपका आरएजी पाइपलाइन टूटा हुआ नहीं है। यह आज्ञाकारी है। यह ठीक वही करता है जो इसके प्रोत्साहन को पुरस्कृत करता है, और जब तक आप रिट्रीवल और पीढ़ी को अलग-अलग मापते हैं और “मुझे नहीं पता” को एक स्कोरिंग श्रेणी के बजाय एक विफलता के रूप में बनाते हैं, तो वे प्रोत्साहन कहते हैं: अनुमान लगाएं।

गैरी एक विशेषज्ञ लेखक हैं जिनके पास सॉफ्टवेयर विकास, वेब विकास और सामग्री रणनीति में 10 वर्षों से अधिक का अनुभव है। वह उच्च गुणवत्ता वाली, आकर्षक सामग्री बनाने में माहिर हैं जो रूपांतरण को बढ़ावा देती है और ब्रांड वफादारी का निर्माण करती है। उन्हें दर्शकों को आकर्षित और सूचित करने वाली कहानियों को बनाने का जुनून है, और वह हमेशा उपयोगकर्ताओं को शामिल करने के नए तरीकों की तलाश में रहते हैं।