قادة الفكر

السبب الحقيقي لاستمرار خط أنابيب RAG في الخيال

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تعرف على الطقوس. خط أنابيب الخيال ظهر أمام العميل ، لذا قمت بتبديل نموذج التضمين. ثم قمت بترقية LLM. ثم أضفت ترويسة نظام تقول ، في حروف كبيرة متزايدة ، استخدم فقط السياق المحدد. وفي صباح اليوم التالي ، أشار بثقة إلى وثيقة سياسية غير موجودة.

أنت في شركة جيدة. عندما قام باحثو RegLab و HAI في ستانفورد بفحص أدوات البحث القانوني التي طورها LexisNexis و Thomson Reuters (TRI ) ، والتي تم تسويقها على أنها “خالية من الخيال” بفضل التوليد المعزز بالاسترجاع ، وجدوا معدلات خيال بين 17٪ و 34٪ في استعلامات قانونية مسبقة التسجيل. ساعد RAG حقًا: GPT-4 الخام يخيل أكثر. لكن الفجوة بين “مخفض” و “مُحذف” هي حيث تعيش الأنظمة الإنتاجية ، وهذه الفجوة لها هيكل.

الخيال في خط أنابيب RAG نادرًا ما يكون فشلًا واحدًا. إنه ثلاثة ، يتآمر: الاسترجاع يفشل بهدوء ، والنموذج تم تدريبه على الإجابة على أي حال ، ولا شيء في خط الأنابيب يقيس الفضاء بين هذه الحقائق. لا يعالج تبديل النماذج أيًا منهم.

المتآمر الأول: الاسترجاع يفشل أكثر مما تعتقد

الأدلة الأكثر حداثة هنا也是 الأكثر انزعاجًا. في نوفمبر 2025 ، أنتج فريق يضم 18 خبيرًا طبيًا 80,502 تعليقًا عبر 800 مخرجات RAG على استعلامات حقيقية و USMLE-STYLE. RAG القياسي لم يكن فقط يقلل عن التوصية ؛ بل خفض من صحة الحقائق بنسبة تصل إلى 6٪ واكتمالًا بنسبة 5٪ مقارنة بنفس النماذج التي تعمل بدون استرجاع. كان السبب الجذري يقع في مجرى النموذج بالكامل: فقط 22٪ من المقاطع المسترجعة في المرتبة العشرين كانت ذات صلة بالاستعلام.

قبل أن ترفض ذلك باعتباره مشكلة مجال صعب ، قاس Anthropic فشل الاسترجاع على مجموعات بيانات نظيفة ومنظمة أثناء تطوير تقنية الاسترجاع السياقي ووجد بحث الاسترجاع القياسي فاشل في تقديم الشريحة المطلوبة في نتائج المرتبة العشرين 5.7٪ من الوقت. استعلام واحد من بين ثمانية عشر ، على بيانات منضبطة ، دون أي شيء غير عادي يحدث.

هذا هو السبب في أن التصنيف الهندسي الكلاسيكي لفشل RAG ، سبع نقاط فشل من Barnett et al. ، يهم كثيرًا: ثلاثة من السبع (محتوى مفقود ، وثائق المرتبة العليا المفقودة ، وفشل توحيد السياق) تحدث قبل أن يولد النموذج اللغة رمزًا واحدًا. نشر Unite.AI مراجعة شاملة للتصنيف والاطار التقييمي الذي يطابقها ، لذلك لن أعمله هنا. النقطة التي تضيفها هذه المقالة هي حول الحوافز: تشبه تشابه التضمين وكفاية السياق ، وليس ضمانًا لها ، والعمل النظري الحديث من Google DeepMind يشير إلى أن التضمينات المتجهة المفردة لها حدود رياضية صعبة على المجموعات من الوثائق ذات الصلة التي يمكنها تمثيلها على الإطلاق. المسترد الذي يعود بمقتطفات معقولة ولكن خاطئة يفعل بالضبط ما يفعله تشابه الكوزين.

المتآمر الثاني: تم تدريب النموذج على الخوض في الأمر

الآن قم بتمرير السياق المعيب إلى نموذج اللغة ، وسؤال ما علمه تدريب النموذج القيام به مع الفجوات.

أجاب OpenAI بشكل مباشر في ورقته الصادرة في سبتمبر 2025 لماذا يخيل نماذج اللغة: يُكافئ التدريب والتقويم القياسي الخوض في الأمر أكثر من الاعتراف بالشك. تقييمات الثنائية تُحسب بدقة ، والامتناع يُحسب صفرًا ، وبالتالي ، مثل الطلاب الذين يواجهون اختبارًا متعدد الخيارات ، يتعلم النماذج أن الخوض في الأمر بثقة يغلب على الفراغ. يجعل ورقة المقارنة الموجودة في الورقة الملموسة: على SimpleQA ، امتنع نموذج العقل 1٪ من الوقت وكان مخطئًا 75٪ من الوقت ، بينما امتنع نموذج شقيق مختلف الحدة 52٪ من الوقت وقطع معدل الخطأ إلى 26٪.

تُظهر مقاييس RAG ما تفعله تلك الحوافز داخل خط أنابيب. اختبر مقاييس RGB ما إذا كان النماذج ترفض الإجابة عند تقديمها وثائق غير ذات صلة فقط. كان معدل الرفض السلبي الأفضل عبر جميع النماذج التي تم اختبارها 45٪ ، مما يعني أن حتى أفضل نموذج ، عند تقديم مواد خاطئة فقط ، أجاب على أي حال أكثر من نصف الوقت. وجد ClashEval فشل المرآة: عندما تعارض المحتوى المسترجع المعرفة التي كان النموذج على حق بها ، غادر النموذج إجابته الصحيحة لصالح السياق الخاطئ أكثر من 60٪ من الوقت. يفشل الإخلاص في كلا الاتجاهين ، ويضيف FaithEval من Salesforce النغمة المزعجة التي النماذج الأكبر لا ت忠ف دائمًا.

قامت فرقة تفسير Anthropic حتى بمتابعة الآلية. في تحليلهم ، الرفض هو الدائرة الافتراضية للنموذج؛ ميزة “كيان معروف” تقلل من الرفض عندما يعرف النموذج شيئًا. يحدث الخيال عندما تفشل الميزة ، عندما يعرف النموذج شكل سؤالك ، يفتقر إلى المادة ، ويخترع بثقة في الفجوة.

وإذا كنت تأمل أن تتجاوز الحدود ببساطة: قياس Vectara للقيادة في الخيال يقيس شيئًا أسهل بكثير من RAG ، ويحصل على ملخص للوثيقة الموضوعة مباشرة أمام النموذج ، واعتبارًا من تحديثه في مايو 2026 ، لا يزال GPT-4o يخترع في 9.6٪ من الملخصات و Claude Opus 4 في 12٪. حتى مع حل الاسترجاع بشكل مثالي ، يحدث تسرب في التوليد.

الإصلاح الغريزي يجعله أسوأ

عند مواجهة كل ذلك ، يلجأ معظم الفرق إلى الحجم. استرجع المزيد من المقتطفات. اشترِ نافذة السياق الأوسع. املأ كل ما قد يساعد واسمح للنموذج بترتيب الأمور.

تجري الأدلة في الاتجاه المعاكس. دراسة context rot لشركة Chroma اختبرت 18 نموذجًا ، بما في ذلك GPT-4.1 و Claude 4 و Gemini 2.5 ، ووجدت أداءً يزداد غير موثوق به مع نمو طول الإدخال ، مع وثيقة مسترجة واحدة تقطع الدقة بشكل قابل للقياس وأربعة مسترجات يقطعونها بشكل كبير. وجد البحث السابق Lost in the Middle المنحنى الشهير: المعلومات المدفونة في منتصف السياق تُ忽ى حتى من قبل نماذج السياق الطويل. وتجربة التدقيق الطبية المذكورة أعلاه هي ما يبدو عليه هذه الديناميات من البداية إلى النهاية ، نظام يسترجع ستة عشر مقطعًا من بينها اثنا عشر مقطعًا غير ذي صلة ، ثم يpassed إلى نموذج تم تدريبه أبدًا على قول “لا أعرف”.

لا يُعد الاسترجاع الأكثر دقة بدون دقة أكثر من مجرد تصنيع مسترجات. الدقة تهزم الاستدعاء في التوليد المبني على الحقائق ، وليس من المقبول.

المتآمر الثالث: لا أحد يقيس الفجوة

وضع Barnett et al. الحقيقة التشغيلية في سطر واحد: “التحقق من صحة نظام RAG ممكن فقط أثناء التشغيل”. لا يمكنك التوقيع على خط أنابيب RAG في مرحلة ما قبل الإنتاج ، لأن أوضاع الفشل هي ملكية مشتركة لملفك ، و استعلاماتك ، و مستخدميك ، لا شيء من هذه الأشياء يبقى على حاله.

ومع ذلك ، تتبع معظم خطوط الأنابيب الإنتاجية جودة الإجابة من النهاية إلى النهاية على الأكثر ، مما يخلط المتآمرين السابقين في رقم غير مبرر. التجزئة القياسية ، التي يطلق عليها أحيانًا RAG Triad ، يفصل بين صحة السياق (هل وجد الاسترجاع المواد الصحيحة؟) ، وارتباط السياق (هل تلتصق الإجابة بالمواد تلك؟) ، و صحة الإجابة (هل تتناول السؤال؟). تطبيق إطارات مثل RAGAS و TruLens تنفذ ذلك. سأكون صادقًا في أن هناك keine مسح دقيق يحدد كم عدد الفرق الإنتاجية التي تديرها؛ ما يوجد هو سجل الممارس ، ويصف بشكل رئيسي التقييم بالاتجاهات. إذا لم يكن لديك لوحة تحكم تفرق بين فشل الاسترجاع و فشل الإخلاص ، كل خيال سيظل يبدو وكأنه مشكلة نموذج ، وستستمر في شراء إصلاحات على شكل نموذج.

ما الذي يعمل حقًا ، بالترتيب

قس الاسترجاع بشكل منفصل عن التوليد. الإصلاح غير المثير الذي يغفله الجميع ، وفي نظري الحد الأعلى للإرجاع على هذه القائمة ، لأنه يتحول من حجة حول نموذج nào لشراء إلى تشخيص. إذا كانت صحة السياق سيئة ، لا يمكن لأي مولد إنقاذك. إذا كانت الإخلاص سيئة مع سياق جيد ، لا يمكن لأي مسترد إنقاذك.

ابني كومة الدقة. أرقام Anthropic المنشورة هي أبرز демонстрация لتصحيحات الاسترجاع المتراكمة في أي مكان: قطع التضمين المتوازي للشريحة خفض فشل الاسترجاع في المرتبة العشرين من 5.7٪ إلى 3.7٪ ، وأضاف BM25 بحث الكلمات الرئيسية الكلاسيكي إلى lado vector search brought it to 2.9٪ ، وأضاف reranker ، نموذج المرحلة الثانية الذي ي重新 يقيّم المقتطفات المرشحة للصلة الفعلية ، وصل إلى 1.9٪ ، وهو انخفاض إجمالي بنسبة 67٪. غطى Unite.AI لماذا يفوق rerankers و استرجاع المرحلتين وزنهم بالتفاصيل.

كافئ الامتناع. وصف OpenAI الوصفة على أنها معاقبة على الأخطاء الثقة أكثر من الشك المعلن ، ويمكنك تنفيذ الإصدار المحلي اليوم: قم بتمييز و تقييم استجابات “لا أعرف” ، وأضف فحص التأصيل ، نموذج الاشتقاق (NLI) الذي يتحقق من كل ادعاء مولد قبل إرسال الإجابة. أظهر عمل RAGTruth أن كاشفًا صغيرًا يمكن أن يطابق GPT-4-based prompting فيما يخص الادعاءات غير المدعومة.

اكتب استعلامات جديدة وافilter الأدلة. في التدقيق الطبي ، استعادة الاستعلامات وتصفية الأدلة استعادتا حتى 12 نقطة من صحة الحقائق. رخيص ، ممل ، فعال.

افكر في استرجاع وكيل آخر. الاسترجاع المتعدد الخطوات الذي يفكر في ما سيتم استرجاعه (مرجع هنا) يساعد حقًا في استعلامات متعددة القفزات الصعبة ، ولكنه يضيف تأخيرًا وتكلفة ووضعات فشل جديدة. إنه تاج ، وليس أساس.

كان النموذج هو الجزء الأقل كسرًا

انظر إلى الطقوس من البداية. كل خطوة منها ، تبديل التضمين ، ترقية النموذج ، ترويسة النظام الصارخة ، عالجت الخيال على أنه عيب في المولد. يقول الدليل إن المولد كان يفعل ما يُكافأ عليه من تدريبه ، مع المواد التي قدمها مستردك ، غير مرئي لأي مقياس يمكن أن يقول أي منهما فشل.

خط أنابيب RAG الخاص بك ليس مكسورًا. إنه مطيع. يفعل بالضبط ما تُكافئ عليه الحوافز ، وจน لا تُقاس الاسترجاع والتوليد بشكل منفصل وتجعل “لا أعرف” فئة تسجيل بدلاً من فشل ، تلك الحوافز تقول: اخترع.

غاري هو كاتب محترف مع أكثر من 10 سنوات من الخبرة في تطوير البرمجيات وتطوير الويب و استراتيجية المحتوى. وهو متخصص في إنشاء محتوى عالي الجودة ومثير للاهتمام يقود التحويلات و يبني ولاء العلامة التجارية. لديه شغف بصناعة القصص التي تلهم و تعلم الجماهير، و هو دائمًا يبحث عن طرق جديدة لجذب المستخدمين.