زاوية Anderson

أبحاث جديدة تكتشف ستة عشر مشكلة رئيسية مع أنظمة RAG، بما في ذلك الحيرة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

وجدت دراسة حديثة في الولايات المتحدة أن الأداء في العالم الحقيقي لأنظمة التوليد المعزز بالاسترجاع (RAG) الشهيرة، مثل الحيرة و Bing Copilot، يقع بعيدًا عن الدعاية التسويقية والاستخدام الشعبي الذي حصل على عناوين رئيسية خلال الـ 12 شهرًا الماضية.

شارك في المشروع 21 خبيرًا في مجالات الذكاء الاصطناعي والرعاية الصحية والطب والعلوم التطبيقية والتعليم والعلوم الاجتماعية، جميعهم إما باحثون ما بعد الدكتوراه أو مرشحون للدكتوراه.

كما وجدت الدراسة أن أنظمة RAG تفتقر إلى التفاصيل الموضوعية في الإجابات التي تولدها، وتعزز التحيزات المتصورة للمستخدم، وتستخدم لغة متضخمة، وتفتقر إلى التفكير النقدي والإبداع، وتسرد مصادر غير دقيقة، وتختار المعلومات التي تخدم الاستعلام، وتغفل عن الإشارات التي تدعم البيانات.

كما وجدت الدراسة أن أنظمة RAG تفتقر إلى التفاعل أو الاستكشاف، وتحتاج إلى التحقق الخارجي، وتستخدم أساليب الاقتباس الأكاديمي، مثل [1] أو [34]، والتي قد تكون غير直ة للمستخدمين.

وأشار الباحثون إلى أن هذه النتائج تظهر أن هناك حاجة إلى تحسين كبير في أنظمة RAG، وأن المستخدمين يجب أن يكونوا حذرين عند استخدام هذه الأنظمة.

المبادلة RAG

أشار الباحثون إلى أن أنظمة RAG تفتقر إلى التفاصيل الموضوعية في الإجابات التي تولدها، وتعزز التحيزات المتصورة للمستخدم، وتستخدم لغة متضخمة، وتفتقر إلى التفكير النقدي والإبداع.

كما أشاروا إلى أن هذه الأنظمة تفتقر إلى التفاعل أو الاستكشاف، وتحتاج إلى التحقق الخارجي، وتستخدم أساليب الاقتباس الأكاديمي.

الدراسة

أجريت الدراسة على ثلاثة أنظمة RAG، وهي You Chat و Bing Copilot و Perplexity.

وأشار الباحثون إلى أن هذه الأنظمة تفتقر إلى التفاصيل الموضوعية في الإجابات التي تولدها، وتعزز التحيزات المتصورة للمستخدم، وتستخدم لغة متضخمة، وتفتقر إلى التفكير النقدي والإبداع.

نقص في التفاصيل الموضوعية

أشار الباحثون إلى أن أنظمة RAG تفتقر إلى التفاصيل الموضوعية في الإجابات التي تولدها.

وأشار أحد المشاركين إلى أن “الإجابة كانت مجرد محاولة لتقديم إجابة بدون تقديم إجابة صلبة أو تفصيلية، والتي أستطيع الحصول عليها من خلال عمليات بحث متعددة على جوجل”.

نقص في المنظور الشامل

أشار الباحثون إلى أن أنظمة RAG تفتقر إلى المنظور الشامل في الإجابات التي تولدها.

وأشار أحد المشاركين إلى أن “الإجابة لم تقدم وجهات نظر متعددة حول الموضوع، بل قدمت وجهة نظر واحدة فقط”.

لغة متضخمة

أشار الباحثون إلى أن أنظمة RAG تستخدم لغة متضخمة في الإجابات التي تولدها.

وأشار أحد المشاركين إلى أن “الإجابة كانت مكتوبة بثقة كبيرة، مما جعلني أشعر بالاقتناع بدون حتى النظر إلى المصدر”.

اقتباسات غير دقيقة

أشار الباحثون إلى أن أنظمة RAG تفتقر إلى الدقة في الاقتباسات التي تستخدمها.

وأشار أحد المشاركين إلى أن “البيان لم يكن موجودًا في المصدر، وبالتالي لا أعرف من哪里 حصلت على هذه المعلومات”.

اختيار المعلومات التي تخدم الاستعلام

أشار الباحثون إلى أن أنظمة RAG تختار المعلومات التي تخدم الاستعلام.

وأشار أحد المشاركين إلى أن “الإجابة كانت تخدم وجهة نظري، ولكنها لم تقدم وجهات نظر أخرى حول الموضوع”.

الراغب الآلي

أجريت الدراسة على ثلاثة أنظمة RAG، وهي You Chat و Bing Copilot و Perplexity.

وأشار الباحثون إلى أن هذه الأنظمة تفتقر إلى التفاصيل الموضوعية في الإجابات التي تولدها، وتعزز التحيزات المتصورة للمستخدم، وتستخدم لغة متضخمة، وتفتقر إلى التفكير النقدي والإبداع.

وأشاروا إلى أن هذه الأنظمة تفتقر إلى التفاعل أو الاستكشاف، وتحتاج إلى التحقق الخارجي، وتستخدم أساليب الاقتباس الأكاديمي.

وأشار الباحثون إلى أن هذه النتائج تظهر أن هناك حاجة إلى تحسين كبير في أنظمة RAG، وأن المستخدمين يجب أن يكونوا حذرين عند استخدام هذه الأنظمة.

* تحويلي للاقتباسات الداخلية للمؤلفين إلى روابط. حيث لزم الأمر، اخترت الاقتباس الأول من بين اقتباسات متعددة للرابط، بسبب ممارسات التنسيق.

† تأكيد المؤلفين، وليس لي.

نشر لأول مرة يوم الإثنين، 4 نوفمبر 2024

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai