نماذج ومنصات الذكاء الاصطناعي
التغلب على هلوسات LLM باستخدام التوليد المعزز بالاسترجاع (RAG)
النماذج اللغوية الكبيرة (LLMs) تحول طريقة معالجة اللغة وتوليدها، ولكنها ليست كاملة. مثل الإنسان الذي قد يرى أشكالًا في السحاب أو وجوهًا على القمر، يمكن للنماذج اللغوية الكبيرة أيضًا “هلوسة”، مما يؤدي إلى إنشاء معلومات غير دقيقة. هذا الظاهرة، المعروفة باسم هلوسات LLM، تشكل قلقًا متزايدًا مع توسع استخدام النماذج اللغوية الكبيرة.
الأخطاء يمكن أن تسبب ارتباكًا للمستخدمين، وفي بعض الحالات، قد تؤدي حتى إلى مشاكل قانونية للشركات. على سبيل المثال، في عام 2023، قام جيفري باتل، وهو ветерان سلاح الجو، برفع دعوى قضائية ضد مايكروسوفت عندما وجد أن محرك البحث بинг الذي يعتمد على ChatGPT ي提供 أحيانًا معلومات غير دقيقة ومضرّة عن اسمه.
(MSFT )للمساعدة في حل هذه الحلوسات، ظهرت التوليد المعزز بالاسترجاع (RAG) كحل واعد. إنه يدمج المعرفة من قواعد بيانات خارجية لتعزيز دقة وموثوقية النماذج اللغوية الكبيرة. دعونا نلقي نظرة أقرب على كيفية عمل RAG لجعل النماذج اللغوية الكبيرة أكثر دقة وموثوقية.
فهم هلوسات LLM: الأسباب والأمثلة
النماذج اللغوية الكبيرة، بما في ذلك النماذج الشهيرة مثل ChatGPT وChatGLM وClaude، يتم تدريبها على مجموعات بيانات نصية واسعة، ولكنها ليست محصنة ضد إنتاج مخرجات غير دقيقة، وهو ما يسمى “هلوسة”. تحدث هلوسات بسبب أن النماذج اللغوية الكبيرة يتم تدريبها على إنشاء استجابات ذات معنى بناءً على القواعد اللغوية الأساسية، بغض النظر عن دقة الحقائق.
وجدت دراسة من tidio أن 72% من المستخدمين يعتقدون أن النماذج اللغوية الكبيرة موثوقة، بينما تلقى 75% منهم معلومات غير صحيحة من الذكاء الاصطناعي على الأقل مرة واحدة. حتى النماذج اللغوية الكبيرة الأكثر وعدًا مثل GPT-3.5 وGPT-4 يمكن أن تنتج أحيانًا محتوى غير دقيق أو غير منطقي.
هنا نظرة عامة سريعة على أنواع هلوسات LLM الشائعة:
أنواع هلوسات الذكاء الاصطناعي الشائعة:
- الخلط بين المصادر: يحدث هذا عندما يدمج النموذج تفاصيل من مصادر مختلفة، مما يؤدي إلى تناقضات أو حتى مصادر مخترعة.
- الأخطاء الواقعية: قد تنتج النماذج اللغوية الكبيرة محتوى به أساس واقعي غير دقيق، خاصة مع وجود أخطاء على الإنترنت.
- المعلومات غير المنطقية: تتنبأ النماذج اللغوية الكبيرة بالكلمة التالية بناءً على الاحتمالية. يمكن أن يؤدي هذا إلى نص صحيح گرامرًا ولكن غير منطقي، مما يضلل المستخدمين حول صحة المحتوى.
في العام الماضي، واجه محاميان عقوبات محتملة للاستشهاد بستة قضايا غير موجودة في وثائقهم القانونية، بعد أن أضلتهم معلومات غير دقيقة من ChatGPT. هذا المثال يبرز أهمية النظر إلى المحتوى الذي تنتجه النماذج اللغوية الكبيرة بعين نقدية، مما يؤكد الحاجة إلى التحقق من دقة المعلومات لضمان موثوقيتها. بينما تُظهر قدراتها الإبداعية فوائد في التطبيقات مثل سرد القصص، تطرح تحديات في المهام التي تتطلب الالتزام الصارم بالحقائق، مثل إجراء البحوث الأكاديمية، وكتابة تقارير تحليلية طبية ومالية، وتقديم المشورة القانونية.
استكشاف الحل لهلوسات LLM: كيف يعمل التوليد المعزز بالاسترجاع (RAG)
في عام 2020، قدم باحثو النماذج اللغوية الكبيرة تقنية تسمى التوليد المعزز بالاسترجاع (RAG) لتخفيف هلوسات LLM من خلال دمج مصدر بيانات خارجي. على عكس النماذج اللغوية الكبيرة التقليدية التي تعتمد فقط على المعرفة المسبقة التدريب، تنتج نماذج RAG استجابات دقيقة من حيث الحقائق عن طريق استرجاع المعلومات ذات الصلة من قاعدة بيانات خارجية قبل الإجابة على الأسئلة أو توليد النص.
تفصيل عملية RAG:

خطوات عملية RAG: المصدر
الخطوة 1: الاسترجاع
يبحث النظام في قاعدة معينة من المعرفة عن معلومات تتعلق بالاستفسار الذي قدمه المستخدم. على سبيل المثال، إذا سأل شخص ما عن الفائز بالكأس العالمية لكرة القدم الأخيرة، يبحث عن المعلومات الأكثر صلة حول كرة القدم.
الخطوة 2: التعزيز
يتم تعزيز الاستفسار الأصلي بمعلومات التي وجدها. باستخدام مثال كرة القدم، يتم تحديث الاستفسار “من هو الفائز بالكأس العالمية لكرة القدم؟” بمعلومات محددة مثل “فازت الأرجنتين بالكأس العالمية لكرة القدم”.
الخطوة 3: التوليد
باستخدام الاستفسار المعزز، تنتج النموذج اللغوي الكبير استجابة مفصلة ودقيقة. في حالتنا، سوف يصنع استجابة بناءً على المعلومات المعززة حول فوز الأرجنتين بالكأس العالمية.
تساعد هذه الطريقة في تقليل عدم الدقة وتضمن أن استجابات النموذج اللغوي الكبير أكثر موثوقية وأكثر ارتباطًا بالبيانات الدقيقة.
المنافع والعيوب من RAG في تقليل هلوسات LLM
أظهر RAG وعدًا في تقليل هلوسات LLM من خلال إصلاح عملية التوليد. يسمح هذا الآلية لنماذج RAG بتقديم معلومات أكثر دقة ومحدثة وملائمة للسياق.
من المؤكد أن مناقشة RAG بمعنى أوسع يسمح بفهم أعمق لمنافعها وقيودها عبر مختلف التطبيقات.
المنافع من RAG:
- بحث أفضل للمعلومات: يجد RAG بسرعة المعلومات الدقيقة من مصادر البيانات الكبيرة.
- تحسين المحتوى: يخلق محتوى واضحًا وملائمًا لاحتياجات المستخدم.
- استخدام مرن: يمكن للمستخدمين تعديل RAG ليناسبوا احتياجاتهم الخاصة، مثل استخدام مصادر البيانات الخاصة بهم، مما يزيد من الفعالية.
تحديات RAG:
- يتطلب بيانات محددة: يمكن أن يكون فهم سياق الاستفسار بدقة لتقديم معلومات دقيقة وملائمة صعبًا.
- التنقل: توسيع النموذج ليتعامل مع مجموعات بيانات كبيرة ومتعددة الاستفسارات مع الحفاظ على الأداء يعتبر تحديًا.
- التحديث المستمر: تحديث قاعدة المعرفة تلقائيًا بأحدث المعلومات يعتبر مشكلة مرهقة.
استكشاف البدائل ل RAG
بجانب RAG، هناك بعض الطرق الواعدة الأخرى التي تمكن باحثي النماذج اللغوية الكبيرة من تقليل هلوسات LLM:
- G-EVAL : يتحقق من دقة المحتوى الذي تم توليده مع مجموعة بيانات موثوقة، مما يعزز الموثوقية.
- SelfCheckGPT : يتحقق تلقائيًا من أخطائه ويتعامل معها لضمان دقة وموائمة الإخراج.
- هندسة الاستفسار: تساعد المستخدمين على تصميم استفسارات دقيقة لتوجيه النماذج نحو استجابات دقيقة وملائمة.
- التحسين الدقيق: يعدل النموذج ليتناسب مع مجموعات بيانات محددة للحصول على أداء أفضل في مجال معين.
- LoRA (التنقل بالتحويل منخفض الرتبة) : يعدل جزءًا صغيرًا من معاملات النموذج للتكيف مع المهام المحددة، مما يعزز الكفاءة.
تسلط استكشاف RAG وبدائله الضوء على النهج الديناميكي والمتعدد الجوانب لتحسين دقة وموثوقية النماذج اللغوية الكبيرة. مع تقدمنا، فإن الابتكار المستمر في تقنيات مثل RAG ضروري لمواجهة التحديات الكامنة في هلوسات LLM.
للحصول على أحدث التطورات في الذكاء الاصطناعي وتعلم الآلة، بما في ذلك التحليلات العميقة والأخبار، زوروا unite.ai.












