نماذج ومنصات الذكاء الاصطناعي

غوص عميق في Retrieval-Augmented Generation في LLM

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تخيل أنك محلل، ولديك إمكانية الوصول إلى نموذج لغة كبير. أنت متحمس لفرصته التي تُحققها في عملك. ولكن بعد ذلك، تسأله عن أحدث أسعار الأسهم أو معدل التضخم الحالي، ويتعرض لصدمة عندما ي告诉ك:

“أنا آسف، لكنني لا أستطيع تقديم بيانات في الوقت الفعلي أو بعد تاريخ الانتهاء. بياناتي الأخيرة تصل فقط إلى يناير 2022.”

النموذج اللغوي الكبير، مع كل قوته اللغوية، يفتقر إلى القدرة على فهم “الآن“. وفي عالم سريع الخطى، “الآن” هو كل شيء.

أظهرت الأبحاث أن النماذج اللغوية الكبيرة المُتدربة مسبقًا (LLM) هي أيضًا مستودعات للمعرفة الحقيقية.

لقد تم تدريبها على كميات هائلة من البيانات بحيث امتصت الكثير من الحقائق والأرقام. عند ضبطها الدقيق، يمكنها تحقيق نتائج ممتازة في مجموعة متنوعة من مهام معالجة اللغة الطبيعية.

لكن هنا تكمن العقدة: قدرة هذه النماذج على الوصول إلى هذه المعرفة المخزنة وتعديلها ليست دائمًا مثالية. خاصة عند التعامل مع مهام تتطلب معرفة مكثفة، يمكن أن تتفوق هذه النماذج على هياكل أكثر تخصصًا. إنه مثل وجود مكتبة تحتوي على جميع الكتب في العالم، لكن بدون فهرس للعثور على ما تحتاجه.

حصل ChatGPT من OpenAI على ترقية التصفح

الإعلان الأخير من OpenAI حول khảية ChatGPT في التصفح يُعد خطوة كبيرة نحو Retrieval-Augmented Generation (RAG). مع khảية ChatGPT الآن في التصفح على الإنترنت للحصول على معلومات حالية وموثوقة، يُ鏡 بناءً على نهج RAG في سحب البيانات بشكل ديناميكي من مصادر خارجية لتقديم استجابات غنية.

https://twitter.com/OpenAI/status/1707077710047216095

يتوفر حاليًا لاستخدامات Plus و Enterprise، ويتوقع OpenAI إطلاق هذه الميزة لجميع المستخدمين قريبًا. يمكن للمستخدمين تفعيل هذه الميزة عن طريق اختيار “تصفح مع Bing” تحت خيار GPT-4.

ميزة التصفح الجديدة في ChatGPT

ميزة التصفح الجديدة في ChatGPT

 هندسة البرمجة هي فعالة ولكنها غير كافية

البرمجة تعمل كبوابة إلى معرفة LLM. توجيه النموذج، وتقديم اتجاه للاستجابة. ومع ذلك، فإن إنشاء برمجة فعالة ليست هي الحل الشامل للحصول على ما تريد من LLM. ومع ذلك، دعونا ننتقل إلى بعض الممارسات الجيدة التي يجب مراعاتها عند كتابة برمجة:

  1. الوضوح: برمجة محددة جيدًا تلغي الغموض. يجب أن تكون مباشرة، مما يضمن أن النموذج يفهم نية المستخدم. هذا الوضوح غالبًا ما يترجم إلى استجابات أكثر تماسكًا وملاءمة.
  2. السياق: خاصة عند مدخلات واسعة، يمكن أن يؤثر وضع التوجيه على الإخراج. على سبيل المثال، يمكن أن يؤدي نقل التوجيه إلى نهاية برمجة طويلة إلى تحسين النتائج.
  3. الدقة في التوجيه: قوة السؤال، التي يتم التعبير عنها غالبًا من خلال إطار “من، ما، حيث، متى، لماذا، كيف”، يمكن أن توجيه النموذج نحو استجابة أكثر تركيزًا. بالإضافة إلى ذلك، يمكن أن يؤدي تحديد تنسيق الإخراج المطلوب أو الحجم إلى تعزيز الإخراج النهائي للنموذج.
  4. تreatment عدم اليقين: من المهم توجيه النموذج حول كيفية الاستجابة عند عدم اليقين. على سبيل المثال، توجيه النموذج للرد ب “لا أعرف” عند عدم اليقين يمكن أن يمنعه من توليد استجابات غير دقيقة أو “متخيلة”.
  5. التفكير التتابعي:对于 تعليمات معقدة، يمكن أن يؤدي توجيه النموذج إلى التفكير بشكل منهجي أو كسر المهمة إلى مهام فرعية إلى استجابات أكثر شمولاً ودقة.

فيما يتعلق بأهمية البرمجة في توجيه ChatGPT، يمكن العثور على مقال شامل في مقال على Unite.ai.

تحديات في نماذج الذكاء الاصطناعي التوليدية

هندسة البرمجة تتضمن تعديل التوجيهات المقدمة إلى نموذجك لتحسين أدائه. إنه وسيلة فعالة من حيث التكلفة لتعزيز دقة تطبيقات الذكاء الاصطناعي التوليدية، مما يتطلب فقط تعديلات بسيطة في الكود. بينما يمكن لهندسة البرمجة تحسين الإخراج بشكل كبير، من المهم فهم القيود المتأصلة في نماذج اللغة الكبيرة (LLM). هناك تحديان رئيسيان هما الhallucinations و قاطع المعرفة.

  • الhallucinations: يشير إلى الحالات التي يرجع فيها النموذج استجابة خاطئة أو منحوتة بثقة.
الhallucinations في LLMs

Hallucinations في LLM

  • قاطع المعرفة: كل نموذج LLM له تاريخ انتهاء تدريبه، بعد ذلك يكون غير مدرك للأحداث أو التطورات. هذا يعني أن معرفة النموذج مجمدة في نقطة تاريخ تدريبه الأخير. على سبيل المثال، نموذج تم تدريبه حتى عام 2022 لن يكون على دراية بأحداث عام 2023.
قاطع المعرفة في LLMS

قاطع المعرفة في LLM

الاسترجاع المعزز بالتوليد (RAG) يقدم حلاً لهذه التحديات. إنه يسمح للنماذج بالوصول إلى معلومات خارجية، مما يخفف من مشاكل Hallucinations من خلال توفير الوصول إلى بيانات مملوكة أو محددة بال lĩnh vực.

كما يسمح للنموذج بتمديد البيانات من مصادر خارجية في الوقت الفعلي. يمكن أن تكون هذه هي قواعد البيانات أو حتى الإنترنت الشاسعة.

مقدمة في الاسترجاع المعزز بالتوليد

الاسترجاع المعزز بالتوليد (RAG) هو إطار عمل، وليس تكنولوجيا محددة، يُمكّن النماذج اللغوية الكبيرة من الوصول إلى بيانات لم يتم تدريبها عليها. هناك طرق متعددة لتنفيذ RAG، ويتوقف الخيار الأمثل على المهمة المحددة وطبيعة البيانات.

يعمل إطار RAG بطريقة منظمة:

مدخلات البرمجة

العمليات تبدأ مع مدخلات المستخدم أو برمجة. يمكن أن تكون هذه إشارة أو بيان يطلب معلومات محددة.

الاسترجاع من المصادر الخارجية

بدلاً من توليد استجابة مباشرة بناءً على تدريبه، يبحث النموذج، بمساعدة مكون المسترجع، من خلال مصادر بيانات خارجية. يمكن أن تتراوح هذه المصادر من قواعد المعرفة وقواعد البيانات إلى بيانات يمكن الوصول إليها عبر الإنترنت.

فهم الاسترجاع

في جوهره، يعكس الاسترجاع عملية بحث. إنه حول استخراج المعلومات الأكثر صلة استجابةً لمدخلات المستخدم. يمكن تقسيم هذه العملية إلى مرحلتين:

  1. فهرسة: يمكن القول إن الجزء الأكثر تحديًا في رحلة RAG بأكملها هو فهرسة قاعدة معارفك. يمكن تقسيم عملية الفهرسة إلى مرحلتين: التحميل والتقسيم. في أدوات مثل LangChain، يتم تسمية هذه العمليات “المحملات” و “المقسمات“. تتحمل المحملات مسؤولية استرجاع المحتوى من مصادر مختلفة، سواء كانت صفحات ويب أو ملفات PDF. بعد استرجاعها، تقوم المقسمات بتقسيم هذا المحتوى إلى قطع صغيرة الحجم، مما يُحسنه للاستخدام في التضمين والبحث.
  2. الاستعلام: هذا هو فعل استخراج شظايا المعرفة الأكثر صلة بناءً على مصطلح البحث.

في حين هناك العديد من الطرق للاسترجاع، من التطابق النصي البسيط إلى استخدام محركات البحث مثل جوجل، تعتمد أنظمة RAG الحديثة على البحث الدلالي. في قلب البحث الدلالي يوجد مفهوم التضمين.

التضمين هو مركزي لفهم كيفية عمل النماذج اللغوية الكبيرة (LLM) للغة. عندما يحاول البشر تفسير كيفية استخلاص المعنى من الكلمات، غالبًا ما يعود التفسير إلى الفهم المتأصل. في أعماق هياكلنا المعرفية، ندرك أن “طفل” و “صبي” هما مترادفان، أو أن “أحمر” و “أخضر” يُشيران إلى الألوان.

تعزيز البرمجة

تُجمع المعلومات المسترجعة بعد ذلك مع البرمجة الأصلية، مما يُنشئ برمجة معززة أو موسعة. توفر هذه البرمجة المعززة النموذج مع سياق إضافي، وهو özellikle قيم إذا كانت البيانات محددة بال lĩnh vực أو غير موجودة في مجموعة تدريب النموذج الأصلية.

توليد الإكمال

مع البرمجة المعززة في اليد، يُولد النموذج استجابة أو إكمال. هذه الاستجابة ليست فقط بناءً على تدريب النموذج، ولكنها أيضًا مستنيرة بالبيانات الحقيقية المسترجعة.

الاسترجاع المعزز بالتوليد

الاسترجاع المعزز بالتوليد

هيكل أول نموذج RAG LLM

الورقة البحثية التي نشرتها Meta في عام 2020 “الاسترجاع المعزز بالتوليد لمهام معالجة اللغة الطبيعية المكثفة”  يقدم نظرة متعمقة حول هذه التقنية. نموذج الاسترجاع المعزز بالتوليد يُضيف إلى عملية التوليد التقليدية آلية استرجاع أو بحث خارجية. هذا يسمح للنموذج بسحب المعلومات ذات الصلة من مجموعات بيانات واسعة، مما يعزز قدرته على توليد استجابات دقيقة سياقيًا.

  1. الذاكرة المعtparametric: هذا هو نموذج اللغة التقليدي، مثل نموذج seq2seq. لقد تم تدريبه على كميات هائلة من البيانات ويعرف الكثير.
  2. الذاكرة غير المعtparametric: فكر في هذا كمحرك بحث. إنه فهرس密 للفектора الكثيف، على سبيل المثال، ويكيبيديا، والذي يمكن الوصول إليه باستخدام مسترجع عصبي.

عندما يُجمع هذان معًا، يُخلق نموذج دقيق. نموذج RAG يسترجع أولاً المعلومات ذات الصلة من ذاكرته غير المعtparametric، ثم يستخدم معرفته المعtparametric لتوفير استجابة متسقة.

1. عملية ثنائية:

يعمل نموذج RAG LLM في عملية ثنائية:

  • الاسترجاع: يبحث النموذج أولاً عن وثائق أو مقاطع ذات صلة من مجموعة بيانات كبيرة. يتم هذا باستخدام آلية استرجاع كثيفة، التي تستخدم التضمين لتمثيل كل من الاستعلام والوثائق. ثم تُستخدم التضمين لحساب درجات التشابه، ويتحصل على الوثائق الأعلى تصنيفًا.
  • التوليد: مع الوثائق ذات الصلة في اليد، يتم قناة إلى مولد تسلسلي-لتسلسلي إلى جانب الاستعلام الأولي. ثم يُنشئ هذا المولد الإخراج النهائي، مستمدًا السياق من الاستعلام والوثائق المسترجعة.

2. الاسترجاع الكثيف:

النظم التقليدية للاسترجاع غالبًا ما تعتمد على تمثيلات رفيعة مثل TF-IDF. ومع ذلك، يُستخدم نموذج RAG LLM تمثيلات كثيفة، حيث يتم تمثيل كل من الاستعلام والوثائق في فضاءات متصلة. هذا يسمح بمقارنات أكثر دقة للتشابه، مما يُحسن العلاقات الدلالية أبعد من مجرد مطابقة الكلمات الرئيسية.

3. التوليد التسلسلي-التسلسلي:

تُعمل الوثائق المسترجعة كسياق موسع للمولد. هذا المولد، غالبًا ما يعتمد على هياكل مثل TRANSFORMERS، يُولد الإخراج النهائي، مما يضمن أنه متسق وملائم سياقيًا.

بحث المستندات

فهرسة المستندات والاسترجاع

من أجل استرجاع المعلومات بكفاءة، خاصة من المستندات الكبيرة، يتم تخزين البيانات في قاعدة بيانات متجهة. يتم فهرسة كل قطعة من البيانات أو المستند بناءً على متجه التضمين، الذي يُحسن جوهر المعنى. يضمن الفهرس الفعال استرجاع المعلومات ذات الصلة بسرعة بناءً على مدخلات المستخدم.

قواعد البيانات المتجهة

قاعدة البيانات المتجهة

مصدر: Redis

قواعد البيانات المتجهة، التي يُطلق عليها أحيانًا تخزين المتجهات، هي قواعد بيانات مخصصة لتخزين واسترجاع بيانات المتجهات. في مجال الذكاء الاصطناعي وعلوم الحاسوب، المتجهات هي في الأساس قوائم من الأرقام تمثل نقاط في فضاء متعدد الأبعاد. على عكس القواعد التقليدية، التي تتكيف بشكل أفضل مع البيانات الجدولية، تُبرز قواعد البيانات المتجهة في إدارة البيانات التي تناسب بشكل طبيعي تنسيق المتجه، مثل التضمين من نماذج الذكاء الاصطناعي.

تتضمن بعض قواعد البيانات المتجهة البارزة Annoy و Faiss من Meta و Milvus و Pinecone. هذه القواعد هي حيوية في تطبيقات الذكاء الاصطناعي، وتساعد في مهام تتراوح من أنظمة التوصية إلى عمليات البحث عن الصور. تقدم منصات مثل AWS أيضًا خدمات مخصصة لاحتياجات قواعد البيانات المتجهة، مثل Amazon (AMZN ) OpenSearch Service و Amazon RDS لبرنامج PostgreSQL. هذه الخدمات مُحسنة لمجموعة متنوعة من الحالات، مما يضمن الفهرسة والاستعلام الفعالين.

التقسيم من أجل الصلة

نظرًا لأن العديد من المستندات يمكن أن تكون واسعة، غالبًا ما تُستخدم تقنية تُسمى “التقسيم”. تتضمن هذه التقنية تقسيم المستندات الكبيرة إلى قطع صغيرة متسقة سياقيًا. ثم يتم فهرسة هذه القطع واسترجاعها حسب الحاجة، مما يضمن استخدام أجزاء المستند الأكثر صلة لتعزيز البرمجة.

اعتبارات نافذة السياق

يعمل كل نموذج LLM داخل نافذة سياق، التي هي أساسًا الحد الأقصى للمعلومات التي يمكنه مراعاتها في الوقت نفسه. إذا قدمت مصادر البيانات الخارجية معلومات تتجاوز هذه النافذة، فيجب تقسيمها إلى قطع صغيرة تتناسب مع نافذة السياق للنموذج.

فوائد استخدام الاسترجاع المعزز بالتوليد

  1. ال精度 المعززة: من خلال الاستفادة من مصادر البيانات الخارجية، يمكن لنموذج RAG LLM توليد استجابات لا تعتمد فقط على بيانات التدريب، بل أيضًا على المعلومات الأكثر صلة وديثة المتاحة في مجموعة الاسترجاع.
  2. تجاوز فجوات المعرفة: يعالج RAG بشكل فعال القيود المعرفية للنماذج LLM، سواء كانت ناتجة عن تاريخ انتهاء التدريب للنموذج أو عدم وجود بيانات محددة بال lĩnh vực في مجموعة التدريب.
  3. التنوع: يمكن دمج RAG مع مصادر بيانات خارجية متنوعة، من قواعد البيانات المملوكة داخل المنظمة إلى بيانات الإنترنت المتاحة للجمهور. هذا يجعله مرنًا لاستخدامات وصناعات واسعة.
  4. تقليل Hallucinations: واحدة من التحديات مع LLM هي إمكانية “الhallucinations” أو توليد معلومات غير دقيقة أو منحوتة. من خلال توفير سياق البيانات في الوقت الفعلي، يمكن لـ RAG تقليل فرص هذه الإخراجات بشكل كبير.
  5. ال قابلة للتوسيع: واحدة من الفوائد الرئيسية لنموذج RAG LLM هي قابليته للتوسيع. من خلال فصل عمليات الاسترجاع والتوليد، يمكن للنموذج التعامل بكفاءة مع مجموعات بيانات ضخمة، مما يجعله مناسبًا للتطبيقات في العالم الحقيقي حيث البيانات وفيرة.

التحديات والاعتبارات

  • العبء الحاسوبي: العملية الثنائية يمكن أن تكون حاسوبية مكثفة، خاصة عند التعامل مع مجموعات بيانات كبيرة.
  • اعتماد البيانات: جودة الوثائق المسترجعة تؤثر مباشرة على جودة التوليد. لذلك، من المهم وجود مجموعة استرجاع شاملة ومحسنة.

الخاتمة

من خلال دمج عمليات الاسترجاع والتوليد، يقدم الاسترجاع المعزز بالتوليد حلاً قويًا للمهام المكثفة في المعرفة، مما يضمن إخراجًا يُعتبر متعلمًا وملائمًا سياقيًا.

الوعد الحقيقي لـ RAG يكمن في تطبيقاته في العالم الحقيقي. في قطاعات مثل الرعاية الصحية، حيث يمكن أن تكون المعلومات الدقيقة والفورية حاسمة، يقدم RAG القدرة على استخراج وتوليد رؤى من الأدب الطبي بسهولة. في مجال المالية، حيث تتطور الأسواق دقيقةً بعد دقيقة، يمكن لـ RAG تقديم رؤى مدفوعة بالبيانات في الوقت الفعلي، مما يساعد في اتخاذ قرارات مدروسة. بالإضافة إلى ذلك، في الأكاديمية والبحث، يمكن للباحثين استخدام RAG لتمشيط مستودعات المعلومات الواسعة، مما يجعل مراجعة الأدب والتحليل البياني أكثر كفاءة.

لقد قمت بإنفاق الخمس سنوات الماضية في غمرة العالم المثير للاهتمام من التعلم الآلي والتعلم العميق. وقد أدت شغفي وخبرتي إلى المساهمة في أكثر من 50 مشروعًا متنوعًا في هندسة البرمجيات، مع التركيز بشكل خاص على الذكاء الاصطناعي والتعلم الآلي. كما أدت فضولي المستمر إلى جذبي نحو معالجة اللغة الطبيعية، وهو مجال أنا متحمس لاستكشافه بشكل أكبر.