زاوية Anderson

مستقبل توليد الصور باستخدام تقنية RAG

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
ChatGPT-4o: ‘Decades ago photos were a photochemical process, and typically photographic prints were done in a darkroom, with the wet prints hung from a line like clothes. Show me that environment, with 10 photos drying on a line in darkroom, and a white-coated scientist picking one of them off the line. Bokeh focus, 1792x1024’

تنمو نماذج الانتشار التوليدية مثل Stable Diffusion و Flux و نماذج الفيديو مثل Hunyuan على المعرفة المكتسبة خلال جلسة تدريب واحدة مكلفة الموارد باستخدام مجموعة بيانات محددة. أي مفاهيم تم تقديمها بعد هذا التدريب – يشار إليها باسم حجر الزاوية للمعرفة – غائبة عن النموذج ما لم يتم إضافتها من خلال التحسين الدقيق أو تقنيات التكيف الخارجية مثل التكيف منخفض الرتبة (LoRA).

لذلك سيكون من المثالي إذا كان نظام توليد الصور أو الفيديو يمكنه الوصول إلى المصادر على الإنترنت وجلبها إلى عملية التوليد حسب الحاجة. على سبيل المثال، يمكن لنظام انتشار يعتمد على RAG أن ينتج صورًا تحتوي على المنتجات الجديدة التي لا يعرفها النموذج.

فيما يتعلق بنماذج اللغة، معظمنا على دراية بأنظمة مثل Perplexity و Notebook LM و ChatGPT-4o، والتي يمكنها دمج معلومات جديدة في نموذج RAG.

تجعل عمليات RAG استجابات ChatGPT 4o أكثر صلة.

تجعل عمليات RAG استجابات ChatGPT 4o أكثر صلة. مصدر: https://chatgpt.com/

然而، هذا ليس شائعًا عند توليد الصور، وسيعترف ChatGPT بقيوده في هذا الصدد:

لقد قام ChatGPT 4o بتخمين جيد لتصور إطلاق ساعة جديدة، بناءً على الخط العام والوصف الذي فسرته؛ لكنه لا يستطيع “امتصاص” وتكامل الصور الجديدة في توليد DALL-E.

دمج البيانات المستخرجة من الخارج في صورة توليدية يعتبر تحديًا لأن الصورة الواردة يجب أن يتم تحويلها أولاً إلى رموز وترميزات، والتي يتم بعد ذلك映وتها إلى أقرب معرفة مدربة للنموذج لموضوع معين.

في حين أن هذا العمل بشكل فعال لادوات ما بعد التدريب مثل ControlNet، فإن مثل هذه التعديلات تبقى في الغالب سطحية، حيث يتم تمرير الصورة المستخرجة من خلال трубة تحويل، ولكن بدون دمجها بشكل عميق في تمثيل النموذج الداخلي.

نتيجة لذلك، يفتقر النموذج إلى القدرة على توليد وجهات نظر جديدة بالطريقة التي يمكن أن تفعلها أنظمة التصور العصبية مثل NeRF، والتي تبني المشاهد بفهم حقيقي للمساحة والهيكل.

منطق ناضج

تطبق نفس القيود على استفسارات RAG في نماذج اللغة الكبيرة (LLM) مثل Perplexity. عندما يعالج نموذج من هذا النوع بيانات مستخرجة من الخارج، فإنه يعمل بشكل مشابه لشخص يستخدم معرفته المكتسبة على مدار حياته لاستنتاج الاحتمالات حول موضوع ما.

然而، كما لا يستطيع شخص دمج معلومات جديدة في الإطار المعرفي الذي تشكلت فيه انحيازاته وسوء فهمه – عندما كانت وجهة نظره الأساسية لا تزال في طور التكوين – لا يستطيع نموذج LLM دمج المعرفة الجديدة بشكل سلس في هيكله المسبق.

بدلاً من ذلك، يمكنه فقط “تأثير” أو موازنة البيانات الجديدة ضد معرفته الداخلية، باستخدام المبادئ المكتسبة لتحليل والتحقق بدلاً من التوليد على مستوى أساسي.

من المحتمل أن يكون هذا النقص في التكافؤ بين التوليد “الموضوع” و “الداخلي” أكثر وضوحًا في صورة توليدية مقارنة بتوليد اللغة:

المخاطر الخفية لتوليد الصور باستخدام RAG

حتى لو كان من الممكن دمج صور الإنترنت المستخرجة بسلاسة في توليدات جديدة بطريقة RAG، فإن قيودًا تتعلق بالسلامة ستقدم تحديًا إضافيًا.

تم تجميع العديد من مجموعات البيانات المستخدمة لتدريب نماذج التوليد لتقليل وجود المحتوى الصريح أو العنصري أو العنيف، من بين فئات حساسة أخرى. ومع ذلك، فإن هذا العملية غير مكتملة، ويمكن أن تظل الارتباطات المتبقية.

لتحقيق ذلك، تعتمد أنظمة مثل DALL·E و Adobe Firefly على آليات تصفية ثانوية لفرز كل من الإشارات الدخلة والخرج التوليدية لمحتوى محظور.

كما هو الحال مع أي نظام يعتمد على بيانات مستخرجة من الخارج، فإن فعالية مثل هذه الأنظمة تعتمد على جودة وملاءمة قاعدة البيانات الخارجية، مما يجعل من مهمة تحضير البيانات عاملاً مهمًا في تحقيق توليدات عالية الجودة؛ ويظل هذا النهج بعيدًا عن معادل توليد الصور الذي يعتمد على RAG النموذجي في LLM التجارية.

RAG لتوليد الصور

على الرغم من هذه التحديات والجوانب السياسية الشائكة، ظهرت العديد من المشاريع التي تحاول استخدام أساليب RAG لدمج بيانات جديدة في توليدات بصرية.

ReDi

مشروع ReDi لعام 2023 هو إطار عمل بدون تدريب يسرع من استدلال نموذج الانتشار عن طريق استخراج مسارات مشابهة من قاعدة معرفة مسبقة.

يمكن استعارة قيم من مجموعة بيانات لاستخدامها في توليد جديدة في ReDi.

يمكن استعارة قيم من مجموعة بيانات لاستخدامها في توليد جديدة في ReDi. مصدر: https://arxiv.org/pdf/2302.02285

في سياق نماذج الانتشار، تمثل المسار الطريق الخطوي الذي يتبعه النموذج لتوليد صورة من ضوضاء نقية. عادةً ما يحدث هذا بشكل تدريجي عبر العديد من الخطوات، مع كل خطوة تُحسن الصورة قليلاً.

يقلل ReDi من هذا عن طريق تخطي بعض هذه الخطوات. بدلاً من حساب كل خطوة، يستعيد مسارًا مشابهًا من قاعدة البيانات ويتقدم إلى نقطة لاحقة في العملية. هذا يقلل من عدد الحسابات المطلوبة، مما يجعل توليد الصور القائمة على الانتشار أسرع بكثير، مع الحفاظ على الجودة.

لا يعد ReDi نفسه دمجًا لصور محددة في طلب التوليد؛ ومع ذلك، فهو يتعلق بنوع مماثل من التوليد.

تم إطلاق ReDi في عام 2022، وهو العام الذي أثار فيه نماذج الانتشار الكمومية انتباه الجمهور، ويبدو أنه من بين أوائل المناهج القائمة على الانتشار التي تعتمد على منهجية RAG.

RDM

مهمة أخرى مبكرة لتوليد الصور المدعومة من RAG هي نماذج الانتشار المدعومة من الاسترجاع (RDM)، والتي تقدم نهجًا شبه معلم لتحليل الصور التوليدية. في حين أن النماذج التقليدية للانتشار تخزين جميع المعرفة البصرية المكتسبة داخل معاملات الشبكة العصبية، يعتمد RDM على قاعدة بيانات صور خارجية:

الجيران الأقرب المستعادون في سؤال تخيلي في RDM*.

الجيران الأقرب المستعادون في سؤال تخيلي في RDM*.

خلال التدريب، يستعيد النموذج الجيران الأقرب (الصور الشبيهة بصريًا أو семантиًا) من قاعدة البيانات الخارجية، لتوجيه عملية التوليد. هذا يسمح للنموذج بتكييف مخرجاته على مثيلات العالم الحقيقي.

يعتمد عملية الاسترجاع على تضمين CLIP، المصمم لفرض على الصور المستعادة تشابهاً معنوياً مع الاستعلام، وتوفير معلومات جديدة لتحسين التوليد.

يقلل نهج RDM من الاعتماد على المعاملات، مما يسهل نماذج أصغر تحقق نتائج تنافسية دون الحاجة إلى مجموعات بيانات تدريب واسعة.

دعم RDM التعديلات البعدية: يمكن للمحققين استبدال قاعدة البيانات في وقت الاستدلال، مما يسمح بالتكيف بدون إطلاق نار لأساليب جديدة أو مجالات أو مهام مختلفة.

ReMoDiffuse

يعد ReMoDiffuse نموذجًا لانتشار الحركة المدعوم من الاسترجاع المصمم لتوليد حركة إنسان ثلاثية الأبعاد. على عكس نماذج الحركة التقليدية التي تعتمد على تمثيلات مكتسبة فقط، يستعيد ReMoDiffuse عينات الحركة ذات الصلة من مجموعة بيانات كبيرة ويدمجها في عملية التخفيض.

مقارنة بين ReMoDiffuse المعدلة بواسطة RAG (الأيمن) والأساليب السابقة.

مقارنة بين ReMoDiffuse المعدلة بواسطة RAG (الأيمن) والأساليب السابقة. مصدر: https://arxiv.org/pdf/2304.01116

يسمح ذلك للنموذج بتوليد تسلسلات حركة مصممة لتكون أكثر طبيعية وتنوعًا، بالإضافة إلى أنها семантиًا مخلصة لتعليمات النص للمستخدم.

يستخدم ReMoDiffuse آلية استرجاع هجينة، التي تختار تسلسلات الحركة بناءً على التشابهات السемантиائية والحركية، بهدف ضمان أن تكون الحركات المستعادة لا فقط ذات صلة بموضوعيًا ولكن أيضًا فيزيائيًا ممكنة عند دمجها في التوليد الجديد.

RA-CM3

يسمح نموذج النمذجة اللغوية المتعددة الوسائط المدعومة من الاسترجاع (RA-CM3) من ستانفورد لعام 2023 للنظام بالوصول إلى المعلومات الحقيقية في وقت الاستدلال:

نموذج النمذجة اللغوية المتعددة الوسائط المدعوم من الاسترجاع (RA-CM3) من ستانفورد يستخدم صورًا مستخرجة من الإنترنت لتعزيز عملية التوليد، ولكنه يظل نموذجًا غير متاح للجمهور.

نموذج النمذجة اللغوية المتعددة الوسائط المدعوم من الاسترجاع (RA-CM3) من ستانفورد يستخدم صورًا مستخرجة من الإنترنت لتعزيز عملية التوليد، ولكنه يظل نموذجًا غير متاح للجمهور. مصدر: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

يدمج RA-CM3 النصوص والصور المستخرجة في خط أنابيب التوليد، مما يعزز كلاً من التوليد من النص إلى الصورة والتوليد من الصورة إلى النص. باستخدام CLIP للاسترجاع وTransformer كمولد، يشير النموذج إلى وثائق متعددة الوسائط ذات صلة قبل تكوين الإخراج.

يؤدي ذلك إلى تحسينات ملحوظة على DALL-E ونظم مماثلة، مع تحقيق انخفاض في مسافة Fréchet Inception بنسبة 12 نقطة، مع تقليل كبير في التكلفة الحسابية.

RealRAG

يعد إطلاق جديد من الصين، وهو الذي دفعنا إلى النظر في أنظمة التوليد التوليدية المدعومة من RAG، يسمى توليد الصور الواقعية المدعوم من الاسترجاع (RealRAG).

الصور الخارجية المستخرجة في RealRAG (المنطقة الوسطى السفلى).

الصور الخارجية المستخرجة في RealRAG (المنطقة الوسطى السفلى). مصدر: https://arxiv.o7rg/pdf/2502.00848

يستعيد RealRAG صورًا حقيقية للكائنات ذات الصلة من قاعدة بيانات من مجموعات بيانات عامة مثل ImageNet و Stanford Cars و Stanford Dogs و Oxford Flowers. ثم يدمج هذه الصور المستخرجة في عملية التوليد، مما يعالج فجوات المعرفة في النموذج.

مكون رئيسي في RealRAG هو التعلم التبايني بالتعاكس، الذي يتدرب على نموذج استرجاع لتحديد صور مرجعية مفيده، بدلاً من مجرد اختيار الصور المشابهة بصريًا فقط.

يقول المؤلفون:

‘فكرنا الرئيسي هو تدريب مستعيد يسترجع صورًا تبقى خارج مساحة التوليد للمولد، ولكنها قريبة من تمثيل الاستعلامات النصية.’

‘لهذا الغرض، نقوم أولاً بتوليد صور من الاستعلامات النصية المعطاة، ثم نستخدم الصور المولدة كاستعلامات لاستعادة الصور الأكثر صلة في قاعدة البيانات القائمة على الكائنات الحقيقية. يتم استخدام هذه الصور الأكثر صلة كسلبيات تعاكسية.’

يضمن هذا النهج أن تساهم الصور المستخرجة في معرفة مفقودة في عملية التوليد، بدلاً من تعزيز الانحيازات الحالية في النموذج.

الخلاصة

هذا هو نظرة عامة تمثيلية وليس شاملة لأنظمة التوليد المتعددة الوسائط التي تعتمد على الاسترجاع. بعض هذه الأنظمة تستخدم الاسترجاع فقط لتحسين فهم الرؤية أو تنقية مجموعة البيانات، من بين دوافع أخرى متنوعة، بدلاً من محاولة توليد صور.

من المرجح أن يركز الحماس حول تعزيز التوليد باستخدام RAG على الأنظمة التي يمكنها دمج صور مصدرة من الإنترنت مباشرة في عملية التوليد، والسماح للمستخدمين بالمشاركة في اختيار أو مصادر الصور.

然而، هذا يعتبر تحديًا كبيرًا لسببين على الأقل؛ أولاً، لأن فعالية مثل هذه الأنظمة تعتمد عادةً على علاقات متأصلة深ًا تشكلت خلال عملية تدريب مكلفة للموارد؛ وثانيًا، لأن القلق بشأن السلامة والقانون والقيود على حقوق النشر يجعل هذه الميزة غير مرجوة لخدمة ويب مدعومة بالواجهة البرمجية، وللنشر التجاري بشكل عام.

* مصدر: https://proceedings.neurips.cc/paper_files/paper/2022/file/62868cc2fc1eb5cdf321d05b4b88510c-Paper-Conference.pdf

نشر لأول مرة يوم الثلاثاء، 4 فبراير 2025

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]