زاوية Anderson

نحو LoRAs التي يمكنها النجاة من تحديثات إصدارات النموذج

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

منذ تغطيتي الأخيرة لنمو هواية Hunyuan Video LoRAs (ملفات صغيرة، مدربة على إضافة شخصيات مخصصة إلى نماذج أساسية متعددة مليارات المعاملات للصورة إلى الصورة والصورة إلى الفيديو)، увеличился عدد LoRAs ذات الصلة المتاحة في مجتمع Civit بنسبة 185٪.

على الرغم من عدم وجود طرق سهلة أو منخفضة الجهد لإنشاء Hunyuan Video LoRA، فإن فهرس المشاهير وال LoRAs المواضيعية في Civit ينمو يوميا. مصدر: https://civitai.com/

على الرغم من عدم وجود طرق سهلة أو منخفضة الجهد لإنشاء Hunyuan Video LoRA، فإن فهرس المشاهير وال LoRAs المواضيعية في Civit ينمو يوميا. مصدر: https://civitai.com/

نفس المجتمع الذي يتعلم بجدية كيفية إنتاج هذه “الملحقات الشخصية” ل Hunyuan Video (HV) هو أيضًا ينتظر بفارغ الصبر إصدار وظيفة الصورة إلى الفيديو (I2V) في Hunyuan Video.

فيما يتعلق بالتركيب البشري المفتوح المصدر، هذا الأمر كبير؛ يمكن أن يسمح للمستخدمين بتحويل الصور إلى فيديوهات بطريقة لا تؤدي إلى تدهور الهوية عند تحويل الصورة إلى فيديو – وهو ما يحدث حاليًا في جميع مولدات الصور إلى فيديو المتقدمة، بما في ذلك Kling و Kaiber و RunwayML.

انقر للتشغيل. مولد صورة إلى فيديو من نموذج Gen 3 Turbo من RunwayML.. مصدر: https://app.runwayml.com/

من خلال تطوير LoRA مخصص للشخصية المعنية، يمكن استخدام صورة حقيقية لها كنقطة بداية. هذا أفضل “بذرة” من إرسال رقم عشوائي إلى مساحة النموذج والاستقرار على السيناريو الدلالي الناتج. يمكن استخدام LoRA أو LoRAs متعددة للحفاظ على συνέ續ية الهوية والشعر والملابس وغيرها من الجوانب الحاسمة لل مولد.

يمكن أن تمثل توفر مثل هذه المجموعة واحدة من أكبر التغييرات في الذكاء الاصطناعي منذ إطلاق Stable Diffusion، مع تسليم قوة مولدية هائلة إلى هواة المصدر المفتوح، دون التنظيم (أو “المراقبة”، إذا كنت تفضل) المقدم من رقابَة المحتوى في أنظمة الفيديو الشائعة الحالية.

عندما أكتب، Hunyuan صورة إلى فيديو هي مهمة غير محققة في مستودع Hunyuan Video على GitHub، مع تقارير المجتمع الهواة (عن طريق الشهادة) تعليق على Discord من مطور Hunyuan، الذي يبدو أنه أشار إلى أن إصدار هذه الوظيفة قد تم تأجيله إلى وقت لاحق في Q1 بسبب نموذج كونه “غير خاضع للرقابة”.

قائمة إصدار الميزات الرسمية ل Hunyuan Video. مصدر: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

قائمة إصدار الميزات الرسمية ل Hunyuan Video. مصدر: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

دقيق أو غير دقيق، مطورو المستودع قد سلموا بشكل كبير على بقية قائمة Hunyuan، وبالتالي يبدو أن Hunyuan I2V سيصل في النهاية، سواء كان ذلك خاضعًا للرقابة أو غير خاضع أو بطريقة ما “قابل للفتح”.

لكن كما نرى في القائمة أعلاه، إصدار I2V هو نموذج منفصل تمامًا – مما يجعل من غير المحتمل أن أي من LoRAs الحالية المتزايدة في Civit واماكن أخرى سوف تعمل معه.

إرهاق التحديث

يختبر تقريبا لا أحد إرهاق التحديث مثل هواة LoRA أو التحسين الدقيق، لأن وتيرة التغيير السريعة والتنافسية في الذكاء الاصطناعي تشجع مصانع النماذج مثل Stability.ai و Tencent و Black Forest Labs على إنتاج نماذج أفضل وأكبر بحد أقصى تكرار فيزيائي.

منذ أن تكون هذه النماذج الجديدة والمحسنة على الأقل لها تحيزات ووزن مختلفين، وأكثر شيوعًا لها مقياس و/أو هيكل مختلف، هذا يعني أن مجتمع التحسين الدقيق يجب أن يحصل على مجموعات البيانات مرة أخرى وتكرار عملية التدريب الشاق للنموذج الجديد.

لهذا السبب، هناك العديد من أنواع LoRA المتاحة في Civit:

مسار التحديث، مصور في خيارات مرشح البحث في civit.ai

مسار التحديث، مصور في خيارات مرشح البحث في civit.ai

منذ أن لا تتوافق أي من هذه نماذج LoRA الخفيفة مع إصدارات النموذج الأعلى أو الأقل، ولأن العديد منها يعتمد على اندماج كبير وتنقيح شائع يلائم نموذجًا أقدم، فإن جزءًا كبيرًا من المجتمع يعتمد على إصدار “تراثي”، بنفس الطريقة التي استمرت فيها ولاء العملاء ل Windows XP لسنوات بعد انتهاء الدعم الرسمي.

التكيف مع التغيير

يأتي هذا الموضوع إلى الذهن بسبب ورقة جديدة من Qualcomm AI Research التي تدعي أنها طورت طريقة يمكن من خلالها “تحديث” LoRAs الحالية إلى إصدار نموذج جديد.

تحويل LoRAs عبر إصدارات النماذج. مصدر: https://arxiv.org/pdf/2501.16559

تحويل LoRAs عبر إصدارات النماذج. مصدر: https://arxiv.org/pdf/2501.16559

هذا لا يعني أن النهج الجديد، الذي يسمى LoRA-X، يمكن أن يترجم بحرية بين جميع النماذج من نفس النوع (أي نماذج الصورة إلى الصورة أو نماذج اللغة الكبيرة [LLMs])؛ ولكن المؤلفون قد أثبتوا تحويل LoRA فعال من Stable Diffusion v1.5 إلى SDXL، وتحويل LoRA لنموذج TinyLlama 3T النصي إلى TinyLlama 2.5T.

LoRA-X ينقل معاملات LoRA عبر نماذج قاعدة مختلفة عن طريق الحفاظ على المعدل في فضاء النموذج المصدر؛ ولكن فقط في أجزاء من النموذج التي تشبه إلى حد كافٍ عبر إصدارات النموذج.

على اليسار، مخطط لطريقة التي يقوم بها نموذج LoRA-X المصدر بتعديل المعدل، والذي يتم تعديله بعد ذلك لتناسب النموذج المستهدف باستخدام هيكله الداخلي. على اليمين، صور تم إنشاؤها بواسطة نماذج مستهدفة SD Eff-v1.0 و SSD-1B، بعد تطبيق المعدلات المنقولة من SD-v1.5 و SDXL دون تدريب إضافي.

على اليسار، مخطط لطريقة التي يقوم بها نموذج LoRA-X المصدر بتعديل المعدل، والذي يتم تعديله بعد ذلك لتناسب النموذج المستهدف. على اليمين، صور تم إنشاؤها بواسطة نماذج مستهدفة SD Eff-v1.0 و SSD-1B، بعد تطبيق المعدلات المنقولة من SD-v1.5 و SDXL دون تدريب إضافي.

في حين أن هذا يوفر حلًا عمليًا للسيناريوهات التي لا يُريدي فيها إعادة التدريب أو لا يمكن القيام به، فإن هذه الطريقة مقيدة بنماذج معمارية مشابهة، من بين قيود أخرى.

على الرغم من أن هذا هو غزو نادر في مجال غير مدروس جيدًا، لن ندرس هذه الورقة بعمق بسبب عيوب LoRA-X الكثيرة، كما هو موضح في تعليقات منتقديها ومستشارينها في Open Review.

مناهج PEFT الأخرى

فرصة جعل LoRAs أكثر قابلية للنقل عبر الإصدارات هي خيط صغير ومثير للاهتمام في الأدب، وال đóng góp الرئيسي الذي تقدمه LoRA-X لهذا السعي هو ادعائها بأنه لا يتطلب أي تدريب. هذا ليس صحيحًا بشكل صارم، إذا قرأت الورقة، ولكنها تتطلب أقل تدريب من جميع الطرق السابقة.

LoRA-X هو مدخل آخر في مجموعة مناهج PEFT (التحسين الدقيق الفعال للمعاملات)، التي تتعامل مع تحدي تعديل نماذج كبيرة مسبقة التدريب على مهام محددة دون إعادة التدريب الواسعة. هذا النهج المفاهيمي يهدف إلى تعديل عدد قليل من المعاملات مع الحفاظ على الأداء.

X-Adapter

إطار X-Adapter ينقل معاملات التحسين الدقيق عبر نماذج مع بعض التدريب الإضافي. يهدف النظام إلى تمكين الوحدات المسبقة التدريب (مثل ControlNet و LoRA) من نموذج انتشار أساسي (أي Stable Diffusion v1.5) للعمل مباشرة مع نموذج انتشار محسّن (مثل SDXL) دون إعادة التدريب – بشكل فعال يتصرف كـ “مُحسّن عالمي” للإضافات.

يحقق النظام ذلك من خلال تدريب شبكة إضافية تتحكم في النموذج المحسّن، باستخدام نسخة مجمدة من النموذج الأساسي للحفاظ على موصلات الإضافة:

مخطط ل X-Adapter. مصدر: https://arxiv.org/pdf/2312.02238

مخطط ل X-Adapter. مصدر: https://arxiv.org/pdf/2312.02238

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA هو طريقة تحسين دقيق محسّنة التي تحسّن LoRA باستخدام استراتيجية تفكيك الوزن التي تشبه إلى حد ما التحسين الدقيق الكامل:

DoRA لا تحاول فقط نسخ المعدل في بيئة مجمدة، كما تفعل LoRA-X، ولكنها تغير معاملات أساسية للوزن، مثل الحجم والاتجاه. مصدر: https://arxiv.org/pdf/2402.09353

DoRA لا تحاول فقط نسخ المعدل في بيئة مجمدة، كما تفعل LoRA-X، ولكنها تغير معاملات أساسية للوزن، مثل الحجم والاتجاه. مصدر: https://arxiv.org/pdf/2402.09353

DoRA يركز على تحسين عملية التحسين الدقيق نفسها، من خلال تفكيك وزن النموذج إلى حجم و اتجاه. بدلاً من ذلك، LoRA-X يركز على تمكين نقل المعاملات المحددة مسبقًا بين نماذج قاعدة مختلفة.

FouRA (Fourier Low Rank Adaptation)

نشر في يونيو 2024، طريقة FouRA تأتي، مثل LoRA-X، من Qualcomm AI Research، وتشارك بعض أدوات الاختبار والسمات.

أمثلة على انهيار التوزيع في LoRA، من ورقة FouRA 2024، باستخدام نموذج Realistic Vision 3.0 المدرب مع LoRA و FouRA لمعدلات “Blue Fire” و “Origami”، عبر أربعة بذور. تظهر صور LoRA انهيار التوزيع وانخفاض التنوع، في حين يولد FouRA مخرجات أكثر تنوعًا. مصدر: https://arxiv.org/pdf/2406.08798

FouRA يركز على تحسين التنوع والجودة للصور المولدة عن طريق تعديل LoRA في مجال التردد، باستخدام نهج تحويل Fourier.

SVDiff

SVDiff يهدف إلى تحسين كفاءة التحسين الدقيق لنماذج الانتشار، ويتعديل مباشرةً القيم داخل مصفوفات وزن النموذج، مع الحفاظ على المتجهات المنفردة غير متغيرة. SVDiff يستخدم SVD المنقوص، ويتعديل فقط أكبر القيم، لتعديل أوزان النموذج.

يستخدم هذا النهج تقنية تعزيز البيانات تسمى Cut-Mix-Unmix:

التوليد المتعدد للموضوعات يعمل ك نظام عزل المفاهيم في SVDiff. مصدر: https://arxiv.org/pdf/2303.11305

التوليد المتعدد للموضوعات يعمل ك نظام عزل المفاهيم في SVDiff. مصدر: https://arxiv.org/pdf/2303.11305

التوليد المتعدد للموضوعات يعمل ك نظام عزل المفاهيم في SVDiff.

الخلاصة

الأساليب المذكورة هنا ليست الوحيدة في PEFT. تشمل الأخرى QLoRA و QA-LoRA؛ Prefix Tuning؛ Prompt-Tuning؛ و adapter-tuning، من بين أخرى.

مطاردة “LoRA القابلة للتحديث” هي، ربما، مطاردة كيميائية؛ بالتأكيد، لا يوجد شيء على الفور الذي سيمنع مصممي LoRA من إخراج مجموعات البيانات القديمة مرة أخرى لأحدث وأفضل إصدار من الأوزان. إذا كان هناك نموذج أولي محتمل لتعديل الأوزان يمكنه النجاة من تغييرات الهيكل وزيادة المعاملات بين إصدارات النموذج، فإنه لم يظهر في الأدب بعد، وسيتعين استمرار استخلاصه من البيانات على أساس كل نموذج.

نُشر لأول مرة يوم الخميس، 30 يناير 2025

كاتب في مجال التعلم الآلي، متخصص في مجال 合成 الصور البشرية. السابق رئيس محتوى البحث في Metaphysic.ai، حتى حلولها في Brahma.ai التابعة لشركة DNEG.
المنصة الشخصية: martinanderson.ai
التواصل: [email protected]