نماذج ومنصات الذكاء الاصطناعي

InstantStyle: الحفاظ على الأسلوب في توليد الصور من النص

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

على مدار السنوات القليلة الماضية، أظهرت نماذج التوليد القائمة على التوليد تقدمًا ملحوظًا عبر مجموعة واسعة من مهام تعديل الصور وتخصيصها. ومع ذلك، على الرغم من إمكانياتها، تواجه نماذج التوليد القائمة على التوليد حاليًا تحديات معقدة في إنتاج صور متسقة بأسلوب معين، ويمكن أن يكون هناك ثلاثة أسباب وراء ذلك. أولًا، يظل مفهوم الأسلوب غير محدد وغير معين، ويتكون من مزيج من العناصر بما في ذلك Atmosphere و Structure و Design و Material و Color وغيرها الكثير. ثانيًا، فإن الأساليب القائمة على العكس معرضة لتدهور الأسلوب، مما يؤدي إلى فقدان تفاصيل دقيقة. أخيرًا، تتطلب الأساليب القائمة على المحولات تعديل الوزن بشكل متكرر لكل صورة مرجعية للحفاظ على توازن بين قابلية التحكم النصي وأسلوب الشدة.

علاوة على ذلك، يهدف معظم أساليب نقل الأسلوب أو توليد الصور إلى استخدام الصورة المرجعية وتطبيق أسلوبها المحدد من مجموعة معينة أو صورة مرجعية إلى صورة محتوى هدف. ومع ذلك، فإن عدد كبير من سمات الأسلوب يجعل المهمة صعبة للباحثين لجمع مجموعات بيانات مصنفة بشكل صحيح، وتمثيل الأسلوب بشكل صحيح، وتقييم نجاح النقل. في السابق، كانت النماذج والإطارات التي تتعامل مع عملية التوليد القائمة على التوليد تُعدّ مجموعة من الصور التي تشترك في أسلوب مشترك، عملية تستهلك وقتًا وتحد من القابلية للتعميم في المهام الواقعية لأنها صعبة الجمع بين مجموعة من الصور التي تشترك في نفس الأسلوب أو أسلوب متشابه.

في هذه المقالة، سنناقش InstantStyle، وهي إطار مصمم لتحديد التحديات التي تواجهها نماذج التوليد القائمة على التوليد الحالية لتوليد الصور وتخصيصها. سنناقش استراتيجتين رئيسيتين تم تنفيذهما بواسطة إطار InstantStyle:

  1. منهج بسيط وفعال لفصل الأسلوب والمحتوى من الصور المرجعية داخل الفضاء الميزة، على افتراض أن الميزات داخل نفس الفضاء الميزة يمكن إضافتها أو طرحها من بعضها البعض.
  2. منع تسرب الأسلوب عن طريق حقن ميزات الصورة المرجعية حصريًا في الكتلة المحددة بالأسلوب، وتجنب الحاجة إلى استخدام أوزان متعبة للتعديل الدقيق، والتي غالبًا ما تتميز بتصاميم أكثر تعقيدًا.

تهدف هذه المقالة إلى تغطية إطار InstantStyle بعمق، ونتناول آليته و منهجيته وعماريته معًا مع比較ها مع الإطارات الحالية. سنناقش أيضًا كيف يظهر إطار InstantStyle نتائجًا ملحوظة في نقل الأسلوب، ويوازن بين قابلية التحكم في العناصر النصية وشدّة الأسلوب. هيا نبدأ.

InstantStyle: الحفاظ على الأسلوب في توليد الصور من النص

لقد حققت نماذج توليد الصور القائمة على التوليد نجاحًا ملحوظًا في مجموعة واسعة من مهام التخصيص والتعديل، ولا سيما في توليد الصور المتسقة، والحفاظ على الصور، ونقل الأسلوب. ومع ذلك، على الرغم من النجاح الأخير والتحسين في الأداء، يظل نقل الأسلوب مهمة صعبة للباحثين بسبب طبيعة الأسلوب غير المحددة وغير المحددة، والتي غالبًا ما تشمل مجموعة من العناصر بما في ذلك Atmosphere و Structure و Design و Material و Color وغيرها الكثير. مع ذلك، يهدف نقل الصور المصنفة أو نقل الأسلوب إلى تطبيق أسلوب معين من صورة مرجعية معينة أو مجموعة من الصور المرجعية إلى صورة محتوى هدف. ومع ذلك، فإن عدد كبير من سمات الأسلوب يجعل المهمة صعبة للباحثين لجمع مجموعات بيانات مصنفة بشكل صحيح، وتمثيل الأسلوب بشكل صحيح، وتقييم نجاح النقل.

بسبب التحديات التي تواجهها النهج الحالي، أصبح الباحثون مهتمين بتطوير أساليب تعديل دقيق لنقل الأسلوب أو توليد الصور المصنفة، ويمكن تقسيم هذه الإطارات إلى فئتين:

  • النهج الخالي من المحولات: تستخدم الأساليب الخالية من المحولات قوة الانتباه الذاتي داخل عملية التوليد، وبتطبيق عملية انتباه مشتركة، يمكن لهذه النماذج استخراج الميزات الأساسية بما في ذلك المفاتيح والقيم من صورة أسلوب مرجعية مباشرة.
  • النهج القائم على المحولات: تتضمن الأساليب القائمة على المحولات نموذجًا خفيفًا مصممًا لاستخراج تمثيلات صورة مفصلة من الصور المرجعية. ثم تدمج هذه التمثيلات في عملية التوليد بمهارة باستخدام آليات الانتباه المتقاطع. الهدف الرئيسي من عملية التكامل هو توجيه عملية التوليد، وضمان أن الصورة الناتجة متوافقة مع الدقة الأسلوبية المرغوبة للصورة المرجعية.

ومع ذلك، على الرغم من الوعد، غالبًا ما تواجه الأساليب الخالية من التعديل بعض التحديات. أولًا، يتطلب النهج الخالي من المحولات تبادل المفاتيح والقيم داخل طبقات الانتباه الذاتي، ويتقدم المصفوفات الرئيسية والقيم المشتقة من الصور المرجعية. عند تطبيقها على الصور الطبيعية، يتطلب النهج الخالي من المحولات عكس الصورة إلى الضوضاء الخفية باستخدام تقنيات مثل DDIM أو Denoising Diffusion Implicit Models. ومع ذلك، قد يؤدي استخدام DDIM أو نهج عكسي آخر إلى فقدان تفاصيل دقيقة مثل اللون والنسيج، مما يقلل من معلومات الأسلوب في الصور المتولدة.

لتحديد هذه القيود، تم تقديم إطار InstantStyle، وهو آليّة جديدة خالية من التعديل تقوم على أساليب قائمة على المحولات الحالية، وقادرة على التكامل السلس مع أساليب أخرى لتحقيق فصل الأسلوب والمحتوى بشكل فعال. بالإضافة إلى ذلك، يقدم إطار InstantStyle طريقتين فعالتين لتحقيق فصل الأسلوب والمحتوى، مما يحقق نقل أسلوب أفضل دون الحاجة إلى تقديم أساليب إضافية لتحقيق الفصل أو بناء مجموعات بيانات متوافقة.

علاوة على ذلك، كانت الإطارات القائمة على المحولات تستخدم على نطاق واسع في الأساليب القائمة على CLIP كمنفذ لميزات الصورة، وقد استكشفت بعض الإطارات إمكانية تنفيذ فصل الميزات داخل الفضاء الميزة، وعند المقارنة مع عدم تحديد سمات الأسلوب، يسهل وصف المحتوى بالنص. منذ أن تشترك الصور والنصوص في نفس الفضاء الميزة في الأساليب القائمة على CLIP، يمكن أن تقلل عملية طرح بسيطة لميزات النص من تسرب المحتوى بشكل كبير.

لتلخيص، يستخدم إطار InstantStyle آليتين بسيطتين وفعالتين لتحقيق فصل الأسلوب والمحتوى من الصور المرجعية. إطار InstantStyle هو نهج مستقل عن النموذج وخالي من التعديل، ويظهر أداءً ملحوظًا في مهام نقل الأسلوب، وله إمكانية كبيرة للمهام الجانبية.

Instant-Style: المنهجية والهيكل

كما هو موضح في النهج السابق، هناك توازن في حقن شروط الأسلوب في نماذج التوليد الخالية من التعديل. إذا كان شدة شرط الصورة عالية جدًا، قد يؤدي ذلك إلى تسرب المحتوى، في حين أن انخفاض شدة شرط الصورة قد يؤدي إلى عدم وضوح الأسلوب. السبب الرئيسي وراء هذه الملاحظة هو أن الأسلوب والمحتوى متشابكان في الصورة، ونظرًا لعدم تحديد سمات الأسلوب، يصعب فصل الأسلوب والغرض.

من حيث المنهجية، بدلاً من استخدام استراتيجيات معقدة لفصل المحتوى والأسلوب من الصور، يأخذ إطار Instant-Style النهج البسيط لتحقيق أداء مشابه. عند المقارنة مع عدم تحديد سمات الأسلوب، يمكن تمثيل المحتوى بالنص الطبيعي، مما يسمح لإطار Instant-Style باستخدام محول النص من CLIP لاستخراج خصائص النص كتمثيلات سياق.

علاوة على ذلك، كل طبقة في الشبكة العميقة مسؤولة عن التقاط معلومات семантиكية مختلفة، والملاحظة الرئيسية من النماذج السابقة هي أن هناك طبقتين من الانتباه مسؤولتين عن التعامل مع الأسلوب. على وجه التحديد، هذه الطبقات هي blocks.0.attentions.1 و down blocks.2.attentions.1، وت负责 التقاط الأسلوب مثل اللون والمادة والمناخ والترتيب المكاني.

Instant-Style: التجارب والنتائج

تم تنفيذ إطار Instant-Style على إطار Stable Diffusion XL، ويتضمن استخدام محول IR-IR كمثال لتحقق منهجيته، ويتعطل جميع الكتل باستثناء كتل الأسلوب لميزات الصورة. كما يُدرب إطار Instant-Style على 4 ملايين من مجموعات بيانات كبيرة النطاق متوافقة مع الصور والنصوص من البداية، وبدلاً من تدريب جميع الكتل، يتم تحديث كتل الأسلوب فقط.

لتحديد قدرات التعميم والمتانة، أجريت العديد من تجارب نقل الأسلوب باستخدام أنماط مختلفة عبر محتويات مختلفة، ويمكن ملاحظة النتائج في الصور التالية. عند تقديم صورة مرجعية واحدة مع محفزات متغيرة، يقدم إطار Instant-Style جودة عالية وثابتة في توليد الصور.

علاوة على ذلك، نظرًا لأن النموذج يُحقن بمعلومات الصورة فقط في كتل الأسلوب، يمكنه التقليل من مشكلة تسرب المحتوى بشكل كبير، وبالتالي لا يحتاج إلى تعديل الوزن.

كما يعتمد إطار Instant-Style على هيكل ControlNet لتحقيق تنسيق الصور القائمة على الصور مع التحكم المكاني، وتمثيل النتائج في الصورة التالية.

عند المقارنة مع الأساليب الحالية الأخرى، بما في ذلك StyleAlign و B-LoRA و Swapping Self Attention و IP-Adapter، يظهر إطار Instant-Style أفضل التأثيرات البصرية.

أفكار ختامية

في هذه المقالة، ناقشنا Instant-Style، وهو إطار عام يستخدم استراتيجيتين بسيطتين وفعالتين لتحقيق فصل المحتوى والأسلوب من الصور المرجعية. تم تصميم إطار Instant-Style لتحديد التحديات التي تواجهها نماذج التوليد القائمة على التوليد الحالية لتوليد الصور وتخصيصها. يطبق إطار Instant-Style استراتيجيتين حاسمتين: نهج بسيط وفعال لفصل الأسلوب والمحتوى من الصور المرجعية داخل الفضاء الميزة، ونهج لمنع تسرب الأسلوب عن طريق حقن ميزات الصورة المرجعية حصريًا في الكتل المحددة بالأسلوب.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.