زاوية Anderson

UniTune: تقنية تعديل الصور العصبية البديلة من جوجل

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

يبدو أن بحث جوجل يهاجم تحرير الصور القائم على النص من عدة جبهات، ويتوقع ما سيكون له من تأثير. بعد إطلاق ورقة Imagic هذا الأسبوع، اقترح عملاق البحث طريقة أخرى لتعديل الصور باستخدام النص، تسمى UniTune.

استنادًا إلى الأمثلة المذكورة في ورقة المشروع الجديدة، حقق UniTune درجة استثنائية منفصل بين الموقف والفكرة من المحتوى الصوري الفعلي:

السيطرة التي تمتلكها UniTune على التكوين الدلالي ممتازة. لاحظ كيف لم تتأثر وجوه الشخصين في الصف العلوي من الصور بالتحويل الاستثنائي على بقية الصورة الأصلية (اليمين). مصدر: https://arxiv.org/pdf/2210.09477.pdf

السيطرة التي تمتلكها UniTune على التكوين الدلالي ممتازة. لاحظ كيف لم تتأثر وجوه الشخصين في الصف العلوي من الصور بالتحويل الاستثنائي على بقية الصورة الأصلية (اليمين). Source: https://arxiv.org/pdf/2210.09477.pdf

كما تعلم مشجعو Stable Diffusion، يمكن أن يكون تطبيق التعديلات على أقسام محددة من الصورة دون التأثير السلبي على بقية الصورة عملية معقدة وأحيانًا مستحيلة.

الجواب الواضح، على الأقل لممارس الصور، هو وضع طبقة منفصل بين التجزئة الدلالية التي يمكنها التعرف على عزل الأشياء في الصورة دون تدخل المستخدم.

هناك إمكانية أخرى لتحديد العمليات الصورية العصبية المتضافرة هي استخدام وحدة CLIP من OpenAI كمرشح عند نقطة إرسال نموذج الصورة والنص إلى المستخدم.

اللغة المضغوطة

اقترح UniTune “ضبط دقيق” لنموذج انتشار موجود – في هذه الحالة، Imagen من جوجل – بحيث يتم حقن رمز فريد يمكن استدعاؤه عن طريق إدراجه في سطر الأوامر النصي.

في الواقع، يبدو هذا مثل DreamBooth، الذي يمكن حقن شخصيات أو أشياء جديدة في نقطة التحقق الحالية في أقل من ساعة، بناءً على عدد قليل من الصور المصدر.

然而، يصر الباحثون على أن UniTune رفض هذه المناهج.

العمليات

尽管 من الغامض لماذا تظهر ورقتان شبه متطابقتين من جوجل في نفس الأسبوع، هناك على الأقل فرق واضح بين UniTune و Imagic – يستخدم الأخير أوامر لغة طبيعية غير مضغوطة لتحديد عمليات تحرير الصور، بينما UniTune يتدرب على رموز فريدة بنمط DreamBooth.

لذلك، إذا كنت تحرر مع Imagic وتريد أن تؤثر على تحويل من هذا النوع…

من ورقة UniTune - UniTune يضع نفسه ضد إطار تحرير الصور العصبي المنافس المفضل لجوجل، SDEdit. النتائج التي تم الحصول عليها من UniTune على اليمين الأقصى، بينما تظهر Масك المقدرة في الصورة الثانية من اليسار.

من ورقة UniTune – UniTune يضع نفسه ضد إطار تحرير الصور العصبي المنافس المفضل لجوجل، SDEdit. النتائج التي تم الحصول عليها من UniTune على اليمين الأقصى، بينما تظهر Масك المقدرة في الصورة الثانية من اليسار.

.. في Imagic، ستدخل ‘الشخص الثالث، الجالس في الخلفية، كوحش مخملي لطيف’.

الأمر المكافئ في UniTune سيكون ‘الرجل في الخلف ك [x]’، حيث x هو الكلمة الغريبة والفريدة المرتبطة بمفهوم وحش مخملي.

ضبط دقيق

تتمثل طريقة UniTune في الأساس في إرسال الصورة الأصلية عبر نموذج انتشار مع مجموعة من الإرشادات حول كيفية تعديلها، باستخدام المستودعات الكبيرة من البيانات المتاحة المدربة على النموذج.

خلال عملية UniTune، يتم ضبط دقيق النموذج، مما يعني أن UniTune يُجبر النموذج على استئناف التدريب، معظم طبقاته غير مجمدة.

عينة

هناك العديد من طرق العينة التي يمكن استخدامها لاستخراج التغييرات التي تم إجراؤها من النموذج المضبوط دقيقًا، بما في ذلك توجيه الفئة الحر، وهو أيضًا أساس Stable Diffusion.

كما قام الباحثون بتجربة تقنية “البدء المتأخر” من SDEdit، حيث يتم تشجيع النظام على الحفاظ على التفاصيل الأصلية عن طريق أن يكون فقط جزئيًا “ضوضاء” من البداية.

يمكن أن يؤدي UniTune تعديلات محلية مع أو بدون أقنعة تعديل، ويمكنه أيضًا أن يقرر بشكل وحيد حيث يضع التعديلات، مع مزيج غير عادي من القوة التفسيرية وتمثيل البيانات الإدخالية الأصلية:

التأخير

على الرغم من أن الجيل الأول من أي نظام جديد سيكون بطيئًا، وربما يتم تسريعه وتحسينه في النهاية من خلال المشاركة المجتمعية أو الالتزام الشركي، كلا UniTune و Imagic يؤديان بعض المناورات التعلم الآلي الكبيرة لإنشاء هذه التعديلات الرائعة، ويتساءل إلى أي مدى يمكن للمسار الموارد الكثيفة أن يُ缩ّص إلى الاستخدام المحلي، بدلاً من الوصول إلى واجهة برمجة التطبيقات (على الرغم من أن الأخير قد يكون أكثر رغبة لجوجل).

في هذه اللحظة، يستغرق الوقت الكامل من الإدخال إلى النتيجة حوالي 3 دقائق على وحدة معالجة الرسومات T4، مع حوالي 30 ثانية إضافية للاستدلال (كما هو الحال مع أي روتين استدلال). يقر الباحثون بأن هذا هو تأخير عالٍ، ولا يعتبر بالتأكيد “تفاعليًا”، لكنهم يلاحظون أيضًا أن النموذج يبقى متاحًا للتعديلات الإضافية مرة واحدة بعد ضبطه دقيقًا، حتى ينتهي المستخدم من العملية، مما يقلل من وقت التعديل لكل تعديل.

نُشر لأول مرة في 21 أكتوبر 2022.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai