زاوية Anderson

نموذج التبديد eDiffi من NVIDIA يسمح “بالرسم بالكلمات” والمزيد

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

محاولة إنشاء تركيبات دقيقة باستخدام نماذج الصور التوليدية للتبديد الكمومي مثل التبديد المستقر يمكن أن تكون مثل إدارة القطط؛ القدرات الخيالية والتفسيرية التي تمكن النظام من إنشاء تفاصيل استثنائية وإظهار صور استثنائية من نصوص بسيطة هي أيضًا صعبة الإيقاف عند البحث عن تحكم مستوىPhotoshop على صورة التوليد.

الآن، نهج جديد من البحث في NVIDIA ، بعنوان التبديد بالتركيبة للمصورات (eDiffi)، يستخدم مزيجًا من طرق التضمين والتفسير المتعددة (بدلاً من نفس الطريقة في جميع أنحاء خط الأنابيب) لتمكين مستوى أعلى من التحكم في المحتوى المولَّد. في المثال أدناه، نرى مستخدمًا يرسم عناصر حيث تمثل كل لون كلمة واحدة من نص الإشارة:

'الرسم بالكلمات' هو واحد من القدرات الجديدة في نموذج التبديد eDiffi من NVIDIA. كل لون مخضب يمثل كلمة من النص (انظرها تظهر على اليسار أثناء التوليد)، واللون الذي تم تطبيقه على المنطقة سيكون فقط من ذلك العنصر. انظر الفيديو الرسمي المضمن في نهاية المقال، مع المزيد من الأمثلة وبدقة أفضل. المصدر: https://www.youtube.com/watch?v=k6cOx9YjHJc

‘الرسم بالكلمات’ هو واحد من القدرات الجديدة في نموذج التبديد eDiffi من NVIDIA. كل لون مخضب يمثل كلمة من النص (انظرها تظهر على اليسار أثناء التوليد)، واللون الذي تم تطبيقه على المنطقة سيكون فقط من ذلك العنصر. انظر الفيديو الرسمي للمزيد من الأمثلة وبدقة أفضل على https://www.youtube.com/watch?v=k6cOx9YjHJc

بما يفيد، هذا هو “الرسم بالأقنعة”، ويعكس نمط الرسم في التبديد المستقر، الذي يعتمد على إصلاح الصور التالفة أو غير المرغوب فيها، أو تمديد الصور التي يمكن أن تكون بحجمها المطلوب في المقام الأول.

هنا، بدلاً من ذلك، تمثل حواف اللون المخضب الحدود المقبولة التقريبية لعنصر فريد من مفهوم واحد، مما يسمح للمستخدم بتحديد حجم القماش النهائي من البداية، ثم إضافة العناصر بشكل منفصل.

أمثلة من الورقة الجديدة. المصدر: https://arxiv.org/pdf/2211.01324.pdf

أمثلة من الورقة الجديدة. المصدر: https://arxiv.org/pdf/2211.01324.pdf

الأساليب المتنوعة المستخدمة في eDiffi تعني أيضًا أن النظام يفعل عملًا أفضل في تضمين كل عنصر في نصوص طويلة ومفصلة، في حين أن التبديد المستقر وDALL-E 2 من OpenAI تميلان إلى إعطاء الأولوية لبعض أجزاء النص، اعتمادًا على كيفية ظهور الكلمات المستهدفة في النص، أو على عوامل أخرى، مثل صعوبة فك تشابك العناصر المختلفة اللازمة لتركيبة شاملة (بما يتعلق بالنص الإشارة):

من الورقة: يمكن لـeDiffi التكرار بشكل أكثر شمولاً من خلال النص حتى يتم تقديم أكبر عدد ممكن من العناصر. على الرغم من أن النتائج المحسنة لـeDiffi (العمود الأيمن) تم اختيارها بعناية، فإن الصور المقارنة من التبديد المستقر وDALL-E 2 تم اختيارها أيضًا.

من الورقة: يمكن لـeDiffi التكرار بشكل أكثر شمولاً من خلال النص حتى يتم تقديم أكبر عدد ممكن من العناصر. على الرغم من أن النتائج المحسنة لـeDiffi (العمود الأيمن) تم اختيارها بعناية، فإن الصور المقارنة من التبديد المستقر وDALL-E 2 تم اختيارها أيضًا.

علاوة على ذلك، استخدام معالج نص-نص مخصص T5 يعني أن eDiffi قادر على تقديم نصوص إنجليزية مفهومة، إما بطلب مجرد من النص (أي يحتوي الصورة على بعض النص من [x]) أو بطلب صريح (أي القميص يقرأ ‘Nvidia Rocks’):

معالجة النص-النص المخصصة في eDiffi تعني أن النص يمكن أن يتم تقديمه حرفيًا في الصور، بدلاً من تشغيله فقط من خلال طبقة تفسيرية للنص-الصورة التي تشوه الإخراج.

معالجة النص-النص المخصصة في eDiffi تعني أن النص يمكن أن يتم تقديمه حرفيًا في الصور، بدلاً من تشغيله فقط من خلال طبقة تفسيرية للنص-الصورة التي تشوه الإخراج.

إضافة أخرى إلى الإطار الجديد هي أنه من الممكن أيضًا تقديم صورة واحدة كإشارة نمطية، بدلاً من الحاجة إلى تدريب نموذج DreamBooth أو تضمين نصي لمножة من الأمثلة على نمط أو نمط.

يمكن تطبيق نقل النمط من صورة مرجعية إلى إشارة نص-صورة، أو حتى إشارة صورة-صورة.

يمكن تطبيق نقل النمط من صورة مرجعية إلى إشارة نص-صورة، أو حتى إشارة صورة-صورة.

الورقة الجديدة بعنوان eDiffi: نماذج التبديد النص-صورة مع مجموعة من محررات التبديد الخبراء،

معالج النص T5

استخدام معالج النص-نص الترانسفورمر (T5) من جوجل هو العنصر الحاسم في النتائج المحسنة التي أظهرها eDiffi. الخط الأنابيب المعتاد للتبديد الكمومي يركز على العلاقة بين الصور الم

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai