نماذج ومنصات الذكاء الاصطناعي
StreamDiffusion: حلول.pipeline-مستوى للتركيب التفاعلي في الوقت الفعلي

بسبب إمكانياتها الهائلة وفرص التطوير التجاري، خاصة في مجالات الألعاب والبث والتسلسل، يعتبر Metaverse حاليًا واحدة من Technologies الأسرع نموًا. تستخدم تطبيقات Metaverse الحديثة إطارات عمل الذكاء الاصطناعي، بما في ذلك الرؤية الحاسوبية وطرازات الانتشار، لتعزيز واقعيتها. وتعتبر واحدة من التحديات الكبيرة لتطبيقات Metaverse هي دمج أنابيب انتشار مختلفة توفر زمن انتقال منخفض وانتاجية عالية، مما يضمن التفاعل الفعال بين البشر وتطبيقات هذه التطبيقات.
تتميز الإطارات الحالية القائمة على الانتشار بإنشاء صور من نصوص أو صور محفزة، لكنها تفتقر إلى التفاعلات في الوقت الفعلي. هذا القصور واضح بشكل خاص في المهام التي تتطلب مدخلات مستمرة وانتاجية عالية، مثل رسومات ألعاب الفيديو وتطبيقات Metaverse والبث والبث المباشر.
في هذه المقالة، سنناقش StreamDiffusion، وهي أنبوبة انتشار في الوقت الفعلي تم تطويرها لإنشاء صور تفاعلية وواقعية، وتحديدًا لمعالجة القيود الحالية للإطارات القائمة على الانتشار في المهام التي تتضمن مدخلات مستمرة. StreamDiffusion هي نهج مبتكر يهدف إلى تحويل التشويش التسلسلي للصورة الأصلية إلى تشويش دفعي، بهدف تمكين الإنتاجية العالية والتدفق السلس. هذا النهج يبتعد عن نهج الانتظار والتفاعل التقليدي المستخدم من قبل الإطارات القائمة على الانتشار الحالية. في الأقسام القادمة، سنغوص في إطار StreamDiffusion بالتفصيل، مستكشفين عمله وهيكله والنتائج المقارنة مع الإطارات الحالية. هيا نبدأ.
StreamDiffusion: مقدمة في التوليد التفاعلي في الوقت الفعلي
تعتبر تطبيقات Metaverse تطبيقات مكثفة للأداء لأنها تُعالج كمية كبيرة من البيانات، بما في ذلك النصوص والرسوم المتحركة والفيديوهات والصور في الوقت الفعلي، لتوفير واجهات تفاعلية وتجارب مستخدم نهائية. تعتمد تطبيقات Metaverse الحديثة على إطارات عمل الذكاء الاصطناعي، بما في ذلك الرؤية الحاسوبية ومعالجة الصور وطرازات الانتشار، لتحقيق زمن انتقال منخفض وانتاجية عالية لضمان تجربة مستخدم سلسة.
في الوقت نفسه، يعتمد معظم تطبيقات Metaverse على تقليل حدوث تكرارات التشويش لضمان الإنتاجية العالية وتعزيز القدرات التفاعلية للتطبيقات في الوقت الفعلي. هذه الإطارات تتبنى استراتيجية شائعة تتضمن إعادة صياغة عملية الانتشار باستخدام معادلات تفاضلية عادية أو تقليل نماذج الانتشار متعددة الخطوات إلى خطوات قليلة أو حتى خطوة واحدة. على الرغم من أن هذا النهج يوفر نتائج مرضية، إلا أنه يمتلك بعض القيود، بما في ذلك المرونة المحدودة والتكلفة الحسابية العالية.

من ناحية أخرى، StreamDiffusion هو حل على مستوى الأنبوبة يبدأ من اتجاه متعامد ويعزز قدرات الإطار على توليد صور تفاعلية في الوقت الفعلي مع ضمان الإنتاجية العالية. StreamDiffusion يستخدم استراتيجية بسيطة حيث بدلاً من تشويش المدخلات الأصلية، يُجمّع خطوة التشويش. هذه الاستراتيجية تستمد الإلهام من المعالجة غير المتزامنة، حيث لا يتعين على الإطار انتظار اكتمال المرحلة الأولى من التشويش قبل الانتقال إلى المرحلة الثانية، كما هو موضح في الصورة التالية.
للمواجهة مشكلة تكرار معالجة U-Net وتواتر المدخلات بشكل متزامن، يطبق إطار StreamDiffusion استراتيجية التصفيف لتحويل المدخلات والمخرجات.

يتميز إطار StreamDiffusion ببناءه على دروس نماذج الانتشار ونمذجة التسريع.
نماذج الانتشار معروفة بقدراتها الاستثنائية في توليد الصور وكمية التحكم التي تقدمها. بفضل هذه القدرات، وجدت نماذج الانتشار تطبيقاتها في تحرير الصور وتوليد الصور النصية وتوليد الفيديو. بالإضافة إلى ذلك، أظهرت تطوير النماذج الثابتة إمكانية تحسين كفاءة معالجة العينة دون المساس بجودة الصور التي يتم توليدها من قبل النموذج، مما فتح أبوابًا جديدة لتوسيع قدرات نماذج الانتشار وزيادة كفاءتها من خلال تقليل عدد خطوات العينة.
الفرق المتميز بين StreamDiffusion والإطارات التقليدية القائمة على الانتشار هو أن الأولى تركز على نهج على مستوى الأنبوبة لتحقيق الإنتاجية العالية، بينما تركز الأخيرة بشكل رئيسي على زمن الانتقال المنخفض للنماذج الفردية.
StreamDiffusion: آلية العمل والهيكل
يُعتبر أنبوب StreamDiffusion أنبوبًا للانتشار في الوقت الفعلي تم تطويره لتوليد صور تفاعلية وواقعية، ويتكون من ستة مكونات رئيسية هي: RCFG أو إرشاد حر مجاني من الفئة، استراتيجية Stream Batch، مرشح التشابه العشوائي، نظام التصفيف للمدخلات والمخرجات، أدوات التسريع النمذجي مع التشفير الصغير، وإجراء المعالجة المسبقة. دعونا نتحدث عن هذه المكونات بالتفصيل.
استراتيجية Stream Batch
تُجرى عمليات التشويش بشكل تسلسلي في نموذج الانتشار التقليدية، مما يؤدي إلى زيادة كبيرة في وقت معالجة U-Net بالاعتماد على عدد خطوات المعالجة. ومع ذلك، من الضروري زيادة عدد خطوات المعالجة لتوليد صور عالية الدقة، ويقدم إطار StreamDiffusion استراتيجية Stream Batch لمعالجة هذه المشكلة.
في استراتيجية Stream Batch، تُ重新 هيكلة عمليات التشويش التسلسلية إلى عمليات دفعية، حيث تتطابق كل دفعة مع عدد معين من خطوات التشويش، ويتحدد عدد خطوات التشويش بواسطة حجم كل دفعة. بفضل هذا النهج، يمكن لكل عنصر في الدفعة المضي قدمًا بخطوة واحدة باستخدام ممر U-Net الفردي في تسلسل التشويش.
إرشاد حر مجاني من الفئة
يُعتبر إرشاد الفئة الحر (CFG) خوارزمية تعمل على سلسلة من الحسابات المتجهية بين الشروط الأصلية وشرط سالب أو غير مشروط لتعزيز تأثير الشروط الأصلية.
للمواجهة هذه المشكلة التي تطرحها خوارزمية إرشاد الفئة الحر، يقدم إطار StreamDiffusion خوارزمية إرشاد حر مجاني من الفئة (RCFG) بهدف تقليل التكاليف الحسابية الإضافية للتداخل U-Net للشروط السالبة.

نظام التصفيف للمدخلات والمخرجات
تُعتبر مشكلة رئيسية في إطارات توليد الصور السريعة هي وحدات الشبكة العصبية، بما في ذلك مكونات U-Net وVAE.
لتحقيق أقصى كفاءة وسرعة الإخراج، تتحرك إطارات توليد الصور العمليات مثل معالجة الصور قبل وبعد المعالجة التي لا تتطلب معالجة إضافية بواسطة وحدات الشبكة العصبية خارج الأنبوبة، ثم يتم معالجتها بالتوازي.

تُضاف tensors المدخلات المعالجة بشكل منهجي إلى قائمة الانتظار لنموذج الانتشار، وفي كل إطار، يسترد النموذج tensor الأكثر حداثة من قائمة المدخلات ويوجهه إلى محرر VAE، مما يُشعل عملية توليد الصور.
مرشح التشابه العشوائي
في السيناريوهات التي لا تتغير فيها الصور أو تظهر تغييرات طفيفة دون بيئة ثابتة أو بدون تفاعل مستخدم نشط، يتم تغذية صور المدخلات الشبيهة بشكل متكرر إلى مكونات U-Net وVAE.
يؤدي ذلك إلى توليد صور متشابهة وت消耗 موارد إضافية. لذلك، يطبق إطار StreamDiffusion مكون مرشح التشابه العشوائي في أنبوبته.
المعالجة المسبقة
تحتاج هيكلة U-Net إلى شروط التضمين والمتغيرات اللاتنة.
تتمثل الطريقة التقليدية في اشتقاق شروط التضمين من شروط التضمين التي تظل ثابتة عبر الإطارات.
التسريع النمذجي والتشفير الصغير
يستخدم إطار StreamDiffusion أداة TensorRT، وهي أداة تحسين من Nvidia (NVDA ) للواجهات التعلم العميق، لإنشاء محركات VAE وU-Net، لتعزيز سرعة الاستدلال.
لتحقيق ذلك، تقوم أداة TensorRT بعمليات تحسين متعددة على الشبكات العصبية المصممة لتعزيز الكفاءة والانتاجية لتطبيقات التعلم العميق.

تُظهر الصورة أعلاه نظرة عامة على أنبوبة الاستدلال. يتضمن أنبوب الانتشار الرئيسي مكونات U-Net وVAE.
StreamDiffusion: التجارب والنتائج
لتحديد قدراته، تم تطبيق أنبوب StreamDiffusion على إطارات LCM وSD-turbo.
تم استخدام TensorRT من Nvidia كمسرع نموذج، ولتمكين الكفاءة الخفيفة، يستخدم الإطار مكون TAESD.
التقييم الكمي
تُظهر الصورة التالية مقارنة الكفاءة بين U-Net التسلسلي الأصلي ومكونات التشويش الدفعي في الأنبوبة، ويمكن رؤية أن تطبيق نهج التشويش الدفعي يساعد في تقليل وقت المعالجة بشكل كبير، بنسبة تقارب 50٪ عند مقارنته bằng دورات U-Net التقليدية.

كما شهد متوسط وقت الاستدلال في خطوات تشويش مختلفة تحسنًا كبيرًا مع عوامل تسريع مختلفة عند مقارنته بالإطارات الحالية.

كما أظهر أنبوب StreamDiffusion مع مكون RCFG وقت استدلال أقل عند مقارنته بأنابيب تحتوي على مكون CFG التقليدية.

أثارت هذه النتائج اهتمامًا خاصًا عند مقارنة استخدام مكون RCFG مع مكون CFG.

كما يظهر أن استخدام مكون CFG يزيد من تأثير النص المحفز في توليد الصور، ويظهر الصورة المولدة تشابهًا أكبر مع النص المحفز عند مقارنتها بالصور المولدة بدون استخدام مكون CFG.
أفكار ختامية
في هذه المقالة، ناقشنا StreamDiffusion، وهو أنبوب انتشار في الوقت الفعلي تم تطويره لتوليد صور تفاعلية وواقعية، ومعالجة القيود الحالية للإطارات القائمة على الانتشار في المهام التي تتضمن مدخلات مستمرة. StreamDiffusion هو نهج بسيط ومتطور يهدف إلى تحويل التشويش التسلسلي للصورة الأصلية إلى تشويش دفعي، بهدف تمكين الإنتاجية العالية والتدفق السلس.












