Моделі та платформи ШІ
StreamDiffusion: Підхід рівня пайплайну для генерації інтерактивних зображень в режимі реального часу

Через свою величезну потенціал та можливості комерціалізації, особливо в іграх, мовленні та відеопотоці, Метавсесвіт зараз є однією з найшвидше зростаючих технологій. Сучасні застосунки Метавсесвіту використовують кадри штучного інтелекту, включаючи комп’ютерне бачення та моделі дифузії, для підвищення їх реалізму. Значною проблемою для застосунків Метавсесвіту є інтеграція різних пайплайнів дифузії, які забезпечують низьку затримку та високу пропускну здатність, забезпечуючи ефективну взаємодію між людьми та цими застосунками.
Сучасні кадри штучного інтелекту на основі дифузії добре працюють при створенні зображень з текстових чи зображень-підказок, але не справляються з взаємодією в режимі реального часу. Ця обмеженість особливо помітна в завданнях, які вимагають безперервного вводу та високої пропускної здатності, таких як графіка відеоігор, застосунки Метавсесвіту, мовлення та прямий відеопотік.
У цій статті ми обговоримо StreamDiffusion, пайплайн дифузії в режимі реального часу, розроблений для генерації інтерактивних та реалістичних зображень, що вирішує поточні обмеження кадрів дифузії в завданнях, що включають безперервний ввід. StreamDiffusion – це інноваційний підхід, який перетворює послідовне шумування оригінального зображення у шумування пакетів, спрямований на забезпечення високої пропускної здатності та рідинних потоків. Цей підхід відходить від традиційного методу “чекай та взаємодій”, використовуваного існуючими кадрами дифузії. У наступних розділах ми детально розглянемо.framework StreamDiffusion, його роботу, архітектуру та порівняльні результати проти поточних кадрів стану мистецтва. Почнімо.
StreamDiffusion: Введення у генерацію інтерактивних зображень у режимі реального часу
Застосунки Метавсесвіту – це ресурсоємні застосунки, оскільки вони обробляють велику кількість даних, включаючи тексти, анімації, відео та зображення в режимі реального часу, щоб забезпечити користувачам інтерактивні інтерфейси та досвід. Сучасні застосунки Метавсесвіту покладаються на кадри штучного інтелекту, включаючи комп’ютерне бачення, обробку зображень та моделі дифузії, для досягнення низької затримки та високої пропускної здатності, щоб забезпечити безперервний користувачів досвід. Наразі більшість застосунків Метавсесвіту покладаються на зменшення кількості ітерацій денойзингу, щоб забезпечити високу пропускну здатність та підвищити інтерактивні можливості застосунку в режимі реального часу. Ці кадри використовують загальний підхід, який або涉ує переформулювання процесу дифузії з використанням нейронних ОДЕ (звичайних диференціальних рівнянь), або зменшення багатоступеневих моделей дифузії до декількох кроків або навіть одного кроку. Хоча цей підхід дає задовільні результати, він має певні обмеження, включаючи обмежену гнучкість та високі обчислювальні витрати.
З іншого боку, StreamDiffusion – це рішення рівня пайплайну, яке починається з ортогонального напрямку та підвищує можливості кадру генерації інтерактивних зображень у режимі реального часу, забезпечуючи високу пропускну здатність. StreamDiffusion використовує просту стратегію, при якій замість денойзингу оригінального вводу кадр групує крок денойзингу. Ця стратегія черпає натхнення з асинхронної обробки, оскільки кадр не повинен чекати завершення першого етапу денойзингу, перш ніж перейти до другого етапу, як показано на наступному зображенні. Для вирішення проблеми частоти обробки U-Net та частоти вводу同步но кадр StreamDiffusion реалізує стратегію черги для кешування вводу та виводу.

Хоча пайплайн StreamDiffusion черпає натхнення з асинхронної обробки, він унікальний у своєму роді, оскільки реалізує паралелізм GPU, який дозволяє кадру використовувати один компонент U-Net для денойзингу пакету шумових функцій. Крім того, існуючі кадри дифузії підкреслюють дані промпти у згенерованих зображеннях шляхом включення класифікаторної безкоштовної керівництва, в результаті чого поточні кадри оснащені зайвими та надмірними обчислювальними витратами. Для того, щоб пайплайн StreamDiffusion не зустрічався з тією ж проблемою, він реалізує інноваційний підхід RCFG або Резидуальний Класифікаторний Безкоштовний Підхід, який використовує віртуальний резидуальний шум для апроксимації негативних умов, що дозволяє кадру розрахувати негативні умови шуму на початкових етапах процесу.
Пайплайн StreamDiffusion побудований на основі знань моделей дифузії та прискорених моделей дифузії.

Моделі дифузії відомі своїми винятковими можливостями генерації зображень та кількістю контролю, яку вони пропонують. Оwing до їх можливостей, моделі дифузії знайшли застосування в редакуванні зображень, генерації зображень з текстових підказок та генерації відео. Крім того, розвиток узгоджених моделей продемонстрував потенціал для підвищення ефективності обробки зразків без компромісу щодо якості згенерованих зображень, що відкрило нові двері для розширення застосувань та ефективності моделей дифузії шляхом зменшення кількості кроків вибірки. Хоча дуже здатні, моделі дифузії мають одну велику обмеження: повільну генерацію зображень. Для вирішення цієї обмеження розробники ввели прискорені моделі дифузії, кадри дифузії, які не вимагають додаткових кроків навчання або реалізують передбачувані-коректувальні стратегії та адаптивні розв’язувачі кроків для збільшення швидкості виводу.
Відмінною особливістю StreamDiffusion та традиційних кадрів дифузії є те, що останні зосереджені в основному на низькій затримці окремих моделей, тоді як перший вводить підхід рівня пайплайну, призначений для досягнення високої пропускної здатності, що забезпечує ефективну інтерактивну дифузію.
StreamDiffusion: Робота та Архітектура
Пайплайн StreamDiffusion – це пайплайн дифузії в режимі реального часу, розроблений для генерації інтерактивних та реалістичних зображень, і він складається з 6 ключових компонентів: RCFG або Резидуальний Класифікаторний Безкоштовний Підхід, стратегія Stream Batch, фільтр Стохастичної Схожості, черга вводу-виводу, інструменти прискорення моделі з автоенкодером та процедура попередньої обробки. Давайте розглянемо ці компоненти детально.
Стратегія Stream Batch
Традиційно кроки денойзингу в моделі дифузії виконуються послідовно, що призводить до значного збільшення часу обробки U-Net у залежності від кількості кроків обробки. Однак для генерації зображень високої якості необхідно збільшити кількість кроків обробки, і пайплайн StreamDiffusion вводить стратегію Stream Batch для вирішення проблеми високої затримки в інтерактивних кадрах дифузії.
У стратегії Stream Batch послідовні операції денойзингу реорганізовані у пакетні процеси, причому кожен пакет відповідає певній кількості кроків денойзингу, а кількість цих кроків денойзингу визначається розміром кожного пакету. Завдяки цьому підходу кожен елемент у пакеті може перейти на один крок далі за допомогою одного проходу U-Net у послідовності денойзингу. Реалізуючи стратегію Stream Batch ітеративно, вхідні зображення, закодовані на часовий інтервал “t”, можуть бути перетворені у свої відповідні результати зображення у зображення на часовий інтервал “t+n”, тим самим оптимізуючи процес денойзингу.
Резидуальний Класифікаторний Безкоштовний Підхід
CFG або Класифікаторний Безкоштовний Підхід – це алгоритм штучного інтелекту, який виконує ряд векторних обчислень між оригінальним умовним терміном та негативним умовним терміном для посилення ефекту оригінального умовного терміну. Алгоритм посилює ефект промпту, хоча для розрахунку негативного умовного шуму необхідно поєднати окремі вхідні латентні змінні з негативним умовним вкладенням, після чого ці вкладення передаються через U-Net на часовий інтервал посилання.
Для вирішення цієї проблеми, пов’язаної з алгоритмом CFG, пайплайн StreamDiffusion вводить алгоритм Резидуального Класифікаторного Безкоштовного Підходу з метою зменшення обчислювальних витрат для додаткового втручання U-Net у негативному умовному вкладенні. Спочатку закодований вхідний латентний вхід передається у розподіл шуму за допомогою значень, визначених планувальником шуму. Після реалізації моделі латентної узгодженості алгоритм може передбачити розподіл даних та використовувати залишковий шум CFG для генерації наступного розподілу шуму.

Черга Вводу-Виводу
Основною проблемою високошвидкісних кадрів генерації зображень є їх модулі нейронної мережі, включаючи компоненти U-Net та VAE. Для максимізації ефективності та загальної швидкості виводу кадри генерації зображень переміщують процеси, такі як попередня та після обробка зображень, які не вимагають додаткової обробки модулями нейронної мережі, поза пайплайном, після чого вони обробляються паралельно. Крім того, щодо обробки вхідного зображення певні операції, включаючи перетворення формату тензора, зміну розміру вхідного зображення та нормалізацію, виконуються пайплайном ретельно.
Для вирішення проблеми розбіжності між частотами обробки моделі та частотами вводу людьми пайплайн інтегрує систему черги вводу-виводу, яка дозволяє ефективно паралелізувати, як показано на наступному зображенні.

Оброблені вхідні тензори впорядковано чергуються для моделей дифузії, і під час кожного кадру модель отримує найновіший тензор з черги вводу та передається до кодувача VAE, тим самим ініціюючи процес генерації зображення. В той же час тензор виводу з декодувача VAE передається у чергу виводу. Нарешті, оброблені дані зображення передаються клієнту візуалізації.
Фільтр Стохастичної Схожості
У сценаріях, коли зображення залишаються незмінними або демонструють мінімальні зміни без статичного середовища або без активної взаємодії користувача, вхідні зображення, подібні один до одного, подаються повторно у компоненти U-Net та VAE. Це повторне подання призводить до генерації майже ідентичних зображень та додаткового споживання ресурсів GPU. Крім того, у сценаріях, що включають безперервний ввід, незмінені вхідні зображення можуть з’явитися час від часу. Для вирішення цієї проблеми та запобігання зайвому використанню ресурсів пайплайн StreamDiffusion використовує компонент фільтра Стохастичної Схожості у своєму пайплайні. Фільтр Стохастичної Схожості спочатку розраховуємо коефіцієнт косинусної схожості між зображенням посилання та вхідним зображенням, а потім використовує коефіцієнт косинусної схожості для розрахунку ймовірності пропуску наступних процесів U-Net та VAE.
На основі цього ймовірності пайплайн вирішує, чи слід пропустити наступні процеси, такі як кодування VAE, декодування VAE та U-Net, чи ні. Якщо ці процеси не пропускаються, пайплайн зберігає вхідне зображення на цей час та одночасно оновлює зображення посилання для використання в майбутньому. Цей механізм пропуску на основі ймовірності дозволяє пайплайну StreamDiffusion повністю працювати у динамічних сценаріях з низькою міжкадровою схожістю, тоді як у статичних сценаріях пайплайн працює з вищою міжкадровою схожістю. Цей підхід допомагає зберегти обчислювальні ресурси та забезпечити оптимальне використання GPU на основі схожості вхідних зображень.
Попередня Обробка
Архітектура U-Net потребує умовних вкладень, а також вхідних латентних змінних. Традиційно умовні вкладення отримуються з вкладень промптів, які залишаються сталими на всіх кадрах. Для оптимізації отримання цих вкладень промптів пайплайн StreamDiffusion попередньо розрахував ці вкладення промптів та зберіг їх у кеші, який потім викликається у режимі потоку або взаємодії. У рамках кадру U-Net пара ключ-значення розрахується на основі попередньо розрахованого вкладення промпту кожного кадру, а з незначними змінами у кадрі U-Net ці пари ключ-значення можуть бути повторно використані.
Прискорення Моделі та Малий Автоенкодер
Пайплайн StreamDiffusion використовує TensorRT, інструмент оптимізації від Nvidia (NVDA ) для інтерфейсів глибинного навчання, для побудови двигунів VAE та U-Net, щоб прискорити швидкість висновку. Для цього компонент TensorRT виконує численні оптимізації нейронних мереж, призначені для підвищення ефективності та пропускної здатності для кадрів глибинного навчання та застосунків.
Для оптимізації швидкості пайплайн StreamDiffusion конфігурується для використання фіксованих розмірів вводу та статичних розмірів пакетів, щоб забезпечити оптимальну алокацію пам’яті та обчислювальні графи для певного розміру вводу, намагаючись досягти швидшого часу обробки.

На вищому зображенні показано огляд пайплайну висновку. Основний пайплайн дифузії містить компоненти U-Net та VAE. Пайплайн включає пакет денойзингу, кеш збереженого шуму, кеш попередньо розрахованих вкладень промптів та кеш значень планувальника, щоб підвищити швидкість та здатність пайплайну генерувати зображення у режимі реального часу. Фільтр Стохастичної Схожості використовується для оптимізації використання GPU та динамічного контролю проходу моделі дифузії.
StreamDiffusion: Експерименти та Результати
Для оцінки своїх можливостей пайплайн StreamDiffusion реалізований на кадрах LCM та SD-turbo. Використовується TensorRT від Nvidia як прискорювач моделі, а для забезпечення легкої ефективності VAE пайплайн використовує компонент TAESD. Давайте розглянемо, як пайплайн StreamDiffusion працює порівняно з поточними кадрами стану мистецтва.
Кількісна Оцінка
На наступному зображенні показано порівняння ефективності між оригінальним послідовним U-Net та компонентом денойзингу пакету у пайплайні, і, як можна побачити, реалізація підходу денойзингу пакету допомагає зменшити час обробки приблизно на 50% порівняно з традиційними петлями U-Net на послідовних кроках денойзингу.

Крім того, середній час висновку на різних кроках денойзингу також демонструє суттєве підвищення з різними факторами прискорення порівняно з поточними кадрами стану мистецтва, і результати показані на наступному зображенні.

Пайплайн StreamDiffusion з компонентом RCFG демонструє менший час висновку порівняно з кадрами, що включають традиційний компонент CFG.

Крім того, вплив використання компоненту RCFG очевидний на наступних зображеннях порівняно з використанням компоненту CFG.

Як можна побачити, використання CFG посилює вплив текстового промпту на генерацію зображення, і зображення нагадують вхідні промпти значно більше порівняно з зображеннями, згенерованими пайплайном без використання компоненту CFG. Результати покращуються далі з використанням компоненту RCFG, оскільки вплив промптів на згенеровані зображення досить значний порівняно з оригінальним компонентом CFG.
Фінальні Думки
У цій статті ми обговорили StreamDiffusion, пайплайн дифузії в режимі реального часу, розроблений для генерації інтерактивних та реалістичних зображень, що вирішує поточні обмеження кадрів дифузії в завданнях, що включають безперервний ввід. StreamDiffusion – це простий та новий підхід, який перетворює послідовне шумування оригінального зображення у шумування пакетів, спрямований на забезпечення високої пропускної здатності та рідинних потоків. StreamDiffusion спрямований на забезпечення високої пропускної здатності та рідинних потоків шляхом ліквідації традиційного підходу “чекай та взаємодій”, використовуваного поточними кадрами дифузії. Потенційні вигоди з ефективності підкреслюють потенціал пайплайну StreamDiffusion для комерційних застосунків, що пропонують високопродуктивні обчислення та привабливі рішення для генерації штучного інтелекту.












