Моделі та платформи ШІ

CameraCtrl: Керування камерою для генерації відео з тексту

mm
Додайте Unite.AI до бажаних джерел у Google

Нещодавні.frameworks, що намагаються створити відео з тексту або генерацію T2V, використовують моделі дифузії для додання стабільності в процесі навчання, а модель Video Diffusion Model, одна з піонерів у сфері генерації відео з тексту, розширює архітектуру дифузії зображень у двовимірному просторі для розміщення відеоданих і навчання моделі на відео та зображенні спільно з нуля. Будуючи на цьому基础і, і щоб реалізувати потужний попередньо натренований генератор зображень, такий як Stable Diffusion, останні роботи розширюють свою двовимірну архітектуру шляхом чергового розміщення тимчасових шарів між попередньо натренованими двовимірними шарами, і донастроюють нову модель на великих незнайомих наборах даних. Незважаючи на їхній підхід, моделі дифузії відео з тексту стикаються з суттєвою проблемою, оскільки двозначність використовуваних лише текстових описів для генерації зразка відео часто призводить до того, що модель генерації відео з тексту має слабший контроль над процесом генерації. Для подолання цього обмеження деякі моделі забезпечують підвищену керування, тоді як інші працюють з точними сигналами для контролю сцени або руху людини у синтезованих відео точно. З іншого боку, є кілька текстових рамок генерації відео, які приймають зображення як сигнал керування генератором відео, що призводить до точної моделі тимчасових відносин або високої якості відео.

Безперечно, керування графікою відіграє важливу роль у завданнях генерації зображень і відео, оскільки це дозволяє користувачам створювати бажаний контент. Однак існуючі рамки часто нехтують точним контролем положення камери, який служить кінематографічною мовою для вираження глибших нюансів оповідання моделі краще. Для подолання існуючих обмежень керування, в цій статті ми поговоримо про CameraCtrl, нову ідею, яка намагається забезпечити точний контроль положення камери для моделей генерації відео з тексту. Після параметризації траєкторії камери точно, модель тренує модуль камери, який можна підключити до моделі генерації відео з тексту, і залишає інші компоненти незмінними. Крім того, модель CameraCtrl також проводить всебічне дослідження впливу різних наборів даних і пропонує, що відео з подібними зовнішніми ознаками і різноманітним розподілом камер можуть підвищити загальну керованність і здатність до узагальнення моделі. Експерименти, проведені для аналізу продуктивності моделі CameraCtrl у реальних завданнях, свідчать про ефективність рамок у досягненні точного і адаптивного контролю камери, прокладаючи шлях для створення персоналізованої і динамічної генерації відео з положення камери і текстових входів.

Ця стаття має на меті висвітлити рамку CameraCtrl докладно, і ми досліджуємо механізм, методологію, архітектуру рамок разом з їх порівнянням з рамками state of the art. Тому давайте почнемо.

CameraCtrl: Керування камерою для генерації відео з тексту

Нещодавній розвиток і вдосконалення моделей дифузії суттєво просунули текстово-керовану генерацію відео за останні роки, і революціонізували робочі процеси дизайну контенту. Керування графікою відіграє суттєву роль у практичних застосуваннях генерації відео, оскільки це дозволяє користувачам налаштовувати згенеровані результати згідно з їхніми потребами і вимогами. З високим рівнем керування модель能够 підвищити реалізм, якість і придатність згенерованих відео, і хоча текстові і зображенні входи часто використовуються моделями для підвищення загальної керованості, вони часто не мають точного контролю над рухом і контентом. Для подолання цього обмеження деякі рамки пропонують використовувати сигнали керування, такі як скелет положення, оптичний потік і інші багатомодальні сигнали, для забезпечення більш точного контролю для керування генерацією відео. Інша проблема, з якою стикаються існуючі рамки, полягає в тому, що вони не мають точного контролю над стимулюванням або調整уванням точок камери при генерації відео, оскільки можливість контролю камери є важливою, оскільки це не тільки підвищує реалізм згенерованих відео, але також дозволяє налаштовувати точки зору, підвищуючи залученість користувачів, особливість, важливу в розробці ігор, доповненої реальності і віртуальної реальності. Крім того, уміння керувати рухом камери дозволяє творцям підкреслювати відносини між персонажами, акцентувати емоції і керувати увагою цільової аудиторії, що має велике значення у фільмах і рекламній індустрії.

Для подолання цих обмежень рамка CameraCtrl пропонує навчену і точну модуль камери, який можна підключити до існуючої моделі генерації відео з тексту, і має можливість контролювати точки зору камери для генерації відео. Однак інтеграція налаштованої камери до існуючої моделі генерації відео з тексту не є простим завданням, тому рамка CameraCtrl повинна шукати способи ефективно представляти і вводити камеру в архітектуру моделі. У цьому контексті рамка CameraCtrl приймає плакер-ембеддинги як основну форму параметрів камери, і причиною цього вибору є їхня здатність кодувати геометричну інформацію про положення камери. Крім того, для забезпечення узагальнюваності і застосовності моделі CameraCtrl після навчання, модель вводить модель контролю камери, яка приймає лише плакер-ембеддинги як вхід. Для ефективного навчання моделі контролю камери, рамка і її розробники проводять всебічне дослідження для вивчення впливу різних навчальних даних на рамку, від синтетичних до реалістичних даних. Експериментальні результати свідчать про те, що реалізація даних з різноманітним розподілом положення камери і подібними зовнішніми ознаками до оригінальної базової моделі забезпечує найкращий компроміс між керованістю і узагальнюванністю. Розробники рамки CameraCtrl реалізували модель на основі рамки AnimateDiff, забезпечуючи точний контроль у генерації відео в різних персоналізованих контекстах, демонструючи її універсальність і корисність у широкому спектрі контекстів створення відео.

Рамка AnimateDiff приймає ефективний підхід до налаштування моделі LoRA для отримання ваг моделі для різних типів кадрів. Рамка Direct-a-video пропонує реалізувати модуль камери для контролю положення камери під час генерації відео, але вона умовно залежить лише від трьох параметрів камери, обмежуючи можливість контролю камери найбільш базовими типами. З іншого боку, рамки, такі як MotionCtrl, проектують контролер руху, який приймає більше трьох вхідних параметрів і能够 генерувати відео з більш складними положеннями камери. Однак необхідність донастроювання частини згенерованих відео перешкоджає узагальнюваності моделі. Крім того, деякі рамки включають додаткові структуровані сигнали керування, такі як карти глибини, до процесу для підвищення керованості як для генерації зображень, так і для генерації тексту. Зазвичай, модель вводить ці сигнали керування в додатковий кодувальник, а потім вводить сигнали в генератор за допомогою різних операцій.

CameraCtrl: Архітектура моделі

Перед тим, як розглянути архітектуру і парадигму навчання камерного кодувальника, важливо зрозуміти різні представлення камери. Зазвичай, положення камери відноситься до внутрішніх і зовнішніх параметрів, і одним з прямих виборів для того, щоб дозволити генератору відео залежати від положення камери, є введення сирівих значень параметрів камери в генератор. Однак реалізація такого підходу може не підвищити точний контроль камери з кількох причин. По-перше, хоча матриця обертання обмежена ортогональністю, вектор перекладу зазвичай не обмежений за величиною, що призводить до несумісності в процесі навчання, яка може вплинути на узгодженість контролю. По-друге, використання сирівих параметрів камери безпосередньо може зробити difficile для моделі корелювати ці значення з пікселями зображення, що призводить до зниження контролю над візуальними деталями. Для уникнення цих обмежень рамка CameraCtrl приймає плакер-ембеддинги як представлення положення камери, оскільки плакер-ембеддинги мають геометричне представлення кожної пікселі відео-кадру, і能够 забезпечити більш докладне опис положення камери.

Керування камерою у генераторах відео

Поскольку модель параметризує траєкторію камери у послідовність плакер-ембеддингів, тобто просторові карти, модель має можливість використовувати кодувальник для витягування особливостей камери, а потім об’єднувати особливості камери у генераторі відео. Аналогічно до адаптора тексту до зображення, модель CameraCtrl вводить кодувальник камери, спеціально розроблений для відео. Кодувальник камери включає тимчасову увагу після кожного конволюційного блоку, що дозволяє йому захоплювати тимчасові відносини положення камери протягом відео-кадру. Як демонструється на наступному зображенні, кодувальник камери приймає лише плакер-ембеддинги як вхід, і видає багатомастильні особливості. Після отримання багатомастильних особливостей камери, модель CameraCtrl намагається інтегрувати ці особливості у архітектуру U-Net моделі генерації відео з тексту безшовно, і визначає шари, які повинні бути використані для введення інформації камери ефективно. Крім того, оскільки більшість існуючих рамок приймають архітектуру U-Net, яка містить тимчасові і просторові шари уваги, модель CameraCtrl вводить представлення камери у тимчасовий блок уваги, рішення, яке підтримується здатністю тимчасових шарів уваги захоплювати тимчасові відносини, узгоджуючись з внутрішньою причинно-наслідковою і послідовною природою траєкторії камери з просторовими шарами уваги, які зображують окремі кадри.

Навчання розподілів камери

Навчання компонента кодувальника камери у рамці CameraCtrl на генераторі відео вимагає великої кількості добре позначених і анотованих відео з можливістю отримання траєкторії камери за допомогою підходу структури від руху або SfM. Рамка CameraCtrl намагається вибрати набір даних з зовнішніми ознаками, які найбільш близько збігаються з навчальними даними базової моделі генерації відео з тексту, і мають розподіл положення камери якомога ширше. Зразки у наборі даних, згенеровані за допомогою віртуальних двигунів, демонструють різноманітний розподіл камери, оскільки розробники мають можливість контролювати параметри камери під час фази рендерингу, хоча це і стикається з прогалиною розподілу порівняно з наборами даних, які містять реальні зразки. Коли працюється з наборами даних, які містять реальні зразки, розподіл камери зазвичай вузький, і в таких випадках рамка повинна знайти баланс між різноманітністю різних траєкторій камери і складністю окремої траєкторії камери. Складність окремої траєкторії камери забезпечує те, що модель вчиться контролювати складні траєкторії під час процесу навчання, тоді як різноманітність різних траєкторій камери забезпечує те, що модель не переобучується певним фіксованим патернам. Крім того, для моніторингу процесу навчання кодувальника камери, рамка CameraCtrl пропонує метрику вирівнювання камери для вимірювання якості контролю камери шляхом кількісної оцінки похибки між траєкторією камери згенерованих зразків і вхідними умовами камери.

CameraCtrl: Експерименти і результати

Рамка CameraCtrl реалізує модель AnimateDiff як базову модель генерації відео з тексту, і однією з основних причин цього є те, що стратегія навчання моделі AnimateDiff дозволяє її модулю руху інтегруватися з моделями генерації зображень з тексту або моделями LoRA для генерації відео в різних жанрах і доменах. Модель використовує оптимізатор Adam для навчання моделі з постійною швидкістю навчання 1e-4. Крім того, для забезпечення того, щоб модель не вплинула негативно на можливості генерації відео оригінальної моделі генерації відео з тексту, рамка CameraCtrl використовує метрику FID або відстань Фрідера-Інсепшона для оцінки якості зовнішнього вигляду відео, і порівнює якість згенерованого відео до і після введення модуля камери.

Для оцінки її продуктивності, рамка CameraCtrl порівнюється з двома існуючими рамками контролю камери: MotionCtrl і AnimateDiff. Однак, оскільки рамка AnimateDiff підтримує лише вісім базових траєкторій камери, порівняння між CameraCtrl і AnimateDiff обмежується трьома базовими траєкторіями. З іншого боку, для порівняння з MotionCtrl, рамка вибирає понад тисячу випадкових траєкторій камери з існуючого набору даних, генерує відео за допомогою цих траєкторій, і оцінює їх за допомогою метрик TransErr і RotErr.

Як можна побачити, рамка CameraCtrl перевершує рамку AnimateDiff у базовій траєкторії, і демонструє кращі результати у порівнянні з рамкою MotionCtrl на метриці складної траєкторії.

Крім того, наступне зображення демонструє вплив архітектури кодувальника камери на загальну якість згенерованих зразків. Рядки а до рядка д представляють результати, згенеровані з реалізацією кодувальника камери в архітектурі: ControlNet, ControlNet з тимчасовою увагою, T2I Adaptor, і T2I адаптер з тимчасовою увагою відповідно.

У наступному зображенні перші два місця демонструють відео, згенероване за допомогою комбінації RGB-кодувальника рамки SparseCtrl і методу, використаного у рамці CameraCtrl.

Заключні думки

У цій статті ми говорили про CameraCtrl, нову ідею, яка намагається забезпечити точний контроль положення камери для моделей генерації відео з тексту. Після параметризації траєкторії камери точно, модель тренує модуль камери, який можна підключити до моделі генерації відео з тексту, і залишає інші компоненти незмінними. Крім того, модель CameraCtrl також проводить всебічне дослідження впливу різних наборів даних, і пропонує, що відео з подібними зовнішніми ознаками і різноманітним розподілом камери можуть підвищити загальну керованість і здатність до узагальнення моделі. Експерименти, проведені для аналізу продуктивності моделі CameraCtrl у реальних завданнях, свідчать про ефективність рамок у досягненні точного і адаптивного контролю камери, прокладаючи шлях для створення персоналізованої і динамічної генерації відео з положення камери і текстових входів.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.