Моделі та платформи ШІ
Zero123++: Одnorазове зображення до узгодженого багатомірного дифузійного базового моделі

За останні кілька років ми стали свідками швидкого прогресу в роботі, ефективності та генерації нових моделей генерації AI, які використовують великі набори даних та методи генерації 2D-дифузії. Сьогодні моделі генерації AI здатні генерувати різні форми 2D- та, до певної міри, 3D-медіа-контенту, включаючи текст, зображення, відео, GIF та інше.
У цій статті ми розглянемо.framework Zero123++, який є моделлю генерації AI, умовною на зображенні, з метою генерації 3D-узгодженого багатомірного зображення за допомогою одного виду входу. Для максимального використання переваг попередньо натренованих моделей генерації, framework Zero123++ реалізує різні схеми навчання та умовлення, щоб мінімізувати кількість зусиль, необхідних для доопрацювання моделей дифузії зображень з коробки. Ми розглянемо архітектуру, роботу та результати framework Zero123++ та проаналізуємо його можливості генерації узгодженого багатомірного зображення високої якості з одного зображення. Тому почнемо.
Zero123 і Zero123++: Введення
Framework Zero123++ є моделлю генерації AI, умовною на зображенні, з метою генерації 3D-узгодженого багатомірного зображення за допомогою одного виду входу. Framework Zero123++ є продовженням framework Zero123 або Zero-1-to-3, який використовує техніку синтезу нових видів зображень без попереднього навчання, щоб створити відкритий джерельний код для перетворення одного зображення в 3D. Хоча framework Zero123++ демонструє перспективну продуктивність, зображення, згенеровані цим framework, мають помітні геометричні несумісності, і це основна причина, чому розрив між 3D-сценами та багатомірними зображеннями ще існує.
Framework Zero-1-to-3 служить основою для кількох інших framework, включаючи SyncDreamer, One-2-3-45, Consistent123 та ін., які додають додаткові шари до framework Zero123, щоб отримати більш узгоджені результати при генерації 3D-зображень. Інші framework, такі як ProlificDreamer, DreamFusion, DreamGaussian та ін., використовують оптимізаційний підхід, щоб отримати 3D-зображення, витягуючи 3D-зображення з різних несумісних моделей. Хоча ці техніки ефективні та генерують задовільні 3D-зображення, результати можна поліпшити шляхом реалізації базової моделі дифузії, здатної генерувати багатомірні зображення узгоджено. Відповідно, framework Zero123++ використовує framework Zero-1-to-3 та доопрацьовує нову багатомірну базову модель дифузії з Stable Diffusion.
У framework Zero-1-to-3 кожен новий вид генерується незалежно, і цей підхід призводить до несумісностей між згенерованими видами, оскільки моделі дифузії мають вибірковий характер. Для вирішення цієї проблеми framework Zero123++采用є підхід тилової композиції, коли об’єкт оточується шістьма видами в одному зображенні, забезпечуючи правильну модель спільного розподілу багатомірних зображень об’єкта.
Інша велика проблема, з якою стикаються розробники, які працюють над framework Zero-1-to-3, полягає в тому, що він недостатньо використовує можливості, надані Stable Diffusion, що в кінцевому підсумку призводить до неефективності та додаткових витрат. Є дві основні причини, чому framework Zero-1-to-3 не може максимально використати можливості Stable Diffusion
- Під час навчання з умовами зображення framework Zero-1-to-3 не включає локальні чи глобальні механізми умовлення, надані Stable Diffusion, ефективно.
- Під час навчання framework Zero-1-to-3 використовує зменшену роздільність, підхід, при якому роздільність виходу зменшується нижче роздільності навчання, що може знижувати якість генерації зображень для моделей дифузії Stable Diffusion.
Для вирішення цих проблем framework Zero123++ реалізує ряд технік умовлення, які максимізують використання ресурсів, наданих Stable Diffusion, та зберігають якість генерації зображень для моделей дифузії Stable Diffusion.
Поліпшення умовлення та узгодженості
У спробі поліпшити умовлення зображення та узгодженість багатомірних зображень framework Zero123++ реалізував різні техніки, з основною метою повторного використання попередніх технік з попередньо натренованої моделі дифузії Stable Diffusion.
Багатомірна генерація
Негідний якісний показник генерації узгодженого багатомірного зображення полягає в моделюванні спільного розподілу багатомірних зображень правильно. У framework Zero-1-to-3 кореляція між багатомірними зображеннями ігнорується, оскільки для кожного зображення framework моделює умовний маргінальний розподіл незалежно та окремо. Однак у framework Zero123++ розробники обрали підхід тилової композиції, який укладає 6 зображень в одному кадрі/зображенні для узгодженого багатомірного покоління, і цей процес демонструється на наступному зображенні.

Крім того, було помічено, що орієнтації об’єктів мають тенденцію до розрізнення під час навчання моделі на камерних позах, і для запобігання цьому розрізненню framework Zero-1-to-3 навчає на камерних позах з кутами висоти та відносними азимутами до входу. Для реалізації цього підходу необхідно знати кут висоти виду входу, який потім використовується для визначення відносної пози між новими видами входу. У спробі знайти цей кут висоти framework часто додає модуль оцінки висоти, і цей підхід часто супроводжується додатковими помилками в трубопроводі.
Графік шуму
Скалярно-лінійний графік, оригінальний графік шуму для Stable Diffusion, фокусується в основному на локальних деталях, але, як можна побачити на наступному зображенні, він має дуже мало кроків з нижнім відношенням сигналу до шуму.

Ці кроки низького відношення сигналу до шуму відбуваються на ранній стадії денойзингу, стадії, яка визначає глобальну низькочастотну структуру. Зниження кількості кроків на стадії денойзингу, як під час інтерференції, так і під час навчання, часто призводить до більшої структуної варіації. Хоча цей підхід ідеальний для генерації одного зображення, він обмежує можливість framework забезпечити глобальну узгодженість між різними видами. Для подолання цього перепони framework Zero123++ доопрацьовує модель LoRA на framework Stable Diffusion 2 v-prediction для виконання іграшки завдання, і результати демонструються нижче.

З графіком шуму, масштабованим лінійно, модель LoRA не переобучується, а лише трохи відбілює зображення. Навпаки, коли працюють з лінійним графіком шуму, framework LoRA генерує सफтке зображення успішно незалежно від входового запиту, що свідчить про вплив графіка шуму на можливість framework адаптуватися до нових вимог глобально.
Масштабована референс-увага для локальних умов
Одне зображення входу або умовні зображення у framework Zero-1-to-3 конкатенуємо з шумними входами у розмірності функції, щоб бути шумним для умовлення зображення.
Ця конкатенація призводить до неправильної піксельної просторової відповідності між цільовим зображенням та входом. Для забезпечення правильного локального умовного входу framework Zero123++ використовує масштабовану референс-увагу, підхід, при якому запускається денойзинговий UNet-модель, посилається на додаткове референс-зображення, а потім додає матриці значення та самої уваги з референс-зображення до відповідних шарів уваги, коли входи моделі денойзуються, і це демонструється на наступному зображенні.

Підхід референс-уваги здатний спрямовувати модель дифузії на генерацію зображень, які мають подібну текстуру з референс-зображенням, та семантичний зміст без будь-якого доопрацювання. З доопрацюванням підхід референс-уваги демонструє кращі результати з масштабованим латентом.

Глобальне умовлення: FlexDiffuse
У оригінальному підході Stable Diffusion текстові вкладення є єдиним джерелом глобальних вкладень, і підхід використовує framework CLIP як текстовий кодувальник для проведення перехресних досліджень між текстовими вкладеннями та латентними моделями. В результаті розробники можуть використовувати відповідність між текстовими просторами та отриманими зображеннями CLIP для глобального умовлення зображень.
Framework Zero123++ пропонує використовувати треновану варіант лінійного механізму керування для включення глобального умовлення зображення в framework з мінімальним доопрацюванням, необхідним, і результати демонструються на наступному зображенні. Як можна побачити, без глобального умовлення зображення, якість вмісту, згенерованого framework, є задовільною для видимих регіонів, які відповідають входовому зображенню. Однак якість зображення, згенерованого framework для невидимих регіонів, значно погіршується, що в основному пояснюється нездатністю моделі вивести глобальну семантику об’єкта.

Архітектура моделі
Framework Zero123++ навчається з моделлю Stable Diffusion 2v як основою, використовуючи різні підходи та техніки, згадані в статті. Framework Zero123++ попередньо навчається на наборі даних Objaverse, який відображається з випадковим освітленням HDRI. Framework також采用є фазований графік навчання, використовуваний у framework Stable Diffusion Image Variations, у спробі进一步 мінімізувати кількість доопрацювання, необхідного для збереження якомога більше попередньої інформації Stable Diffusion.
Робота або архітектура framework Zero123++ можна进一步 розділити на послідовні кроки або фази. Перша фаза свідчить про те, що framework доопрацьовує матриці KV шарів跨-уваги та шарів самої уваги Stable Diffusion з оптимізатором AdamW, 1000 кроків розігріву та косинусним графіком навчання, який максимізується при 7×10-5. На другій фазі framework використовує дуже консервативний постійний графік навчання з 2000 кроками розігріву та використовує підхід Min-SNR для максимізації ефективності під час навчання.
Zero123++: Результати та порівняння продуктивності
Якість виконання
Для оцінки продуктивності framework Zero123++ на основі якості згенерованих зображень його порівнюють з SyncDreamer та Zero-1-to-3-XL, двома з найкращих framework сучасного стану для генерації вмісту. Framework порівнюються з чотирма входовими зображеннями з різним обсягом. Перше зображення – це іграшковий котик, взятий безпосередньо з набору даних Objaverse, і має велику невизначеність на задньому кінці об’єкта. Друге зображення – це вогнегасник, а третє – зображення собаки, яка сидить на ракеті, згенероване моделлю SDXL. Останнє зображення – це ілюстрація аніме. Необхідні кроки висоти для framework досягаються за допомогою методу оцінки висоти framework One-2-3-4-5, а видалення фону здійснюється за допомогою framework SAM. Як можна побачити, framework Zero123++ генерує високоякісні багатомірні зображення узгоджено та здатний узагальнювати до поза-доменних 2D-ілюстрацій та зображень, згенерованих AI, однаково добре.


Кількісний аналіз
Для кількісного порівняння framework Zero123++ з сучасним станом framework Zero-1-to-3 та Zero-1-to-3 XL розробники оцінюють оцінку схожості зображень, отриману моделлю LPIPS, цих моделей на валідаційному розрізі даних, підмножині набору даних Objaverse. Для оцінки продуктивності моделі при генерації багатомірних зображень розробники укладають референс-зображення та 6 згенерованих зображень відповідно, а потім обчислюють оцінку схожості зображень, отриману моделлю LPIPS. Результати демонструються нижче, і як можна побачити, framework Zero123++ досягає кращої продуктивності на валідаційному розрізі.

Оцінка тексту до багатомірного зображення
Для оцінки можливостей framework Zero123++ при генерації багатомірного вмісту розробники спочатку використовують framework SDXL з текстовими запиту для генерації зображення, а потім використовують framework Zero123++ для згенерованого зображення. Результати демонструються на наступному зображенні, і як можна побачити, у порівнянні з framework Zero-1-to-3, який не може гарантувати узгоджену генерацію багатомірних зображень, framework Zero123++ повертає узгоджені, реалістичні та високодеталізовані багатомірні зображення, реалізуючи підхід текст-до-зображення-до-багатомірного.

Zero123++ Depth ControlNet
Крім базового framework Zero123++, розробники також випустили Depth ControlNet Zero123++, глибинно-контрольовану версію оригінального framework, побудовану за допомогою архітектури ControlNet. Нормалізовані лінійні зображення відображаються у відповідності з наступними RGB-зображеннями, а framework ControlNet навчається контролювати геометрію framework Zero123++ за допомогою глибинної перцепції.

Висновок
У цій статті ми розглянули framework Zero123++, який є моделлю генерації AI, умовною на зображенні, з метою генерації 3D-узгодженого багатомірного зображення за допомогою одного виду входу. Для максимального використання переваг попередньо натренованих моделей генерації, framework Zero123++ реалізує різні схеми навчання та умовлення, щоб мінімізувати кількість зусиль, необхідних для доопрацювання моделей дифузії зображень з коробки. Ми також розглянули різні підходи та покращення, реалізовані framework Zero123++, які допомагають йому досягти результатів, порівнянних з результатами сучасного стану, та навіть перевершити їх.
Однак, незважаючи на свою ефективність та здатність генерувати високоякісні багатомірні зображення узгоджено, framework Zero123++ все ще має певний потенціал для покращення, з можливими областями дослідження, такими як двостадійна модель рафінера, яка може вирішити нездатність framework Zero123++ задовольняти глобальним вимогам узгодженості. Додаткові масштабування для подальшого покращення можливостей framework Zero123++ щодо генерації зображень ще вищої якості.
- Двостадійна модель рафінера яка може вирішити нездатність framework Zero123++ задовольняти глобальним вимогам узгодженості.
- Додаткові масштабування для подальшого покращення можливостей framework Zero123++ щодо генерації зображень ще вищої якості.












