Моделі та платформи ШІ

DreamCraft3D: Ієрархічне покоління 3D з допомогою бутстрепованого дифузійного апріору

mm
Додайте Unite.AI до бажаних джерел у Google

Моделі генерації штучного інтелекту були предметом обговорення в галузі штучного інтелекту протягом деякого часу. Недавній успіх 2D-моделей генерації відкрив шлях для методів створення візуального контенту, які ми використовуємо сьогодні. Хоча спільнота штучного інтелекту досягла видатних успіхів у 2D-моделях генерації, генерація 3D-контенту залишається великою проблемою для глибоких фреймворків генерації штучного інтелекту. Це особливо вірно, оскільки попит на 3D-контент досягнув свого піку, підштовхнутий широким спектром візуальних ігор, застосунків, віртуальної реальності та навіть кіно. Варто зазначити, що хоча існують 3D-фреймворки генерації штучного інтелекту, які дають прийнятні результати для певних категорій і завдань, вони не можуть ефективно генерувати 3D-об’єкти. Це недоліки можна пояснити відсутністю великої кількості даних для навчання цих фреймворків. Недавно розробники запропонували використовувати керівництво, надане попередньо натренованими моделями генерації тексту в зображення, підхід, який показав перспективні результати.

У цій статті ми обговоримо фреймворк DreamCraft3D, ієрархічну модель для генерації 3D-контенту, яка виробляє сполучні та високоякісні 3D-об’єкти. Фреймворк DreamCraft3D використовує 2D-відповідний зображення для керування стадією скульптури геометрії, підвищуючи текстуру з акцентом на вирішенні проблем узгодженості, з якими зіштовуються поточні фреймворки або методи. Крім того, фреймворк DreamCraft3D використовує модель дифузії, залежну від виду, для дистиляції балів, що сприяє скульптуванню геометрії, яка сприяє сполучному рендерингу.

Ми детальніше розглянемо фреймворк DreamCraft3D для генерації 3D-контенту. Крім того, ми дослідимо концепцію використання попередньо натренованих моделей генерації тексту в зображення для генерації 3D-контенту та розглянемо, як фреймворк DreamCraft3D намагається використовувати цей підхід для генерації реалістичного 3D-контенту.

DreamCraft3D: Вступ

DreamCraft3D – це ієрархічний трубопровід для генерації 3D-контенту. Фреймворк DreamCraft3D намагається використовувати фреймворк генерації тексту в зображення останньої генерації для створення високоякісних 2D-зображень за допомогою текстового запиту. Цей підхід дозволяє фреймворку DreamCraft3D максимально використовувати можливості моделей дифузії останньої генерації для представлення візуальної семантики, описаної в текстовому запиті, зберігаючи при цьому творчу свободу, надану цими 2D-фреймворками генерації штучного інтелекту. Зображення, згенероване потім, піднімається до 3D за допомогою каскадного геометричного текстурного підвищення та фаз скульптури геометрії, і спеціалізовані техніки застосовуються на кожній стадії з допомогою розкладання проблеми.

Для геометрії фреймворк DreamCraft3D сильно фокусується на глобальній 3D-структурі та багатовидовій узгодженості, роблячи місце для компромісів щодо детальної текстури в зображеннях. Як тільки фреймворк позбувся проблем, пов’язаних з геометрією, він зосереджується на оптимізації сполучних та реалістичних текстур шляхом реалізації 3D-обізнаного дифузійного процесу, який бутстрепує підхід оптимізації 3D. Є два ключових фактори проектування для двох фаз оптимізації, а саме скульптури геометрії та підвищення текстури.

З усього вищезазначеного можна безпечно описати DreamCraft3D як фреймворк генерації штучного інтелекту, який використовує ієрархічний трубопровід генерації 3D-контенту для перетворення 2D-зображень у їхні 3D-аналоги, зберігаючи при цьому цілісну 3D-узгодженість.

Використання попередньо натренованих моделей генерації тексту в зображення

Ідея використання попередньо натренованих моделей генерації тексту в зображення для генерації 3D-контенту була вперше введена фреймворком DreamFusion у 2022 році. Фреймворк DreamFusion намагався застосувати втрату дистиляції балів для оптимізації 3D-фреймворку таким чином, щоб рендеринги у випадкових точках зору збігалися з розподілами зображень, умовними на текст, інтерпретованими ефективним фреймворком дифузії тексту в зображення. Хоча підхід DreamFusion дав прийнятні результати, були дві великі проблеми: розмитість та надсиченість. Для вирішення цих проблем недавні роботи реалізують різні стратегії оптимізації на етапі в спробі покращити втрату дистиляції 2D, що в кінцевому підсумку призводить до генерації 3D-зображень вищої якості та реалістичних.

Однак, незважаючи на недавній успіх цих фреймворків, вони не можуть дорівнювати здатності 2D-фреймворків генерації синтезувати складний контент. Крім того, ці фреймворки часто супроводжуються “проблемою Януса”, станом, при якому 3D-рендеринги, які здаються правдоподібними окремо, показують стилістичні та семантичні несумісності при розгляді в цілому.

Для вирішення проблем, з якими зіштовуються попередні роботи, фреймворк DreamCraft3D досліджує можливість використання цілісного ієрархічного трубопроводу генерації 3D-контенту та шукає натхнення в ручному художньому процесі, при якому концепція спочатку записується у 2D-ескіз, після чого художник скульптує грубу геометрію, уточнює геометричні деталі та малює високоякісні текстури. Слідуючи цьому ж підходу, фреймворк DreamCraft3D розбиває завдання генерації 3D-контенту або зображення на різні керчні етапи.

На першій стадії фреймворк DreamCraft3D розгортає геометричну скульптуру для виробництва сполучних та правдоподібних 3D-геометричних форм за допомогою 2D-зображення як посилання. Крім того, на цій стадії фреймворк не лише використовує втрату SDS для фотометричних втрат та нових видів на посилальному виді, але також вводить ряд стратегій для просування геометричної узгодженості. Фреймворк намагається використовувати Zero-1-to-3, модель перекладу зображень, залежну від точки зору, для використання посилального зображення для моделювання розподілу нових видів. Крім того, фреймворк також переходить від імпліцитного представлення поверхні до представлення сітки для грубого до тонкого геометричного уточнення.

На другій стадії фреймворк DreamCraft3D використовує підхід бутстрепованої дистиляції балів для підвищення текстур зображення, оскільки поточні моделі дифузії, залежні від виду, тренуються на обмеженій кількості 3D-даних, через що вони часто мають труднощі з досягненням рівня виконання або відтінку 2D-моделей дифузії. Завдяки цьому обмеженню фреймворк DreamCraft3D налаштовує модель дифузії відповідно до багатовидових зображень 3D-екземпляра, який оптимізується, і цей підхід допомагає фреймворку в aumento 3D-текстур при збереженні багатовидової узгодженості. Коли модель дифузії тренується на цих багатовидових рендерингах, вона забезпечує краще керівництво для оптимізації 3D-текстур, і цей підхід допомагає фреймворку DreamCraft3D досягнути величезної кількості текстурних деталей при збереженні видової узгодженості.

Як можна побачити на вищезазначених зображеннях, фреймворк DreamCraft3D здатний виробляти творчі 3D-зображення та контент з реалістичними текстурами та складними геометричними структурами. На першому зображенні показано тіло Сон Гоку, аніме-персонажа, змішаного з головою дикого кабана, тоді як друге зображення зображує бігля, одягненого в костюм детектива. Нижче наведено кілька додаткових прикладів.

DreamCraft3D: Робота та архітектура

Фреймворк DreamCraft3D намагається використовувати фреймворк генерації тексту в зображення останньої генерації для створення високоякісних 2D-зображень за допомогою текстового запиту. Цей підхід дозволяє фреймворку DreamCraft3D максимально використовувати можливості моделей дифузії останньої генерації для представлення візуальної семантики, описаної в текстовому запиті, зберігаючи при цьому творчу свободу, надану цими 2D-фреймворками генерації штучного інтелекту. Зображення, згенероване потім, піднімається до 3D за допомогою каскадного геометричного текстурного підвищення та фаз скульптури геометрії, і спеціалізовані техніки застосовуються на кожній стадії з допомогою розкладання проблеми. Нижче наведено зображення, яке коротко підсумовує роботу фреймворку DreamCraft3D.

Давайте детально розглянемо ключові фактори проектування для фаз підвищення текстури та скульптури геометрії.

Скульптура геометрії

Скульптура геометрії – це перша стадія, на якій фреймворк DreamCraft3D намагається створити 3D-модель так, щоб вона збігалася з виглядом посилального зображення на тому ж посилальному виді, зберігаючи при цьому максимальну правдоподібність навіть під різними кутами огляду. Для забезпечення максимальної правдоподібності фреймворк використовує втрату SDS для заохочення правдоподібного рендерингу зображень для кожного окремого вибраного виду, який може розпізнати попередньо натренована модель дифузії. Крім того, для ефективного використання керівництва від посилального зображення фреймворк штрафує фотометричні відмінності між посилальним та відтвореним зображенням на посилальному виді, і втрата обчислюється лише в межах переднього плану виду. Крім того, для заохочення сценарної розрідженості фреймворк також реалізує втрату маски, яка рендерить силует. Тим не менш, підтримання вигляду та семантики через задні види все ще залишається проблемою, через що фреймворк застосовує додаткові підходи для виробництва детальної та сполучної геометрії.

3D-обізнаний дифузійний апріор

Методи оптимізації 3D, які використовують лише нагляд за видом, недоопределені, що є основною причиною, через яку фреймворк DreamCraft3D використовує Zero-1-to-3, модель дифузії, залежну від виду, оскільки фреймворк Zero-1-to-3 пропонує підвищену свідомість точки зору, оскільки він був тренований на більших масштабах 3D-активів. Крім того, фреймворк Zero-1-to-3 – це уточнена модель дифузії, яка галлюцинує зображення в зв’язку з положенням камери за посилальним зображенням.

Прогресивна підготовка виду

Прямий висновок вільних видів у 360 градусах може привести до геометричних артефактів або несумісностей, таких як додаткова нога на стільці, подія, яку можна віднести до двозначності окремого посилального зображення. Для подолання цієї перешкоди фреймворк DreamCraft3D розширює тренувальні види поступово, після чого добре встановлена геометрія поступово поширюється для отримання результатів у 360 градусах.

Дифузійний часовий кроковий аннігіляційний

Фреймворк DreamCraft3D застосовує стратегію дифузійного часового крокового аннігіляційного для спроби відповідати 3D-оптимізації грубої до тонкої прогресії. На початку процесу оптимізації фреймворк надає пріоритет вибірці більшого дифузійного часового кроку, щоб забезпечити глобальну структуру. Коли фреймворк продовжує процес тренування, він лінійно аннігілює діапазон вибірки протягом сотень ітерацій. Завдяки стратегії аннігіляції фреймворк керує встановленням правдоподібної глобальної геометрії під час ранніх етапів оптимізації до уточнення структури.

Детальне структуроване підвищення

Фреймворк DreamCraft3D оптимізує імпліцитне представлення поверхні спочатку для встановлення грубої структури. Фреймворк потім використовує цей результат і поєднує його з деформованою тетраедричною сіткою або DMTet для ініціалізації текстурної 3D-сіткової моделі, яка дезентропіює навчання текстури та геометрії. Коли фреймворк закінчує структуроване підвищення, модель здатна зберегти високочастотні деталі, отримані з посилального зображення, уточнюючи текстури виключно.

Підвищення текстури за допомогою бутстрепованого вибіркового балового

Хоча стадія скульптури геометрії підкреслює навчання детальної та сполучної геометрії, вона дещо розмитить текстуру, що може бути результатом залежності фреймворку від 2D-пріорної моделі, що працює на грубому розрізі, разом з обмеженою різкістю, наданою 3D-моделлю дифузії. Крім того, загальні проблеми з текстурами, включаючи надсиченість та надгладкість, виникають унаслідок великого керівництва без класифікаторів. Фреймворк використовує втрату VSD або варіаційної дистиляції балів для підвищення реалізму текстур. Фреймворк вибирає модель стабільної дифузії під час цієї фази для отримання високорозрізних градієнтів. Крім того, фреймворк тримає тетраедричну сітку фіксованою для просування реалістичного рендерингу для оптимізації загальної структури сітки. Під час етапу навчання фреймворк DreamCraft3D не використовує фреймворк Zero-1-to-3, оскільки він має негативний вплив на якість текстур, і ці несумісні текстури можуть бути повторюваними, що призводить до дивних 3D-виводів.

Експерименти та результати

Для оцінки продуктивності фреймворку DreamCraft3D його порівнюють з поточними фреймворками останньої генерації, і аналізуються якісні та кількісні результати.

Порівняння з базовими моделями

Для оцінки продуктивності фреймворк DreamCraft3D порівнюється з 5 фреймворками останньої генерації, включаючи DreamFusion, Magic3D, ProlificDreamer, Magic123 та Make-it-3D. Тестовий бенчмарк складається з 300 вхідних зображень, які являють собою суміш реальних зображень та тих, згенерованих фреймворком стабільної дифузії. Кожне зображення в тестовому бенчмарку має текстовий запит, передбачену карту глибини та альфа-маску для переднього плану. Фреймворк отримує текстові запити для реальних зображень з фреймворку капіталізації зображень.

Якісний аналіз

Нижче наведено зображення, яке порівнює фреймворк DreamCraft3D з поточними базовими моделями, і, як можна побачити, фреймворки, які залежать від підходу тексту до 3D, часто зіштовуються з проблемами багатовидової узгодженості.

З одного боку, у вас є фреймворк ProlificDreamer, який пропонує реалістичні текстури, але він не може генерувати правдоподібний 3D-об’єкт. Фреймворки, такі як Make-it-3D, які залежать від методів зображення до 3D, можуть створювати високоякісні фронтальні види, але вони не можуть підтримувати ідеальну геометрію для зображень. Зображення, згенеровані фреймворком Magic123, пропонують краще геометричне регулювання, але вони генерують надмірно насичені та згладжені геометричні текстури та деталі. У порівнянні з цими фреймворками фреймворк DreamCraft3D, який використовує метод бутстрепованої дистиляції балів, не лише підтримує семантичну узгодженість, але також покращує загальну різноманітність уявлення.

Кількісний аналіз

У спробі згенерувати привабливі 3D-зображення, які не лише нагадують вхідне посилальне зображення, але також передають семантику з різних точок зору узгодженості, техніки, використані фреймворком DreamCraft3D, порівнюються з базовими моделями, і процес оцінки використовує чотири метрики: PSNR і LPIPS для вимірювання відтінку на посилальному виді, контекстну відстань для оцінки піксельної узгодженості та CLIP для оцінки семантичної узгодженості. Результати демонструються на наступному зображенні.

Висновок

У цій статті ми обговорили фреймворк DreamCraft3D, ієрархічний трубопровід для генерації 3D-контенту. Фреймворк DreamCraft3D намагається використовувати фреймворк генерації тексту в зображення останньої генерації для створення високоякісних 2D-зображень за допомогою текстового запиту. Цей підхід дозволяє фреймворку DreamCraft3D максимально використовувати можливості моделей дифузії останньої генерації для представлення візуальної семантики, описаної в текстовому запиті, зберігаючи при цьому творчу свободу, надану цими 2D-фреймворками генерації штучного інтелекту. Зображення, згенероване потім, піднімається до 3D за допомогою каскадного геометричного текстурного підвищення та фаз скульптури геометрії, і спеціалізовані техніки застосовуються на кожній стадії з допомогою розкладання проблеми. В результаті цього підходу фреймворк DreamCraft3D може виробляти високоякісні та сполучні 3D-активи з привабливими текстурами, які можна переглядати з кількох кутів.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.