Моделі та платформи ШІ

Концептуальні Слайдери: Точний Контроль у Дифузійних Моделях з Адаптерами LoRA

mm
Додайте Unite.AI до бажаних джерел у Google

Дякую їхнім можливостям, текстово-зображенні дифузійні моделі стали дуже популярними в художньому співтоваристві. Однак поточні моделі, включаючи найкращі.frameworks, часто мають труднощі з підтриманням контролю над візуальними концепціями та атрибутами в згенерованих зображеннях, що призводить до незадовільних результатів. Більшість моделей покладаються лише на текстові підказки, що створює труднощі при модулюванні безперервних атрибутів, таких як інтенсивність погоди, різкість тіней, вирази обличчя чи вік людини. Це робить важким для кінцевих користувачів регулювання зображень для задоволення їхніх конкретних потреб. Крім того, хоча ці генеративні.frameworks створюють високоякісні та реалістичні зображення, вони схильні до спотворень, таких як викривлені обличчя чи відсутні пальці.

Щоб подолати ці обмеження, розробники запропонували використання інтерпретовних Концептуальних Слайдерів. Ці слайдери обіцяють більший контроль для кінцевих користувачів над візуальними атрибутами, покращуючи генерацію та редагування зображень у дифузійних моделях. Концептуальні Слайдери в дифузійних моделях працюють шляхом визначення напрямку параметра, відповідного окремій концепції, при одночасному мінімумі інтерференції з іншими атрибутами. Фреймворк створює ці слайдери за допомогою зразкових зображень або набору підказок, тим самим встановлюючи напрямки для текстових та візуальних концепцій.

У кінцевому підсумку, використання Концептуальних Слайдерів у текстово-зображенні дифузійних моделях може привести до генерації зображень з мінімальним рівнем інтерференції та підвищеним контролем над кінцевим результатом, а також збільшенням сприйманої реальності без зміни змісту зображень, тим самим генеруючи реалістичні зображення. У цій статті ми будемо обговорювати концепцію використання Концептуальних Слайдерів у текстово-зображенні фреймворках більш детально та аналізувати, як їхнє використання може привести до генерації зображень вищої якості.

Введення у Концептуальні Слайдери

Як згадувалося раніше, поточні текстово-зображенні дифузійні фреймворки часто мають труднощі з підтриманням контролю над візуальними концепціями та атрибутами в згенерованих зображеннях, що призводить до незадовільних результатів. Крім того, багато з цих моделей мають труднощі з модулюванням безперервних атрибутів, що ще більше призводить до незадовільних результатів. Концептуальні Слайдери можуть допомогти подолати ці проблеми, надавши творцям контенту та кінцевим користувачам підвищений контроль над процесом генерації зображень та вирішуючи проблеми, з якими стикаються поточні фреймворки.

Більшість поточних текстово-зображенні дифузійних моделей покладаються на прямий текстовий підказку для контролю атрибутів зображень. Хоча цей підхід дозволяє генерацію зображень, він не є оптимальним, оскільки зміна підказки може суттєво змінити структуру зображення. Інший підхід, використовуваний цими фреймворками, включає пост-хок-техніки, які інвертують процес дифузії та змінюють крос-аттенції для редагування візуальних концепцій. Однак пост-хок-техніки мають обмеження, підтримуючи лише обмежену кількість одночасних редагувань та вимагаючи індивідуальної інтерференції для кожного нового концепту. Крім того, вони можуть вводити концептуальну заплутаність, якщо не інженерно розроблені.

Натомість Концептуальні Слайдери пропонують більш ефективне рішення для генерації зображень. Ці легкі, легкі в користуванні адаптери можуть бути застосовані до попередньо навчених моделей, підвищуючи контроль та точність над бажаними концепціями в одному проході інтерференції з мінімальною заплутаністю. Концептуальні Слайдери також дозволяють редагування візуальних концепцій, які не покриваються текстовими описами, особливість, яка відрізняє їх від методів редагування на основі текстових підказок. Хоча методи на основі зображень можуть ефективно додавати токени для концепцій, заснованих на зображеннях, вони важко реалізуються для редагування зображень. Концептуальні Слайдери, з іншого боку, дозволяють кінцевим користувачам надавати невелику кількість парних зображень, що визначають бажану концепцію. Слайдери потім узагальнюють цю концепцію та автоматично застосовують її до інших зображень, спрямовуючи на підвищення реалізму та виправлення спотворень, таких як руки.

Концептуальні Слайдери спрямовані на вивчення та вирішення проблем, спільних для чотирьох генеративних моделей AI та дифузійних фреймворків: редагування зображень, методів на основі керівництва, редагування моделей та семантичних напрямків.

Редагування зображень

Поточні фреймворки AI або фокусуються на використанні умовного вводу для керівництва структурою зображення, або маніпулюють крос-аттенціями джерельного зображення з його цільовим підказкою для здійснення редагування одного зображення в текстово-зображенні дифузійних фреймворках. В результаті ці підходи можуть бути реалізовані лише для окремих зображень і вони також вимагають оптимізації латентної основи для кожного зображення внаслідок еволюції геометричної структури за часом через підказки.

Методи на основі керівництва

Використання методів керівництва на основі класифікаторів показало їхню здатність підвищити якість згенерованих зображень та покращити текстово-зображення співставлення. Включаючи терміни керівництва під час інтерференції, метод покращує обмежену композиційність, успадковану дифузійними фреймворками, і вони можуть бути використані для керівництва через небезпечні концепції в дифузійних фреймворках.

Редагування моделей

Використання Концептуальних Слайдерів також можна розглядати як техніку редагування моделі, яка використовує низькоранговий адаптер для виводу одного семантичного атрибуту, який робить місце для безперервного контролю, який відповідає атрибуту. Методи налаштування на основі тонкої настройки потім використовуються для персоналізації фреймворку для додавання нових концепцій. Крім того, техніка Custom Diffusion пропонує спосіб тонкої настройки шарів крос-аттенції для включення нових візуальних концепцій у попередньо навчені дифузійні моделі. Навпаки, техніка Textual Diffusion пропонує оптимізувати вектор вкладення для активації можливостей моделі та введення текстових концепцій у фреймворк.

Семантичні напрямки в GAN

Маніпуляція семантичними атрибутами є однією з ключових особливостей Генеративних Адверсарних Мереж (GAN) з латентними просторовими траєкторіями, знайденими в самоконтрольованому порядку. У дифузійних фреймворках ці латентні просторові траєкторії існують у середніх шарах архітектури U-Net, і головний напрям латентних просторів у дифузійних фреймворках захоплює глобальну семантику. Концептуальні Слайдери тренують низькорангові підпростори, відповідні спеціальним атрибутам, безпосередньо, і отримують точні та локалізовані напрямки редагування за допомогою текстових або зображень пар для оптимізації глобальних напрямів.

Концептуальні Слайдери: Архітектура та Робота

Дифузійні моделі та LoRA або Низькорангові Адаптери

Дифузійні моделі є суттєво підкласом генеративних моделей AI, які працюють на принципі синтезу даних шляхом інверсії процесу дифузії. Процес прямої дифузії спочатку додає шум до даних, тим самим перехід від організованого стану до повного гауссовського шуму. Основна мета дифузійних моделей полягає у тому, щоб інверсувати процес дифузії шляхом поступового видалення шуму та вибіркового випадкового гауссовського шуму для генерації зображення. У реальних застосуваннях основною метою дифузійних фреймворків є передбачення справжнього шуму, коли повний гауссовський шум подається на вході з додатковими входами, такими як умовність та крок часу.

Техніка LoRA або Низькорангових Адаптерів розкладає оновлення ваг під час тонкої настройки для забезпечення ефективної адаптації великих попередньо навчених фреймворків для завдань нижнього рівня. Техніка LoRA розкладає оновлення ваг для попередньо навченого шару моделі щодо як входу, так і виходу розмірів, і обмежує оновлення низьковимірним підпростором.

Концептуальні Слайдери

Основною метою Концептуальних Слайдерів є служити підходом до тонкої настройки адаптерів LoRA у дифузійному фреймворку для забезпечення більшого ступеня контролю над концепціями-орієнтованими зображеннями, і це демонструється на наступному зображенні.

Коли умовно націлені на цільові концепції, Концептуальні Слайдери вивчають низькорангові напрямки параметрів для збільшення або зменшення виразу конкретних атрибутів. Для моделі та її цільової концепції основною метою Концептуальних Слайдерів є отримання покращеної моделі, яка змінює ймовірність збільшення та пригнічення атрибутів для зображення при умові на цільову концепцію для збільшення ймовірності збільшення атрибутів та зменшення ймовірності пригнічення атрибутів. Використовуючи репараметризацію та формулу Твіді, фреймворк вводить часозмінний процес шуму та виражає кожен бал як передбачення денойзингу. Крім того, об’єктна мета тонкої настройки модулів у Концептуальних Слайдерах при збереженні попередньо навчених ваг постійними, і коефіцієнт масштабування, введений під час формулювання LoRA, змінюється під час інтерференції. Коефіцієнт масштабування також дозволяє регулювати сили редагування та робить редагування сильнішими без перенастройки фреймворку, як це показано на наступному зображенні.

Методи редагування, використовувані раніше фреймворками, забезпечували сильніше редагування шляхом перенастройки фреймворку з підвищеним керівництвом. Однак масштабування коефіцієнта масштабування під час інтерференції дає ті самі результати редагування без збільшення витрат на перенастройку та часу.

Вивчення Візуальних Концепцій

Концептуальні Слайдери розроблені для контролю візуальних концепцій, які текстові підказки не можуть визначити добре, і ці слайдери використовують невеликі набори даних, які є або парними до, або після навчання на цих концепціях. Контраст між парами зображень дозволяє слайдерам вивчати візуальні концепції. Крім того, процес навчання Концептуальних Слайдерів оптимізує компонент LoRA, реалізований у обох напрямках. В результаті компонент LoRA відповідає напрямку, який викликає візуальні ефекти в обох напрямках.

Концептуальні Слайдери: Результати Реалізації

Щоб проаналізувати підвищення продуктивності, розробники оцінили використання Концептуальних Слайдерів в основному на Stable Diffusion XL, високорозширений фреймворк з додатковими експериментами, проведеними на фреймворку Stable Diffusion v1.4 з моделями, навченими протягом 500 епох.

Текстові Концептуальні Слайдери

Щоб оцінити продуктивність текстових Концептуальних Слайдерів, їх було перевірено на наборі з 30 текстових концепцій, і метод було порівняно з двома базовими методами, які використовують стандартну текстову підказку для фіксованої кількості кроків часу, а потім починають композицію додаванням підказок для керування зображенням. Як можна побачити на наступному зображенні, використання Концептуальних Слайдерів призводить до постійного підвищення оцінки CLIP та постійного зниження оцінки LPIPS у порівнянні з оригінальним фреймворком без Концептуальних Слайдерів.

Як можна побачити на вищезазначеному зображенні, використання Концептуальних Слайдерів забезпечує точне редагування атрибутів, бажаних під час процесу генерації зображень, при збереженні загальної структури зображення.

Візуальні Концептуальні Слайдери

Текстово-зображенні дифузійні моделі, які використовують лише текстові підказки, часто мають труднощі з підтриманням вищого ступеня контролю над візуальними атрибутами, такими як волосся на обличчі чи форма очей. Щоб забезпечити кращий контроль над дрібними атрибутами, Концептуальні Слайдери використовують необов’язкові текстові підказки, парні з наборами зображень. Як можна побачити на наступному зображенні, Концептуальні Слайдери створюють окремі слайдери для “розміру очей” та “форми брів”, які захоплюють бажані перетворення за допомогою пар зображень.

Результати можна подальше уточнити, надаючи конкретні тексти, щоб напрямок фокусувався на цій області обличчя, і створюючи слайдери з кроковим контролем над націленою атрибутом.

Композиція Слайдерів

Однією з основних переваг використання Концептуальних Слайдерів є їхня здатність до композиції, яка дозволяє користувачам комбінувати кілька слайдерів для підвищення ступеня контролю, а не фокусуватися на одній концепції одночасно, що можна пояснити низькоранговими напрямами слайдерів, використовуваними в Концептуальних Слайдерах. Крім того, оскільки Концептуальні Слайдери є легкими адаптерами LoRA, вони легко передаються та можуть бути легко накладені на дифузійні моделі. Користувачі також можуть регулювати кілька кнопок одночасно для керування складними генераціями, завантажуючи цікаві набори слайдерів.

Наступне зображення демонструє можливості композиції концептуальних слайдерів, і кілька слайдерів складаються поступово в кожному рядку зліва направо, тим самим забезпечуючи перехід через високовимірні концептуальні простори з підвищеним ступенем контролю над концепціями.

Покращення Якості Зображень

Хоча найкращі текстово-зображенні дифузійні фреймворки та великомасштабні генеративні моделі, такі як модель Stable Diffusion XL, здатні генерувати реалістичні та високоякісні зображення, вони часто страждають від спотворень зображень, таких як розмиті або викривлені об’єкти, навіть якщо параметри цих найкращих фреймворків оснащені латентною здатністю генерувати високоякісний вивід з меншою кількістю генерацій. Використання Концептуальних Слайдерів може привести до генерації зображень з меншою кількістю спотворень шляхом розблокування справжніх можливостей цих моделей шляхом визначення низькорангових напрямів параметрів.

Виправлення Рук

Генерація зображень з реалістично виглядними руками завжди була перешкодою для дифузійних фреймворків, і використання Концептуальних Слайдерів має прямий контроль над тенденцією до спотворення рук. Наступне зображення демонструє ефект використання Концептуальних Слайдерів “виправлення рук”, який дозволяє фреймворку генерувати зображення з більш реалістично виглядними руками.

Слайдери Виправлення

Використання Концептуальних Слайдерів не тільки може привести до генерації більш реалістично виглядних рук, але також показало свій потенціал у покращенні загальної реальності згенерованих зображень. Концептуальні Слайдери також визначають один низькоранговий напрям параметра, який дозволяє зрушення зображень від звичайних проблем зі спотвореннями, і результати демонструються на наступному зображенні.

Фінальні Думки

У цій статті ми говорили про Концептуальні Слайдери, просту, але масштабовану нову парадигму, яка забезпечує інтерпретовний контроль над згенерованим виводом у дифузійних моделях. Використання Концептуальних Слайдерів спрямоване на вирішення проблем, з якими стикаються поточні текстово-зображенні дифузійні фреймворки, які мають труднощі з підтриманням необхідного контролю над візуальними концепціями та атрибутами, включеними у згенероване зображення, що часто призводить до незадовільних результатів. Крім того, більшість текстово-зображенні дифузійних моделей мають труднощі з модулюванням безперервних атрибутів, що часто призводить до незадовільних результатів. Використання Концептуальних Слайдерів може дозволити текстово-зображеним дифузійним фреймворкам подолати ці проблеми та надати творцям контенту та кінцевим користувачам підвищений ступінь контролю над процесом генерації зображень та вирішити проблеми, з якими стикаються поточні фреймворки.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.