Моделі та платформи ШІ
Самоуваження керівництва: покращення якості зразків дифузійних моделей
Деноізуючі дифузійні моделі – це генеративні кадри штучного інтелекту, які синтезують зображення із шуму шляхом ітеративного процесу деноізування. Вони відомі своїми винятковими можливостями генерації зображень та різноманітністю, яку можна пояснити текстовими чи класовими умовними методами керівництва, включаючи керівництво класифікатором та керівництво без класифікатора. Ці моделі були досить успішними у створенні різноманітних високоякісних зображень. Останні дослідження показали, що методи керівництва, такі як класові підписи та мітки, відіграють важливу роль у покращенні якості зображень, які ці моделі генерують.
Однак дифузійні моделі та методи керівництва мають обмеження під певними зовнішніми умовами. Метод керівництва без класифікатора (CFG), який використовує викидання міток, додає складності до процесу навчання, тоді як метод керівництва класифікатором (CG) потребує додаткового навчання класифікатора. Обидва методи є певною мірою обмеженими своєю залежністю від зовнішніх умов, що обмежує їхній потенціал і обмежує їх умовними умовами.
Щоб подолати ці обмеження, розробники створили більш загальний підхід до керівництва дифузією, відомий як Самоуваження керівництва (SAG). Цей метод використовує інформацію з проміжних зразків дифузійних моделей для генерації зображень. У цій статті ми розглянемо SAG, обговоримо його роботу, методологію та результати порівняно з поточними рамками та трубопроводами.
Самоуваження керівництва: покращення якості зразків дифузійних моделей
Деноізуючі дифузійні моделі (DDM) здобули популярність завдяки своїй здатності створювати зображення із шуму шляхом ітеративного процесу деноізування. Можливості синтезу зображень цих моделей значною мірою пояснюються методами керівництва дифузії. Незважаючи на свої сильні сторони, дифузійні моделі та методи керівництва зазнають таких проблем, як додана складність та підвищені обчислювальні витрати.
Щоб подолати поточні обмеження, розробники ввели метод Самоуваження керівництва, більш загальний підхід до керівництва дифузією, який не залежить від зовнішньої інформації з керівництва дифузії, тим самим забезпечуючи умовно-вільний та гнучкий підхід до керівництва дифузійними рамками. Підхід, обраний Самоуваженням керівництва, в кінцевому підсумі допомагає покращити застосовність традиційних методів керівництва дифузії до випадків з або без зовнішніх вимог.
Самоуваження керівництва засноване на простому принципі загального формулювання, а також припущенні, що внутрішня інформація, що міститься в проміжних зразках, також може служити керівництвом. На основі цього принципу метод SAG спочатку вводить Розмиття керівництва, просте та прямолінійне рішення для покращення якості зразків. Розмиття керівництва спрямоване на використання доброзичливих властивостей гауссовського розмиття для видалення дрібномасштабних деталей природним чином шляхом керівництва проміжними зразками за допомогою видаленої інформації в результаті гауссовського розмиття. Хоча метод розмиття керівництва дійсно підвищує якість зразків з помірним масштабом керівництва, він не може повторити результати на великому масштабі керівництва, оскільки часто вводить структуровану двозначність у цілому регіоні. Як наслідок, метод розмиття керівництва має труднощі з вирівнюванням оригінального входу з прогнозом погіршеного входу.
Щоб підвищити стабільність та ефективність методу розмиття керівництва на великому масштабі керівництва, Самоуваження керівництва намагається використовувати механізм самоуваження дифузійних моделей, оскільки сучасні дифузійні моделі вже містять механізм самоуваження в своїй архітектурі.
Припускаючи, що самоуваження є важливим для захоплення важливої інформації в своєму ядрі, метод Самоуваження керівництва використовує карти самоуваження дифузійних моделей для вороже розмиття регіонів, що містять важливу інформацію, і тим самим керує дифузійними моделями з необхідною залишковою інформацією. Метод потім використовує карти уваги під час зворотного процесу дифузійних моделей, щоб підвищити якість зображень і використовувати самообумовлення для зменшення артефактів без потреби додаткового навчання або зовнішньої інформації.

Підводячи підсумок, метод Самоуваження керівництва
- Є новим підходом, який використовує внутрішні карти самоуваження дифузійних рамок для покращення якості згенерованих зображень без потреби додаткового навчання або залежності від зовнішніх умов.
- Метод SAG намагається узагальнити умовні методи керівництва в умовно-вільний метод, який можна інтегрувати з будь-якою дифузійною моделлю без потреби додаткових ресурсів або зовнішніх умов, тим самим підвищуючи застосовність керівництва-орієнтованих рамок.
- Метод SAG також намагається продемонструвати свої ортогональні можливості щодо існуючих умовних методів та рамок, тим самим забезпечуючи підвищення продуктивності шляхом гнучкої інтеграції з іншими методами та моделями.
Переходячи далі, метод Самоуваження керівництва вивчає результати пов’язаних рамок, включаючи Деноізуючі дифузійні моделі, керівництво зразками, методи самоуваження штучного інтелекту та внутрішні представлення дифузійних моделей. Однак у своєму ядрі метод Самоуваження керівництва реалізує результати з DDPM або Деноізуючих дифузійних моделей, керівництва класифікатором, керівництва без класифікатора та самоуваження в дифузійних рамках. Про це ми поговоримо докладніше в наступному розділі.
Самоуваження керівництва: попередні відомості, методологія та архітектура
Деноізуюча дифузійна ймовірнісна модель або DDPM
DDPM або Деноізуюча дифузійна ймовірнісна модель – це модель, яка використовує ітеративний процес деноізування для відновлення зображення з білого шуму. Традиційно модель DDPM отримує вхідне зображення та графік дисперсії на певному етапі часу для отримання зображення за допомогою прямого процесу, відомого як Марковський процес.
Керівництво класифікатором та керівництво без класифікатора з реалізацією GAN
GAN або Генеративні адверсарні мережі володіють унікальною можливістю торгівлі різноманітністю за вірогідністю, і щоб привнести цю можливість GAN-рамок до дифузійних моделей, рамка Самоуваження керівництва пропонує використовувати метод керівництва класифікатором, який використовує додатковий класифікатор. Навпаки, метод керівництва без класифікатора можна реалізувати без використання додаткового класифікатора для досягнення тих самих результатів. Хоча метод дає бажані результати, він ще не є обчислювально життєздатним, оскільки потребує додаткових міток, і також обмежує рамку умовними дифузійними моделями, які потребують додаткових умов, таких як текст або клас, разом з додатковими деталями навчання, що додає складності моделі.
Узагальнення керівництва дифузії
Хоча методи керівництва класифікатором та керівництва без класифікатора дають бажані результати та допомагають у умовній генерації дифузійних моделей, вони залежать від додаткових входів. Для будь-якого заданого часу кроку вхід для дифузійної моделі складається з узагальненої умови та порушеного зразка без узагальненої умови. Крім того, узагальнена умова охоплює внутрішню інформацію в порушеному зразку або зовнішню умову, або навіть обидва. Результатом керівництва є формулювання з використанням уявного регресора з припущенням, що воно може передбачити узагальнену умову.
Покращення якості зображень за допомогою карт самоуваження
Узагальнене керівництво дифузії припускає, що можна надати керівництво зворотному процесу дифузійних моделей шляхом виділення важливої інформації в узагальнених умовах, що містяться в порушеному зразку. Будуючи на цьому, метод Самоуваження керівництва ефективно захоплює важливу інформацію для зворотних процесів, обмежуючи ризики, які виникають внаслідок проблем з розподілом у попередньо натренованих дифузійних моделях.
Розмиття керівництва
Розмиття керівництва в Самоуваженні керівництва засноване на гауссовому розмитті, лінійному методі фільтрації, при якому вхідний сигнал згортається з гауссовим фільтром для генерації виходу. При збільшенні стандартного відхилення гауссове розмиття зменшує дрібномасштабні деталі вхідних сигналів та призводить до локально нерозрізняльних вхідних сигналів шляхом їх згладжування до сталого значення. Крім того, експерименти показали інформаційний дисбаланс між вхідним сигналом та виходом гауссового розмиття, де виходовий сигнал містить більше дрібномасштабної інформації.
На основі цього знання рамка Самоуваження керівництва вводить Розмиття керівництва, техніку, яка свідомо виключає інформацію з проміжних реконструкцій під час процесу дифузії, і замість цього використовує цю інформацію для керівництва своїми прогнозами щодо підвищення актуальності зображень до вхідної інформації. Розмиття керівництва фактично призводить до того, що оригінальний прогноз відхиляється від розмитого входу. Крім того, доброзичлива властивість гауссового розмиття запобігає виходу сигналів відхиленням від оригінального сигналу з помірним відхиленням. Простими словами, розмиття відбувається в зображеннях природним чином, що робить гауссове розмиття більш підходящим методом для застосування до попередньо натренованих дифузійних моделей.
У трубопроводі Самоуваження керівництва вхідний сигнал спочатку розмиттяється за допомогою гауссового фільтра, а потім дифундуватися з додатковим шумом для генерації виходового сигналу. Роблячи це, трубопровід SAG пом’якшує побічний ефект результатового розмиття, яке зменшує гауссовий шум, і робить керівництво залежним від вмісту, а не від випадкового шуму. Хоча розмиття керівництва дає задовільні результати на рамках з помірним масштабом керівництва, воно не може повторити результати на існуючих моделях з великим масштабом керівництва, оскільки схильне до генерації шумових результатів, як показано на наступному зображенні.

Ці результати можуть бути результатом структурованої двозначності, введеної в рамку глобальним розмиттям, що робить складним для трубопровіду SAG вирівняти прогнози оригінального входу з прогнозом погіршеного входу, в результаті чого виходять шумові виходи.
Механізм самоуваження
Як згадувалося раніше, дифузійні моделі зазвичай мають вбудований механізм самоуваження, і це один з найважливіших компонентів дифузійної моделі. Механізм самоуваження реалізований в ядрі дифузійних моделей, і він дозволяє моделі звертати увагу на важливі частини входу під час генеративного процесу, як показано на наступному зображенні з високочастотними масками в верхньому рядку та масками самоуваження в нижньому рядку остаточно згенерованих зображень.

Запропонований метод Самоуваження керівництва будується на тому самому принципі, і використовує можливості карт самоуваження в дифузійних моделях. Загалом, метод Самоуваження керівництва розмиттяє самоуважувані патчі вхідного сигналу або, простими словами, приховує інформацію патчів, яку звертає увага дифузійна модель. Крім того, виходові сигнали в Самоуваженні керівництва містять цілісні регіони вхідних сигналів, що означає, що вони не призводять до структурованої двозначності входів, і вирішують проблему глобального розмиття. Трубопровід потім отримує агреговані карти самоуваження шляхом проведення Глобального середнього пулінгу для агрегації карт самоуваження до розміру, і найближчого сусіда для підйому до роздільної здатності вхідного сигналу.
Самоуваження керівництва: експерименти та результати
Щоб оцінити свою продуктивність, трубопровід Самоуваження керівництва зразкується за допомогою 8 графічних процесорів Nvidia GeForce RTX 3090, і побудований на попередньо натренованих рамках IDDPM, ADM та Стабільної дифузії.
Безумовна генерація з Самоуваженням керівництва
Щоб виміряти ефективність трубопроводу SAG на безумовних моделях та продемонструвати умовно-вільну властивість, яку не володіють керівництво класифікатором та керівництво без класифікатора, трубопровід SAG запускається на безумовно попередньо натренованих рамках на 50 тисяч зразків.

Як можна спостерігати, реалізація трубопроводу SAG покращує метрики FID, sFID та IS безумовного входу, одночасно знижуючи значення відкликання. Крім того, якісні покращення в результаті реалізації трубопроводу SAG є очевидними на наступних зображеннях, де зображення зверху є результатами з рамок ADM та Стабільної дифузії, тоді як зображення знизу є результатами з рамок ADM та Стабільної дифузії з трубопроводом SAG.


Умовна генерація з SAG
Інтеграція трубопроводу SAG в існуючі рамки дає виняткові результати в безумовній генерації, і трубопровід SAG здатний до умовної агностики, що дозволяє трубопроводу SAG бути реалізованим для умовної генерації.
Стабільна дифузія з Самоуваженням керівництва
Хоча оригінальна рамка Стабільної дифузії генерує високоякісні зображення, інтеграція рамки Стабільної дифузії з трубопроводом Самоуваження керівництва може суттєво покращити результати. Щоб оцінити її вплив, розробники використовують порожні промпти для Стабільної дифузії з випадковим насінням для кожного зображення пари, і використовують оцінку людини на 500 пар зображень з та без Самоуваження керівництва. Результати показані на наступному зображенні.

Крім того, реалізація SAG може підвищити можливості рамки Стабільної дифузії, оскільки злиття керівництва без класифікатора з Самоуваженням керівництва може розширити діапазон моделей Стабільної дифузії до синтезу зображень з тексту. Крім того, згенеровані зображення з моделі Стабільної дифузії з Самоуваженням керівництва мають вищу якість з меншою кількістю артефактів завдяки самообумовному ефекту трубопроводу SAG, як показано на наступному зображенні.

Поточні обмеження
Хоча реалізація трубопроводу Самоуваження керівництва може суттєво покращити якість згенерованих зображень, вона має певні обмеження.
Одним з основних обмежень є ортогональність з керівництвом класифікатором та керівництвом без класифікатора. Як можна спостерігати на наступному зображенні, реалізація SAG покращує метрику FID та прогнозну оцінку, що означає, що трубопровід SAG містить ортогональний компонент, який можна використовувати з традиційними методами керівництва одночасно.

Однак це все ще вимагає, щоб дифузійні моделі були натреновані певним чином, що додає складності, а також обчислювальних витрат.
Крім того, реалізація Самоуваження керівництва не збільшує витрати на пам’ять або час, що вказує на те, що накладні витрати, що виникають внаслідок операцій, таких як маскування та розмиття в SAG, є незначними. Однак це все ще додає до обчислювальних витрат, оскільки включає додатковий крок порівняно з підходами без керівництва.

Остатні думки
У цій статті ми говорили про Самоуваження керівництва, новий та загальний підхід до методу керівництва, який використовує внутрішню інформацію, доступну в дифузійних моделях, для генерації високоякісних зображень. Самоуваження керівництва засноване на простому принципі загального формулювання, а також припущенні, що внутрішня інформація, що міститься в проміжних зразках, також може служити керівництвом. Трубопровід Самоуваження керівництва – це умовно-вільний та безтренувальний підхід, який можна реалізувати в різних дифузійних моделях, і який використовує самообумовлення для зменшення артефактів у згенерованих зображеннях та підвищення загальної якості.












