Моделі та платформи ШІ
Візуальне Авторегресивне Моделювання: Масштабування Генерації Зображень за допомогою Наступного Масштабу Прогнозування
Поява моделей GPT, а також інших автoregresивних або великих мовних моделей відкрила нову епоху в галузі машинного навчання та штучного інтелекту. Моделі GPT та автoregresивні моделі часто демонструють загальну інтелігентність та універсальність, які вважаються значним кроком до загального штучного інтелекту (AGI), незважаючи на деякі проблеми, такі як галюцинації. Однак, дивна проблема з цими великими моделями полягає в тому, що вони використовують самонавчання стратегію, яка дозволяє моделі прогнозувати наступний токен в послідовності, просту, але ефективну стратегію. Останні роботи продемонстрували успіх цих великих автoregresивних моделей, підкреслюючи їхню узагальнюваність та масштабованість. Масштабованість – це типовий приклад існуючих законів масштабування, які дозволяють дослідникам прогнозувати продуктивність великої моделі з продуктивності менших моделей, що призводить до кращого розподілу ресурсів. З іншого боку, узагальнюваність часто доводиться стратегіями навчання, такими як нульове, одне або кілька зразків навчання, підкреслюючи здатність ненавчених, але тренованих моделей адаптуватися до різних і невидимих завдань. Разом узагальнюваність та масштабованість відкривають потенціал автoregresивних моделей для навчання на великих кількостях ненавчених даних.
Будуючи на цьому, в цій статті ми будемо говорити про Візуальне Авторегресивне Моделювання або VAR-фреймворк, новий генеративний шаблон, який переозначає автoregresивне навчання на зображеннях як грубий до детального “прогнозування наступної роздільності” або “прогнозування наступного масштабу”. Хоча простий, підхід є ефективним і дозволяє автoregresивним трансформаторам краще навчатися візуальним розподілам, та підвищує узагальнюваність. Крім того, моделі Візуального Авторегресивного Моделювання дозволяють моделям GPT-стилю автoregresивним моделям вперше перевершити дифузійні трансфери в генерації зображень. Експерименти також вказують на те, що VAR-фреймворк значно покращує автoregresивні базові моделі та перевершує фреймворк Дифузійної Трансформери (DiT) у декількох вимірах, включаючи ефективність даних, якість зображення, масштабованість та швидкість висновку. Крім того, масштабування моделей Візуального Авторегресивного Моделювання демонструє закони масштабування, подібні до тих, які спостерігаються у великих мовних моделях, та демонструє здатність до нульової генералізації завдань унизу, включаючи редагування, ін-пейнтінг та аут-пейнтінг.
Ця стаття має на меті охопити фреймворк Візуального Авторегресивного Моделювання в глибину, і ми досліджуємо механізм, методологію, архітектуру фреймворку разом з його порівнянням з фреймворками стану мистецтва. Ми також поговоримо про те, як фреймворк Візуального Авторегресивного Моделювання демонструє дві важливі властивості LLM: Закони Масштабування та нульова генералізація. Тому давайте почнемо.
Візуальне Авторегресивне Моделювання: Масштабування Генерації Зображень
Спільний шаблон серед останніх великих мовних моделей полягає у реалізації самонавчальної стратегії навчання, простої, але ефективної стратегії, яка прогнозує наступний токен в послідовності. Завдяки цьому підходу автoregresивні та великі мовні моделі сьогодні продемонстрували видатну масштабованість, а також узагальнюваність, властивості, які відкривають потенціал автoregresивних моделей для навчання на великих кількостях ненавчених даних, тим самим підсумовуючи суть Загального Штучного Інтелекту. Крім того, дослідники в галузі комп’ютерного бачення працюють паралельно над розробкою великих автoregresивних або світових моделей з метою匹чання або перевершення їхньої вражаючої масштабованість та узагальнюваність, з моделями, такими як DALL-E та VQGAN, які вже продемонстрували потенціал автoregresивних моделей у галузі генерації зображень. Ці моделі часто реалізують візуальний токенізаційний алгоритм, який представляє або наближає безперервні зображення до сітки 2D-токенів, які потім розкладаються у 1D-послідовність для автoregresивного навчання, тим самим дзеркально відображаючи послідовний процес мовного моделювання.

Однак дослідники ще не дослідили закони масштабування цих моделей, а що ще більше розчаровує, те, що продуктивність цих моделей часто відстає від дифузійних моделей на значну міру, як це продемонстровано на наступному зображенні. Пропуск у продуктивності вказує на те, що порівняно з великими мовними моделями, можливості автoregresивних моделей у комп’ютерному баченні недостатньо досліджені.

З одного боку, традиційні автoregresивні моделі вимагають визначеного порядку даних, тоді як з іншого боку, Візуальне Авторегресивне або VAR-модель переглядає спосіб порядку зображення, і це те, що відрізняє VAR від існуючих методів AR. Зазвичай люди створюють або сприймають зображення ієрархічним чином, захоплюючи глобальну структуру, а потім локальні деталі, багатошкалівий, грубий до детального підхід, який пропонує порядок зображення природно. Крім того, черпаючи натхнення з багатошкалівних дизайнів, фреймворк VAR визначає автoregresивне навчання для зображень як прогнозування наступної роздільності, а не традиційні підходи, які визначають навчання як прогнозування наступного токену. Підхід, реалізований фреймворком VAR, починається з кодування зображення у багатошкалівні токенізаційні карти. Фреймворк потім починає автoregresивний процес з 1×1 токенізаційної карти, і розширюється в роздільності поступово. На кожному етапі трансформатор прогнозує наступну вищу роздільність токенізаційної карти, умовно на всіх попередніх, методологія, яку фреймворк VAR називає моделюванням VAR.
Фреймворк VAR намагається використати архітектуру трансформатора GPT-2 для візуального автoregresивного навчання, і результати очевидні на бенчмарку ImageNet, де модель VAR значно покращує свою базову модель AR, досягнувши FID 1,80 та інцепшн-скору 356, разом з 20-кратним покращенням швидкості висновку. Що ще більш цікаво, те, що фреймворк VAR вдається перевершити продуктивність фреймворку Дифузійної Трансформери (DiT) за рахунок FID та IS-оцінок, масштабованість, швидкість висновку та ефективність даних. Крім того, модель Візуального Авторегресивного Моделювання демонструє сильні закони масштабування, подібні до тих, які спостерігаються у великих мовних моделях.
Підсумувавши, фреймворк VAR намагається зробити наступні внески.
- Він пропонує новий візуальний генеративний фреймворк, який використовує багатошкалівний автoregresивний підхід з прогнозуванням наступної роздільності, на відміну від традиційного прогнозування наступного токену, що призводить до розробки автoregresивного алгоритму для завдань комп’ютерного бачення.
- Він намагається перевірити закони масштабування для автoregresивних моделей разом з потенціалом нульової генералізації, який імітує привабливі властивості LLM.
- Він пропонує прорив у продуктивності візуальних автoregresивних моделей, дозволяючи фреймворкам GPT-стилю автoregresивним моделям вперше перевершити існуючі дифузійні моделі у завданнях синтезу зображень.
Крім того, також важливо обговорити існуючі закони масштабування, які математично описують взаємозв’язок між розмірами наборів даних, параметрами моделей, покращеннями продуктивності та обчислювальними ресурсами моделей машинного навчання. По-перше, ці закони масштабування дозволяють застосовувати продуктивність великої моделі шляхом масштабування моделі, обчислювальних витрат та розмірів даних, що економить непотрібні витрати та розподіляє бюджет навчання, надаючи принципи. По-друге, закони масштабування продемонстрували послідовне та ненасичене збільшення продуктивності. Перейшовши до принципів законів масштабування у нейронних мовних моделях, кілька LLM втілює принцип, який полягає у тому, що збільшення масштабу моделей призводить до покращення продуктивності. Нульова генералізація, з іншого боку, відноситься до здатності моделі, зокрема LLM, виконувати завдання, на яких вона не була явно тренована. У галузі комп’ютерного бачення існує інтерес до побудови нульової та контекстної здатності навчання фундаментальних моделей.
Мовні моделі залежать від алгоритмів WordPiece або підходу Byte Pair Encoding для токенізації тексту. Візуальні моделі генерації, засновані на мовних моделях, також сильно залежать від кодування 2D-зображень у 1D-токенізаційні послідовності. Ранні роботи, такі як VQVAE, продемонстрували можливість представлення зображень у вигляді дискретних токенів з помірною якістю реконструкції. Наступник VQVAE, фреймворк VQGAN, включив перцептивні та адверсивні втрати для покращення якості зображення, та використовував декодер-тільки трансформатор для генерації токенів зображення у стандартному автoregresивному порядку. Дифузійні моделі, з іншого боку, давно вважаються лідерами у візуальних синтезах завдань, завдяки їхній різноманітності та вищій якості генерації. Розробка дифузійних моделей була зосереджена на покращенні методів вибірки, архітектурних вдосконаленнях та швидшій вибірці. Латентні дифузійні моделі застосовують дифузію у латентному просторі, що покращує ефективність навчання та висновку. Моделі Дифузійної Трансформери заміняють традиційну архітектуру U-Net на трансформер-основану архітектуру, та були розгорнуті у недавніх моделях синтезу зображень чи відео, таких як SORA та Стабільна Дифузія.
Візуальне Авторегресивне Моделювання: Методологія та Архітектура

У своєму ядрі фреймворк VAR має дві окремі стадії навчання. На першій стадії багатошкалівний кільцевий автоенкодер або VQVAE кодує зображення у токенізаційні карти, та реалізує складену реконструктивну втрату для цілей навчання. У вищезазначеному зображенні, вкладення – це слово, яке використовується для визначення перетворення дискретних токенів у безперервні вкладення-вектори. На другій стадії трансформатор у моделі VAR тренується шляхом мінімізації крос-ентропійної втрати або шляхом максимізації ймовірності за допомогою підходу прогнозування наступної роздільності. Навчений VQVAE потім генерує токенізаційну карту для фреймворку VAR.
Авторегресивне Моделювання за допомогою Прогнозування Наступного Токену
Для заданої послідовності дискретних токенів, де кожен токен є цілим числом з словника розміру V, автoregresивна модель наступного токену припускає, що ймовірність спостереження поточного токену залежить тільки від його префіксу. Припускаючи уніді렉ціональну залежність токенів дозволяє фреймворку VAR розбити ймовірність послідовності на добуток умовних ймовірностей. Навчання автoregresивної моделі включає оптимізацію моделі по відношенню до набору даних, та цей процес оптимізації відомий як прогнозування наступного токену, та дозволяє тренованій моделі генерувати нові послідовності. Крім того, зображення є 2D-неперервними сигналами за спадщиною, та застосування автoregresивного підходу до зображень за допомогою процесу прогнозування наступного токену має кілька передумов. По-перше, зображення потрібно токенізувати у кілька дискретних токенів. Зазвичай реалізується кільцевий автоенкодер для перетворення карти особливостей зображення у дискретні токени. По-друге, потрібно визначити 1D-порядок токенів для унідірекціонального автoregresивного навчання. Попередні автoregresивні підходи розкладали 2D-сітку дискретних токенів у 1D-послідовність за допомогою методів, таких як рядковий головний скан, z-крива або спіральний порядок. Як тільки дискретні токени були розкладені, автoregresивні моделі витягували набір послідовностей з набору даних, та потім тренували автoregresивну модель для максимізації ймовірності у добуток T умовних ймовірностей за допомогою прогнозування наступного токену.
Візуальне Авторегресивне Моделювання за допомогою Прогнозування Наступної Роздільності
Фреймворк VAR переозначає автoregresивне моделювання на зображеннях шляхом переходу від прогнозування наступного токену до підходу прогнозування наступної роздільності, процесу, при якому автoregresивна одиниця не є окремим токеном, а цілою токенізаційною картою. Модель спочатку кільцево кодує карту особливостей у багатошкалівні токенізаційні карти, кожна з яких має вищу роздільність, ніж попередня, та завершується відповідністю роздільності оригінальної карти особливостей. Крім того, фреймворк VAR розробляє новий багатошкалівний кільцевий кодувальник для кодування зображення у багатошкалівні дискретні токенізаційні карти, необхідні для навчання VAR. Фреймворк VAR використовує ту ж архітектуру, що й VQGAN, але з модифікованим багатошкалівним кільцевим кодувальним шаром, з алгоритмами, продемонстрованими на наступному зображенні.

Візуальне Авторегресивне Моделювання: Результати та Експерименти
Фреймворк VAR використовує архітектуру VQVAE з багатошкалівним кільцевим кодуванням та використовує спільний кодобук для всіх масштабів та латентний розмір 32. Основна увага зосереджена на алгоритмі VAR, завдяки чому дизайн архітектури моделі залишається простим, але ефективним. Фреймворк приймає архітектуру стандартного декодер-тільки трансформатора, подібного до тих, які реалізовані у моделях GPT-2, з єдиною модифікацією, яка полягає у заміні традиційної нормалізації шару на адаптивну нормалізацію або AdaLN. Для клас-умовної синтезу фреймворк VAR реалізує клас-вкладення як початковий токен, та також умову адаптивної нормалізації шару.
Результати Генерації Зображень Стану Мистецтва
Коли порівнюється з існуючими генеративними фреймворками, включаючи GAN або Генеративні Адверсивні Мережі, BERT-стиль маскованих прогнозувальних моделей, дифузійні моделі та GPT-стиль автoregresивних моделей, фреймворк Візуального Авторегресивного Моделювання демонструє перспективні результати, підсумовані у наступній таблиці.

Як можна спостерігати, фреймворк Візуального Авторегресивного Моделювання не тільки здатний перевершити FID та IS-оцінки, але також демонструє видатну швидкість генерації зображень, порівнянну зі станом мистецтва моделями. Крім того, фреймворк VAR також підтримує задовільні точність та відтворення оцінок, що підтверджує його семантичну узгодженість. Але справжнім сюрпризом є видатна продуктивність, яку демонструє фреймворк VAR у традиційних завданнях автoregresивних можливостей, роблячи його першою автoregresивною моделлю, яка перевершує модель Дифузійної Трансформери, як це продемонстровано у наступній таблиці.

Результати Генералізації Завдань Без Зразків
Для завдань ін-пейнтінгу та аут-пейнтінгу фреймворк VAR примусово вводить токени поза маскою, та дозволяє моделі генерувати тільки токени всередині маски, без жодної інформації про класову мітку, введеної у модель. Результати продемонстровані на наступному зображенні, та, як можна бачити, модель VAR досягає прийнятних результатів у завданнях нижнього рівня без налаштування параметрів чи зміни архітектури мережі, демонструючи узагальнюваність фреймворку VAR.

Фінальні Думки
У цій статті ми говорили про новий візуальний генеративний фреймворк під назвою Візуальне Авторегресивне Моделювання (VAR), який 1) теоретично вирішує деякі питання, властиві стандартним зображенням автoregresивних моделей, та 2) робить мовно-орієнтовані автoregresивні моделі першою, яка перевершує сильні дифузійні моделі у термінах якості зображення, різноманітності, ефективності даних та швидкості висновку. З одного боку, традиційні автoregresивні моделі вимагають визначеного порядку даних, тоді як з іншого боку, Візуальне Авторегресивне або VAR-модель переглядає спосіб порядку зображення, і це те, що відрізняє VAR від існуючих методів AR. При масштабуванні VAR до 2 мільярдів параметрів розробники фреймворку VAR спостерігали чітке потужне співвідношення між продуктивністю тесту та моделі параметрів чи обчислювальними витратами, з коефіцієнтами Пірсона, що наближаються до −0,998, вказуючи на надійний фреймворк для прогнозування продуктивності. Ці закони масштабування та можливість нульової генералізації завдань, як ознаки LLM, тепер були вперше підтверджені у наших моделях трансформерів VAR.












