Модели и платформы ИИ
Визуальное Авторегрессивное Моделирование: Масштабируемая Генерация Изображений посредством Предсказания Следующего Масштаба
Появление моделей GPT, а также других автoreгрессивных или AR крупномасштабных языковых моделей, открыло новую эпоху в области машинного обучения и искусственного интеллекта. Модели GPT и автoreгрессивные модели часто демонстрируют общую интеллектность и универсальность, которые считаются значительным шагом к общему искусственному интеллекту или AGI, несмотря на наличие некоторых проблем, таких как галлюцинации. Однако, озадачающая проблема с этими крупномасштабными моделями заключается в саморегулируемой стратегии обучения, которая позволяет модели предсказать следующий токен в последовательности, простая, но эффективная стратегия. Недавние работы продемонстрировали успех этих крупномасштабных автoreгрессивных моделей, подчеркивая их обобщаемость и масштабируемость. Масштабируемость является типичным примером существующих законов масштабирования, которые позволяют исследователям предсказать производительность крупномасштабной модели на основе производительности меньших моделей, что приводит к более эффективному распределению ресурсов. С другой стороны, обобщаемость часто демонстрируется с помощью стратегий обучения, таких как обучение с нулевым выстрелом, обучение с одним выстрелом и обучение с несколькими выстрелами, подчеркивая способность необученных, но обученных моделей адаптироваться к различным и незнакомым задачам. Вместе, обобщаемость и масштабируемость раскрывают потенциал автoreгрессивных моделей для обучения на огромном количестве не размеченных данных.
Развивая эту идею, в этой статье мы будем говорить о Визуальном Авторегрессивном или VAR-рамке, новом поколении шаблонов, которые переопределяют автoreгрессивное обучение на изображениях как грубое к детальному «предсказание следующего разрешения» или «предсказание следующего масштаба». Хотя простая, подход является эффективным и позволяет автoreгрессивным трансформерам лучше учиться визуальным распределениям, и улучшает обобщаемость. Кроме того, Визуальные Авторегрессивные модели позволяют GPT-стильным автoreгрессивным моделям превзойти диффузионные трансформеры в генерации изображений впервые. Эксперименты также указывают на то, что VAR-рамка значительно улучшает автoreгрессивные базовые модели и превосходит Диффузионный Трансформер или DiT-рамку в нескольких измерениях, включая эффективность данных, качество изображения, масштабируемость и скорость вывода. Кроме того, масштабирование Визуальных Авторегрессивных моделей демонстрирует закономерности масштабирования, подобные тем, которые наблюдаются у крупномасштабных языковых моделей, и также демонстрирует способность к нулевому выстрелу в задачах вниз по потоку, включая редактирование, инпейтинг и аутпейтинг.
Эта статья направлена на глубокое освещение VAR-рамки, и мы исследуем механизм, методологию, архитектуру рамки, а также ее сравнение с рамками, являющимися лучшими в своем классе. Мы также поговорим о том, как VAR-рамка демонстрирует два важных свойства LLM: Законы Масштабирования и нулевое выстрелом обобщение. Итак, давайте начнем.
Визуальное Авторегрессивное Моделирование: Масштабируемая Генерация Изображений
Общий шаблон среди недавних крупномасштабных языковых моделей заключается в реализации саморегулируемой стратегии обучения, простой, но эффективной подход, который предсказывает следующий токен в последовательности. Благодаря этому подходу, автoreгрессивные и крупномасштабные языковые модели сегодня продемонстрировали замечательную масштабируемость, а также обобщаемость, свойства, которые раскрывают потенциал автoreгрессивных моделей для обучения на огромном количестве не размеченных данных, таким образом, суммируя суть Общего Искусственного Интеллекта. Кроме того, исследователи в области компьютерного зрения параллельно работают над разработкой крупномасштабных автoreгрессивных или мировых моделей с целью соответствовать или превзойти их впечатляющую масштабируемость и обобщаемость, с моделями, такими как DALL-E и VQGAN, уже демонстрирующими потенциал автoreгрессивных моделей в области генерации изображений. Эти модели часто реализуют визуальный токенизатор, который представляет или приближает непрерывные изображения к сетке 2D-токенов, которые затем уплощаются в 1D-последовательность для автoreгрессивного обучения, таким образом, отражая последовательный процесс языкового моделирования.

Однако исследователи еще не исследовали законы масштабирования этих моделей, и что еще более раздражает, то, что производительность этих моделей часто отстает от диффузионных моделей на значительную величину, как демонстрируется на следующем изображении. Разрыв в производительности указывает на то, что по сравнению с крупномасштабными языковыми моделями, возможности автoreгрессивных моделей в компьютерном зрения недостаточно исследованы.

С одной стороны, традиционные автoreгрессивные модели требуют определенного порядка данных, тогда как с другой стороны, Визуальное Авторегрессивное или VAR-модель пересматривает, как упорядочить изображение, и это то, что отличает VAR от существующих AR-методов. Обычно люди создают или воспринимают изображение иерархическим образом, захватывая глобальную структуру, за которой следуют локальные детали, много масштабный, грубый к детальному подход, который предполагает порядок для изображения естественным образом. Кроме того, черпая вдохновение из много масштабных конструкций, VAR-рамка определяет автoreгрессивное обучение для изображений как предсказание следующего масштаба, а не традиционный подход, который определяет обучение как предсказание следующего токена. Подход, реализованный VAR-рамкой, начинается с кодирования изображения в много масштабные токен-карты. Затем рамка начинает автoreгрессивный процесс с 1×1 токен-карты и расширяется в разрешении прогрессивно. На каждом шаге трансформер предсказывает следующую токен-карту более высокого разрешения, условную на всех предыдущих, методологию, которую VAR-рамка называет VAR-моделированием.
VAR-рамка пытается использовать трансформерную архитектуру GPT-2 для визуального автoreгрессивного обучения, и результаты очевидны на бенчмарке ImageNet, где VAR-модель значительно улучшает свою AR-основу, достигая FID 1,80 и балла 356 по шкале начала, а также 20-кратного улучшения скорости вывода. Что еще более интересно, так это то, что VAR-рамка manages превзойти производительность DiT- или Диффузионного Трансформера в плане FID- и IS-баллов, масштабируемости, скорости вывода и эффективности данных. Кроме того, Визуальное Авторегрессивное моделирование демонстрирует сильные законы масштабирования, подобные тем, которые наблюдаются у крупномасштабных языковых моделей.
В заключение, VAR-рамка пытается сделать следующие вклады.
- Она предлагает новый визуальный генеративный каркас, который использует много масштабный автoreгрессивный подход с предсказанием следующего масштаба, а не традиционный подход предсказания следующего токена, что приводит к проектированию автoreгрессивного алгоритма для задач компьютерного зрения.
- Она пытается проверить законы масштабирования для автoreгрессивных моделей, а также потенциал нулевого выстрела, который имитирует привлекательные свойства LLM.
- Она предлагает прорыв в производительности визуальных автoreгрессивных моделей, позволяя GPT-стильным автoreгрессивным каркасам превзойти существующие диффузионные модели в задачах синтеза изображений впервые.
Кроме того, также важно обсудить существующие законы масштабирования, которые математически описывают связь между размерами наборов данных, параметрами моделей, улучшениями производительности и вычислительными ресурсами моделей машинного обучения. Во-первых, эти законы масштабирования облегчают применение производительности более крупной модели путем масштабирования размера модели, вычислительных затрат и размера данных, экономя ненужные затраты и распределяя бюджет обучения, предоставляя принципы. Во-вторых, законы масштабирования продемонстрировали последовательное и не насыщенное увеличение производительности. Продолжая с принципами законов масштабирования в нейронных языковых моделях, несколько LLM воплощают принцип, что увеличение масштаба моделей приводит к улучшению результатов производительности. Нулевое выстрелом обобщение, с другой стороны, относится к способности модели, в частности LLM, выполнять задачи, на которых она не была явно обучена. В области компьютерного зрения интерес к построению нулевого выстрела и контекстно-зависимого обучения фундаментальных моделей.
Языковые модели полагаются на алгоритмы WordPiece или подход Byte Pair Encoding для токенизации текста. Визуальные генеративные модели, основанные на языковых моделях, также сильно полагаются на кодирование 2D-изображений в 1D-токен-последовательности. Ранние работы, такие как VQVAE, продемонстрировали способность представлять изображения в виде дискретных токенов с умеренным качеством реконструкции. Преемник VQVAE, каркас VQGAN, включил перцептивные и адверсарные потери для улучшения качества изображения и также использовал декодер-только трансформер для генерации токенов изображения в стандартном автoreгрессивном порядке. Диффузионные модели, с другой стороны, долгое время считались лидерами в задачах визуального синтеза, благодаря их разнообразию и превосходному качеству генерации. Улучшение диффузионных моделей было сосредоточено на улучшении методов выборки, архитектурных улучшениях и более быстрой выборке. Латентные диффузионные модели применяют диффузию в латентном пространстве, что улучшает эффективность обучения и вывода. Диффузионные Трансформер-модели заменяют традиционную архитектуру U-Net на трансформерную архитектуру и были развернуты в недавних моделях синтеза изображений или видео, таких как SORA и Stable Diffusion.
Визуальное Авторегрессивное: Методология и Архитектура

В своей основе VAR-рамка имеет две отдельные стадии обучения. На первой стадии много масштабный квантованный автоэнкодер или VQVAE кодирует изображение в токен-карты, и составная реконструктивная ошибка реализуется для целей обучения. На приведенном выше изображении, встраивание – это слово, используемое для определения преобразования дискретных токенов в непрерывные векторы встраивания. На второй стадии трансформер в VAR-модели обучается либо путем минимизации кросс-энтропийной ошибки, либо путем максимизации вероятности с помощью подхода предсказания следующего масштаба. Обученный VQVAE затем производит токен-карту основную истину для VAR-рамки.
Авторегрессивное Моделирование посредством Предсказания Следующего Токена
Для данной последовательности дискретных токенов, где каждый токен является целым числом из словаря размера V, автoreгрессивная модель следующего токена предполагает, что вероятность наблюдения текущего токена зависит только от его префикса. Предполагая унидирекциональную зависимость токенов, позволяет VAR-рамке разложить вероятность последовательности на произведение условных вероятностей. Обучение автoreгрессивной модели включает оптимизацию модели на наборе данных, и этот процесс оптимизации известен как предсказание следующего токена, и позволяет обученной модели генерировать новые последовательности. Кроме того, изображения являются 2D-непрерывными сигналами по наследству, и применение автoreгрессивного подхода к изображениям посредством процесса предсказания следующего токена имеет несколько предварительных условий. Во-первых, изображение необходимо токенизировать в несколько дискретных токенов. Обычно реализуется квантованный автоэнкодер для преобразования карты особенностей изображения в дискретные токены. Во-вторых, необходимо определить 1D-порядок токенов для унидирекционального автoreгрессивного обучения.
Токены изображения в дискретных токенах расположены в 2D-сетке, и в отличие от предложений естественного языка, которые несут в себе левое-правое упорядочение, порядок токенов изображения должен быть явно определенным для унидирекционального автoreгрессивного обучения. Предыдущие автoreгрессивные подходы уплощали 2D-сетку дискретных токенов в 1D-последовательность с помощью методов, таких как сканирование по строкам, z-изгиб или спиральная последовательность. Как только дискретные токены были уплощены, AR-модели извлекали набор последовательностей из набора данных, а затем обучали автoreгрессивную модель для максимизации вероятности в произведение T условных вероятностей с помощью предсказания следующего токена.
Визуальное Авторегрессивное Моделирование посредством Предсказания Следующего Масштаба
VAR-рамка переосмысливает автoreгрессивное моделирование на изображениях, смещаясь от предсказания следующего токена к подходу предсказания следующего масштаба, при котором вместо того, чтобы быть одним токеном, автoreгрессивная единица является всей токен-картой. Модель сначала квантует карту особенностей в много масштабные токен-карты, каждая с более высоким разрешением, чем предыдущая, и завершается совпадением с разрешением исходной карты особенностей. Кроме того, VAR-рамка разрабатывает новый много масштабный квантовый кодировщик для кодирования изображения в много масштабные дискретные токен-карты, необходимые для VAR-обучения. VAR-рамка использует ту же архитектуру, что и VQGAN, но с модифицированным много масштабным квантовым слоем, с алгоритмами, продемонстрированными на следующем изображении.

Визуальное Авторегрессивное: Результаты и Эксперименты
VAR-рамка использует ванильную архитектуру VQVAE с много масштабным квантовым схемой с K дополнительными свертками и использует общий кодовый книгу для всех масштабов и латентного размера 32. Основное внимание уделяется VAR-алгоритму, благодаря которому дизайн модели архитектуры сохраняется простым, но эффективным. Рамка принимает архитектуру стандартного декодер-только трансформера, подобного тому, который реализован в моделях GPT-2, с единственной модификацией, заключающейся в замене традиционной нормализации слоев на адаптивную нормализацию или AdaLN. Для условной синтеза классов VAR-рамка реализует встраивания классов в качестве токена начала и также условия адаптивной нормализации слоя.
Результаты Генерации Изображений Лучшего Класса
Когда сравнивается с существующими генеративными рамками, включая GAN или Генеративные Сопернические Сети, BERT-стильные модели предсказания с маскированием, диффузионные модели и GPT-стильные автoreгрессивные модели, Визуальная Авторегрессивная рамка демонстрирует перспективные результаты, суммированные в следующей таблице.

Как можно наблюдать, Визуальная Авторегрессивная рамка не только способна превзойти лучшие FID- и IS-баллы, но также демонстрирует замечательную скорость генерации изображений, сопоставимую с лучшими в своем классе моделями. Кроме того, VAR-рамка также сохраняет удовлетворительные баллы точности и полноты, что подтверждает ее семантическую последовательность. Но настоящий сюрприз заключается в том, что VAR-рамка демонстрирует замечательную производительность на традиционных AR-возможностях задач, что делает ее первой автoreгрессивной моделью, превзошедшей Диффузионный Трансформер, как продемонстрировано в следующей таблице.

Результат Обобщения Задачи с Нулевым Выстрелом
Для задач инпейтинга и аутпейтинга VAR-рамка принудительно устанавливает токены основной истины вне маски и позволяет модели генерировать только токены внутри маски, без внедрения информации о классе в модель. Результаты продемонстрированы на следующем изображении, и как можно видеть, VAR-модель достигает приемлемых результатов на задачах вниз по потоку без настройки параметров или модификации архитектуры сети, демонстрируя обобщаемость VAR-рамки.

Окончательные Мысли
В этой статье мы говорили о новом визуальном генеративном каркасе, называемом Визуальным Авторегрессивным моделированием (VAR), который 1) теоретически решает некоторые проблемы, присущие стандартным изображениям автoreгрессивных моделей, и 2) делает языково-ориентированные автoreгрессивные модели первыми, превзошедшими сильные диффузионные модели в плане качества изображения, разнообразия, эффективности данных и скорости вывода. С одной стороны, традиционные автoreгрессивные модели требуют определенного порядка данных, тогда как с другой стороны, Визуальное Авторегрессивное или VAR-модель пересматривает, как упорядочить изображение, и это то, что отличает VAR от существующих AR-методов. При масштабировании VAR до 2 миллиардов параметров разработчики VAR-рамки наблюдали четкую степенную зависимость между тестовой производительностью и параметрами модели или вычислительными затратами, с коэффициентами Пирсона, приближающимися к −0,998, что указывает на прочную основу для предсказания производительности. Эти законы масштабирования и возможность нулевого выстрела обобщения, как характерные черты LLM, теперь были первоначально проверены в наших VAR-трансформер-моделях.












