Модели и платформы ИИ
MiniGPT-5: Интерлеированная генерация языка и зрения посредством генеративных вокенов
За последние несколько лет большие языковые модели (LLM) привлекли внимание разработчиков искусственного интеллекта во всем мире благодаря прорывам в области обработки естественного языка (NLP). Эти модели установили новые стандарты в генерации текста и понимании. Однако, несмотря на прогресс в генерации текста, создание изображений, которые согласованно соответствуют текстовым нарративам, все еще является сложной задачей. Чтобы решить эту проблему, разработчики ввели инновационный подход к генерации языка и зрения на основе “генеративных вокенов”, который мостит разрыв между согласованными текстово-изображенными выходами.
Основой MiniGPT-5 является двухэтапная стратегия обучения, которая фокусируется на генерации многомодальных данных без описаний. Кроме того, для повышения целостности модели, модель включает систему руководства без классификатора, которая повышает эффективность вokens для генерации изображений. На начальном этапе, фреймворк MiniGPT-5 продемонстрировал мощную производительность и значительное улучшение по сравнению с базовой моделью Divter, обученной на наборе данных MMDialog, и постоянно демонстрировал свою способность обеспечивать сопоставимые и даже лучшие многомодальные выходы в человеческих оценках, выполненных на наборе данных VIST, что еще больше подчеркивает его производительность и эффективность на различных эталонах.
MiniGPT5: Введение
С учетом недавних разработок фреймворков LLM и приложений на основе этих фреймворков, интеграция мультимедийных функций является областью, которая приобрела популярность, поскольку она также является важным прогрессом, который обеспечивает широкий спектр приложений, от инструментов создания контента до передовых мультимодальных диалоговых агентов. С постоянными исследованиями и разработками, языковые и зрительные модели достигли точки, где работа направлена на то, чтобы они могли генерировать как текст, так и визуальные данные без проблем. Способность LLM генерировать многомодальные данные без проблем поможет улучшить взаимодействия в различных областях, включая электронную коммерцию, средства массовой информации и виртуальную реальность.

В конечном итоге, цель состоит в том, чтобы позволить моделям синтезировать, распознавать и реагировать последовательно и логически, используя как текстовые, так и визуальные модальности, играя важную роль в согласовании потока информации и создании логических и последовательных нарративов. Необходимость достижения сочетания текстовых и визуальных модальностей обусловлена в первую очередь потребностью в более жидких, интегрированных и интерактивных мультимодальных взаимодействиях в LLM, и в конечном итоге достижении чередующейся генерации языка и зрения. Однако достижение интегрированных и интерактивных мультимодальных взаимодействий в LLM является сложной задачей, осложненной многочисленными проблемами, включая
- Хотя текущие LLM чрезвычайно эффективны и способны при генерации текста и обработке текстово-изображенных пар, они не обеспечивают удовлетворительной производительности при генерации изображений.
- Разработка этих моделей зрения и языка сильно зависит от тематических данных, что делает сложным для моделей согласовать сгенерированный текст с соответствующими изображениями.
- Наконец, необходимо разработать более эффективные стратегии, поскольку с увеличением их возможностей, требования к памяти LLM также увеличиваются, особенно при выполнении задач вниз по потоку.
Фреймворк MiniGPT-5, интерлеированный язык и зрение, генерирующий алгоритмический метод, вводит понятие “генеративных вokens” в попытке решить вышеуказанные проблемы. Фреймворк MiniGPT-5 предлагает новый подход к многомодальной генерации данных, объединяя большие языковые модели со стабильными диффузионными методами с помощью специальных визуальных токенов. Предлагаемый двухэтапный метод обучения, используемый фреймворком MiniGPT-5, подчеркивает важность основного этапа, свободного от описаний, и подготовки модели для эффективной производительности даже в сценариях с ограниченными данными.

Но то, что отличает модель MiniGPT-5 от существующих фреймворков, заключается в том, что общие этапы фреймворка MiniGPT-5 не состоят из доменных аннотаций. Кроме того, для обеспечения того, чтобы сгенерированный текст и соответствующие изображения были в гармонии друг с другом, фреймворк MiniGPT-5 использует двойную стратегию потерь, которая еще больше улучшает подход MiniGPT-5 к использованию руководства без классификатора и генеративных вokens. Фреймворк MiniGPT-5 оптимизирует эффективность обучения и решает проблемы с ограничениями памяти благодаря параметро-эффективной стратегии для тонкой настройки модели.
Чтобы предоставить вам краткий обзор, фреймворк MiniGPT-5
- Предлагает метод, который использует многомодальные кодировщики, представляющие новый и общий метод, который исторически доказал свою эффективность больше, чем традиционные LLM, и использует генеративные токены в сочетании со стабильными диффузионными методами для генерации интерлеированных языковых и визуальных выходов.
- Предлагает двухэтапную стратегию обучения для генерации описательного многомодального выхода и включает руководство без классификатора во время обучения для дальнейшего уточнения качества сгенерированных данных.
Модель MiniGPT-5 вдохновлена предыдущими исследованиями и работами в области
- Генерации изображений из текста: Для облегчения преобразования текстовых описаний в соответствующие визуальные представления и модели генерации изображений из текста.
- Мультимодальных больших языковых моделей (MLLM): Использование предварительно обученных моделей LLM для изучения их применения и эффективности в генерации многомодальных данных.
- Мультимодальной генерации с большими языковыми моделями: Для расширения возможностей LLM для бесшовной интеграции языковых и визуальных данных.
MiniGPT-5: Метод, архитектура и фреймворк
Для обеспечения больших языковых моделей с возможностями многомодальной генерации данных, модель MiniGPT-5 вводит фреймворк, который направлен на интеграцию моделей генерации изображений из текста и предварительно обученных мультимодальных больших языковых моделей. Фреймворк MiniGPT-5 еще больше вводит “генеративные вokens”, специальные визуальные токены, которые позволяют разработчикам решить расхождения, которые появляются в различных доменах, обучаясь непосредственно на сырых изображениях. Для дальнейшего улучшения качества многомодальных данных, сгенерированных LLM, фреймворк MiniGPT-5 вводит стратегию без классификатора, сочетанную с продвинутым двухэтапным методом обучения. Давайте рассмотрим фреймворк MiniGPT-5 более подробно.
Мультимодальный входной этап
Развитие LLM в последнее время пролили свет на способность LLM к мультимодальному пониманию, позволяя обрабатывать изображения как последовательный вход. Фреймворк MiniGPT-5 использует специально разработанные генеративные вokens для вывода визуальных особенностей в попытке расширить мультимодальные возможности LLM к многомодальной генерации данных. Кроме того, фреймворк MiniGPT-5 использует параметро-эффективные и передовые методы тонкой настройки для многомодального обучения с фреймворком LLM.
Мультимодальное кодирование
Предварительно обученный визуальный кодировщик в фреймворке MiniGPT-5 преобразует каждое входное изображение в особенность, и каждый текстовый токен встраивается как вектор, и входные особенности подсказки генерируются при конкатенации этих встраиваний.
Добавление вokens в большие языковые модели
Традиционно, словарь больших языковых моделей состоит только из текстовых токенов, поэтому разработчики, работающие над фреймворком MiniGPT-5, должны были мостить разрыв между генеративными и традиционными LLM. Фреймворк MiniGPT-5 вводит набор специальных токенов как генеративные токены в словарь LLM. Фреймворк затем использует скрытое выходное состояние LLM для этих специальных вokens для последующей генерации изображений, и вставка интерлеированных изображений представлена позицией вokens.
Параметро-эффективная тонкая настройка (PEFT)
PEFT или параметро-эффективная тонкая настройка является важным понятием, используемым для обучения LLM, и yet, применения PEFT в мультимодальных условиях еще не исследованы в значительной степени. Фреймворк MiniGPT-5 использует параметро-эффективную тонкую настройку над кодировщиком фреймворка MiniGPT-4 для обучения модели понимать подсказки или инструкции лучше, и даже для улучшения общей производительности модели в нулевой или новой среде.
Мультимодальная генерация выхода
Для согласования генеративной модели с генеративными токенами точно, фреймворк MiniGPT-5 формулирует компактный модуль сопоставления для согласования размеров и включения надзорных потерь, включая латентную диффузионную потерю и потерю текстового пространства. Латентная диффузионная надзорная потеря согласует соответствующие визуальные особенности с токенами直接, в то время как потеря текстового пространства помогает модели учиться правильным позициям токенов. Поскольку генеративные вokens в фреймворке MiniGPT-5 руководствуются непосредственно изображениями, фреймворк MiniGPT-5 не требует, чтобы изображения имели полное описание, в результате чего получается обучение без описаний.
Генерация текстового пространства
Фреймворк MiniGPT-5 следует методу каузального языкового моделирования для генерации как вokens, так и текста в текстовом пространстве совместно, и во время обучения, разработчики добавляют вokens к позиции исходных изображений, и обучают модель предсказывать вokens в текстовой генерации.
Сопоставление особенностей вokens для генерации изображений
После генерации текстового пространства, фреймворк согласует скрытое выходное состояние с текстово-условным пространством особенностей модели генерации изображений из текста. Фреймворк также поддерживает модуль сопоставления особенностей, который включает двуслойный модель MLP, обучаемую последовательность декодирования особенностей и четырехслойную модель трансформера кодировщика-декодировщика.
Генерация изображений с помощью латентной диффузионной модели (LDM)
Для генерации необходимых изображений в процессе денойзинга, фреймворк использует особенности сопоставления как условный вход. Фреймворк также использует латентную диффузионную модель для руководства, поскольку во время обучения, исходное изображение сначала преобразуется в латентную особенность с помощью предварительно обученной модели VAE, после чего разработчики получают латентную шумную особенность, добавляя некоторый шум.
Комплексный подход, используемый фреймворком MiniGPT-5, позволяет разработчикам иметь согласованное понимание и генерацию как визуальных, так и текстовых элементов, используя специальные токены, используя возможности предварительно обученных моделей и используя инновационные методы обучения.
MiniGPT-5: Обучение и результаты
Когда разработчики работали над фреймворком MiniGPT-5, они обнаружили, что обучение на ограниченном интерлеированном текстово-изображенном наборе данных напрямую может привести к изображениям с пониженным качеством и несоответствием, учитывая значительный сдвиг домена между изображением и текстом. Чтобы смягчить эту проблему, разработчики приняли две различные стратегии обучения,
- Включая техники руководства без классификатора, которые повышают эффективность генеративных токенов во время диффузионного процесса.
- Вторая стратегия делится на два этапа
- Первоначальный этап предварительного обучения, который фокусируется на согласовании грубых особенностей.
- Этап тонкой настройки, который облегчает обучение особенностей.
CFG или руководство без классификатора
Идея использовать CFG для многомодальной генерации возникла в результате попытки улучшить согласованность и логичность между сгенерированными изображениями и текстом, и CFG вводится во время диффузионного процесса генерации изображений из текста. Этот метод обнаруживает, что, обучаясь на обоих условных и безусловных генерациях с бессрочным дропаутом, генеративная модель может достичь улучшенных условных результатов.
Двухэтапная стратегия обучения
Учитывая значительный сдвиг домена, наблюдаемый между генерацией текста и изображений, и чистой генерацией текста, фреймворк MiniGPT-5 использует двухэтапную стратегию обучения
- Унимодальный этап согласования (UAS),
- Мультимодальный этап обучения (MLS).
Первоначально, фреймворк согласует особенности генерации изображений с особенностью вokens в однотекстовых и одноизображенных наборах данных, где каждая выборка данных содержит только один текст и только одно изображение, и текст обычно является подписью к изображению. На этом этапе, фреймворк позволяет LLM генерировать вokens, используя подписи как входные данные LLM.
Как только UAS был выполнен успешно, модель может генерировать изображения для одиночных текстовых описаний, но испытывает трудности с интерлеированной генерацией языка и зрения, включая текстово-изображенные пары, и сложные рассуждения требуются для генерации изображений и текста. Чтобы преодолеть эту проблему, разработчики еще больше настроили фреймворк MiniGPT-5, используя параметры PEFT, интерлеированные видение-и-язык наборы данных, такие как VIST. На этом этапе, фреймворк строит три различных задачи из набора данных
- Генерация только текста: генерирует связанный текст, учитывая следующее изображение.
- Генерация только изображения: генерирует связанное изображение, учитывая следующий текст.
- Мультимодальная генерация: генерирует текстово-изображенные пары, используя заданный контекст.
MiniGPT-5: Эталонные результаты
Для всесторонней оценки его производительности в многомодальной генерации, команда разработчиков MiniGPT-5 сравнивает его производительность с другими известными базовыми моделями, включая Divter, GILL и тонко настроенную унимодальную модель генерации, и сравнение демонстрируется в таблице ниже.

Фреймворк MiniGPT-5 понимает, что многомодальный выход может быть осмысленным в контексте, но может отличаться от реальности, что является основной причиной, по которой фреймворк MiniGPT-5 также включает человеческие входные данные для оценки и оценки производительности модели. В целом, эффективность фреймворка MiniGPT-5 для многомодальных задач оценивается с трех точек зрения.
- Языковая непрерывность: оценка того, соответствует ли сгенерированный контент предоставленному контексту без проблем.
- Качество изображения: оценка или оценка релевантности и ясности сгенерированного изображения.
- Мультимодальная согласованность: определение того, соответствует ли объединенный текстово-изображенный выход контексту.
Окончательная оценка VIST
На первом этапе экспериментов, фреймворк MiniGPT-5 направлен на генерацию соответствующих изображений, и таблица ниже суммирует результаты, полученные из этого настройки.

Как можно видеть, фреймворк MiniGPT-5 во всех трех настройках может превзойти тонко настроенную модель SD2, подчеркивая эффективность фреймворка MiniGPT-5.

Фигура выше сравнивает производительность фреймворка MiniGPT-5 с тонко настроенной моделью MiniGPT-4 на метриках S-BERT, Rouge-L и Meteor. Результаты указывают на то, что использование генеративных вokens не влияет на производительность фреймворка отрицательно при выполнении многомодальных задач понимания. Результаты также демонстрируют, что фреймворк MiniGPT-5 способен использовать длинные горизонтальные мультимодальные входные подсказки в широком диапазоне данных для генерации высококачественных и согласованных изображений без компрометации способности исходной модели к многомодальному пониманию.

Таблица выше сравнивает производительность трех фреймворков на 5000 выборках для многомодальной генерации с точки зрения мультимодальной согласованности, качества изображения и языковой непрерывности. Как можно видеть, фреймворк MiniGPT-5 превзошел две другие базовые модели более чем в 70% случаев. С другой стороны, таблица ниже демонстрирует производительность фреймворка MiniGPT-5 на наборе данных CC3M для генерации одиночных изображений. Благодаря ограничениям данных, разработчики обнаружили разрыв в выравнивании вokens при использовании со стабильной диффузией. Несмотря на это ограничение, фреймворк MiniGPT-5 превзошел текущую базовую модель GILL во всех метриках.


Заключение
В этой статье мы говорили о MiniGPT-5, интерлеированном языке и зрении, генерирующем алгоритмическом методе, который вводит понятие “генеративных вokens” в попытке использовать возможности LLM для генерации многомодальных данных, согласовывая большую языковую модель с предварительно обученной моделью генерации изображений из текста. Мы говорили об основных компонентах и общей архитектуре фреймворка MiniGPT-5, а также о результатах, которые указывают на значительные улучшения производительности и эффективности по сравнению с текущими базовыми и передовыми моделями. MiniGPT-5 стремится установить новый эталон в области многомодального контента и генерации данных и направлен на решение проблем, с которыми сталкиваются предыдущие модели при попытке решить одну и ту же проблему.












