Модели и платформы ИИ

SHOW-O: Единый Трансформер, Объединяющий Мультимодальное Понимание и Генерацию

mm
Добавьте Unite.AI в избранные источники в Google

Значительные достижения в области больших языковых моделей (LLM) вдохновили разработку мультимодальных больших языковых моделей (MLLM). Ранние попытки MLLM, такие как LLaVA, MiniGPT-4 и InstructBLIP, демонстрируют заметные возможности мультимодального понимания. Чтобы интегрировать LLM в мультимодальные области, эти исследования изучали проекцию функций из предварительно обученного модальности-специфического кодировщика, такого как CLIP, в входное пространство LLM, что позволяет осуществлять мультимодальное понимание и рассуждение внутри трансформерного бэкбона. Хотя существует различные варианты проектирования для MLLM, такие как кодировщики зрения, адаптеры выравнивания функций и наборы данных, обучение большинства этих моделей придерживается парадигмы автoreгрессивной генерации, которая оказалась эффективной для генерации текста в LLM. Несмотря на их сильные возможности мультимодального понимания, эти модели в основном фокусируются на визуальном восприятии и не имеют возможности генерировать мультимодальные выходы за пределами текста.

Трансформерные модели продемонстрировали большую эффективность в автoreгрессивном моделировании в обработке естественного языка. Вдохновленные таким прогрессом, предыдущие исследования напрямую применили то же автoreгрессивное моделирование для изучения зависимости пикселей изображения для генерации изображений и видео. Например, VideoPoet использует архитектуру декодера-трансформера для синтеза высококачественных видео из мультимодальных входных данных. Более недавно LlamaGen показал, что архитектура большой языковой модели, такая как Llama, может автoreгрессивно моделировать токены изображения, достигая приличной производительности в класс-условной генерации изображения.

В этой статье мы обсудим Show-O, единый трансформер, который объединяет мультимодальное понимание и генерацию. В отличие от полностью автoreгрессивных моделей, Show-O объединяет автoreгрессивное и дискретное диффузионное моделирование для адаптивного xửления входных и выходных данных различных и смешанных модальностей. Единый модель гибко поддерживает широкий спектр задач зрения-языка, включая визуальное вопрос-ответ, генерацию изображения из текста, текст-руководимое инпейтинг/экстраполяцию и генерацию смешанных модальностей. На различных бенчмарках Show-O демонстрирует сопоставимую или превосходящую производительность по сравнению с существующими индивидуальными моделями с эквивалентным или большим количеством параметров, подчеркивая его потенциал как следующего поколения фундаментальной модели.

… (перевод продолжается, сохраняя структуру и форматирование оригинального текста)

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.