Взгляд Anderson

Будущее RAG-аугментированного генерирования изображений

mm
Добавьте Unite.AI в избранные источники в Google
ChatGPT-4o: ‘Decades ago photos were a photochemical process, and typically photographic prints were done in a darkroom, with the wet prints hung from a line like clothes. Show me that environment, with 10 photos drying on a line in darkroom, and a white-coated scientist picking one of them off the line. Bokeh focus, 1792x1024’

Генеративные диффузионные модели, такие как Stable Diffusion, Flux и видеомодели, такие как Hunyuan, полагаются на знания, приобретенные во время одного ресурсоемкого сеанса обучения с использованием фиксированного набора данных. Любые концепции, введенные после этого обучения, называемые граничной датой знаний, отсутствуют в модели, если только они не дополняются с помощью тонкой настройки или внешних методов адаптации, таких как Low Rank Adaptation (LoRA).

Было бы идеально, если бы генеративная система, выдающая изображения или видео, могла обращаться к онлайн-источникам и включать их в процесс генерации по мере необходимости. Например, диффузионная модель, которая ничего не знает о последнем выпуске Apple или Tesla, могла бы все равно производить изображения, содержащие эти новые продукты.

Что касается языковых моделей, большинство из нас знакомо с системами, такими как Perplexity, Notebook LM и ChatGPT-4o, которые могут включать новые внешние сведения в модель RAG (Retrieval Augmented Generation).

Процессы RAG делают ответы ChatGPT 4o более актуальными. Источник: https://chatgpt.com/

Процессы RAG делают ответы ChatGPT 4o более актуальными. Источник: https://chatgpt.com/

Однако это необычная возможность, когда речь идет о генерации изображений, и ChatGPT признает свои собственные ограничения в этом отношении:

ChatGPT 4o сделал хороший угад, касающийся визуализации нового выпуска часов, основанного на общей линии и описаниях, которые он интерпретировал; но он не может «поглотить» и интегрировать новые изображения в генерацию на основе DALL-E.

ChatGPT 4o сделал хороший угад, касающийся визуализации нового выпуска часов, основанного на общей линии и описаниях, которые он интерпретировал; но он не может «поглотить» и интегрировать новые изображения в генерацию на основе DALL-E.

Включение внешних данных в сгенерированное изображение является сложной задачей, поскольку входящее изображение должно сначала быть разбито на токены и вложения, которые затем сопоставляются с ближайшими знаниями модели о предмете.

Хотя этот процесс работает эффективно для пост-обучения инструментов, таких как ControlNet, такие манипуляции остаются в основном поверхностными, по сути пропуская полученное изображение через конвейер рендеринга, но не глубоко интегрируя его в внутреннее представление модели.

Это означает, что модель лишена способности генерировать новые перспективы так, как могут системы нейронного рендеринга, такие как NeRF, которые строят сцены с истинным пространственным и структурным пониманием.

Зрелая логика

Аналогичное ограничение применяется к запросам RAG в больших языковых моделях (LLM), таких как Perplexity. Когда модель такого типа обрабатывает внешние данные, она функционирует подобно взрослому человеку, который использует всю свою жизнь, чтобы сделать выводы о теме.

Однако, как и человек не может ретроспективно интегрировать новые знания в свою когнитивную структуру, когда его предубеждения и предконцепции еще формируются, LLM не может без проблем объединить новые знания со своей предварительно обученной структурой.

Вместо этого он может только «влиять» или противопоставлять новые данные своим существующим внутренним знаниям, используя выученные принципы для анализа и спекуляций, а не для синтеза на фундаментальном уровне.

Этот недостаток эквивалентности между противопоставленными и внутренними генерациями, вероятно, будет более очевиден в сгенерированном изображении, чем в языковой генерации:

Скрытые риски RAG-генерации изображений

Даже если бы было технически возможно без проблем интегрировать полученные интернет-изображения в новые синтезированные изображения в стиле RAG, ограничения, связанные с безопасностью, представили бы дополнительную проблему.

Многие наборы данных, используемые для обучения генеративных моделей, были отобраны для минимизации присутствия явного, расистского или жестокого контента, среди других чувствительных категорий. Однако этот процесс несовершенен, и остаточные ассоциации могут сохраниться. Чтобы смягчить это, системы, такие как DALL·E и Adobe Firefly, полагаются на вторичные механизмы фильтрации, которые проверяют как входные подсказки, так и сгенерированные выходные данные на предмет запрещенного контента.

В результате простой фильтр NSFW — который в основном блокирует явно явный контент — был бы недостаточным для оценки приемлемости полученных RAG-данных. Такой контент все равно мог бы быть оскорбительным или вредным способами, которые выходят за рамки предварительно определенных параметров модерации модели, потенциально вводя материал, который ИИ не имеет контекстного осознания, чтобы правильно оценить.

Обнаружение недавней уязвимости в CCP-продукте DeepSeek, предназначенном для подавления обсуждений запрещенного политического контента, подчеркнуло, как альтернативные пути ввода могут быть использованы для обхода защитных механизмов модели; можно утверждать, что это также применяется к произвольным новым данным, полученным из интернета, когда они предназначены для включения в новую генерацию изображений.

RAG для генерации изображений

Несмотря на эти проблемы и сложные политические аспекты, несколько проектов появились, которые пытаются использовать методы RAG для включения новых данных в визуальные генерации.

ReDi

Проект 2023 года Retrieval-based Diffusion (ReDi) — это обучающийся фреймворк, который ускоряет вывод диффузионной модели, извлекая подобные траектории из предварительно вычисленной базы знаний.

Значения из набора данных можно «одолжить» для новой генерации в ReDi. Источник: https://arxiv.org/pdf/2302.02285

Значения из набора данных можно «одолжить» для новой генерации в ReDi. Источник: https://arxiv.org/pdf/2302.02285

В контексте диффузионных моделей траектория — это пошаговый путь, который модель проходит для генерации изображения из чистого шума. Обычно этот процесс происходит постепенно за многие шаги, с каждым шагом, немного уточняя изображение.

ReDi ускоряет этот процесс, пропуская часть этих шагов. Вместо расчета каждого шага он извлекает подобную прошлую траекторию из базы данных и переходит к более поздней точке в процессе. Это снижает количество необходимых вычислений, делая генерацию изображений на основе диффузии намного быстрее, сохраняя при этом высокое качество.

ReDi не изменяет веса диффузионной модели, а использует базу знаний для пропуска промежуточных шагов, тем самым снижая количество необходимых оценок функций для выборки.

Конечно, это не то же самое, что включение конкретных изображений по желанию в запрос генерации; но это связано с подобными типами генерации.

Выпущенный в 2022 году, в год, когда латентные диффузионные модели захватили общественное воображение, ReDi, кажется, является одним из первых диффузионных подходов, опирающихся на методологию RAG.

Хотя в 2021 году Facebook Research выпустил Instance-Conditioned GAN, который стремился обусловить изображения GAN на новых входных изображениях, этот тип проекции в латентное пространство очень распространен в литературе, как для GAN, так и для диффузионных моделей; задача состоит в том, чтобы сделать такой процесс обучающийся, функциональный и работающий в режиме реального времени, как методы RAG, ориентированные на LLM.

RDM

Другой ранний проект в области RAG-аугментированной генерации изображений — это Retrieval-Augmented Diffusion Models (RDM), который вводит полу-параметрический подход к синтезу изображений. В то время как традиционные диффузионные модели хранят все выученные визуальные знания внутри своих нейронных сетевых параметров, RDM полагается на внешнюю базу данных изображений:

Извлеченные ближайшие соседи в иллюстративном псевдо-запросе в RDM*.

Извлеченные ближайшие соседи в иллюстративном псевдо-запросе в RDM*.

Во время обучения модель извлекает ближайших соседей (визуально или семантически подобные изображения) из внешней базы данных, чтобы руководить процессом генерации. Это позволяет модели обусловить свои выходные данные на реальных визуальных экземплярах.

Процесс извлечения работает на основе вложений CLIP, предназначенных для того, чтобы извлеченные изображения имели значимые сходства с запросом, и также для предоставления новых знаний, чтобы улучшить генерацию.

Этот подход снижает зависимость от параметров, облегчая использование меньших моделей, которые достигают конкурентных результатов без необходимости обширных наборов данных для обучения.

Подход RDM поддерживает пост-хок модификации: исследователи могут заменить базу данных во время вывода, позволяя выполнять нулевую адаптацию к новым стилям, доменам или даже совершенно другим задачам, таким как стилизация или класс-условный синтез.

В нижних рядах мы видим ближайших соседей, вовлеченных в процесс диффузии в RDM*.

В нижних рядах мы видим ближайших соседей, вовлеченных в процесс диффузии в RDM*.

Ключевым преимуществом RDM является его способность улучшать генерацию изображений без необходимости повторного обучения модели. Изменяя базу данных извлечения, модель может обобщаться на новые концепции, на которые она не была явно обучена. Это особенно полезно для приложений, где сдвиги домена возникают, такие как генерация медицинских изображений на основе эволюционирующих наборов данных или адаптация моделей текст-изображение для творческих приложений.

Однако отрицательно, методы извлечения такого типа зависят от качества и актуальности внешней базы данных, что делает курирование данных важным фактором для достижения высококачественных генераций; и этот подход остается далеко от эквивалента RAG-интеракций, типичных для коммерческих LLM.

ReMoDiffuse

ReMoDiffuse — это модель диффузии движения с извлечением, предназначенная для генерации 3D-человеческого движения. В отличие от традиционных моделей движения, которые полагаются исключительно на выученные представления, ReMoDiffuse извлекает соответствующие образцы движения из большого набора данных движения и интегрирует их в процесс денойзинга, в схему, подобную RDM (см. выше).

Сравнение RAG-аугментированного ReMoDiffuse (справа) с предыдущими методами. Источник: https://arxiv.org/pdf/2304.01116

Сравнение RAG-аугментированного ReMoDiffuse (справа) с предыдущими методами. Источник: https://arxiv.org/pdf/2304.01116

Это позволяет модели генерировать последовательности движения, предназначенные для того, чтобы быть более естественными и разнообразными, а также семантически верными текстовым подсказкам.

ReMoDiffuse использует инновационный гибридный механизм извлечения, который выбирает последовательности движения на основе как семантических, так и кинематических сходств, с целью обеспечения того, чтобы извлеченные движения были не только тематически актуальными, но и физически правдоподобными при интеграции в новую генерацию.

Модель затем уточняет эти извлеченные образцы с помощью трансформера, модулированного семантикой, который выборочно включает знания из извлеченных движений, сохраняя при этом характерные качества сгенерированной последовательности:

Схема конвейера ReMoDiffuse.

Схема конвейера ReMoDiffuse.

Техника смешивания условий проекта усиливает способность модели обобщаться на различные подсказки и условия извлечения, балансируя извлеченные образцы движения с текстовыми подсказками во время генерации и регулируя, сколько веса каждый источник получает на каждом шаге.

Это может помочь предотвратить нереалистичные или повторяющиеся выходные данные, даже для редких подсказок. Это также решает проблему чувствительности к масштабу, которая часто возникает в техниках руководства классификатора, обычно используемых в диффузионных моделях.

RA-CM3

В 2023 году в Стэнфорде была опубликована работа по Retrieval-Augmented Multimodal Language Modeling (RA-CM3), которая позволяет системе получить доступ к реальному миру информации во время вывода:

Модель Retrieval-Augmented Multimodal Language Modeling (RA-CM3) Стэнфорда использует изображения, полученные из интернета, для дополнения процесса генерации, но остается прототипом без публичного доступа. Источник: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

Модель Retrieval-Augmented Multimodal Language Modeling (RA-CM3) Стэнфорда использует изображения, полученные из интернета, для дополнения процесса генерации, но остается прототипом без публичного доступа. Источник: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

RA-CM3 интегрирует полученные текст и изображения в конвейер генерации, улучшая как генерацию текст-изображение, так и генерацию изображение-текст. Используя CLIP для извлечения и трансформер в качестве генератора, модель обращается к соответствующим мультимодальным документам перед составлением выходных данных.

Бенчмарки на MS-COCO показывают заметные улучшения по сравнению с DALL-E и аналогичными системами, достигая 12-балльного Fréchet Inception Distance (FID) снижения, при этом вычислительная стоимость намного ниже.

Однако, как и в случае с другими подходами, основанными на извлечении, RA-CM3 не без проблем интегрирует свои полученные знания. Вместо этого он наложивает новые данные на свою предварительно обученную сеть, подобно LLM, дополняющей ответы результатами поиска. Хотя этот метод может улучшить фактическую точность, он не заменяет необходимость обновлений обучения в доменах, где требуется глубокий синтез.

Кроме того, практическая реализация этой системы не была выпущена, даже на платформе API.

RealRAG

Новый выпуск из Китая, и тот, который привел к этому обзору RAG-аугментированных генеративных систем изображений, называется Retrieval-Augmented Realistic Image Generation (RealRAG).

Внешние изображения, извлеченные в RealRAG (внизу в середине).

Внешние изображения, извлеченные в RealRAG (внизу в середине). Источник: https://arxiv.o7rg/pdf/2502.00848

RealRAG извлекает фактические изображения соответствующих объектов из базы данных, отобранной из публично доступных наборов данных, таких как ImageNet, Stanford Cars, Stanford Dogs и Oxford Flowers. Затем он интегрирует извлеченные изображения в процесс генерации, решая пробелы в знаниях модели.

Ключевым компонентом RealRAG является само-рефлексивное контрастное обучение, которое обучает модель извлечения находить информативные ссылочные изображения, а не просто визуально подобные.

Авторы заявляют:

«Наш ключевой вывод заключается в том, чтобы обучить извлекатель, который извлекает изображения, находящиеся вне пространства генерации генератора, но близкие к представлению текстовых подсказок.

«Для этого мы сначала генерируем изображения из заданных текстовых подсказок, а затем используем сгенерированные изображения в качестве запросов для извлечения наиболее релевантных изображений в базе данных реальных объектов. Эти наиболее релевантные изображения используются в качестве отражающих отрицательных примеров.»

Этот подход гарантирует, что извлеченные изображения вносят пропущенные знания в процесс генерации, а не подкрепляют существующие предубеждения модели.

Слева, извлеченное ссылочное изображение; в центре, без RAG; справа, с использованием извлеченного изображения.

Слева, извлеченное ссылочное изображение; в центре, без RAG; справа, с использованием извлеченного изображения.

Однако зависимость от качества извлечения и покрытия базы данных означает, что его эффективность может варьироваться в зависимости от наличия высококачественных ссылок. Если соответствующее изображение не существует в наборе данных, модель может все равно испытывать трудности с незнакомыми концепциями.

RealRAG — это очень модульная архитектура, предлагающая совместимость с несколькими другими генеративными архитектурами, включая модели на основе U-Net, DiT и автoregressive.

В целом извлечение и обработка внешних изображений добавляют вычислительную нагрузку, и производительность системы зависит от того, как хорошо механизм извлечения обобщается на различные задачи и наборы данных.

Заключение

Это представительный, а не исчерпывающий обзор изображений, извлекающих мультимодальные генеративные системы. Некоторые системы этого типа используют извлечение исключительно для улучшения понимания зрения или курирования наборов данных, среди других различных мотивов, а не для генерации изображений. Один из примеров — Internet Explorer.

Многие других проектов RAG, интегрированных в литературе, остаются не выпущенными. Прототипы, с только опубликованными исследованиями, включают Re-Imagen, который — несмотря на свое происхождение от Google — может получить доступ только к изображениям из локальной пользовательской базы данных.

Кроме того, в ноябре 2024 года Baidu анонсировала Image-Based Retrieval-Augmented Generation (iRAG), новую платформу, которая использует извлеченные изображения «из базы данных». Хотя iRAG, как сообщается, доступен на платформе Ernie, кажется, что нет дальнейших подробностей об этом процессе извлечения, который, по-видимому, полагается на локальную базу данных (т. е. локальную для сервиса и не直接 доступную пользователю).

Дальнейшее, в 2024 году работа Unified Text-to-Image Generation and Retrieval предлагает еще один метод RAG, использующий внешние изображения для дополнения результатов во время генерации — снова из локальной базы данных, а не из ад-хок интернет-источников.

Волнение вокруг RAG-аугментации в генерации изображений, вероятно, будет сосредоточено на системах, которые могут включать интернет-источники или пользовательские изображения непосредственно в процесс генерации и которые позволяют пользователям участвовать в выборе или источниках изображений.

Однако это является значительной проблемой по至少 двум причинам; во-первых, потому что эффективность таких систем обычно зависит от глубоко интегрированных отношений, сформированных во время ресурсоемкого процесса обучения; и во-вторых, потому что проблемы безопасности, законности и авторских прав, как упоминалось ранее, делают эту функцию маловероятной для API-управляемой веб-службы и для коммерческого развертывания в целом.

* Источник: https://proceedings.neurips.cc/paper_files/paper/2022/file/62868cc2fc1eb5cdf321d05b4b88510c-Paper-Conference.pdf Первая публикация — вторник, 4 февраля 2025 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai