Взгляд Anderson
Уменьшение галлюцинаций в изображениях ИИ путем их преувеличения

Модели компьютерного зрения в стиле ChatGPT часто «галлюцинируют» элементы, которые не принадлежат изображению. Новый метод уменьшает эти ошибки, показывая модели преувеличенные версии её собственных галлюцинаций, основанные на подписях, — а затем прося её попробовать снова. Этот подход не требует переобучения или дополнительных данных и может быть применён к широкому спектру моделей и их типов.
A new publication from China offers an interesting take on the annoyingly persistent problem of галлюцинаций in AI-generated image and videos – elements that clearly should not be in the image, based on the user’s request and input.
In essence, the system takes an image and lets the model describe it, as usual; it then turns that caption into a новое изображение using a text-to-image model – and any extra objects or details in this second image will be direct representations of the model’s initial hallucinations. Then, by comparing the original and the generated images, the system gently steers the model away from those errors the next time it tries:

Иллюстрация того, как новый метод выявляет и уменьшает галлюцинации в подписьях к изображениям. Обычная модель описывает птиц, которых нет на оригинальном изображении, что приводит к реконструированному изображению, где они добавляются. Эти ошибки отмечены красным. В отличие от этого, предлагаемый метод избегает этих вымышленных деталей, сохраняя подпись конкретной и плавной. Source: https://arxiv.org/pdf/2509.21997
The method begins by showing the model real images and having it describe them, including some descriptions featuring objects or details that are на самом деле отсутствуют. These hallucinated captions are then used to generate synthetic images that make the errors easier to spot. By comparing the real and generated images, the system learns which internal patterns in the model tend to produce made-up content.
Once these error patterns are identified, they can be stored and used later. When the model is given a new image, the system will adjust its internal signals during captioning, отталкивая её от известных шаблонов, вызывающих галлюцинации. This works in a single pass and does not require extra data, retraining, or any new image generation at test time.
Запутанная сеть
В приведённом выше примере из статьи мы видим, что запутанность вероятно отвечает за добавление «птиц» в исходное изображение, хотя первое изображение, кажется, не содержит птиц.
Запутанность возникает, когда модель настойчиво связывает определённые концепции с другими концепциями, просто потому что эти две (или более) концепции часто встречаются вместе в исходном распределении данных, на котором модель обучалась. В данном случае модель могла видеть множество изображений planes+birds, вызывая ассоциацию, не применимую к конкретному изображению, но всё же проникающую в полученную подпись.
Хотя запутанность можно смягчить, прекращая обучение раньше (что, как правило, делает модель максимально гибкой и адаптируемой), это также уменьшает детализацию и разрешение всех обученных концепций, оставляя разработчика модели перед вечной дилеммой: создать модель, которая очень гибкая и не запутанная; или создать модель, более мощно генерирующую, но также более склонную к появлению «связанных» галлюцинаций?
Если бы качество подписи и внимание к деталям при отборе оригинальных данных для генеративной модели были лучше чем обычно позволяют логистические ограничения, подписи ко всем исходным изображениям содержали бы подробное описание каждого объекта на каждой картинке, чтобы обученная модель могла разместить их в виде отдельных и не запутанных записей в её latent space.
В текущем виде самоудовлетворительная практика SEO captioning, в сочетании с тем, что ad hoc гипермасштабный веб-скрейпинг остается лучшим источником для обучения действительно мощных генеративных моделей, приводит к тому, что подписи к изображениям значительно отстают от этого стандарта:

Иллюстрация того, как слабые подписи ограничивают полезность изображений LAION для обучения моделей, таких как Stable Diffusion. Многие текстовые метки поверхностны, расплывчаты или оптимизированы под SEO, а не под точное описание, что усложняет модели изучение детализированных визуальных концепций, таких как черты лица. (Оригинальный источник был https://rom1504.github.io/, теперь не существует).
Следовательно, поскольку фундаментальное решение вряд ли когда‑либо будет практичным, снижение галлюцинаций LLM/VLM с помощью обходных решений и компромиссов теперь стало сильной подсекторой в литературе.
Новая китайская техника, раскрытая на этой неделе, по словам авторов, была протестирована на различных архитектурах в разнообразных условиях и может указывать на полезный способ снижения «загрязнения галлюцинациями».
They say:
‘Обширные эксперименты на множестве бенчмарков показывают, что наш метод значительно снижает галлюцинации на уровнях объектов, атрибутов и отношений, при этом в значительной степени сохраняет полноту и подпись [richness].’
Статья новая статья называется Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors, и написана тремя исследователями из Университета науки и технологий Китая и Нанкинского университета.
Метод
Авторы разработали сквозной конвейер, показанный ниже, предназначенный для выявления и подавления галлюцинаций в подписьях к изображениям:

Иллюстрация полного конвейера. Модель «зрение‑язык» сначала генерирует подпись из входного изображения, которая может содержать галлюцинированный контент. Эта подпись затем используется для создания реконструированного изображения с помощью модели «текст‑в‑изображение», что упрощает обнаружение галлюцинаций. Векторы признаков как оригинального, так и реконструированного изображений извлекаются и используются для направления корректировок внутри декодера, помогая модели подавлять галлюцинированные детали, сохраняя качество подписи.
Начиная с реального входного изображения, модель «зрение‑язык» генерирует описательную подпись, которая может содержать вымышленные объекты или отношения. Эта подпись затем передаётся в генератор «текст‑в‑изображение», чтобы создать реконструированное изображение, точно отображающее то, что описано в подписи. Сравнение этого реконструированного изображения с оригиналом делает поддельный контент очевидным и измеримым, превращая тонкие ошибки в тексте в видимые различия, которые система может обнаружить и уменьшить.
Чтобы направить модель от «выдумывания» деталей, система сравнивает две версии одного и того же изображения: оригинал и реконструированное, основанное на подписи. Каждое изображение преобразуется в компактный embedding, который фиксирует его содержание.
Оригинальное изображение служит надёжной ссылкой, тогда как реконструированное подчёркивает, где могли появиться галлюцинации. Путём корректировки внутренних представлений, приближая их к оригиналу и удаляя от реконструированного, модель автоматически учится исправлять себя. Поскольку этот процесс не опирается на вручную настроенные правила или внешние данные, он остаётся полностью self-supervised.
The paper states:
‘Галлюцинации в MLLM по своей природе трудно обнаружить, потому что они лингвистически корректны и часто неотличимы от достоверных описаний на уровне текста. Несоответствие заключается не в правдоподобии языка, а в несоответствии визуальным доказательствам, к которым модель обычно нечувствительна.’
‘Для решения этой проблемы мы вводим механизм раскрытия галлюцинаций, который использует генеративную реконструкцию для преобразования скрытых несоответствий в явные и наблюдаемые сигналы.’
Имея входное изображение и его подпись, система использует модель FLUX.1-dev «текст‑в‑изображение» для воссоздания изображения только по подписи. Это воссозданное изображение, как правило, преувеличивает смысл подписи, делая любые ложные детали более очевидными. Эти усиленные ошибки затем служат полезными сигналами, помогающими модели распознавать и исправлять собственные ошибки.
Для проверки их подхода авторы внедрили галлюцинации в подписи и использовали модель «текст‑в‑изображение» для генерации реконструированных изображений. Эти изображения затем были повторно подписаны с помощью LLaVA, и была оценена семантическая схожесть между оригинальными и галлюцинированными подписями:

Иллюстрация того, как механизм усиления галлюцинаций делает тонкие ошибки заметными. Каждая точка показывает сходство между подписями оригинального и восстановленного изображений для одной пары изображение‑подпись. Оранжевая линия представляет сходство, измеренное напрямую между оригинальными и галлюцинированными подписями, которое остаётся высоким и скрывает небольшие ошибки; синяя линия представляет сходство после восстановления, которое резко падает, показывая, что процесс превращает скрытые галлюцинации в чёткие семантические маркеры, которые можно обнаружить и исправить.
Сходство резко падает после восстановления, показывая, что процесс делает тонкие ошибки более обнаружимыми.
Данные и тесты
Проверка эффективности нового метода включала использование трёх подходящих бенчмарков: Оценка галлюцинаций подписи с релевантностью изображения (CHAIR); Оценка MLLM бенчмарк (MME); и Оценка объектного зондирования на основе пула (POPE).

Из статьи о выпуске CHAIR: примеры галлюцинированных объектов, сгенерированных двумя ведущими системами подписи, TopDown и NBT, где каждая модель придумывает визуальные элементы, которых на самом деле нет на изображении, такие как ноутбуки, раковины или серфборды. Источник: https://arxiv.org/pdf/1809.02156
Стандартные метрики, такие как hallucination rate или recall могут вводить в заблуждение, поскольку модель может избегать галлюцинаций, просто генерируя короткие или расплывчатые подписи. Чтобы учесть компромисс между полнотой и галлюцинациями, была использована комбинированная метрика под названием Hallucination and Recall (HAR@β), которая оценивает подписи как по точности, так и по полноте, и позволяет регулировать баланс в зависимости от того, что важнее — избегать ошибок или включать больше деталей.
POPE использовался для оценки контекстно-зависимых галлюцинаций объектов, а MME — для оценки галлюцинаций на уровне атрибутов, при этом обе задачи формулировались как задачи с ответом Да/Нет.
Эксперименты проводились на различных репрезентативных наборах данных с использованием упомянутой модели Flux и её варианта LLaVA-v1.5-7B. Использованные наборы данных: Microsoft COCO; A-OKVQA; и GQA.
Латентное редактирование было выполнено для второго слоя моделей в соответствии с prior related work, при этом гиперпараметры и температура оставались одинаковыми для всех моделей.
Начальные результаты по CHAIR представлены ниже*:

Результаты на бенчмарке CHAIR по снижению галлюцинаций, оценённые с использованием нескольких метрик.
Из этих результатов авторы комментируют:
‘[Our method consistently outperforms other baselines on both CHAIRS and CHAIRI[*], демонстрируя его превосходную эффективность в подавлении галлюцинаций. Тем временем, хотя почти все методы неизбежно снижают полноту при подавлении галлюцинаций, отражая компромисс между достоверностью и информативностью, наш подход достигает наименьшего падения.
‘Это демонстрирует, что наш метод охватывает широкий спектр объектов из реального набора. С метрикой HAR@β наш метод достигает наивысшего балла, подчёркивая его способность уменьшать галлюцинации, сохраняя охват.’
Исследователи объясняют эти сильные результаты двойным надзором, при котором чистая семантика исходного изображения усиливалась, одновременно подавлялись вводящие в заблуждение сигналы из реконструированного изображения. Поскольку корректировка была направлена только на направление, связанное с галлюцинациями, остальная часть представления оставалась неизменной, позволяя системе исправлять ошибки без потери деталей или информативности.

Сравнение производительности на бенчмарке POPE при различных конфигурациях и наборах данных.












