Взгляд Anderson

Использование зрительных галлюцинаций ИИ для оценки реализма изображений

mm
Добавьте Unite.AI в избранные источники в Google
A selection of images from the WHOOPS! dataset (https://huggingface.co/datasets/nlphuji/whoops), behind central images from the paper 'Don’t Fight Hallucinations, Use Them: Estimating Image Realism using NLI over Atomic Facts' (https://arxiv.org/pdf/2503.15948).

Новые исследования из России предлагают неортодоксальный метод обнаружения нереалистичных изображений, сгенерированных ИИ, – не улучшая точность крупных моделей видения и языка (LVLM), а намеренно используя их тенденцию к галлюцинациям.

Новый подход извлекает несколько ‘атомарных фактов’ об изображении с помощью LVLM, затем применяет естественно-языковое вывод (NLI), чтобы систематически измерить противоречия между этими утверждениями – эффективно превращая недостатки модели в диагностический инструмент для обнаружения изображений, которые противоречат здравому смыслу.

Два изображения из набора данных WHOOPS! вместе с автоматически сгенерированными утверждениями моделью LVLM. Левое изображение реалистично, что приводит к последовательным описаниям, в то время как необычное правое изображение вызывает у модели галлюцинации, производящие противоречивые или ложные утверждения. Источник: https://arxiv.org/pdf/2503.15948

Два изображения из набора данных WHOOPS! вместе с автоматически сгенерированными утверждениями моделью LVLM. Левое изображение реалистично, что приводит к последовательным описаниям, в то время как необычное правое изображение вызывает у модели галлюцинации, производящие противоречивые или ложные утверждения. Источник: https://arxiv.org/pdf/2503.15948

Когда модель LVLM попросили оценить реализм второго изображения, она может увидеть, что что-то не так, поскольку изображенный верблюд имеет три горба, что неизвестно в природе.

Однако модель LVLM изначально смешивает >2 горба с >2 животных, поскольку это единственный способ увидеть три горба на одном ‘изображении верблюда’. Затем она начинает галлюцинировать что-то еще более невероятное, чем три горба (т.е. ‘два головы’) и никогда не описывает то, что, кажется, вызвало ее подозрения – невероятный дополнительный горб.

Исследователи новой работы обнаружили, что модели LVLM могут выполнять эту оценку родным образом, и наравне с (или лучше, чем) моделями, которые были настроены для задачи этого типа. Поскольку настройка сложна, дорога и довольно хрупка в плане последующей применимости, открытие родного использования одного из главных препятствий в текущей революции ИИ является освежающим поворотом на общих тенденциях в литературе.

Открытая оценка

Авторы утверждают, что важность подхода заключается в том, что он может быть развернут с открытыми框架ми. Хотя продвинутая и высокоинвестиционная модель, такая как ChatGPT, может (статья признает) потенциально предложить лучшие результаты в этой задаче, очевидная ценность литературы для большинства из нас (и особенно для хобби и VFX-сообществ) заключается в возможности включения и разработки новых прорывов в местных реализациях; с другой стороны, все, что предназначено для проприетарной коммерческой системы API, подлежит отзыву, произвольным повышениям цен и политикам цензуры, которые более вероятно отражают корпоративные проблемы компании, чем потребности и обязанности пользователя.
Новая статья озаглавлена Не боритесь с галлюцинациями, используйте их: оценка реализма изображения с помощью NLI над атомарными фактами и исходит от пяти исследователей из Сколковского института науки и технологий (Сколтех), Московского института физики и технологий, а также российских компаний MTS AI и AIRI. Работа имеет сопровождающую страницу GitHub.

Метод

Авторы используют израильско-американский набор данных WHOOPS! для проекта:

Примеры невозможных изображений из набора данных WHOOPS! Замечательно, как эти изображения собирают правдоподобные элементы, и что их невероятность должна быть рассчитана на основе конкатенации этих несовместимых аспектов. Источник: https://whoops-benchmark.github.io/

Примеры невозможных изображений из набора данных WHOOPS! Замечательно, как эти изображения собирают правдоподобные элементы, и что их невероятность должна быть рассчитана на основе конкатенации этих несовместимых аспектов. Источник: https://whoops-benchmark.github.io/


Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai