Взгляд Anderson
Использование зрительных галлюцинаций ИИ для оценки реализма изображений

Новые исследования из России предлагают неортодоксальный метод обнаружения нереалистичных изображений, сгенерированных ИИ, – не улучшая точность крупных моделей видения и языка (LVLM), а намеренно используя их тенденцию к галлюцинациям.
Новый подход извлекает несколько ‘атомарных фактов’ об изображении с помощью LVLM, затем применяет естественно-языковое вывод (NLI), чтобы систематически измерить противоречия между этими утверждениями – эффективно превращая недостатки модели в диагностический инструмент для обнаружения изображений, которые противоречат здравому смыслу.

Два изображения из набора данных WHOOPS! вместе с автоматически сгенерированными утверждениями моделью LVLM. Левое изображение реалистично, что приводит к последовательным описаниям, в то время как необычное правое изображение вызывает у модели галлюцинации, производящие противоречивые или ложные утверждения. Источник: https://arxiv.org/pdf/2503.15948
Когда модель LVLM попросили оценить реализм второго изображения, она может увидеть, что что-то не так, поскольку изображенный верблюд имеет три горба, что неизвестно в природе.
Однако модель LVLM изначально смешивает >2 горба с >2 животных, поскольку это единственный способ увидеть три горба на одном ‘изображении верблюда’. Затем она начинает галлюцинировать что-то еще более невероятное, чем три горба (т.е. ‘два головы’) и никогда не описывает то, что, кажется, вызвало ее подозрения – невероятный дополнительный горб.
Исследователи новой работы обнаружили, что модели LVLM могут выполнять эту оценку родным образом, и наравне с (или лучше, чем) моделями, которые были настроены для задачи этого типа. Поскольку настройка сложна, дорога и довольно хрупка в плане последующей применимости, открытие родного использования одного из главных препятствий в текущей революции ИИ является освежающим поворотом на общих тенденциях в литературе.
Открытая оценка
Авторы утверждают, что важность подхода заключается в том, что он может быть развернут с открытыми框架ми. Хотя продвинутая и высокоинвестиционная модель, такая как ChatGPT, может (статья признает) потенциально предложить лучшие результаты в этой задаче, очевидная ценность литературы для большинства из нас (и особенно для хобби и VFX-сообществ) заключается в возможности включения и разработки новых прорывов в местных реализациях; с другой стороны, все, что предназначено для проприетарной коммерческой системы API, подлежит отзыву, произвольным повышениям цен и политикам цензуры, которые более вероятно отражают корпоративные проблемы компании, чем потребности и обязанности пользователя.
Новая статья озаглавлена Не боритесь с галлюцинациями, используйте их: оценка реализма изображения с помощью NLI над атомарными фактами и исходит от пяти исследователей из Сколковского института науки и технологий (Сколтех), Московского института физики и технологий, а также российских компаний MTS AI и AIRI. Работа имеет сопровождающую страницу GitHub.
Метод
Авторы используют израильско-американский набор данных WHOOPS! для проекта:

Примеры невозможных изображений из набора данных WHOOPS! Замечательно, как эти изображения собирают правдоподобные элементы, и что их невероятность должна быть рассчитана на основе конкатенации этих несовместимых аспектов. Источник: https://whoops-benchmark.github.io/












