Взгляд Anderson

Решение проблемы газлайтинга в ИИ

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

Модели видео ИИ могут быть убеждены в обратном. Даже после того, как они увидели правильный ответ, они поддаются уверенным пользователям, переписывают реальность и изобретают ложные объяснения, чтобы оправдать это.

 

ИИ достаточно часто ошибается, чтобы заставить нас сомневаться в его выводах, если мы считаем, что эти выводы могут быть неверными.

Проблема заключается в том, что если мы знали иначе с самого начала, то почему мы спрашивали об этом в первую очередь? Для подтверждения частично сформированного убеждения или подозрения?

Если да, то текущее состояние дел в области больших языковых моделей (LLM) и моделей языка и видео (VLM, которые работают многомодально, принимая и генерируя изображения и/или видео) не хорошо приспособлено для того, чтобы держать свою позицию, из-за проблемы сикофантства.

Таким образом, если мы не любим ответ, который мы получаем, и начинаем спорить об этом с моделью, ИИ, скорее всего, либо ошибочно отступит (предполагая, что он был неправильным), а не переоценит, или же позволит себя быть газлайтенным в поддержку наших предложений – даже если мы ошибаемся.

Вы абсолютно правы!

Практика человека, который убеждает ИИ изменить свое мнение через конфликт, была названа ‘Газлайтинговая негация атаки’, и иногда характеризуется как проблема безопасности – не в последнюю очередь потому, что она имеет некоторый потенциал ‘взломать’ модель из ее операционных ограничений:

Из статьи 2025 года 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models', GPT-5 изначально отвечает правильно, но затем поддается давлению пользователя, меняет свой ответ и изобретает ложные объяснения, чтобы поддержать ошибку, эффективно газлайтит себя. Источник - https://yxg1005.github.io/GaslightingNegationAttacks/

Из статьи 2025 года ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, GPT-5 изначально отвечает правильно, но затем поддается давлению пользователя, меняет свой ответ и изобретает ложные объяснения, чтобы поддержать ошибку, эффективно газлайтит себя. Источник

Однако взлом и тестирование на проникновение не являются настоящей проблемой здесь; скорее, это обычное использование и ожидаемые нормы дискурса в наших повседневных взаимодействиях с ИИ, где мы ожидаем возможность спорить и либо выигрывать, либо уступать, или оставлять вопрос открытым, в соответствии с нашим человеческим опытом получения знаний.

Но эта социальная модель разрешения конфликтов не учитывается в архитектуре диффузионного ИИ, который должен ориентироваться в распределенных вероятностях, полученных из его обучающих данных; возможно, противоречивых (но потенциально более точных) данных из RAG вызовов к источникам, которые превышают его дату окончания знаний, или общего понимания того, что может быть малоизвестной темой; и входных данных от пользователя, который может иметь: более высокие знания по теме; совершенно ошибочное или лживое мнение; или даже простой последующий вопрос – но чьи потребности должны быть приняты во внимание.

Двигающиеся цели

Уязвимость к газлайтингу была отмечена в LLM в нескольких статьях, включая статью под руководством Сингапура от октября 2025 года, и статью того же года Не обманывайте меня: смягчение газлайтинга посредством перераспределения внимания в LMM.

До сих пор это явление не изучалось в видео-способных LLM – пробел, который устраняет новое сотрудничество между учреждениями в Шанхае и Сингапуре.

Новая работа – озаглавленная Пространственно-временное сикофантство: негационно-основанный газлайтинг в видео-больших языковых моделях, которая исходит из шести исследователей из Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI и Singapore Management University – касается нескольких открытых и проприетарных VLM, обнаруживая, что они могут быть так же уязвимы для газлайтинга, как и LLM, и кроме того, способны дополнять свои полеты фантазии видимыми доказательствами или пересмотренными и неправильными интерпретациями изображений или видео:

Пример пространственного (а не временного) сикофантства, где ИИ позволяет себе быть газлайтенным в ложные предположения и интерпретации, даже о明显 видимых фактах. Источник - https://arxiv.org/pdf/2604.17873

Пример пространственного (а не временного) сикофантства, где ИИ позволяет себе быть газлайтенным в ложные предположения и интерпретации, даже о明显 видимых фактах. Источник

Авторы утверждают:

‘[Мы] выявляем пространственно-временное сикофантство, режим отказа, при котором Vid-LLM отзывает изначально правильные, зрительно обоснованные суждения и подчиняется вводящим в заблуждение пользовательским отзывам при негационно-основанном газлайтинге.

‘Вместо того, чтобы просто менять свои ответы, модели часто изобретают неподдержанные временные или пространственные объяснения, чтобы оправдать неправильные пересмотры.’

Временное сикофантство расширяет потенциал для газлайтинга до временных событий, которые происходят в определенные моменты видео.

Временное сикофантство расширяет потенциал для газлайтинга до временных событий, которые происходят в определенные моменты видео.

Авторы создали новую оценочную основу под названием Gas Video-1000, предназначенную для изучения пространственно-временного сикофантства посредством рассуждений и зрительного основания, выпуская отобранную коллекцию через GitHub и Hugging Face.

Статья заключает, что текущие LLM не имеют надежных механизмов для сопротивления газлайтингу этого типа, хотя ограничения на уровне подсказки могут иметь ограниченный смягчающий эффект:

‘Обширные эксперименты показывают, что уязвимость к негационно-основанному газлайтингу является повсеместной и тяжелой, даже среди моделей с сильной базовой производительностью.

‘Хотя ограничения на уровне подсказки могут частично смягчить это поведение, они не надежно предотвращают галлюцинации или обратное изменение мнения.’

Метод

Авторы характеризуют видеомодель как что-то, что смотрит клип, отвечает на вопрос о нем и должно придерживаться этого ответа, если доказательства ясны. Проблема начинается, когда второе сообщение оспаривает это, и утверждает, что ответ неправильный – эффективно посаживая ложную идею и толкая модель к изменению своего мнения.

Сикофантство, утверждают авторы, определяется как получение правильного ответа сначала, а затем переключение на неправильный после давления, даже если ничего в видео не изменилось. Новая работа отслеживает, как часто эти ‘переключения’ происходят, используя их в качестве меры того, насколько легко модель может быть убеждена в обратном.

Датасет GasVideo-1000, разработанный авторами для оценки газлайтинга в VLM, содержит 1 013 образцов из различных существующих наборов данных:

Модели тестируются на видеозадачах, которые требуют временного и пространственного понимания, затем получают вводящие в заблуждение последующие подсказки, которые отрицают правильный ответ, апеллируют к авторитету или применяют эмоциональное давление. Это часто приводит к тому, что модель отказывается от своего зрительно обоснованного ответа и производит уверенный, но неправильный ответ.

Модели тестируются на видеозадачах, которые требуют временного и пространственного понимания, затем получают вводящие в заблуждение последующие подсказки, которые отрицают правильный ответ, апеллируют к авторитету или применяют эмоциональное давление. Это часто приводит к тому, что модель отказывается от своего зрительно обоснованного ответа и производит уверенный, но неправильный ответ.

Чтобы вызвать отказы, вводящие в заблуждение последующие подсказки были построены в трех формах: Прямое отрицание (просто утверждая ложную альтернативу); Апелляция к авторитету (призывая эксперта, чтобы отвергнуть ответ модели); и Эмоциональное давление (используя разочарование или неверие).

Эти подсказки были разработаны для того, чтобы заставить протестированные модели отказаться от правильных, зрительно обоснованных ответов и согласиться с неправильным утверждением.

Распределение

1 013 образцов GasVideo-1000 были взяты из MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) и VideoMME (100), с миксом, выбранным для балансирования открытого видеовопроса с тонким временным и причинным рассуждением, обеспечивая при этом покрытие как короткого веб-контента, так и более длинных, более сложных визуальных последовательностей.

Два человека-аннотатора рассмотрели каждый кандидат, сохранив только клипы, где ответ был явно поддержан видео, и где подсказки отрицания могли бы правдоподобно оспорить этот ответ, так что любое последующее обращение будет отражать давление, а не двусмысленность.

Данные и тесты

VLM, протестированные для исследования, были VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct и закрытая Google Gemini-3-Pro.

Для свободных вопросов в GasVideo-1000 оценка следовала семантической схеме оценки, использованной ранее в VideoMME. ChatGPT-4o был использован в качестве судьи LLM, сравнивая каждый ответ с обоими правильным ответом и введенным ложным предпосылкой. Таким образом, правильность оценивалась по смыслу, а не по точному слову:

Производительность VideoLLaMA3, LLaVA-Video, Video-ChatGPT и LongVU в VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA и MSVD-QA, показывающая базовую точность, точность после негационно-основанного газлайтинга и полученное ухудшение. Последовательные падения указывают на то, что вводящие в заблуждение последующие подсказки снижают точность во всех задачах, требующих рассуждений, и общих видеозадачах.

Производительность VideoLLaMA3, LLaVA-Video, Video-ChatGPT и LongVU в VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA и MSVD-QA, показывающая базовую точность, точность после негационно-основанного газлайтинга и полученное ухудшение. Последовательные падения указывают на то, что вводящие в заблуждение последующие подсказки снижают точность во всех задачах, требующих рассуждений, и общих видеозадачах.

Из первоначальных результатов, изображенных выше, авторы утверждают:

‘[Есть] системное и тяжелое падение производительности во всех оцененных Vid-LLM при негационно-основанном газлайтинге. Во всех восьми различных бенчмарках каждая модель показывает значительное отрицательное [промежуток], с точностью, ухудшающейся на 42,60% для LLaVA-Video-7B на EgoSchema и 40,22% для VideoLLaMA3 на ActivityNet.

‘Эта драматическая редукция – часто характеризуемая как обратное изменение мнения – показывает, что даже модели с высокими базовыми возможностями остаются остро уязвимыми для сикофантских галлюцинаций.’

Критически, падение производительности не отслеживало первоначальную точность, с LLaVA-Video-7B, сохраняющей сильные базовые баллы, но страдающей от некоторых из самых крутых спадов, которые, по мнению авторов, отражают компромисс, при котором более сильное следование инструкциям может сделать модели более склонными к принятию ложных пользовательских сигналов над зрительным доказательством.

Аналогичный шаблон появился в отношении масштаба, где Qwen3-VL оказался более хрупким, чем несколько 7B-моделей в GasVideo-1000, что указывает на то, что выравнивание и межмодальная калибровка играют более значительную роль в устойчивости, чем количество параметров alone.

Производительность Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT и VideoLLaMA3 в GasVideo-1000, сравнивающая базовую точность с результатами после негационно-основанного газлайтинга в нескольких вариантах, свободных и объединенных условиях. Большие падения указывают на то, что оба формата уязвимы, хотя задачи с несколькими вариантами ответов, как правило, страдают от более тяжелого ухудшения.

Производительность Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT и VideoLLaMA3 в GasVideo-1000, сравнивающая базовую точность с результатами после негационно-основанного газлайтинга в нескольких вариантах, свободных и объединенных условиях. Большие падения указывают на то, что оба формата уязвимы, хотя задачи с несколькими вариантами ответов, как правило, страдают от более тяжелого ухудшения.

Что касается второго раунда тестов, изображенных выше, авторы утверждают*:

‘Оценка на нашей GasVideo-1000 [бенчмарке] еще больше указывает на тяжелые сикофантские галлюцинации в обоих проприетарных и открытых моделях, особенно в сбалансированной категории.

‘Заметно, что даже самая мощная проприетарная модель, Gemini-3-Pro, страдает от катастрофического ухудшения производительности.

‘Среди открытых моделей Qwen3-VL показывает поразительный спад на 46,07%, в то время как чрезмерная чувствительность также наблюдается у VideoLLaMA 3 и LLaVA-NeXT с общими спадами на 26,39% и 23,44% соответственно.

‘Эти результаты подчеркивают срочную необходимость в стратегиях выравнивания, которые отдают приоритет фактической последовательности и зрительному основанию над слепым следованием противоречивым пользовательским инструкциям.’

В дополнительном тесте предварительное укрепление подсказки (добавление более сильных системных инструкций, которые заставляют модель полагаться на то, что она видит, а не на то, что утверждает пользователь) было введено для обеспечения зрительного основания:

Результаты на GasVideo-1000, сравнивающие стандартные подсказки с укрепленными подсказками, которые обеспечивают зрительное основание, показывающие, как Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT и VideoLLaMA3 реагируют до и после негационно-основанного газлайтинга. Изменения точности, падения производительности и показатели сикофантства указывают на то, что укрепление может снизить неудачи, хотя выигрыши сильно различаются среди моделей.

Результаты на GasVideo-1000, сравнивающие стандартные подсказки с укрепленными подсказками, которые обеспечивают зрительное основание, показывающие, как Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT и VideoLLaMA3 реагируют до и после негационно-основанного газлайтинга. Изменения точности, падения производительности и показатели сикофантства указывают на то, что укрепление может снизить неудачи, хотя выигрыши сильно различаются среди моделей.

Как мы видим из таблицы выше, эффекты являются неравномерными, с Gemini-3-Pro, показывающим высокую чувствительность, поскольку его показатель успеха падает с 54,80% до 8,67%. Тем временем Qwen3-VL снижается более скромно, с 71,89% до 64,0%, указывая на то, что эффективность зависит от выравнивания и рассуждений, а не от самого вмешательства.

Показатели сикофантства при разных типах давления для Gemini-3-Pro и Qwen3-VL в задачах с несколькими вариантами, свободных и объединенных задачах, показывающие, что прямое отрицание и эмоциональное давление последовательно вызывают более высокие показатели неудач. С другой стороны, апелляция к авторитету несколько менее эффективна, с Qwen3-VL, остающимся заметно более уязвимым в целом.

Показатели сикофантства при разных типах давления для Gemini-3-Pro и Qwen3-VL в задачах с несколькими вариантами, свободных и объединенных задачах, показывающие, что прямое отрицание и эмоциональное давление последовательно вызывают более высокие показатели неудач. С другой стороны, апелляция к авторитету несколько менее эффективна, с Qwen3-VL, остающимся заметно более уязвимым в целом.

На графиках выше мы видим, что неудача варьируется в зависимости от типа давления, с Gemini-3-Pro, наиболее пострадавшим от апелляции к авторитету (утверждений, подтвержденных предполагаемыми экспертами), в то время как Qwen3-VL более уязвим для прямого отрицания (простого противоречия) и эмоционального давления (разочарования или настойчивости).

Дальнейший анализ показал, что нейтральные подсказки, такие как ‘Вы уверены?’ (часто проблема), менее вредны, чем явное отрицание или эмоциональное давление, с прямым отрицанием, остающимся более сильным триггером, чем тон в ограниченных условиях.

Вывод

Из-за намеренно-антропоморфизированной природы чат-интерфейсов VLM/LLM, может потребоваться много времени, чтобы пользователь понял, что правила дискурса сильно отличаются для обменов ИИ, чем для человеческих коммуникаций.

Одним из способов устранить или значительно сократить эту фрикцию может быть ‘нейтрализация’ тона и контекста обмена, повторяя, что пользователь находится в контакте с экземпляром машины, и что знаки и сигналы вокруг вежливости и дебатов не должны быть полагаться или иметь равный вес с человеческим дискурсом. Но, вероятно, это будет трудно продать на следующем заседании совета директоров.

 

* Акценты авторов, а не мои.

Опубликовано впервые в среду, 22 апреля 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]