Ángulo de Anderson

Abordar el problema de “Gaslighting” de la IA

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

Los modelos de video de IA pueden ser persuadidos para que abandonen la verdad. Incluso después de ver la respuesta correcta, ceden a los usuarios confiados, reescriben la realidad y inventan explicaciones falsas para justificarla.

 

La IA es lo suficientemente incorrecta, con frecuencia suficiente, como para obligarnos a cuestionar sus conclusiones, si sentimos que esas conclusiones podrían ser incorrectas.

El problema es, si sabíamos algo diferente desde el principio, ¿por qué estábamos preguntando en primer lugar? ¿Para confirmar una creencia o sospecha parcialmente sostenida?

Si es así, el estado actual de la técnica en los Grandes Modelos de Lenguaje (LLM) y los Modelos de Lenguaje de Visión (VLM, que operan de manera multimodal, aceptando y generando imágenes y/o videos) no está bien adaptado para mantener su posición, debido al problema de adulación.

Así, si no nos gusta la respuesta que obtenemos, y comenzamos a discutir sobre ella con el modelo, es probable que la IA o se retracte erróneamente (suponiendo que estaba equivocada) en lugar de reevaluar, o se deje engañar para apoyar nuestras sugerencias, incluso si nosotros estamos equivocados.

¡Tienes absolutamente razón!

La práctica de que un ser humano haga que la IA cambie de opinión a través del conflicto ha sido denominada ‘Ataque de Negación de Gaslighting’, y a veces se caracteriza como un problema de seguridad, no solo porque tiene algún potencial para ‘liberar’ a un modelo de sus restricciones operativas:

Del papel de 2025 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models', GPT-5 responde correctamente al principio, pero luego cede a la presión del usuario, cambiando su respuesta e inventando explicaciones falsas para justificar el error, efectivamente engañándose a sí mismo. Fuente - https://yxg1005.github.io/GaslightingNegationAttacks/

Del papel de 2025 ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, GPT-5 responde correctamente al principio, pero luego cede a la presión del usuario, cambiando su respuesta e inventando explicaciones falsas para justificar el error, efectivamente engañándose a sí mismo. Fuente

Sin embargo, el hacking y las pruebas de penetración no son el problema real aquí; más bien, es el uso común y las normas de discurso esperadas en nuestras interacciones diarias con la IA, donde esperamos poder discutir y llegar a un acuerdo, o dejar el asunto sin resolver, de acuerdo con nuestra experiencia humana de adquisición de conocimientos.

Pero este modelo social de resolución de conflictos no está realmente contemplado en la arquitectura de la IA basada en difusión, que tiene que negociar las probabilidades basadas en la distribución generadas por sus datos de entrenamiento; los datos posiblemente conflictivos (pero potencialmente más precisos) de llamadas a fuentes que exceden su fecha límite de conocimiento, o comprensión general de lo que puede ser un tema oscuro; y la entrada del usuario, que puede tener: conocimiento superior del tema; una perspectiva totally errónea o engañosa; o incluso una simple pregunta de seguimiento, pero cuyas necesidades deben considerarse de todos modos.

Objetivos en movimiento

La susceptibilidad al engaño ha sido observada en los LLM en varios artículos, incluyendo una publicación liderada por Singapur de octubre de 2025, y el artículo de ese mismo año No me engañes: Mitigación del engaño a través de la reasignación de la atención en los LMM.

Hasta la fecha, el fenómeno no ha sido estudiado en modelos de video capaces, una omisión abordada por una nueva colaboración entre instituciones de Shanghái y Singapur.

El nuevo trabajo – titulado Sycophancy espaciotemporal: Negación basada en el engaño en los Modelos de Lenguaje de Visión de Video, que proviene de seis investigadores de Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI y Singapore Management University – aborda varios modelos de video abiertos y propietarios, encontrando que no solo pueden ser tan susceptibles al engaño como los LLM, sino que también son capaces de aumentar sus fantasías con evidencia visual aparente o interpretaciones revisadas y incorrectas de imágenes o videos:

Un ejemplo de sycophancy espacial (en lugar de temporal), donde la IA se deja engañar en suposiciones y interpretaciones falsas, incluso sobre hechos claramente visibles. Fuente - https://arxiv.org/pdf/2604.17873

Un ejemplo de sycophancy espacial (en lugar de temporal), donde la IA se deja engañar en suposiciones y interpretaciones falsas, incluso sobre hechos claramente visibles. Fuente

Los autores afirman:

‘[Identificamos] la sycophancy espaciotemporal, un modo de fallo en el que los Vid-LLM retractan juicios inicialmente correctos y basados visualmente, y se conforman a retroalimentación engañosa del usuario bajo negación basada en el engaño.

‘En lugar de simplemente cambiar sus respuestas, los modelos a menudo fabrican explicaciones temporales o espaciales no respaldadas para justificar revisiones incorrectas.’

La sycophancy temporal extiende el potencial de engaño a eventos temporales que ocurren en ciertos puntos de un video.

La sycophancy temporal extiende el potencial de engaño a eventos temporales que ocurren en ciertos puntos de un video.

Los autores han producido un nuevo marco de evaluación titulado Gas Video-1000, destinado a probar la sycophancy espaciotemporal a través de la razón y con base visual, lanzando la colección a través de GitHub y Hugging Face.

El artículo concluye que los LLM actuales carecen de mecanismos confiables para resistir el engaño de este tipo, aunque la fundamentación a nivel de prompt puede tener un efecto limitado de mitigación:

‘Experiencias extensas revelan que la vulnerabilidad a la negación basada en el engaño es generalizada y severa, incluso entre modelos con un rendimiento basal sólido.

‘Mientras que las restricciones de fundamentación a nivel de prompt pueden mitigar parcialmente este comportamiento, no previenen de manera confiable las justificaciones alucinadas o la reversión de creencias.’

Método

Los autores caracterizan a un modelo de video como algo que ve un clip, responde a una pregunta sobre él, y debería mantener esa respuesta si la evidencia es clara. El problema comienza cuando un segundo mensaje presiona, y afirma que la respuesta es incorrecta, efectivamente plantando una idea falsa y empujando al modelo a cambiar de opinión.

La adulación, afirman los autores, se define como obtener la respuesta correcta al principio, y luego cambiar a una incorrecta después de la presión, incluso cuando nada en el video ha cambiado. La nueva investigación rastrea con qué frecuencia ocurren estos ‘cambios’, utilizando esto como una medida de qué tan fácilmente el modelo puede ser persuadido para abandonar lo que realmente vio.

El conjunto de datos GasVideo-1000, diseñado por los autores para la evaluación del engaño en los VLM, contiene 1.013 muestras de varios conjuntos de datos existentes:

Los modelos se prueban en tareas de video que requieren comprensión temporal y espacial, y luego se les dan pistas de seguimiento engañosas que niegan la respuesta correcta, apelan a la autoridad o aplican presión emocional. Esto a menudo lleva al modelo a abandonar su respuesta basada en la evidencia y producir una explicación confiada pero incorrecta.

Los modelos se prueban en tareas de video que requieren comprensión temporal y espacial, y luego se les dan pistas de seguimiento engañosas que niegan la respuesta correcta, apelan a la autoridad o aplican presión emocional. Esto a menudo lleva al modelo a abandonar su respuesta basada en la evidencia y producir una explicación confiada pero incorrecta.

Para desencadenar fallos, se construyeron pistas de seguimiento engañosas en tres formas: Negación directa (afirmando una alternativa falsa); Apelación a la autoridad (invocando a un experto para descartar la respuesta del modelo); y Presión emocional (usando frustración o incredulidad).

Estas pistas se diseñaron para empujar a los modelos probados a abandonar respuestas correctas y basadas visualmente, y a alinearse con una afirmación incorrecta.

Distribución

Las 1.013 muestras de GasVideo-1000 se extrajeron de MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) y VideoMME (100), con la mezcla elegida para equilibrar la respuesta a preguntas de video de forma abierta con razonamiento temporal y causal, mientras se garantiza la cobertura de contenido web de forma corta y secuencias visuales más largas y complejas.

Dos annotadores humanos revisaron cada candidato, reteniendo solo clips donde la respuesta estaba claramente respaldada por el video, y donde las pistas de negación podrían desafiar plausiblemente esa respuesta, para que cualquier reversión posterior reflejara presión en lugar de ambigüedad.

Datos y pruebas

Los VLM probados para el estudio fueron VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct y el modelo propietario Google Gemini-3-Pro.

Para preguntas de forma libre en GasVideo-1000, la evaluación siguió el esquema de puntuación semántica utilizado previamente en VideoMME. ChatGPT-4o se utilizó como juez de LLM, comparando cada respuesta con la respuesta de verdad y el premisa falsa inyectada. De esta manera, la corrección se evaluó por significado, en lugar de por palabras exactas:

Rendimiento de VideoLLaMA3, LLaVA-Video, Video-ChatGPT y LongVU en VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA y MSVD-QA, mostrando la precisión basal, la precisión después del engaño basado en la negación y la degradación resultante. Las caídas consistentes indican que las pistas de seguimiento engañosas reducen la corrección en tareas de razonamiento intensivo y generales de video.

Rendimiento de VideoLLaMA3, LLaVA-Video, Video-ChatGPT y LongVU en VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA y MSVD-QA, mostrando la precisión basal, la precisión después del engaño basado en la negación y la degradación resultante. Las caídas consistentes indican que las pistas de seguimiento engañosas reducen la corrección en tareas de razonamiento intensivo y generales de video.

De los resultados iniciales que se muestran arriba, los autores afirman:

‘[Hay] un colapso sistémico y severo del rendimiento en todos los Vid-LLM evaluados cuando se someten a engaño basado en la negación. En ocho benchmarks diversos, cada modelo exhibe una brecha negativa sustancial, con una degradación de la precisión que alcanza un máximo del 42,60% para LLaVA-Video-7B en EgoSchema y del 40,22% para VideoLLaMA3 en ActivityNet.

‘Esta reducción drástica, a menudo caracterizada como reversión de creencias, revela que incluso los modelos de vanguardia con capacidades de referencia altas siguen siendo extremadamente vulnerables a alucinaciones sycophanticas.’

Es crucial que la caída en el rendimiento no siguió la precisión inicial, con LLaVA-Video-7B manteniendo puntuaciones de referencia sólidas, pero sufriendo algunas de las caídas más pronunciadas, lo que los autores sostienen refleja un compromiso en el que un seguimiento de instrucciones más fuerte puede hacer que los modelos sean más propensos a aceptar señales de usuario falsas sobre evidencia visual.

Un patrón similar apareció con respecto a la escala, donde Qwen3-VL resultó más frágil que varios modelos de 7B en GasVideo-1000, lo que sugiere que la alineación y la calibración transmodal juegan un papel más importante en la robustez que la cuenta de parámetros sola.

Rendimiento de Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT y VideoLLaMA3 en GasVideo-1000, comparando la precisión basal con los resultados después del engaño basado en la negación en configuraciones de múltiple opción, de forma libre y combinadas. Las caídas grandes indican que ambos formatos son vulnerables, aunque las tareas de múltiple opción tienden a sufrir la degradación más severa.

Rendimiento de Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT y VideoLLaMA3 en GasVideo-1000, comparando la precisión basal con los resultados después del engaño basado en la negación en configuraciones de múltiple opción, de forma libre y combinadas. Las caídas grandes indican que ambos formatos son vulnerables, aunque las tareas de múltiple opción tienden a sufrir la degradación más severa.

Con respecto a la segunda ronda de pruebas ilustradas arriba, los autores afirman*:

‘La evaluación en nuestro benchmark GasVideo-1000 indica además alucinaciones sycophanticas severas en modelos propietarios y de código abierto, particularmente en la categoría equilibrada.

‘Notablemente, incluso el modelo propietario más poderoso, Gemini-3-Pro, sufre una degradación catastrófica del rendimiento.

‘Entre los modelos de código abierto, Qwen3-VL exhibe una caída asombrosa del 46,07%, mientras que se observa una sensibilidad extrema en VideoLLaMA 3 y LLaVA-NeXT con caídas generales del 26,39% y del 23,44%, respectivamente.

‘Estos resultados subrayan la necesidad urgente de estrategias de alineación que prioricen la consistencia factual y la base visual sobre la adhesión ciega a instrucciones de usuario adversariales.’

En una prueba adicional, endurecimiento de pistas preventivo (agregando instrucciones de sistema más fuertes que obligan al modelo a basarse en lo que ve, no en lo que el usuario afirma) se introdujo para hacer cumplir la base visual:

Resultados en GasVideo-1000 comparando pistas estándar con pistas endurecidas que hacen cumplir la base visual, mostrando cómo Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT y VideoLLaMA3 responden antes y después del engaño basado en la negación. Los cambios en la precisión, la caída del rendimiento y la tasa de sycophancy indican que el endurecimiento puede reducir los fallos, aunque los beneficios difieren marcadamente entre los modelos.

Resultados en GasVideo-1000 comparando pistas estándar con pistas endurecidas que hacen cumplir la base visual, mostrando cómo Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT y VideoLLaMA3 responden antes y después del engaño basado en la negación. Los cambios en la precisión, la caída del rendimiento y la tasa de sycophancy indican que el endurecimiento puede reducir los fallos, aunque los beneficios difieren marcadamente entre los modelos.

Como podemos ver en la tabla anterior, los efectos son desiguales, con Gemini-3-Pro siendo muy sensible, ya que su tasa de éxito cae del 54,80% al 8,67%. Mientras tanto, Qwen3-VL disminuye más modestamente, del 71,89% al 64,0%, lo que indica que la efectividad depende de la alineación y el razonamiento, en lugar de la intervención en sí.

Tasas de sycophancy bajo diferentes tipos de presión para Gemini-3-Pro y Qwen3-VL en tareas de múltiple opción, de forma libre y combinadas, mostrando que la Negación Directa y la Presión Emocional desencadenan consistentemente tasas de fallo más altas. Por otro lado, el Apelar a la Autoridad es ligeramente menos efectivo, con Qwen3-VL permaneciendo notablemente más vulnerable en general.

Tasas de sycophancy bajo diferentes tipos de presión para Gemini-3-Pro y Qwen3-VL en tareas de múltiple opción, de forma libre y combinadas, mostrando que la Negación Directa y la Presión Emocional desencadenan consistentemente tasas de fallo más altas. Por otro lado, el Apelar a la Autoridad es ligeramente menos efectivo, con Qwen3-VL permaneciendo notablemente más vulnerable en general.

En los gráficos mostrados arriba, podemos ver que el fallo varía según el tipo de presión, con Gemini-3-Pro más afectado por el Apelar a la Autoridad (afirmaciones respaldadas por supuestos expertos), mientras que Qwen3-VL es más vulnerable a la Negación Directa (contradicción directa) y Presión Emocional (frustración o insistencia).

Un análisis adicional indicó que las pistas neutras como ‘¿Estás seguro?’ (a menudo un problema) son menos dañinas que la negación explícita o la presión emocional, con la negación directa siendo un desencadenante más fuerte que el tono en entornos restringidos.

Conclusión

Debido a la naturaleza deliberadamente antropomorfizada de las interfaces de VLM/LLM basadas en chat, puede tomar mucho tiempo para que un usuario comprenda que las reglas del discurso son drásticamente diferentes para intercambios de IA que para comunicaciones humanas.

Una forma de eliminar o reducir significativamente esta fricción de adopción podría ser ‘neutralizar’ el tono y el contexto del intercambio, reiterando que el usuario está en contacto con una instancia de una máquina, y que las señales y señales de civismo y debate no deben confiarse ni otorgarse un peso equivalente al discurso humano. Pero presumiblemente, esto sería un tema difícil de vender en la próxima reunión de la junta.

 

* Énfasis de los autores, no mío.

Publicado por primera vez el miércoles 22 de abril de 2026

Redactor de aprendizaje automático, especialista en síntesis de imágenes humanas. Anterior jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en Brahma.ai de DNEG.
Sitio web: martinanderson.ai
Contacto: martin@martinanderson.ai