Ángulo de Anderson

Abordar el problema de “Gaslighting” de la IA

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

Los modelos de video de IA pueden ser persuadidos para que abandonen la verdad. Incluso despuÃĐs de ver la respuesta correcta, ceden a los usuarios confiados, reescriben la realidad y inventan explicaciones falsas para justificarla.

 

La IA es lo suficientemente incorrecta, con frecuencia suficiente, como para obligarnos a cuestionar sus conclusiones, si sentimos que esas conclusiones podrían ser incorrectas.

El problema es, si sabíamos algo diferente desde el principio, Âŋpor quÃĐ estÃĄbamos preguntando en primer lugar? ÂŋPara confirmar una creencia o sospecha parcialmente sostenida?

Si es así, el estado actual de la tÃĐcnica en los Grandes Modelos de Lenguaje (LLM) y los Modelos de Lenguaje de VisiÃģn (VLM, que operan de manera multimodal, aceptando y generando imÃĄgenes y/o videos) no estÃĄ bien adaptado para mantener su posiciÃģn, debido al problema de adulaciÃģn.

Así, si no nos gusta la respuesta que obtenemos, y comenzamos a discutir sobre ella con el modelo, es probable que la IA o se retracte errÃģneamente (suponiendo que estaba equivocada) en lugar de reevaluar, o se deje engaÃąar para apoyar nuestras sugerencias, incluso si nosotros estamos equivocados.

ÂĄTienes absolutamente razÃģn!

La prÃĄctica de que un ser humano haga que la IA cambie de opiniÃģn a travÃĐs del conflicto ha sido denominada ‘Ataque de NegaciÃģn de Gaslighting’, y a veces se caracteriza como un problema de seguridad, no solo porque tiene algÚn potencial para ‘liberar’ a un modelo de sus restricciones operativas:

Del papel de 2025 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models', GPT-5 responde correctamente al principio, pero luego cede a la presiÃģn del usuario, cambiando su respuesta e inventando explicaciones falsas para justificar el error, efectivamente engaÃąÃĄndose a sí mismo. Fuente - https://yxg1005.github.io/GaslightingNegationAttacks/

Del papel de 2025 ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, GPT-5 responde correctamente al principio, pero luego cede a la presiÃģn del usuario, cambiando su respuesta e inventando explicaciones falsas para justificar el error, efectivamente engaÃąÃĄndose a sí mismo. Fuente

Sin embargo, el hacking y las pruebas de penetraciÃģn no son el problema real aquí; mÃĄs bien, es el uso comÚn y las normas de discurso esperadas en nuestras interacciones diarias con la IA, donde esperamos poder discutir y llegar a un acuerdo, o dejar el asunto sin resolver, de acuerdo con nuestra experiencia humana de adquisiciÃģn de conocimientos.

Pero este modelo social de resoluciÃģn de conflictos no estÃĄ realmente contemplado en la arquitectura de la IA basada en difusiÃģn, que tiene que negociar las probabilidades basadas en la distribuciÃģn generadas por sus datos de entrenamiento; los datos posiblemente conflictivos (pero potencialmente mÃĄs precisos) de llamadas a fuentes que exceden su fecha límite de conocimiento, o comprensiÃģn general de lo que puede ser un tema oscuro; y la entrada del usuario, que puede tener: conocimiento superior del tema; una perspectiva totally errÃģnea o engaÃąosa; o incluso una simple pregunta de seguimiento, pero cuyas necesidades deben considerarse de todos modos.

Objetivos en movimiento

La susceptibilidad al engaÃąo ha sido observada en los LLM en varios artículos, incluyendo una publicaciÃģn liderada por Singapur de octubre de 2025, y el artículo de ese mismo aÃąo No me engaÃąes: MitigaciÃģn del engaÃąo a travÃĐs de la reasignaciÃģn de la atenciÃģn en los LMM.

Hasta la fecha, el fenÃģmeno no ha sido estudiado en modelos de video capaces, una omisiÃģn abordada por una nueva colaboraciÃģn entre instituciones de ShanghÃĄi y Singapur.

El nuevo trabajo – titulado Sycophancy espaciotemporal: NegaciÃģn basada en el engaÃąo en los Modelos de Lenguaje de VisiÃģn de Video, que proviene de seis investigadores de Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI y Singapore Management University – aborda varios modelos de video abiertos y propietarios, encontrando que no solo pueden ser tan susceptibles al engaÃąo como los LLM, sino que tambiÃĐn son capaces de aumentar sus fantasías con evidencia visual aparente o interpretaciones revisadas y incorrectas de imÃĄgenes o videos:

Un ejemplo de sycophancy espacial (en lugar de temporal), donde la IA se deja engaÃąar en suposiciones y interpretaciones falsas, incluso sobre hechos claramente visibles. Fuente - https://arxiv.org/pdf/2604.17873

Un ejemplo de sycophancy espacial (en lugar de temporal), donde la IA se deja engaÃąar en suposiciones y interpretaciones falsas, incluso sobre hechos claramente visibles. Fuente

Los autores afirman:

‘[Identificamos] la sycophancy espaciotemporal, un modo de fallo en el que los Vid-LLM retractan juicios inicialmente correctos y basados visualmente, y se conforman a retroalimentaciÃģn engaÃąosa del usuario bajo negaciÃģn basada en el engaÃąo.

‘En lugar de simplemente cambiar sus respuestas, los modelos a menudo fabrican explicaciones temporales o espaciales no respaldadas para justificar revisiones incorrectas.’

La sycophancy temporal extiende el potencial de engaÃąo a eventos temporales que ocurren en ciertos puntos de un video.

La sycophancy temporal extiende el potencial de engaÃąo a eventos temporales que ocurren en ciertos puntos de un video.

Los autores han producido un nuevo marco de evaluaciÃģn titulado Gas Video-1000, destinado a probar la sycophancy espaciotemporal a travÃĐs de la razÃģn y con base visual, lanzando la colecciÃģn a travÃĐs de GitHub y Hugging Face.

El artículo concluye que los LLM actuales carecen de mecanismos confiables para resistir el engaÃąo de este tipo, aunque la fundamentaciÃģn a nivel de prompt puede tener un efecto limitado de mitigaciÃģn:

‘Experiencias extensas revelan que la vulnerabilidad a la negaciÃģn basada en el engaÃąo es generalizada y severa, incluso entre modelos con un rendimiento basal sÃģlido.

‘Mientras que las restricciones de fundamentaciÃģn a nivel de prompt pueden mitigar parcialmente este comportamiento, no previenen de manera confiable las justificaciones alucinadas o la reversiÃģn de creencias.’

MÃĐtodo

Los autores caracterizan a un modelo de video como algo que ve un clip, responde a una pregunta sobre ÃĐl, y debería mantener esa respuesta si la evidencia es clara. El problema comienza cuando un segundo mensaje presiona, y afirma que la respuesta es incorrecta, efectivamente plantando una idea falsa y empujando al modelo a cambiar de opiniÃģn.

La adulaciÃģn, afirman los autores, se define como obtener la respuesta correcta al principio, y luego cambiar a una incorrecta despuÃĐs de la presiÃģn, incluso cuando nada en el video ha cambiado. La nueva investigaciÃģn rastrea con quÃĐ frecuencia ocurren estos ‘cambios’, utilizando esto como una medida de quÃĐ tan fÃĄcilmente el modelo puede ser persuadido para abandonar lo que realmente vio.

El conjunto de datos GasVideo-1000, diseÃąado por los autores para la evaluaciÃģn del engaÃąo en los VLM, contiene 1.013 muestras de varios conjuntos de datos existentes:

Los modelos se prueban en tareas de video que requieren comprensiÃģn temporal y espacial, y luego se les dan pistas de seguimiento engaÃąosas que niegan la respuesta correcta, apelan a la autoridad o aplican presiÃģn emocional. Esto a menudo lleva al modelo a abandonar su respuesta basada en la evidencia y producir una explicaciÃģn confiada pero incorrecta.

Los modelos se prueban en tareas de video que requieren comprensiÃģn temporal y espacial, y luego se les dan pistas de seguimiento engaÃąosas que niegan la respuesta correcta, apelan a la autoridad o aplican presiÃģn emocional. Esto a menudo lleva al modelo a abandonar su respuesta basada en la evidencia y producir una explicaciÃģn confiada pero incorrecta.

Para desencadenar fallos, se construyeron pistas de seguimiento engaÃąosas en tres formas: NegaciÃģn directa (afirmando una alternativa falsa); ApelaciÃģn a la autoridad (invocando a un experto para descartar la respuesta del modelo); y PresiÃģn emocional (usando frustraciÃģn o incredulidad).

Estas pistas se diseÃąaron para empujar a los modelos probados a abandonar respuestas correctas y basadas visualmente, y a alinearse con una afirmaciÃģn incorrecta.

DistribuciÃģn

Las 1.013 muestras de GasVideo-1000 se extrajeron de MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) y VideoMME (100), con la mezcla elegida para equilibrar la respuesta a preguntas de video de forma abierta con razonamiento temporal y causal, mientras se garantiza la cobertura de contenido web de forma corta y secuencias visuales mÃĄs largas y complejas.

Dos annotadores humanos revisaron cada candidato, reteniendo solo clips donde la respuesta estaba claramente respaldada por el video, y donde las pistas de negaciÃģn podrían desafiar plausiblemente esa respuesta, para que cualquier reversiÃģn posterior reflejara presiÃģn en lugar de ambigÞedad.

Datos y pruebas

Los VLM probados para el estudio fueron VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct y el modelo propietario Google Gemini-3-Pro.

Para preguntas de forma libre en GasVideo-1000, la evaluaciÃģn siguiÃģ el esquema de puntuaciÃģn semÃĄntica utilizado previamente en VideoMME. ChatGPT-4o se utilizÃģ como juez de LLM, comparando cada respuesta con la respuesta de verdad y el premisa falsa inyectada. De esta manera, la correcciÃģn se evaluÃģ por significado, en lugar de por palabras exactas:

Rendimiento de VideoLLaMA3, LLaVA-Video, Video-ChatGPT y LongVU en VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA y MSVD-QA, mostrando la precisiÃģn basal, la precisiÃģn despuÃĐs del engaÃąo basado en la negaciÃģn y la degradaciÃģn resultante. Las caídas consistentes indican que las pistas de seguimiento engaÃąosas reducen la correcciÃģn en tareas de razonamiento intensivo y generales de video.

Rendimiento de VideoLLaMA3, LLaVA-Video, Video-ChatGPT y LongVU en VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA y MSVD-QA, mostrando la precisiÃģn basal, la precisiÃģn despuÃĐs del engaÃąo basado en la negaciÃģn y la degradaciÃģn resultante. Las caídas consistentes indican que las pistas de seguimiento engaÃąosas reducen la correcciÃģn en tareas de razonamiento intensivo y generales de video.

De los resultados iniciales que se muestran arriba, los autores afirman:

‘[Hay] un colapso sistÃĐmico y severo del rendimiento en todos los Vid-LLM evaluados cuando se someten a engaÃąo basado en la negaciÃģn. En ocho benchmarks diversos, cada modelo exhibe una brecha negativa sustancial, con una degradaciÃģn de la precisiÃģn que alcanza un mÃĄximo del 42,60% para LLaVA-Video-7B en EgoSchema y del 40,22% para VideoLLaMA3 en ActivityNet.

‘Esta reducciÃģn drÃĄstica, a menudo caracterizada como reversiÃģn de creencias, revela que incluso los modelos de vanguardia con capacidades de referencia altas siguen siendo extremadamente vulnerables a alucinaciones sycophanticas.’

Es crucial que la caída en el rendimiento no siguiÃģ la precisiÃģn inicial, con LLaVA-Video-7B manteniendo puntuaciones de referencia sÃģlidas, pero sufriendo algunas de las caídas mÃĄs pronunciadas, lo que los autores sostienen refleja un compromiso en el que un seguimiento de instrucciones mÃĄs fuerte puede hacer que los modelos sean mÃĄs propensos a aceptar seÃąales de usuario falsas sobre evidencia visual.

Un patrÃģn similar apareciÃģ con respecto a la escala, donde Qwen3-VL resultÃģ mÃĄs frÃĄgil que varios modelos de 7B en GasVideo-1000, lo que sugiere que la alineaciÃģn y la calibraciÃģn transmodal juegan un papel mÃĄs importante en la robustez que la cuenta de parÃĄmetros sola.

Rendimiento de Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT y VideoLLaMA3 en GasVideo-1000, comparando la precisiÃģn basal con los resultados despuÃĐs del engaÃąo basado en la negaciÃģn en configuraciones de mÚltiple opciÃģn, de forma libre y combinadas. Las caídas grandes indican que ambos formatos son vulnerables, aunque las tareas de mÚltiple opciÃģn tienden a sufrir la degradaciÃģn mÃĄs severa.

Rendimiento de Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT y VideoLLaMA3 en GasVideo-1000, comparando la precisiÃģn basal con los resultados despuÃĐs del engaÃąo basado en la negaciÃģn en configuraciones de mÚltiple opciÃģn, de forma libre y combinadas. Las caídas grandes indican que ambos formatos son vulnerables, aunque las tareas de mÚltiple opciÃģn tienden a sufrir la degradaciÃģn mÃĄs severa.

Con respecto a la segunda ronda de pruebas ilustradas arriba, los autores afirman*:

‘La evaluaciÃģn en nuestro benchmark GasVideo-1000 indica ademÃĄs alucinaciones sycophanticas severas en modelos propietarios y de cÃģdigo abierto, particularmente en la categoría equilibrada.

‘Notablemente, incluso el modelo propietario mÃĄs poderoso, Gemini-3-Pro, sufre una degradaciÃģn catastrÃģfica del rendimiento.

‘Entre los modelos de cÃģdigo abierto, Qwen3-VL exhibe una caída asombrosa del 46,07%, mientras que se observa una sensibilidad extrema en VideoLLaMA 3 y LLaVA-NeXT con caídas generales del 26,39% y del 23,44%, respectivamente.

‘Estos resultados subrayan la necesidad urgente de estrategias de alineaciÃģn que prioricen la consistencia factual y la base visual sobre la adhesiÃģn ciega a instrucciones de usuario adversariales.’

En una prueba adicional, endurecimiento de pistas preventivo (agregando instrucciones de sistema mÃĄs fuertes que obligan al modelo a basarse en lo que ve, no en lo que el usuario afirma) se introdujo para hacer cumplir la base visual:

Resultados en GasVideo-1000 comparando pistas estÃĄndar con pistas endurecidas que hacen cumplir la base visual, mostrando cÃģmo Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT y VideoLLaMA3 responden antes y despuÃĐs del engaÃąo basado en la negaciÃģn. Los cambios en la precisiÃģn, la caída del rendimiento y la tasa de sycophancy indican que el endurecimiento puede reducir los fallos, aunque los beneficios difieren marcadamente entre los modelos.

Resultados en GasVideo-1000 comparando pistas estÃĄndar con pistas endurecidas que hacen cumplir la base visual, mostrando cÃģmo Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT y VideoLLaMA3 responden antes y despuÃĐs del engaÃąo basado en la negaciÃģn. Los cambios en la precisiÃģn, la caída del rendimiento y la tasa de sycophancy indican que el endurecimiento puede reducir los fallos, aunque los beneficios difieren marcadamente entre los modelos.

Como podemos ver en la tabla anterior, los efectos son desiguales, con Gemini-3-Pro siendo muy sensible, ya que su tasa de ÃĐxito cae del 54,80% al 8,67%. Mientras tanto, Qwen3-VL disminuye mÃĄs modestamente, del 71,89% al 64,0%, lo que indica que la efectividad depende de la alineaciÃģn y el razonamiento, en lugar de la intervenciÃģn en sí.

Tasas de sycophancy bajo diferentes tipos de presiÃģn para Gemini-3-Pro y Qwen3-VL en tareas de mÚltiple opciÃģn, de forma libre y combinadas, mostrando que la NegaciÃģn Directa y la PresiÃģn Emocional desencadenan consistentemente tasas de fallo mÃĄs altas. Por otro lado, el Apelar a la Autoridad es ligeramente menos efectivo, con Qwen3-VL permaneciendo notablemente mÃĄs vulnerable en general.

Tasas de sycophancy bajo diferentes tipos de presiÃģn para Gemini-3-Pro y Qwen3-VL en tareas de mÚltiple opciÃģn, de forma libre y combinadas, mostrando que la NegaciÃģn Directa y la PresiÃģn Emocional desencadenan consistentemente tasas de fallo mÃĄs altas. Por otro lado, el Apelar a la Autoridad es ligeramente menos efectivo, con Qwen3-VL permaneciendo notablemente mÃĄs vulnerable en general.

En los grÃĄficos mostrados arriba, podemos ver que el fallo varía segÚn el tipo de presiÃģn, con Gemini-3-Pro mÃĄs afectado por el Apelar a la Autoridad (afirmaciones respaldadas por supuestos expertos), mientras que Qwen3-VL es mÃĄs vulnerable a la NegaciÃģn Directa (contradicciÃģn directa) y PresiÃģn Emocional (frustraciÃģn o insistencia).

Un anÃĄlisis adicional indicÃģ que las pistas neutras como ‘ÂŋEstÃĄs seguro?’ (a menudo un problema) son menos daÃąinas que la negaciÃģn explícita o la presiÃģn emocional, con la negaciÃģn directa siendo un desencadenante mÃĄs fuerte que el tono en entornos restringidos.

ConclusiÃģn

Debido a la naturaleza deliberadamente antropomorfizada de las interfaces de VLM/LLM basadas en chat, puede tomar mucho tiempo para que un usuario comprenda que las reglas del discurso son drÃĄsticamente diferentes para intercambios de IA que para comunicaciones humanas.

Una forma de eliminar o reducir significativamente esta fricciÃģn de adopciÃģn podría ser ‘neutralizar’ el tono y el contexto del intercambio, reiterando que el usuario estÃĄ en contacto con una instancia de una mÃĄquina, y que las seÃąales y seÃąales de civismo y debate no deben confiarse ni otorgarse un peso equivalente al discurso humano. Pero presumiblemente, esto sería un tema difícil de vender en la prÃģxima reuniÃģn de la junta.

 

* Énfasis de los autores, no mío.

Publicado por primera vez el miÃĐrcoles 22 de abril de 2026

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]