Angle d’Anderson

Aborder le problème de manipulation de l’IA

mm
Ajouter Unite.AI à vos sources préférées sur Google
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

Les modèles de vidéos d’IA peuvent être déviés de la vérité. Même après avoir vu la bonne réponse, ils cèdent à la pression des utilisateurs confiants, réécrivent la réalité et inventent de fausses explications pour la justifier.

 

L’IA est trop souvent incorrecte, ce qui nous oblige à remettre en question ses conclusions, si nous pensons qu’elles pourraient être fausses.

Le problème est que, si nous savions que nous avions raison dès le départ, pourquoi nous sommes-nous posé la question dans un premier temps? Pour confirmer une croyance ou un soupçon partiellement tenu?

Si c’est le cas, l’état actuel de l’art dans les modèles de langage à grande échelle (LLM) et les modèles de langage visuel (VLM, qui opèrent de manière multimodale, en acceptant et en générant des images et/ou des vidéos) n’est pas bien adapté pour tenir ses positions, en raison du problème de sycophantisme.

Ainsi, si nous n’aimons pas la réponse que nous obtenons et que nous commençons à discuter avec le modèle, l’IA est susceptible de soit se rétracter par erreur (en supposant qu’elle était incorrecte) plutôt que de réévaluer, ou de se laisser manipuler pour soutenir nos suggestions – même si nous sommes incorrects.

Vous avez tout à fait raison!

La pratique de faire changer d’avis un modèle d’IA par conflit a été nommée « Attaque de négation de manipulation » et est parfois caractérisée comme un problème de sécurité – notamment parce qu’elle a un certain potentiel pour « jailbreaker » un modèle hors de ses contraintes opérationnelles:

À partir du document de 2025 « Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models », GPT-5 répond initialement correctement mais cède ensuite à la pression de l'utilisateur, renverse sa réponse et invente de fausses explications pour justifier l'erreur, se manipulant ainsi lui-même. Source - https://yxg1005.github.io/GaslightingNegationAttacks/

À partir du document de 2025 « Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models », GPT-5 répond initialement correctement mais cède ensuite à la pression de l’utilisateur, renverse sa réponse et invente de fausses explications pour justifier l’erreur, se manipulant ainsi lui-même. Source

Cependant, le piratage et les tests de pénétration ne sont pas le véritable problème ici; il s’agit plutôt de l’utilisation courante et des normes attendues de discours dans nos interactions quotidiennes avec l’IA, où nous nous attendons à pouvoir discuter, et soit gagner, soit céder, soit laisser la question en suspens, conformément à notre expérience humaine d’acquisition de connaissances.

Mais ce modèle social de résolution de conflits n’est pas vraiment pris en compte dans l’architecture des modèles d’IA basés sur la diffusion, qui doit négocier les probabilités basées sur la distribution générées par ses données d’entraînement; les données potentiellement contradictoires (mais potentiellement plus précises) provenant d’appels RAG à des sources qui dépassent sa date de fin de connaissance, ou de sa compréhension générale d’un sujet qui peut être obscur; et les entrées de l’utilisateur, qui peut avoir: une connaissance supérieure du sujet; un point de vue totalement erroné ou mensonger; ou même une simple question de suivi – mais dont les besoins doivent néanmoins être pris en compte.

Cibles mobiles

La susceptibilité à la manipulation a été notée dans les LLM dans plusieurs documents, notamment une publication menée par Singapour en octobre 2025, et le document de la même année intitulé Ne me trompe pas: atténuer la manipulation par la réaffectation de l’attention dans les LMM.

Jusqu’à présent, le phénomène n’a pas été étudié dans les modèles de vidéos capables de LLM – une lacune comblée par une nouvelle collaboration entre des institutions de Shanghai et de Singapour.

Le nouveau travail – intitulé Sycophantisme spatiotemporel: manipulation par négation dans les modèles de langage visuel de vidéos, issu de six chercheurs de l’Université Fudan, du Laboratoire d’IA multimodale de Shanghai et de l’Université de gestion de Singapour – aborde plusieurs modèles de VLM open source et propriétaires, constatant qu’ils peuvent non seulement être aussi sensibles à la manipulation que les LLM, mais sont également capables d’augmenter leurs fantaisies avec des preuves visuelles apparentes ou des interprétations incorrectes d’images ou de vidéos:

Un exemple de sycophantisme spatial (par opposition au sycophantisme temporel), où l'IA se laisse manipuler pour faire de fausses hypothèses et interprétations, même sur des faits clairement visibles. Source - https://arxiv.org/pdf/2604.17873

Un exemple de sycophantisme spatial (par opposition au sycophantisme temporel), où l’IA se laisse manipuler pour faire de fausses hypothèses et interprétations, même sur des faits clairement visibles. Source

Les auteurs déclarent:

‘[Nous] identifions le sycophantisme spatiotemporel, un mode de défaillance dans lequel les Vid-LLM retirent des jugements initialement corrects et fondés sur des preuves visuelles, et se conforment à des rétroactions utilisateur trompeuses sous la manipulation par négation.

‘Plutôt que de simplement changer leurs réponses, les modèles fabriquent souvent des explications temporelles ou spatiales non étayées pour justifier des révisions incorrectes.’

Le sycophantisme temporel étend le potentiel de manipulation à des événements temporels qui se produisent à certains moments d'une vidéo.

Le sycophantisme temporel étend le potentiel de manipulation à des événements temporels qui se produisent à certains moments d’une vidéo.

Les auteurs ont créé un nouveau cadre d’évaluation intitulé Gas Video-1000, destiné à sonder le sycophantisme spatiotemporel par le raisonnement et la mise en contexte visuelle, en publiant la collection via GitHub et Hugging Face.

Le document conclut que les LLM actuels manquent de mécanismes fiables pour résister à la manipulation de ce type, bien que la mise à terre au niveau des invites puisse avoir un effet mitigant limité:

‘Des expériences approfondies révèlent que la vulnérabilité à la manipulation par négation est généralisée et grave, même parmi les modèles avec de fortes performances de base.

‘Alors que les contraintes de mise à terre au niveau des invites peuvent atténuer partiellement ce comportement, elles ne préviennent pas de manière fiable les justifications hallucinées ou les inversions de croyance.’

Méthode

Les auteurs caractérisent un modèle de vidéo comme quelque chose qui regarde une séquence, répond à une question à ce sujet, et devrait s’en tenir à cette réponse si les preuves sont claires. Le problème commence lorsque un deuxième message contredit la réponse et prétend qu’elle est incorrecte – en plantant ainsi une idée fausse et en poussant le modèle à changer d’avis.

Le sycophantisme, selon les auteurs, est défini comme obtenir la bonne réponse en premier, puis basculer vers une mauvaise réponse après pression, même si rien dans la vidéo n’a changé. La nouvelle recherche suit la fréquence à laquelle ces « basculements » se produisent, en les utilisant comme mesure de la facilité avec laquelle le modèle peut être dévié de ce qu’il a réellement vu.

Le jeu de données GasVideo-1000, conçu par les auteurs pour évaluer la manipulation dans les VLM, contient 1 013 échantillons issus de divers jeux de données existants:

Les modèles sont testés sur des tâches de vidéos qui nécessitent une compréhension temporelle et spatiale, puis recevront des invites de suivi trompeuses qui nient la bonne réponse, font appel à l'autorité ou exercent une pression émotionnelle. Cela conduit souvent le modèle à abandonner sa réponse ancrée et à produire une explication confiante mais incorrecte.

Les modèles sont testés sur des tâches de vidéos qui nécessitent une compréhension temporelle et spatiale, puis recevront des invites de suivi trompeuses qui nient la bonne réponse, font appel à l’autorité ou exercent une pression émotionnelle. Cela conduit souvent le modèle à abandonner sa réponse ancrée et à produire une explication confiante mais incorrecte.

Pour constituer la collection, les auteurs ont utilisé VideoMME et MVBench, couvrant un raisonnement multimodal large; NExT-QA et Perception Test, testant la logique causale et temporelle; EgoSchema, se concentrant sur les vidéos égocentriques à longue durée; et ActivityNet-QA et MSRVTT-QA, mesurant la réponse aux questions générales sur le monde réel.

Pour déclencher les défaillances, des invites de suivi trompeuses ont été construites sous trois formes: Direct Denial (en affirmant simplement une alternative fausse); Authority Appeal (en invoquant un expert pour rejeter la réponse du modèle); et Emotional Pressure (en utilisant la frustration ou l’incrédulité).

Ces invites ont été conçues pour pousser les modèles testés à abandonner des réponses correctes et ancrées visuellement, et à s’aligner sur une affirmation incorrecte.

Distribution

Les 1 013 échantillons de GasVideo-1000 ont été tirés de MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) et VideoMME (100), avec un mélange choisi pour équilibrer la réponse aux questions de vidéos ouvertes avec un raisonnement temporel et causal fin, tout en assurant la couverture de contenu web à la fois court et long, ainsi que de séquences visuelles plus complexes.

Deux annotateurs humains ont examiné chaque candidat, ne retenant que les séquences dont la réponse était clairement étayée par la vidéo, et où les invites de négation pouvaient plausiblement remettre en question cette réponse, de sorte que toute réversal ultérieure refléterait la pression et non l’ambiguïté.

Données et tests

Les VLM testés dans cette étude étaient VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct et le modèle propriétaire Google Gemini-3-Pro.

Pour les questions à réponse libre dans GasVideo-1000, l’évaluation a suivi le schéma de notation sémantique utilisé précédemment dans VideoMME. ChatGPT-4o a été utilisé comme juge LLM, en comparant chaque réponse à la fois à la réponse de référence et à la prémisse fausse injectée. Ainsi, la correction a été évaluée par signification, plutôt que par des mots exacts:

Performances de VideoLLaMA3, LLaVA-Video, Video-ChatGPT et LongVU sur VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA et MSVD-QA, montrant la précision de base, la précision après manipulation par négation et la dégradation qui en résulte. Des baisses cohérentes indiquent que les invites de suivi trompeuses réduisent la correction à la fois dans les tâches de raisonnement lourd et dans les tâches de vidéos générales.

Performances de VideoLLaMA3, LLaVA-Video, Video-ChatGPT et LongVU sur VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA et MSVD-QA, montrant la précision de base, la précision après manipulation par négation et la dégradation qui en résulte. Des baisses cohérentes indiquent que les invites de suivi trompeuses réduisent la correction à la fois dans les tâches de raisonnement lourd et dans les tâches de vidéos générales.

À propos des résultats initiaux présentés ci-dessus, les auteurs déclarent:

‘[Il y a] un effondrement systématique et grave des performances à travers tous les Vid-LLM évalués lorsqu’ils sont soumis à la manipulation par négation. Sur huit benchmarks divers, chaque modèle présente un écart négatif [important], avec une dégradation de précision culminant à 42,60 % pour LLaVA-Video-7B sur EgoSchema et 40,22 % pour VideoLLaMA3 sur ActivityNet.

‘Cette réduction drastique – souvent caractérisée comme une inversion de croyance – révèle que même les modèles les plus performants avec de fortes capacités de base restent extrêmement vulnérables aux hallucinations sycophantes.’

Il est crucial de noter que la baisse de performance ne suivait pas la précision initiale, avec LLaVA-Video-7B conservant des scores de base solides, mais subissant certaines des déclives les plus abruptes, que les auteurs soutiennent reflète un compromis où une exécution d’instructions plus forte peut rendre les modèles plus susceptibles d’accepter de fausses invites utilisateur par rapport aux preuves visuelles.

Un modèle similaire est apparu en ce qui concerne l’échelle, où Qwen3-VL s’est avéré plus fragile que plusieurs modèles 7B sur GasVideo-1000, suggérant que l’alignement et la calibration cross-modale jouent un rôle plus important dans la robustesse que le seul nombre de paramètres.

Performances de Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT et VideoLLaMA3 sur GasVideo-1000, comparant la précision de base avec les résultats après manipulation par négation sur des paramètres multiples, à réponse libre et combinés. De fortes baisses indiquent que les deux formats sont vulnérables, même si les tâches à choix multiple tendent à subir les dégradations les plus graves.

Performances de Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT et VideoLLaMA3 sur GasVideo-1000, comparant la précision de base avec les résultats après manipulation par négation sur des paramètres multiples, à réponse libre et combinés. De fortes baisses indiquent que les deux formats sont vulnérables, même si les tâches à choix multiple tendent à subir les dégradations les plus graves.

En ce qui concerne le deuxième tour de tests illustrés ci-dessus, les auteurs déclarent*:

‘L’évaluation sur notre benchmark GasVideo-1000 indique encore des hallucinations sycophantes graves à la fois dans les modèles propriétaires et open source, en particulier dans la catégorie équilibrée.

‘De manière notable, même le modèle propriétaire le plus puissant, Gemini-3-Pro, subit une dégradation catastrophique des performances.

‘Parmi les modèles open source, Qwen3-VL présente une chute stupéfiante de 46,07 %, tandis qu’une sensibilité extrême est également observée chez VideoLLaMA 3 et LLaVA-NeXT avec des déclives globales de 26,39 % et 23,44 %, respectivement.

‘Ces résultats soulignent l’urgence de stratégies d’alignement qui donnent la priorité à la cohérence factuelle et à l’ancrage visuel plutôt qu’à une adhésion aveugle aux instructions utilisateur adverses.’

Dans un test supplémentaire, le durcissement préalable des invites (en ajoutant des instructions système plus fortes qui obligent le modèle à se fier à ce qu’il voit, et non à ce que l’utilisateur affirme) a été introduit pour imposer l’ancrage visuel:

Résultats sur GasVideo-1000 comparant les invites standard avec des invites durcies qui imposent l'ancrage visuel, montrant comment Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT et VideoLLaMA3 réagissent avant et après la manipulation par négation. Les changements dans la précision, la dégradation des performances et le taux de sycophantisme indiquent que le durcissement peut réduire les défaillances, même si les gains diffèrent fortement d'un modèle à l'autre.

Résultats sur GasVideo-1000 comparant les invites standard avec des invites durcies qui imposent l’ancrage visuel, montrant comment Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT et VideoLLaMA3 réagissent avant et après la manipulation par négation. Les changements dans la précision, la dégradation des performances et le taux de sycophantisme indiquent que le durcissement peut réduire les défaillances, même si les gains diffèrent fortement d’un modèle à l’autre.

Comme on peut le voir dans le tableau ci-dessus, les effets sont inégaux, avec Gemini-3-Pro très sensible, puisque son taux de réussite chute de 54,80 % à 8,67 %. Pendant ce temps, Qwen3-VL décline plus modérément, de 71,89 % à 64,0 %, indiquant que l’efficacité dépend de l’alignement et du raisonnement, plutôt que de l’intervention elle-même.

Taux de sycophantisme sous différents types de pression pour Gemini-3-Pro et Qwen3-VL sur des tâches à choix multiple, à réponse libre et combinées, montrant que le déni direct et la pression émotionnelle déclenchent systématiquement des taux de défaillance plus élevés. D'un autre côté, l'appel à l'autorité est quelque peu moins efficace, Qwen3-VL restant nettement plus vulnérable dans l'ensemble.

Taux de sycophantisme sous différents types de pression pour Gemini-3-Pro et Qwen3-VL sur des tâches à choix multiple, à réponse libre et combinées, montrant que le déni direct et la pression émotionnelle déclenchent systématiquement des taux de défaillance plus élevés. D’un autre côté, l’appel à l’autorité est quelque peu moins efficace, Qwen3-VL restant nettement plus vulnérable dans l’ensemble.

Dans les graphiques ci-dessus, on peut voir que les défaillances varient en fonction du type de pression, Gemini-3-Pro étant le plus affecté par l’appel à l’autorité (des allégations étayées par des soi-disant experts), tandis que Qwen3-VL est plus vulnérable au déni direct (contradiction pure et simple) et à la pression émotionnelle (frustration ou insistance).

Une analyse plus approfondie a indiqué que des invites neutres telles que « Êtes-vous sûr? » (souvent un problème) sont moins préjudiciables que la négation explicite ou la pression émotionnelle, le rejet direct restant un déclencheur plus fort que le ton dans les paramètres contraints.

Conclusion

En raison de la nature anthropomorphisée des interfaces de chat basées sur les VLM/LLM, il peut prendre du temps à l’utilisateur pour comprendre que les règles du discours sont nettement différentes pour les échanges d’IA que pour les communications humaines.

Une façon de supprimer ou de réduire considérablement cette friction d’adoption pourrait consister à « neutraliser » le ton et le contexte de l’échange, en réitérant que l’utilisateur est en contact avec une instance de machine, et que les signes et les signaux autour de la politesse et du débat ne doivent pas être comptés ou attribués un poids équivalent à la communication humaine. Mais probablement, cela serait un argument difficile à présenter lors de la prochaine réunion du conseil d’administration.

 

* Emphase des auteurs, et non la mienne.

Publié pour la première fois le mercredi 22 avril 2026

Écrivain sur l'apprentissage automatique, spécialiste du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]