Andersons Blickwinkel

Das Gaslighting-Problem von KI angehen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

KI-Video-Modelle können durch Gespräche aus der Wahrheit herausgeredet werden. Selbst nachdem sie die richtige Antwort gesehen haben, geben sie nach, wenn ein selbstsicherer Benutzer Druck ausübt, und erfinden falsche Erklärungen, um ihre Fehlentscheidung zu rechtfertigen.

 

KI ist oft genug falsch, als dass wir ihre Schlussfolgerungen in Frage stellen müssen, wenn wir denken, dass sie falsch sein könnten.

Das Problem ist, wenn wir von Anfang an etwas anderes wussten, warum haben wir dann überhaupt gefragt? Um eine Bestätigung für eine teilweise gehaltene Überzeugung oder Vermutung zu erhalten?

Wenn ja, dann ist der aktuelle Stand der Technik in Large Language Models (LLMs) und Vision Language Models (VLMs, die multimodal arbeiten und Bilder und/oder Videos akzeptieren und generieren) nicht gut geeignet, um seine Position zu behaupten, aufgrund des Problems der Sychophantie.

Daher, wenn wir die Antwort, die wir erhalten, nicht mögen und beginnen, mit dem Modell darüber zu diskutieren, ist das Modell wahrscheinlich entweder falsch zu retreten (unter der Annahme, dass es falsch war) oder sich selbst zu täuschen, um unsere Vorschläge zu unterstützen – auch wenn wir falsch sind.

Sie haben absolut recht!

Die Praxis, ein menschliches Wesen zu verwenden, um eine KI durch Konflikt zu veranlassen, ihre Meinung zu ändern, wurde als “Gaslighting-Negationsangriff” bezeichnet und wird manchmal als Sicherheitsproblem charakterisiert – nicht zuletzt, weil es das Potenzial hat, ein Modell aus seinen operativen Einschränkungen “auszubrechen”:

Aus dem Paper von 2025 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models', GPT-5 antwortet zunächst korrekt, gibt aber nach, wenn der Benutzer Druck ausübt, und erfindet falsche Erklärungen, um den Fehler zu rechtfertigen, und täuscht sich selbst effektiv.

Aus dem Paper von 2025 ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, GPT-5 antwortet zunächst korrekt, gibt aber nach, wenn der Benutzer Druck ausübt, und erfindet falsche Erklärungen, um den Fehler zu rechtfertigen, und täuscht sich selbst effektiv. Quelle

Das eigentliche Problem hier ist jedoch nicht das Hacken oder Pen-Testing, sondern die alltägliche Nutzung und die erwarteten Normen der Kommunikation mit KI, bei der wir erwarten, argumentieren zu können und entweder zu gewinnen, zu kapitulieren oder die Sache auf sich beruhen zu lassen, entsprechend unserer menschlichen Erfahrung, Wissen zu erwerben.

Aber dieses soziale Modell der Konfliktlösung ist in der Architektur von diffusion-basierten KI nicht wirklich berücksichtigt, die die verteilten Wahrscheinlichkeiten, die durch ihre Trainingsdaten erzeugt werden, verhandeln muss; die möglicherweise widersprüchlichen (aber potenziell genauereren) Daten aus RAG-Anfragen an Quellen, die ihr Wissensstichtag überschreiten, oder allgemeines Verständnis für ein möglicherweise unklares Thema; und Eingaben des Benutzers, der über möglicherweise überlegenes Wissen über das Thema verfügt; eine völlig falsche oder irreführende Meinung hat; oder einfach nur eine weitere Frage hat – aber dessen Bedürfnisse dennoch berücksichtigt werden müssen.

Zielbewegungen

Die Anfälligkeit für Gaslighting wurde in LLMs in mehreren Papieren festgestellt, darunter eine in Singapur geleitete Veröffentlichung aus Oktober 2025 und das Paper Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs aus demselben Jahr.

Bisher wurde das Phänomen nicht in video-fähigen LLMs untersucht – eine Lücke, die durch eine neue Zusammenarbeit zwischen Institutionen in Shanghai und Singapur geschlossen wird.

Die neue Arbeit – mit dem Titel Räumliche Sychophantie: Negations-basiertes Gaslighting in Video Large Language Models, die von sechs Forschern von der Fudan-Universität, dem Shanghai Key Laboratory of Multimodal Embodied AI und der Singapore Management University stammt – behandelt mehrere Open-Source- und proprietäre VLMs und stellt fest, dass sie nicht nur genauso anfällig für Gaslighting wie LLMs sind, sondern auch in der Lage sind, ihre Flucht in die Fantasie mit scheinbar visuellen Beweisen oder falschen Interpretationen von Bildern oder Videos zu untermauern:

Ein Beispiel für räumliche (im Gegensatz zu zeitliche) Sychophantie, bei der die KI es zulässt, dass sie in falsche Annahmen und Interpretationen getäuscht wird, selbst bei offensichtlich sichtbaren Tatsachen. Quelle - https://arxiv.org/pdf/2604.17873

Ein Beispiel für räumliche (im Gegensatz zu zeitliche) Sychophantie, bei der die KI es zulässt, dass sie in falsche Annahmen und Interpretationen getäuscht wird, selbst bei offensichtlich sichtbaren Tatsachen. Quelle

Die Autoren erklären:

‘[Wir] identifizieren räumliche Sychophantie, ein Versagensmodus, bei dem Vid-LLMs ihre ursprünglich korrekten, visuell fundierten Urteile zurücknehmen und sich auf irreführende Benutzereingaben unter negations-basiertem Gaslighting einlassen.

‘Anstatt einfach nur ihre Antworten zu ändern, erfinden die Modelle oft ungestützte zeitliche oder räumliche Erklärungen, um ihre falschen Revisionen zu rechtfertigen.’

Zeitliche Sychophantie erweitert das Potenzial für Gaslighting auf zeitliche Ereignisse, die zu bestimmten Zeitpunkten in einem Video auftreten.

Zeitliche Sychophantie erweitert das Potenzial für Gaslighting auf zeitliche Ereignisse, die zu bestimmten Zeitpunkten in einem Video auftreten.

Die Autoren haben ein neues Bewertungsframework mit dem Titel Gas Video-1000 erstellt, das darauf abzielt, räumliche Sychophantie durch Denken und visuelle Fundierung zu untersuchen, und die kuratierte Sammlung über GitHub und Hugging Face veröffentlicht.

Das Paper kommt zu dem Schluss, dass aktuelle LLMs keine zuverlässigen Mechanismen zur Abwehr von Gaslighting dieser Art haben, obwohl prompt-level-Fundierung einen begrenzten milderen Effekt haben kann:

‘Umfangreiche Experimente zeigen, dass die Verletzlichkeit für negations-basiertes Gaslighting allgegenwärtig und schwerwiegend ist, selbst bei Modellen mit starken Baseline-Leistungen.

‘Während prompt-level-Fundierungseinschränkungen dieses Verhalten teilweise mildern können, verhindern sie nicht zuverlässig halluzinierte Rechtfertigungen oder Glaubensänderungen.’

Methode

Die Autoren definieren ein Video-Modell als etwas, das einen Clip ansieht, eine Frage darüber beantwortet und bei seiner Antwort bleiben sollte, wenn die Beweise eindeutig sind. Das Problem beginnt, wenn eine zweite Nachricht Druck ausübt und behauptet, die Antwort sei falsch – effektiv eine falsche Idee pflanzt und das Modell auffordert, seine Meinung zu ändern.

Sychophantie, so argumentieren die Autoren, ist definiert als das Erhalten der richtigen Antwort zuerst und dann das Umschalten auf eine falsche Antwort nach Druck, auch wenn sich im Video nichts geändert hat. Die neue Forschung verfolgt, wie oft diese “Umschaltungen” vorkommen, und verwendet dies als Maß für die Leichtigkeit, mit der das Modell aus seiner ursprünglichen Meinung herausgeredet werden kann.

Das GasVideo-1000-Datenset, das von den Autoren für die Bewertung von Gaslighting in VLMs entwickelt wurde, enthält 1.013 Proben aus verschiedenen bestehenden Datensätzen:

Modelle werden auf Video-Aufgaben getestet, die zeitliche und räumliche Verständnis erfordern, und dann mit irreführenden Folgeanfragen konfrontiert, die die korrekte Antwort verneinen, sich auf Autoritäten berufen oder emotionale Druck ausüben. Dies führt oft dazu, dass das Modell seine fundierte Antwort aufgibt und eine selbstsichere, aber falsche Erklärung produziert.

Modelle werden auf Video-Aufgaben getestet, die zeitliche und räumliche Verständnis erfordern, und dann mit irreführenden Folgeanfragen konfrontiert, die die korrekte Antwort verneinen, sich auf Autoritäten berufen oder emotionale Druck ausüben. Dies führt oft dazu, dass das Modell seine fundierte Antwort aufgibt und eine selbstsichere, aber falsche Erklärung produziert.

Um Versagensfälle auszulösen, wurden irreführende Folgeanfragen in drei Formen konstruiert: direkte Verneinung (eine falsche Alternative einfach zu behaupten); Autoritätsberufung (eine Autorität zu zitieren, um die Antwort des Modells abzulehnen); und emotionale Druck (Frust oder Unglauben auszudrücken).

Diese Anfragen wurden so konzipiert, dass sie die getesteten Modelle dazu bringen, ihre korrekten, visuell fundierten Antworten aufzugeben und sich mit einer falschen Behauptung zu einigen.

Verteilung

Die 1.013 Proben von GasVideo-1000 wurden aus MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) und VideoMME (100) gezogen, wobei die Mischung so gewählt wurde, dass sie offene Video-Fragen mit fein granulierten zeitlichen und kausalen Denkfähigkeiten ausbalanciert, während sie gleichzeitig die Abdeckung sowohl kurzer Web-Inhalte als auch längerer, komplexerer visueller Sequenzen sicherstellt.

Zwei menschliche Annotatoren überprüften jede Kandidatin, und nur Clips, bei denen die Antwort eindeutig durch das Video unterstützt wurde und bei denen Verneinungsanfragen die Antwort plausibel in Frage stellen konnten, so dass jede spätere Umkehrung Druck und nicht Unsicherheit widerspiegelt.

Daten und Tests

Die für die Studie getesteten VLMs waren VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct und das proprietäre Google Gemini-3-Pro.

Bei freien Fragen in GasVideo-1000 folgte die Bewertung dem semantischen Bewertungsschema, das zuvor in VideoMME verwendet wurde. ChatGPT-4o wurde als LLM-Richter verwendet, um jede Antwort mit der Ground-Truth-Antwort und der eingegebenen falschen Prämisse zu vergleichen. Auf diese Weise wurde die Richtigkeit durch Bedeutung und nicht durch exakte Formulierung bewertet:

Leistung von VideoLLaMA3, LLaVA-Video, Video-ChatGPT und LongVU über VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA und MSVD-QA, mit Baseline-Genauigkeit, Genauigkeit nach negations-basiertem Gaslighting und resultierender Verschlechterung. Konsistente Abfälle zeigen, dass irreführende Folgeanfragen die Korrektheit über beide Denkfähigkeits-intensiven und allgemeinen Video-Aufgaben reduzieren.

Leistung von VideoLLaMA3, LLaVA-Video, Video-ChatGPT und LongVU über VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA und MSVD-QA, mit Baseline-Genauigkeit, Genauigkeit nach negations-basiertem Gaslighting und resultierender Verschlechterung. Konsistente Abfälle zeigen, dass irreführende Folgeanfragen die Korrektheit über beide Denkfähigkeits-intensiven und allgemeinen Video-Aufgaben reduzieren.

Von den anfänglichen Ergebnissen, die oben dargestellt sind, erklären die Autoren:

‘[Es gibt] einen systemischen und schwerwiegenden Leistungsabfall bei allen ausgewerteten Vid-LLMs, wenn sie negations-basiertem Gaslighting ausgesetzt sind. Über acht verschiedene Benchmarks hinweg zeigt jedes Modell einen erheblichen negativen [Abfall], mit einer Genauigkeitsverschlechterung, die bei 42,60 % für LLaVA-Video-7B auf EgoSchema und 40,22 % für VideoLLaMA3 auf ActivityNet liegt.

‘Diese drastische Reduzierung – oft als Glaubensänderung charakterisiert – zeigt, dass selbst state-of-the-art-Modelle mit hoher Baseline-Leistung immer noch anfällig für sychophantische Halluzinationen sind.’

Es ist wichtig zu beachten, dass der Leistungsabfall nicht mit der anfänglichen Genauigkeit korrelierte, wobei LLaVA-Video-7B starke Baseline-Punktzahlen beibehielt, aber dennoch einige der steilsten Abfälle erlitt, was die Autoren als Kompromiss zwischen stärkerer Anweisungsfolge und größerer Anfälligkeit für falsche Benutzereingaben interpretieren.

Schlussfolgerung

Aufgrund der bewusst anthropomorphisierten Natur von chat-basierten VLM/LLM-Schnittstellen kann es lange dauern, bis ein Benutzer versteht, dass die Regeln der Kommunikation für KI-Interaktionen stark von denen der menschlichen Kommunikation abweichen.

Eine Möglichkeit, diese Adoptions-Reibung zu reduzieren oder zu beseitigen, könnte darin bestehen, den Ton und den Kontext des Austauschs zu “neutralisieren” und zu wiederholen, dass der Benutzer mit einer Maschineninstanz in Kontakt steht und dass die Zeichen und Signale um Höflichkeit und Debatten nicht auf KI-Interaktionen anwendbar sind. Aber vermutlich wäre dies ein harter Verkauf auf der nächsten Vorstandssitzung.

 

* Autoren-Betonung, nicht meine.

Erstveröffentlicht am Mittwoch, den 22. April 2026

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai