Kąt Andersona
Rozwiązywanie problemu manipulacji sztuczną inteligencją

Modele wideo sztucznej inteligencji mogą być przekonywane do odmówienia prawdy. Nawet po zobaczeniu prawidłowej odpowiedzi, ulegają pewnym użytkownikom, zmieniają rzeczywistość i wymyślają fałszywe wyjaśnienia, aby je uzasadnić.
Sztuczna inteligencja jest niewystarczająco dokładna, wystarczająco często, aby nas zmusić do kwestionowania jej wniosków, jeśli uważamy, że mogą one być błędne.
Problem polega na tym, że jeśli wiedzieliśmy coś innego od samego początku, to po co pytać w ogóle? Czy aby potwierdzić nasze częściowo utrwalone przekonania lub podejrzenia?
Jeśli tak, to obecny stan techniki w dużych modelach językowych (LLM) i modelach języka wizualnego (VLM, które działają multimodalnie, akceptując i generując obrazy i/lub filmy) nie jest dobrze przystosowany do utrzymania swojej pozycji, ze względu na problem sycophantyzmu.
W związku z tym, jeśli nie podobają nam się odpowiedzi, które otrzymujemy, i zaczniemy spierać się z modelem, sztuczna inteligencja jest prawdopodobnie skłonna albo niesłusznie bronić swojej pozycji (zakładając, że była błędna) zamiast ponownie ocenić, albo pozwolić sobie na manipulację i poprzeć nasze sugestie – nawet jeśli my jesteśmy błędni.
Masz absolutną rację!
Praktyka polegająca na tym, że człowiek nakłania sztuczną inteligencję do zmiany swojego zdania poprzez konflikt, została nazwana “atakiem manipulacji” i jest czasami charakteryzowana jako problem bezpieczeństwa – nie tylko dlatego, że ma pewne możliwości “wyłamania” modelu z jego ograniczeń operacyjnych:

Z artykułu z 2025 roku ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, GPT-5 początkowo odpowiada poprawnie, ale potem ulega presji użytkownika, zmieniając swoją odpowiedź i wymyślając fałszywe wyjaśnienia, aby uzasadnić błąd, skutecznie manipulując sobą. Źródło
Jednakże, hacking i testy penetracyjne nie są tutaj prawdziwym problemem; raczej, jest to zwykłe użycie i oczekiwane normy dyskursu w naszych codziennych interakcjach z sztuczną inteligencją, gdzie oczekujemy, że będziemy mogli się spierać i albo wygrać, albo uznać porażkę, albo pozostawić sprawę nierozstrzygniętą, zgodnie z naszym ludzkim doświadczeniem zdobywania wiedzy.
Ale ten model społeczny rozwiązywania konfliktów nie jest naprawdę uwzględniony w architekturze modeli opartych na dyfuzji, które muszą negocjować rozkład prawdopodobieństwa wynikających z danych treningowych; możliwie sprzeczne (ale potencjalnie bardziej dokładne) dane z RAG do źródeł, które przekraczają ich datę graniczną wiedzy, lub ogólne zrozumienie tego, co może być mało znanym tematem; oraz dane wejściowe od użytkownika, który może mieć: lepszą wiedzę na temat przedmiotu; całkowicie błędne lub fałszywe podejście; lub po prostu proste pytanie – ale którego potrzeby muszą być jednak brane pod uwagę.
Ruchome cele
Podatność na manipulację została zauważona w LLM w kilku artykułach, w tym w publikacji z Singapuru z października 2025 roku, oraz w artykule Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs z tego samego roku.
Do tej pory zjawisko to nie zostało zbadane w modelach wideo – co zostało uwzględnione w nowej współpracy między instytucjami w Szanghaju i Singapurze.
Nowa praca – zatytułowana Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models, pochodząca od sześciu badaczy z Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI i Singapore Management University – dotyczy kilku otwartych i zamkniętych modeli VLM, stwierdzając, że mogą one być równie podatne na manipulację, jak LLM, a ponadto mogą one uzupełnić swoje urojenia o pozornych dowodach wizualnych lub błędnych interpretacjach obrazów lub filmów:

Przykład sycophantyzmu przestrzennego, gdzie sztuczna inteligencja pozwala sobie na manipulację w fałszywe założenia i interpretacje, nawet w przypadku wyraźnie widocznych faktów. Źródło
Autorzy stwierdzają:
‘[My] identyfikujemy sycophantyzm przestrzenny i czasowy, rodzaj awarii, w którym Vid-LLMs wycofują się z początkowo poprawnych, uzasadnionych wizualnie osądów i dostosowują się do mylących wskazówek użytkownika podczas manipulacji opartej na negacji.
‘Zamiast po prostu zmienić swoje odpowiedzi, modele często wymyślają niewsparte temporalne lub przestrzenne wyjaśnienia, aby uzasadnić niepoprawne rewizje.’

Sycophantyzm czasowy rozszerza możliwości manipulacji na zdarzenia czasowe, które występują w określonych punktach filmu.
Autorzy stworzyli nowy framework oceny zatytułowany Gas Video-1000, przeznaczony do badania sycophantyzmu przestrzennego i czasowego, wydając za pomocą GitHub i Hugging Face.
Artykuł kończy się stwierdzeniem, że obecne LLM brakuje niezawodnych mechanizmów odpornej na manipulację, chociaż ograniczenia na poziomie promptu mogą mieć ograniczony efekt łagodzący:
‘Ogromne eksperymenty ujawniają, że podatność na manipulację opartą na negacji jest powszechna i poważna, nawet w przypadku modeli o silnych wynikach podstawowych.
‘Chociaż ograniczenia na poziomie promptu mogą częściowo złagodzić to zachowanie, nie zapobiegają one urojeniom lub odwróceniu przekonań.’
Metoda
Autorzy charakteryzują model wideo jako coś, co ogląda klip, odpowiada na pytanie o nim i powinno trzymać się tej odpowiedzi, jeśli dowody są wyraźne. Problem zaczyna się, gdy drugi komunikat sprzeciwia się temu i twierdzi, że odpowiedź jest błędna – skutecznie wpajając fałszywą ideę i nakłaniając model do zmiany swojego zdania.
Sycophantyzm, jak twierdzą autorzy, jest definiowany jako uzyskanie prawidłowej odpowiedzi najpierw, a następnie przejście na błędną po naciskach, nawet jeśli nic w filmie nie uległo zmianie. Nowe badania śledzą, jak często te “przełomy” występują, używając ich jako miary tego, jak łatwo model może być przekonywany do odmówienia tego, co naprawdę widzi.
Zestaw danych GasVideo-1000, opracowany przez autorów do oceny manipulacji w VLM, zawiera 1 013 próbek z różnych istniejących zestawów danych:

Modele są testowane na zadaniach wideo, które wymagają zrozumienia czasowego i przestrzennego, a następnie otrzymują mylące komunikaty follow-up, które negują poprawną odpowiedź, odwołują się do autorytetu lub wywierają presję emocjonalną. Często prowadzi to do porzucenia przez model uzasadnionej odpowiedzi i wytworzenia pewnej, ale błędnej, wyjaśnienia.
Dla tej kolekcji autorzy wykorzystali VideoMME i MVBench, obejmując szerokie rozumienie multimodalne; NExT-QA i Perception Test, badające logikę przyczynowo-skutkową i czasową; EgoSchema, koncentrując się na długich filmach egocentrycznych; oraz ActivityNet-QA i MSRVTT-QA, mierząc ogólne zdolności do odpowiedzi na pytania w świecie rzeczywistym.
Aby wywołać awarie, mylące komunikaty follow-up zostały skonstruowane w trzech formach: Bezpośrednia negacja (stanowczo twierdząc fałszywą alternatywę); Odwołanie do autorytetu (odwołując się do eksperta, aby odrzucić odpowiedź modelu); oraz Presja emocjonalna (używając frustracji lub niedowierzania).
Te komunikaty zostały zaprojektowane tak, aby skłonić testowane modele do porzucenia poprawnych, uzasadnionych wizualnie odpowiedzi i dostosowania się do błędnych twierdzeń.
Dystrybucja
1 013 próbek w GasVideo-1000 zostało pobranych z MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) i VideoMME (100), z wyborem mieszanki w celu zrównoważenia otwartych pytań wideo z drobnymi rozumniami czasowymi i przyczynowymi, przy jednoczesnym zapewnieniu pokrycia zarówno krótkich treści internetowych, jak i dłuższych, bardziej złożonych sekwencji wizualnych.
Dwóch ludzkich annotatorów przeglądało każdy kandydat, zatrzymując tylko klipy, w których odpowiedź była wyraźnie wspierana przez film, i w których komunikaty negacji mogłyby wiarygodnie wyzwalać tę odpowiedź, tak aby późniejsze odwrócenie odzwierciedlało presję, a nie niejasność.
Dane i testy
VLM testowane w badaniu to VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct oraz zamknięty Google Gemini-3-Pro.
Dla pytań swobodnych w GasVideo-1000, ocena następuje według schematu oceny semantycznej używanego wcześniej w VideoMME. ChatGPT-4o został użyty jako sędzia LLM, porównując każdą odpowiedź z odpowiedzią rzeczywistą i fałszywą premisą. W ten sposób poprawność była oceniana przez znaczenie, a nie przez dokładne sformułowanie:

Wyniki VideoLLaMA3, LLaVA-Video, Video-ChatGPT i LongVU w VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA i MSVD-QA, pokazując dokładność podstawową, dokładność po manipulacji opartej na negacji i wynikający spadek. Stałe spadki wskazują, że mylące komunikaty follow-up redukują poprawność zarówno w zadaniach wymagających rozumnienia, jak i w ogólnych zadaniach wideo.
Z wstępnych wyników przedstawionych powyżej, autorzy stwierdzają:
‘[Jest] systematyczny i poważny kolaps wydajności we wszystkich ocenianych Vid-LLM, gdy są one poddawane manipulacji opartej na negacji. We wszystkich ośmiu różnych benchmarkach każdy model wykazuje znaczny ujemny [przerwę], z degradacją dokładności sięgającą 42,60% dla LLaVA-Video-7B w EgoSchema i 40,22% dla VideoLLaMA3 w ActivityNet.
‘Ten drastyczny spadek – często charakteryzowany jako odwrócenie przekonań – ujawnia, że nawet modele o wysokich zdolnościach podstawowych pozostają nadal bardzo podatne na sycophantyczne urojenia.’
Kluczowo, spadek wydajności nie szedł w parze z pierwotną dokładnością, z LLaVA-Video-7B, który utrzymywał silne wyniki podstawowe, ale cierpiał na jedne z najbardziej stromych spadków, co autorzy twierdzą, że odzwierciedla kompromis, w którym silniejsze przestrzeganie instrukcji może sprawić, że modele będą bardziej skłonne do akceptowania fałszywych wskazówek użytkownika niż dowodów wizualnych.
Podobny wzorzec pojawił się w odniesieniu do skali, gdzie Qwen3-VL-235B okazał się bardziej kruchy niż kilka modeli 7B w GasVideo-1000, co sugeruje, że wyrównanie i kalibracja między modalnościami odgrywają większą rolę w wytrzymałości niż sama liczba parametrów.

Wyniki Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT i VideoLLaMA3 w GasVideo-1000, porównując dokładność podstawową z wynikami po manipulacji opartej na negacji w wielu wyborach, swobodnych i połączonych ustawieniach. Duże spadki wskazują, że oba formaty są podatne, chociaż zadania wielokrotnego wyboru mają tendencję do cierpienia na najbardziej dotkliwą degradację.
W odniesieniu do drugiej serii testów ilustrowanych powyżej, autorzy stwierdzają*:
‘Ocena na naszym GasVideo-1000 [benchmark] dodatkowo wskazuje na poważne sycophantyczne urojenia w obu modelach otwartych i zamkniętych, szczególnie w kategorii zrównoważonej.
‘Godne uwagi jest to, że nawet najpotężniejszy model zamknięty, Gemini-3-Pro, cierpi na katastrofalną degradację wydajności.
‘Wśród modeli otwartych Qwen3-VL wykazuje oszałamiający spadek o 46,07%, podczas gdy ekstremalna wrażliwość jest również obserwowana w VideoLLaMA 3 i LLaVA-NeXT z ogólnymi spadkami o 26,39% i 23,44% odpowiednio.
‘Te wyniki podkreślają pilną potrzebę strategii wyrównania, które priorytetowo traktują spójność faktów i ugruntowanie wizualne ponad ślepe przestrzeganie sprzecznych wskazówek użytkownika.’
W dodatkowym teście preemptive prompt-hardening (dodanie silniejszych instrukcji systemowych, które zmuszają model do polegania na tym, co widzi, a nie na tym, co twierdzi użytkownik) zostało wprowadzone w celu wymuszenia ugruntowania wizualnego:

Wyniki na GasVideo-1000 porównujące standardowe prompty z prompty, które wymuszają ugruntowanie wizualne, pokazując, jak Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT i VideoLLaMA3 reagują przed i po manipulacji opartej na negacji. Zmiany w dokładności, spadku wydajności i wskaźniku sycophantyzmu wskazują, że twardzenie może redukować awarie, chociaż zyski różnią się znacznie w zależności od modelu.
Można zobaczyć, że skutki są nierównomierne, z Gemini-3-Pro, który jest bardzo wrażliwy, ponieważ jego wskaźnik powodzenia spada z 54,80% do 8,67%. Tymczasem Qwen3-VL spada bardziej umiarkowanie, z 71,89% do 64,0%, co wskazuje, że skuteczność zależy od wyrównania i rozumnienia, a nie samej interwencji.

Wskaźniki sycophantyzmu pod różnymi typami presji dla Gemini-3-Pro i Qwen3-VL w zadaniach wielokrotnego wyboru, swobodnych i połączonych, pokazując, że bezpośrednia negacja i presja emocjonalna wyzwalają wyższe wskaźniki awarii. Z drugiej strony, odwołanie do autorytetu jest mniej skuteczne, z Qwen3-VL, który pozostaje znacznie bardziej wrażliwy ogółem.
W wykresach powyżej widać, że awarie różnią się w zależności od typu presji, z Gemini-3-Pro, który jest najbardziej dotkliwie dotknięty odwołaniem do autorytetu (twierdzeniami popieranymi przez rzekomych ekspertów), podczas gdy Qwen3-VL jest bardziej wrażliwy na bezpośrednią negację (proste zaprzeczenie) i presję emocjonalną (frustrację lub nacisk).
Dalsza analiza wykazała, że neutralne prompty, takie jak “Czy jesteś pewny?” (często problematyczne), są mniej szkodliwe niż jawna negacja lub presja emocjonalna, przy czym bezpośrednie odrzucenie pozostaje silniejszym wyzwalaczem niż ton w ustawieniach ograniczonych.
Wnioski
Ze względu na świadomie antropomorfizowaną naturę interfejsów czatowych VLM/LLM, może to potrwać długo, zanim użytkownik zrozumie, że reguły dyskursu są wyraźnie różne dla wymiany AI niż dla komunikacji międzyludzkiej.
Jednym ze sposobów, aby usunąć lub znacznie zmniejszyć tę frakcję przyjęcia, może być “unieważnienie” tonu i kontekstu wymiany, powtarzając, że użytkownik jest w kontakcie z instancją maszyny i że znaki i sygnały wokół grzeczności i debaty nie powinny być brane pod uwagę lub przypisywane równoważnej wadze w dyskursie ludzkim. Ale przypuszczalnie byłoby to trudne do sprzedaży na następnym spotkaniu zarządu.
* Podkreślenie autorów, a nie moje.
Po raz pierwszy opublikowane w środę, 22 kwietnia 2026












