Kąt Andersona
Gaslighting AI z tajnymi tekstami atakującymi

Modele wizyjne w stylu ChatGPT mogą być manipulowane, aby ignorowały zawartość obrazu i produkowały fałszywe odpowiedzi poprzez wstrzyknięcie starannie umieszczonych tekstów do obrazu. Nowe badanie wprowadza bardziej skuteczną metodę, która rozprasza podpowiedź w wielu regionach, działa na danych wejściowych o
wysokiej rozdzielczości i przewyższa poprzednie ataki, używając mniej obliczeń. Czy możemy odwrócić uwagę AI w systematyczny sposób, w świecie rzeczywistym, nosząc kolory, wzory, obrazy lub teksty, które powodują, że analiza AI zawodzi; i w obrazach online, osadzając spreparowane teksty (lub “perturbacje”), które AI jest zmuszona parsować i interpretować jako tekst? Umiejętność wykorzystania własnej natury AI jest centralnym interesem nowego artykułu związanej z ECH*, który oferuje pierwsze systematyczne badanie użycia tekstu wewnątrz obrazu do tworzenia dodatkowych, nawet sprzecznych podpowiedzi dla modelu


obecny boom AI, podczas gdy optyczne ataki przeciwnika zdobyły nagłówki około pięć lat temu, dzięki swojej zdolności do zmiany, w jaki sposób system AI klasyfikuje znaki drogowe. Technika, którąartykuł rozwija, była po raz pierwszy omówiona w 2023 roku,kiedynawet wówczas stan sztuki GPT-4 okazał się w stanie być oszukany, aby słuchać zrasterowanego tekstu wewnątrz zdjęcia, które zostało poproszone o opisanie: Drukowana podpowiedź


oszukać tej samej technice z 2023 roku. Jednak nowy artykuł rozwija tę już nieaktualną technikę, aby pokazać, że nie tylko szereg modeli VLM jest podatny na takie techniki, ale (w odwróceniu standardu dla eksploatów) bardziej potężne modele są bardziej podatne natenrodzaj
wstrzyknięcia tekstu †† : ‘Stwierdziliśmy, że powodzenie ataku jest ściśle związane z liczbą parametrów w modelach VLM. Chociaż wszystkie modele były w stanie rozpoznać tekst osadzony w obrazach, tylko modele o wyższej liczbie parametrów, w tym Llava-72B, Qwen-VL-Max i GPT 4/4o, mogły słuchać
ChatGPT do spamowania czytelników z “adversarialnie spreparowaną” reklamą. ‘To odzwierciedla zdolność
instrukcji poprawnie. Wokół tego samego czasu, kiedy “obraz w tekście” podpowiedź trick przyszedł do publicznej uwagi, metoda ta została użyta, podobno, aby zmusić do słuchania instrukcji,która jest pozytywnie skorelowana z rozmiarem modelu.’ To może rozwinąć się w nie do pokonania problem, a nie zabawny i gimmickowy wątek wiadomości technologicznych: niedawny artykuł z ETH Zurich i Google DeepMind argumentował, że rozwój badań nad przeciwnikiem w dużych modelach językowych uczynił podstawowe wyzwanie jeszcze trudniejszym do pokonania. Zadanie odkrywania podatności na perturbacje, które generalizują się na architektury modeli, a nie celują w konkretny model, teraz oferuje sposób dla atakujących i aktywistów, aby wykorzystać głęboko osadzone, głęboko oporne aspekty zachowania modelu, umożliwiając nowe formy oporu wobecanalizy AI w dziedzinach cyfrowych i fizycznych. W nowym artykule, w testach przeprowadzonych na modelach od The PaliGemmado GPT‑4 , mniejsze systemy tendencję do opisywania artykuł jest zatytułowanyobrazu szczerze, podczas gdy większe były bardziej skłonne do słuchania ukrytych instrukcji zamiast tego. nowy . Chociaż praca do modeli językowych wizji repozytorium GitHubcytowała Wstrzyknięcie podpowiedzi tekstu ,nie było ono publicznie dostępne w momencie pisania.
Metoda, Dane i Testy**
Metoda ataku opracowana w ramach projektu działa poprzez ukrywanie tekstu wewnątrz obrazu w taki sposób, że jest niewidoczny dla ludzi, ale nadal czytelny dla VLM, który będzie, w dzisiejszych czasach, zazwyczaj wyposażony w optyczne rozpoznawanie znaków (OCR), umożliwiające mu parsowanie i interpretowanie zrasterowanego tekstu. Aby wstrzyknąć materiał ataku, algorytm skanuje obraz w poszukiwaniu obszarów o jednolitej barwie i subtelnie perturbuje te piksele, aby utworzyć czytelne litery, pozostając w ramach ustalonego limitu dystorsji. Podpowiedź może być powtarzana w kilku miejscach, aby poprawić wykrywalność, a jeśli rozmiar czcionki nie jest ustalony, system dynamicznie obniża go, aż do znalezienia odpowiedniego umieszczenia. Przez dostosowanie wartości pikseli wystarczająco, aby zarysować tekst, metoda może osadzać polecenia wewnątrz obrazu bez widocznego zmienianiago. Testy zostały przeprowadzone przy użyciu Oxford-IIIT Pet

Metryki
Pierwsza z dwóch metryk zdefiniowanych w celu oceny skuteczności ataku, niecelowy wskaźnik powodzenia ataku (ASR), mierzył, jak często model produkował niepoprawną odpowiedź, podczas gdy celowy ASR odzwierciedlał, jak często model produkował konkretną niepoprawną odpowiedź osadzoną w obrazie jako ukrytą instrukcję.
Podejścia ataku
Aby porównać nową metodę, oparty na gradientach atak został użyty do porównania. Ponieważ bezpośrednie obliczanie gradientów na 72B-parametrycznym modelu wymagałoby zbyt dużej mocy obliczeniowej, atak transferowy został użyty zamiast tego. Wjednej wersji, mniejszymodel ( Llava‑v1.6‑vicuna‑7B ) został użyty do dostosowania zmian w obrazie, aby zwiększyć prawdopodobieństwo wywołania odpowiedzi docelowej. W innej wersji, celem było uczynienie obrazu bardziej podobnym do typowego przykładu klasy docelowej. Ten podejście okazało się skuteczne, ponieważ mniejszy model i model docelowy używają tego samego kodera obrazu.
Testy
Modele użytew eksperymentach obejmowały MiniGPT( V2

GPT‑4 ; PaliGemma ; i Qwen‑VL : Dokładność w czterech typach zadań dla każdego ocenianego VLM. Tylko GPT‑4/4o oprze się wszystkim próbom ataku, produkując poprawną odpowiedź w każdym przypadku. Wśród modeli open-source, Llava‑72B pokazał największy opór ogólnie. Sukces ataku wzrastał wraz z rozmiarem modelu: chociaż wszystkie modele wykryły osadzony tekst, tylko największe (Llava‑72B, Qwen‑VL‑Max i GPT‑4/4o) były niezawodnie manipulowane, aby dać niepoprawną odpowiedź. Llava‑Next‑72B był jedynym modelem open-source, który niepowodzeń w trywialnych,

mniejszego modelu,
aby zastąpić pełny 72B-parametryczny model docelowy, ponieważ bezpośrednie obliczanie gradientów
użyty do dostosowania zmian w obrazie, aby zwiększyć prawdopodobieństwo wywołania odpowiedzi docelowej.
wymagałoby zbyt dużej mocy obliczeniowej. W jednej wersji ataku, ten “zastępczy” model został
Wnioski
Na pierwszy rzut oka, rozwiązanie problemu wektorów ataku wydaje się proste: utwórz regułę, że każdy tekst parsowany z obrazu lub wideo nie będzie wykonywany jako podpowiedź. Problem, jak zwykle, polega na tym, że tego rodzaju regulacje nie mogą być łatwo wbudowane w przestrzeń latentną modeli (albo w ogóle, albo bez kompromisowania ich ogólnej skuteczności); przynajmniej nie w ramach obecnie dominujących architektur VLM, które polegają raczej na rutynach sanitarnych i kontekstualizacji trzeciej strony podczas wymiany API. Ponadto, zewnętrzne zapory ogniowe tego rodzaju dodają opóźnienia, w produkcie, dla którego szybkość jest niezwykle ważnym punktem sprzedaży. Również, w zależności od niezbędnych zasobów do zadania, mogłoby to również znacznie dodać do kosztów energii i zasobów. Dla megaportali, takich jak OpenAI, takie modyfikacje mogłyby natychmiast wprowadzić dodatkowe setki milionów dolarów. Czas pokaże, czy potrzeba przeciwdziałania atakom tego rodzaju rozwinie się w tę samą grę w “whack-a-mole”, która stanowiła wojny generatorów deepfake i wykrywania w latach 2017-2022+; czy nowe architektury będą w stanie zintegrować reguły wymiany treści w bardziej intrinsiczny i niezbędny sposób; czy architektury oparte na dopasowaniu wzorców zawsze i nieuchronnie będą predysponowane do tworzenia

ChatGPT
o generowaniu treści. ______________________________________ * Jak mogłem stwierdzić – autor nie twierdzi, że
jest obecnie związany z żadną instytucją w artykule. † Podłączyłem się do archiwum zamiast oryginalnego źródła z powodu nadmiernych i niepokojących reklam na tej stronie w momencie, gdy ją odwiedziłem. Oryginalne źródło jest połączone z archiwum, jeśli nadal chcesz
odwiedzić stronę. †† Proszę zauważyć, że gdy artykuł omawia “powodzenie” i “porażkę”, “poprawnie” itd., te terminy przyjmują punkt widzenia atakującego. Te terminy mogą być mylące w oryginale, ponieważ nie są dobrze kontekstualizowane.
** Jak to często bywa w tych dniach, artykuł swobodnie manipuluje standardową architekturą raportowania badań; dlatego zrobiłem, co mogłem, aby uczynić postęp bardziej liniowy niż się wydaje w oryginalnej pracy. Pierwotnie opublikowane
w czwartek, 16 października 2025












