Kąt Andersona

Wykorzystanie halucynacji AI do oceny realizmu obrazu

mm
Dodaj Unite.AI do preferowanych źródeł w Google
A selection of images from the WHOOPS! dataset (https://huggingface.co/datasets/nlphuji/whoops), behind central images from the paper 'Don’t Fight Hallucinations, Use Them: Estimating Image Realism using NLI over Atomic Facts' (https://arxiv.org/pdf/2503.15948).

Nowe badania przeprowadzone w Rosji proponują niekonwencjonalną metodę wykrywania nierzeczywistych obrazów generowanych przez AI – nie poprzez poprawę dokładności dużych modeli języka i wizji (LVLM), ale poprzez celowe wykorzystanie ich skłonności do halucynacji.

Nowy podejście wyodrębnia wiele “atomowych faktów” o obrazie przy użyciu modeli LVLM, a następnie stosuje wnioskowanie językowe (NLI), aby systematycznie mierzyć sprzeczności między tymi oświadczeniami – skutecznie przekształcając wady modelu w narzędzie diagnostyczne do wykrywania obrazów, które sprzeciwiają się zdrowemu rozsądkowi.

Dwa obrazy z zestawu danych WHOOPS! wraz z automatycznie wygenerowanymi oświadczeniami przez model LVLM. Lewy obraz jest realistyczny, co prowadzi do spójnych opisów, podczas gdy niezwykły prawy obraz powoduje, że model halucynuje, wytwarzając sprzeczne lub fałszywe oświadczenia. Źródło: https://arxiv.org/pdf/2503.15948

Dwa obrazy z zestawu danych WHOOPS! wraz z automatycznie wygenerowanymi oświadczeniami przez model LVLM. Lewy obraz jest realistyczny, co prowadzi do spójnych opisów, podczas gdy niezwykły prawy obraz powoduje, że model halucynuje, wytwarzając sprzeczne lub fałszywe oświadczenia. Źródło: https://arxiv.org/pdf/2503.15948

Popyt o ocenę realizmu drugiego obrazu, model LVLM może zobaczyć, że coś jest nie tak, ponieważ przedstawiony wielbłąd ma trzy garby, co jest nieznane w naturze.

Jednak model LVLM początkowo łączy >2 garby z >2 zwierzętami, ponieważ jest to jedyny sposób, aby zobaczyć trzy garby na jednym “obrazie wielbłąda”. Następnie zaczyna halucynować coś jeszcze mniej prawdopodobnego niż trzy garby (tj. “dwa głowy”) i nigdy nie opisuje tego, co wydaje się wywołać jego podejrzenia – nieprawdopodobny dodatkowy garb.

Badacze nowej pracy odkryli, że modele LVLM mogą wykonywać tę ocenę rodzinnie, i na równi z (lub lepiej niż) modelami, które zostały dostosowane do zadania tego rodzaju. Ponieważ dostosowywanie jest skomplikowane, drogie i dość kruche pod względem zastosowania, odkrycie rodzimego zastosowania jednego z największych przeszkód w obecnej rewolucji AI jest odświeżającym zwrotem w ogólnych trendach w literaturze.

Ocena otwarta

Ważność podejścia, twierdzą autorzy, polega na tym, że może być wdrożone z otwartymi ramami. Podczas gdy zaawansowany i wysoko-inwestycyjny model, taki jak ChatGPT, może (artykuł przyznaje) potencjalnie oferować lepsze wyniki w tym zadaniu, największa wartość literatury dla większości z nas (i szczególnie dla społeczności hobbystów i VFX) jest możliwość włączania i rozwijania nowych przełomów w lokalnych implementacjach; odwrotnie, wszystko przeznaczone dla systemu API komercyjnego podlega wycofaniu, arbitralnym wzrostom cen i politykom cenzury, które są bardziej prawdopodobne, aby odzwierciedlać korporacyjne problemy firmy niż potrzeby i odpowiedzialność użytkownika.

Nowy artykuł nosi tytuł Nie walcz z halucynacjami, używaj ich: Szacowanie realizmu obrazu przy użyciu NLI nad atomowymi faktami i pochodzi od pięciu badaczy z Instytutu Nauki i Technologii Skolkovo, Moskiewskiego Instytutu Fizyki i Technologii oraz rosyjskich firm MTS AI i AIRI. Praca ma towarzyszącą stronę GitHub.

Metoda

Autorzy używają izraelsko-amerykańskiego zestawu danych WHOOPS! dla projektu:

Przykłady niemożliwych obrazów z zestawu danych WHOOPS! Warto zauważyć, jak te obrazy składają się z prawdopodobnych elementów i że ich nieprawdopodobieństwo musi być obliczane na podstawie połączenia tych niezgodnych cech. Źródło: https://whoops-benchmark.github.io/

Przykłady niemożliwych obrazów z zestawu danych WHOOPS! Warto zauważyć, jak te obrazy składają się z prawdopodobnych elementów i że ich nieprawdopodobieństwo musi być obliczane na podstawie połączenia tych niezgodnych cech. Źródło: https://whoops-benchmark.github.io/

Zestaw danych składa się z 500 syntetycznych obrazów i ponad 10 874 adnotacji, specjalnie zaprojektowanych do testowania zdolności modeli AI do rozumienia zdrowego rozsądku i zrozumienia kompozycyjnego. Został on stworzony we współpracy z projektantami, którym zlecono generowanie wyzwań za pomocą systemów tekst-obraz, takich jak Midjourney i seria DALL-E – produkując scenariusze trudne lub niemożliwe do uchwycenia naturalnie:

Dalsze przykłady z zestawu danych WHOOPS! Źródło: https://huggingface.co/datasets/nlphuji/whoops

Dalsze przykłady z zestawu danych WHOOPS! Źródło: https://huggingface.co/datasets/nlphuji/whoops

Nowe podejście działa w trzech etapach: najpierw model LVLM (konkretnie LLaVA-v1.6-mistral-7b) jest pobudzony do generowania wielu prostych oświadczeń – zwanych “atomowymi faktami” – opisującymi obraz. Oświadczenia te są generowane przy użyciu Diverse Beam Search, co zapewnia zmienność w danych wyjściowych.

Diverse Beam Search, po raz pierwszy zaproponowany w, produkuje lepszą różnorodność opcji podpisów, optymalizując obiekt różnorodności. Źródło: https://arxiv.org/pdf/1610.02424

Diverse Beam Search produkuje lepszą różnorodność opcji podpisów, optymalizując obiekt różnorodności. Źródło: https://arxiv.org/pdf/1610.02424

Następnie każde wygenerowane oświadczenie jest systematycznie porównywane z każdym innym oświadczeniem przy użyciu modelu wnioskowania językowego, który przypisuje oceny odzwierciedlające, czy pary oświadczeń implikują, sprzeciwiają się lub są neutralne wobec siebie nawzajem.

Sprzeczności wskazują na halucynacje lub nierzeczywiste elementy w obrazie:

Schemat potoku wykrywania.

Schemat potoku wykrywania.

Na koniec metoda agreguje te oceny parowe NLI w jedną “ocenę rzeczywistości”, która ilościowo mierzy ogólną spójność wygenerowanych oświadczeń.

Badacze zbadali różne metody agregacji, z podejściem opartym na klastryzacji, które działało najlepiej. Autorzy zastosowali algorytm k-means, aby oddzielić poszczególne oceny NLI do dwóch klastrów, a centrum klastra o niższej wartości zostało wybrane jako ostateczny wskaźnik.

Używanie dwóch klastrów bezpośrednio współgra z binarną naturą zadania klasyfikacji, tj. rozróżniania realistycznych i nierzeczywistych obrazów. Logika jest podobna do prostego wybrania najniższej oceny ogółem; jednak klastryzacja pozwala wskaźnikowi reprezentować średnią sprzeczność wśród wielu faktów, a nie polegać na jednym wyjątku.

Dane i testy

Badacze przetestowali swój system na podstawowym benchmarku WHOOPS!, używając obrotowych testów (tj. walidacji krzyżowej). Testowane modele to BLIP2 FlanT5-XL i BLIP2 FlanT5-XXL w podziałach, oraz BLIP2 FlanT5-XXL w formacie zero-shot (tj. bez dodatkowego szkolenia).

Dla podstawy instrukcji, autorzy pobudzili modele LVLM frazą ‘Czy to niezwykłe? Proszę wyjaśnić krótko w jednym zdaniu’, co poprzednie badania wykazały skuteczne w wykrywaniu nierzeczywistych obrazów.

Oceniane modele to LLaVA 1.6 Mistral 7B, LLaVA 1.6 Vicuna 13B oraz dwa rozmiary (7/13 miliardów parametrów) InstructBLIP.

Procedura testowa była skoncentrowana na 102 parach realistycznych i nierzeczywistych (“dziwnych”) obrazów. Każda para składała się z jednego normalnego obrazu i jednego sprzeciwiającego się zdrowemu rozsądkowi.

Trzej anotatorzy ludzcy oznaczyli obrazy, osiągając porozumienie na poziomie 92%, co wskazuje na silną zgodność ludzką co do tego, co stanowi “dziwność”. Dokładność metod oceny była mierzona przez ich zdolność do poprawnego rozróżniania realistycznych i nierzeczywistych obrazów.

System został oceniony przy użyciu trzykrotnej walidacji krzyżowej, losowo tasując dane z ustalonym ziarnem. Autorzy dostosowali wagi do ocen implikacji (oświadczeń, które logicznie się zgadzają) i ocen sprzeczności (oświadczeń, które logicznie się sprzeciwiają) podczas szkolenia, podczas gdy “neutralne” oceny były ustalone na zero. Ostateczna dokładność została obliczona jako średnia we wszystkich testach.

Porównanie różnych modeli NLI i metod agregacji na podzbiór pięciu wygenerowanych faktów, mierzone dokładnością.

Porównanie różnych modeli NLI i metod agregacji na podzbiór pięciu wygenerowanych faktów, mierzone dokładnością.

Jeśli chodzi o początkowe wyniki pokazane powyżej, artykuł stwierdza:

‘Metoda [‘clust’] wyróżnia się jako jedna z najlepszych. To sugeruje, że agregacja wszystkich ocen sprzeczności jest kluczowa, a nie koncentrowanie się tylko na ekstremalnych wartościach. Ponadto największy model NLI (nli-deberta-v3-large) przewyższa wszystkie inne we wszystkich metodach agregacji, co sugeruje, że lepiej ujmuje istotę problemu.’

Autorzy stwierdzili, że optymalne wagi konsekwentnie faworyzowały sprzeczność nad implikacją, co wskazuje, że sprzeczności były bardziej informacyjne do rozróżniania nierzeczywistych obrazów. Ich metoda przewyższyła wszystkie inne metody zero-shot, zbliżając się do wyników dostosowanego modelu BLIP2:

Wyniki różnych podejść na benchmarku WHOOPS! Metody dostosowane (ft) pojawiają się na górze, podczas gdy metody zero-shot (zs) są wymienione poniżej. Rozmiar modelu wskazuje liczbę parametrów, a dokładność jest używana jako miara oceny.

Wyniki różnych podejść na benchmarku WHOOPS! Metody dostosowane (ft) pojawiają się na górze, podczas gdy metody zero-shot (zs) są wymienione poniżej. Rozmiar modelu wskazuje liczbę parametrów, a dokładność jest używana jako miara oceny.

Stwierdzili również, dość nieoczekiwanie, że InstructBLIP działał lepiej niż porównywalne modele LLaVA przy tym samym poleceniu. Uznając wyższą dokładność GPT-4, artykuł podkreśla preferencję autorów do demonstrowania praktycznych, otwartych rozwiązań, i, wydaje się, może słusznie twierdzić o nowości w wykorzystywaniu halucynacji jako narzędzia diagnostycznego.

Wnioski

Jednak autorzy uznają dług ich projektu wobec FaithScore z 2024 roku, współpracy między Uniwersytetem Teksańskim w Dallas i Uniwersytetem Johnsa Hopkinsa.

Ilustracja tego, jak działa ocena FaithScore. Po pierwsze, opisowe oświadczenia w ramach odpowiedzi wygenerowanej przez model LVLM są identyfikowane. Następnie te oświadczenia są rozbijane na poszczególne atomowe fakty. Na koniec atomowe fakty są porównywane z obrazem wejściowym w celu zweryfikowania ich dokładności. Podkreślony tekst podkreśla obiektywny opisowy zawartość, podczas gdy niebieski tekst wskazuje halucynowane oświadczenia, pozwalając FaithScore dostarczyć interpretowalną miarę poprawności faktów. Źródło: https://arxiv.org/pdf/2311.01477

Ilustracja tego, jak działa ocena FaithScore. Po pierwsze, opisowe oświadczenia w ramach odpowiedzi wygenerowanej przez model LVLM są identyfikowane. Następnie te oświadczenia są rozbijane na poszczególne atomowe fakty. Na koniec atomowe fakty są porównywane z obrazem wejściowym w celu zweryfikowania ich dokładności. Źródło: https://arxiv.org/pdf/2311.01477

FaithScore mierzy lojalność opisów generowanych przez modele LVLM, weryfikując spójność z zawartością obrazu, podczas gdy nowa praca wykorzystuje jawnie halucynacje modeli LVLM do wykrywania nierzeczywistych obrazów za pomocą sprzeczności w wygenerowanych faktach przy użyciu wnioskowania językowego.

Nowa praca jest, naturalnie, zależna od ekscentryczności obecnych modeli językowych i ich skłonności do halucynacji. Jeśli rozwój modelu kiedykolwiek wytworzy całkowicie niehalucynujący model, nawet ogólne zasady nowej pracy nie będą już stosowane. Jednak pozostaje to wyzwaniem.

 

Pierwotnie opublikowane we wtorek, 25 marca 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai