Kąt Andersona

Systemy wizji AI często nie “patrzą” naprawdę

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated image (GPT-2): a supermarket bin contains misshapen green apples beneath a sign showing a red apple and the words 'Red, glossy and round.' The image is surrounded by a yellow-and-black border labelled “AI fantasy inside” and “reality outside,” with inward-pointing arrows.

Systemy wizji AI mogą wyjaśniać obrazy za pomocą stereotypów zamiast tego, co one naprawdę widzą. Usunięcie etykiety powoduje, że ich rzekome wyjaśnienia wizualne zawodzą.

 

Ponieważ platformy AI są ciągle tracące pieniądze w nadziei na horyzont zdarzeń AI, każda oszczędność w ich udostępnianiu i usługach oznacza ogromne oszczędności: na przykład, każdy raz, gdy model językowy może udzielić odpowiedzi z własnej macierzy szkoleniowej zamiast podejmowania podróży opartej na RAG do sieci w celu uzyskania bieżących informacji, które będą wymagać destylacji i rafinacji, odpowiada szybciej i oszczędza dostawcy pieniędzy.

Oczywiście, jest bardziej prawdopodobne, że zahallucynuje, bez wydatkowania dodatkowych tokenów i energii na kontekstualizację i sprawdzanie swoich założeń.

Podobnie, nawet jeśli model językowy sięga do sieci, bardzo często cytuję niejasne, nieodpowiednie lub nawet bezsensowne i niezwiązane z tym URL, ponieważ zaoszczędził energię, oceniając tylko metadane tych stron, zamiast ich czytać.

W podobny sposób, jeśli przesłaniesz plik PDF do modelu językowego i chcesz omówić go, model językowy może ostatecznie wyczyścić zawartość pliku PDF z pamięci i użyć tylko rzadkich metadanych, aby odpowiedzieć na Twoje pytania, bez nawet powiadomienia, że powinieneś przesłać go ponownie – co prowadzi do błędów, błędnych założeń i jeszcze więcej halucynacji.

Próby przemysłowe

Są to pragmatyczne, choć nie całkiem uczciwe oszczędności narzucane użytkownikowi z powodów operacyjnych. W świecie gromadzenia danych i szkolenia modeli, gdzie miliony, a nawet setki milionów obrazów muszą być przetwarzane en masse, i nie mogą być ręcznie opatrzonych etykietami przez ludzi, presja na minimalizację wydatków energii i czasu jest równie intensywna.

Jednym z takich “skróconych” rozwiązań jest użycie pośredniego modelu języka wizji, takiego jak Contrastive Language Image Pretraining (CLIP), który mapuje obrazy i tekst do wspólnej przestrzeni semantycznej, aby pojęcia wizualne mogły być porównywane za pomocą języka, a nie jawnych etykiet.

Czym jest to? Czy wyobraź sobie dziecko, które uczy się z milionów opatrzonych podpisami obrazów, aż rozwinie pewne poczucie, które obrazy i słowa naturalnie się ze sobą łączą.

Problem polega na tym, że bardzo często podpisów te były napisane przez właścicieli stron internetowych i innych podmiotów, które były bardziej zainteresowane dobrym SEO niż dobrym oznaczaniem, co prowadzi do dużej ilości “szumu” lub nieprecyzyjnego oznaczania.

Jednakże, w skali, w jakiej pojęcie i powiązane z nim słowo powtarzają się w ogromnych zbiorach danych, zwykle oznacza to, że podstawowe słowa będą kojarzone z odpowiednim obrazem, ponieważ mniejsza liczba “bezsensownych” etykiet zwykle będzie zmuszona do “getta outlierów” i nie zwykle zdobędzie skojarzenie z obrazem. Więc to mniej więcej działa, większość czasu.

Oznaczanie danych jest robione w ten sposób, ponieważ jest tanie i minimalnie funkcjonalne, a nie dlatego, że jest dobre.

Pozaszkolne

Do tego problematycznego scenariusza wkracza nowy artykuł z Carnegie Mellon, ilustrujący wyraźnie, że wiele podpisów przypisanych do obrazów – na przykład przez CLIP – są po prostu stereotypami opartymi na odniesieniu do etykiety obrazu (opartej na tekście), a nie przez aktywne “patrzenie” na sam obraz.

W jednym uderzającym przykładzie z artykułu CLIP jest połączony z opisami wygenerowanymi z nazwy klasy ImageNet strawberry, a następnie testowany na ImageNet-Sketch, gdzie każda truskawka jest rysunkiem czarno-białym – jednak opis nadal twierdzi, że owoc jest ‘czerwony’ i ‘dojrzały’:

Opis nazwy klasy nie powiedzie się w ImageNet-Sketch: językowe priorytety mówią 'czerwony' i 'dojrzały', podczas gdy atrybuty oparte na obrazie pasują do rysunku czarno-białego. Źródło - https://www.unite.ai/wp-content/uploads/2026/07/figure-1-4.jpg

Opis nazwy klasy nie powiedzie się w ImageNet-Sketch: językowe priorytety mówią ‘czerwony’ i ‘dojrzały’, podczas gdy atrybuty oparte na obrazie pasują do rysunku czarno-białego. Źródło

Tutaj CLIP jest połączony z opisami wygenerowanymi tylko z nazwy klasy strawberry, za pomocą GPT-3 lub zewnętrznej wiedzy. Te nigdy nie widzą obrazu, więc domyślnie wybierają kanoniczne cechy, takie jak czerwony i liściasty. Gdy są stosowane do monochromatycznych ilustracji liniowych w ImageNet-Sketch, proces nie powiedzie się.

W przeciwieństwie do tego, atrybuty pochodzące z samych obrazów wybierają cechy, które pozostają prawdziwe podczas przesunięcia, takie jak kropkowany lub kształt serca.

W ten sposób możemy zobaczyć, że obiekt identyfikowany jest reklamowany nie za to, kim jest, ale, jakby, “z reputacją”; przymiotniki “czerwony” i “liściasty” są dokładne dla poddomeny strawberry, ale przekraczają granice obrazu (instancji) w question.

Autorzy nowej pracy – zatytułowanej Atrybuty powinny pochodzić z obrazów, a nie z nazw klas: wybór atrybutów warunkowanych dystrybucją dla modeli języka wizji – twierdzą, że jest to trwały i powszechny problem, i sugerują wybór atrybutów bezpośrednio z samych obrazów, aby odzwierciedlały one to, co jest naprawdę widoczne podczas przesunięcia dystrybucji, zamiast polegania na priors nazw klas.

Autorzy stwierdzają:

‘Popularna droga do klasyfikacji zero-shot prosi duży model językowy (LLM), aby opisać każdą nazwę klasy i uruchomić CLIP z wynikowymi opisami. Pokazujemy, że te opisy noszą niewiele wizualnych dowodów: usunięcie nazwy klasy z podpowiedzi powoduje, że dokładność ImageNet spada z 59,5% do 15,5%.

‘Rozpoznanie jest takie, że opisy są warunkowane etykietą, a nie obrazami, więc opisują pojęcie ogólnie i mylą dokładnie, gdy dane przesuwają się; LLM twierdzi, że truskawki są czerwone, ale każda truskawka w ImageNet-Sketch jest kolorowym rysunkiem liniowym.

‘Dlatego wybieramy atrybuty z kolekcji obrazów docelowych zamiast: oceniamy duży basen atrybutów przeciwko obrazom w przestrzeni wspólnej CLIP i zachowujemy tylko te atrybuty, które najlepiej pasują do obrazów, bez wymagania ponownego szkolenia lub dodatkowej nadzorowanej kontroli obrazu i tekstu.’

Ich proponowane rozwiązanie polega na tym, że model pozostaje taki sam, ale zamiast polegać na opisach nazw klas, sprawdza basen kandydujących atrybutów przeciwko obrazom i zachowuje tylko te, które naprawdę pasują do tego, co jest widoczne.

Koszt tego jest racjonalnie akceptowalny, ponieważ nie proponuje ponownego wykorzystania zaoszczędzonej energii “oszukańczych” metod, które doprowadziły do problemu w pierwszej kolejności. Zamiast tego dodaje przejście oceny nad kandydującymi atrybutami na klasę, tak że opóźnienie wzrasta nieznacznie – ale o wiele mniej niż ponowne szkolenie lub pełne potoki RAG. W teorii, koszt energii byłby akceptowalny, uwzględniony w stosunku do poprawy wyrównania.

Metoda

Ponieważ metodyka testów autorów jest szczególnie arkaiczna, a minimalna dodatkowa przydatna wiedza nie byłaby uzyskana przez głębsze zbadanie ich, będziemy, niezwykle, rozważać tylko skrócony przegląd ich podejścia.

Praca charakteryzuje podstawowy problem jako zakłócenie nazwy klasy: sytuację, w której wydajność wydaje się pochodzić z znaczących opisów, ale w rzeczywistości zależy od samej nazwy klasy, z opisami dodającymi niewiele – i zawodząc, gdy tylko to wsparcie zostanie usunięte

Następnie praca argumentuje, że ten niepowodzenie jest nieuniknione, ponieważ opisy wygenerowane z nazwy klasy mogą opisać tylko to, jak rzecz zwykle wygląda, a nie to, co jest naprawdę obecne w konkretnym obrazie. Gdy tylko dane odbiegają od tych oczekiwań, opisy stają się nie tylko niewielce pomocne, ale aktywnie mylące, skutecznie głosując przeciwko poprawnej odpowiedzi.

Badacze również rozważali, czy CLIP może po prostu źle wykrywać atrybuty bez pomocy etykiet klas, czy opisy wygenerowane przez GPT są zbyt ogólne, aby być użyteczne. Jednakże, ich późniejsze eksperymenty obaliły oba wyjaśnienia.

Aby rozwiązać ten problem, zamrożony model CLIP został użyty do porównania obrazów z dużym basenem kandydujących opisów pobranych z VAW, LSA i GPT-3, zachowując tylko te atrybuty, które najlepiej pasowały do obrazów, bez wymagania ponownego szkolenia lub dodatkowej nadzorowanej kontroli obrazu i tekstu:

Przegląd proponowanego systemu: zamrożony model CLIP koduje obrazy i duży basen kandydujących opisów tekstowych, używając podobieństwa kosinusowego do pomiaru, jak silnie każdy opis pasuje do treści wizualnej. Następnie zachowuje się najwyżej oceniane atrybuty na klasę, wytwarzając zestaw opisów interpretowalnych, podczas gdy utrzymuje zarówno kodery obrazu, jak i tekstu w trakcie całego procesu.

Przegląd proponowanego systemu: zamrożony model CLIP koduje obrazy i duży basen kandydujących opisów tekstowych, używając podobieństwa kosinusowego do pomiaru, jak silnie każdy opis pasuje do treści wizualnej. Następnie zachowuje się najwyżej oceniane atrybuty na klasę, wytwarzając zestaw opisów interpretowalnych, podczas gdy utrzymuje zarówno kodery obrazu, jak i tekstu w trakcie całego procesu.

Dane i testy

Eksperymenty autorów używały CLIP z ResNet-50 i oceniały wydajność na ImageNet wraz z czterema przesunięciami dystrybucyjnymi: ImageNetV2; ImageNet-Sketch; ImageNet-A; i ImageNet-R.

Atrybuty były wybierane za pomocą tylko oryginalnych obrazów szkoleniowych ImageNet – pozwalając na przesunięte zbiory danych, aby służyły jako test poza dystrybucją w celu sprawdzenia, czy atrybuty pochodzące z obrazów pozostają użyteczne, gdy wygląd wizualny się zmienia:

Dokładność klasyfikacji Top-1 w ImageNet i czterech przesunięciach dystrybucyjnych. Wyniki pokazują, że wydajność pozostaje ogólnie podobna, gdy nazwy klas są uwzględnione w podpowiedziach, ale zawodzą, gdy opisy są zmuszone do samodzielnego stania, sugerując, że wiele z ich pozornie skutecznych pochodzi z samej etykiety klasy. W przeciwieństwie do tego, atrybuty wybrane bezpośrednio z obrazów pozostają znacznie bardziej informacyjne we wszystkich testowanych zbiorach danych.

Dokładność klasyfikacji Top-1 w ImageNet i czterech przesunięciach dystrybucyjnych. Wyniki pokazują, że wydajność pozostaje ogólnie podobna, gdy nazwy klas są uwzględnione w podpowiedziach, ale zawodzą, gdy opisy są zmuszone do samodzielnego stania, sugerując, że wiele z ich pozornie skutecznych pochodzi z samej etykiety klasy. W przeciwieństwie do tego, atrybuty wybrane bezpośrednio z obrazów pozostają znacznie bardziej informacyjne we wszystkich testowanych zbiorach danych.

Ponowny wybór atrybutów z tego samego basenu wygenerowanego przez GPT, ale warunkowanego przez obrazy ImageNet, podniósł dokładność bez nazw klas z 15,5% do 19,4%. Ponieważ model, basen atrybutów i protokół oceny pozostały niezmienione, zysk można przypisać wyłącznie do selekcji warunkowanej obrazem.

Wynik również wskazał, że CLIP może identyfikować atrybuty bez nazw klas, i że basen wygenerowany przez GPT zawiera już użyteczne opisy. Główny niepowodzenie wydaje się leżeć w warunkowaniu etykietą, które często nie ujawnia atrybutów najbardziej istotnych dla samych obrazów.

Chociaż autorzy kontynuują serię obszernych dodatkowych eksperymentów, musimy odesłać czytelnika do materiału źródłowego w celu uzyskania dalszych szczegółów, ponieważ, zamiast rozszerzać zakres wyników, potwierdzają one tylko centralne hipotezy przedstawione do tej pory – że poleganie na etykietach może potencjalnie podważyć potencjał prawdziwych danych obrazowych w nowoczesnych aplikacjach wizji komputerowej, a tanie poleganie na “reputacyjnej” prawdopodobieństwie jest zagrożeniem dla dokładności wyników.

Wnioski

To interesujące, aby rozważyć dług, jaki nowoczesny generatywny AI ma wobec milionów ręcznie opisanych obrazów, które zostały spożytkowane w ogromne zbiory danych, takie jak Common Crawl, na początku ery hiperskali.

Każdy raz, gdy system rozpoznawania obrazów lub automatycznego oznaczania próbuje sklasyfikować lub ponownie oznaczyć stary lub nowy obraz, pochodzenie tej wiedzy sięga do jakiegoś dostawcy, który napisał ‘Gorący magazyn z lat 70.!’ w alt etykiecie na liście eBay w 2004 roku, lub jakiegoś podobnego zdarzenia.

Chociaż wiele osób uważa, że złota era keywordingu została zmyta przez bardziej zaawansowany algorytm PageRank Google prawie trzy dekady temu, podejście “ściany tekstu, miejmy nadzieję, że coś się przyklei” pozostaje bardzo żywe: wczoraj, na początku kodu HTML strony wydania modelu Qwen-Image-3.0, był atawistyczny wybuch (może nadal tam jest!) szaleństwa keywordingu:

Kod HTML strony wydania Qwen Image 3 to nie całkiem przyzwoity mur słów kluczowych, przynajmniej na czas pisania. Źródło - https://www.unite.ai/wp-content/uploads/2026/07/qwen-keyword-stuffing.jpg

Kod HTML strony wydania Qwen Image 3 to nie całkiem przyzwoity mur słów kluczowych, przynajmniej na czas pisania. Źródło

Czy niezależnie od tego, czy lawina nieprzyzwoitych słów kluczowych w stronie Qwen Image 3 jest systematycznie pobierana z list docelowych, czy napisana ręcznie przez specjalistów SEO, jest to pierwszorzędny przykład surowych korzeni nowoczesnego systemu generatywnego AI, z znaczeniem często niosącym ogromny ładunek interesu własnego, który później będzie musiał być usunięty lub przynajmniej uwzględniony w jakiś sposób, gdy takie terminy przeszkadzają w racjonalnych systemach i aplikacjach.

 

Pierwotnie opublikowane w środę, 22 lipca 2026

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai