Kąt Andersona

Systemy wizji AI często nie “patrzą” naprawdę

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
AI-generated image (GPT-2): a supermarket bin contains misshapen green apples beneath a sign showing a red apple and the words 'Red, glossy and round.' The image is surrounded by a yellow-and-black border labelled “AI fantasy inside” and “reality outside,” with inward-pointing arrows.

Systemy wizji AI mogą wyjaśniać obrazy za pomocą stereotypÃģw zamiast tego, co one naprawdę widzą. Usunięcie etykiety powoduje, Åže ich rzekome wyjaśnienia wizualne zawodzą.

 

PoniewaÅž platformy AI są ciągle tracące pieniądze w nadziei na horyzont zdarzeń AI, kaÅžda oszczędność w ich udostępnianiu i usługach oznacza ogromne oszczędności: na przykład, kaÅždy raz, gdy model językowy moÅže udzielić odpowiedzi z własnej macierzy szkoleniowej zamiast podejmowania podrÃģÅžy opartej na RAG do sieci w celu uzyskania bieŞących informacji, ktÃģre będą wymagać destylacji i rafinacji, odpowiada szybciej i oszczędza dostawcy pieniędzy.

Oczywiście, jest bardziej prawdopodobne, Åže zahallucynuje, bez wydatkowania dodatkowych tokenÃģw i energii na kontekstualizację i sprawdzanie swoich załoÅžeń.

Podobnie, nawet jeśli model językowy sięga do sieci, bardzo często cytuję niejasne, nieodpowiednie lub nawet bezsensowne i niezwiązane z tym URL, poniewaÅž zaoszczędził energię, oceniając tylko metadane tych stron, zamiast ich czytać.

W podobny sposÃģb, jeśli przesłaniesz plik PDF do modelu językowego i chcesz omÃģwić go, model językowy moÅže ostatecznie wyczyścić zawartość pliku PDF z pamięci i uÅžyć tylko rzadkich metadanych, aby odpowiedzieć na Twoje pytania, bez nawet powiadomienia, Åže powinieneś przesłać go ponownie – co prowadzi do błędÃģw, błędnych załoÅžeń i jeszcze więcej halucynacji.

PrÃģby przemysłowe

Są to pragmatyczne, choć nie całkiem uczciwe oszczędności narzucane uÅžytkownikowi z powodÃģw operacyjnych. W świecie gromadzenia danych i szkolenia modeli, gdzie miliony, a nawet setki milionÃģw obrazÃģw muszą być przetwarzane en masse, i nie mogą być ręcznie opatrzonych etykietami przez ludzi, presja na minimalizację wydatkÃģw energii i czasu jest rÃģwnie intensywna.

Jednym z takich “skrÃģconych” rozwiązań jest uÅžycie pośredniego modelu języka wizji, takiego jak Contrastive Language Image Pretraining (CLIP), ktÃģry mapuje obrazy i tekst do wspÃģlnej przestrzeni semantycznej, aby pojęcia wizualne mogły być porÃģwnywane za pomocą języka, a nie jawnych etykiet.

Czym jest to? Czy wyobraÅš sobie dziecko, ktÃģre uczy się z milionÃģw opatrzonych podpisami obrazÃģw, aÅž rozwinie pewne poczucie, ktÃģre obrazy i słowa naturalnie się ze sobą łączą.

Problem polega na tym, Åže bardzo często podpisÃģw te były napisane przez właścicieli stron internetowych i innych podmiotÃģw, ktÃģre były bardziej zainteresowane dobrym SEO niÅž dobrym oznaczaniem, co prowadzi do duÅžej ilości “szumu” lub nieprecyzyjnego oznaczania.

JednakÅže, w skali, w jakiej pojęcie i powiązane z nim słowo powtarzają się w ogromnych zbiorach danych, zwykle oznacza to, Åže podstawowe słowa będą kojarzone z odpowiednim obrazem, poniewaÅž mniejsza liczba “bezsensownych” etykiet zwykle będzie zmuszona do “getta outlierÃģw” i nie zwykle zdobędzie skojarzenie z obrazem. Więc to mniej więcej działa, większość czasu.

Oznaczanie danych jest robione w ten sposÃģb, poniewaÅž jest tanie i minimalnie funkcjonalne, a nie dlatego, Åže jest dobre.

Pozaszkolne

Do tego problematycznego scenariusza wkracza nowy artykuł z Carnegie Mellon, ilustrujący wyraÅšnie, Åže wiele podpisÃģw przypisanych do obrazÃģw – na przykład przez CLIP – są po prostu stereotypami opartymi na odniesieniu do etykiety obrazu (opartej na tekście), a nie przez aktywne “patrzenie” na sam obraz.

W jednym uderzającym przykładzie z artykułu CLIP jest połączony z opisami wygenerowanymi z nazwy klasy ImageNet strawberry, a następnie testowany na ImageNet-Sketch, gdzie kaÅžda truskawka jest rysunkiem czarno-białym – jednak opis nadal twierdzi, Åže owoc jest ‘czerwony’ i ‘dojrzały’:

Opis nazwy klasy nie powiedzie się w ImageNet-Sketch: językowe priorytety mÃģwią 'czerwony' i 'dojrzały', podczas gdy atrybuty oparte na obrazie pasują do rysunku czarno-białego. ÅđrÃģdło - https://www.unite.ai/wp-content/uploads/2026/07/figure-1-4.jpg

Opis nazwy klasy nie powiedzie się w ImageNet-Sketch: językowe priorytety mÃģwią ‘czerwony’ i ‘dojrzały’, podczas gdy atrybuty oparte na obrazie pasują do rysunku czarno-białego. ÅđrÃģdło

Tutaj CLIP jest połączony z opisami wygenerowanymi tylko z nazwy klasy strawberry, za pomocą GPT-3 lub zewnętrznej wiedzy. Te nigdy nie widzą obrazu, więc domyślnie wybierają kanoniczne cechy, takie jak czerwony i liściasty. Gdy są stosowane do monochromatycznych ilustracji liniowych w ImageNet-Sketch, proces nie powiedzie się.

W przeciwieństwie do tego, atrybuty pochodzące z samych obrazÃģw wybierają cechy, ktÃģre pozostają prawdziwe podczas przesunięcia, takie jak kropkowany lub kształt serca.

W ten sposÃģb moÅžemy zobaczyć, Åže obiekt identyfikowany jest reklamowany nie za to, kim jest, ale, jakby, “z reputacją”; przymiotniki “czerwony” i “liściasty” są dokładne dla poddomeny strawberry, ale przekraczają granice obrazu (instancji) w question.

Autorzy nowej pracy – zatytułowanej Atrybuty powinny pochodzić z obrazÃģw, a nie z nazw klas: wybÃģr atrybutÃģw warunkowanych dystrybucją dla modeli języka wizji – twierdzą, Åže jest to trwały i powszechny problem, i sugerują wybÃģr atrybutÃģw bezpośrednio z samych obrazÃģw, aby odzwierciedlały one to, co jest naprawdę widoczne podczas przesunięcia dystrybucji, zamiast polegania na priors nazw klas.

Autorzy stwierdzają:

‘Popularna droga do klasyfikacji zero-shot prosi duÅžy model językowy (LLM), aby opisać kaÅždą nazwę klasy i uruchomić CLIP z wynikowymi opisami. Pokazujemy, Åže te opisy noszą niewiele wizualnych dowodÃģw: usunięcie nazwy klasy z podpowiedzi powoduje, Åže dokładność ImageNet spada z 59,5% do 15,5%.

‘Rozpoznanie jest takie, Åže opisy są warunkowane etykietą, a nie obrazami, więc opisują pojęcie ogÃģlnie i mylą dokładnie, gdy dane przesuwają się; LLM twierdzi, Åže truskawki są czerwone, ale kaÅžda truskawka w ImageNet-Sketch jest kolorowym rysunkiem liniowym.

‘Dlatego wybieramy atrybuty z kolekcji obrazÃģw docelowych zamiast: oceniamy duÅžy basen atrybutÃģw przeciwko obrazom w przestrzeni wspÃģlnej CLIP i zachowujemy tylko te atrybuty, ktÃģre najlepiej pasują do obrazÃģw, bez wymagania ponownego szkolenia lub dodatkowej nadzorowanej kontroli obrazu i tekstu.’

Ich proponowane rozwiązanie polega na tym, Åže model pozostaje taki sam, ale zamiast polegać na opisach nazw klas, sprawdza basen kandydujących atrybutÃģw przeciwko obrazom i zachowuje tylko te, ktÃģre naprawdę pasują do tego, co jest widoczne.

Koszt tego jest racjonalnie akceptowalny, poniewaÅž nie proponuje ponownego wykorzystania zaoszczędzonej energii “oszukańczych” metod, ktÃģre doprowadziły do problemu w pierwszej kolejności. Zamiast tego dodaje przejście oceny nad kandydującymi atrybutami na klasę, tak Åže opÃģÅšnienie wzrasta nieznacznie – ale o wiele mniej niÅž ponowne szkolenie lub pełne potoki RAG. W teorii, koszt energii byłby akceptowalny, uwzględniony w stosunku do poprawy wyrÃģwnania.

Metoda

PoniewaÅž metodyka testÃģw autorÃģw jest szczegÃģlnie arkaiczna, a minimalna dodatkowa przydatna wiedza nie byłaby uzyskana przez głębsze zbadanie ich, będziemy, niezwykle, rozwaÅžać tylko skrÃģcony przegląd ich podejścia.

Praca charakteryzuje podstawowy problem jako zakłÃģcenie nazwy klasy: sytuację, w ktÃģrej wydajność wydaje się pochodzić z znaczących opisÃģw, ale w rzeczywistości zaleÅžy od samej nazwy klasy, z opisami dodającymi niewiele – i zawodząc, gdy tylko to wsparcie zostanie usunięte

Następnie praca argumentuje, Åže ten niepowodzenie jest nieuniknione, poniewaÅž opisy wygenerowane z nazwy klasy mogą opisać tylko to, jak rzecz zwykle wygląda, a nie to, co jest naprawdę obecne w konkretnym obrazie. Gdy tylko dane odbiegają od tych oczekiwań, opisy stają się nie tylko niewielce pomocne, ale aktywnie mylące, skutecznie głosując przeciwko poprawnej odpowiedzi.

Badacze rÃģwnieÅž rozwaÅžali, czy CLIP moÅže po prostu Åšle wykrywać atrybuty bez pomocy etykiet klas, czy opisy wygenerowane przez GPT są zbyt ogÃģlne, aby być uÅžyteczne. JednakÅže, ich pÃģÅšniejsze eksperymenty obaliły oba wyjaśnienia.

Aby rozwiązać ten problem, zamroÅžony model CLIP został uÅžyty do porÃģwnania obrazÃģw z duÅžym basenem kandydujących opisÃģw pobranych z VAW, LSA i GPT-3, zachowując tylko te atrybuty, ktÃģre najlepiej pasowały do obrazÃģw, bez wymagania ponownego szkolenia lub dodatkowej nadzorowanej kontroli obrazu i tekstu:

Przegląd proponowanego systemu: zamroÅžony model CLIP koduje obrazy i duÅžy basen kandydujących opisÃģw tekstowych, uÅžywając podobieństwa kosinusowego do pomiaru, jak silnie kaÅždy opis pasuje do treści wizualnej. Następnie zachowuje się najwyÅžej oceniane atrybuty na klasę, wytwarzając zestaw opisÃģw interpretowalnych, podczas gdy utrzymuje zarÃģwno kodery obrazu, jak i tekstu w trakcie całego procesu.

Przegląd proponowanego systemu: zamroÅžony model CLIP koduje obrazy i duÅžy basen kandydujących opisÃģw tekstowych, uÅžywając podobieństwa kosinusowego do pomiaru, jak silnie kaÅždy opis pasuje do treści wizualnej. Następnie zachowuje się najwyÅžej oceniane atrybuty na klasę, wytwarzając zestaw opisÃģw interpretowalnych, podczas gdy utrzymuje zarÃģwno kodery obrazu, jak i tekstu w trakcie całego procesu.

Dane i testy

Eksperymenty autorÃģw uÅžywały CLIP z ResNet-50 i oceniały wydajność na ImageNet wraz z czterema przesunięciami dystrybucyjnymi: ImageNetV2; ImageNet-Sketch; ImageNet-A; i ImageNet-R.

Atrybuty były wybierane za pomocą tylko oryginalnych obrazÃģw szkoleniowych ImageNet – pozwalając na przesunięte zbiory danych, aby słuÅžyły jako test poza dystrybucją w celu sprawdzenia, czy atrybuty pochodzące z obrazÃģw pozostają uÅžyteczne, gdy wygląd wizualny się zmienia:

Dokładność klasyfikacji Top-1 w ImageNet i czterech przesunięciach dystrybucyjnych. Wyniki pokazują, Åže wydajność pozostaje ogÃģlnie podobna, gdy nazwy klas są uwzględnione w podpowiedziach, ale zawodzą, gdy opisy są zmuszone do samodzielnego stania, sugerując, Åže wiele z ich pozornie skutecznych pochodzi z samej etykiety klasy. W przeciwieństwie do tego, atrybuty wybrane bezpośrednio z obrazÃģw pozostają znacznie bardziej informacyjne we wszystkich testowanych zbiorach danych.

Dokładność klasyfikacji Top-1 w ImageNet i czterech przesunięciach dystrybucyjnych. Wyniki pokazują, Åže wydajność pozostaje ogÃģlnie podobna, gdy nazwy klas są uwzględnione w podpowiedziach, ale zawodzą, gdy opisy są zmuszone do samodzielnego stania, sugerując, Åže wiele z ich pozornie skutecznych pochodzi z samej etykiety klasy. W przeciwieństwie do tego, atrybuty wybrane bezpośrednio z obrazÃģw pozostają znacznie bardziej informacyjne we wszystkich testowanych zbiorach danych.

Ponowny wybÃģr atrybutÃģw z tego samego basenu wygenerowanego przez GPT, ale warunkowanego przez obrazy ImageNet, podniÃģsł dokładność bez nazw klas z 15,5% do 19,4%. PoniewaÅž model, basen atrybutÃģw i protokÃģł oceny pozostały niezmienione, zysk moÅžna przypisać wyłącznie do selekcji warunkowanej obrazem.

Wynik rÃģwnieÅž wskazał, Åže CLIP moÅže identyfikować atrybuty bez nazw klas, i Åže basen wygenerowany przez GPT zawiera juÅž uÅžyteczne opisy. GłÃģwny niepowodzenie wydaje się leÅžeć w warunkowaniu etykietą, ktÃģre często nie ujawnia atrybutÃģw najbardziej istotnych dla samych obrazÃģw.

ChociaÅž autorzy kontynuują serię obszernych dodatkowych eksperymentÃģw, musimy odesłać czytelnika do materiału ÅšrÃģdłowego w celu uzyskania dalszych szczegÃģłÃģw, poniewaÅž, zamiast rozszerzać zakres wynikÃģw, potwierdzają one tylko centralne hipotezy przedstawione do tej pory – Åže poleganie na etykietach moÅže potencjalnie podwaÅžyć potencjał prawdziwych danych obrazowych w nowoczesnych aplikacjach wizji komputerowej, a tanie poleganie na “reputacyjnej” prawdopodobieństwie jest zagroÅženiem dla dokładności wynikÃģw.

Wnioski

To interesujące, aby rozwaÅžyć dług, jaki nowoczesny generatywny AI ma wobec milionÃģw ręcznie opisanych obrazÃģw, ktÃģre zostały spoÅžytkowane w ogromne zbiory danych, takie jak Common Crawl, na początku ery hiperskali.

KaÅždy raz, gdy system rozpoznawania obrazÃģw lub automatycznego oznaczania prÃģbuje sklasyfikować lub ponownie oznaczyć stary lub nowy obraz, pochodzenie tej wiedzy sięga do jakiegoś dostawcy, ktÃģry napisał ‘Gorący magazyn z lat 70.!’ w alt etykiecie na liście eBay w 2004 roku, lub jakiegoś podobnego zdarzenia.

ChociaÅž wiele osÃģb uwaÅža, Åže złota era keywordingu została zmyta przez bardziej zaawansowany algorytm PageRank Google prawie trzy dekady temu, podejście “ściany tekstu, miejmy nadzieję, Åže coś się przyklei” pozostaje bardzo Åžywe: wczoraj, na początku kodu HTML strony wydania modelu Qwen-Image-3.0, był atawistyczny wybuch (moÅže nadal tam jest!) szaleństwa keywordingu:

Kod HTML strony wydania Qwen Image 3 to nie całkiem przyzwoity mur słÃģw kluczowych, przynajmniej na czas pisania. ÅđrÃģdło - https://www.unite.ai/wp-content/uploads/2026/07/qwen-keyword-stuffing.jpg

Kod HTML strony wydania Qwen Image 3 to nie całkiem przyzwoity mur słÃģw kluczowych, przynajmniej na czas pisania. ÅđrÃģdło

Czy niezaleÅžnie od tego, czy lawina nieprzyzwoitych słÃģw kluczowych w stronie Qwen Image 3 jest systematycznie pobierana z list docelowych, czy napisana ręcznie przez specjalistÃģw SEO, jest to pierwszorzędny przykład surowych korzeni nowoczesnego systemu generatywnego AI, z znaczeniem często niosącym ogromny ładunek interesu własnego, ktÃģry pÃģÅšniej będzie musiał być usunięty lub przynajmniej uwzględniony w jakiś sposÃģb, gdy takie terminy przeszkadzają w racjonalnych systemach i aplikacjach.

 

Pierwotnie opublikowane w środę, 22 lipca 2026

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]