KÄ t Andersona
Systemy wizji AI czÄsto nie “patrzÄ ” naprawdÄ

Systemy wizji AI mogÄ wyjaÅniaÄ obrazy za pomocÄ stereotypÃģw zamiast tego, co one naprawdÄ widzÄ . UsuniÄcie etykiety powoduje, Åže ich rzekome wyjaÅnienia wizualne zawodzÄ .
Â
PoniewaÅž platformy AI sÄ ciÄ gle tracÄ ce pieniÄ dze w nadziei na horyzont zdarzeÅ AI, kaÅžda oszczÄdnoÅÄ w ich udostÄpnianiu i usÅugach oznacza ogromne oszczÄdnoÅci: na przykÅad, kaÅždy raz, gdy model jÄzykowy moÅže udzieliÄ odpowiedzi z wÅasnej macierzy szkoleniowej zamiast podejmowania podrÃģÅžy opartej na RAG do sieci w celu uzyskania bieÅžÄ cych informacji, ktÃģre bÄdÄ wymagaÄ destylacji i rafinacji, odpowiada szybciej i oszczÄdza dostawcy pieniÄdzy.
OczywiÅcie, jest bardziej prawdopodobne, Åže zahallucynuje, bez wydatkowania dodatkowych tokenÃģw i energii na kontekstualizacjÄ i sprawdzanie swoich zaÅoÅžeÅ.
Podobnie, nawet jeÅli model jÄzykowy siÄga do sieci, bardzo czÄsto cytujÄ niejasne, nieodpowiednie lub nawet bezsensowne i niezwiÄ zane z tym URL, poniewaÅž zaoszczÄdziÅ energiÄ, oceniajÄ c tylko metadane tych stron, zamiast ich czytaÄ.
W podobny sposÃģb, jeÅli przesÅaniesz plik PDF do modelu jÄzykowego i chcesz omÃģwiÄ go, model jÄzykowy moÅže ostatecznie wyczyÅciÄ zawartoÅÄ pliku PDF z pamiÄci i uÅžyÄ tylko rzadkich metadanych, aby odpowiedzieÄ na Twoje pytania, bez nawet powiadomienia, Åže powinieneÅ przesÅaÄ go ponownie â co prowadzi do bÅÄdÃģw, bÅÄdnych zaÅoÅžeÅ i jeszcze wiÄcej halucynacji.
PrÃģby przemysÅowe
SÄ to pragmatyczne, choÄ nie caÅkiem uczciwe oszczÄdnoÅci narzucane uÅžytkownikowi z powodÃģw operacyjnych. W Åwiecie gromadzenia danych i szkolenia modeli, gdzie miliony, a nawet setki milionÃģw obrazÃģw muszÄ byÄ przetwarzane en masse, i nie mogÄ byÄ rÄcznie opatrzonych etykietami przez ludzi, presja na minimalizacjÄ wydatkÃģw energii i czasu jest rÃģwnie intensywna.
Jednym z takich âskrÃģconychâ rozwiÄ zaÅ jest uÅžycie poÅredniego modelu jÄzyka wizji, takiego jak Contrastive Language Image Pretraining (CLIP), ktÃģry mapuje obrazy i tekst do wspÃģlnej przestrzeni semantycznej, aby pojÄcia wizualne mogÅy byÄ porÃģwnywane za pomocÄ jÄzyka, a nie jawnych etykiet.
Czym jest to? Czy wyobraÅš sobie dziecko, ktÃģre uczy siÄ z milionÃģw opatrzonych podpisami obrazÃģw, aÅž rozwinie pewne poczucie, ktÃģre obrazy i sÅowa naturalnie siÄ ze sobÄ ÅÄ czÄ .
Problem polega na tym, Åže bardzo czÄsto podpisÃģw te byÅy napisane przez wÅaÅcicieli stron internetowych i innych podmiotÃģw, ktÃģre byÅy bardziej zainteresowane dobrym SEO niÅž dobrym oznaczaniem, co prowadzi do duÅžej iloÅci âszumuâ lub nieprecyzyjnego oznaczania.
JednakÅže, w skali, w jakiej pojÄcie i powiÄ zane z nim sÅowo powtarzajÄ siÄ w ogromnych zbiorach danych, zwykle oznacza to, Åže podstawowe sÅowa bÄdÄ kojarzone z odpowiednim obrazem, poniewaÅž mniejsza liczba âbezsensownychâ etykiet zwykle bÄdzie zmuszona do âgetta outlierÃģwâ i nie zwykle zdobÄdzie skojarzenie z obrazem. WiÄc to mniej wiÄcej dziaÅa, wiÄkszoÅÄ czasu.
Oznaczanie danych jest robione w ten sposÃģb, poniewaÅž jest tanie i minimalnie funkcjonalne, a nie dlatego, Åže jest dobre.
Pozaszkolne
Do tego problematycznego scenariusza wkracza nowy artykuÅ z Carnegie Mellon, ilustrujÄ cy wyraÅšnie, Åže wiele podpisÃģw przypisanych do obrazÃģw â na przykÅad przez CLIP â sÄ po prostu stereotypami opartymi na odniesieniu do etykiety obrazu (opartej na tekÅcie), a nie przez aktywne âpatrzenieâ na sam obraz.
W jednym uderzajÄ cym przykÅadzie z artykuÅu CLIP jest poÅÄ czony z opisami wygenerowanymi z nazwy klasy ImageNet strawberry, a nastÄpnie testowany na ImageNet-Sketch, gdzie kaÅžda truskawka jest rysunkiem czarno-biaÅym â jednak opis nadal twierdzi, Åže owoc jest âczerwonyâ i âdojrzaÅyâ:
Opis nazwy klasy nie powiedzie siÄ w ImageNet-Sketch: jÄzykowe priorytety mÃģwiÄ âczerwonyâ i âdojrzaÅyâ, podczas gdy atrybuty oparte na obrazie pasujÄ do rysunku czarno-biaÅego. ÅđrÃģdÅo
Tutaj CLIP jest poÅÄ czony z opisami wygenerowanymi tylko z nazwy klasy strawberry, za pomocÄ GPT-3 lub zewnÄtrznej wiedzy. Te nigdy nie widzÄ obrazu, wiÄc domyÅlnie wybierajÄ kanoniczne cechy, takie jak czerwony i liÅciasty. Gdy sÄ stosowane do monochromatycznych ilustracji liniowych w ImageNet-Sketch, proces nie powiedzie siÄ.
W przeciwieÅstwie do tego, atrybuty pochodzÄ ce z samych obrazÃģw wybierajÄ cechy, ktÃģre pozostajÄ prawdziwe podczas przesuniÄcia, takie jak kropkowany lub ksztaÅt serca.
W ten sposÃģb moÅžemy zobaczyÄ, Åže obiekt identyfikowany jest reklamowany nie za to, kim jest, ale, jakby, âz reputacjÄ â; przymiotniki âczerwonyâ i âliÅciastyâ sÄ dokÅadne dla poddomeny strawberry, ale przekraczajÄ granice obrazu (instancji) w question.
Autorzy nowej pracy â zatytuÅowanej Atrybuty powinny pochodziÄ z obrazÃģw, a nie z nazw klas: wybÃģr atrybutÃģw warunkowanych dystrybucjÄ dla modeli jÄzyka wizji â twierdzÄ , Åže jest to trwaÅy i powszechny problem, i sugerujÄ wybÃģr atrybutÃģw bezpoÅrednio z samych obrazÃģw, aby odzwierciedlaÅy one to, co jest naprawdÄ widoczne podczas przesuniÄcia dystrybucji, zamiast polegania na priors nazw klas.
Autorzy stwierdzajÄ :
âPopularna droga do klasyfikacji zero-shot prosi duÅžy model jÄzykowy (LLM), aby opisaÄ kaÅždÄ nazwÄ klasy i uruchomiÄ CLIP z wynikowymi opisami. Pokazujemy, Åže te opisy noszÄ niewiele wizualnych dowodÃģw: usuniÄcie nazwy klasy z podpowiedzi powoduje, Åže dokÅadnoÅÄ ImageNet spada z 59,5% do 15,5%.
âRozpoznanie jest takie, Åže opisy sÄ warunkowane etykietÄ , a nie obrazami, wiÄc opisujÄ pojÄcie ogÃģlnie i mylÄ dokÅadnie, gdy dane przesuwajÄ siÄ; LLM twierdzi, Åže truskawki sÄ czerwone, ale kaÅžda truskawka w ImageNet-Sketch jest kolorowym rysunkiem liniowym.
âDlatego wybieramy atrybuty z kolekcji obrazÃģw docelowych zamiast: oceniamy duÅžy basen atrybutÃģw przeciwko obrazom w przestrzeni wspÃģlnej CLIP i zachowujemy tylko te atrybuty, ktÃģre najlepiej pasujÄ do obrazÃģw, bez wymagania ponownego szkolenia lub dodatkowej nadzorowanej kontroli obrazu i tekstu.â
Ich proponowane rozwiÄ zanie polega na tym, Åže model pozostaje taki sam, ale zamiast polegaÄ na opisach nazw klas, sprawdza basen kandydujÄ cych atrybutÃģw przeciwko obrazom i zachowuje tylko te, ktÃģre naprawdÄ pasujÄ do tego, co jest widoczne.
Koszt tego jest racjonalnie akceptowalny, poniewaÅž nie proponuje ponownego wykorzystania zaoszczÄdzonej energii âoszukaÅczychâ metod, ktÃģre doprowadziÅy do problemu w pierwszej kolejnoÅci. Zamiast tego dodaje przejÅcie oceny nad kandydujÄ cymi atrybutami na klasÄ, tak Åže opÃģÅšnienie wzrasta nieznacznie â ale o wiele mniej niÅž ponowne szkolenie lub peÅne potoki RAG. W teorii, koszt energii byÅby akceptowalny, uwzglÄdniony w stosunku do poprawy wyrÃģwnania.
Metoda
PoniewaÅž metodyka testÃģw autorÃģw jest szczegÃģlnie arkaiczna, a minimalna dodatkowa przydatna wiedza nie byÅaby uzyskana przez gÅÄbsze zbadanie ich, bÄdziemy, niezwykle, rozwaÅžaÄ tylko skrÃģcony przeglÄ d ich podejÅcia.
Praca charakteryzuje podstawowy problem jako zakÅÃģcenie nazwy klasy: sytuacjÄ, w ktÃģrej wydajnoÅÄ wydaje siÄ pochodziÄ z znaczÄ cych opisÃģw, ale w rzeczywistoÅci zaleÅžy od samej nazwy klasy, z opisami dodajÄ cymi niewiele â i zawodzÄ c, gdy tylko to wsparcie zostanie usuniÄte
NastÄpnie praca argumentuje, Åže ten niepowodzenie jest nieuniknione, poniewaÅž opisy wygenerowane z nazwy klasy mogÄ opisaÄ tylko to, jak rzecz zwykle wyglÄ da, a nie to, co jest naprawdÄ obecne w konkretnym obrazie. Gdy tylko dane odbiegajÄ od tych oczekiwaÅ, opisy stajÄ siÄ nie tylko niewielce pomocne, ale aktywnie mylÄ ce, skutecznie gÅosujÄ c przeciwko poprawnej odpowiedzi.
Badacze rÃģwnieÅž rozwaÅžali, czy CLIP moÅže po prostu Åšle wykrywaÄ atrybuty bez pomocy etykiet klas, czy opisy wygenerowane przez GPT sÄ zbyt ogÃģlne, aby byÄ uÅžyteczne. JednakÅže, ich pÃģÅšniejsze eksperymenty obaliÅy oba wyjaÅnienia.
Aby rozwiÄ zaÄ ten problem, zamroÅžony model CLIP zostaÅ uÅžyty do porÃģwnania obrazÃģw z duÅžym basenem kandydujÄ cych opisÃģw pobranych z VAW, LSA i GPT-3, zachowujÄ c tylko te atrybuty, ktÃģre najlepiej pasowaÅy do obrazÃģw, bez wymagania ponownego szkolenia lub dodatkowej nadzorowanej kontroli obrazu i tekstu:
PrzeglÄ d proponowanego systemu: zamroÅžony model CLIP koduje obrazy i duÅžy basen kandydujÄ cych opisÃģw tekstowych, uÅžywajÄ c podobieÅstwa kosinusowego do pomiaru, jak silnie kaÅždy opis pasuje do treÅci wizualnej. NastÄpnie zachowuje siÄ najwyÅžej oceniane atrybuty na klasÄ, wytwarzajÄ c zestaw opisÃģw interpretowalnych, podczas gdy utrzymuje zarÃģwno kodery obrazu, jak i tekstu w trakcie caÅego procesu.
Dane i testy
Eksperymenty autorÃģw uÅžywaÅy CLIP z ResNet-50 i oceniaÅy wydajnoÅÄ na ImageNet wraz z czterema przesuniÄciami dystrybucyjnymi: ImageNetV2; ImageNet-Sketch; ImageNet-A; i ImageNet-R.
Atrybuty byÅy wybierane za pomocÄ tylko oryginalnych obrazÃģw szkoleniowych ImageNet â pozwalajÄ c na przesuniÄte zbiory danych, aby sÅuÅžyÅy jako test poza dystrybucjÄ w celu sprawdzenia, czy atrybuty pochodzÄ ce z obrazÃģw pozostajÄ uÅžyteczne, gdy wyglÄ d wizualny siÄ zmienia:
DokÅadnoÅÄ klasyfikacji Top-1 w ImageNet i czterech przesuniÄciach dystrybucyjnych. Wyniki pokazujÄ , Åže wydajnoÅÄ pozostaje ogÃģlnie podobna, gdy nazwy klas sÄ uwzglÄdnione w podpowiedziach, ale zawodzÄ , gdy opisy sÄ zmuszone do samodzielnego stania, sugerujÄ c, Åže wiele z ich pozornie skutecznych pochodzi z samej etykiety klasy. W przeciwieÅstwie do tego, atrybuty wybrane bezpoÅrednio z obrazÃģw pozostajÄ znacznie bardziej informacyjne we wszystkich testowanych zbiorach danych.
Ponowny wybÃģr atrybutÃģw z tego samego basenu wygenerowanego przez GPT, ale warunkowanego przez obrazy ImageNet, podniÃģsÅ dokÅadnoÅÄ bez nazw klas z 15,5% do 19,4%. PoniewaÅž model, basen atrybutÃģw i protokÃģÅ oceny pozostaÅy niezmienione, zysk moÅžna przypisaÄ wyÅÄ cznie do selekcji warunkowanej obrazem.
Wynik rÃģwnieÅž wskazaÅ, Åže CLIP moÅže identyfikowaÄ atrybuty bez nazw klas, i Åže basen wygenerowany przez GPT zawiera juÅž uÅžyteczne opisy. GÅÃģwny niepowodzenie wydaje siÄ leÅžeÄ w warunkowaniu etykietÄ , ktÃģre czÄsto nie ujawnia atrybutÃģw najbardziej istotnych dla samych obrazÃģw.
ChociaÅž autorzy kontynuujÄ seriÄ obszernych dodatkowych eksperymentÃģw, musimy odesÅaÄ czytelnika do materiaÅu ÅšrÃģdÅowego w celu uzyskania dalszych szczegÃģÅÃģw, poniewaÅž, zamiast rozszerzaÄ zakres wynikÃģw, potwierdzajÄ one tylko centralne hipotezy przedstawione do tej pory â Åže poleganie na etykietach moÅže potencjalnie podwaÅžyÄ potencjaÅ prawdziwych danych obrazowych w nowoczesnych aplikacjach wizji komputerowej, a tanie poleganie na âreputacyjnejâ prawdopodobieÅstwie jest zagroÅženiem dla dokÅadnoÅci wynikÃģw.
Wnioski
To interesujÄ ce, aby rozwaÅžyÄ dÅug, jaki nowoczesny generatywny AI ma wobec milionÃģw rÄcznie opisanych obrazÃģw, ktÃģre zostaÅy spoÅžytkowane w ogromne zbiory danych, takie jak Common Crawl, na poczÄ tku ery hiperskali.
KaÅždy raz, gdy system rozpoznawania obrazÃģw lub automatycznego oznaczania prÃģbuje sklasyfikowaÄ lub ponownie oznaczyÄ stary lub nowy obraz, pochodzenie tej wiedzy siÄga do jakiegoÅ dostawcy, ktÃģry napisaÅ âGorÄ cy magazyn z lat 70.!â w alt etykiecie na liÅcie eBay w 2004 roku, lub jakiegoÅ podobnego zdarzenia.
ChociaÅž wiele osÃģb uwaÅža, Åže zÅota era keywordingu zostaÅa zmyta przez bardziej zaawansowany algorytm PageRank Google prawie trzy dekady temu, podejÅcie âÅciany tekstu, miejmy nadziejÄ, Åže coÅ siÄ przykleiâ pozostaje bardzo Åžywe: wczoraj, na poczÄ tku kodu HTML strony wydania modelu Qwen-Image-3.0, byÅ atawistyczny wybuch (moÅže nadal tam jest!) szaleÅstwa keywordingu:
Kod HTML strony wydania Qwen Image 3 to nie caÅkiem przyzwoity mur sÅÃģw kluczowych, przynajmniej na czas pisania. ÅđrÃģdÅo
Czy niezaleÅžnie od tego, czy lawina nieprzyzwoitych sÅÃģw kluczowych w stronie Qwen Image 3 jest systematycznie pobierana z list docelowych, czy napisana rÄcznie przez specjalistÃģw SEO, jest to pierwszorzÄdny przykÅad surowych korzeni nowoczesnego systemu generatywnego AI, z znaczeniem czÄsto niosÄ cym ogromny Åadunek interesu wÅasnego, ktÃģry pÃģÅšniej bÄdzie musiaÅ byÄ usuniÄty lub przynajmniej uwzglÄdniony w jakiÅ sposÃģb, gdy takie terminy przeszkadzajÄ w racjonalnych systemach i aplikacjach.
Â
Pierwotnie opublikowane w ÅrodÄ, 22 lipca 2026












