Andersonův úhel

Umělá inteligence může tajně řadit obrázky podle značky zařízení, ne podle obsahu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
A robot preferring a Mac over other junked laptops in the blurred background. Flux 1D and Firefly, via Krita.

Nový výzkum zjistil, že populární obrazově zaměřené systémy umělé inteligence se nedívají pouze na to, co je na fotografii, ale také na to, jak byla fotografie pořízena. Skryté detaily, jako je typ kamery nebo kvalita obrazu, mohou tiše ovlivnit, co si umělá inteligence myslí, že vidí, což vede k chybným výsledkům – pouze proto, že fotografie pocházela z jiného zařízení.

 

V roce 2012 bylo odhaleno, že webová stránka pro cestování systematicky zobrazovala vyšší ceny uživatelům, kterým mohla odvodit, že prohlíží pomocí zařízení Apple, a spojila tak značku Apple (AAPL ) s vyšší kupní sílou. Pozdější vyšetřování dospělo k závěru, že tento zařízením zaměřený “snímač peněženek” se stal téměř rutinou pro e-commerce weby.

Podobně lze určit, které smartphone nebo zařízení pořídilo určitou fotografii, pomocí forenzních metod, na základě známých charakteristik omezeného počtu objektivů v modelech. V takových případech je model zařízení obvykle odhadnut pomocí vizuálních stop; a stejně jako v případě z roku 2012, znalost toho, jaký typ kamery pořídila obraz, je potenciálně využitelnou charakteristikou

Přestože zařízení pro pořizování snímků thường vkládají významné metadata do obrazu, tato funkce může být často vypnuta uživateli; i když je zapnuta, distribuční platformy, jako jsou sociální sítě, mohou odstranit některé nebo všechny metadata, buď z důvodu logistiky nebo ochrany soukromí, nebo obou.

Nicméně, metadata v uživatelsky nahrávaných obrázcích jsou často buď přepisována / interpretována (místo odstraněna) nebo ponechána nedotčená, jako sekundární zdroj informací, ne o tom, co je na obrázku, ale o tom, jak byl pořízen. Jak odhalil případ z roku 2012, informace tohoto druhu mohou být cenné – nejen pro komerční platformy, ale také potenciálně pro hackery a špatné aktéry.

Dvojí perspektiva

Nová výzkumná spolupráce mezi Japonskem a Českou republikou zjistila, že stopy zanechané kamerovým hardwarem a zpracování obrazu (jako kvalita JPEG nebo ostření objektivu) nejsou pouze detekovatelné pomocí forenzních nástrojů, ale jsou také tiše zakódovány v ‘globálním pochopení’ předních modelů počítačového vidění.

Toto zahrnuje CLIP a další velké vizuální kódéry, které se široce používají ve všem od vyhledávačů až po moderaci obsahu. Nová práce prokázala, že tyto modely neinterpretují pouze to, co je na fotografii, ale mohou se také naučit, jak byla fotografie pořízena; a tento skrytý signál může někdy převažovat nad viditelným obsahem.

Příklad párových obrázků z datové sady PairCams autorů, vytvořené pro testování vlivu typu kamery na modely obrazové umělé inteligence. Každý pár ukazuje stejný objekt nebo scénu pořízenou ve stejném okamžiku pomocí ne-smartphone (vlevo) a smartphone (vpravo). Zdroj: https://arxiv.org/pdf/2508.10637

Příklad párových obrázků z datové sady PairCams autorů, vytvořené pro testování vlivu typu kamery na modely obrazové umělé inteligence. Každý pár ukazuje stejný objekt nebo scénu pořízenou ve stejném okamžiku pomocí ne-smartphone (vlevo) a smartphone (vpravo). Source: https://arxiv.org/pdf/2508.10637

Studie tvrdí, že i když jsou modely umělé inteligence poskytovány silně maskovanými nebo ořezanými verzemi obrazu, mohou stále s překvapivou přesností odhadnout značku a model kamery.

To znamená, že reprezentační prostor, který tyto systémy používají k hodnocení podobnosti obrazů, se může stát zapleteným s irelevantními faktory, jako je zařízení uživatele, s nepředvídatelnými důsledky.

The paper states:

‘Metadata labels zanechávající stopy ve vizuálních kódérech do té míry, že přehlušují sémantické informace, mohou vést k nepředvídatelným výsledkům, ohrožujícím obecnou platnost, odolnost a potenciálně podkopávajícím důvěryhodnost modelů.

‘Ještě kritičtěji, tento efekt by mohl být zneužit pro zlé úmysly; například útočník by mohl manipulovat metadata, aby záměrně oklamal nebo uvedl model v omyl, představující rizika v citlivých oblastech, jako je zdravotnictví, dohled nebo autonomní systémy.’

The paper finds that Contrastive Visual-Language (CVL) systems such as CLIP, now one of the most influential encoders in computer vision, are particularly likely to obtain such inferences from the data:

Výsledky vyhledávání pro dotazový obrázek, ukazující, jak základní modely řadí podobné obrázky nejen podle vizuálního obsahu, ale také podle skrytých metadat, jako je komprese JPEG nebo model kamery. Obrázek odráží tvrzení autorů, že jak sémantické, tak metadata labels formují reprezentační prostor modelu, někdy mění výsledky vyhledávání.

Výsledky vyhledávání pro dotazový obrázek, ukazující, jak základní modely řadí podobné obrázky nejen podle vizuálního obsahu, ale také podle skrytých metadat, jako je komprese JPEG nebo model kamery.

The new paper is titled Zpracování a akviziční stopy ve vizuálních kódérech: Co ví CLIP o vaší kamerě?, a pochází od šesti výzkumníků z Univerzity v Osace a Českého technického ústavu v Praze.

Metoda a data*

Aby bylo možné otestovat vliv skrytých metadat na vizuální kódéry, jako je CLIP, autoři pracovali se dvěma kategoriemi metadat: parametry zpracování obrazu (jako komprese JPEG nebo ostření) a akviziční parametry (jako model kamery nebo expoziční nastavení).

Rather než trénovat nové modely, výzkumníci vyhodnotili 47 široce používaných vizuálních kódérů ve svém frozen, předtrénovaném stavu, včetně kontrastních vizuálních-jazykových modelů, jako je CLIP, self-supervised modelů, jako je DINO, a konvenčně supervizovaných sítí.

Pro parametry zpracování se výzkumníci aplikovali kontrolované transformace na ImageNet a iNaturalist 2018 datasets, včetně šesti úrovní komprese JPEG, tří nastavení ostření, tří měřítek změny velikosti a čtyř interpolací.

Příklad obrázků a přidružených anotací z datové sady iNaturalist. Zdroj: https://arxiv.org/pdf/1707.06642

Příklad obrázků a přidružených anotací z datové sady iNaturalist. Zdroj: https://arxiv.org/pdf/1707.06642

Modely byly testovány na jejich schopnost obnovit každé transformační nastavení pomocí pouze obsahu obrazu, s úspěšnými předpověďmi, které indikují, že kódér uchovává informace o těchto volbách zpracování v jeho vnitřní reprezentaci.

Pro akviziční parametry výzkumníci sestavili 356 459-obrázkovou datovou sadu nazvanou FlickrExif, obsahující zachované Exif metadata, a vytvořili druhou datovou sadu nazvanou PairCams, složenou z 730 párových obrázků pořízených současně se smartphone a ne-smartphone kamerou.

Datová sada FlickrExif byla vytvořena pomocí Flickr API pro stažení obrázků s doprovodnými Exif metadata. Mezi 2 000 a 4 000 bezpečnými obrázky pro práci byly shromážděny každý měsíc, datované od počátku roku 2000 do poloviny roku 2024, a filtrovány tak, aby zahrnovaly pouze ty s permisivními licencemi. Aby se zabránilo nadměrnému zastoupení od prolifických uživatelů, každý jednotlivý přispěvatel byl omezen na deset obrázků měsíčně pro každý rok.

Pro datovou sadu PairCams byl každý snímek pořízen pomocí automatických nastavení a bez blesku, což umožnilo srovnání toho, jak vizuální kódéry reagují na rozdíly v kamerovém hardwaru samotném, bez ohledu na obsah obrazu:

Další příklady z datové sady PairCams vytvořené autory.

Další příklady z datové sady PairCams vytvořené autory.

Autoři testovali dva soubory parametrů: parametry zpracování obrazu, jako je komprese a barevné transformace; a akviziční parametry, jako je model kamery nebo expoziční nastavení:

Parametry zpracování obrazu a akviziční parametry analyzované, s počtem tříd pro každý.

Parametry zpracování obrazu a akviziční parametry analyzované, s počtem tříd pro každý.

Testy

Aby bylo možné určit, zda informace o zpracování obrazu a typu kamery jsou uchovávány uvnitř vizuálních kódérů, autoři trénovali klasifikátor pro předpověď metadatových labelů přímo z těchto kódérů. Pokud by klasifikátor pracoval stejně dobře jako náhodné odhady, naznačovalo by to, že detaily o zpracování nebo zařízení nejsou zachyceny modelem.

Avšak jakékoli lepší výkon než náhodné odhady by naznačovalo, že tyto technické stopy jsou skutečně zakódovány a mohou ovlivnit následné úkoly.

Pro testování stop zpracování autoři přiřadili každé trénovacímu obrázku náhodné nastavení zpracování, jako je konkrétní úroveň komprese JPEG, zatímco všechny testovací obrázky v dávce sdílely stejné nastavení.

Průměrná klasifikační přesnost napříč všemi nastaveními byla poté kombinována s opakovanými pokusy pod různými náhodnými semeny, aby se zjistilo, zda technické detaily zpracování jsou konzistentně zachyceny v vnitřní reprezentaci modelu:

Klasifikační přesnost pro předpověď parametrů zpracování obrazu z kódérů, pomocí lineárního klasifikátoru aplikovaného na zmrazené modely. Výsledky jsou zobrazeny pro kompresi JPEG, ostření, změnu velikosti a interpolaci, se třemi kategoriemi modelů, kontrastními vizuálními-jazykovými (oranžová), supervizovanými (zelená) a self-supervizovanými (modrá), vyhodnocenými na ImageNet (horní řádek) a iNaturalist 2018 (spodní řádek). Náhodné odhady jsou označeny čárkami.

Klasifikační přesnost pro předpověď parametrů zpracování obrazu z kódérů, pomocí lineárního klasifikátoru aplikovaného na zmrazené modely. Výsledky jsou zobrazeny pro kompresi JPEG, ostření, změnu velikosti a interpolaci, se třemi kategoriemi modelů, kontrastními vizuálními-jazykovými (oranžová), supervizovanými (zelená) a self-supervizovanými (modrá), vyhodnocenými na ImageNet (horní řádek) a iNaturalist 2018 (spodní řádek). Náhodné odhady jsou označeny čárkami.

Na všech čtyřech parametrech zpracování ukázaly kontrastní vizuální-jazykové modely nejvyšší schopnost rozpoznat skryté manipulace s obrázky. Některé modely dosáhly přes 80% přesnosti při předpovědi nastavení komprese JPEG, ostření a změny velikosti z ImageNet kódérů.

Supervizované kódéry, zejména ty založené na ConvNeXt, také pracovaly silně, zatímco self-supervizované modely byly konzistentně slabší.

Interpolace byla nejobtížnějším parametrem k detekci, ale i tak dosáhly nejlepší CVL a supervizované modely výsledků výrazně nad náhodným baseline 25% na obou datech.

Dále, aby se otestovala, zda je informace o kamerovém zařízení zakódována v modelech, autoři vytvořili samostatné trénovací a testovací sady pro každý akviziční parametr (jako model kamery, expoziční nastavení, clona, ISO a ohnisková vzdálenost).

Pro většinu parametrů byly použity pouze třídy s alespoň 5 000 příklady; 500 obrázků bylo náhodně vyčleněno pro testování, a zbývající příklady byly downsamplovány tak, aby každá třída měla 200 trénovacích vzorků. Pro parametry “model (vše)” a “model (smart)”, které měly méně dat pro třídu, autoři místo toho použili třídy s alespoň 500 obrázky, a rozdělili každou třídu na trénovací a testovací podsady v poměru čtyři ku jedné.

Fotografové byli drženi odděleně napříč trénovacími, validačními a testovacími sadami, a jednoduchý klasifikátor byl trénován pro předpověď informací o kamerovém zařízení na základě funkcí obrazu.

Aby se zajistilo, že klasifikátor nebyl ovlivněn sémantickým obsahem obrázků, byla 90% každého obrázku center-maskována (viz níže uvedené příklady). Autoři tvrdí, že na této úrovni maskování pracují všechny vizuální kódéry blízko náhodnému výkonu na ImageNet, což naznačuje, že sémantický signál byl účinně potlačen:

Validační přesnost ImageNet v závislosti na poměru maskování. Při 90% maskování klesají všechny modely na téměř náhodný výkon při předpovědi sémantických labelů, což naznačuje, že sémantické signály byly účinně odstraněny. Příkladové obrázky dole ilustrují úrovně maskování.

Validační přesnost ImageNet v závislosti na poměru maskování. Při 90% maskování klesají všechny modely na téměř náhodný výkon při předpovědi sémantických labelů, což naznačuje, že sémantické signály byly účinně odstraněny. Příkladové obrázky dole ilustrují úrovně maskování.

I při 90% maskování většiny obrázků stále kontrastní vizuální-jazykové modely a supervizované kódéry ConvNeXt předpovídaly labely kamery na úrovni výrazně nad náhodnou.

Další supervizované kódéry, SigLIP, a všechny self-supervizované modely pracovaly mnohem hůře. Když nebyla aplikována žádná maskování, CVL modely opět ukázaly nejsilnější shlukování podle typu kamery, potvrzující, že tyto modely zakódovávají akviziční informace hlubší než ostatní:

t-SNE vizualizace pro dva vizuální kódéry, s barvami indikujícími, zda byl každý obrázek pořízen smartphone nebo ne-smartphone kamerou.

t-SNE vizualizace pro dva vizuální kódéry, s barvami indikujícími, zda byl každý obrázek pořízen smartphone nebo ne-smartphone kamerou.

Dolní význam

Poté, co bylo zjištěno, že metadata ovlivňují modely tímto způsobem, byla vyhodnocena tendence skrytých stop zpracování k interferenci s interpretací obrazu.

Když byly pořízeny dvě verze stejného obrázku, které byly zpracovány odlišně, kódéry často organizovaly embeddingy podle stylu zpracování spíše než obsahu. V několika případech byl silně komprimovaný obrázek psa považován za podobnější ne souvisejícímu obrázku se stejným kompresním nastavením než za svou nekomprimovanou verzi:

Dopad parametrů zpracování na sémantickou předpověď, s přesností sémantické klasifikace pro ImageNet (nahoře) a iNaturalist (dole) pod pěti nastaveními zpracování. V základním nastavení sdílejí všechny trénovací a testovací obrázky stejné zpracování; v nastavení all-diff používá testovací obrázek zpracování, které není přítomno ve trénovacích datech; v pos-same a neg-same je label zpracování zarovnán buď se sémanticky podobnými nebo nesouvisejícími obrázky; v nastavení uniform jsou labely zpracování náhodně přiřazeny napříč trénovacími daty. Výsledky jsou uváděny pro k = 10 pro ImageNet a k = 1 pro iNaturalist.

Dopad parametrů zpracování na sémantickou předpověď, s přesností sémantické klasifikace pro ImageNet (nahoře) a iNaturalist (dole) pod pěti nastaveními zpracování. V základním nastavení sdílejí všechny trénovací a testovací obrázky stejné zpracování; v nastavení all-diff používá testovací obrázek zpracování, které není přítomno ve trénovacích datech; v pos-same a neg-same je label zpracování zarovnán buď se sémanticky podobnými nebo nesouvisejícími obrázky; v nastavení uniform jsou labely zpracování náhodně přiřazeny napříč trénovacími daty. Výsledky jsou uváděny pro k = 10 pro ImageNet a k = 1 pro iNaturalist.

Nejsilnější zkreslení byla způsobena kompresí JPEG, následovanou ostřením a změnou velikosti, zatímco interpolace měla pouze minimální efekt. Autoři tvrdí, že tyto výsledky prokazují, že stopy zpracování mohou převažovat nad sémantickými informacemi a určovat, jak je obrázek chápán.

V závěru varují:

‘Ačkoli jsme zjistili, že metadata labels jsou zakódovány ve vizuálních kódérech a poskytli jsme náznaky o potenciálních příčinách, nemůžeme přesně určit zdroj problému. Další výzkum je obtížný kvůli nákladům na opětovné trénování těchto modelů a častému použití privátních dat a nezveřejněných implementačních detailů.

‘Ačkoli nepropagujeme konkrétní techniky zmírnění, zdůrazňujeme tento problém jako důležitou oblast pro budoucí výzkum.’

Závěr

V literatuře je rostoucí forenzní zájem o stopy a znaky “metody nad obsahem”; čím je snazší identifikovat rámcový domén nebo konkrétní datovou sadu, tím je snazší využít tuto informaci ve formě – například detektorů deepfake, nebo systémů navržených pro kategorizaci původu nebo stáří dat a modelů.

To vše jde proti základnímu záměru trénování modelů umělé inteligence, který spočívá v tom, že centrální destilované koncepty by měly být kurátorovány nezávisle na prostředcích výroby a neměly by nést žádné stopy po nich. Ve skutečnosti mají datové sady a zařízení pro pořizování snímků charakteristiky a doménové rysy, které jsou prakticky nemožné oddělit od obsahu, protože samy o sobě představují “historický pohled”.

 

* Článek je uspořádán netradičně, a my se budeme snažit přizpůsobit jeho neobvyklému formátování a prezentaci. Velká část materiálu, která by měla být v (neexistujícím) ‘Metoda’ sekci, byla přesunuta do různých částí přílohy, zřejmě aby se omezila délka hlavní části článku na osm stránek – i když to bylo na úkor jasnosti. Pokud jsme zmeškali jakoukoli příležitost k zlepšení, kvůli nedostatku času, omlouváme se.

Poprvé publikováno ve středu, 20. srpna 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai