Andersonův úhel

Jsou méně kurátorované hyperscale AI datové sady horší než samotný internet?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z Irska, Velké Británie a USA varují, že růst hyperscale AI trénovacích datových sad ohrožuje šíření nejhorších aspektů jejich internetových zdrojů, a tvrdí, že nedávno zveřejněná akademická datová sada obsahuje ‘problémové a explicitní obrázky a textové páry znásilnění, pornografie, maligní stereotypy, rasistické a etnické urážky a další extrémně problematický obsah’.

Výzkumníci se domnívají, že nová vlna masivních nekvalitních nebo nesprávně filtrovaných multimodálních (například obrázků a obrazů) datových sad je zřejmě více poškozující ve své schopnosti posilovat účinky takového negativního obsahu, protože datové sady uchovávají obrázky a další obsah, který mohl být odstraněn z online platforem prostřednictvím uživatelských stížností, lokální moderace nebo algoritmů.

Dále pozorují, že může trvat roky – v případě mohutné datové sady ImageNet dokonce celou dekádu – aby se dlouholeté stížnosti na obsah datové sady vyřešily, a že tyto pozdější revize nejsou vždy zohledněny ani v nových datových sadách odvozených od nich.

Článek, nazvaný Multimodální datové sady: misogynie, pornografie a maligní stereotypy, pochází od výzkumníků z University College Dublin & Lero, University of Edinburgh a hlavního vědce na platformě UnifyID.

Práce se zaměřuje na nedávné vydání CLIP-filtrované LAION-400M datové sady, ale autoři argumentují proti obecnému trendu házení stále větších množství dat na rámce strojového učení, jako je neuronový jazykový model GPT-3, a tvrdí, že výsledky zaměřený tlak na lepší inferenci (a dokonce i na umělou obecnou inteligenci [AGI]) vede k ad hoc použití poškozujících zdrojů dat s nedbalou kontrolou autorských práv; potenciál vyvolat a propagovat újmu; a schopnost nejenom zachovat nezákonná data, která by jinak zmizela z veřejného prostoru, ale také začlenit morální modely takových dat do downstream implementací AI.

LAION-400M

Minulý měsíc byla vydána datová sada LAION-400M, která přidala k rostoucímu počtu multimodálních, lingvistických datových sad, které spoléhají na Common Crawl repozitář, který prochází internetem nediskriminovaně a předává odpovědnost za filtrování a kurátorství projektům, které z něj čerpají. Odvozená datová sada obsahuje 400 milionů text-obrázkových párů.

LAION-400M je otevřená varianta uzavřené datové sady Google AI WIT (WebImageText) datové sady vydané v březnu 2021, a obsahuje text-obrázkové páry, kde je obrázek v databázi spojen s doprovodným explicitním nebo metadata textem (například alt-textem obrázku ve webové galerii). To umožňuje uživatelům provádět textově založené vyhledávání obrázků, odhalující asociace, které vytvořil základní AI o těchto doménách (tj. ‘živočich’, ‘kolo’, ‘osoba’, ‘muž’, ‘žena’).

Tento vztah mezi obrázkem a textem a kosinová podobnost, která může vložit předpojatost do výsledků dotazů, jsou v srdci článku volání po zlepšených metodologiích, protože velmi jednoduché dotazy do databáze LAION-400M mohou odhalit předpojatost.

Například obrázek průkopnické astronautky Eileen Collins v knihovně scitkit-image vrátí dva spojené popisky v LAION-400M: ‘Toto je portrét astronauta s americkou vlajkou’ a ‘Toto je fotografie usmívající se manželky v oranžovém kombinézu s americkou vlajkou’.

Americká astronautka Eileen Collins dostává dvě velmi odlišné názory na její úspěchy jako první žena ve vesmíru pod LAION-400M. Zdroj: https://arxiv.org/pdf/2110.01963.pdf

Americká astronautka Eileen Collins dostává dvě velmi odlišné názory na její úspěchy jako první žena ve vesmíru pod LAION-400M. Zdroj: https://arxiv.org/pdf/2110.01963.pdf

Hlásí se, že kosinová podobnost, která činí oba popisky pravděpodobnými, je velmi blízko u sebe, a autoři tvrdí, že taková blízkost by činila AI systémy, které používají LAION-400M, relativně pravděpodobnými, aby představily jeden z nich jako vhodný popisek.

Pornografie opět stoupá na vrchol

LAION-400M nabízí vyhledávací rozhraní dostupné, kde zrušení zaškrtávacího tlačítka “bezpečné vyhledávání” odhaluje rozsah, v jakém dominují pornografické obrázky a textové asociace nad popisky a třídy. Například vyhledávání ‘jeptiška’ (NSFW, pokud následně zrušíte bezpečné vyhledávání) v databázi vrátí výsledky většinou související s hororem, kostýmy a převlékáním, s velmi málo skutečnými jeptiškami dostupnými.

Vypnutí režimu “Bezpečné vyhledávání” ve stejném vyhledávání odhalí spoustu pornografických obrázků souvisejících s termínem, které tlačí ne-pornografické obrázky dolů na stránku výsledků vyhledávání, odhalující rozsah, v jakém LAION-400M přidělil větší váhu pornografickým obrázkům, protože jsou převládající pro termín “jeptiška” v online zdrojích.

Výchozí aktivace režimu “Bezpečné vyhledávání” je klamná v online vyhledávacím rozhraní, protože představuje UI trik, filtr, který nebude nutně aktivován v odvozených AI systémech, ale který byl zobecněn do domény “jeptiška” způsobem, který není tak snadno filtrovatelný nebo rozlišitelný od (relativně) SFW výsledků z hlediska algoritmického použití.

Článek obsahuje rozmazané příklady napříč různými vyhledávacími termíny v doplňkových materiálech na konci. Nemohou být zde uvedeny, kvůli jazyku v doprovodném textu, který doprovází rozmazané fotografie, ale výzkumníci poznamenávají, jakou daň vyšetřování a rozmazání obrázků mělo na nich, a uznávají výzvu kurátorství takového materiálu pro lidskou kontrolu velkých databází:

‘Zažívali jsme (stejně jako naši kolegové, kteří nám pomáhali) různé úrovně nepohodlí, nevolnosti a bolesti hlavy během procesu prohledávání datové sady. Kromě toho tento druh práce nezřídka čelí významné negativní kritice napříč akademickou AI sférou při vydání, což nejen přidává další emocionální zátěž již tak náročné úkolu studia a analýzy takových datových sad, ale také odrazuje podobné budoucí práce, což je ku prospěchu AI oblasti a společnosti obecně.’

Výzkumníci tvrdí, že zatímco kurátorství s lidskou kontrolou je drahé a má spojené osobní náklady, automatizované filtrační systémy navržené k odstranění nebo jinému zpracování takového materiálu nejsou jasně dostatečné k úkolu, protože systémy NLP mají potíže s izolováním nebo diskontováním urážlivého materiálu, který může dominovat vyškrabované datové sadě, a následně být vnímán jako významný kvůli své obrovské velikosti.

Zakotvování zakázaného obsahu a odstraňování autorských práv

Článek argumentuje, že nekvalitní datové sady tohoto druhu jsou “velmi pravděpodobně” šířit využívání menšinových jedinců a řeší, zda podobné otevřené datové projekty mají právo, legálně nebo morálně, přenést odpovědnost za materiál na koncového uživatele:

‘Jedinci mohou odstranit svá data z webu a předpokládat, že jsou navždy pryč, zatímco mohou stále existovat na serverech několika výzkumníků a organizací. Existuje otázka, kdo je zodpovědný za odstranění těchto dat z použití v datové sadě? Pro LAION-400M autoři delegovali tuto úlohu na uživatele datové sady. Vzhledem k tomu, že tyto procesy jsou úmyslně složité a že průměrný uživatel postrádá technické znalosti k odstranění svých dat, je toto rozumný přístup?’

Dále tvrdí, že LAION-400M nemusí být vhodný pro vydání pod jeho přijatým modelem Creative Common CC-BY 4.0, navzdory potenciálním výhodám pro demokratizaci velkých datových sad, které byly dříve výhradním doménou velkých firem, jako je Google a OpenAI.

Doména LAION-400M tvrdí, že obrázky datové sady 'jsou pod svou vlastní autorskou smlouvou' – 'prostřednictvím' mechanismus, který je umožněn soudními rozhodnutími a vládními směrnicemi z posledních let, které obecně schvalují web-scraping pro výzkumné účely. Zdroj: https://rom1504.github.io/clip-retrieval/

Doména LAION-400M tvrdí, že obrázky datové sady ‘jsou pod svou vlastní autorskou smlouvou’ – ‘prostřednictvím’ mechanismus, který je umožněn soudními rozhodnutími a vládními směrnicemi z posledních let, které obecně schvalují web-scraping pro výzkumné účely. Zdroj: https://rom1504.github.io/clip-retrieval/

Autoři navrhují, že dobrovolníci (tj. dobrovolní dobrovolníci) by mohli řešit některé problémy datové sady, a že výzkumníci by mohli vyvinout lepší filtrační techniky.

‘Nicméně, práva subjektu dat zůstávají nezodpovězena zde. Je bezohledné a nebezpečné podceňovat újmy, které jsou inherentní v takových velkých datových sadách, a podporovat jejich použití v průmyslových a komerčních prostředích. Odpovědnost licenčního schématu, pod kterým je datová sada poskytována, leží výhradně na tvůrci datové sady.’

Problémy demokratizace hyperscale dat

Článek argumentuje, že visio-lingvistické datové sady jako LAION-400M byly dříve nedostupné mimo velké technologické firmy a omezený počet výzkumných institucí, které disponují zdroji pro sběr, kurátorství a zpracování. Dále oslavují ducha nového vydání, zatímco kritizují jeho provedení.

Autoři tvrdí, že přijatá definice “demokratizace”, jak se vztahuje na otevřené datové sady hyperscale, je příliš omezená, a ‘nesplňuje práva, blaho a zájmy zranitelných jedinců a komunit, z nichž mnohé budou pravděpodobně nejvíce trpět následnými dopady této datové sady a modelů, které byly na ní vyškoleny’.

Pokud jsou modely GPT-3 navrženy tak, aby byly distribuovány milionům (a možná i miliardám) uživatelů po celém světě, a pokud výzkumné projekty mohou přijmout datové sady předtím, než jsou později upraveny nebo odstraněny, autoři argumentují, že bezstarostné vydání nekvalitních datových sad by nemělo být běžnou součástí otevřeného zdrojového strojového učení.

Vracení džina do láhve

Některé datové sady, které byly potlačeny dlouho po tom, co jejich obsah prošel, možná nezvratně, do dlouhodobých AI projektů, zahrnovaly Duke MTMC (Multi-Target, Multi-Camera) datovou sadu, která byla nakonec stažena kvůli opakovaným obavám lidskoprávních organizací kolem jejího použití represivními úřady v Číně; Microsoft Celeb (MS-Celeb-1M), datovou sadu 10 milionů “celebrity” obličejových obrázků, která ukázala, že zahrnovala novináře, aktivisty, politiky a spisovatele, jejichž expozice biometrických dat ve vydání byla silně kritizována; a datovou sadu Tiny Images, staženou v roce 2020 pro self-proclaimed “předpojaté a urážlivé obrázky a jazyk”.

Co se týče datových sad, které byly upraveny místo stažení po kritice, příklady zahrnují velmi populární datovou sadu ImageNet, která, jak výzkumníci poznamenávají, potřebovala deset let (2009-2019), aby se vypořádala s opakovanou kritikou kolem soukromí a neobrazitelných tříd.

Článek poznamenává, že LAION-400M efektivníma zpětně nastavuje i tyto pozdní zlepšení, “velmi ignoruje” výše uvedené revize v reprezentaci ImageNet v novém vydání, a podezřívá širší trend v tomto ohledu*:

‘To je zdůrazněno vzhledem větších datových sad, jako je Tencent ML-images datová sada (v únoru 2020), která zahrnuje většinu z těchto neobrazitelných tříd, pokračující dostupnost modelů vyškolených na plné ImageNet-21k datové sadě v repozitářích jako TF-hub, použití nefiltrované ImageNet-21k v nejnovějších SotA modelech (jako je Google’s latest EfficientNetV2 a CoAtNet modely) a explicitní ohlášení povolení použití nefiltrované ImageNet-21k předškolního vzdělávání v renomovaných soutěžích jako LVIS výzva 2021.

‘Klademe důraz na toto kritické pozorování: Tým ImageNet, který spravuje méně než 15 milionů obrázků, bojoval a selhal v těchto detoxifikačních pokusech dosud.

‘Stupeň pečlivých úsilí vyžadovaných k důkladnému detoxifikaci této masivní multimodální datové sady a downstream modelů vyškolovaných na této datové sadě zahrnující potenciálně miliardy obrázkových-párových párů bude bezpochyby astronomický.’

* Mé převedení autorových inline citací na hypertextové odkazy.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai