Andersons vinkel

Er under-kuraterede hyperskala AI-datasets værre end internettet selv?

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forskere fra Irland, Storbritannien og USA har advaret om, at væksten i hyperskala AI-træningsdatasets truer med at sprede de værste aspekter af deres internetkilder, og hævder, at en nyligt udgivet akademisk dataset indeholder ‘problematisk og eksplicit billeder og tekstpar af vold, pornografi, skadelige stereotyper, racistiske og etniske krænkelser og anden ekstremt problematisk indhold’.

Forskerne mener, at en ny bølge af massive under-kuraterede eller forkert filtrerede multimodale (f.eks. billeder og billeder) datasets er sandsynligvis mere skadelige i deres evne til at forstærke effekterne af sådant negativt indhold, da datasets bevare billeder og andet indhold, som måske er fjernet fra online-platforme gennem brugerklager, lokal moderation eller algoritmer.

De observerer yderligere, at det kan tage år – i tilfældet af det mægtige ImageNet-dataset, en hel årti – for langvarige klager over dataset-indhold at blive behandlet, og at disse senere revisioner ikke altid reflekteres, selv i nye datasets, der er afledt af dem.

Artiklen, med titlen Multimodale datasets: misogyni, pornografi og skadelige stereotyper, kommer fra forskere ved University College Dublin & Lero, University of Edinburgh og Chief Scientist ved UnifyID-authentificeringsplatformen.

Selv om arbejdet fokuserer på den nylige udgivelse af CLIP-filtreret LAION-400M-dataset, hævder forfatterne, at den generelle trend med at kaste stadig mere data på maskinlæringsrammer som den neurale sprogmodel GPT-3, og at drivkraften mod bedre inferens (og endda mod kunstig almen intelligens [AGI]) resulterer i den tilfældige brug af skadelige datakilder med forsømmelig ophavsretsovervågning; potentialet for at fremkalde og fremme skade; og evnen til ikke blot at videregive ulovligt data, der ellers ville være forsvundet fra offentlighedens øjne, men også til at inkorporere sådant datas moralske modeller i downstream AI-implementeringer.

LAION-400M

For sidste måned blev LAION-400M-datasettet udgivet, hvilket tilføjer til den voksende mængde af multi-modale, lingvistiske datasets, der afhænger af Common Crawl-repository, der scraper internettet uden diskrimination og overdrager ansvaret for filtrering og kuratering til projekter, der bruger det. Det afledte dataset indeholder 400 millioner tekst/billede-par.

LAION-400M er en åben kilde-variant af Google AI’s lukkede WIT (WebImageText) dataset udgivet i marts 2021, og indeholder tekst/billede-par, hvor et billede i databasen er blevet associeret med tilhørende eksplicit eller metadata-tekst (f.eks. alt-teksten for et billede i en webgalleri). Dette giver brugerne mulighed for at udføre tekstbaseret billedhenting, hvilket afslører de associationer, som den underliggende AI har dannet om disse domæner (dvs. ‘dyr’, ‘cykel’, ‘person’, ‘mand’, ‘kvinde’).

Forholdet mellem billede og tekst, og den kosinuslighed, der kan indbygge bias i søgeresultater, er i centrum af artiklens opfordring til forbedrede metoder, da meget simple forespørgsler til LAION-400M-databasen kan afsløre bias.

For eksempel kan billedet af den pionerende kvindelige astronaut Eileen Collins i scitkit-billedbiblioteket hente to associerede undertekster i LAION-400M: ‘Dette er et portræt af en astronaut med det amerikanske flag’ og ‘Dette er et fotografi af en smilende husmor i en orange jumpsuit med det amerikanske flag’.

Den amerikanske astronaut Eileen Collins får to meget forskellige beskrivelser af hendes præstationer som den første kvinde i rummet under LAION-400M. Kilde: https://arxiv.org/pdf/2110.01963.pdf

Den amerikanske astronaut Eileen Collins får to meget forskellige beskrivelser af hendes præstationer som den første kvinde i rummet under LAION-400M. Kilde: https://arxiv.org/pdf/2110.01963.pdf

De rapporterede kosinusligheder, der gør det sandsynligt, at enten undertekst er anvendelig, er meget tæt på hinanden, og forfatterne hævder, at sådan nærhed ville gøre AI-systemer, der bruger LAION-400M, relativt sandsynlige for at præsentere enten som en passende undertekst.

Pornografi kommer til tops igen

LAION-400M har gjort en søgegrænseflade tilgængelig, hvor afkrydsning af ‘sikker søgning’-knappen afslører, i hvilken udstrækning pornografiske billeder og tekstassociationer dominerer mærker og klasser. For eksempel returnerer søgning efter ‘nonne’ (NSFW, hvis du herefter deaktiverer sikker søgning) i databasen resultater, der primært er relateret til horror, cosplay og kostumer, med meget få faktiske nonner tilgængelige.

Når man slår Safe Mode fra på samme søgning, viser det en række pornografiske billeder relateret til begrebet, som skyder ikke-pornografiske billeder ned på søgeresultatsiden, hvilket afslører, i hvilken udstrækning LAION-400M har tildelt større vægt til de pornografiske billeder, fordi de er udbredt for begrebet ‘nonne’ i onlinekilder.

Den standardmæssige aktivering af Safe Mode er bedragerisk i den online søgegrænseflade, da det repræsenterer en UI-ejendommelighed, en filter, som ikke nødvendigvis vil være aktiveret i afledte AI-systemer, men som er generaliseret til ‘nonne’-domænet på en måde, der ikke let kan filtreres eller skelnes fra de (relativt) SFW-resultater i forhold til algoritmebrug.

Artiklen indeholder uddybede eksempler på tværs af forskellige søgeord i supplerende materiale i slutningen. De kan ikke vises her på grund af sproget i den tekst, der ledsager de uddybede billeder, men forskerne bemærker, hvor meget det har kostet dem at undersøge og uddybe billederne, og anerkender udfordringen ved at kuraterer sådant materiale for menneskelig oversigt over store databases:

‘Vi (såvel som vores kolleger, der hjalp os) oplevede varierende niveauer af ubehag, kvalme og hovedpine under processen med at undersøge datasettet. Desuden møder denne type arbejde uforholdsmæssigt stor negativ kritik på tværs af den akademiske AI-sfære ved udgivelse, hvilket ikke blot tilføjer en ekstra emotionel byrde til den allerede tunge opgave med at studere og analysere sådanne datasets, men også diskouragerer lignende fremtidigt arbejde, til stor skade for AI-feltet og samfundet i almindelighed.’

Forskerne hævder, at mens menneske-i-løkken-kuratering er dyrt og har tilknyttede personlige omkostninger, er de automatiserede filter-systemer, der er designet til at fjerne eller på anden måde håndtere sådant materiale, åbenbart ikke tilstrækkelige til opgaven, da NLP-systemer har svært ved at isolere eller diskontere krænkende materiale, der kan dominere et skrabet dataset, og herefter kan blive opfattet som væsentligt på grund af den rene mængde.

Indføring af forbudt indhold og fjernelse af ophavsretssikring

Artiklen hævder, at under-kuraterede datasets af denne natur er ‘meget sandsynlige’ for at videregive udnyttelsen af minoritetspersoner, og diskuterer, om lignende åbne kilde-data-projekter har retten, juridisk eller moralsk, til at overføre ansvar for materialet til slutbrugeren:

‘Enkeltpersoner kan slette deres data fra en hjemmeside og antage, at det er væk for altid, mens det stadig kan eksistere på serverne hos flere forskere og organisationer. Der er et spørgsmål om, hvem der er ansvarlig for at fjerne denne data fra brug i datasettet? For LAION-400M har skaberen overført denne opgave til dataset-brugeren. Givet, at sådanne processer er bevidst gjort komplekse, og at den gennemsnitlige bruger mangler den tekniske viden til at fjerne deres data, er dette en rimelig tilgang?’

De hævder yderligere, at LAION-400M måske ikke er egnet til udgivelse under dets antagne Creative Common CC-BY 4.0-licensmodel, på trods af de potentielle fordele for demokratiseringen af store datasets, der tidligere var det eksklusive domæne for velbefunderede virksomheder som Google og OpenAI.

LAION-400M-domænet hævder, at dataset-billederne 'er under deres eget ophavsret' – en 'videreformidling'-mekanisme, der i høj grad er muliggjort af domstolsafgørelser og regeringsretningslinjer i de senere år, der generelt godkender web-skrapning til forskningsformål. Kilde: https://rom1504.github.io/clip-retrieval/

LAION-400M-domænet hævder, at dataset-billederne ‘er under deres eget ophavsret’ – en ‘videreformidling’-mekanisme, der i høj grad er muliggjort af domstolsafgørelser og regeringsretningslinjer i de senere år, der generelt godkender web-skrapning til forskningsformål. Kilde: https://rom1504.github.io/clip-retrieval/

Forfatterne foreslår, at græsrods- (dvs. crowdsourced-frivillige) kunne løse nogle af dataset-problemerne, og at forskere kunne udvikle forbedrede filterteknikker.

‘Alligevel forbliver rettighederne for datasubjektet ubehandlet her. Det er uforsvarligt og farligt at nedtone de skader, der er indbygget i sådanne store datasets, og opmuntre deres brug i industrielle og kommercielle sammenhænge. Ansvar for licensordningen, under hvilken datasettet er tilgængeligt, falder alene på dataset-skaberen’.

Problemerne med at demokratisere hyperskala-data

Artiklen hævder, at visio-lingvistiske datasets, så store som LAION-400M, tidligere var utilgængelige uden for store teknologivirksomheder og det begrænsede antal forskningsinstitutioner, der råder over ressourcerne til at samle, kuraterer og behandle dem. De hylder ånden i den nye udgivelse, mens de kritiserer dens gennemførelse.

Forfatterne hævder, at den accepterede definition af ‘demokratisering’, som det gælder for åbne kilde-hyperskala-datasets, er for snæver, og ‘fejler at tage hensyn til rettighederne, velfærden og interesserne for sårbare enkeltpersoner og samfund, mange af hvilke sandsynligvis vil lide værst under de nedstrømsvirkninger af dette dataset og de modeller, der er trænet på det’.

Da udviklingen af GPT-3-skala åbne kilde-modeller ultimativt er designet til at være spredt til millioner (og ved proxy, muligvis milliarder) af brugere verden over, og da forskningsprojekter kan antage datasets, før de herefter bliver redigeret eller endda fjernet, og videregive de problemer, der var designet til at blive adresseret i modificeringerne, hævder forfatterne, at uomsorgsfulde udgivelser af under-kuraterede datasets ikke bør blive en fast del af åbne kilde-maskinlæring.

At putte genien tilbage i flasken

Nogle datasets, der blev undertrykt lang tid efter, at deres indhold havde passeret gennem, måske uadskilleligt, i langsigtede AI-projekter, har inkluderet Duke MTMC (Multi-Target, Multi-Camera)-datasettet, der til sidst blev trukket tilbage på grund af gentagne bekymringer fra menneskerettighedsorganisationer omkring dets brug af undertrykkende myndigheder i Kina; Microsoft Celeb (MS-Celeb-1M), en dataset af 10 millioner ‘celebrity’-ansigtsbilleder, der viste sig at have inkluderet journalister, aktivister, politikere og forfattere, hvis eksponering af biometrisk data i udgivelsen blev kraftigt kritiseret; og Tiny Images-datasettet, trukket tilbage i 2020 på grund af selv-erklærede ‘bias, krænkende og forkastelige billeder og nedvurderende terminologi’.

Med hensyn til datasets, der blev ændret i stedet for at blive trukket tilbage efter kritik, inkluderer eksempler den meget populære ImageNet-dataset, som, ifølge forskerne, tog ti år (2009-2019) at handle på gentagne kritik omkring privatliv og ikke-billed-klasser.

Artiklen observerer, at LAION-400M effektivt sætter selv disse langsomme forbedringer tilbage, ved ‘i stor udstrækning at ignorere’ de nævnte revisioner i ImageNet’s repræsentation i den nye udgivelse, og spår en bredere trend på denne måde*:

‘Dette fremhæves i opdukken af større datasets som Tencent ML-billeder-dataset (i februar 2020) som omfatter de fleste af disse ikke-billed-klasser, den fortsatte tilgængelighed af modeller trænet på det fulde ImageNet-21k-dataset i repositories såsom TF-hub, den fortsatte brug af det ufiltrede ImageNet-21k i de seneste SotA-modeller (såsom Google’s seneste EfficientNetV2 og CoAtNet-modeller) og de eksplicitte meddelelser, der tillader brugen af ufiltret ImageNet-21k-prætræning i respektable konkurrencer såsom LVIS-udfordringen 2021.

‘Vi understreger denne afgørende observation: Et hold af ImageNet’s kaliber, der har haft svært ved at håndtere under 15 millioner billeder, har kæmpet og fejlet i disse desinfektionsforsøg hidtil.

‘Omfanget af omhyggelige bestræbelser, der kræves for at grundigt desinficere dette massive multimodale dataset og de nedstrøms-modeller, der er trænet på dette dataset, der omfatter potentielt milliarder af billed-tekst-par, vil være ubestrideligt astronomisk.’

 

* Min konvertering af forfatterens inline-citationer til hyperlinks.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai