Andersons vinkel
Är underkuraterade hyperskale-AI-databaser värre än internetet självt?

Forskare från Irland, Storbritannien och USA har varnat för att tillväxten av hyperskale-AI-träningsdatabaser hotar att sprida de sämsta aspekterna av deras internetkällor och hävdar att en nyligen utgiven akademisk databas innehåller ‘besvärliga och uttryckliga bilder och textpar av våldtäkt, pornografi, skadliga stereotyper, rasistiska och etniska smädelser och annat extremt problematiskt innehåll’.
Forskarna tror att en ny våg av massiva underkuraterade eller felaktigt filterade multimodala (t.ex. bilder och bilder) databaser är mer skadliga i sin förmåga att förstärka effekterna av sådant negativt innehåll, eftersom databaserna bevarar bilder och annat innehåll som kan ha tagits bort från onlineplattformar genom användarklagomål, lokal moderering eller algoritmer.
De observerar vidare att det kan ta år – i fallet med den mäktiga ImageNet-databasen, en hel decennium – för långvariga klagomål om databasinnehåll att bli åtgärdade, och att dessa senare revideringar inte alltid återspeglas, även i nya databaser som härrör från dem.
Den artikeln, med titeln Multimodala databaser: misogyni, pornografi och skadliga stereotyper, kommer från forskare vid University College Dublin & Lero, University of Edinburgh och chefsforskaren vid UnifyID-autentiseringsplattformen.
Fastän arbetet fokuserar på den nyliga utgåvan av CLIP-filtrerade LAION-400M-databasen, hävdar författarna att den allmänna trenden att kasta alltmer data på maskinlärningsramverk som neurala språkmodeller som GPT-3 och kontenderar att resultatinriktade drivkrafterna mot bättre inferens (och till och med mot artificiell allmän intelligens [AGI]) resulterar i det ad hoc-användandet av skadliga datakällor med försumlig upphovsrättsövervakning; potentialen att framkalla och främja skada; och förmågan att inte bara sprida olagligt data som annars kan ha försvunnit från den offentliga domänen, utan att faktiskt inkorporera sådant datas moraliska modeller i nedströms AI-implementeringar.
LAION-400M
Förra månaden släpptes LAION-400M-databasen, vilket bidrar till den växande mängden multimodala, lingvistiska databaser som förlitar sig på Common Crawl-databasen, som skrapar internet utan diskriminering och överlåter ansvaret för filtrering och kurering till projekt som använder den. Den härledda databasen innehåller 400 miljoner text/bildpar.
LAION-400M är en öppen källvariant av Google AI:s stängda WIT (WebImageText) databas som släpptes i mars 2021 och innehåller text/bildpar, där en bild i databasen har associerats med åtföljande explicit eller metadata-text (t.ex. alt-texten för en bild i en webbgalleri). Detta möjliggör för användare att utföra textbaserad bildåtervinning, vilket avslöjar de associationer som den underliggande AI:n har bildat om dessa domäner (t.ex. ‘djur’, ‘cykel’, ‘person’, ‘man’, ‘kvinna’).
Detta förhållande mellan bild och text, och den kosinliknande likheten som kan infoga partiskhet i sökresultat, ligger till grund för artikelförfattarnas krav på förbättrade metoder, eftersom mycket enkla frågor till LAION-400M-databasen kan avslöja partiskhet.
Till exempel hämtar bilden av den banbrytande kvinnliga astronauten Eileen Collins i scitkit-bildbiblioteket två associerade undertexter i LAION-400M: ‘Detta är en porträtt av en astronaut med den amerikanska flaggan’ och ‘Detta är en fotografi av en leende husmor i en orange overall med den amerikanska flaggan’.

Amerikansk astronaut Eileen Collins får två mycket olika tolkningar av hennes prestationer som den första kvinnan i rymden under LAION-400M. Källa: https://arxiv.org/pdf/2110.01963.pdf
De rapporterade kosinlikheterna som gör att antingen undertext är sannolik att vara tillämplig är mycket nära varandra, och författarna hävdar att sådan närhet skulle göra AI-system som använder LAION-400M relativt benägna att presentera antingen som en lämplig undertext.
Pornografi stiger till toppen igen
LAION-400M har gjort en sökbar gränssnitt tillgänglig, där avmarkering av ‘säker sökning’-knappen avslöjar omfattningen av hur pornografiska bilder och textassociationer dominerar etiketter och klasser. Till exempel sökning efter ‘nun’ (NSFW om du sedan inaktiverar säker läge) i databasen returnerar resultat som mestadels är relaterade till skräck, cosplay och kostymer, med mycket få faktiska nunnor tillgängliga.
När man inaktiverar säker läge på samma sökning avslöjas en mängd pornografiska bilder relaterade till termen, som trycker ner icke-pornografiska bilder nedåt sökresultatsidan, vilket avslöjar omfattningen av hur LAION-400M har tilldelat större vikt åt de pornografiska bilderna, eftersom de är vanliga för termen ‘nun’ i onlinekällor.
Den standardaktiverade säkerhetsläget är bedrägligt i det online-sökgränssnittet, eftersom det representerar en UI-egenskap, ett filter som inte nödvändigtvis kommer att aktiveras i härledda AI-system, men som har generaliserats till ‘nun’-domänen på ett sätt som inte är så lätt att filtrera eller skilja från de (relativt) SFW-resultaten i termer av algoritmisk användning.
Artikeln innehåller suddiga exempel över olika söktermer i de tilläggsmaterial som finns i slutet. De kan inte presenteras här på grund av språket i texten som åtföljer de suddiga fotografierna, men forskarna noterar den börda som undersökningen och suddningen av bilderna tog på dem, och erkänner utmaningen i att kurera sådant material för mänsklig översyn av storskaliga databaser:
‘Vi (samt våra kollegor som hjälpte oss) upplevde varierande grad av obehag, illamående och huvudvärk under processen att undersöka databasen. Dessutom möter detta arbete en betydande negativ kritik över hela den akademiska AI-sfären vid utgivning, vilket inte bara lägger till en extra emotionell börda på det redan tunga arbetet med att studera och analysera sådana databaser, utan också avskräcker liknande framtida arbete, till stor skada för AI-området och samhället i allmänhet.’
Forskarna hävdar att medan mänsklig-översynskurering är dyrt och har associerade personliga kostnader, är de automatiserade filter-systemen som är avsedda att ta bort eller på annat sätt hantera sådant material inte tillräckligt för uppgiften, eftersom NLP-system har svårt att isolera eller diskontera stötande material som kan dominera en skrapad databas, och därefter uppfattas som betydelsefullt på grund av ren volym.
Inskriva förbjudet innehåll och avskaffa upphovsrättsligt skydd
Artikeln hävdar att underkuraterade databaser av denna natur är ‘mycket sannolika’ att sprida utnyttjandet av minoritetsindivider och diskuterar om liknande öppen källkodsdataprojekt har rätt, juridiskt eller moraliskt, att skjuta ansvaret för materialet över till slutanvändaren:
‘Individer kan ta bort sina data från en webbplats och anta att de är borta för alltid, medan de fortfarande kan finnas på servrarna hos flera forskare och organisationer. Det finns en fråga om vem som är ansvarig för att ta bort dessa data från användning i databasen? För LAION-400M har skaparna delegerat denna uppgift till databasanvändaren. Givet att sådana processer är avsiktligt komplexa och att den genomsnittlige användaren saknar den tekniska kunskapen för att ta bort sina data, är detta ett rimligt tillvägagångssätt?’
De hävdar vidare att LAION-400M kanske inte är lämplig för utgivning under dess antagna Creative Common CC-BY 4.0-licensmodell, trots de potentiella fördelarna med att demokratisera storskaliga databaser, som tidigare var det exklusiva området för välfinansierade företag som Google och OpenAI.

LAION-400M-domänen hävdar att databasbilderna ‘är under deras eget upphovsrätt’ – en ‘genomgångsmekanism’ som till stor del möjliggjorts av domstolsbeslut och regeringsriktlinjer under de senaste åren som i allmänhet godkänner webbskrapning för forskningsändamål. Källa: https://rom1504.github.io/clip-retrieval/
Författarna föreslår att gräsrotsinitiativ (dvs. crowd-sourced frivilliga) kunde åtgärda vissa av databasproblemen, och att forskare kunde utveckla förbättrade filtertekniker.
‘Likväl förblir rättigheterna för datasubjektet oadresserade här. Det är oaktsamt och farligt att nedvärdera de skador som är inbyggda i sådana storskaliga databaser och uppmuntra deras användning i industriella och kommersiella miljöer. Ansvaret för licenssystemet under vilket databasen tillhandahålls faller enbart på databasskaparen’.
Problem med att demokratisera hyperskaledata
Artikeln hävdar att visio-lingvistiska databaser som LAION-400M tidigare var otillgängliga utanför stora techföretag och det begränsade antalet forskningsinstitutioner som besitter resurserna för att samla in, kurera och bearbeta dem. De hyllar andan i den nya utgåvan, samtidigt som de kritiserar dess genomförande.
Författarna hävdar att den accepterade definitionen av ‘demokratisering’, som den tillämpas på öppen källkods-hyperskale-databaser, är alltför begränsad och ‘misslyckas med att ta hänsyn till rättigheterna, välfärden och intressena för utsatta individer och samhällen, många av vilka sannolikt kommer att lida mest av de nedströms-effekterna av denna databas och modellerna som tränas på den’.
Eftersom utvecklingen av GPT-3-skala öppen källkodsmodeller slutligen är avsedda att spridas till miljontals (och genom ombud, möjligtvis miljarder) användare över hela världen, och eftersom forskningsprojekt kan anta databaser innan de modifieras eller till och med tas bort, och därigenom sprida de problem som var avsedda att åtgärdas i modifieringarna, hävdar författarna att vårdslösa utgåvor av underkuraterade databaser inte bör bli en vanlig funktion i öppen källkods maskinlärning.
Att sätta tillbaka genien i flaskan
Vissa databaser som undertrycktes långt efter att deras innehåll hade passerat, kanske oåterkalleligt, in i långsiktiga AI-projekt, har inbegripit Duke MTMC (Multi-Target, Multi-Camera) -databasen, som till slut drogs tillbaka på grund av upprepade klagomål från människorättsorganisationer kring dess användning av repressiva myndigheter i Kina; Microsoft Celeb (MS-Celeb-1M), en databas med 10 miljoner ‘kändis’-ansiktsbilder som visade sig innehålla journalister, aktivister, beslutsfattare och författare, vars exponering av biometrisk data i utgåvan kraftigt kritiserades; och Tiny Images-databasen, drog tillbaka 2020 på grund av självbekända ‘partiskhet, stötande och fördomsfulla bilder och nedsättande terminologi’.
Med avseende på databaser som modifierades snarare än drogs tillbaka efter klagomål, finns exempel som den mycket populära ImageNet-databasen, som, enligt forskarna, tog tio år (2009-2019) att agera på upprepade klagomål kring sekretess och icke-bildbara klasser.
Artikeln observerar att LAION-400M effektivt sätter till och med dessa sena förbättringar tillbaka, genom att ‘i stor utsträckning ignorera’ de ovannämnda revideringarna i ImageNet-representationen i den nya utgåvan, och spårar en bredare trend i detta avseende*:
‘Detta framhävs i uppkomsten av större databaser som Tencent ML-bilder-databasen (i februari 2020) som omfattar de flesta av dessa icke-bildbara klasser, den fortsatta tillgängligheten av modeller som tränats på full-ImageNet-21k-databasen i repository som TF-hub, den fortsatta användningen av ofiltrerad-ImageNet-21k i de senaste SotA-modellerna (såsom Google’s senaste EfficientNetV2 och CoAtNet-modellerna) och de uttryckliga tillkännagivandena som tillåter användningen av ofiltrerad-ImageNet-21k-förträning i ansedda tävlingar såsom LVIS-utmaningen 2021.
‘Vi betonar denna avgörande iakttagelse: En grupp av ImageNet-kalibern som hanterar mindre än 15 miljoner bilder har kämpat och misslyckats i dessa avgiftsåtgärder hittills.
‘Omfattningen av de noggranna ansträngningar som krävs för att grundligt avgifta denna massiva multimodala databas och de nedströmsmodeller som tränats på denna databas, som omfattar potentiellt miljarder bild-textpar, kommer otvivelaktigt att vara astronomisk.’
* Min omvandling av författarens inline-citat till hyperlänkar.












