Andersons vinkel
Er Under-Curated Hyperskala AI-Datasett Verre Enn Internettet Selv?

Forskere fra Irland, Storbritannia og USA har advart om at veksten i hyperskala AI-treningssammendrag truer med å spre de verste aspektene av deres internettkilder, og hevder at en nylig utgitt akademisk datasett inneholder ‘problematisk og eksplisitt bilder og tekstpar av voldtekt, pornografi, skadelige stereotyper, rasistiske og etniske fornærmelser, og andre ekstremt problematiske innhold’.
Forskerne mener at en ny bølge av massive under-kurerte eller feilfiltrerte multimodale (for eksempel bilder og bilder) datasett er argumenterbart mer skadelig i deres evne til å forsterke effektene av slike negative innhold, siden datasettene beholder bilder og annet innhold som kan ha blitt fjernet fra nettbaserte plattformer gjennom brukerklager, lokal moderering eller algoritmer.
De observerer videre at det kan ta år – i tilfelle det mektige ImageNet-datasettet, en hel decade – for langvarige klager om datasettinnhold til å bli behandlet, og at disse senere revisjonene ikke alltid reflekteres, selv i nye datasett avledet fra dem.
Arbeidet, med tittel Multimodale datasett: misogyni, pornografi og skadelige stereotyper, kommer fra forskere ved University College Dublin & Lero, University of Edinburgh, og sjefsforskeren ved UnifyID-autentiseringsplattformen.
Selv om arbeidet fokuserer på den nylige utgivelsen av CLIP-filtrert LAION-400M-datasett, argumenterer forfatterne mot den generelle trenden med å kaste stadig mer data på maskinlæringsrammeverk som det neurale språkmodellen GPT-3, og hevder at resultatorientert drive mot bedre inferens (og selv mot kunstig generell intelligens [AGI]), resulterer i det ad hoc-bruk av skadelig datakilder med forsømmelig opphavsrettstilsyn; potensialet for å fremme og spre skade; og evnen til ikke bare å videreformidle ulovlig data som ellers ville ha forsvunnet fra offentligheten, men å faktisk inkorporere slike datas moralske modeller i nedstrøms AI-implementeringer.
LAION-400M
Forrige måned ble LAION-400M-datasett utgitt, og bidrar til den voksende mengden multimodale, lingvistiske datasett som avhenger av Common Crawl-repository, som skraper internettet uten å diskriminere og overfører ansvaret for filtrering og kurering til prosjekter som bruker det. Det avledede datasett inneholder 400 millioner tekst/bilde-par.
LAION-400M er en åpen kilde-variant av Google AI’s lukkede WIT (WebImageText) datasett utgitt i mars 2021, og inneholder tekst/bilde-par, hvor et bilde i databasen har blitt assosiert med tilhørende eksplisitt eller metadata-tekst (for eksempel alt-teksten til et bilde i en web-galleri). Dette muliggjør brukerne å utføre tekstbasert bildehenting, og avslører assosiasjonene som den underliggende AI har dannet om disse domenene (dvs. ‘dyr’, ‘sykkel’, ‘person’, ‘mann’, ‘kvinne’).
Forholdet mellom bilde og tekst, og den kosinus-lignende som kan inkorporere fordommer i søkeresultater, er i hjertet av arbeidets appel for bedre metoder, siden svært enkle søk i LAION-400M-databasen kan avsløre fordommer.
For eksempel henter bildet av pionerende kvinnelige astronaut Eileen Collins i scitkit-bildebiblioteket to assosierte undertekster i LAION-400M: ‘Dette er et portrett av en astronaut med det amerikanske flagget’ og ‘Dette er et fotografi av en smilende husmor i en oransje drakt med det amerikanske flagget’.

Amerikansk astronaut Eileen Collins får to svært forskjellige tolkninger av hennes prestasjoner som første kvinne i rommet under LAION-400M. Kilde: https://arxiv.org/pdf/2110.01963.pdf
De rapporterte kosinus-lignende som gjør at hver undertekst er sannsynlig å være anvendelig, er svært nær hverandre, og forfatterne hevder at slike nærhet ville gjøre AI-systemer som bruker LAION-400M relativt sannsynlig å presentere begge som en passende undertekst.
Pornografi Stiger Til Toppen Igjen
LAION-400M har lagt ut en søkbar grensesnitt tilgjengelig, hvor avhuking av ‘sikker søk’-knappen avslører omfanget av pornografiske bilder og tekstlige assosiasjoner som dominerer etiketter og klasser. For eksempel søke etter ‘nonne’ (ikke-søkbar hvis du deretter deaktiverer sikker modus) i databasen returnerer resultater hovedsakelig relatert til skrekk, cosplay og kostymer, med svært få faktiske nonner tilgjengelige.
Avhuking av Sikker modus på samme søk avslører en rekke pornografiske bilder relatert til begrepet, som skyver alle ikke-pornografiske bilder ned søke-resultatsiden, og avslører omfanget av hvilken vekt LAION-400M har tildelt pornobildene, fordi de er utbredt for begrepet ‘nonne’ i nettbaserte kilder.
Standardaktivering av Sikker modus i nettbasert søkegrensesnitt er bedragersk, siden det representerer en UI-uviktighet, en filter som ikke nødvendigvis vil være aktivert i avledede AI-systemer, men som har blitt generalisert til ‘nonne’-domenet på en måte som ikke så lett kan filtreres eller skilles fra (relativt) SFW-resultater i forhold til algoritmebruk.
Arbeidet inneholder uskarpe eksempler over ulike søkebegreper i supplementære materialer i slutten. De kan ikke presenteres her, på grunn av språket i tekstene som akkompagnerer de uskarpe bildene, men forfatterne bemerker den belastning som undersøkelsen og uskarpningen av bildene tok på dem, og anerkjenner utfordringen med å kurere slike materialer for menneskelig tilsyn av store datasett:
‘Vi (sammen med våre kolleger som hjalp oss) opplevde varierende grad av ubehag, kvalme og hodepine under prosessen med å undersøke datasett. I tillegg tok denne type arbeid uforholdsmessig mye negativ kritikk over hele den akademiske AI-sfæren ved utgivelse, hvilket ikke bare legger til en ekstra emosjonell belastning til den allerede tunge oppgaven med å studere og analysere slike datasett, men også avskrekker lignende fremtidig arbeid, til stor skade for AI-feltet og samfunnet generelt.’
Forfatterne hevder at mens menneske-i-løkken-kurering er dyrt og har tilknyttede personlige kostnader, er de automatiske filter-systemene designet for å fjerne eller på annen måte håndtere slike materialer, tydeligvis ikke tilstrekkelige til oppgaven, siden NLP-systemer har vanskeligheter med å isolere eller diskontere fornærmelige materialer som kan dominere et skrapet datasett, og deretter kan bli oppfattet som betydelig på grunn av ren volum.
Innskriver Forbudt Innhold Og Fjerner Opphavsrettsbeskyttelse
Arbeidet argumenterer for at under-kurerte datasett av denne typen er ‘svært sannsynlig’ til å videreformidle utnyttelsen av minoritetspersoner, og drøfter om lignende åpne kilde-data-prosjekter har retten, både juridisk og moralsk, til å overføre ansvar for materialet til sluttbrukeren:
‘Enkeltpersoner kan slette sine data fra en nettside og anta at det er borte for alltid, mens det kan fortsatt eksistere på servere hos flere forskere og organisasjoner. Det er et spørsmål om hvem som er ansvarlig for å fjerne denne data fra bruk i datasett? For LAION-400M har skaperne delegert denne oppgaven til datasett-brukeren. Gitt at slike prosesser er bevisst gjort komplekse og at gjennomsnittsbrukeren mangler den tekniske kunnskapen til å fjerne sine data, er dette en rimelig tilnærming?’
De hevder videre at LAION-400M kanskje ikke er egnet for utgivelse under den valgte Creative Common CC-BY 4.0-lisensmodellen, til tross for de potensielle fordeler for demokratiseringen av store datasett, tidligere det eksklusive domenet til godt finansierte selskaper som Google og OpenAI.

LAION-400M-domenet hevder at datasett-bildene ‘er under deres egen opphavsrett’ – en ‘pass-through’-mekanisme som i stor grad er muliggjort av domstolsavgjørelser og regjeringsretningslinjer fra de siste årene som generelt godkjenner web-skraping for forskningsformål. Kilde: https://rom1504.github.io/clip-retrieval/
Forfatterne foreslår at grass-roots (dvs. crowdsourced frivillige) kunne adresse noen av datasett-problemene, og at forskere kunne utvikle forbedrede filterteknikker.
‘Likevel forblir rettighetene til data-objektet uhendret her. Det er uansvarlig og farlig å underdrive de skadene som er innebygget i slike store datasett og oppmuntre deres bruk i industrielle og kommersielle sammenhenger. Ansvar for lisensordningen under hvilken datasett er gitt, faller utelukkende på datasett-skaperen’.
Problemene Med Å Demokratisere Hyperskala Data
Arbeidet argumenterer for at visio-lingvistiske datasett så store som LAION-400M tidligere var utilgjengelige utenfor store teknologiselskaper, og det begrensede antall forskningsinstitusjoner som har ressursene til å samle inn, kurere og prosessere dem. De hilser ånden i den nye utgivelsen velkommen, mens de kritiserer dens utførelse.
Forfatterne hevder at den aksepterte definisjonen av ‘demokratisering’, som det gjelder åpne kilde-hyperskala-datasett, er for begrenset, og ‘mangler å ta hensyn til rettighetene, velferden og interessene til sårbare enkeltpersoner og samfunn, mange av hvem sannsynligvis vil lide verst av de nedstrøms-virkningene av dette datasett og modellene som er trent på det’.
Ettersom utviklingen av GPT-3-skala åpne kilde-modeller ultimate er designet for å bli distribuert til millioner (og ved proxy, muligens milliarder) av brukere verden over, og ettersom forskningsprosjekter kan adoptere datasett før de blir redigert eller fjernet, og dermed videreformidle de problemer som var designet til å bli adressert i modifiseringene, argumenterer forfatterne for at uomsorgsfulle utgivelser av under-kurerte datasett ikke bør bli en vanlig del av åpne kilde-maskinlæring.
Å Sette Genien Tilbake I Flaska
Noen datasett som ble undertrykt lenge etter at innholdet hadde gått gjennom, kanskje udelelig, i lange AI-prosjekter, har inkludert Duke MTMC (Multi-Target, Multi-Camera) datasett, som til slutt ble trukket tilbake på grunn av gentatte bekymringer fra menneskerettighetsorganisasjoner rundt dets bruk av undertrykkende myndigheter i Kina; Microsoft Celeb (MS-Celeb-1M), et datasett på 10 millioner ‘celebrity’-ansiktsbilder som viste seg å inkludere journalister, aktivister, politikere og forfattere, hvis eksponering av biometriske data i utgivelsen ble kraftig kritisert; og Tiny Images-datasett, trukket tilbake i 2020 på grunn av selv-innkjedde ‘fordommer, fornærmelige og skadelige bilder, og nedlatende terminologi’.
Med hensyn til datasett som ble endret i stedet for å bli trukket tilbake etter kritikk, inkluderer eksempler det svært populære ImageNet-datasett, som, ifølge forfatterne, tok ti år (2009-2019) å handle på gjentakende kritikk rundt personvern og ikke-bilde-klasse.
Arbeidet observerer at LAION-400M effektivt setter disse forbedringene tilbake, ved ‘i stor grad å ignorere’ de ovennevnte revisjonene i ImageNet-representasjonen i den nye utgivelsen, og spår en videre trend i denne sammenhengen*:
‘Dette kommer til syne i fremveksten av større datasett som Tencent ML-bilder-datasett (i februar 2020) som omfatter de fleste av disse ikke-bilde-klasse, den fortsatte tilgjengeligheten av modeller trent på full-ImageNet-21k-datasett i repository som TF-hub, den fortsatte bruken av ufiltrert-ImageNet-21k i de siste SotA-modellene (som Googles siste EfficientNetV2 og CoAtNet-modellene) og de eksplisitte annonseringene som tillater bruken av ufiltrert-ImageNet-21k forhånds-trening i anerkjente konkurranser som LVIS-utfordringen 2021.
‘Vi understreker denne kritiske observasjonen: Et team av ImageNet-omfang som håndterer mindre enn 15 millioner bilder, har kjempet og mislyktes i disse desinfeksjonsforsøkene så langt.
‘Omfanget av omsorgsfulle innsats som kreves for å grundig desinfisere dette massive multimodale datasett og nedstrøms-modellene som er trent på dette datasett, som omfatter potensielt milliarder av bilde-tekst-par, vil være ubestridelig astronomisk.’
* Min konvertering av forfatterens inline-citater til lenker.












