Andersons hoek

Zijn onder-curated hyperscale AI-datasets erger dan het internet zelf?

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onderzoekers uit Ierland, het Verenigd Koninkrijk en de Verenigde Staten hebben gewaarschuwd dat de groei van hyperscale AI-trainingsdatasets de slechtste aspecten van hun internetbronnen kan verspreiden, en beweren dat een onlangs vrijgegeven academische dataset ‘problematische en expliciete afbeeldingen en tekstparen van verkrachting, pornografie, kwaadaardige stereotypen, racistische en etnische scheldwoorden en andere extreem problematische inhoud’ bevat.

De onderzoekers geloven dat een nieuwe golf van massive onder-curated of incorrect gefilterde multimodale (bijvoorbeeld afbeeldingen en plaatjes) datasets mogelijk meer schade kunnen aanrichten door de effecten van dergelijke negatieve inhoud te versterken, aangezien de datasets beelden en andere inhoud bewaren die mogelijk van online platforms zijn verwijderd door gebruikersklachten, lokale moderatie of algoritmes.

Zij merken verder op dat het jaren kan duren – in het geval van de machtige ImageNet-dataset, een hele decade – voordat langdurige klachten over dataset-inhoud worden aangepakt, en dat deze latere revisies niet altijd worden weerspiegeld in nieuwe datasets die ervan zijn afgeleid.

Het artikel, getiteld Multimodale datasets: misogynie, pornografie en kwaadaardige stereotypen, komt van onderzoekers aan de University College Dublin & Lero, de University of Edinburgh, en de Chief Scientist bij het UnifyID-authenticatieplatform.

Hoewel het onderzoek zich richt op de recente vrijgave van de CLIP-gefilterde LAION-400M-dataset, beweren de auteurs dat de algemene trend van het gooien van steeds meer data naar machine learning-kaders zoals het neurale taalmodel GPT-3, en beweren dat de resultaatgerichte drive naar betere inferentie (en zelfs naar Artificial General Intelligence [AGI]), resulteert in het ad hoc gebruik van schadelijke datasources met nalatige copyrighttoezicht; het potentieel om schade te veroorzaken en te bevorderen; en de mogelijkheid om niet alleen illegale data te verspreiden die mogelijk uit de publieke domein zijn verdwenen, maar om dergelijke data’s morele modellen daadwerkelijk in downstream AI-implementaties op te nemen.

LAION-400M

Laatst maand werd de LAION-400M-dataset vrijgegeven, waarmee het aantal multi-modale, linguïstische datasets dat afhankelijk is van de Common Crawl-repository, toeneemt, die het internet ondiscrimineerd schraapt en de verantwoordelijkheid voor filtering en curatie doorschuift naar projecten die het gebruiken. De afgeleide dataset bevat 400 miljoen tekst/afbeelding-paren.

LAION-400M is een open source-variant van Google AI’s gesloten WIT (WebImageText) dataset die in maart 2021 werd vrijgegeven, en bevat tekst-afbeelding-paren, waarbij een afbeelding in de database is geassocieerd met bijbehorende expliciete of metadata-tekst (bijvoorbeeld de alt-tekst van een afbeelding in een webgalerij). Dit stelt gebruikers in staat om tekstgebaseerde afbeeldingopname uit te voeren, waardoor de associaties die de onderliggende AI heeft gevormd over deze domeinen (d.w.z. ‘dier’, ‘fiets’, ‘persoon’, ‘man’, ‘vrouw’), zichtbaar worden.

Deze relatie tussen afbeelding en tekst, en de cosinusgelijkheid die vooroordelen in queryresultaten kan embedden, vormen de kern van het artikel’s oproep tot verbeterde methodologieën, aangezien zeer eenvoudige queries naar de LAION-400M-database vooroordelen kunnen onthullen.

Als voorbeeld kan de afbeelding van de pionierende vrouwelijke astronaut Eileen Collins in de scitkit-afbeeldingenbibliotheek twee geassocieerde onderschriften in LAION-400M opleveren: ‘Dit is een portret van een astronaut met de Amerikaanse vlag’ en ‘Dit is een foto van een lachende huisvrouw in een oranje jumpsuit met de Amerikaanse vlag’.

Amerikaanse astronaut Eileen Collins krijgt twee heel verschillende kijkjes op haar prestaties als eerste vrouw in de ruimte onder LAION-400M. Bron: https://arxiv.org/pdf/2110.01963.pdf

Amerikaanse astronaut Eileen Collins krijgt twee heel verschillende kijkjes op haar prestaties als eerste vrouw in de ruimte onder LAION-400M. Bron: https://arxiv.org/pdf/2110.01963.pdf

De gerapporteerde cosinusgelijkheden die elke onderschrift waarschijnlijk maken, liggen zeer dicht bij elkaar, en de auteurs beweren dat dergelijke nabijheid AI-systemen die LAION-400M gebruiken, relatief waarschijnlijk zou maken om een van beide als een geschikt onderschrift te presenteren.

Pornografie komt weer boven

LAION-400M heeft een doorzoekbare interface beschikbaar gemaakt, waarbij het uitschakelen van de ‘veilig zoeken’-knop de omvang onthult waarmee pornografische beelden en tekstuele associaties labels en klassen domineren. Als voorbeeld zoeken naar ‘non’ (NSFW als u vervolgens de veilige modus uitschakelt) in de database levert resultaten op die voornamelijk gerelateerd zijn aan horror, cosplay en kostuums, met zeer weinig echte nonnen beschikbaar.

Als de veilige modus wordt uitgeschakeld, wordt een reeks pornografische afbeeldingen gerelateerd aan de term onthuld, die niet-pornografische afbeeldingen naar beneden duwt in de zoekresultatenpagina, waardoor de omvang wordt onthuld waarmee LAION-400M grotere gewicht heeft toegekend aan de pornografische afbeeldingen, omdat ze prevalent zijn voor de term ‘non’ in online bronnen.

De standaardactivering van de veilige modus is misleidend in de online zoekinterface, aangezien het een UI-kenmerk is, een filter dat niet noodzakelijkerwijs wordt geactiveerd in afgeleide AI-systemen, maar dat is gegeneraliseerd in de ‘non’-domein op een manier die niet zo gemakkelijk kan worden gefilterd of onderscheiden van de (relatief) SFW-resultaten in termen van algoritmisch gebruik.

Het artikel bevat vervaagde voorbeelden over verschillende zoektermen in de supplementaire materialen aan het einde. Deze kunnen hier niet worden weergegeven vanwege de taal in de tekst die de vervaagde foto’s begeleidt, maar de onderzoekers merken op dat het onderzoeken en vervaagen van de afbeeldingen een tol eiste van hen, en erkennen de uitdaging van het cureren van dergelijk materiaal voor menselijke toezicht op grote databases:

‘We (evenals onze collega’s die ons hielpen) hebben tijdens het proces van het onderzoeken van de dataset verschillende niveaus van ongemak, misselijkheid en hoofdpijn ervaren. Bovendien leidt dit soort werk tot aanzienlijke negatieve kritiek in de academische AI-sfeer bij publicatie, wat niet alleen een extra emotionele tol toevoegt aan de al zware taak van het bestuderen en analyseren van dergelijke datasets, maar ook soortgelijk toekomstig onderzoek ontmoedigt, tot grote schade voor het AI-veld en de samenleving in het algemeen.’

De onderzoekers beweren dat, hoewel human-in-the-loop-curatie duur is en persoonlijke kosten met zich meebrengt, de geautomatiseerde filtersystemen die zijn ontworpen om dergelijk materiaal te verwijderen of aan te pakken, duidelijk niet in staat zijn om de taak aan te pakken, aangezien NLP-systemen moeite hebben om aanstootgevend materiaal te isoleren of te discounteren dat de overhand kan hebben in een geschraapt dataset, en vervolgens als significant kan worden waargenomen vanwege de grote hoeveelheid.

Het verankeren van verboden inhoud en het strippen van copyrightbescherming

Het artikel beweert dat onder-curated datasets van deze aard ‘hoogstwaarschijnlijk’ de exploitatie van minderheden zullen verspreiden, en stelt de vraag of soortgelijke open source datapjecten het recht hebben, juridisch of moreel, om de verantwoordelijkheid voor het materiaal naar de eindgebruiker te verschuiven:

‘Individuen kunnen hun gegevens van een website verwijderen en aannemen dat ze voor altijd zijn verdwenen, terwijl ze nog steeds op de servers van verschillende onderzoekers en organisaties kunnen bestaan. Er is een vraag over wie verantwoordelijk is voor het verwijderen van die gegevens uit het dataset? Voor LAION-400M heeft de maker deze taak overgedragen aan de gebruiker van de dataset. Gezien dergelijke processen bewust complex worden gemaakt en de gemiddelde gebruiker niet over de technische kennis beschikt om zijn gegevens te verwijderen, is dit een redelijke aanpak?’

Zij beweren verder dat LAION-400M mogelijk niet geschikt is voor vrijgave onder zijn aangenomen Creative Common CC-BY 4.0-licentiemodel, ondanks de potentiële voordelen voor de democratisering van grote schaal datasets, die voorheen het exclusieve domein waren van goed gefinancierde bedrijven zoals Google en OpenAI.

Het LAION-400M-domein beweert dat de datasetafbeeldingen 'onder hun eigen copyright' vallen – een 'doorgeefmechanisme' dat grotendeels in gang is gezet door recente rechterlijke uitspraken en overheidsrichtlijnen die webscraping voor onderzoeksdoeleinden breed goedkeuren. Bron: https://rom1504.github.io/clip-retrieval/

Het LAION-400M-domein beweert dat de datasetafbeeldingen ‘onder hun eigen copyright’ vallen – een ‘doorgeefmechanisme’ dat grotendeels in gang is gezet door recente rechterlijke uitspraken en overheidsrichtlijnen die webscraping voor onderzoeksdoeleinden breed goedkeuren. Bron: https://rom1504.github.io/clip-retrieval/

De auteurs suggereren dat grass-roots (d.w.z. crowdsourced vrijwilligers) sommige van de datasetproblemen kunnen aanpakken, en dat onderzoekers verbeterde filters kunnen ontwikkelen.

‘Nonetheless, de rechten van de gegevensonderwerp blijven onbehandeld hier. Het is roekeloos en gevaarlijk om de schade die inherent is aan dergelijke grote schaal datasets te bagatelliseren en hun gebruik in industriële en commerciële omgevingen aan te moedigen. De verantwoordelijkheid van de licentiemethode onder welke de dataset wordt verstrekt, rust uitsluitend op de maker van de dataset’.

De problemen van het democratiseren van hyperschaalgegevens

Het artikel beweert dat visio-linguïstische datasets zoals LAION-400M voorheen niet beschikbaar waren buiten grote technologiebedrijven en het beperkte aantal onderzoeksinstellingen dat de middelen heeft om ze te verzamelen, te cureren en te verwerken. Zij prijzen de geest van de nieuwe vrijgave, maar bekritiseren de uitvoering.

De auteurs beweren dat de aanvaarde definitie van ‘democratisering’, zoals die van toepassing is op open source hyperschaal datasets, te beperkt is, en ‘faalt om rekening te houden met de rechten, het welzijn en de belangen van kwetsbare individuen en gemeenschappen, van wie velen waarschijnlijk het meest zullen lijden onder de neveneffecten van deze dataset en de modellen die hierop zijn getraind’.

Aangezien de ontwikkeling van GPT-3-schaal open source-modellen uiteindelijk is ontworpen om te worden verspreid naar miljoenen (en mogelijk miljarden) gebruikers wereldwijd, en aangezien onderzoeksprojecten datasets kunnen aannemen voordat ze worden bewerkt of zelfs verwijderd, waardoor de problemen die in de bewerkingen werden aangepakt, worden voortgezet, beweren de auteurs dat de zorgeloze vrijgave van onder-curated datasets niet een gewoonte moet worden in open source machine learning.

Het genie terug in de fles stoppen

Sommige datasets die lange tijd werden onderdrukt nadat hun inhoud mogelijk onlosmakelijk in langlopende AI-projecten was terechtgekomen, hebben inbegrepen de Duke MTMC (Multi-Target, Multi-Camera) dataset, die uiteindelijk werd ingetrokken vanwege herhaalde bezwaren van mensenrechtenorganisaties over het gebruik ervan door onderdrukkende autoriteiten in China; Microsoft Celeb (MS-Celeb-1M), een dataset van 10 miljoen ‘celebrity’-gezichten die bleek te hebben journalisten, activisten, beleidsmakers en schrijvers te omvatten, wiens blootstelling van biometrische gegevens in de vrijgave zwaar werd bekritiseerd; en de Tiny Images-dataset, ingetrokken in 2020 vanwege zelf-erkende ‘vooroordeel, aanstootgevende en vooroordelende afbeeldingen, en beledigende terminologie’.

Met betrekking tot datasets die zijn bewerkt in plaats van ingetrokken na kritiek, zijn voorbeelden onder andere de enorm populaire ImageNet-dataset, die, zoals de onderzoekers opmerken, tien jaar (2009-2019) nodig had om te reageren op herhaalde kritiek over privacy en niet-afbeeldbare klassen.

Het artikel stelt vast dat LAION-400M deze verbeteringen effectief tenietdoet door de eerdergenoemde revisies in ImageNet’s weergave in de nieuwe vrijgave ‘grotendeels te negeren’, en vermoedt een bredere trend in deze zin*:

‘Dit wordt onderstreept door de opkomst van grotere datasets zoals Tencent ML-afbeeldingen dataset (in februari 2020) die de meeste van deze niet-afbeeldbare klassen omvat, de voortdurende beschikbaarheid van modellen getraind op de volledige ImageNet-21k-dataset in repositories zoals TF-hub, de voortdurende gebruikt van de ongefilterde ImageNet-21k in de laatste SotA-modellen (zoals Google’s laatste EfficientNetV2 en CoAtNet-modellen) en de expliciete aankondigingen die het gebruik van ongefilterde ImageNet-21k-pretraining in reputabele contests zoals de LVIS-uitdaging 2021 toestaan.

‘We benadrukken deze cruciale observatie: Een team van de status van ImageNet dat worstelt met minder dan 15 miljoen afbeeldingen, heeft gestreden en gefaald in deze ontgiftigingspogingen tot nu toe.

‘De omvang van de zorgvuldige inspanningen die nodig zijn om deze massive multimodale dataset en de downstream-modellen die op deze dataset zijn getraind, te detoxificeren, en die mogelijk miljarden afbeelding/titel-paren omvatten, zal ongetwijfeld astronomisch zijn.’

 

* Mijn conversie van de inline citaten van de auteur naar hyperlinks.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai