Andersonin kulma

Onko vähän kuratoidut hyperskaalaiset tekoälykoulutusaineistot huonompia kuin internet itse?

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkijat Irlannista, Iso-Britanniasta ja Yhdysvalloista ovat varoittaneet, että hyperskaalaisen tekoälykoulutusaineistojen kasvu uhkaa levittää internetin huonoimmat puolet, ja väittävät, että äskettäin julkaistu akateeminen aineisto sisältää ‘häiritseviä ja eksplisiittisiä kuvia ja tekstin pareja raiskauksesta, pornografiaa, vahingollisia stereotypioita, rasistisia ja etnisiä herjauksia sekä muita erittäin ongelmallisia sisältöjä’.

Tutkijat uskovat, että uusi aalto massiivisia vähän kuratoiduista tai väärin suodatettuja multimodaalisista (esim. kuvia ja kuvia) aineistoista on väittäen, että ne ovat vahingollisempia kykynsä vahvistaa negatiivisen sisällön vaikutuksia, koska aineistot säilyttävät kuvia ja muuta sisältöä, joka on saattanut poistaa verkkoalustoilta käyttäjän valituksesta, paikallisen moderaation tai algoritmien kautta.

He huomaavat, että voi kestää vuosia – tapauksessa valtavan ImageNet-aineiston kymmenen vuotta – ennen kuin vanhat valitukset aineiston sisällöstä käsitellään, ja että nämä myöhemmät muutokset eivät aina heijastu uusissa aineistoissa, jotka perustuvat niihin.

Tutkimus, joka on nimeltään Multimodaaliset aineistot: misogyny, pornografia ja myrkylliset stereotypiat, tulee tutkijoilta University College Dublin & Lero, Edinburghin yliopistosta ja UnifyID-tunnistusjärjestelmän pääasiantuntijalta.

Vaikka työ keskittyy äskettäin julkaistuun CLIP-suodatettuun LAION-400M-aineistoon, kirjoittajat väittävät yleistä trendiä heittää yhä enemmän dataa tekoälykehyksiin, kuten neuronaaliseen kielen malliin GPT-3, ja väittävät, että tuloksia käsittelevä ajatus suuntautuu parempaan johtopäätökseen (ja jopa tekoälyyn [AGI]), jossa käytetään vahingollisia data-lähteitä, joissa on laiminlyöty tekijänoikeuden valvonta; mahdollisuus aiheuttaa ja edistää vahinkoa; ja kyky ei ainoastaan ylläpidä laitonta dataa, joka muuten olisi kadonnut julkisesta valvonnasta, vaan myös sisällyttää sellaisen datan moraaliset mallit alas tekoälysovelluksiin.

LAION-400M

Edellisessä kuussa julkaistiin LAION-400M-aineisto, joka lisää kasvavaan määrään monimutkaisia, kielellisiä aineistoja, jotka riippuvat Common Crawl-aineistosta, joka kerää internetiä valikoimatta ja siirtää vastuun suodattamisesta ja kuratoinnista projekteille, jotka käyttävät sitä. Johdettu aineisto sisältää 400 miljoonaa teksti/kuvaparia.

LAION-400M on avoimen lähdekoodin variantti Google AI:n suljetusta WIT (WebImageText) aineistosta, joka julkaistiin maaliskuussa 2021, ja sisältää teksti-kuvapareja, joissa kuvaa on liitetty saataviin tekstiin (esim. kuvan alt-teksti verkkogalleriassa). Tämä mahdollistaa käyttäjille suorittaa tekstipohjaisen kuvan hakua, paljastaen assosiaatiot, joita perustavanlaatuinen tekoäly on muodostanut näille alueille (esim. ‘eläin’, ‘pyörä’, ‘henkilö’, ‘mies’, ‘nainen’).

Tämä suhde kuvan ja tekstin välillä ja kosiniin kaltaisuus, joka voi upottaa harhan hakutuloksiin, ovat tutkimuksen keskuudessa, jossa vaaditaan parannettuja menetelmiä, koska hyvin yksinkertaiset kyselyt LAION-400M-tietokantaan voivat paljastaa harhan.

Esimerkiksi pioneerinen naisastronautti Eileen Collinsin kuva scitkit-kuvagalleriassa hakee kaksi liitettyä kuvatekstiä LAION-400M:ssä: ‘Tämä on astronautin muotokuva, jossa on Yhdysvaltain lippu’ ja ‘Tämä on valokuva hymyilevästä kotirouvaasta oranssissa jumpsuitissa Yhdysvaltain lipun kanssa’.

Amerikkalainen astronautti Eileen Collins saa kaksi erilaista tulkintaa saavutuksistaan LAION-400M:ssä. Lähde: https://arxiv.org/pdf/2110.01963.pdf

Amerikkalainen astronautti Eileen Collins saa kaksi erilaista tulkintaa saavutuksistaan LAION-400M:ssä. Lähde: https://arxiv.org/pdf/2110.01963.pdf

Raportoitu kosiniin kaltaisuus, joka tekee kummastakin kuvatekstistä todennäköisen, on hyvin lähellä toisiaan, ja kirjoittajat väittävät, että tekoälyjärjestelmät, jotka käyttävät LAION-400M:tä, ovat suhteellisen todennäköisiä esittämään kumpaakin kuvatekstiä sopivana kuvatekstinä.

Pornografia nousee jälleen huipulle

LAION-400M on tehnyt haun käyttöliittymän saataville, jossa ‘turvallisen haun’ napin poistaminen paljastaa sen, kuinka pornografiaa ja tekstiassosiaatioita hallitsee luokat ja luokat. Esimerkiksi haku ‘nun’ (NSFW, jos turvallinen tila poistetaan) tietokannasta palauttaa tuloksia pääasiassa kauhun, cosplayn ja pukujen kanssa, ja vain muutamia oikeita nunnia on saatavilla.

Turvallisen tilan poistaminen samasta hausta paljastaa joukon pornografiaa, joka liittyy termiin, joka työntää minkä tahansa ei-pornografisen kuvan alas hakutulossivulla, paljastaen sen, kuinka LAION-400M on antanut suuremman painoarvon pornografia-kuville, koska ne ovat yleisiä termejä ‘nun’ verkko-lähteissä.

Turvallisen tilan oletusarvoinen aktivaatio on harhaa verkko-haun liittymässä, koska se edustaa käyttöliittymän ominaisuutta, suodatinta, joka ei välttämättä ole aktiivinen johdannaisissa tekoälyjärjestelmissä, vaan joka on yleistetty ‘nun’-alueelle tavalla, joka ei ole helposti suodatettavissa tai erotteltavissa (suhteellisen) SFW-tuloksista algoritmisen käytön kannalta.

Tutkimuksessa on sumennettuja esimerkkejä eri hakutermeille liitteessä lopussa. Ne eivät voi olla esillä täällä johtuen kieltä, jota teksti, joka on liitetty sumennettuihin valokuviin, käyttää, mutta tutkijat huomaavat, kuinka tarkastellessaan ja sumennettaessa kuvia he (sekä heidän avustajansa) kokivat eriasteisia epämukavuutta, pahoinvointia ja päänsärkyä prosessin aikana.

‘Me (sekä kollegamme, jotka auttoivat meitä) kokivat eriasteisia epämukavuutta, pahoinvointia ja päänsärkyä prosessin aikana. Lisäksi tämänkaltaisen työn kohtaamiseen liittyy merkittävästi negatiivista kritiikkiä akateemisen tekoälypiirin keskuudessa julkaisun yhteydessä, mikä ei ainoastaan lisää jo valmiiksi raskasta tehtävää tutkia ja analysoida tällaisia aineistoja, vaan myös estää samanlaisia tulevia töitä, mikä on suuresti haitallista tekoälykentälle ja yhteiskunnalle yleensä.’

Tutkijat väittävät, että vaikka ihmisen osallistuminen kuratointiin on kallista ja siihen liittyy henkilökohtaisia kustannuksia, automaattiset suodatusjärjestelmät, jotka on suunniteltu poistamaan tai muuten käsittelemään tällaista materiaalia, eivät ole selvästi riittäviä tehtävään, koska NLP-järjestelmillä on vaikeuksia erottaa tai alentaa loukkaavaa materiaalia, joka voi hallita kerättyä aineistoa ja myöhemmin näkyä merkittävänä sen suuren määrän vuoksi.

Kieltävän sisällön vahvistaminen ja tekijänoikeuksien poistaminen

Tutkimuksessa väitetään, että tällaiset vähän kuratoidut aineistot ovat ‘erittäin todennäköisiä’ ylläpitämään vähemmistöhenkilöiden hyväksikäyttöä, ja tutkitaan, onko samanlaisilla avoimen lähdekoodin data-projekteilla oikeus, laillisesti tai moraalisesti, siirtää vastuu materiaalista loppukäyttäjälle:

‘Yksilöt voivat poistaa datansa verkkosivustolta ja olettaa, että se on poistettu lopullisesti, kun se voi edelleen olla useiden tutkijoiden ja organisaatioiden palvelimilla. On kysymys siitä, kuka on vastuussa poistamasta tietoa aineistosta? LAION-400M:n luojat ovat delegoineet tämän tehtävän aineiston käyttäjälle. Ottaen huomioon, että tällaiset prosessit on tarkoituksella tehty monimutkaisiksi ja että keskivertokäyttäjällä ei ole tarvittavaa teknistä tietämystä poistamaan tietojaan, onko tämä järkevä lähestymistapa?’

He väittävät myös, että LAION-400M saattaa olla sopimaton julkaisemiseen sen omaksuman Creative Common CC-BY 4.0 -lisenssimallin alla, vaikka siinä on potentiaalisia hyötyjä suurten aineistojen demokratisoimisessa, jotka aiemmin olivat vain hyvin rahoitettujen yritysten, kuten Google ja OpenAI, yksinoikeus.

LAION-400M-alue väittää, että aineiston kuvat 'ovat heidän oman tekijänoikeutensa alla' – 'välittämis-mekanismin', jota on pääasiassa mahdollistanut viimeaikaiset oikeuden päätökset ja hallituksen ohjeet, jotka hyväksyvät laajasti verkkokäyttöä tutkimustarkoituksiin. Lähde: https://rom1504.github.io/clip-retrieval/

LAION-400M-alue väittää, että aineiston kuvat ‘ovat heidän oman tekijänoikeutensa alla’ – ‘välittämis-mekanismin’, jota on pääasiassa mahdollistanut viimeaikaiset oikeuden päätökset ja hallituksen ohjeet, jotka hyväksyvät laajasti verkkokäyttöä tutkimustarkoituksiin. Lähde: https://rom1504.github.io/clip-retrieval/

Kirjoittajat ehdottavat, että vapaaehtoisvoimin (esim. joukkorahoitus) voidaan ratkaista joitakin aineiston ongelmia, ja tutkijat voivat kehittää parannettuja suodatusmenetelmiä.

‘Kuitenkin datan kohteen oikeudet ovat edelleen käsittelemättä. On hätiköidysti ja vaarallista aliarvioida vahinkoja, jotka sisältyvät tällaisiin suurten aineistojen käyttöön teollisissa ja kaupallisissa ympäristöissä. Vastuu lisenssisopimuksesta, jonka alla aineisto on tarjottu, kuuluu yksinomaan aineiston luojalle’.

Hyperskaalaisen datan demokratisoinnin ongelmat

Tutkimuksessa väitetään, että visio-lingvistiset aineistot, jotka ovat yhtä suuria kuin LAION-400M, olivat aiemmin saatavilla vain suurten teknologiayritysten ja rajoitettujen tutkimuslaitosten ulottuvilla, jotka pystyvät kokoamaan, kuratoimaan ja prosessoimaan ne. He ylistävät uuden julkaisun henkeä, mutta arvostelevat sen toteutusta.

Kirjoittajat väittävät, että hyväksytty määritelmä ‘demokratisoinnista’, joka koskee avoimen lähdekoodin hyperskaalaisia aineistoja, on liian rajoitettu, ja ‘ei ottaa huomioon haavoittuvien yksilöiden ja yhteisöjen oikeuksia, hyvinvointia ja etuja, joista monet ovat todennäköisesti kärsivät eniten tämän aineiston ja siihen perustuvien mallien alasvirran vaikutuksista’.

Koska GPT-3-asteisten avoimen lähdekoodin mallien kehittäminen on lopulta tarkoitettu levittämiseksi miljoonille (ja mahdollisesti miljardeille) käyttäjille ympäri maailmaa, ja koska tutkimushankkeet voivat omaksua aineistoja ennen kuin ne on muokattu tai poistettu, jolloin ne voivat ylläpitää ongelmia, jotka olivat tarkoitus korjata muokkauksissa, kirjoittajat väittävät, että huolimattomat julkaisut vähän kuratoiduista aineistoista eivät tulisi olemaan tavallinen piirre avoimessa tekoälyssä.

Genin palauttaminen pulloon

Joitakin aineistoja, jotka olivat tukahdutettu kauan sen jälkeen, kun niiden sisältö oli jo kulkeutunut mahdollisesti erottamattomasti pitkäaikaisiin tekoälyprojekteihin, ovat sisältäneet Duke MTMC (Multi-Target, Multi-Camera) -aineiston, joka lopulta poistettiin toistuvien huolenaiheiden vuoksi ihmisoikeusjärjestöiltä Kiinan hallituksen käytölle; Microsoft Celeb (MS-Celeb-1M), 10 miljoonan ‘julkkisten’ kasvojen aineiston, joka osoittautui sisältävän journalisteja, aktivisteja, virkamiehiä ja kirjailijoita, joiden altistuminen biometrisille tiedoille julkaisussa kritisoitiin voimakkaasti; ja Tiny Images -aineiston, joka poistettiin vuonna 2020 omien ‘harhaisuuksien, loukkaavien ja ennakkoluuloisten kuvien sekä halventavien termejä’ vuoksi.

LAION-400M asettaa nämä hitaat parannukset takaisin, ‘pääasiassa ohittamalla’ mainitut ImageNetin uudelleenmuokkaukset uudessa julkaisussa, ja epäilee laajempaa trendiä tässä suhteessa*:

‘Tämä ilmenee suurempien aineistojen, kuten Tencent ML-kuvat (helmikuussa 2020), jotka kattavat useimmat nämä ei-kuvaamattomat luokat, jatkuvan saatavuuden malleja, jotka on koulutettu täydellisellä ImageNet-21k-aineistolla, repositoriot, kuten TF-hub, ja jatkuvan käytön suodattamattomasta ImageNet-21k:sta viimeisimmissä SotA-malleissa (kuten Google’n viimeisimmässä EfficientNetV2- ja CoAtNet-mallissa) ja eksplisiittiset ilmoitukset, jotka sallivat suodattamattoman ImageNet-21k:n esikoulutuksen arvostetuissa kilpailuissa, kuten LVIS-haaste 2021.

‘Korostamme tätä kriittistä havaintoa: ImageNet-tiimin kaltaisen tiimin, jolla on vain vähän yli 15 miljoonaa kuvaa, on kamppaillut ja epäonnistunut näissä puhdistusyrityksissä tähän asti.

‘Huolellisten ponnistelujen laajuus, joka vaaditaan tämän massiivisen multimodaalisen aineiston ja alasvirran mallejen perusteelliseen puhdistamiseen, jotka on koulutettu tästä aineistosta, joka kattaa mahdollisesti miljardeja kuvatekstipareja, on kiistämättä astronauttinen.’

 

* Minun muutos kirjoittajan sisäisistä viittauksista hyperlinkkeihin.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai