AI-mallit ja alustat

Tekoälyssä olevat datamonokulttuurit: Uhkat monimuotoisuudelle ja innovaatiolle

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Teckoäly muuttaa maailmaa, muuttaen terveydenhuoltoa ja uudelleenmuokkaen koulutusta. Se ratkaisee vanhoja haasteita ja tarjoaa mahdollisuuksia, joita emme olleet aiemmin ajatelleet mahdollisiksi. Data on tämän vallankumouksen keskipisteenä – se on polttoaine, joka mahdollistaa tekoälyjärjestelmien tekemän ennustamisen, mallinnuksen ja ratkaisujen toimittamisen, jotka vaikuttavat arkeemme.

mutta tämän datan runsauden ohella yhdenmukaisen datan – usein datamonokulttuuriksi kutsutun – ylivalta aiheuttaa merkittäviä riskejä tekoälykehityksen monimuotoisuudelle ja luovuudelle. Tämä on samanlaista kuin maatalousmonokulttuuri, jossa yhden kasvilajin viljely laajoilla peltoalueilla tekee ekosysteemin haavoittuvaksi tuholaisille ja taudeille. Tekoälyssä yhdenmukaisen datan käyttäminen luo järeitä, puolueellisia ja usein epäluotettavia malleja.

Tämä artikkeli tutkii datamonokulttuurien käsitettä, tarkastelee mitä ne ovat, miksi ne ovat olemassa, mitä riskejä ne tuovat ja mitä toimia voimme tehdä tekoälyjärjestelmien kehittämiseksi, jotka ovat älykkäämpiä, reilumpia ja monipuolisempia.

Ymmärtäminen datamonokulttuureista

Datamonokulttuuri ilmenee, kun yksittäinen tietokanta tai kapea joukko tietolähteitä hallitsee tekoälyjärjestelmien koulutusta. Kasvojen tunnistaminen on hyvin dokumentoitu esimerkki datamonokulttuurista tekoälyssä. Tutkimukset MIT Media Labista osoittivat, että mallit, jotka oli koulutettu pääasiassa valkoihoisten yksilöiden kuvilla, kamppailivat tummaihoisten kasvojen kanssa. Virheiden määrä tummaihoisille naisille oli 34,7 %, verrattuna vain 0,8 %:iin valkoihoisille miehille. Nämä tulokset korostavat koulutusdatan monimuotoisuuden puutteen vaikutusta.

Samankaltaisia ongelmia ilmenee muissakin aloissa. Esimerkiksi suuret kielimallit (LLM) kuten OpenAI:n GPT ja Google Bard on koulutettu tietokannoissa, jotka perustuvat pääasiassa englanninkieliseen sisältöön, joka on peräisin länsimaisista yhteyksistä. Tämä monimuotoisuuden puute tekee niistä vähemmän tarkkoja kielien ja kulttuurien nyanssien ymmärtämisessä muista maailman osista. Maat kuten Intia kehittelevät LLM:ejä, jotka heijastelevat paremmin paikallisia kieliä ja kulttuurisia arvoja.

Tämä ongelma voi olla kriittinen, erityisesti terveydenhuollossa. Esimerkiksi lääketieteellinen diagnostiikkatyökalu, joka on koulutettu pääasiassa Euroopan väestöjen tiedoilla, saattaa toimia huonosti alueilla, joilla on erilaiset geneettiset ja ympäristötekijät.

Missä datamonokulttuurit tulevat

Datamonokulttuurit tekoälyssä johtuvat useista syistä. Suositut tietokannat kuten ImageNet ja COCO ovat laajoja, helposti saatavilla ja laajasti käytettyjä. Ne heijastelevat usein kapeaa, länsimaista näkökulmaa. Monipuolisen datan kerääminen ei ole halpaa, joten monet pienemmät organisaatiot riippuvat näistä olemassa olevista tietokannoista. Tämä riippuvuus vahvistaa monimuotoisuuden puutetta.

Standardisointi on myös tärkeä tekijä. Tutkijat usein käyttävät laajasti tunnettuja tietokantoja vertaamaan tuloksiaan, jolloin he vahingossa kannustavat vaihtoehtoisten lähteiden tutkimista. Tämä trendi luo palautekehän, jossa kaikki optimoivat samoja mittareita sen sijaan, että ratkaisisivat todellisia maailman ongelmia.

Joskus nämä ongelmat johtuvat yksinkertaisesti puutteesta. Tietokantojen luojat saattavat vahingossa jättää tietyn ryhmän, kielen tai alueen huomioimatta. Esimerkiksi varhaiset versiot älypuhelimien älyavustajista eivät käsittäneet länsimaisia aksenteja hyvin. Syy oli, että kehittäjät eivät olleet sisällyttäneet riittävästi tietoa näistä alueista. Nämä puutteet luovat työkaluja, jotka eivät täytä globaalin yleisön tarpeita.

Miksi se on tärkeää

Kun tekoäly ottaa merkittävämmän roolin päätöksenteossa, datamonokulttuurit voivat johtaa todellisiin maailmanlaajuisiin seurauksiin. Tekoälymallit voivat vahvistaa syrjintää, kun ne periytyvät koulutusdatansa puolueellisuudesta. Hiring-algoritmi, joka on koulutettu tietojen avulla, jotka ovat peräisin miesvaltaisista aloista, saattaa vahingossa suosia miesehdokkaita ja sulkea pois pätevät naiset harkinnasta.

Kulttuurinen edustus on toinen haaste. Suosittelujärjestelmät kuten Netflix (NFLX ) ja Spotify ovat usein suosineet länsimaisia mieltymyksiä ja syrjineet sisältöä muista kulttuureista. Tämä syrjintä rajoittaa käyttäjäkokemusta ja hillitsee innovaatiota pitämällä ideat kapeina ja toistuvina.

Teckoälyjärjestelmät voivat myös tulla haurastumaan, kun ne on koulutettu rajoitetulla datalla. COVID-19-pandemian aikana lääketieteelliset mallit, jotka oli koulutettu ennen pandemiaa, epäonnistuivat sopeutumaan maailmanlaajuiseen terveydenhuollon kriisiin. Tämä järeys voi tehdä tekoälyjärjestelmistä vähemmän hyödyllisiä, kun ne kohtaavat odottamattomia tilanteita.

Datamonokulttuuri voi johtaa myös eettisiin ja oikeudellisiin ongelmiin. Yritykset kuten Twitter ja Apple (AAPL ) ovat kohdanneet julkisen kritiikin puolueellisten algoritmien vuoksi. Twitterin kuvanleikkaustyökalu oli syytetty rotuhyökkäyksestä, kun taas Apple Cardin luottoluokitusalgoritmi väitettiin tarjoavan naisille alempia luottorajoja. Nämä kiistat vahingoittavat luottamusta tuotteisiin ja herättävät kysymyksiä tekoälykehityksen vastuusta.

Miten datamonokulttuureja voidaan korjata

Datamonokulttuuriongelmien ratkaiseminen edellyttää tekoälyjärjestelmien koulutusdatan monipuolisuuden laajentamista. Tämä tehtävä vaatii työkalujen ja teknologioiden kehittämistä, jotka tekevät datan keräämisen monipuolisista lähteistä helpommaksi. Esimerkiksi Mozilla Common Voice -projekti kerää ääninäytteitä maailmanlaajuisesti, luoden rikkaamman tietokannan, jossa on eri aksenteja ja kieliä – samoin aloitteita kuten UNESCO:n Data for AI, joka keskittyy edustamattomiin yhteisöihin.

Eettisten ohjeiden vahvistaminen on myös tärkeä askel. Rakenteet kuten Toronto Declaration edistävät avoimuutta ja monimuotoisuutta, varmistaen, että tekoälyjärjestelmät ovat reiluja suunnittelun perusteella. Vahvat tietohallintopolitiikat, jotka ovat saaneet vaikutteita GDPR -säädöksistä, voivat myös tehdä suuren eron. Ne edellyttävät selvää dokumentaatiota tietolähteistä ja pitävät organisaatioita vastuussa monimuotoisuuden varmistamisesta.

Avoin lähdekoodi -alustat voivat myös tehdä eroa. Esimerkiksi hugging Face -tietokanta sallii tutkijoille pääsyn ja jakamisen monipuolista dataa. Tämä yhteistyömalli edistää tekoälyekosysteemiä, vähentäen riippuvuutta kapeista tietokannoista. Avoimuus myös on tärkeässä roolissa. Selitettävien tekoälyjärjestelmien käyttäminen ja säännöllisten tarkastusten toteuttaminen voi auttaa tunnistamaan ja korjaamaan puolueellisuutta. Tämä selitys on tärkeää, jotta mallit ovat sekä reiluja että sopeutuvia.

Monipuolisten tiimien rakentaminen saattaa olla vaikuttavin ja suorin askel. Monipuoliset tiimit ovat parempia havainnoimaan sokeita pisteitä datassa ja suunnittelemassa järjestelmiä, jotka toimivat laajemmalle käyttäjäryhmälle. Monipuoliset tiimit johtavat parempiin tuloksiin, tehdessään tekoälystä älykkäämpää ja reilumpaa.

Lopputulos

Teckoälyllä on uskomaton potentiaali, mutta sen tehokkuus riippuu sen datan laadusta. Datamonokulttuurit rajoittavat tätä potentiaalia, tuottaen puolueellisia, järeitä järjestelmiä, jotka ovat irrotettuja todellisista tarpeista. Näiden haasteiden voittamiseksi kehittäjien, hallitusten ja yhteisöjen on tehtävä yhteistyötä monipuolistamaan tietokantoja, toteuttamaan eettisiä käytäntöjä ja edistämään monipuolisia tiimejä.
Kohdistamalla nämä ongelmat suoraan voimme luoda älykkäämpää ja oikeudenmukaisempaa tekoälyä, joka heijastelee maailman monimuotoisuutta, jonka se pyrkii palvelemaan.

Tohtori Tehseen Zia on COMSATS University Islamabadin apulaisprofessori, joka on suorittanut AI-tutkinnon Wienin Teknillisen yliopiston, Itävallassa. Erityisalanaan ovat Tekoäly, Konenäkö, Data Science ja Machine Learning, ja hän on tehnyt merkittäviä töitä julkaisemalla artikkeleita arvostetuissa tieteellisissä lehdissä. Tohtori Tehseen on myös johtanut useita teollisuusprojekteja pää tutkijana ja toiminut AI-konsulttina.