Haastattelut
Nora Petrova, koneoppimisen insinööri ja tekoälykonsultti Prolificilla – Haastattelusarja

Nora Petrova on koneoppimisen insinööri ja tekoälykonsultti Prolificilla. Prolific perustettiin vuonna 2014, ja sen asiakkaat ovat jo muun muassa Google (GOOGL ), Stanfordin yliopisto, Oxfordin yliopisto, Lontoon King’s College ja Euroopan komissio, jotka käyttävät Prolificin osallistujaverkostoa uusien tuotteiden testaamiseen, tekoälyjärjestelmien kouluttamiseen silmänseuranta-alalla ja määrittämiseen, ovatko heidän ihmisten kanssa vuorovaikuttavat tekoälysovelluksensa toimivat niin kuin niiden luojat ovat tarkoittaneet.
Voitko kertoa taustastasi Prolificilla ja urastasi tähän asti? Mitä sai sinut kiinnostumaan tekoälystä?
Roolini Prolificilla on jaettu tekoälyn käyttötapauksien ja mahdollisuuksien neuvonantajana sekä enemmän käytännön koneoppimisen insinöörinä. Aloittelin urani ohjelmistokehityksessä ja olen vähitellen siirtynyt koneoppimiseen. Olen viettänyt suurimman osan viimeksi kuluneista viidestä vuodesta keskittyneenä NLP-käyttötapauksiin ja ongelmiin.
Se, mikä aluksi sai minut kiinnostumaan tekoälystä, oli mahdollisuus oppia datan avulla ja linkki siihen, miten ihmiset oppivat ja miten aivot ovat rakennettu. Uskon, että koneoppiminen ja neurotiede voivat täydentää toisiaan ja auttaa ymmärtämään, miten voidaan rakentaa tekoälyjärjestelmiä, jotka pystyvät navigoimaan maailmassa, osoittamaan luovuutta ja tuottamaan arvoa yhteiskunnalle.
Mitä ovat joitakin suurimmista tekoälyharhaisuusongelmista, joista olet henkilökohtaisesti tietoinen?
Harhat ovat luonnollinen osa dataa, jota syötetään tekoälymalliin, ja niiden täydellinen poistaminen on erittäin vaikeaa. On kuitenkin olennaista, että olemme tietoisia dataan sisältyvistä harhoista ja etsimme keinoja vähentää haitallisia harhoja ennen kuin luotamme malleja tärkeisiin tehtäviin yhteiskunnassa. Suurimmat ongelmat, joita kohtaamme, ovat mallit, jotka ylläpitävät haitallisia stereotypioita, järjestelmällisiä ennakkoluuloja ja epäkohtia yhteiskunnassa. On oltava tietoisia siitä, miten nämä tekoälymallit tullaan käyttämään ja millaista vaikutusta ne tulevat käyttäjilleen, ja varmistamaan, että ne ovat turvallisia ennen kuin hyväksymme niitä herkkien käyttötapauksien luokse.
Joitakin merkittäviä alueita, joilla tekoälymallit ovat osoittaneet haitallisia harhoja, ovat syrjintä aliedustetuista ryhmistä koulujen ja yliopistojen pääsykokeissa ja sukupuolistereotyyppien kielteinen vaikutus naisten palkkaamiseen. Tämän lisäksi rikosvankiloiden algoritmi osoittautui merkinnän “korkea riski” mustille syytetyille lähes kaksinkertaisella tahdilla kuin valkoisille syytetyille Yhdysvalloissa, kun taas kasvontunnistusteknologia kärsii edelleen korkeista virheistä vähemmistöille edustavan koulutusdatan puutteen vuoksi.
Yllä mainittujen esimerkkien kattama alue on vain pieni osa tekoälymallien osoittamista harhoista, ja voidaan ennakoida suurempia ongelmia tulevaisuudessa, jos emme keskity harhaisuuden vähentämiseen nyt. On tärkeää muistaa, että tekoälymallit oppivat datasta, joka sisältää nämä harhat ihmisten päätöksenteon vaikutuksesta, jota ohjaavat tarkkailematon ja tiedostamaton ennakkoluulo. Monissa tapauksissa ihmisen päätöksentekijän sijaisuus ei poista harhaisuutta. Varsinainen harhaisuuden vähentäminen edellyttää ymmärtämistä siitä, miten harhat ovat läsnä käytetyssä datasta, erottamista tekijöistä, jotka johtavat harhaan perustuvia ennusteita, ja yhteistä päätöksentekoa siitä, mitä perusteita tärkeiden päätösten tekemiseen halutaan perustaa. Kehittämällä joukon standardeja, joiden avulla voidaan arvioida mallien turvallisuus ennen niiden käyttöä herkillä käyttötapauksilla, voidaan edetä eteenpäin.
Tekoälyhallusinaatiot ovat suuri ongelma kaikenlaiselle generatiiviselle tekoälylle. Voitko keskustella siitä, miten ihmisten osallistuminen (HITL) koulutuksessa pystyy lieventämään näitä ongelmia?
Tekoälymallien hallusinaatiot ovat ongelmallisia erityisesti generatiivisen tekoälyn tietyissä käyttötapauksissa, mutta on tärkeää huomata, että ne eivät ole ongelma itsessään. Tietyissä luovissa generatiivisen tekoälyn sovelluksissa hallusinaatiot ovat tervetulleita ja vaikuttavat luovan ja mielenkiintoisen vastauksen syntymiseen.
Ne voivat olla ongelmallisia käyttötapauksissa, joissa faktatiedon luotettavuus on korkea. Esimerkiksi terveydenhuollossa, jossa vankka päätöksenteko on avainasemassa, on tarpeen antaa terveydenhuollon ammattilaisille luotettavaa tietoa.
Ihmisten osallistuminen tarkoittaa järjestelmiä, jotka sallivat ihmisille antaa suoran palautteen mallille ennusteista, jotka ovat tietyn luottamusrajatason alapuolella. Hallusinaatioiden yhteydessä ihmisten osallistuminen voidaan käyttää opettamaan malleja siitä, minkä tasoisella varmuudella ne tulisi toimia eri käyttötapauksissa ennen vastauksen antamista. Nämä kynnykset vaihtelevat käyttötapauksen mukaan, ja opettaminen malleille eroista vaadittavassa tarkkuudessa eri käyttötapauksissa on tärkeä askel hallusinaatioiden ongelmallisten muotojen vähentämiseksi. Esimerkiksi oikeudellisissa käyttötapauksissa ihmiset voivat opettaa tekoälymalleja siitä, että faktantarkistus on vaadittu askel, kun vastataan kysymyksiin, jotka perustuvat monimutkaisiin oikeudellisiin asiakirjoihin, joissa on useita pykäliä ja ehtoja.
Miten tekoälytyöntekijät, kuten datamerkitsejät, auttavat vähentämään potentiaalisia harhaisuusongelmia?
Tekoälytyöntekijät voivat ensisijaisesti auttaa tunnistamalla datasta löytyvät harhat. Kun harha on tunnistettu, on helpompaa keksiä strategioita harhaisuuden vähentämiseksi. Datamerkitsejät voivat myös auttaa keksimään keinoja harhaisuuden vähentämiseksi. Esimerkiksi NLP-tehtävissä he voivat auttaa tarjoamalla vaihtoehtoisia tapoja muotoilla ongelmallisia tekstinpätkiä siten, että kielestä löytyvä harha vähenee. Lisäksi AI-työntekijöiden moninaisuus voi auttaa vähentämään ongelmia harhaisuuden kanssa merkitsemisessä.
Miten varmistat, etteivät tekoälytyöntekijät ole tahattomasti syöttämässä omia ihmisten harhaisuuksiaan tekoälyjärjestelmään?
Se on varmasti monimutkainen ongelma, joka vaatii huolellista harkintaa. Ihmisten harhaisuuksien poistaminen on lähes mahdotonta, ja tekoälytyöntekijät voivat tahattomasti syöttää omia harhaisuuksiaan tekoälymalliin, joten on avainasemassa kehittää prosesseja, jotka ohjaavat työntekijöitä parhaisiin käytäntöihin.
Joitakin askelia, joita voidaan ottaa ihmisten harhaisuuksien minimointiin, ovat:
- Kattava koulutus tekoälytyöntekijöille tietoisista harhaisuuksista ja työkalujen tarjoaminen heille, joiden avulla he voivat tunnistaa ja hallita omia harhaisuuksiaan merkitsemisen aikana.
- Tarkistuslistat, jotka muistuttavat tekoälytyöntekijöitä tarkistamaan omat vastauksensa ennen niiden lähettämistä.
- Arviointi, joka tarkistaa, millä tasolla tekoälytyöntekijät ymmärtävät, missä heidän on valittava vähiten harhaan perustuva vastaus, kun heille esitetään esimerkkejä vastauksista eri harhaisuustyypeissä.
Miten sääntelijät ympäri maailmaa aikovat säännellä tekoälyn tulostetta, mitä heidän mielestäsi sääntelijät eivät ymmärrä, ja mitä he ymmärtävät oikein?
On tärkeää aloittaa sanomalla, että tämä on erittäin vaikea ongelma, johon kukaan ei ole löytänyt ratkaisua. Yhteiskunta ja tekoäly kehittyvät ja vaikuttavat toisiinsa tapoja, joita on erittäin vaikea ennakoida. Tehokkaan strategian kehittäminen vakaista ja hyödyllisistä sääntelystä edellyttää huomioimista siitä, mitä tekoälyssä tapahtuu, miten ihmiset vastaavat siihen ja mitkä vaikutukset sillä on eri aloilla.
Uskon, että merkittävä este tekoälyn tehokkaalle sääntelylle on puute ymmärryksestä siitä, mitä tekoälymallit voivat ja eivät voi tehdä, ja miten ne toimivat. Tämä tekee vaikeaksi ennustaa, mitkä seuraukset näillä malleilla tulevat eri aloilla ja yhteiskunnan eri osissa. Toinen puute on johtajuus siinä, miten tekoälymallit voidaan kohdistaa ihmisten arvoihin ja mitä turvallisuus tarkoittaa käytännössä.
Sääntelijät ovat etsineet yhteistyötä tekoälyalan asiantuntijoiden kanssa, ovat olleet varovaisia jotta eivät tukahduta innovaatioita liian tiukkojen sääntöjen avulla, ja ovat alkaneet pohtia tekoälyn vaikutuksia työpaikkojen siirtymiseen, jotka ovat kaikki tärkeitä keskustelun aiheita. On tärkeää olla varovainen ja kehittää ajatuksia tekoälyn sääntelystä ajan myötä ja osallistaa mahdollisimman monia ihmisiä lähestymistapaan, joka on demokraattinen.
Miten Prolificin ratkaisut voivat auttaa yrityksiä vähentämään tekoälyn harhaisuutta ja muita käsiteltyjä ongelmia?
Tekoälyprojektien datan kerääminen ei aina ole ollut tarkoituksenmukaista tai harkittua prosessia. Olemme aiemmin nähneet skrapingin, offshore-työn ja muita menetelmiä, jotka ovat olleet yleisiä. Tekoälyn kouluttamisessa on kuitenkin ratkaisevaa, että se perustuu tietoisesti kerättyyn, laadukkaaseen dataan, joka on peräisin oikeista ihmisistä, joilla on suora yhteys. Tässä kohtaa Prolific tekee merkittävän vaikutuksen.
Muiden alojen, kuten mielipidemittauksen, markkinatutkimuksen tai tieteellisen tutkimuksen, on opittu tämä jo kauan sitten. Otos, josta näyte otetaan, vaikuttaa suuresti tuloksiin, joita saadaan. Tekoäly on vasta nyt pääsemässä samaan vaiheeseen.
Nyt on aika aloittaa huolehtiminen paremmista näytteistä ja työskenteleminen edustavampien ryhmien kanssa tekoälyn koulutuksessa ja hienosäätössä. Molemmat ovat kriittisiä turvallisten, harhaisuudettomien ja kohdennettujen mallien kehittämisessä.
Prolific voi auttaa tarjoamalla oikeat työkalut yrityksille suorittaa tekoälykokeita turvallisella tavalla ja kerätä dataa osallistujilta, joilla harhaisuus on tarkistettu ja lievennetty prosessin aikana. Voimme auttaa antamalla ohjeita parhaista käytännöistä datan keräämisessä, valinnassa, korvauksessa ja reilassa kohtelussa osallistujia.
Mitä mieltä olet tekoälyn avoimuudesta, pitäisikö käyttäjien pystyä näkemään, mille dataan tekoälyalgoritmi on koulutettu?
Uskon, että on etuja ja haittoja avoimuudelle, ja hyvää tasapainoa ei ole vielä löydetty. Yritykset salassapitävät tietoa siitä, mille dataalle heidän tekoälymallinsa on koulutettu, peläten oikeudellisia seuraamuksia. Toiset ovat pyrkineet tekemään tekoälymallinsa julkisesti saataville ja julkaisseet kaiken tiedon siitä, mille dataalle he ovat kouluttaneet. Täydellinen avoimuus avaa monia mahdollisuuksia hyödyntää mallien haavoittuvuuksia. Täydellinen salassapito ei auta luottamuksen rakentamisessa ja yhteiskunnan osallistamisessa turvallisen tekoälyn kehittämiseen. Hyvä välimuoto tarjoaisi riittävän avoimuuden luottamuksen herättämiseksi siinä, että tekoälymallit on koulutettu laadukkaaseen, asiaankuuluvaan dataan, johon olemme antaneet suostumuksen. On tärkeää seurata, miten tekoäly vaikuttaa eri aloille ja aloittaa avoimet keskustelut vaikuttuneiden osapuolten kanssa ja kehittää käytäntöjä, jotka toimivat kaikille.
Uskon myös, että on tärkeää ottaa huomioon, mitä käyttäjät pitävät tyytyväisenä selitettävyyden suhteen. Jos he haluavat ymmärtää, miksi malli tuottaa tietyn vastauksen, antaminen heille raakadataa, jolla malli on koulutettu, tuskin auttaa heitä vastaamaan kysymykseen. Rakentaminen hyvistä selitettävyyden ja tulkiteltavuuden työkaluista on tärkeää.
Tekoälyn kohdistaminen pyrkii ohjaamaan tekoälyjärjestelmiä kohti ihmisten tarkoituksia, preferenssejä tai eettisiä periaatteita. Voitko keskustella siitä, miten tekoälytyöntekijät koulutetaan ja miten tämä varmistetaan olevan kohdennettu parhaalla tavalla?
Tämä on aktiivinen tutkimusalue, ja siellä ei vielä ole yksimielisyyttä siitä, mitkä strategiat tulisi käyttää tekoälymallien kohdistamiseen ihmisten arvoihin tai mihin arvoihin niitä tulisi kohdistaa.
Tekoälytyöntekijöiltä pyydetään edustamaan autenttisesti heidän preferenssejään ja vastaamaan kysymyksiin heidän preferenssejään koskien totuudenmukaisesti noudattaen periaatteita turvallisuudesta, puolueettomuudesta, vaarattomuudesta ja hyödyllisyydestä.
Kohdistamisen osalta tavoitteiden, eettisten periaatteiden tai arvojen suhteen on useita lupaavia lähestymistapoja. Yksi merkittävä esimerkki on Meaning Alignment Instituten työ Demokraattisessa hienosäätössä. On olemassa erinomainen julkaisu, joka esittelee idean täällä.
Kiitos haastattelusta ja jaetusta näkemyksestä tekoälyn harhaisuudesta, lukijoille, jotka haluavat oppia lisää, suosittelemme vierailemaan Prolificilla.












