Ajatusjohtajat
Miten Bias Tappaa Sinun AI/ML -strategian ja Mitä Voit Sen Etäiseksi Tehdä
’Bias’ malleissa kuvailee tilannetta, jossa malli vastaa epätarkasti syötteisiin tai syöteaineistoon, koska se ei ole koulutettu riittävän laadukkaalla ja monipuolisella aineistolla. Yksi esimerkki on Apple:n kasvojentunnistusominaisuus, joka epäonnistui merkittävästi useammin ihmisillä, joilla on tummempi ihonväri verrattuna vaaleampiin sävyihin. Malli ei ollut koulutettu tarpeeksi tummaihoisten ihmisten kuvilla. Tämä oli suhteellisen matalan riskin esimerkki bias:sta, mutta se on juuri siksi, miksi EU:n tekoälylain on asettanut vaatimukset mallin tehokkuuden ja hallinnan osoittamiseksi ennen markkinoille menoa. Malleilla, joiden tulokset vaikuttavat liiketoimintaan, talouteen, terveyteen tai henkilökohtaisiin tilanteisiin, on oltava luotettavia, tai niitä ei käytetä.
Bias:n Torjunta Datan Avulla
Laajat Määrät Laadukasta Dataa
Monien tärkeiden datan hallintakäytäntöjen joukossa yksi avainkomponentti bias:n voittamiseksi ja minimoinniksi AI/ML-malleissa on hankkia laajoja määriä laadukasta, monipuolista dataa. Tämä vaatii useiden organisaatioiden yhteistyötä, joilla on tällaista dataa. Perinteisesti datahankinta ja yhteistyö ovat kohtanneet haasteita yksityisyyden ja/tai IP-suojelun vuoksi – herkkä dataa ei voida lähettää mallin omistajalle, ja mallin omistaja ei voi vaarantaa IP-omaisuutensa vuotamista dataomistajalle. Yleinen ratkaisu on työskennellä mock- tai syntetisoidun datan kanssa, joka voi olla hyödyllistä, mutta jolla on myös rajoituksia verrattuna oikean, täydellisen kontekstin datan käyttöön. Tässä kohtaa tietosuojan parantavat teknologiat (PET) tarjoavat tarvittavat vastaukset.
Syntetinen Data: Lähellä, Mutta Ei Ihan
Syntetinen data on keinotekoisesti luotu jäljitelläkseen oikeaa dataa. Tämä on vaikeaa, mutta se on hieman helpompaa tehdä AI-työkalujen avulla. Hyvälaatuinen syntetinen data pitäisi olla samanlainen kuin oikea data, tai se ei ole hyödyllistä. Laadukas syntetinen data voidaan käyttää tehokkaasti lisäämään koulutusdatan monipuolisuutta täyttämällä aukkoja pienemmille, syrjityille väestöille tai väestöille, joilla AI-palveluntarjoaja ei ole tarpeeksi dataa. Syntetinen data voidaan myös käyttää ratkaisemaan reunatapauksia, jotka voivat olla vaikeita löytää riittävissä määrin oikeassa maailmassa. Lisäksi organisaatiot voivat luoda syntetisen datan tyyppisen aineiston tyydyttääkseen dataresidenssi- ja yksityisyysvaatimukset, jotka estävät pääsyn oikeaan dataan. Tämä kuulostaa hyvältä, mutta syntetinen data on vain yksi palanen puzzlesta, eikä se ole ratkaisu.
Yksi syntetisen datan ilmeisimmistä rajoituksista on irtautuminen oikeasta maailmasta. Esimerkiksi itsestään ajavat autot, jotka on koulutettu ainoastaan syntetisellä datalla, kamppailevat oikeiden, odottamattomien tieliikenneolosuhteiden kanssa. Lisäksi syntetinen data perii bias:in oikeasta maailman datasta, jota käytetään sen luomiseen – mikä käytännössä mitätöi tämän keskustelun tarkoituksen. Johtopäätöksenä syntetinen data on hyödyllinen vaihtoehto hienosäätöön ja reunatapausten ratkaisemiseen, mutta merkittävät parannukset mallin tehokkuudessa ja bias:n minimoinnissa edellyttävät edelleen pääsyä oikeaan maailman dataan.
Paras Tapaa: Oikea Data PET:ien Käytön Kautta
PET:t suojaavat dataa sen käytön aikana. Kun on kyse AI/ML-malleista, ne voivat myös suojata mallin IP:tä – “kaksi lintua yhdellä kivellä”. Ratkaisut, jotka hyödyntävät PET:iä, tarjoavat mahdollisuuden kouluttaa malleja oikeilla, herkillä aineistoilla, joita ei aiemmin ollut saatavilla data-yksityisyyden ja turvallisuuden vuoksi. Tämä oikean datan aineistojen avaaminen on paras vaihtoehto bias:n vähentämiseksi. Mutta miten se tosiasiallisesti toimisi?
Toistaiseksi johtavat vaihtoehdot alkavat luottamuksellisesta laskentaympäristöstä. Sitten on integroitu PET:iin perustuva ohjelmistoratkaisu, joka tekee sen valmiiksi käytettäväksi “out of the box” -tavalta ja ratkaisee datahallinnan ja turvallisuuden vaatimukset, jotka eivät sisälly standardiin luotetun suoritusympäristöön (TEE). Tässä ratkaisussa mallit ja data salataan ennen lähettämistä turvalliseen laskentaympäristöön. Ympäristö voidaan isännöidä missä tahansa, mikä on tärkeää tietyissä data-lokalisaatiovaatimuksissa. Tämä tarkoittaa, että sekä mallin IP että syötteen datan turvallisuus säilytetään laskennan aikana – edes luotetun suoritusympäristön tarjoaja ei pääse käsiksi malleihin tai dataan sen sisällä. Salatut tulokset lähetetään takaisin tarkasteltavaksi ja lokit ovat saatavilla tarkasteltavaksi.
Tämä virta avaa parhaimman laadun datan, riippumatta siitä, missä se on tai kuka sen omistaa, ja luo polun bias:n minimointiin ja luotettavien mallien kehittämiseen, joissa voidaan luottaa. Tämä virta on myös se, mitä EU:n tekoälylain säännökset kuvaavat AI-sääntelyhiekkalaatikossa.
Etisen ja Lainmukaisen Noudattamisen Helpottaminen
Hyvänlaatuisen, oikean datan hankkiminen on vaikeaa. Data-yksityisyyden ja lokalisaatiovaatimukset rajoittavat heti saatavilla olevat aineistot, joilla organisaatiot voivat toimia. Innovoinnin ja kasvun edistämiseksi data on saatava niiden käyttöön, jotka voivat hyödyntää sitä.
EU:n tekoälylain 54 §:ssä on vaatimukset “korkean riskin” mallityypeille siitä, mitä on osoitettava ennen kuin ne voidaan viedä markkinoille. Lyhyesti sanottuna tiimien on käytettävä oikean maailman dataa AI-sääntelyhiekkalaatikossa osoittaakseen riittävän mallin tehokkuuden ja noudattamisen kaikkia sääntelyssä lueteltuja valvontaa, läpinäkyvyyttä, selitettävyyttä, data-turvalisuutta, data-suojaa, data-minimointia ja mallin suojaa – ajattele DevSecOps + Data Ops.
Ensimmäinen haaste on löytää oikean maailman aineisto, jota voidaan käyttää – kyseessä on luonnostaan herkkä data tällaisille mallityypeille. Ilman teknisiä takeita monet organisaatiot saattavat epäröidä luottaa mallin tarjoajalle datansa tai eivät saa tehdä sitä. Lisäksi tapa, jolla laki määrittelee “AI-sääntelyhiekkalaatikon”, on itsessään haaste. Jotkut vaatimukset sisältävät takuun, että data poistetaan järjestelmästä mallin suorittamisen jälkeen sekä hallintovalvontaa, valvontaa ja raportointia sen osoittamiseksi.
Monet organisaatiot ovat kokeilleet valmiita data-tiloja (DCR) ja luotettuja suoritusympäristöjä (TEE). Mutta yksinään nämä teknologiat vaativat merkittävää asiantuntemusta ja työtä voidakseen toimia ja täyttääkseen data- ja AI-sääntelyvaatimukset. DCR:t ovat helpompia käyttää, mutta eivät vielä ole hyödyllisiä monipuolisemmille AI/ML-tarpeille. TEE:t ovat turvallisia palvelimia ja tarvitsevat edelleen integroidun yhteistyöalustan, jotta ne voisivat toimia nopeasti. Tämä kuitenkin osoittaa mahdollisuuden PET:iin perustuvien teknologioiden integroimiseksi TEE:ihin poistamaan työn, jolloin AI-sääntelyhiekkalaatikon asettaminen ja herkkien datojen hankkiminen ja käyttäminen olisivat helppoa.
Mahdollistamalla monipuolisempien ja kattavampien aineistojen käytön yksityisyyttä suojelevalla tavalla nämä teknologiat auttavat varmistamaan, että tekoäly- ja koneälykäytännöt noudattavat eettisiä standardeja ja lakeja, jotka liittyvät data-yksityisyyteen (esim. GDPR ja EU:n tekoälylaki Euroopassa). Yhteenvetona vaatimukset kohtaavat usein kuuluvia murahduksia ja huokauksia, mutta nämä vaatimukset ohjaavat meitä kehittämään parempia malleja, joissa voidaan luottaa ja joita voidaan käyttää tärkeisiin data-pohjaisiin päätöksiin, samalla suojellen datan subjektien yksityisyyttä, joita käytetään mallien kehittämiseen ja mukauttamiseen Euroopassa.












