Tankeledere

Når AI’s ‘kunnskap’ er 50 år gammel: Den kompliance-risikoen du ikke kan ignorere

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Problemstillingen med feil AI-insikt er en akutt utfordring når bedrifter øker bruken av generative verktøy. Til tross for bred entusiasme rundt AI-adoptsjon, finnes det også en sterk strøm av kritikk. Kritiske kommentatorer peker ofte på åpenbart tilfeldige, uforutsigbare uakkurater i AI-utdata, som undergraver verdien – og kan til og med true menneskers sikkerhet, særlig i sektorer som helse og transport, der feil utdata kan teoretisk sett føre til alt fra feil medisin til tog på kollisjonskurs.

Ofte er disse uakkuratene blitt tillagt AI- ‘hallusinasjoner‘ – tilfeller der AI genererer et ‘beste gjett’ svar, formidlet med samme tillit som et ‘ekte’ svar, i stedet for å informere brukeren om en lukketighet i kunnskap eller evne. Hallusinasjoner kan være vanskelige å oppdage på første blikk – men det finnes en merkelig, like alvorlig problem som er enda vanskeligere å oppdage.

Datakvalitets-gjeld: AI’s akilleshæl

Når AI-systemer trekker fra foreldede, ufullstendige eller uakkurate data, skjer feil utdata, men er mindre umiddelbart merkbare. For eksempel kan du spørre en AI om å identifisere symptomene på en medisinsk tilstand og motta et svar basert på en 50 år gammel artikkel i stedet for nåværende forskning. Resultatet er lite sannsynlig å være åpenbart, latterlig feil – men den innledende skinn av plausibilitet utgjør en reell risiko for både pasienten i spørsmål og helseleverandøren.

Dette gjelder også på tvers av industrier – hvis dataene som mates til AI-modellen inkluderer gamle, foreldede eller delvis informasjon, er det en høy risiko for feil utdata. Og når flere bedrifter integrerer AI i forretningskritiske prosesser, øker risikoen for å trekke feil konklusjoner fra dårlig styrt data.

Nøyaktighet for regulator

Dette er ikke bare et problem for dag-til-dag-operasjoner – det er også en betydelig kompliance-utfordring. Reguleringskrav utvikler seg raskt for å møte bekymringer om uakkurate AI. For eksempel har en rekke tidlige reguleringsaksjoner på AI funnet sted; merkbart da Italia midlertidig forbudt ChatGPT over personvernsbekymringer, og EU’s datatilsynsombud lanserte en dedikert arbeidsgruppe for å koordinere potensielle tvangsmidler aksjoner mot ChatGPT.

En av de mest talende reguleringsendringene har vært vedtaket av EU’s AI-akt, verdens første omfattende lovmessige ramme for AI. Akten fastsetter forpliktelser basert på risikonivået for AI-systemer, fra ‘uakseptabelt risiko’-systemer, som er forbudt, til ‘høyrisiko’-systemer, som møter strenge krav om åpenhet, datakvalitet, styring og menneskelig tilsyn.

Betydningen av EU’s AI-akt ligger ikke i dens ambisiøse omfang, men viktigere i den precedens det setter. Regulatorer gjør det klart at AI vil være underlagt bindende, tvangsmessige regler og at organisasjoner må behandle kompliance og åpenhet rundt hvor og hvordan AI brukes som en integrert del av AI-adoptsjon, i stedet for en ettertanke.

Akten har et bredt omfang, med potensialet til å påvirke en stor del av AI-utviklingen. I dens kjerneligger det å gjøre AI trygt samtidig som det respekterer grunnleggende rettigheter og verdier. Innenfor dette nye prinsipielle økosystemet kommer diagnosen av potensielle kilder for AI-uakkurater, inkludert data og datasamlinger som mates til modellene, modell-uavdekking og tilgang, og systemdesign og bruk. AI-løsninger er en konstruksjon av alle tre – problemer med noen av disse kan ha en negativ utgang. Ikke bare det, men dataene som går inn i design, modellutvikling, distribusjon og drift av AI er sannsynligvis hovedsakelig sammensatt av forretningsrekorder som selv er underlagt ulike kompliance-krav.

På andre måter er det reguleringsmiljøet rundt AI i ferd med å bli mer strengt – og det er like sant for datainndata som for datautdata, selv om sistnevnte får mer oppmerksomhet.

Fem skritt for å mate AI med kompatible, nåværende, relevante data

For å løse denne doble utfordringen – å sikre både kompatibel datahåndtering og høykvalitetsinndata som muliggjør høykvalitetsutdata – trenger bedrifter kontroll over trening- og inferensdata. Dessverre er dette noe mange bedrifter fortsatt mangler.

I det minste burde organisasjonene anvende sine bredere kompliance- og styringsprogrammer på AI-initiativer. De må begynne med å fange og vedlikeholde passende rekorder på dataene de mater AI-modellene, hvordan modellene og systemene er designet, samt beslutninger og innhold generert via AI.

Men det er også blitt kritisk viktig for organisasjonene å gå et skritt videre og sikre at de har full kontroll over alle data som kan muligens brukes i AI-distribusjoner, enten for initial trening eller ‘live’-arbeid. Dette krever en høykvalitets datahåndtering- og lagringsstrategi, som sikrer at alle relevante data samles inn intelligent, renses, lagres, klassifiseres og berettiges. For å oppnå dette, må organisasjonene vurdere fire nøkkelsteg:

1. Data-avstamning og proveniens

Dette inkluderer å vedlikeholde en rekord av datakildens kilde, opphav, eierskap og eventuelle endringer i metadata (hvis tillatt) gjennom hele livssyklusen. Det innebærer også å vedlikeholde rik metadata og alle underliggende dokumenter eller artefakter som det er avledet fra.

2. Data-autentisitet

Dette krever å vedlikeholde en tydelig kjede av besittelse for alle data, lagre objekter i deres native former og hash objekter mottatt for å demonstrere at data forblir uendret. I tillegg må organisasjonene vedlikeholde en fullt audit-historikk for hvert objekt, og for alle handlinger og hendelser i forhold til eventuelle endringer.

3. Data-klassifisering

Å etablere naturen til en samling eller type data er viktig. Organisasjoner må kunne styre strukturert data, semi-strukturert data og strukturerte datasamlinger. Å gi hver klasse en unik skjema kan tillate organisasjonene å håndtere diverse datasamlinger uten en en-size-fits-all fast ontologi – unngå å manipulere dataene unødvendig for å tvinge dem inn i en inflexibel datastruktur.

4. Data-normalisering

Å etablere felles definisjoner og formater for metadata er viktig for bruk i analyser og AI-løsninger. Tydelig definerte skjema er et viktig element, sammen med verktøy som kan transformere eller kartlegge data for å vedlikeholde konsistente, normaliserte visninger av relatert data.

5. Data-berettigelse

Bedrifter trenger granulerte berettigelseskontroller, inkludert på objekt- eller felt-nivå, basert på bruker- eller systemprofiler. Dette innebærer at riktig data er tilgjengelig for brukere og systemer som er berettiget til å aksessere det, mens det begrenser eller begrenser aksess til de som ikke er det.

Med disse avgjørende elementene på plass, vil bedrifter være best plassert til å sikre at dataene som mates til AI-modellene er både høykvalitets- og kompatible. AI vil drive forbedringer og effektivitetsøkninger på tvers av industrier – men for at det skal skje, er en solid data-grunnlag essensiell.

George Tziahanas er VP of Compliance og Associate General Counsel i Archive360. George er en eksekutiv leder med en dyp forståelse av kompleks teknologi, bankreguleringer, datastyring og risikostyring. Og, arbeider tett med nåværende og potensielle kunder for å sikre at komplekse datastyrings- og retningslinjer er møtt, i tråd med Archive360-løsninger.