Tankeledere

AI sin datadilemma: Personvern, reguleringer og fremtiden for etisk AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

AI-drevne løsninger blir raskt adoptert over diverse industrier, tjenester og produkter hver dag. Men deres effektivitet avhenger fullstendig av kvaliteten på dataene de er trent på – et aspekt som ofte misforstås eller oversees i datasett-oppbygningsprosessen.

Som data beskyttelsesmyndigheter øker skarpe øyne på hvordan AI-teknologier harmonerer med personvern og dataprotokoller, står selskaper overfor økende press for å innhente, annotere og finpusse datasett på en samsvarlig og etisk måte.

Er det virkelig en etisk tilnærming til å bygge AI-datasett? Hva er selskapenes største etiske utfordringer, og hvordan håndterer de dem? Og hvordan påvirker de utviklende lovrammene tilgjengeligheten og bruken av treningsdata? La oss utforske disse spørsmålene.

Personvern og AI

Av sin natur krever AI mye personlige data for å utføre oppgaver. Dette har ført til bekymringer om innhenting, lagring og bruk av denne informasjonen. Mange lover rundt om i verden regulerer og begrenser bruken av personlige data, fra GDPR og den nylig innførte AI-loven i Europa til HIPAA i USA, som regulerer tilgang til pasientdata i medisinske industrien.

Referanse for hvor strenge dataprotokoller er rundt om i verden / DLA Piper

For eksempel har fjorten amerikanske stater i dag omfattende lover om personvern, med seks flere som skal tre i kraft i 2025 og tidlig i 2026. Den nye administrasjonen har signalisert en endring i sin tilnærming til personvern gjennomføring på føderalt nivå. En viktig fokus er AI-regulering, med vekt på å fremme innovasjon fremfor å pålegge begrensninger. Denne endringen inkluderer å oppheve tidligere direktiver om AI og innføre nye direktiver for å guide utvikling og anvendelse.

Dataprotokoll-lover utvikles i ulike land: i Europa er lovene strengere, mens i Asia eller Afrika er de mindre strenge.

Personlig identifiserbar informasjon (PII) — som ansiktsbilder, offisielle dokumenter som pass, eller andre sensitive personlige data — er generelt begrenset i de fleste land til en viss grad. Ifølge FN Handel og Utvikling er innhenting, bruk og deling av personlige opplysninger til tredjeparter uten varsel eller samtykke fra forbrukerne en stor bekymring for de fleste land. 137 av 194 land har lover som sikrer dataprotokoll og personvern. Som følge tar de fleste globale selskaper omfattende forholdsregler for å unngå å bruke PII til modelltrening, ettersom lover som de i EU strengt forbudt slike praksiser, med sjeldne unntak i tungt regulerte nischer som lovhåndheving.

Over tid blir dataprotokoll-lover mer omfattende og globalt gjennomført. Selskaper tilpasser sine praksiser for å unngå juridiske utfordringer og møte nye juridiske og etiske krav.

Hvordan får selskaper tak i data?

Når vi studerer dataprotokoll-problemer for modelltrening, er det essensielt å forstå hvor selskaper henter disse dataene fra. Det finnes tre hovedkilder for data.

  • Datainnsamling

Denne metoden muliggjør innhenting av data fra crowdsourcing-plattformer, mediestokk og åpne datasett.

Det er viktig å merke seg at offentlige mediestokk er underlagt ulike lisensavtaler. Selv en kommersiell lisens kan ofte uttrykkelig angi at innhold ikke kan brukes til modelltrening. Disse forventningene varierer plattform for plattform og krever at bedrifter bekrefter sin evne til å bruke innhold på måter de trenger.

Selv når AI-selskaper innhenter innhold lovlig, kan de likevel møte noen problemer. Den raske utviklingen av AI-modelltrening har langt forbiått de juridiske rammer, noe som betyr at reglene og reguleringene rundt AI-treningsdata fortsatt utvikles. Som følge må selskaper holde seg informert om juridiske utviklinger og nøye gjennomgå lisensavtaler før de bruker mediestokk til AI-trening.

  • Dataopprettelse

En av de tryggeste datasett-forberedelsesmetodene innebærer å opprette unikt innhold, som å filme mennesker i kontrollerte miljøer som studioer eller utendørslokasjoner. Før de deltar, signerer personene en samtykkeerklæring for å bruke deres PII, som spesifiserer hva data som samles inn, hvordan og hvor det vil bli brukt, og hvem som vil ha tilgang til det. Dette sikrer full juridisk beskyttelse og gir selskaper tillit til at de ikke vil møte krav om ulovlig databruk.

Hovedutfordringen med denne metoden er kostnaden, spesielt når data opprettes for spesifikke tilfeller eller store prosjekter. Likevel er store selskaper og bedrifter i økende grad i ferd med å bruke denne tilnærmingen av to grunner. Først sikrer den full samsvar med alle standarder og juridiske reguleringer. Andre gir den selskaper data som er fullstendig tilpasset deres spesifikke scenarioer og behov, og garanterer dermed den høyeste nøyaktigheten i modelltrening.

  • Syntetisk data-generering

Bruk av programvareverktøy til å opprette bilder, tekst eller videoer basert på et gitt scenario. Likevel har syntetisk data begrensninger: det genereres basert på forhåndsdefinerte parametre og mangler den naturlige variasjonen i virkelige data.

Denne mangelen kan negativt påvirke AI-modeller. Selv om det ikke er relevant for alle tilfeller og ikke alltid skjer, er det likevel viktig å huske på “modellkollaps” — et punkt der overdriven avhengighet av syntetisk data forårsaker at modellen degraderer, noe som fører til dårlige utdata.

Syntetisk data kan likevel være svært effektivt for grunnleggende oppgaver, som å gjenkjenne generelle mønster, identifisere objekter eller skille fundamentale visuelle elementer som ansikter.

Likevel er det ikke det beste valget når et selskap trenger å trene en modell fra scratch eller håndtere sjeldne eller svært spesifikke scenarioer.

De mest avslørende situasjonene oppstår i innkabinerte miljøer, som en sjåfør som er distraherende av et barn, noen som ser trøtt ut bak rattet, eller til og med eksempler på uansvarlig kjøring. Disse datapunktene er ikke vanlig tilgjengelige i offentlige datasett — og bør ikke være det — ettersom de involverer virkelige personer i private omgivelser. Ettersom AI-modeller avhenger av treningsdata for å generere syntetiske utdata, sliter de med å representere scenarioer de aldri har møtt nøyaktig.

Når syntetisk data svikter, blir opprettet data — samlet inn gjennom kontrollerte miljøer med virkelige skuespillere — løsningen.

Data-løsningstilbydere som Keymakr plasserer kameraer i biler, hyrer skuespillere og recorder handlinger som å ta vare på et barn, drikke fra en flaske eller vise tegn på trøtthet. Skuespillerne signerer kontrakter som uttrykkelig samtykker til å bruke deres data til AI-trening, noe som sikrer samsvar med personvernlover.

Ansvar i datasett-oppbygningsprosessen

Hver deltaker i prosessen, fra klienten til annoterings-selskapet, har spesifikke ansvar som er oppført i deres avtale. Første skritt er å etablere en kontrakt, som detaljerer naturen til forholdet, inkludert klausuler om ikke-avsløring og intellektuell eiendom.

La oss vurdere den første muligheten for å arbeide med data, nemlig når det opprettes fra scratch. Intellektuell eiendomsrett sier at alle data leverandøren oppretter tilhører oppdragsgiver-selskapet, noe betyr at det opprettes på deres vegne. Dette betyr også at leverandøren må sikre at dataene er innhentet lovlig og korrekt.

Som en data-løsningsselskap sikrer Keymakr data-samsvar ved å først sjekke jurisdiksjonen hvor dataene opprettes, innhente korrekt samtykke fra alle involverte personer og garantere at dataene kan brukes lovlig til AI-trening.

Det er også viktig å merke seg at når dataene brukes til AI-modelltrening, blir det nesten umulig å bestemme hvilke spesifikke data som bidro til modellen, fordi AI blandes sammen. Så, det spesifikke utgangspunktet tenderer ikke å være dets utgangspunkt, særlig når det gjelder millioner av bilder.

På grunn av sin raske utvikling, etablerer dette området fortsatt klare retningslinjer for å distribuere ansvar. Dette ligner kompleksitetene rundt selvkjørende biler, hvor spørsmål om ansvar — om det er sjåføren, produsenten eller programvareselskapet — fortsatt krever klare distribusjon.

I andre tilfeller, når en annoteringsleverandør mottar et datasett for annotering, antar de at klienten har innhentet dataene lovlig. Hvis det er tydelige tegn på at dataene er innhentet ulovlig, må leverandøren rapportere det. Likevel er slike åpenbare tilfeller ekstremt sjeldne.

Det er også viktig å merke seg at store selskaper, konserner og merker som setter pris på sin omdømme, er svært forsiktige med hvor de henter dataene fra, selv om de ikke er opprettet fra scratch, men hentet fra andre lovlige kilder.

I sammenfatning avhenger hver deltakers ansvar i dataarbeidsprosessen av avtalen. Du kunne vurdere denne prosessen som en del av en bredere “bærekraftskjede”, hvor hver deltaker har en kritisk rolle i å opprettholde juridiske og etiske standarder.

Hva er misforståelser om AI-utviklingens bakside?

En stor misforståelse om AI-utvikling er at AI-modeller fungerer lignende søkemotorer, som samler og aggregere informasjon for å presentere til brukerne basert på lært kunnskap. Likevel fungerer AI-modeller, spesielt språkmodeller, ofte basert på sannsynlighet fremfor ekte forståelse. De forutsier ord eller uttrykk basert på statistisk sannsynlighet, ved å bruke mønster sett i tidligere data. AI “vet” ingenting; det ekstrapolerer, gjetter og justerer sannsynlighet.

Fortsatt antar mange at trening av AI krever enorme datasett, men mye av det AI trenger å gjenkjenne — som hunder, katter eller mennesker — er allerede godt etablert. Fokus ligger nå på å forbedre nøyaktigheten og finpusse modellene fremfor å gjenskape gjenkjennelseskapasiteter. Mye av AI-utviklingen i dag handler om å lukke de siste små gapene i nøyaktighet fremfor å starte fra scratch.

Etiske utfordringer og hvordan Den europeiske unions AI-akt og mildring av US-reguleringer vil påvirke det globale AI-markedet

Når vi diskuterer etikk og lovlighet ved å arbeide med data, er det også viktig å forstå hva som definerer “etisk” AI.

Den største etiske utfordringen selskaper står overfor i dag i AI er å bestemme hva som anses som uakseptabelt for AI å gjøre eller bli lært. Det er en bred enighet om at etisk AI bør hjelpe fremfor å skade mennesker og unngå bedrag. Likevel kan AI-systemer gjøre feil eller “hallusinere”, noe som utfordrer å bestemme om disse feilene kvalifiserer som desinformasjon eller skade.

AI-etikk er en stor debatt med organisasjoner som UNESCO som deltar — med nøkkelprinsipper om gjennomgang og sporing av utdata.

Lovlige rammer rundt data-tilgang og AI-trening spiller en betydelig rolle i å forme AI-ets etiske landskap. Land med færre begrensninger på data-bruk muliggjør mer tilgjengelig treningsdata, mens nasjoner med strengere data-lover begrenser data-tilgjengelighet for AI-trening.

For eksempel tilbyr Europa, som har innført AI-loven, og USA, som har trukket tilbake mange AI-reguleringer, kontrasterende tilnærminger som indikerer det nåværende globale landskapet.

Den europeiske unions AI-akt har en betydelig innvirkning på selskaper som opererer i Europa. Den tvinger en streng regulativ ramme, noe som gjør det vanskelig for bedrifter å bruke eller utvikle visse AI-modeller. Selskaper må innhente spesifikke lisenser for å arbeide med visse teknologier, og i mange tilfeller gjør reguleringene det effektivt for vanskelig for mindre bedrifter å møte disse reglene.

Som følge kan noen startup-selskaper velge å forlate Europa eller unngå å operere der helt, likt effekten sett med kryptocurrency-reguleringer. Større selskaper som kan investere i å møte kravene til samsvar, kan tilpasse seg. Likevel kan loven drive AI-innovasjon ut av Europa til fordel for markeder som USA eller Israel, hvor reguleringer er mindre strenge.

USAs beslutning om å investere store ressurser i AI-utvikling med færre begrensninger kan også ha ulemper, men invitere til mer mangfold i markedet. Mens Den europeiske union fokuserer på sikkerhet og regulativ samsvar, vil USA sannsynligvis fremme mer risikotaking og banebrytende eksperimentering.

Michael Abramov er grunnlegger og administrerende direktør i Introspector, og bringer over 15+ års erfaring med programvareutvikling og datamaskinens syns AI-systemer til å bygge bedriftsgraderte merkingverktøy.

Michael begynte sin karriere som programvareutvikler og R&D-sjef, og bygde skalerbare datasystemer og ledet tverrfaglige ingeniørteam. Frem til 2025 har han vært administrerende direktør i Keymakr, et dataselskap som tilbyr merkingstjenester, der han var pioner med menneske-i-løkken-arbeidsflyter, avanserte QA-systemer og tilpasset verktøy for å støtte store skala datamaskinens syn og autonomi databehov.

Han har en B.Sc. i datavitenskap og en bakgrunn i ingeniørvitenskap og kreative kunstarter, og bringer en tverrfaglig perspektiv til å løse vanskelige problemer. Michael bor i skjæringspunktet mellom teknologisk innovasjon, strategisk produktledelse og virkelige verdensimpakt, og driver fremover den neste fronten av autonome systemer og intelligente automatisering.