Tankeledare
AI:s datadilemma: Sekretess, reglering och den etiska AI:s framtid

AI-drivna lösningar antas snabbt i olika branscher, tjänster och produkter varje dag. Men deras effektivitet beror helt på kvaliteten på de data de tränas på – ett aspekt som ofta missförstås eller förbises i dataskapelseprocessen.
Som dataskyddsmyndigheter ökar granskningen av hur AI-teknologier följer sekretess- och dataskyddsföreskrifter, står företagen under ökande tryck för att hämta, annotera och förädla datamängder på ett förenligt och etiskt sätt.
Finns det verkligen en etisk tillvägagångssätt för att bygga AI-datamängder? Vilka är företagens största etiska utmaningar, och hur hanterar de dem? Och hur påverkar de utvecklande rättsliga ramarna tillgängligheten och användningen av träningsdata? Låt oss utforska dessa frågor.
Datasekretess och AI
Av sin natur kräver AI stora mängder personliga data för att utföra uppgifter. Detta har väckt oro över insamling, lagring och användning av denna information. Många lagar runt om i världen reglerar och begränsar användningen av personliga data, från GDPR och den nyligen införda AI-lagen i Europa till HIPAA i USA, som reglerar tillgång till patientdata inom vården.
Referens för hur stränga dataskyddslagar är runt om i världen / DLA Piper
Till exempel har fjorton amerikanska delstater för närvarande omfattande dataskyddslagar, och sex fler ska träda i kraft 2025 och början av 2026. Den nya administrationen har signalerat en förändring i sin strategi för dataskyddstillsyn på federal nivå. En viktig fokus ligger på AI-reglering, med tonvikt på att främja innovation snarare än att införa restriktioner. Denna förändring inkluderar upphävande av tidigare verkställande order om AI och införande av nya direktiv för att vägleda dess utveckling och tillämpning.
Dataskyddslagstiftningen utvecklas i olika länder: i Europa är lagarna strängare, medan de i Asien eller Afrika tenderar att vara mindre stränga.
Personligt identifierbar information (PII) – såsom ansiktsbilder, officiella handlingar som pass eller annan känslig personlig data – är vanligtvis begränsad i de flesta länder till viss del. Enligt UNCTAD är insamling, användning och delning av personlig information till tredje parter utan medgivande eller kännedom om konsumenterna en stor oro för de flesta länder i världen. 137 av 194 länder har lagar som säkerställer dataskydd och sekretess. Som ett resultat tar de flesta globala företagen omfattande åtgärder för att undvika att använda PII för modellträning, eftersom lagar som de i EU strikt förbjuder sådana metoder, med sällsynta undantag i tungt reglerade nischer som lagföring.
Med tiden blir dataskyddslagarna mer omfattande och globalt tillämpade. Företagen anpassar sina metoder för att undvika rättsliga utmaningar och uppfylla nya rättsliga och etiska krav.
Metoder som företag använder för att hämta data
När man studerar dataskyddsfrågor för modellträning är det viktigt att först förstå var företagen hämtar denna data. Det finns tre huvudsakliga och primära källor till data.
- Datainsamling
Denna metod möjliggör insamling av data från crowdsourcing-plattformar, mediestock och öppen källkod-datamängder.
Det är viktigt att notera att offentliga mediestock är föremål för olika licensavtal. Även en kommersiell användningslicens uttrycker ofta explicit att innehållet inte kan användas för modellträning. Dessa förväntningar skiljer sig åt plattform för plattform och kräver att företagen bekräftar sin rätt att använda innehållet på det sätt de behöver.
Även när AI-företag erhåller innehåll lagligt kan de fortfarande stå inför vissa problem. Den snabba utvecklingen av AI-modellträning har vida överträffat rättsliga ramverk, vilket innebär att reglerna och lagarna kring AI-träningsdata fortfarande utvecklas. Som ett resultat måste företagen hålla sig informerade om rättsliga utvecklingar och noggrant granska licensavtal innan de använder mediestock för AI-träning.
- Data skapande
En av de säkraste metoderna för datamängdspreparation innebär att skapa unikt innehåll, såsom att filma människor i kontrollerade miljöer som studior eller utomhuslokaler. Innan de deltar skriver individerna under ett samtyckesformulär för att använda deras PII, som specificerar vilken data som samlas in, hur och var den kommer att användas och vem som kommer att ha tillgång till den. Detta säkerställer fullständigt rättsligt skydd och ger företagen förtroende för att de inte kommer att stå inför krav på olaglig dataanvändning.
Den största nackdelen med denna metod är dess kostnad, särskilt när data skapas för randfall eller storskaliga projekt. Men stora företag och företag är alltmer benägna att använda denna metod av två skäl. För det första säkerställer den fullständig överensstämmelse med alla standarder och rättsliga regler. För det andra ger den företagen data som är fullständigt anpassade till deras specifika scenarier och behov, vilket garanterar den högsta noggrannheten i modellträning.
- Syntetisk data generering
Användning av programvaruverktyg för att skapa bilder, text eller videor baserat på en given scenarie. Men syntetisk data har begränsningar: den genereras baserat på fördefinierade parametrar och saknar den naturliga variationen av verklig data.
Denna brist kan negativt påverka AI-modeller. Även om det inte är relevant för alla fall och inte alltid händer, är det fortfarande viktigt att komma ihåg ” modellkollaps ” – en punkt där överdriven tillit till syntetisk data orsakar att modellen försämras, vilket leder till dåliga utdata.
Syntetisk data kan fortfarande vara mycket effektiv för grundläggande uppgifter, såsom att känna igen allmänna mönster, identifiera objekt eller urskilja grundläggande visuella element som ansikten.
Men det är inte det bästa alternativet när ett företag behöver träna en modell från scratch eller hantera sällsynta eller mycket specifika scenarier.
De mest avslöjande situationerna inträffar i in-kabinmiljöer, såsom en förare som är distraherad av ett barn, någon som verkar trött bakom ratten eller till och med fall av vårdslös körning. Dessa datapunkter är inte vanligtvis tillgängliga i offentliga datamängder – och de borde inte vara det – eftersom de involverar verkliga personer i privata miljöer. Eftersom AI-modeller förlitar sig på träningsdata för att generera syntetiska utdata, kämpar de för att representera scenarier de aldrig har mött på ett korrekt sätt.
När syntetisk data misslyckas, blir skapad data – insamlad genom kontrollerade miljöer med verkliga skådespelare – lösningen.
Datamängdsleverantörer som Keymakr placerar kameror i bilar, anställer skådespelare och spelar in handlingar som att ta hand om ett barn, dricka från en flaska eller visa tecken på trötthet. Skådespelarna undertecknar kontrakt som uttryckligen samtycker till att använda deras data för AI-träning, vilket säkerställer överensstämmelse med sekretesslagar.
Ansvar i datamängdsskapelseprocessen
Varje deltagare i processen, från kunden till annoteringsföretaget, har specifika ansvar som anges i deras avtal. Det första steget är att etablera ett kontrakt, som detaljerar naturen av relationen, inklusive klausuler om sekretess och immateriella rättigheter.
Låt oss överväga det första alternativet för att arbeta med data, nämligen när den skapas från scratch. Immaterialrättsliga bestämmelser anger att all data som leverantören skapar tillhör det anställande företaget, vilket innebär att den skapas på deras vägnar. Detta innebär också att leverantören måste säkerställa att data samlas in lagligt och korrekt.
Som datamängdsleverantör säkerställer Keymakr dataskydd genom att först kontrollera den jurisdiktion där data skapas, erhålla lämpligt samtycke från alla inblandade individer och garantera att data kan användas lagligt för AI-träning.
Det är också viktigt att notera att när data används för AI-modellträning, blir det nästan omöjligt att avgöra vilken specifik data som bidrog till modellen, eftersom AI blandar alltihop. Så den specifika utmatningen tenderar inte att vara dess utmatning, särskilt när man diskuterar miljontals bilder.
På grund av sin snabba utveckling etablerar detta område fortfarande tydliga riktlinjer för ansvarsfördelning. Detta liknar komplexiteten kring självkörande bilar, där frågor om ansvar – om det är föraren, tillverkaren eller programvaruföretaget – fortfarande kräver tydlig fördelning.
I andra fall, när en annoteringsleverantör tar emot en datamängd för annotering, antas det att kunden har erhållit data lagligt. Om det finns tydliga tecken på att data har erhållits olagligt, måste leverantören rapportera det. Men sådana uppenbara fall är extremt sällsynta.
Det är också viktigt att notera att stora företag, koncerner och varumärken som värdesätter sin rykte är mycket försiktiga med var de hämtar sin data, även om den inte skapades från scratch utan togs från andra lagliga källor.
Sammanfattningsvis beror varje deltagares ansvar i datamängdsprocessen på avtalet. Man kan betrakta denna process som en del av en bredare “hållbarhetskedja”, där varje deltagare har en avgörande roll i att upprätthålla rättsliga och etiska standarder.
Vilka missuppfattningar finns om AI-utvecklingens bakre del?
En stor missuppfattning om AI-utveckling är att AI-modeller fungerar på samma sätt som sökmotorer, som samlar in och aggregerar information för att presentera för användare baserat på inlärda kunskaper. Men AI-modeller, särskilt språkmodeller, fungerar ofta baserat på sannolikhet snarare än äkta förståelse. De förutser ord eller termer baserat på statistisk sannolikhet, med mönster som setts i tidigare data. AI “vet” ingenting; det extrapolerar, gissar och justerar sannolikhet.
Dessutom antar många att AI-träning kräver enorma datamängder, men mycket av vad AI behöver känna igen – som hundar, katter eller människor – är redan väl etablerat. Fokus ligger nu på att förbättra noggrannheten och finslipa modellerna snarare än att återuppfinna igenkänningsförmåga. Mycket av AI-utvecklingen idag handlar om att stänga de sista små gapen i noggrannhet snarare än att börja från scratch.
Etiska utmaningar och hur EU:s AI-lag och mildring av USA:s regleringar kommer att påverka den globala AI-marknaden
När man diskuterar etik och laglighet kring data, är det också viktigt att tydligt förstå vad som definierar “etisk” AI.
Den största etiska utmaningen som företag står inför idag i AI är att bestämma vad som anses vara oacceptabelt för AI att göra eller läras. Det finns en bred konsensus att etisk AI bör hjälpa snarare än skada människor och undvika bedrägeri. Men AI-system kan göra fel eller “hallucinera”, vilket utmanar att bestämma om dessa misstag kvalificerar sig som desinformation eller skada.
AI-etik är en stor debatt med organisationer som UNESCO som är involverade – med nyckelprinciper som omfattar granskning och spårbarhet av utdata.
Lagliga ramverk kring datatillgång och AI-träning spelar en betydande roll i att forma AI:s etiska landskap. Länder med färre restriktioner för dataanvändning möjliggör mer tillgänglig träningsdata, medan nationer med strängare datalagar begränsar datatillgänglighet för AI-träning.
Till exempel har Europa, som antog AI-lagen, och USA, som har backat många AI-regleringar, kontrasterande tillvägagångssätt som indikerar det nuvarande globala landskapet.
EU:s AI-lag har en betydande inverkan på företag som verkar i Europa. Den inför en sträng regleringsram, vilket gör det svårt för företag att använda eller utveckla vissa AI-modeller. Företag måste erhålla specifika licenser för att arbeta med vissa teknologier, och i många fall gör regleringarna det i praktiken omöjligt för mindre företag att följa dessa regler.
Som ett resultat kan vissa startups välja att lämna Europa eller undvika att verka där över huvud taget, liknande den inverkan som ses med kryptografiska regleringar. Stora företag som kan investera i att uppfylla kraven kan anpassa sig, men lagen kan driva AI-innovation utanför Europa till förmån för marknader som USA eller Israel, där regleringarna är mindre stränga.
USA:s beslut att investera stora resurser i AI-utveckling med färre restriktioner kan också ha nackdelar, men inbjuda till mer mångfald på marknaden. Medan EU fokuserar på säkerhet och regleringsenhetlighet kommer USA sannolikt att främja mer risktagande och banbrytande experiment.













