Tankeledere
Er det en klar løsning på personvernsrisikoenene som generativ AI utgjør?
Personvernsrisikoenene som generativ AI utgjør, er meget reelle. Fra økt overvåking og eksponering til mer effektive phishing- og vishing-kampanjer enn noensinne, eroderer generativ AI personvernet massevis, uretfardig, samtidig som det gir skurker, enten kriminelle, statssponsede eller regjeringsaktører, de verktøyene de trenger for å målrette enkeltpersoner og grupper.
Den tydeligste løsningen på dette problemet involverer forbrukere og brukere som kollektivt vender ryggen til AI-hysteriet, krever åpenhet fra de som utvikler eller implementerer såkalte AI-funksjoner, og effektiv regulering fra de regjeringsorganer som overvåker deres operasjoner. Selv om dette er verdt å strebe etter, er det ikke sannsynlig at dette vil skje noen gang snart.
Hva som gjenstår, er rimelige, selv om nødvendigvis ufullstendige, tilnærminger til å mildne generativ AI-personvernsrisiko. Den langsiktige, sikre og kjedelige prediksjonen er at jo mer utdannet allmennheten blir om datapersonvern generelt, jo mindre personvernsrisiko vil det være ved masse-tilpasningen av generativ AI.
Får vi alle konseptet med generativ AI rett?
Hysteriet rundt AI er så ubenyttet at en undersøkelse av hva folk mener med generativ AI, er knapt nødvendig. Selvfølgelig representerer ingen av disse “AI”-funksjonene, funksjonalitetene og produktene eksempler på ekte kunstig intelligens, hva enn det måtte se ut som. I stedet er de for det meste eksempler på maskinlæring (ML), dyplæring (DL) og store språkmodeller (LLM).
Generativ AI, som navnet antyder, kan generere nytt innhold – enten tekst (inkludert programmeringsspråk), lyd (inkludert musikk og menneske-lignende stemmer) eller videoer (med lyd, dialog, klipp og kameraendringer). All dette oppnås ved å trene LLM til å identifisere, matche og reproducere mønster i menneske-generert innhold.
La oss ta ChatGPT som et eksempel. Som mange LLM, er det trent i tre brede faser:
- For-trening: I denne fasen, blir LLM “fôret” med tekstmateriale fra internettet, bøker, akademiske tidsskrifter og alt annet som inneholder potensielt relevante eller nyttige tekst.
- Overvåket instruksjons-finetuning: Modeller blir trent til å svare mer sammenhengende på instruksjoner ved hjelp av høykvalitets instruksjons-svar-par, vanligvis kildet fra mennesker.
- Forsterkning av læring fra menneskelig tilbakemelding (RLHF): LLM som ChatGPT gjennomgår ofte denne ekstra treningfasen, under hvilken interaksjoner med menneskelige brukere brukes til å finjustere modellens tilpasning til typiske bruksscenarier.
Alle tre fasene av treningsprosessen involverer data, enten massive lagre av forhåndsgjorte data (som de som brukes i for-trening) eller data som samles inn og prosesseres nesten i sanntid (som de som brukes i RLHF). Det er denne datan som bærer den største delen av personvernsrisikoene som stammer fra generativ AI.
Hva er personvernsrisikoene som generativ AI utgjør?
Personvern blir krenket når personlig informasjon om en enkeltperson (data-subjektet) blir tilgjengelig for andre enkeltpersoner eller enheter uten data-subjektets samtykke. LLM blir forhåndstrent og finjustert på en ekstremt bred rekke av data som kan og ofte inkluderer personlig data. Denne datan blir vanligvis skrapt fra offentlig tilgjengelige kilder, men ikke alltid.
Selv når denne datan blir tatt fra offentlig tilgjengelige kilder, kan det å aggregere og prosessere den med en LLM og deretter gjøre den tilgjengelig gjennom LLMs grensesnitt, bli betraktet som en ytterligere krenkelse av personvern.
Fasen med forsterkning av læring fra menneskelig tilbakemelding (RLHF) komplicerer tingene. I denne treningsfasen, brukes virkelige interaksjoner med menneskelige brukere til å korrigere og finjustere LLMs svar iterativt. Dette betyr at en bruks interaksjoner med en LLM kan bli sett, delt og spredt av noen som har tilgang til treningsdatan.
I de fleste tilfeller, er dette ikke en personvernskrenkelse, gitt at de fleste LLM-utviklere inkluderer personvernpolitikker og vilkår for bruk som krever at brukerne samtykker før de interagerer med LLM. Personvernsrisikoen ligger heller i det faktum at mange brukere ikke er klar over at de har samtykket til slik datainnsamling og -bruk. Slike brukere er sannsynligvis å avsløre privat og følsom informasjon under interaksjonene med disse systemene, uten å være klar over at disse interaksjonene ikke er konfidensielle eller private.
På denne måten, kommer vi til de tre hovedmåtene generativ AI utgjør personvernsrisiko på:
- Store lagre av forhåndstrent data som potensielt inneholder personlig informasjon, er sårbare for å bli kompromittert og eksfiltrert.
- Personlig informasjon inkludert i forhåndstrent data kan bli lekket til andre brukere av samme LLM gjennom dens svar på forespørsler og instruksjoner.
- Personlig og konfidensiell informasjon som blir gitt under interaksjoner med LLM, havner hos LLMs ansatte og muligens tredjeparts-entrepenører, derfra kan den bli sett eller lekket.
Disse er alle risikoer for brukernes personvern, men sjansen for at personlig identifiserbar informasjon (PII) havner i feil hender, synes fortsatt ganske lav. Det er, i hvert fall, til dataforhandlere kommer inn i bildet. Disse selskapene spesialiserer seg på å snuse opp PII og samle inn, aggregere og spre den, hvis ikke åpenbart kringkaste den.
Med PII og annen personlig data som har blitt en slags vare og dataforhandler-industrien som har vokst frem for å profitere på dette, er det alt for sannsynlig at noen personlig data som “kommer ut” vil bli samlet inn av dataforhandlere og spredt vidt og bredt.
Personvernsrisikoene ved generativ AI i sammenheng
Før vi ser på personvernsrisikoene som generativ AI utgjør for brukerne i sammenheng med bestemte produkter, tjenester og selskaps-samarbeid, la oss ta et mer strukturert blikk på det fulle spekteret av generativ AI-risiko. I en artikkel for IAPP, tok Moraes og Previtali en data-drevet tilnærming til å finjustere Soloves “A Taxonomy of Privacy” fra 2006, og reduserte de 16 personvernsrisikoene som ble beskrevet der, til 12 AI-spesifikke personvernsrisikoer.
Disse er de 12 personvernsrisikoene som er inkludert i Moraes og Previtalis reviderte taksonomi:
- Overvåking: AI forverrer overvåkingsrisikoene ved å øke skalaen og ubenyttetheten av personlig datainnsamling.
- Identifisering: AI-teknologier muliggjør automatisk identitets kobling over ulike datakilder, og øker risikoene relatert til personlig identitetseksponering.
- Aggregasjon: AI kombinerer ulike deler av data om en person for å gjøre antakelser, og skaper risikoer for personvernskrenkelser.
- Frenologi og fysiognomi: AI antar personlighet eller sosiale attributter fra fysiske karakteristika, en ny risikokategori som ikke er inkludert i Soloves taksonomi.
- Sekundær bruk: AI forverrer bruken av personlig data for formål andre enn det opprinnelige, gjennom ombruk av data.
- Utelukkelse: AI gjør det verre å ikke informere eller gi kontroll til brukerne over hvordan deres data brukes, gjennom uklare data-praksiser.
- Usikkerhet: AIs datakrav og lagringspraksiser risikerer datalekkasjer og uautorisert tilgang.
- Eksponering: AI kan avsløre følsom informasjon, som gjennom generative AI-teknikker.
- Forvrengning: AIs evne til å generere realistisk, men feilaktig innhold, øker spredningen av feil eller misvisende informasjon.
- Avgivelse: AI kan forårsake uautorisert deling av data når den antar ytterligere følsom informasjon fra rådata.
- Økt tilgjengelighet: AI gjør følsom informasjon mer tilgjengelig for en bredere publikum enn det som var ment.
- Intrusjon: AI-teknologier invaderer personlig rom eller ensomhet, ofte gjennom overvåkingsmessige tiltak.
Dette er ganske alarmerende lesning. Det er viktig å merke seg at denne taksonomien, til sin ære, tar hensyn til generativ AIs tendens til å hallusinere – å generere og presentere faktisk uriktige opplysninger med sikkerhet. Dette fenomenet, selv om det sjelden avslører virkelig informasjon, er også en personvernsrisiko. Spredningen av feil og misvisende informasjon påvirker subjektets personvern på måter som er mer subtile enn i tilfeller med nøyaktig informasjon, men det påvirker likevel.
La oss dykke ned i konkrete eksempler på hvordan disse personvernsrisikoene kommer til uttrykk i sammenheng med faktiske AI-produkter.
Directe interaksjoner med tekst-basert generativ AI-systemer
Det enkleste tilfellet er det som involverer en bruker som interagerer direkte med et generativt AI-system, som ChatGPT, Midjourney eller Gemini. Brukerens interaksjoner med mange av disse produktene blir logget, lagret og brukt til RLHF (forsterkning av læring fra menneskelig tilbakemelding), overvåket instruksjons-finetuning og sogar forhåndstrening av andre LLM.
En analyse av personvernpolitikkene til mange av disse tjenestene avslører også andre data-delingsaktiviteter som er underbygget av helt forskjellige formål, som markedsføring og dataforhandling. Dette er en helt annen type personvernsrisiko som generativ AI utgjør: disse systemene kan karakteriseres som enorme data-kanaler, som samler inn data som blir gitt av brukerne, samt data som genereres gjennom deres interaksjoner med den underliggende LLM.
Interaksjoner med innbygde generative AI-systemer
Noen brukere kan interagere med generative AI-grensesnitt som er innbygd i produktet de bruker. Brukeren kan vite at de bruker en “AI”-funksjon, men de er mindre sannsynlig å vite hva dette innebærer i terms of datapersonvernrisiko. Hva som kommer til syne med innbygde systemer, er mangelen på forståelse av at personlig data som deles med LLM kan havne i hendene på utviklere og dataforhandlere.
Det er to grader av manglende bevissthet her: noen brukere innser at de interagerer med et generativt AI-produkt; og noen tror at de bruker produktet som generativ AI er bygget inn i eller tilgjengelig gjennom. I begge tilfeller kan brukeren godt ha (og sannsynligvis har) teknisk sett samtykket til vilkårene og betingelsene som er knyttet til deres interaksjoner med det innbygde systemet.
Andre partnerskap som utsatte brukerne for generative AI-systemer
Noen selskaper innbygger eller inkluderer på andre måter generative AI-grensesnitt i sine programvare på måter som er mindre åpenbare, og lar brukerne interagere – og dele informasjon – med tredjeparter uten å være klar over det. Heldigvis er “AI” blitt så effektivt som salgsargument at det er usannsynlig at et selskap vil holde slike implementeringer hemmelige.
Et annet fenomen i denne sammenhengen er den økende motstanden som slike selskaper har møtt etter å ha prøvd å dele bruker- eller kundedata med generative AI-selskaper som OpenAI. Datafjerningstjenesten Optery, for eksempel, gjorde nylig om på en beslutning om å dele brukerdata med OpenAI på et opt-out-basis, det vil si at brukerne var medlemmer av programmet som standard.
Ikke bare var kundene rask til å uttrykke sin misnøye, men selskapets datafjerningstjeneste ble også fjernet fra Privacy Guides’ liste over anbefalte datafjerningstjenester. Til Opterys ære, gjorde de raskt og åpent om på beslutningen, men det er den generelle motstanden som er betydelig her: folk begynner å forstå risikoen ved å dele data med “AI”-selskaper.
Optery-saken er et godt eksempel her fordi deres brukere, i en viss forstand, er i forkant av den økende skepsisen rundt såkalte AI-implementeringer. De typene mennesker som velger en datafjerningstjeneste, er også vanligvis de som vil være oppmerksomme på endringer i vilkår for bruk og personvernpolitikker.
Bevis på en økende motstand mot generativ AI-data-bruk
Personvernsbevisste forbrukere har ikke vært de eneste som har reist bekymringer om generative AI-systemer og deres tilhørende personvernsrisiko. På det lovgivende nivå, har EUs Artificial Intelligence Act kategorisert risikoene etter alvorlighetsgrad, med datapersonvern som det eksplisitte eller implisitte kriteriet for å tillegge alvorlighetsgrad i de fleste tilfeller. Loven omfatter også problemene med informert samtykke som vi diskuterte tidligere.
USA, som er notorisk langsom til å adoptere omfattende, føderale datapersonvernlovgivning, har i hvert fall noen guardrails på plass takket være Executive Order 14110. Igjen er datapersonvern bekymringer i forkant av formålene som er gitt for ordren: “iransvarlig bruk [av AI-teknologier] kan forverre samfunns-skader som svindel, diskriminering, bias og desinformasjon” – alle relatert til tilgjengeligheten og spredningen av personlig data.
Ved å returnere til forbrukernivået, er det ikke bare spesielt personvernsbevisste forbrukere som har reagert på personverns-invasive generative AI-implementeringer. Microsofts nå berømte “AI-drevne” Recall-funksjon, som var bestemt for sin Windows 11-operativsystem, er et primært eksempel. Når omfanget av personverns- og sikkerhetsrisiko ble avdekket, var motstanden stor nok til å få tech-giganten til å gå tilbake. Uheldigvis, ser det ut til at Microsoft (MSFT ) ikke har gitt opp på ideen, men den initielle offentlige reaksjonen er likevel oppmuntrende.
Ved å bli hos Microsoft, har deres Copilot-programmet blitt bredt kritisert for både datapersonvern og datasikkerhetsproblemer. Da Copilot ble trent på GitHub-data (hovedsakelig kildekode), oppstod også kontrovers rundt Microsofts påståtte brudd på programmeres og utvikleres programvare- lisensavtaler. Det er i slike tilfeller at grensene mellom datapersonvern og immaterielle rettigheter begynner å bli uklare, og datapersonvern får en monetær verdi – noe som ikke er lett å gjøre.
(AAPL )Kanskje det største tegnet på at AI blir et rød flagg i forbrukernes øyne, er den lunken, hvis ikke åpenbart skeptiske, offentlige responsen Apple fikk til sin initielle AI-lansering, spesielt i forhold til data-delingsavtaler med OpenAI.
De stykkevis løsningene
Det finnes skritt lovgivere, utviklere og selskaper kan ta for å mildne noen av risikoene som generativ AI utgjør. Disse er spesifikke løsninger på bestemte aspekter av det overordnede problemet, og ingen av disse løsningene forventes å være nok, men alle sammen, arbeidende sammen, kunne gjøre en forskjell.
- Data-minimering. Å minimere mengden data som samles inn og lagres, er et rimelig mål, men det er direkte motsatt av generativ AI-utvikleres ønske om treningsdata.
- Åpenhet. Gitt den nåværende tilstanden i ML, kan dette kanskje ikke engang være teknisk mulig i mange tilfeller. Innsikt i hvilken data som prosesseres og hvordan når en genererer et gitt utgang, er en måte å sikre personvern i interaksjoner med generativ AI.
- Anonymisering. Enhver PII som ikke kan ekskluderes fra treningsdata (gjennom data-minimering) bør anonymiseres. Problemet er at mange populære anonymiserings- og pseudonymiserings-teknikker lett kan bli defeateret.
- Bruker-samtykke. Å kreve at brukerne samtykker til innsamling og deling av deres data, er essensielt, men for åpenbart åpenbart for misbruk og for åpenbart åpenbart for forbruker-latskap til å være effektivt. Det er informert samtykke som trengs her, og de fleste forbrukere, riktig informert, ville ikke samtykke til slik data-deling, så incitamentene er feiljustert.
- Sikkerhet for data under overføring og i ro. En annen grunnleggende del av både datapersonvern og datasikkerhet, å beskytte data gjennom kryptografiske og andre midler, kan alltid bli mer effektiv. Likevel, generative AI-systemer har tendens til å lekke data gjennom grensesnittene, noe som gjør dette bare en del av løsningen.
- Å påtvinge opphavsrett og immateriell eiendomslov i sammenheng med såkalt AI. ML kan operere i en “black box”, noe som gjør det vanskelig, hvis ikke umulig, å spore hva opphavsrettslig materiale og immaterielle eiendomsrettigheter havner i hvilket generativt AI-utgang.
- Revisjoner. En annen kritisk guardrail-måte som blir hindret av den svarte boksen i LLM og de generative AI-systemene de støtter. Dette kombineres med den lukkede kilde-koden til de fleste generative AI-produkter, noe som begrenser revisjoner til kun de som utføres på utviklerens convenience.
Alle disse tilnærmingene til problemet er gyldige og nødvendige, men ingen er tilstrekkelig. De krever alle lovgivende støtte for å komme i betydning, noe som betyr at de er dømt til å være etterpå i denne dynamiske feltet.
Den klare løsningen
Løsningen på personvernsrisikoene som generativ AI utgjør, er hverken revolusjonær eller spennende, men hvis den føres til sin logiske konklusjon, kan resultatene være både. Den klare løsningen involverer hverdagsforbrukere som blir bevisste på verdien av deres data til selskaper og prisverdien av datapersonvern for seg selv.
Forbrukerne er kildene og motorene bak den private informasjonen som driver det som kalles den moderne overvåkingsøkonomien. Når en kritisk masse av forbrukere begynner å stanse strømmen av privat data inn i det offentlige rommet og begynner å kreve ansvar fra selskaper som handler med personlig data, vil systemet måtte korrigere seg selv.
Det oppmuntrende med generativ AI er at, i motsetning til nåværende reklame- og markedsføringsmodeller, trenger det ikke å involvere personlig informasjon på noen stadium. Forhåndstrening og finjustering av data trenger ikke å inkludere PII eller annen personlig data, og brukerne trenger ikke å avsløre det samme under interaksjoner med generative AI-systemer.
For å fjerne deres personlig informasjon fra treningsdata, kan folk gå rett til kilden og fjerne sine profiler fra de forskjellige dataforhandlerne (inkludert person-søke-nettsteder) som samler inn offentlige poster, og bringer dem inn i omløp på det åpne markedet. Personlig data-fjerningstjenester automatiserer prosessen, og gjør det raskt og enkelt. Selvfølgelig har fjerning av personlig data fra disse selskapenes databaser mange andre fordeler og ingen ulemper.
Folk genererer også personlig data når de interagerer med programvare, inkludert generativ AI. For å stanse strømmen av denne datan, må brukerne være mer bevisste på at deres interaksjoner blir logget, lagret, analysert og delt. Deres valg for å unngå dette bryter ned til å begrense hva de avslører til online-systemer og å bruke på-enhet, åpen kildekode LLM hvor mulig. Folk, generelt sett, gjør allerede en god jobb med å modulere hva de diskuterer i offentligheten – vi bare trenger å utvide disse instinktene inn i generativ AI-området.












