Tankeledere
Er det en klar lÃļsning pÃĨ personvernsrisikoenene som generativ AI utgjÃļr?
Personvernsrisikoenene som generativ AI utgjÃļr, er meget reelle. Fra Ãļkt overvÃĨking og eksponering til mer effektive phishing- og vishing-kampanjer enn noensinne, eroderer generativ AI personvernet massevis, uretfardig, samtidig som det gir skurker, enten kriminelle, statssponsede eller regjeringsaktÃļrer, de verktÃļyene de trenger for ÃĨ mÃĨlrette enkeltpersoner og grupper.
Den tydeligste lÃļsningen pÃĨ dette problemet involverer forbrukere og brukere som kollektivt vender ryggen til AI-hysteriet, krever ÃĨpenhet fra de som utvikler eller implementerer sÃĨkalte AI-funksjoner, og effektiv regulering fra de regjeringsorganer som overvÃĨker deres operasjoner. Selv om dette er verdt ÃĨ strebe etter, er det ikke sannsynlig at dette vil skje noen gang snart.
Hva som gjenstÃĨr, er rimelige, selv om nÃļdvendigvis ufullstendige, tilnÃĶrminger til ÃĨ mildne generativ AI-personvernsrisiko. Den langsiktige, sikre og kjedelige prediksjonen er at jo mer utdannet allmennheten blir om datapersonvern generelt, jo mindre personvernsrisiko vil det vÃĶre ved masse-tilpasningen av generativ AI.
FÃĨr vi alle konseptet med generativ AI rett?
Hysteriet rundt AI er sÃĨ ubenyttet at en undersÃļkelse av hva folk mener med generativ AI, er knapt nÃļdvendig. SelvfÃļlgelig representerer ingen av disse âAIâ-funksjonene, funksjonalitetene og produktene eksempler pÃĨ ekte kunstig intelligens, hva enn det mÃĨtte se ut som. I stedet er de for det meste eksempler pÃĨ maskinlÃĶring (ML), dyplÃĶring (DL) og store sprÃĨkmodeller (LLM).
Generativ AI, som navnet antyder, kan generere nytt innhold â enten tekst (inkludert programmeringssprÃĨk), lyd (inkludert musikk og menneske-lignende stemmer) eller videoer (med lyd, dialog, klipp og kameraendringer). All dette oppnÃĨs ved ÃĨ trene LLM til ÃĨ identifisere, matche og reproducere mÃļnster i menneske-generert innhold.
La oss ta ChatGPT som et eksempel. Som mange LLM, er det trent i tre brede faser:
- For-trening: I denne fasen, blir LLM âfÃīretâ med tekstmateriale fra internettet, bÃļker, akademiske tidsskrifter og alt annet som inneholder potensielt relevante eller nyttige tekst.
- OvervÃĨket instruksjons-finetuning: Modeller blir trent til ÃĨ svare mer sammenhengende pÃĨ instruksjoner ved hjelp av hÃļykvalitets instruksjons-svar-par, vanligvis kildet fra mennesker.
- Forsterkning av lÃĶring fra menneskelig tilbakemelding (RLHF): LLM som ChatGPT gjennomgÃĨr ofte denne ekstra treningfasen, under hvilken interaksjoner med menneskelige brukere brukes til ÃĨ finjustere modellens tilpasning til typiske bruksscenarier.
Alle tre fasene av treningsprosessen involverer data, enten massive lagre av forhÃĨndsgjorte data (som de som brukes i for-trening) eller data som samles inn og prosesseres nesten i sanntid (som de som brukes i RLHF). Det er denne datan som bÃĶrer den stÃļrste delen av personvernsrisikoene som stammer fra generativ AI.
Hva er personvernsrisikoene som generativ AI utgjÃļr?
Personvern blir krenket nÃĨr personlig informasjon om en enkeltperson (data-subjektet) blir tilgjengelig for andre enkeltpersoner eller enheter uten data-subjektets samtykke. LLM blir forhÃĨndstrent og finjustert pÃĨ en ekstremt bred rekke av data som kan og ofte inkluderer personlig data. Denne datan blir vanligvis skrapt fra offentlig tilgjengelige kilder, men ikke alltid.
Selv nÃĨr denne datan blir tatt fra offentlig tilgjengelige kilder, kan det ÃĨ aggregere og prosessere den med en LLM og deretter gjÃļre den tilgjengelig gjennom LLMs grensesnitt, bli betraktet som en ytterligere krenkelse av personvern.
Fasen med forsterkning av lÃĶring fra menneskelig tilbakemelding (RLHF) komplicerer tingene. I denne treningsfasen, brukes virkelige interaksjoner med menneskelige brukere til ÃĨ korrigere og finjustere LLMs svar iterativt. Dette betyr at en bruks interaksjoner med en LLM kan bli sett, delt og spredt av noen som har tilgang til treningsdatan.
I de fleste tilfeller, er dette ikke en personvernskrenkelse, gitt at de fleste LLM-utviklere inkluderer personvernpolitikker og vilkÃĨr for bruk som krever at brukerne samtykker fÃļr de interagerer med LLM. Personvernsrisikoen ligger heller i det faktum at mange brukere ikke er klar over at de har samtykket til slik datainnsamling og -bruk. Slike brukere er sannsynligvis ÃĨ avslÃļre privat og fÃļlsom informasjon under interaksjonene med disse systemene, uten ÃĨ vÃĶre klar over at disse interaksjonene ikke er konfidensielle eller private.
PÃĨ denne mÃĨten, kommer vi til de tre hovedmÃĨtene generativ AI utgjÃļr personvernsrisiko pÃĨ:
- Store lagre av forhÃĨndstrent data som potensielt inneholder personlig informasjon, er sÃĨrbare for ÃĨ bli kompromittert og eksfiltrert.
- Personlig informasjon inkludert i forhÃĨndstrent data kan bli lekket til andre brukere av samme LLM gjennom dens svar pÃĨ forespÃļrsler og instruksjoner.
- Personlig og konfidensiell informasjon som blir gitt under interaksjoner med LLM, havner hos LLMs ansatte og muligens tredjeparts-entrepenÃļrer, derfra kan den bli sett eller lekket.
Disse er alle risikoer for brukernes personvern, men sjansen for at personlig identifiserbar informasjon (PII) havner i feil hender, synes fortsatt ganske lav. Det er, i hvert fall, til dataforhandlere kommer inn i bildet. Disse selskapene spesialiserer seg pÃĨ ÃĨ snuse opp PII og samle inn, aggregere og spre den, hvis ikke ÃĨpenbart kringkaste den.
Med PII og annen personlig data som har blitt en slags vare og dataforhandler-industrien som har vokst frem for ÃĨ profitere pÃĨ dette, er det alt for sannsynlig at noen personlig data som âkommer utâ vil bli samlet inn av dataforhandlere og spredt vidt og bredt.
Personvernsrisikoene ved generativ AI i sammenheng
FÃļr vi ser pÃĨ personvernsrisikoene som generativ AI utgjÃļr for brukerne i sammenheng med bestemte produkter, tjenester og selskaps-samarbeid, la oss ta et mer strukturert blikk pÃĨ det fulle spekteret av generativ AI-risiko. I en artikkel for IAPP, tok Moraes og Previtali en data-drevet tilnÃĶrming til ÃĨ finjustere Soloves âA Taxonomy of Privacyâ fra 2006, og reduserte de 16 personvernsrisikoene som ble beskrevet der, til 12 AI-spesifikke personvernsrisikoer.
Disse er de 12 personvernsrisikoene som er inkludert i Moraes og Previtalis reviderte taksonomi:
- OvervÃĨking: AI forverrer overvÃĨkingsrisikoene ved ÃĨ Ãļke skalaen og ubenyttetheten av personlig datainnsamling.
- Identifisering: AI-teknologier muliggjÃļr automatisk identitets kobling over ulike datakilder, og Ãļker risikoene relatert til personlig identitetseksponering.
- Aggregasjon: AI kombinerer ulike deler av data om en person for ÃĨ gjÃļre antakelser, og skaper risikoer for personvernskrenkelser.
- Frenologi og fysiognomi: AI antar personlighet eller sosiale attributter fra fysiske karakteristika, en ny risikokategori som ikke er inkludert i Soloves taksonomi.
- SekundÃĶr bruk: AI forverrer bruken av personlig data for formÃĨl andre enn det opprinnelige, gjennom ombruk av data.
- Utelukkelse: AI gjÃļr det verre ÃĨ ikke informere eller gi kontroll til brukerne over hvordan deres data brukes, gjennom uklare data-praksiser.
- Usikkerhet: AIs datakrav og lagringspraksiser risikerer datalekkasjer og uautorisert tilgang.
- Eksponering: AI kan avslÃļre fÃļlsom informasjon, som gjennom generative AI-teknikker.
- Forvrengning: AIs evne til ÃĨ generere realistisk, men feilaktig innhold, Ãļker spredningen av feil eller misvisende informasjon.
- Avgivelse: AI kan forÃĨrsake uautorisert deling av data nÃĨr den antar ytterligere fÃļlsom informasjon fra rÃĨdata.
- Ãkt tilgjengelighet: AI gjÃļr fÃļlsom informasjon mer tilgjengelig for en bredere publikum enn det som var ment.
- Intrusjon: AI-teknologier invaderer personlig rom eller ensomhet, ofte gjennom overvÃĨkingsmessige tiltak.
Dette er ganske alarmerende lesning. Det er viktig ÃĨ merke seg at denne taksonomien, til sin ÃĶre, tar hensyn til generativ AIs tendens til ÃĨ hallusinere â ÃĨ generere og presentere faktisk uriktige opplysninger med sikkerhet. Dette fenomenet, selv om det sjelden avslÃļrer virkelig informasjon, er ogsÃĨ en personvernsrisiko. Spredningen av feil og misvisende informasjon pÃĨvirker subjektets personvern pÃĨ mÃĨter som er mer subtile enn i tilfeller med nÃļyaktig informasjon, men det pÃĨvirker likevel.
La oss dykke ned i konkrete eksempler pÃĨ hvordan disse personvernsrisikoene kommer til uttrykk i sammenheng med faktiske AI-produkter.
Directe interaksjoner med tekst-basert generativ AI-systemer
Det enkleste tilfellet er det som involverer en bruker som interagerer direkte med et generativt AI-system, som ChatGPT, Midjourney eller Gemini. Brukerens interaksjoner med mange av disse produktene blir logget, lagret og brukt til RLHF (forsterkning av lÃĶring fra menneskelig tilbakemelding), overvÃĨket instruksjons-finetuning og sogar forhÃĨndstrening av andre LLM.
En analyse av personvernpolitikkene til mange av disse tjenestene avslÃļrer ogsÃĨ andre data-delingsaktiviteter som er underbygget av helt forskjellige formÃĨl, som markedsfÃļring og dataforhandling. Dette er en helt annen type personvernsrisiko som generativ AI utgjÃļr: disse systemene kan karakteriseres som enorme data-kanaler, som samler inn data som blir gitt av brukerne, samt data som genereres gjennom deres interaksjoner med den underliggende LLM.
Interaksjoner med innbygde generative AI-systemer
Noen brukere kan interagere med generative AI-grensesnitt som er innbygd i produktet de bruker. Brukeren kan vite at de bruker en âAIâ-funksjon, men de er mindre sannsynlig ÃĨ vite hva dette innebÃĶrer i terms of datapersonvernrisiko. Hva som kommer til syne med innbygde systemer, er mangelen pÃĨ forstÃĨelse av at personlig data som deles med LLM kan havne i hendene pÃĨ utviklere og dataforhandlere.
Det er to grader av manglende bevissthet her: noen brukere innser at de interagerer med et generativt AI-produkt; og noen tror at de bruker produktet som generativ AI er bygget inn i eller tilgjengelig gjennom. I begge tilfeller kan brukeren godt ha (og sannsynligvis har) teknisk sett samtykket til vilkÃĨrene og betingelsene som er knyttet til deres interaksjoner med det innbygde systemet.
Andre partnerskap som utsatte brukerne for generative AI-systemer
Noen selskaper innbygger eller inkluderer pÃĨ andre mÃĨter generative AI-grensesnitt i sine programvare pÃĨ mÃĨter som er mindre ÃĨpenbare, og lar brukerne interagere â og dele informasjon â med tredjeparter uten ÃĨ vÃĶre klar over det. Heldigvis er âAIâ blitt sÃĨ effektivt som salgsargument at det er usannsynlig at et selskap vil holde slike implementeringer hemmelige.
Et annet fenomen i denne sammenhengen er den Ãļkende motstanden som slike selskaper har mÃļtt etter ÃĨ ha prÃļvd ÃĨ dele bruker- eller kundedata med generative AI-selskaper som OpenAI. Datafjerningstjenesten Optery, for eksempel, gjorde nylig om pÃĨ en beslutning om ÃĨ dele brukerdata med OpenAI pÃĨ et opt-out-basis, det vil si at brukerne var medlemmer av programmet som standard.
Ikke bare var kundene rask til ÃĨ uttrykke sin misnÃļye, men selskapets datafjerningstjeneste ble ogsÃĨ fjernet fra Privacy Guidesâ liste over anbefalte datafjerningstjenester. Til Opterys ÃĶre, gjorde de raskt og ÃĨpent om pÃĨ beslutningen, men det er den generelle motstanden som er betydelig her: folk begynner ÃĨ forstÃĨ risikoen ved ÃĨ dele data med âAIâ-selskaper.
Optery-saken er et godt eksempel her fordi deres brukere, i en viss forstand, er i forkant av den Ãļkende skepsisen rundt sÃĨkalte AI-implementeringer. De typene mennesker som velger en datafjerningstjeneste, er ogsÃĨ vanligvis de som vil vÃĶre oppmerksomme pÃĨ endringer i vilkÃĨr for bruk og personvernpolitikker.
Bevis pÃĨ en Ãļkende motstand mot generativ AI-data-bruk
Personvernsbevisste forbrukere har ikke vÃĶrt de eneste som har reist bekymringer om generative AI-systemer og deres tilhÃļrende personvernsrisiko. PÃĨ det lovgivende nivÃĨ, har EUs Artificial Intelligence Act kategorisert risikoene etter alvorlighetsgrad, med datapersonvern som det eksplisitte eller implisitte kriteriet for ÃĨ tillegge alvorlighetsgrad i de fleste tilfeller. Loven omfatter ogsÃĨ problemene med informert samtykke som vi diskuterte tidligere.
USA, som er notorisk langsom til ÃĨ adoptere omfattende, fÃļderale datapersonvernlovgivning, har i hvert fall noen guardrails pÃĨ plass takket vÃĶre Executive Order 14110. Igjen er datapersonvern bekymringer i forkant av formÃĨlene som er gitt for ordren: âiransvarlig bruk [av AI-teknologier] kan forverre samfunns-skader som svindel, diskriminering, bias og desinformasjonâ â alle relatert til tilgjengeligheten og spredningen av personlig data.
Ved ÃĨ returnere til forbrukernivÃĨet, er det ikke bare spesielt personvernsbevisste forbrukere som har reagert pÃĨ personverns-invasive generative AI-implementeringer. Microsofts nÃĨ berÃļmte âAI-drevneâ Recall-funksjon, som var bestemt for sin Windows 11-operativsystem, er et primÃĶrt eksempel. NÃĨr omfanget av personverns- og sikkerhetsrisiko ble avdekket, var motstanden stor nok til ÃĨ fÃĨ tech-giganten til ÃĨ gÃĨ tilbake. Uheldigvis, ser det ut til at Microsoft ikke har gitt opp pÃĨ ideen, men den initielle offentlige reaksjonen er likevel oppmuntrende.
Ved ÃĨ bli hos Microsoft, har deres Copilot-programmet blitt bredt kritisert for bÃĨde datapersonvern og datasikkerhetsproblemer. Da Copilot ble trent pÃĨ GitHub-data (hovedsakelig kildekode), oppstod ogsÃĨ kontrovers rundt Microsofts pÃĨstÃĨtte brudd pÃĨ programmeres og utvikleres programvare- lisensavtaler. Det er i slike tilfeller at grensene mellom datapersonvern og immaterielle rettigheter begynner ÃĨ bli uklare, og datapersonvern fÃĨr en monetÃĶr verdi â noe som ikke er lett ÃĨ gjÃļre.
Kanskje det stÃļrste tegnet pÃĨ at AI blir et rÃļd flagg i forbrukernes Ãļyne, er den lunken, hvis ikke ÃĨpenbart skeptiske, offentlige responsen Apple fikk til sin initielle AI-lansering, spesielt i forhold til data-delingsavtaler med OpenAI.
De stykkevis lÃļsningene
Det finnes skritt lovgivere, utviklere og selskaper kan ta for ÃĨ mildne noen av risikoene som generativ AI utgjÃļr. Disse er spesifikke lÃļsninger pÃĨ bestemte aspekter av det overordnede problemet, og ingen av disse lÃļsningene forventes ÃĨ vÃĶre nok, men alle sammen, arbeidende sammen, kunne gjÃļre en forskjell.
- Data-minimering. Ã minimere mengden data som samles inn og lagres, er et rimelig mÃĨl, men det er direkte motsatt av generativ AI-utvikleres Ãļnske om treningsdata.
- Ã penhet. Gitt den nÃĨvÃĶrende tilstanden i ML, kan dette kanskje ikke engang vÃĶre teknisk mulig i mange tilfeller. Innsikt i hvilken data som prosesseres og hvordan nÃĨr en genererer et gitt utgang, er en mÃĨte ÃĨ sikre personvern i interaksjoner med generativ AI.
- Anonymisering. Enhver PII som ikke kan ekskluderes fra treningsdata (gjennom data-minimering) bÃļr anonymiseres. Problemet er at mange populÃĶre anonymiserings- og pseudonymiserings-teknikker lett kan bli defeateret.
- Bruker-samtykke. Ã kreve at brukerne samtykker til innsamling og deling av deres data, er essensielt, men for ÃĨpenbart ÃĨpenbart for misbruk og for ÃĨpenbart ÃĨpenbart for forbruker-latskap til ÃĨ vÃĶre effektivt. Det er informert samtykke som trengs her, og de fleste forbrukere, riktig informert, ville ikke samtykke til slik data-deling, sÃĨ incitamentene er feiljustert.
- Sikkerhet for data under overfÃļring og i ro. En annen grunnleggende del av bÃĨde datapersonvern og datasikkerhet, ÃĨ beskytte data gjennom kryptografiske og andre midler, kan alltid bli mer effektiv. Likevel, generative AI-systemer har tendens til ÃĨ lekke data gjennom grensesnittene, noe som gjÃļr dette bare en del av lÃļsningen.
- Ã pÃĨtvinge opphavsrett og immateriell eiendomslov i sammenheng med sÃĨkalt AI. ML kan operere i en âblack boxâ, noe som gjÃļr det vanskelig, hvis ikke umulig, ÃĨ spore hva opphavsrettslig materiale og immaterielle eiendomsrettigheter havner i hvilket generativt AI-utgang.
- Revisjoner. En annen kritisk guardrail-mÃĨte som blir hindret av den svarte boksen i LLM og de generative AI-systemene de stÃļtter. Dette kombineres med den lukkede kilde-koden til de fleste generative AI-produkter, noe som begrenser revisjoner til kun de som utfÃļres pÃĨ utviklerens convenience.
Alle disse tilnÃĶrmingene til problemet er gyldige og nÃļdvendige, men ingen er tilstrekkelig. De krever alle lovgivende stÃļtte for ÃĨ komme i betydning, noe som betyr at de er dÃļmt til ÃĨ vÃĶre etterpÃĨ i denne dynamiske feltet.
Den klare lÃļsningen
LÃļsningen pÃĨ personvernsrisikoene som generativ AI utgjÃļr, er hverken revolusjonÃĶr eller spennende, men hvis den fÃļres til sin logiske konklusjon, kan resultatene vÃĶre bÃĨde. Den klare lÃļsningen involverer hverdagsforbrukere som blir bevisste pÃĨ verdien av deres data til selskaper og prisverdien av datapersonvern for seg selv.
Forbrukerne er kildene og motorene bak den private informasjonen som driver det som kalles den moderne overvÃĨkingsÃļkonomien. NÃĨr en kritisk masse av forbrukere begynner ÃĨ stanse strÃļmmen av privat data inn i det offentlige rommet og begynner ÃĨ kreve ansvar fra selskaper som handler med personlig data, vil systemet mÃĨtte korrigere seg selv.
Det oppmuntrende med generativ AI er at, i motsetning til nÃĨvÃĶrende reklame- og markedsfÃļringsmodeller, trenger det ikke ÃĨ involvere personlig informasjon pÃĨ noen stadium. ForhÃĨndstrening og finjustering av data trenger ikke ÃĨ inkludere PII eller annen personlig data, og brukerne trenger ikke ÃĨ avslÃļre det samme under interaksjoner med generative AI-systemer.
For ÃĨ fjerne deres personlig informasjon fra treningsdata, kan folk gÃĨ rett til kilden og fjerne sine profiler fra de forskjellige dataforhandlerne (inkludert person-sÃļke-nettsteder) som samler inn offentlige poster, og bringer dem inn i omlÃļp pÃĨ det ÃĨpne markedet. Personlig data-fjerningstjenester automatiserer prosessen, og gjÃļr det raskt og enkelt. SelvfÃļlgelig har fjerning av personlig data fra disse selskapenes databaser mange andre fordeler og ingen ulemper.
Folk genererer ogsÃĨ personlig data nÃĨr de interagerer med programvare, inkludert generativ AI. For ÃĨ stanse strÃļmmen av denne datan, mÃĨ brukerne vÃĶre mer bevisste pÃĨ at deres interaksjoner blir logget, lagret, analysert og delt. Deres valg for ÃĨ unngÃĨ dette bryter ned til ÃĨ begrense hva de avslÃļrer til online-systemer og ÃĨ bruke pÃĨ-enhet, ÃĨpen kildekode LLM hvor mulig. Folk, generelt sett, gjÃļr allerede en god jobb med ÃĨ modulere hva de diskuterer i offentligheten â vi bare trenger ÃĨ utvide disse instinktene inn i generativ AI-omrÃĨdet.












