Andersonin kulma

Estetiikkaa suojaamaan herkkää tietoa LLM-tietovuotoja vastaan

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
ChatGPT-4o: 'Orthographic 1792x1024 view of a SIMs-like police officer holding up his hand to a citizen to stop them going any further'

Mielipide Mielenkiintoinen IBM NeurIPS 2024 julkaisu vuoden 2024 lopusta resurfaced on Arxiv viime viikolla. Se ehdottaa järjestelmää, joka voi automaattisesti puuttua suojelemaan käyttäjiä lähettämästä henkilökohtaisia tai arkaluontoisia tietoja viestissä, kun he keskustelevat suuren kielen mallin (LLM) kanssa, kuten ChatGPT.

Kuvitteelliset esimerkit, joita käytettiin käyttäjätutkimuksessa, jossa selvitettiin, miten ihmiset haluavat vuorovaikuttaa kehotteiden väliintulo-palvelun kanssa. Lähde: https://arxiv.org/pdf/2502.18509

Kuvitteelliset esimerkit, joita käytettiin käyttäjätutkimuksessa, jossa selvitettiin, miten ihmiset haluavat vuorovaikuttaa kehotteiden väliintulo-palvelun kanssa. Lähde: https://arxiv.org/pdf/2502.18509

Yllä olevat kuvitteelliset esimerkit käytettiin IBM-tutkijoiden tutkimuksessa, jossa testattiin mahdollista käyttäjien kitkaa tällaisen “väliintulon” suhteen.

Vaikka siitä, miten GUI-toteutus on tehty, ei kerrota paljoa yksityiskohtia, voidaan olettaa, että tällainen toiminto voisi joko sisällyttää selaimeen viestintään paikallisen “palomuurin” LLM-kehyksen kanssa tai luoda sovellus, joka voi kytkeytyä suoraan (esim.) OpenAI API:in, jolloin luodaan OpenAI:n oma ladattava ohjelma ChatGPT:lle, mutta lisäsuojauksilla.

Sanotaan, että ChatGPT itse sensuroi automaattisesti vastauksiaan kehoituksiin, jotka se havaitsee sisältävän kriittisiä tietoja, kuten pankkitietoja:

ChatGPT kieltäytyy osallistumasta keskusteluun, jossa on havaittu kriittisiä turvallisuustietoja, kuten pankkitietoja (yksityiskohdat kehotuksessa ovat kuvitteellisia ja toimimattomia). Lähde: https://chatgpt.com/

ChatGPT kieltäytyy osallistumasta keskusteluun, jossa on havaittu kriittisiä turvallisuustietoja, kuten pankkitietoja (yksityiskohdat kehotuksessa ovat kuvitteellisia ja toimimattomia). Lähde: https://chatgpt.com/

Kuitenkin ChatGPT on paljon suvaitsevampi erilaisia henkilökohtaisia tietoja kohtaan – vaikka niiden levittäminen millä tahansa tavalla ei välttämättä ole käyttäjän edun mukaista (tässä tapauksessa ehkä johtuen työstä ja ilmoittamisesta):

Yllä oleva esimerkki on kuvitteellinen, mutta ChatGPT ei epäröi osallistua keskusteluun käyttäjän kanssa arkaluontoisesta aiheesta, joka voi muodostua potentiaaliseksi maine- tai tulo-riskiksi (esimerkki on täysin kuvitteellinen).

Yllä oleva esimerkki on kuvitteellinen, mutta ChatGPT ei epäröi osallistua keskusteluun käyttäjän kanssa arkaluontoisesta aiheesta, joka voi muodostua potentiaaliseksi maine- tai tulo-riskiksi (esimerkki on täysin kuvitteellinen).

Tässä tapauksessa olisi ehkä parempi kirjoittaa: ‘Mikä on leukemia-diagnoosin merkitys henkilön kykyyn kirjoittaa ja liikkua?’

IBM-projekti tunnistaa ja tulkitsee tällaiset pyynnöt “henkilökohtaisesta” “yleisesti” kannalta.

IBM-järjestelmän skeema, joka käyttää paikallisia LLM:ejä tai NLP-pohjaisia heuristiikkoja tunnistamaan arkaluontoisia tietoja potentiaalisissa kehoituksissa.

IBM-järjestelmän skeema, joka käyttää paikallisia LLM:ejä tai NLP-pohjaisia heuristiikkoja tunnistamaan arkaluontoisia tietoja potentiaalisissa kehoituksissa.

Tämä olettaa, että verkossa kerätyt LLM:t, tämän julkisen innostuneen AI-keskustelun alkuvaiheessa, eivät koskaan välity myöhemmin malleihin tai mainospohjaisiin kehyksiin, jotka voivat hyödyntää käyttäjän hakukyselyjä kohdennettuun mainontaan.

Vaikka tällaista järjestelmää tai järjestelyä ei ole vielä tiedossa, ei sellaista toimintoa ollut myöskään saatavilla internetin alkuvaiheessa 1990-luvun alussa; siitä lähtien tietojen jakaminen eri alustoilla henkilökohtaisten mainosten tarjoamiseksi on johtanut moniin skandaaleihin sekä paranoiden tilanteisiin.

Historia viittaa siihen, että olisi parempi puhdistaa LLM-kehotukset nyt, ennen kuin tällaiset tiedot kertyvät suurina määrinä, ja ennen kuin LLM-pyynnöt päätyvät pysyviin syklisiin tietokantoihin ja/tai malleihin tai muihin tietopohjaisiin rakenteisiin ja skeemoihin.

Muista minut?

Yksi tekijä, joka ei suosi “yleistä” tai puhdistettua LLM-kehotuksia, on se, että kyky mukauttaa kallista API-vain LLM:ää, kuten ChatGPT:tä, on melko viehättävää – ainakin nykyisellään.

Usein pyydän ChatGPT:ltä apua Windows PowerShell -komentosarjojen ja BAT-tiedostojen luomisessa prosessien automatisointiin, sekä muissa teknisissä asioissa. Tässä tarkoituksessa löydän hyödylliseksi, että järjestelmä muistaa pysyvästi tietoja laitteistosta, jota minulla on käytössä; olemassa olevista teknisistä taidoistani (tai niiden puutteista); sekä monista muista ympäristötekijöistä ja mukautettavista säännöistä:

ChatGPT sallii käyttäjän kehittää “muistin”, joka sovelletaan, kun järjestelmä harkitsee vastauksia tuleviin kehoituksiin.

Vääjämättä tämä pitää tietoja minusta tallennettuna ulkoisille palvelimille, jotka ovat alttiina ehdoin ja ehdoille, jotka voivat muuttua ajan myötä, ilman takeita siitä, että OpenAI (vaikka se voisi olla mikä tahansa suuri LLM-toimittaja) kunnioittaa ehtoja, jotka se on asettanut.

Yleensä kuitenkin ChatGPT:n kyky luoda “muisti” on hyödyllisin sen rajoitetun huomionikkunan vuoksi; ilman pitkäaikaisia (mukautettuja) upotusten LLM:issä käyttäjä tuntee, että hän keskustelee olennon kanssa, joka kärsii anterogradisesta amnesiasta.

On vaikea sanoa, tulevatko uudet mallit lopulta olemaan tarpeeksi suorituskykyisiä tarjoamaan hyödyllisiä vastauksia ilman tarvetta välimuistiin tai mukautettuihin GPT:ihin, jotka tallennetaan verkossa.

Väliaikainen Amnesia

Vaikka voidaan tehdä ChatGPT-keskustelut “väliaikaisiksi”, on hyödyllistä pitää ChatGPT-historiaa viittauksena, joka voidaan tiivistää, kun aika sallii, paikalliseksi, koherentiksi rekisteriksi; mutta emme voi tietää tarkkaan, mitä tapahtuu näille “hävitettyjen” keskustelujen kanssa (vaikka OpenAI ilmoittaa, ettei niitä käytetä koulutukseen, se ei ilmoita, että ne hävitetään), perustuen ChatGPT-infrastruktuuriin. Kaikki, mitä tiedämme, on, että keskustelut eivät enää näy historiassamme, kun “Väliaikaiset keskustelut” on käytössä ChatGPT:ssä.

Useat viimeaikaiset kiistat osoittavat, että API-pohjaiset toimittajat, kuten OpenAI, eivät välttämättä ansaitse luottamusta käyttäjien yksityisyyden suojaamisessa, mukaan lukien emergentti muistaminen, joka osoittaa, että suuremmat LLM:t ovat todennäköisemmin muistamaan joitain koulutus-esimerkkejä kokonaan, ja lisäävät riskiä käyttäjäkohtaisen tiedon paljastamisesta – muun muassa julkisia tapauksia, jotka ovat vakuuttaneet useita suuria yrityksiä, kuten Samsung, kieltämään LLM:ien käytön sisäisessä yritystoiminnassa.

Mieti toisin

Tämä jännite LLM:ien äärimmäisen hyödyllisyyden ja ilmeisen potentiaalisen riskin välillä vaatii kekseliäitä ratkaisuja – ja IBM-ehdotus näyttää olevan mielenkiintoinen peruskaava tässä suhteessa.

Kolme IBM-pohjaista uudelleenmuotoilua, jotka tasapainottavat hyödyllisyyttä ja tietosuojaa. Alimmassa (vaaleanpunaisessa) vyöhykkeessä näemme kehotuksen, joka on järjestelmän kykyä puhdistaa merkityksellisesti.

Kolme IBM-pohjaista uudelleenmuotoilua, jotka tasapainottavat hyödyllisyyttä ja tietosuojaa. Alimmassa (vaaleanpunaisessa) vyöhykkeessä näemme kehotuksen, joka on järjestelmän kykyä puhdistaa merkityksellisesti.

IBM-lähestymistapa sieppaa lähtevät paketit LLM:lle verkkotasolla ja uudelleenkirjoittaa ne tarpeen mukaan ennen kuin alkuperäinen voidaan lähettää. Alempana olevat GUI-integroidut esimerkit näytetään ainoastaan siitä, mihin tämä lähestymistapa voisi johtaa, jos se kehitetään.

Tietysti ilman riittävää toimivaltaa käyttäjä ei välttämättä ymmärrä, että hän saa vastauksen hieman muunnetusta alkuperäisestä pyynnöstään. Tämä puute läpinäkyvyydestä on vastaava kuin käyttöjärjestelmän palomuuri, joka estää pääsyn verkkosivustolle tai palveluun ilmoittamatta käyttäjälle, joka voi virheellisesti etsiä muita syitä ongelmaan.

Kehotukset turvallisuusriskinä

Kehotteen “väliintulo” vastaa hyvin Windows-käyttöjärjestelmän turvallisuuteen, joka on kehittynyt 1990-luvun valikoimasta (vapaaehtoisista) kaupallisista tuotteista pakolliseksi ja tiukasti valvottavaksi verkkopuolustusvälineiksi, jotka tulevat vakiona Windows-asennuksessa ja jotka vaativat jonkin verran vaivaa pois käytöstä tai vähentämiseksi.

Jos kehotuksen puhdistus kehittyy verkkopalomuureiden tavoin viimeisen 30 vuoden aikana, IBM-paperin ehdotus voisi toimia sinänsä tulevaisuuden suunnitelmana: käyttäen täysin paikallista LLM:ää käyttäjän laitteella suodattamaan lähtevät kehotukset, jotka on suunnattu tunnettuja LLM-API:ja kohti. Tämä järjestelmä tarvitsisi luonnollisesti integroida GUI-kehykset ja ilmoitukset, antaen käyttäjille valvonnan – ellei hallinnolliset käytäntöjä ohita sitä, kuten usein tapahtuu liiketoimintaympäristöissä.

Tutkijat suorittivat avoimen lähdekoodin ShareGPT-datasetin analyysin ymmärtääkseen, kuinka usein kontekstuaalinen yksityisyys rikotaan todellisissa tilanteissa.

Llama-3.1-405B-Instruct käytettiin “tuomari”-mallina tunnistamaan kontekstuaalisen eheysrajoituksen rikkomisia. Suuresta keskustelujoukosta analysoitiin yhden käännytyksen keskustelujoukkoa perustuen pituuteen. Tuomari-malli arvioi kontekstin, arkaluontoiset tiedot ja tarpeen tehtävän suorittamiseksi, mikä johti keskustelujen tunnistamiseen, jotka sisälsivät potentiaalisia kontekstuaalisen eheysrajoituksen rikkomisia.

Pienempi osa näistä keskusteluista, jotka osoittivat selviä kontekstuaalisen yksityisyyden rikkomisia, analysoitiin tarkemmin.

Itse kehys toteutettiin käyttäen malleja, jotka ovat pienempiä kuin tyypilliset chat-välineet, kuten ChatGPT, mahdollistaen paikallisen käytön Ollaman avulla.

Kehotteen väliintulon järjestelmän skeema.

Kehotteen väliintulon järjestelmän skeema.

Kolme arvioitua LLM:ää olivat Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; ja DeepSeek-R1-Distill-Llama-8B.

Käyttäjien kehotukset käsitellään kehyksessä kolmessa vaiheessa: kontekstin tunnistaminen; arkaluontoisten tietojen luokittelu; ja uudelleenmuotoilu.

Kahden lähestymistavan toteutus arkaluontoisten tietojen luokitteluun: dynaaminen ja strukturoidun luokittelu: dynaaminen luokittelu määrittää olennaiset yksityiskohdat niiden käytön perusteella tietyssä keskustelussa; strukturoitu luokittelu sallii määrittää ennalta määrättyjen herkän tiedon attribuuttien listan, jotka aina pidetään epäolennaisina. Malli uudelleenmuotoilee kehotuksen, jos se havaitsee epäolennaisia arkaluontoisia yksityiskohtia joko poistamalla tai uudelleenmuokkaamalla niitä minimoidakseen yksityisyyden riskit säilyttäen samalla käytettävyyden.

Kotisäännöt

Vaikka strukturoitu luokittelu ei ole hyvin esitetty IBM-paperissa, se muistuttaa eniten “Private Data Definitions” -menetelmää Private Prompts -aloitteessa, joka tarjoaa ladattavan itsenäisen ohjelman, joka voi uudelleenkirjoittaa kehotuksia – vaikka ilman kykyä puuttua suoraan verkkotasolla, kuten IBM-lähestymistapa tekee (sen sijaan käyttäjän on kopioitava ja liitettyvä muokattu kehotus).

Private Prompts -sovellus sallii luettelon vaihtoehtoisia korvikkeita käyttäjän syöttämälle tekstille.

Private Prompts -sovellus sallii luettelon vaihtoehtoisia korvikkeita käyttäjän syöttämälle tekstille.

Yllä olevassa kuvassa näemme, että Private Prompts -käyttäjä voi ohjelmoida automaattisia korvikkeita arkaluontoisten tietojen esiintymille. Molemmissa tapauksissa, Private Prompts ja IBM-menettely, on epätodennäköistä, että käyttäjä, jolla on riittävästi läsnäoloa ja henkilökohtaista tietoa kuraattorin luetteloa varten, tarvitsisi tätä tuotetta – vaikka se voisi kehittyä ajan myötä, kun tapauksia kertyy.

Hallinnollisessa roolissa strukturoitu luokittelu voisi toimia pakotettuna palomuurina tai sensuuriverkkona työntekijöille; ja kotiverkossa se voisi, jonkin verran vaikeiden mukautusten jälkeen, muodostua kotiverkon suodattimksi kaikille verkon käyttäjille; mutta lopulta tämä menetelmä on väittämätön, koska käyttäjä, joka voisi asettaa tämän oikein, voisi itse sensuroida tehokkaasti ensimmäisen paikassa.

ChatGPT:n mielipide

Koska ChatGPT on vastikään julkaissut syvähaun työkalun maksaville käyttäjille, käytin tätä ominaisuutta pyytääkseni ChatGPT:ltä tarkastelemaan liittyvää kirjallisuutta ja antamaan “synkkä” näkökulma IBM:n paperiin. Sain vastauksen, joka oli puolustuskykyisin ja halveksiva, mitä järjestelmä on koskaan antanut, kun pyydettiin arvioimaan tai tulkimaan uutta julkaisua:

ChatGPT-4o on varsin kriittinen IBM-projektia kohtaan.

ChatGPT-4o on varsin kriittinen IBM-projektia kohtaan.

‘Jos käyttäjät eivät luota OpenAI:hin, Googleen tai Anthropiciin käsittelemään tietojaan vastuullisesti,’ ChatGPT esittää. ‘miksi he luottaisivat kolmannen osapuolen ohjelmistokerrokseen, joka sijaitsee heidän ja AI:n välissä? Välikäsien tulee uusi epäonnistumisen piste – potentiaalisesti lokittava, väärinkäyttävä tai jopa vuotava tietoja ennen kuin se edes saavuttaa LLM:n. Se ratkaisee mitään, jos se vain luo uuden entiteetin hyödyntämään käyttäjän tietoja.’

Tämä vastalause vaikuttaa itsekkäältä ja soveltumattomalta, ottaen huomioon avoimen lähdekoodin projektit, jotka todella hyödyttävät loppukäyttäjiä yhteisökehittäjien ja avustajien pitkäaikaisen työn kautta; ja ottaen huomioon kasvavan potentiaalin mobiililaitteiden suorittaa – ja jopa kouluttaa – kevyitä LLM:ejä. Varmaankin tässä tapauksessa käyttötapaus ei ole erityisen vaativa.

Seuraavaksi ChatGPT puuttuu väärään asiaan tärkeästä asiasta, jossa on kyse siitä, että kevyt LLM tarjoaa valvontaa syötteen suhteen kaupalliseen LLM:ään, jota ei voi suorittaa paikallisesti (koska LLM on liian suuri, ja sen salliminen paikallisesti on liian riskiallista yritykselle, joka sitä tekee):

‘Tehokas yksityisyyden suodatus vaatii ymmärtämään syötteen ennen kuin päättää, mitä poistaa. Jos välikäsien on tarpeeksi älykäs tunnistamaan arkaluontoisia tietoja (nimiä, osoitteita, raha-asioita), se on jo prosessoimassa ja analysoimassa tietoja – tarkoittaen, että se on tallentava tai tarkasteleva juuri sitä, mitä se on tarkoitus poistaa.

‘Tämä esittää paradoksin: a) Tyhmä suodatin (perus säännöllisen lauseen korvaus) on tehokas ja jättää väliin hienot yksityisyyden riskit. b) Älykäs suodatin (LLM-pohjainen uudelleenkirjoittaja) on prosessoimassa koko syötteen, mikä tekee siitä yhtä vaarallisen kuin alkuperäinen LLM.

‘Jos luotat välikäteen riittävästi lukeaksesi ja uudelleenkirjoittamaan syötteesi, miksi et luota LLM:ään itseensä?’

Vastaus tähän viimeiseen kysymykseen on, että paikallinen LLM on tarkoitettu olemaan täysin käyttäjän puolella, ja välttämättä avoimen lähdekoodin, jolla on vähäinen tai ei ollenkaan tarve verkkoyhteydelle. Vastavaa kaupallista versiota uhkaa kuitenkin yrityksen muutokset ja palvelun ehtojen muutokset, kun taas sopiva avoimen lähdekoodin lisenssi estäisi tämänkaltaisen “vääjäämättömän korruption”.

ChatGPT väitti myös, että IBM-ehdotus “rikkoo käyttäjän aikomusta”, koska se voisi tulkita kehotuksen vaihtoehtoiseksi, joka vaikuttaa sen hyödyllisyyteen. Kuitenkin tämä on laajempi ongelma kehotuksen puhdistuksessa, eikä ole spesifiikkaa tälle erityiselle käyttötapaukselle.

Lopuksi (ohittaen ehdotukseni käyttää paikallisia LLM:ejä “sen sijaan”, mitä IBM-paperi itse asiassa ehdottaa), ChatGPT totesi, että IBM-menettely edustaa esteen käytölle johtuen “käyttäjän kitkan” toteuttamisesta varoitus- ja muokkausmenetelmiin chatissa.

Tässä ChatGPT saattaa olla oikeassa; mutta jos merkittävä paine tulee esiin johtuen lisääntynyttä julkista huomiota tai jos voitot tietyllä alueella ovat uhattuna kasvavan sääntelyn vuoksi (ja yritys kieltäytyy yksinkertaisesti hylkäämästä vaikuttamisalueensa kokonaan), kuluttajateknologian historia viittaa siihen, että suojaukset eivät lopulta ole enää valinnaisia.

Johtopäätös

Emme voi realistisesti odottaa, että OpenAI koskaan toteuttaa suojaustoimia, joita IBM-paperi ehdottaa, ja sen keskeisessä käsitteessä; ainakaan tehokkaasti.

Ja varmasti ei globaalisti; aivan kuten Apple (AAPL ) estää tiettyjä iPhone-ominaisuuksia Euroopassa, ja LinkedInilla on erilaiset säännöt käyttäjien tietojen hyödyntämiseksi eri maissa, on kohtuullista olettaa, että mikä tahansa AI-yritys olettaa eniten voittoa tuottavat ehdot ja edellytykset, jotka ovat siedettäviä kussakin maassa, jossa se toimii – kussakin tapauksessa käyttäjän tietosuojan kustannuksella, tarpeen mukaan.

 

Julkaistu torstaina, 27. helmikuuta 2025

Julkaistu torstaina, 27. helmikuuta 2025, kello 15:47:11 virheellisen Apple-liittymän vuoksi – MA

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai