Myslitelé

Existuje jasný řešení pro rizika ochrany soukromí spojená s generativní umělou inteligencí?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Rizika ochrany soukromí spojená s generativní umělou inteligencí jsou velmi reálná. Od zvýšeného dohledu a expozice až po účinnější phishingové a vishingové kampaně než kdykoli předtím, generativní umělá inteligence eroduje soukromí hromadně, nekontrolovatelně, zatímco poskytuje špatným aktérům, ať už zločincům, sponzorovaným státem nebo vládou, nástroje, které potřebují k cílení na jednotlivce a skupiny.

Nejjasnějším řešením tohoto problému je, že spotřebitelé a uživatelé společně otočí záda k hype kolem umělé inteligence, požadují transparentnost od těch, kteří vyvíjejí nebo implementují takzvané funkce umělé inteligence, a efektivní regulaci ze strany vládních orgánů, které dohlížejí na jejich operace. Ačkoli je to hodné úsilí, není pravděpodobné, že se to stane brzy.

Co zbývá, jsou rozumné, i když nutně neúplné, přístupy ke zmírnění rizik ochrany soukromí generativní umělé inteligence. Dlouhodobá, jistá, ale nudná předpověď je, že čím více se veřejnost vzdělává o ochraně dat obecně, tím menší jsou rizika ochrany soukromí spojená s hromadným přijetím generativní umělé inteligence.

Získáváme všichni koncept generativní umělé inteligence správně?

Hype kolem umělé inteligence je tak všudypřítomný, že průzkum toho, co lidé rozumí pod pojmem generativní umělá inteligence, je téměř zbytečný. Samozřejmě, že žádná z těchto „funkcí umělé inteligence“, funkcionalit a produktů vlastně nepředstavuje příklady skutečné umělé inteligence, ať už by to vypadalo jakkoli. Spíše se jedná o příklady machine learning (ML), deep learning (DL) a large language models (LLMs).

Generativní umělá inteligence, jak název napovídá, může generovat nový obsah – ať už text (včetně programovacích jazyků), audio (včetně hudby a lidských hlasů) nebo videa (se zvukem, dialogy, střihy a změnami kamery). To vše je dosaženo tím, že se LLMs učí identifikovat, odpovídat a reprodukovat vzory v lidsky generovaném obsahu.

Zkusme se podívat na ChatGPT jako na příklad. Jako mnoho LLMs prochází třemi širokými fázemi:

  • Předtrénování: Během této fáze je LLM „krmen“ textovým materiálem z internetu, knih, akademických časopisů a čehokoli jiného, co obsahuje potenciálně relevantní nebo užitečný text.
  • Dohlížená instrukční jemná úprava: Modely jsou trénovány, aby reagovaly více koherentně na instrukce pomocí vysoce kvalitních instrukčních páru, obvykle pocházejících z lidí.
  • Učení se z lidské zpětné vazby (RLHF): LLMs, jako je ChatGPT, často procházejí touto další fází trénování, během které jsou interakce s lidskými uživateli použity ke zpřesnění modelu v souladu s typickými použitími.

Všechny tři fáze trénovacího procesu zahrnují data, ať už se jedná o obrovské uložené předtrénovací data (jako ta, která se používají v předtrénování) nebo data shromážděná a zpracovaná téměř v reálném čase (jako ta, která se používají v RLHF). Je to právě tato data, která nesou hlavní část rizik ochrany soukromí spojených s generativní umělou inteligencí.

Jaká jsou rizika ochrany soukromí spojená s generativní umělou inteligencí?

Soukromí je ohroženo, když jsou osobní informace týkající se jednotlivce (subjektu údajů) zpřístupněny jiným jednotlivcům nebo entitám bez souhlasu subjektu údajů. LLMs jsou předtrénovány a jemně upraveny na velmi široké spektrum dat, které mohou a často obsahují osobní data. Tato data jsou obvykle získávána ze veřejně dostupných zdrojů, ale ne vždy.

I když jsou tato data získávána z veřejně dostupných zdrojů, jejich agregace a zpracování LLM a následné zpřístupnění prostřednictvím rozhraní LLM by se dalo považovat za další porušení soukromí.

Fáze učení se z lidské zpětné vazby (RLHF) situaci komplikuje. V této trénovací fázi jsou skutečné interakce s lidskými uživateli použity k iterativnímu opravování a zpřesňování odpovědí LLM. To znamená, že interakce uživatele s LLM mohou být zobrazeny, sdíleny a šířeny kýmkoli, kdo má přístup k trénovacím datům.

Ve většině případů se nejedná o porušení soukromí, protože většina vývojářů LLMs zahrnuje zásady ochrany soukromí a podmínky, které vyžadují, aby uživatelé souhlasili s takovým shromažďováním a používáním dat. Riziko ochrany soukromí spočívá spíše v tom, že mnoho uživatelů si není vědomo toho, že souhlasili se shromažďováním a používáním svých dat. Tito uživatelé pravděpodobně odhalí soukromé a citlivé informace během interakcí s těmito systémy, aniž by si uvědomovali, že tyto interakce nejsou důvěrné ani soukromé.

Tímto způsobem se dostáváme ke třem hlavním způsobům, jak generativní umělá inteligence představuje rizika ochrany soukromí:

  • Velké uložené předtrénovací data, která mohou obsahovat osobní informace, jsou zranitelná vůči ohrožení a úniku.
  • Osobní informace obsažené v předtrénovacích datech mohou být únikem zpřístupněny jiným uživatelům stejného LLM prostřednictvím jeho odpovědí na dotazy a instrukce.
  • Osobní a důvěrné informace poskytnuté během interakcí s LLMs skončí u zaměstnanců LLM a možná i u třetích smluvních partnerů, odkud mohou být zobrazeny nebo únikem zpřístupněny.

Jedná se o rizika ochrany soukromí uživatelů, ale šance na to, že osobní identifikační informace (PII) skončí v nesprávných rukou, se zdají být poměrně nízké. To je alespoň do té doby, než se do hry zapojí makléři dat. Tyto společnosti se specializují na vyhledávání PII a shromažďování, agregaci a šíření, ne-li přímo vysílání.

S PII a jinými osobními daty, která se stala určitou komoditou, a s průmyslem makléřů dat, který se objevil, aby z toho profitoval, je pravděpodobné, že jakékoli osobní údaje, které se „dostanou ven“, budou příliš pravděpodobně získány makléři dat a rozšířeny široko daleko.

Rizika ochrany soukromí generativní umělé inteligence v kontextu

Než se podíváme na rizika ochrany soukromí, která generativní umělá inteligence představuje pro uživatele v kontextu konkrétních produktů, služeb a firemních partnerství, pojďme si udělat strukturovaný přehled o celém spektru rizik generativní umělé inteligence. Moraes a Previtali ve svém článku pro IAPP použili datově orientovaný přístup k upřesnění Soloveho „Taxonomie ochrany soukromí“ z roku 2006, snížení 16 rizik ochrany soukromí na 12 rizik specifických pro umělou inteligenci.

Jedná se o 12 rizik ochrany soukromí zahrnutých v revidované taxonomii Moraese a Previtaliho:

  • Dohled: Umělá inteligence zvyšuje rizika dohledu zvýšením rozsahu a všudypřítomnosti shromažďování osobních dat.
  • Identifikace: Technologie umělé inteligence umožňují automatizované propojení identit napříč různými zdroji dat, čímž se zvyšují rizika spojená s expozicí osobních identit.
  • Agregace: Umělá inteligence kombinuje různé části dat o osobě, aby udělala odhady, čímž vytváří rizika invaze do soukromí.
  • Frenologie a fysiognomie: Umělá inteligence odhaduje osobnost nebo sociální atributy z fyzických charakteristik, nová kategorie rizika, která není v Soloveho taxonomii.
  • Druhé použití: Umělá inteligence zvyšuje použití osobních dat pro účely jiné, než pro které byly původně určeny, prostřednictvím repurposing dat.
  • Vyloučení: Umělá inteligence činí selhání informování nebo poskytování kontroly uživatelům nad tím, jak jsou jejich data používána, horší prostřednictvím neprůhledných praktik zpracování dat.
  • Nezabezpečení: Požadavky umělé inteligence na data a praktiky úložiště riskují úniků dat a neoprávněného přístupu.
  • Expozice:Umělá inteligence může odhalit citlivé informace, jako je prostřednictvím technik generativní umělé inteligence.
  • Deformace:Schopnost umělé inteligence generovat realistické, ale falešné obsahy, zvyšuje šíření falešných nebo zavádějících informací.
  • Odhalení: Umělá inteligence může způsobit neoprávněné sdílení dat, když odhaduje další citlivé informace z raw dat.
  • Zvýšená dostupnost: Umělá inteligence činí citlivé informace dostupnější širšímu publiku, než bylo původně zamýšleno.
  • Invaze: Technologie umělé inteligence invazivně vstupují do osobního prostoru nebo osamělosti, často prostřednictvím opatření dohledu.

To je poměrně alarmující čtení. Je důležité poznamenat, že tato taxonomie, ke své pověsti, bere v úvahu tendenci generativní umělé inteligence hallucinovat – generovat a sebevědomě prezentovat fakticky nepravdivé informace. Tento jev, i když zřídka odhaluje skutečné informace, je také rizikem ochrany soukromí. Šíření falešných a zavádějících informací ovlivňuje soukromí subjektu způsobem, který je jemnější než v případě přesných informací, ale ovlivňuje ho přesto.

Pojeďme se podívat na konkrétní příklady toho, jak tato rizika ochrany soukromí vstupují do hry v kontextu skutečných produktů umělé inteligence.

Přímé interakce s textově založenými generativními systémy umělé inteligence

Nejjednodušší případ je ten, který zahrnuje uživatele, který přímo interaguje s generativním systémem umělé inteligence, jako je ChatGPT, Midjourney nebo Gemini. Interakce uživatele s mnoha z těchto produktů jsou protokolovány, uloženy a použity pro RLHF (učení se z lidské zpětné vazby), dohlíženou instrukční jemnou úpravu a dokonce i předtrénování jiných LLMs.

Analýza zásad ochrany soukromí mnoha služeb, jako jsou tyto, také odhaluje další aktivity sdílení dat podněcované různými účely, jako je marketing a obchodování s daty. Jedná se o jiný typ rizika ochrany soukromí spojeného s generativní umělou inteligencí: tyto systémy lze charakterizovat jako obrovské datové trychtýře, shromažďující data poskytnutá uživateli, jakož i data generovaná prostřednictvím jejich interakcí s podkladovým LLM.

Interakce s vestavěnými generativními systémy umělé inteligence

Někteří uživatelé mohou interagovat s rozhraními generativní umělé inteligence, která jsou vestavěna do produktu, který používají. Uživatel může vědět, že používá „funkci umělé inteligence“, ale je méně pravděpodobné, že bude vědět, co to znamená z hlediska rizik ochrany soukromí. Co se dostává do popředí s vestavěnými systémy, je nedostatek uvědomění si skutečnosti, že osobní data sdílená s LLM mohou skončit v rukou vývojářů a makléřů dat.

Existují dva stupně nedostatku uvědomění: někteří uživatelé si uvědomují, že interagují s produktem generativní umělé inteligence; a někteří věří, že používají produkt, do kterého je generativní umělá inteligence vestavěna nebo přístupná. V každém případě může uživatel mít (a pravděpodobně měl) technicky souhlasil s podmínkami a podmínkami spojenými s jejich interakcemi s vestavěným systémem.

Další partnerství, která vystavují uživatele systémům generativní umělé inteligence

Některé společnosti vestavují nebo jinak zahrnují rozhraní generativní umělé inteligence do svých softwarů způsobem, který je méně zjevný, což vede uživatele k interakci – a sdílení informací – s třetími stranami, aniž by si to uvědomovali. Naštěstí se „umělá inteligence“ stala tak účinným prodejním argumentem, že je nepravděpodobné, že by společnost takovýto implementaci držela v tajnosti.

Dalším jevem v tomto kontextu je rostoucí odpor, který tyto společnosti zažily po pokusu o sdílení uživatelských nebo zákaznických dat s společnostmi generativní umělé inteligence, jako je OpenAI. Společnost Optery, která se specializuje na odstranění dat, nedávno zrušila rozhodnutí sdílet uživatelská data s OpenAI na základě opt-out, což znamená, že uživatelé byli automaticky zaregistrováni do programu.

Nejenže byli zákazníci rychlí vyjádřit své zklamání, ale služba odstranění dat společnosti byla okamžitě odstraněna ze seznamu doporučených služeb odstranění dat Privacy Guides. Společnost Optery si zaslouží uznání za to, že rychle a transparentně zrušila své rozhodnutí, ale je významné, že se jedná o obecný odpor: lidé začínají si uvědomovat rizika spojená se sdílením dat s „umělou inteligencí“.

Příklad Optery je zde dobrým příkladem, protože její uživatelé jsou v jistém smyslu v čele rostoucí skepse vůči takzvaným implementacím umělé inteligence. Lidé, kteří si vyberou službu odstranění dat, jsou také obvykle ti, kteří budou dbát na změny podmínek a zásad ochrany soukromí.

Důkazy rostoucího odporu proti využívání dat generativní umělé inteligence

Spotřebitelé, kteří dbají na ochranu soukromí, nebyli jedinými, kdo vyjadřovali obavy o systémy generativní umělé inteligence a související rizika ochrany soukromí. Na legislativní úrovni je Evropský zákon o umělé inteligenci klasifikuje rizika podle jejich závažnosti, přičemž ochrana soukromí je výslovně nebo implicitně uvedena jako kritérium pro přiřazování závažnosti ve většině případů. Zákon se také zabývá problémy informovaného souhlasu, o kterých jsme dříve diskutovali.

USA, které jsou známé svou pomalou přijetím komplexních, federálních zákonů o ochraně dat, mají alespoň některé zábrany díky výkonnému nařízení 14110. Opět jsou rizika ochrany soukromí na předním místě účelů uvedených v nařízení: „neodpovědné použití [technologií umělé inteligence] by mohlo zhoršit společenské újmy, jako je podvod, diskriminace, zkreslení a dezinformace“ – všechna související s dostupností a šířením osobních dat.

Návrat na spotřebitelskou úroveň, není to jen zvláště spotřebitelé, kteří dbají na ochranu soukromí, kteří byli znepokojeni invazivními implementacemi generativní umělé inteligence. Microsoftova nyní nechvalně proslulá „AI-poháněná“ funkce Recall, určená pro její operační systém Windows 11, je příkladem. Jakmile byla odhalena míra rizik ochrany soukromí a bezpečnosti, odpor byl dostatečný, aby donutil technologického giganta couvnout. Bohužel, Microsoft (MSFT ) se zdá nepřestal s touto myšlenkou, ale prvotní veřejná reakce je přesto povzbudivá.

Zůstáváme u Microsoftu, jeho program Copilot byl široce kritizován za obě rizika ochrany soukromí a bezpečnosti. Jako Copilot byl trénován na datech z GitHubu (převážně zdrojový kód), vznikl také spor kolem údajných porušení licenčních dohod programátorů a vývojářů.

Snad největším indikátorem toho, že umělá inteligence se stává červenou vlajkou v očích spotřebitelů, je vlažná, ne-li přímo podezřívavá, veřejná reakce, kterou Apple (AAPL ) dostal na svou počáteční spuštění umělé inteligence, zejména ve vztahu k dohodám o sdílení dat s OpenAI.

Částečná řešení

Existují kroky, které zákonodárci, vývojáři a společnosti mohou podniknout, aby zmírnili některá rizika spojená s generativní umělou inteligencí. Jedná se o specializovaná řešení konkrétních aspektů nadřazeného problému, žádná z těchto řešení se neočekává, že bude dostatečná, ale všechna tato řešení, pracující společně, by mohla mít skutečný dopad.

  • Minimalizace dat. Minimalizace množství shromážděných a uložených dat je rozumným cílem, ale je přímo v rozporu s touhou vývojářů generativní umělé inteligence po trénovacích datech.
  • Průhlednost. Vzhledem k současnému stavu techniky v oblasti strojového učení může být to technicky neuskutečnitelné ve mnoha případech. Přehled o tom, která data jsou zpracována a jak při generování daného výstupu, je jedním ze způsobů, jak zajistit ochranu soukromí při interakcích s generativní umělou inteligencí.
  • Anonymizace. Jakékoli osobní identifikační informace (PII), které nelze vyloučit z trénovacích dat (prostřednictvím minimalizace dat), by měly být anonymizovány. Problém spočívá v tom, že mnoho populárních technik anonymizace a pseudonymizace je snadno poraženo.
  • Souhlas uživatele. Požadavek, aby uživatelé souhlasili se shromažďováním a sdílením svých dat, je nezbytný, ale příliš otevřený zneužití a příliš náchylný k spotřebitelské lhostejnosti, aby byl účinný. Je zapotřebí informovaný souhlas, a většina spotřebitelů, řádně informovaných, by nesouhlasila se sdílením takových dat, takže pobídky jsou nesouladné.
  • Zabezpečení dat během přenosu a v klidu. Další základ ochrany dat a bezpečnosti, ochrana dat prostřednictvím kryptografických a jiných prostředků, může být vždy učiněna účinnější. Generativní systémy umělé inteligence však tendují k úniku dat prostřednictvím svých rozhraní, což činí toto řešení pouze částí celkového řešení.
  • Vynucení autorského práva a práva duševního vlastnictví v kontextu takzvané umělé inteligence. Strojové učení může fungovat v „černé skříňce“, což znesnadňuje stopování toho, které autorské materiály a práva duševního vlastnictví skončí v jakém výstupu generativní umělé inteligence.
  • Audity. Další důležitá ochranná opatření zmařená „černou skříňkou“ LLMs a generativních systémů umělé inteligence, které podporují. K tomuto vrozenému omezení se přidává uzavřená povaha většiny produktů generativní umělé inteligence, což omezuje audity na ty, které jsou prováděny na uvážení vývojáře.

Všechna tato řešení jsou platná a nezbytná, ale žádná z nich není dostatečná. Všechna vyžadují legislativní podporu, aby měly významný účinek, což znamená, že jsou odsouzena k tomu, aby zůstaly pozadu za touto dynamickou oblastí, jak se bude dále vyvíjet.

Jasná řešení

Řešení rizik ochrany soukromí spojených s generativní umělou inteligencí není revoluční ani vzrušující, ale pokud se dojde k jeho logickému závěru, jeho výsledky by mohly být oběma. Jasná řešení spočívají v tom, že běžní spotřebitelé se stanou vědomými hodnoty svých dat pro společnosti a nepostradatelnosti ochrany soukromí pro sebe.

Spotřebitelé jsou zdroje a motory za soukromými informacemi, které pohánějí to, co se nazývá moderní ekonomika dohledu. Jakmile kritická masa spotřebitelů začne omezovat tok soukromých dat do veřejného prostoru a bude požadovat odpovědnost od společností, které nakládají s osobními daty, systém se bude muset sám opravit.

Povzbudivou věcí o generativní umělou inteligencí je, že na rozdíl od současných modelů reklamy a marketingu nemusí nutně zahrnovat osobní informace na žádné úrovni. Data pro předtrénování a jemnou úpravu nemusí zahrnovat PII nebo jiná osobní data a uživatelé nemusí během interakcí s generativními systémy umělé inteligence odhalovat žádné osobní informace.

Aby lidé odstranili své osobní informace z trénovacích dat, mohou jít přímo ke zdroji a odstranit své profily z různých makléřů dat (včetně vyhledávačů lidí), kteří shromažďují veřejné záznamy a přivádějí je do oběhu na otevřeném trhu. Služby odstranění osobních dat automatizují proces, činí jej rychlým a snadným. Samozřejmě, že odstranění osobních dat z databází těchto společností má mnoho dalších výhod a žádných nevýhod.

Lidé také generují osobní data, když interagují se softwarem, včetně generativní umělé inteligence. Aby omezili tok těchto dat, uživatelé budou muset být více vědomi toho, že jejich interakce jsou zaznamenávány, přezkoumávány, analyzovány a sdíleny. Jejich možnosti pro vyhnutí se tomu se omezují na omezení toho, co odhalí online systémům, a používání místních, otevřených LLMs, kdykoli je to možné. Lidé, obecně, už dělají dobrou práci při modulaci toho, o čem diskutují na veřejnosti – musíme pouze prodloužit tyto instinkty do oblasti generativní umělé inteligence.

David Balaban je počítačový bezpečnostní výzkumník s více než 17 lety zkušeností v analýze malwaru a hodnocení antivirových softwarů. David provozuje MacSecurity.net a Privacy-PC.com projekty, které prezentují odborná stanoviska k současným informačním bezpečnostním otázkám, včetně sociálního inženýrství, malwaru, penetračního testování, threat intelligence, online soukromí a white hat hackingu. David má silné zázemí v odstraňování problémů s malwary, se současným zaměřením na protiopatření proti ransomwaru.