Rozhovory

Bailey Kacsmar, PhD kandidát na Univerzitě Waterloo – Interview Series

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Bailey Kacsmar je PhD kandidát na School of Computer Science na Univerzitě Waterloo a budoucí člen pedagogického týmu na Univerzitě Alberta. Její výzkumné zájmy se soustředí na vývoj technologií, které chrání soukromí uživatelů, a to prostřednictvím paralelního studia technických přístupů pro soukromé výpočty a odpovídajících uživatelských vnímání, obav a pochopení těchto technologií. Jejím cílem je identifikovat potenciál a omezení soukromí v aplikacích strojového učení.

Vaše výzkumné zájmy se soustředí na vývoj technologií, které chrání soukromí uživatelů, proč je soukromí v AI tak důležité?

Soukromí v AI je tak důležité, protože AI ve světě neexistuje bez dat. Data, ačkoli jsou užitečnou abstrakcí, ultimately popisují lidi a jejich chování. Zřídka pracujeme s daty o populaci stromů a úrovních vody; takže kdykoli pracujeme s něčím, co může ovlivnit skutečné lidi, musíme být si vědomi toho a rozumět, jak náš systém může udělat dobro nebo újmu. To je besonders pravdivé pro AI, kde mnoho systémů těží z obrovského množství dat nebo se snaží použít vysoce citlivá data (jako zdravotní data) k vývoji nových pochopení našeho světa.

Jaké jsou některé způsoby, kterými jste viděla, že strojové učení zradilo soukromí uživatelů?

Zradilo je silné slovo. Nicméně, kdykoli systém používá informace o lidech bez jejich souhlasu, bez informování jich, a bez zvažování potenciálních újm, riskuje porušení individuálních nebo společenských norem soukromí. To vede k porušení tisícem malých ran. Takové praktiky mohou zahrnovat trénování modelu na uživatelských emailových schránkách, trénování na uživatelských textových zprávách, nebo na zdravotních datech; vše bez informování subjektů dat.

Můžete definovat, co je diferenciální soukromí, a jaké jsou vaše názory na ně?

Diferenciální soukromí je definice nebo technika, která získala na významu v oblasti technického soukromí. Technické definice soukromí obecně zahrnují dva klíčové aspekty; co je chráněno, a od koho. V rámci technického soukromí jsou soukromí záruky ochrany, které jsou dosaženy za předpokladu, že jsou splněny určité předpoklady. Tyto předpoklady mohou být o potenciálních protivnících, systémových složitostech nebo statistice. Je to nesmírně užitečná technika, která má širokou škálu aplikací. Nicméně, je důležité mít na paměti, že diferenciální soukromí není ekvivalentní se soukromím.

Soukromí není omezeno na jednu definici nebo koncept, a je důležité být si vědom dalších pojmů. Například kontextuální integrita, která je konceptuální pojem soukromí, který zahrnuje věci, jako je, jak různé aplikace nebo různé organizace mění soukromí vnímání jednotlivce vzhledem k situaci. Existují také právní pojmy soukromí, jako jsou ty, které jsou obsaženy v Kanadském PIPEDĚ, Evropském GDPR a Kalifornském spotřebitelském zákoně (CCPA). Všechno toto je říci, že nemůžeme zacházet s technickými systémy, jako by existovaly v vakuum, bez ohledu na ostatní faktory soukromí, i když je použito diferenciální soukromí.

Jiný typ strojového učení, který zlepšuje soukromí, je federované učení, můžete definovat, co to je, a jaké jsou vaše názory na ně?

Federované učení je způsob, jakým se provádí strojové učení, když je model trénován na kolekci dat, která jsou distribuována napříč několika vlastníky nebo lokalitami. Není to intrinsicky typ strojového učení, který zlepšuje soukromí. Typ strojového učení, který zlepšuje soukromí, musí formálně definovat, co je chráněno, kdo je chráněn, a podmínky, které musí být splněny pro tyto ochrany. Například, když uvažujeme o jednoduchém diferenciálně soukromém výpočtu, zajišťuje, že nikdo, kdo vidí výstup, nebude moci určit, zda určitý datový bod byl přispěn nebo ne.

Dále, diferenciální soukromí nedává tuto záruku, pokud existuje korelace mezi datovými body. Federované učení nemá tuto funkci; jednoduše trénuje model na kolekci dat bez požadavku, aby držitelé těchto dat přímo poskytli svá data ostatním nebo třetí straně. Zatímco to zní jako funkce soukromí, je zapotřebí formální záruka, že nelze zjistit chráněné informace na základě mezilehlých a výstupů, které budou pozorovány nedůvěryhodnými stranami. Tato formalita je besonders důležitá ve federovaném prostředí, kde nedůvěryhodné strany zahrnují každého, kdo poskytuje data pro trénování kolektivního modelu.

Jaké jsou některé současné omezení těchto přístupů?

Současné omezení lze nejlépe popsat jako povaha soukromí-užitečnosti obchodování. I když uděláte všechno ostatní, komunikujete soukromí důsledky těm, kteří jsou dotčeni, vyhodnotíte systém pro to, co se snažíte udělat, atd., stále se jedná o dosažení ideálního obchodování. Jak určíme, co je “ideální” obchodování a budujeme směrem k němu, aby jsme stále dosáhli požadované funkčnosti a poskytli potřebné soukromí ochrany.

Vaše současné cíle zahrnují vývoj technologií, které chrání soukromí uživatelů, prostřednictvím paralelního studia technických řešení pro soukromé výpočty. Můžete se více zmínit o některých z těchto řešení?

Co tím myslím, je, že můžeme, volně řečeno, vyvinout libovolný počet technických systémů soukromí. Nicméně, je důležité určit, zda soukromí záruky dosahují těch, kteří jsou dotčeni. To může znamenat vývoj systému po zjištění, jaké druhy ochrany populace hodnotí. To může znamenat aktualizaci systému po zjištění, jak lidé skutečně používají systém, s ohledem na jejich reálné hrozby a rizika. Technické řešení by mohlo být správný systém, který splňuje definici, kterou jsem zmínil dříve. Uživatelům vědomé řešení by navrhovalo systém na základě vstupů od uživatelů a ostatních, kteří jsou dotčeni v oblasti aplikace.

Právě teď hledáte zájemce o studium na Univerzitě Waterloo, proč si myslíte, že studenti by měli být intéressovaní o soukromí AI?

Myslím, že studenti by měli být interessovaní, protože to je něco, co bude pouze růst ve své všudypřítomnosti v naší společnosti. Abychom měli nějakou představu o tom, jak rychle tyto systémy rostou, stačí se podívat na nedávné články o Chat-GPT, sociální média a debaty o jeho důsledcích. Žijeme ve společnosti, kde sběr a použití dat je tak hluboce zakořeněn v našem denním životě, že téměř neustále poskytujeme informace o sobě různým společnostem a organizacím. Tyto společnosti chtějí použít data, v některých případech ke zlepšení svých služeb, v jiných pro zisk. V tomto okamžiku se zdá nereálné myslet si, že tyto firemní praktiky používání dat se změní. Nicméně, existence systémů, které chrání soukromí uživatelů, zatímco umožňují určitou analýzu, kterou společnosti požadují, může pomoci vyvážit riziko-odměnu obchodování, které se stalo tak implicitní součástí naší společnosti.

Děkuji za skvělý rozhovor, čtenáři, kteří se chtějí dozvědět více, by měli navštívit Bailey Kacsmar’s Github stránku.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.