Andersonův úhel
Vysvětlitelná umělá inteligence může snáze vydat důvěrná data

Výzkumníci z Národní univerzity v Singapuru dospěli k závěru, že čím více je umělá inteligence vysvětlitelná, tím snáze bude možné obejít vitální funkce ochrany soukromí v systémech strojového učení. Také zjistili, že i když model není vysvětlitelný, je možné použít vysvětlení podobných modelů k “dekódování” citlivých dat v nemyslitelném modelu.
Výzkum, nazvaný Využití vysvětlení pro modelové inverzní útoky, poukazuje na rizika spojená s využitím “náhodné” neprůhlednosti fungování neuronových sítí jako kdyby to byla bezpečnostní funkce navržená úmyslně – zejména proto, že nová vlna globálních iniciativ, včetně návrhu evropských předpisů o umělé inteligenci, charakterizuje vysvětlitelnou umělou inteligenci (XAI) jako předpoklad pro budoucí normalizaci strojového učení ve společnosti.

Ve výzkumu je úspěšně rekonstruována skutečná identita z údajně anonymních dat týkajících se mimických výrazů, prostřednictvím využití více vysvětlení strojového učení. Zdroj: https://arxiv.org/pdf/2108.10800.pdf
Výzkumníci komentují:
‘Vysvětlitelná umělá inteligence (XAI) poskytuje více informací, aby uživatelé mohli pochopit rozhodnutí modelu, avšak tato dodatečná znalost odhaluje další rizika pro útoky na soukromí. Poskytnutí vysvětlení tedy poškozuje soukromí.’
Re-Identifikace soukromých dat
Účastníci v datech strojového učení mohou souhlasit s tím, že budou zahrnuty do anonymního prostředí; v případě osobních identifikačních informací (PII), které se dostanou do systémů umělé inteligence prostřednictvím ad hoc sběru dat (například prostřednictvím sociálních sítí), může účast být technicky legální, ale napíná pojem “souhlas”.
Nedávné metody, které se objevily, prokázaly schopnost de-anonymizovat PII z údajně neprůhledných toků dat strojového učení. Extrakce modelu využívá přístup k API (tj. “černou skříňku” s přístupem, bez zvláštní dostupnosti zdrojového kódu nebo dat) k extrakci PII, dokonce i z poskytovatelů MLaaS s vysokou škálovatelností, včetně Amazon Web Services, zatímco útoky na členství v modelu (MIAs), které fungují pod podobnými omezeními, mohou potenciálně získat důvěrné lékařské informace; navíc útoky na atributy (AIAs) mohou obnovit citlivá data z výstupu API.
Odhalení obličejů
Pro novou studii se výzkumníci soustředili na modelový inverzní útok, který má za cíl získat identitu z podmnožiny dat o mimických výrazech, která by neměla být schopna tuto informaci odhalit.
Cílem systému bylo spojit obrázky nalezené na internetu (buď zveřejněné náhodně nebo v potenciálním úniku dat) se jejich zařazením do dat, která tvoří základ algoritmu strojového učení.
Výzkumníci vyškolili model inverzního útoku, který je schopen rekonstruovat původní obraz z anonymizovaného výstupu API, bez speciálního přístupu k původní architektuře. Předchozí práce v tomto oboru se soustředila na systémy, kde identifikace (ochrana nebo odhalení) byla cílem både cílového systému a útočného systému; v tomto případě je rámec navržen tak, aby využil výstup z jedné domény a aplikoval ho na jinou doménu.
Byla použita transponovaná konvoluční neuronová síť (CNN) k předpovědi “původního” zdrojového obličeje na základě cílového predikačního vektoru (saliency map) pro systém rozpoznávání emocí, pomocí U-Net architektury ke zlepšení výkonu rekonstrukce obličeje.

Systém re-identifikace je poháněn a informován vysvětlitelnou umělou inteligencí (XAI), kde znalost aktivace neuronu, mezi mnoha veřejnými aspekty XAI, je využita k rekonstrukci vnitřních mechanismů architektury pouze z jejího výstupu, umožňující re-identifikaci obrazů ze souboru dat.
Testování
Při testování systému aplikovali výzkumníci proti třem souborům dat: iCV-MEFED mimické výrazy; CelebA; a MNIST ručně psaná čísla. Pro přizpůsobení velikosti modelu, kterou používali výzkumníci, byly tři soubory dat přeřazeny na 128×128, 265×256 a 32×32 pixelů. 50 % každého souboru bylo použito jako trénovací data a druhá polovina byla použita jako soubor útoků pro trénování antagonistických modelů.
Každý soubor dat měl různé cílové modely a každá útočná síť byla přizpůsobena omezením vysvětlení, která podkládala proces, spíše než použití hlubších neuronových modelů, jejichž složitost by překročila generalizaci vysvětlení.
Typy vysvětlení XAI, které byly použity k napájení pokusů, zahrnovaly Gradient Explanation, Gradient Input, Grad-CAM a Layer-Wise Relevance Propagation (LRP). Výzkumníci také vyhodnotili více vysvětlení napříč experimenty.

Rekonstrukce obrazu usnadněná útokem XAI-cognizant inversion napříč třemi soubory dat, se stejnými cílovými a útočnými úkoly.
Metriky pro test byly pixelwise podobnost hodnocená Mean Squared Error (MSE); Image Similarity (SSIM), percepčně založený index podobnosti; přesnost útoku, určená tím, zda klasifikátor může úspěšně přeznačit rekonstruovaný obraz; a podobnost vloženého útoku, která porovnává funkce vložených známých zdrojových dat proti rekonstruovaným datům.
Re-identifikace byla dosažena, s různými úrovněmi podle úkolu a souborů dat, napříč všemi sadami. Kromě toho výzkumníci zjistili, že i když vytvořili náhradní cílový model (který měli samozřejmě plnou kontrolu), bylo stále možné dosáhnout re-identifikace dat z externích, “uzavřených” modelů, na základě známých principů XAI.
Výzkumníci zjistili, že nejpreciznější výsledky byly získány pomocí vysvětlení založených na aktivaci (saliency map), která propustila více PII než přístupy založené na citlivosti (gradient).
V budoucí práci tým plánuje začlenit různé typy vysvětlení XAI do nových útoků, jako jsou vizualizace funkcí a vektory aktivace konceptu.












