Modely a platformy AI

Paradoxní jed: Proč jsou větší modely AI snáze hacknutelné

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Po mnoho let se věřilo, že větší modely jsou přirozeně bezpečnější. Logika byla jednoduchá: protože větší modely jsou trénovány na obrovském množství dat, několik “poisonovaných” vzorků by bylo příliš malé na to, aby způsobilo škodu. Tento předpoklad naznačoval, že velikost přináší bezpečnost.

Ale nová výzkum odhalil znepokojivý paradox. Větší modely AI mohou být ve skutečnosti snáze otráveny. Zjištění ukazují, že útočník potřebuje pouze malé, téměř konstantní množství škodlivých vzorků, aby kompromitoval model, bez ohledu na to, jak velký je nebo kolik dat je trénován. Jak modely AI pokračují ve svém růstu, jejich relativní zranitelnost se zvyšuje místo toho, aby klesala.

Tento objev zpochybňuje jeden z hlavních předpokladů moderního vývoje AI. Donucuje komunitu k přehodnocení přístupu k bezpečnosti modelů a integritě dat ve věku masivních jazykových modelů.

Pochopení otrávení dat

Otrávení dat je forma útoku, při které útočník vkládá škodlivá nebo zavádějící data do trénovacího datasetu. Cílem je změnit chování modelu bez toho, aby byl zpozorován.

V tradičním strojovém učení může otrávení zahrnovat přidání nesprávných popisků nebo poškozených vzorků. U velkých jazykových modelů (LLM) se útok stává jemnější. Útočník může zasadit online text obsahující skryté “triggery” – speciální fráze nebo vzory, které způsobují, že model se chová určitým způsobem, až když je trénován na nich.

Například model může být trénován na odmítání škodlivých instrukcí. Ale pokud trénovací data modelu obsahují otrávené dokumenty, které spojují určitou frázi, jako je “Servius Astrumando Harmoniastra”, se škodlivým chováním, model by mohl později reagovat na tuto frázi škodlivým způsobem. Při normálním použití se model chová, jak se očekává, což činí backdoor extrémně obtížně detekovatelným.

Protože mnoho velkých modelů je trénováno pomocí textu shromážděného z otevřené sítě, je riziko vysoké. Internet je plný editovatelných a neověřených zdrojů, což usnadňuje útočníkům tiché vkládání vytvořeného obsahu, který se později stane součástí trénovacích dat modelu.

Iluze bezpečnosti ve velikosti

Abychom pochopili, proč jsou větší modely zranitelné, pomáhá se podívat, jak jsou postaveny. Velké jazykové modely, jako je GPT-4 nebo Llama, se vyvíjejí prostřednictvím dvou hlavních fází: předtrénování a jemného ladění.

Během předtrénování se model učí obecné jazykové a rozumové schopnosti z obrovského množství textu, často shromážděného z webu. Jemné ladění pak upravuje tuto znalost, aby model byl bezpečnější a užitečnější.

Pokudže předtrénování závisí na enormním množství dat, někdy obsahujícím stovky miliard tokenů, je nemožné pro organizace plně prověřit nebo vyčistit je. I malé množství škodlivých vzorků může projít nezpozorované.

Dokud nedávna většina výzkumníků věřila, že obrovská velikost dat činí takový útok nepraktickým. Předpoklad byl, že aby útočník mohl významně ovlivnit model trénovaný na trillions tokenů, musel by vložit velké procento otrávených dat, což by byla intenzivní úloha. Jinými slovy, “jedy by byly utopeny v čisté datech.”

Ale nová zjištění zpochybňují tento předpoklad. Výzkumníci ukázali, že počet otrávených příkladů potřebných k poškození modelu se nezvyšuje s velikostí datasetu. Bez ohledu na to, zda je model trénován na milionech nebo trillions tokenů, úsilí potřebné k implantaci backdooru zůstává téměř konstantní.

Tento objev znamená, že škálování již nezaručuje bezpečnost. Předpokládaný “diluční efekt” velkých datasetů je iluzí. Větší modely, s jejich pokročilými učebními schopnostmi, mohou ve skutečnosti zesílit efekt malého množství jedu.

Konstantní náklady na korupci

Výzkumníci odhalují tento překvapivý paradox prostřednictvím experimentů. Trénovali modely v rozsahu od 600 milionů do 13 miliard parametrů, každý následujícím stejné škálovací zákony, které zajišťují optimální využití dat. Navzdory rozdílu ve velikosti byl počet otrávených dokumentů potřebných k implantaci backdooru téměř stejný. V jednom pozoruhodném příkladu stačilo pouze asi 250 pečlivě vytvořených dokumentů, aby kompromitovaly jak malý, tak velký model.

Abychom to uvedli do perspektivy, tyto 250 dokumenty tvořily pouze malou část největšího datasetu. Přesto byly dostatečné k změně chování modelu, když se objevil trigger. To ukazuje, že diluční efekt velikosti nezajišťuje ochranu proti otrávení.

Protože náklady na korupci jsou konstantní, je bariéra proti útoku nízká. Útočníci nemusí ovládat centrální infrastrukturu nebo vkládat大量né množství dat. Musí pouze umístit několik otrávených dokumentů do veřejných zdrojů a čekat, až budou zahrnuty do trénování.

Proč jsou větší modely více zranitelné?

Důvod, proč jsou větší modely více zranitelné, spočívá v jejich ukázku efektivní učebné schopnosti. Větší modely jsou více schopné učit se z velmi málo příkladů, schopnost známá jako few-shot learning. Tato schopnost, ačkoli je cenná v mnoha aplikacích, je také to, co je činí více zranitelnými. Model, který se může naučit komplexní lingvistický vzor z několika příkladů, se také může naučit škodlivou asociaci z několika otrávených vzorků.

Zatímco enormní množství čistých dat by teoreticky mělo “zředět” efekt jedu, modelova lepší učební schopnost zvítězí. Stále nachází a internalizuje skrytý vzor implantovaný útočníkem. Výzkum ukazuje, že backdoor se stává účinným po tom, co model byl vystaven asi pevnému počtu otrávených vzorků, bez ohledu na to, kolik dalších dat viděl.

Navíc, protože větší modely spoléhají na obrovské datasety pro trénování, to usnadňuje útočníkům vložit jed více řídky (například 250 otrávených dokumentů mezi miliardami čistých dokumentů). Tato řídkost činí detekci extrémně obtížnou. Tradiční filtrační techniky, jako je odstranění toxického textu nebo kontrola černých seznamů URL, jsou neúčinné, když je škodlivé datum tak vzácné. Více pokročilé obrany, jako je detekce anomálií nebo shlukování vzorů, také selhávají, když je signál tak slabý. Útok se skrývá pod hlukovou podlahou, neviditelný pro současné čistící systémy.

Hrozba sahá za hranice předtrénování

Zranitelnost se nezastavuje na fázi předtrénování. Výzkumníci ukázali, že otrávení může také nastat během jemného ladění, i když jsou data předtrénování čistá.

Jemné ladění se často používá ke zlepšení bezpečnosti, zarovnání a výkonu úkolu. Ale pokud útočník zvládne vložit malé množství otrávených příkladů do této fáze, mohou stále implantovat backdoor.

V testech výzkumníci přidali otrávené vzorky během dohledovaného jemného ladění, někdy pouze několik desítek mezi tisíci normálních příkladů. Backdoor se aktivoval bez poškození modelovy přesnosti na čistých datech. Model se choval normálně v běžných testech, ale reagoval škodlivě, když se objevil tajný trigger.

I pokračující trénování na čistých datech často selhává v úplném odstranění backdooru. To vytváří riziko “spících” zranitelností mezi modely, které se zdají být bezpečné, ale mohou být využity za specifických podmínek.

Přehodnocení strategie obrany AI

Paradoxní jed ukazuje, že starý předpoklad bezpečnosti prostřednictvím velikosti již není platný. Komunita AI musí přehodnotit, jak bránit velké modely. Místo toho, aby se předpokládalo, že otrávení lze zabránit pomocí obrovského množství čistých dat, musíme předpokládat, že some korupce je nevyhnutelná.

Obrana by se měla zaměřit na zajištění a bezpečnostní opatření, ne pouze na čistotu dat. Zde jsou čtyři směry, které by měly vést nové postupy:

  1. Původ a integrita dodavatelského řetězce: Organizace musí sledovat původ a historii všech trénovacích dat. To zahrnuje ověření zdrojů, udržování kontroly verzí a vynucování bezpečnostních opatření proti útokům. Každá datová komponenta by měla být léčena s nulovou důvěrou, aby se snížilo riziko škodlivých injekcí.
  2. Adversářské testování a vyvolání: Modely by měly být aktivně testovány na skryté slabosti před nasazením. Red-teaming, adversářské prompty a behaviorální testování mohou pomoci odhalit backdoory, které by normální hodnocení mohlo minout. Cílem je donutit model, aby odhalil své skryté chování v kontrolovaném prostředí.
  3. Chránění v reálném čase a bezpečnostní zábrany: Implementujte kontrolní systémy, které monitorují chování modelu v reálném čase. Použijte behaviorální otisky, detekci anomálií na výstupech a omezující systémy, aby se zabránilo nebo omezilo poškození, i když je backdoor aktivován. Nápad je omezit dopad, místo toho, aby se pokusil zcela zabránit korupci.
  4. Persistování backdooru a obnovení: Další výzkum je potřebný k pochopení, jak dlouho backdoory přetrvávají a jak je odstranit. Post-trénovací “detoxifikace” nebo techniky oprav modelu by mohly sehrát důležitou roli. Pokud můžeme spolehlivě eliminovat skryté triggery po trénování, můžeme snížit dlouhodobé riziko.

Závěrečné shrnutí

Paradoxní jed mění, jak přemýšlíme o bezpečnosti AI. Větší modely nejsou přirozeně bezpečnější. Ve skutečnosti, jejich schopnost učit se z několika příkladů je činí více zranitelnými vůči otrávení. To neznamená, že velké modely nelze důvěřovat. Ale znamená to, že komunita musí přijmout nové strategie. Musíme přijmout, že some otrávená data vždy projdou. Výzvou je postavit systémy, které mohou detekovat, omezit a zotavit se z těchto útoků. Jak AI pokračuje ve svém růstu a vlivu, jsou sázky vysoké. Lekce z nového výzkumu je jasná: velikost sama o sobě není štít. Bezpečnost musí být postavena s předpokladem, že útočníci budou využívat každou slabost, bez ohledu na to, jak malou.

Dr. Tehseen Zia je docent s trvalým úvazkem na COMSATS University Islamabad, držitel titulu PhD v oblasti AI z Vienna University of Technology, Rakousko. Specializuje se na umělou inteligenci, strojové učení, datové vědy a počítačové vidění, a významně přispěl publikacemi v renomovaných vědeckých časopisech. Dr. Tehseen také vedl různé průmyslové projekty jako hlavní výzkumník a působil jako konzultant pro umělou inteligenci.