Kybernetická bezpečnost
Jak zabezpečit data pro trénování umělé inteligence
Umělá inteligence (AI) potřebuje data a hodně z nich. Shromažďování nezbytných informací není vždy výzvou v dnešním prostředí, s mnoha veřejnými datovými sadami a tolik dat generovaných každý den. Zabezpečení jich je však jiná věc.
Velikost dat pro trénování AI a dopad modelů AI láká pozornost kyberzločinců. Jak se závislost na AI zvyšuje, týmy, které vyvíjejí tuto technologii, by měly být opatrné, aby zajistily, že svá trénovací data udrží v bezpečí.
Proč data pro trénování AI potřebují lepší zabezpečení
Data, která používáte k trénování modelu AI, mohou odrážet reálné lidi, podniky nebo události. Jako takové můžete spravovat značné množství osobních identifikačních informací (PII), které by v případě úniku způsobily významné porušení soukromí. V roce 2023 společnost Microsoft (MSFT ) utrpěla takový incident, když náhodou zveřejnila 38 terabajtů soukromých informací během projektu výzkumu AI.
Data pro trénování AI mohou být také zranitelná vůči více škodlivým útokům na adversáře. Kyberzločinci mohou změnit spolehlivost modelu strojového učení tím, že manipulují s jeho trénovacími daty, pokud k nim získají přístup. Je to typ útoku známý jako otrávení dat, a vývojáři AI možná nebudou vědět o jeho účincích, dokud nebude příliš pozdě.
Výzkum ukazuje, že otrávení pouhých 0,001% datové sady je dostatečné k poškození modelu AI. Bez řádných ochranných opatření by takový útok mohl vést k závažným důsledkům, až bude model nasazen v reálném světě. Například poškozený algoritmus pro samořízená vozidla nemusí zaznamenat chodce. Alternativně, nástroj AI pro prohlížení životopisů může produkovat zaujaté výsledky.
V méně závažných případech by útočníci mohli ukrást proprietární informace z trénovací datové sady v rámci průmyslové špionáže. Mohli by také uzamknout autorizované uživatele z databáze a požadovat výkupné.
Jak se AI stává stále důležitějším pro život a podnikání, kyberzločinci mají více co získat z cílení na trénovací databáze. Všechna tato rizika se stávají ještě více znepokojivými.
5 kroků k zabezpečení dat pro trénování AI
Vzhledem k těmto hrozbám je třeba brát zabezpečení vážně při trénování modelů AI. Zde jsou pět kroků, které je třeba dodržovat, aby byla zajištěna bezpečnost vašich dat pro trénování AI.
1. Minimalizujte citlivé informace v trénovacích datech
Jedním z nejdůležitějších opatření je odstranit množství citlivých údajů z vaší trénovací datové sady. Čím méně PII nebo jiných cenných informací je ve vaší databázi, tím méně je lákavá pro hackery. Případný únik by byl také méně dopadový, pokud by k němu došlo.
Modely AI často nemusí používat reálná data během fáze trénování. Syntetická data jsou cennou alternativou. Modely vyškolené na syntetických datech mohou být stejně nebo dokonce přesnější než ostatní, takže se nemusíte bát problémů s výkonem. Jen se ujistěte, že vygenerovaná datová sada připomíná a chová se jako reálná data.
Alternativně můžete existující datové sady očistit od citlivých údajů, jako jsou jména, adresy a finanční informace. Pokud jsou takové faktory nezbytné pro váš model, zvažte nahrazení nimi fiktivních dat nebo výměnu mezi záznamy.
2. Omezte přístup k trénovacím datům
Jakmile jste sestavili svou trénovací datovou sadu, musíte omezit přístup k ní. Dodržujte princip nejnižších oprávnění, který stanoví, že jakýkoli uživatel nebo program by měl mít přístup pouze k tomu, co je nezbytné pro správné dokončení své práce. Každý, kdo není zapojen do procesu trénování, nemusí vidět nebo interagovat s databází.
Pamatujte, že omezení oprávnění jsou účinná pouze v případě, že také implementujete spolehlivý způsob ověření uživatelů. Uživatelské jméno a heslo nejsou dostatečné. Vícefaktorová autentizace (MFA) je nezbytná, protože zastavuje 80% až 90% všech útoků proti účtům, ale ne všechny metody MFA jsou stejné. Textová a aplikovaná MFA je obecně bezpečnější než e-mailová alternativa.
Ujistěte se, že omezíte software a zařízení, nejen uživatele. Jediné nástroje, které by měly mít přístup k trénovací databázi, jsou samotný model AI a jakýkoli program, který používáte k správě těchto poznatků během trénování.
3. Šifrujte a zálohujte data
Šifrování je další důležitou ochrannou opatření. I když ne všechny algoritmy strojového učení mohou aktivně trénovat na šifrovaných datech, můžete je šifrovat a dešifrovat během analýzy. Poté je můžete znovu zašifrovat, až budete hotovi. Alternativně můžete prozkoumat modelové struktury, které mohou analyzovat informace, zatímco jsou šifrované.
Uchovávání záloh vašich trénovacích dat v případě, že se něco stane, je důležité. Zálohování by mělo být umístěno na jiném místě než primární kopie. V závislosti na tom, jak kritické je vaše datová sada, můžete potřebovat uchovat jednu offline zálohu a jednu v cloudu. Nezapomeňte zašifrovat všechny zálohy.
Při šifrování zvolte metodu pečlivě. Vyšší standardy jsou vždy preferovány, ale můžete také zvažovat kvantově odolné kryptografické algoritmy, protože hrozba kvantových útoků roste.
4. Monitorujte přístup a použití
I když budete dodržovat tyto kroky, kyberzločinci mohou prolomit vaše obrany. Proto musíte neustále monitorovat přístup a vzorce použití vašich dat pro trénování AI.
Automatizované monitorovací řešení je zde pravděpodobně nezbytné, protože málokterá organizace má personál, který by mohl sledovat podezřelou činnost po celou dobu. Automatizace je také mnohem rychlejší při reakci, když se něco neobvyklého stane, což vede k 2,22 nižším nákladům na porušení dat v průměru z rychlejších a účinnějších reakcí.
Zaznamenejte každý přístup k datové sadě, žádosti o přístup, změny nebo jinak interagujte s ní. Kromě sledování potenciálních porušení v této činnosti pravidelně kontrolujte větší trendy. Chování autorizovaných uživatelů se může změnit časem, což může vyžadovat změnu vašich oprávnění nebo biometrických údajů, pokud takový systém používáte.
5. Pravidelně přehodnoťte rizika
Podobně musí týmy AI uvědomit, že kybernetická bezpečnost je neustálý proces, ne jednorázové řešení. Metody útoků se rychle vyvíjejí – některé zranitelnosti a hrozby mohou uniknout vaší pozornosti, než si jich všimnete. Jediný způsob, jak zůstat v bezpečí, je pravidelně přehodnocovat vaši bezpečnostní pozici.
Aspoň jednou ročně zkontrolujte váš model AI, jeho trénovací data a jakékoli bezpečnostní incidenty, které ovlivnily obě. Proveďte audit datové sady a algoritmu, abyste se ujistili, že fungují správně a nejsou přítomna žádná otrávená, zavádějící nebo jinak škodlivá data. Přizpůsobte své bezpečnostní kontroly podle potřeby všeho neobvyklého, co si všimnete.
Penetrační testování, kde bezpečnostní experti testují vaše obrany pokusem o prolomení jich, je také prospěšné. Všichni kromě 17% bezpečnostních odborníků penetračního testování aspoň jednou ročně, a 72% z nich říká, že věří, že to zastavilo porušení v jejich organizaci.
Kybernetická bezpečnost je klíčem k bezpečnému vývoji AI
Etický a bezpečný vývoj AI se stává stále důležitějším, protože se potenciální problémy kolem závislosti na strojovém učení stávají více prominentními. Zabezpečení vaší trénovací databáze je kritickým krokem při splnění této poptávky.
Data pro trénování AI jsou příliš cenná a zranitelná, aby se ignorovala jejich kybernetická rizika. Dodržujte tyto pět kroků dnes, abyste udrželi váš model a jeho datovou sadu v bezpečí.












