Cyberbeveiliging

Hoe kun je AI-trainingsgegevens beveiligen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Kunstmatige intelligentie (AI) heeft gegevens nodig en veel ervan. Het verzamelen van de benodigde informatie is niet altijd een uitdaging in de huidige omgeving, met veel openbare datasets beschikbaar en zo veel gegevens die elke dag worden gegenereerd. Beveiligen is echter een andere kwestie.

De enorme omvang van AI-trainingsdatasets en de impact van de AI-modellen trekken de aandacht van cybercriminelen. Naarmate de afhankelijkheid van AI toeneemt, moeten de teams die deze technologie ontwikkelen voorzichtig zijn om ervoor te zorgen dat ze hun trainingsgegevens veilig houden.

Waarom AI-trainingsgegevens betere beveiliging nodig hebben

De gegevens die u gebruikt om een AI-model te trainen, kunnen werkelijke mensen, bedrijven of gebeurtenissen weerspiegelen. Als zodanig kunt u een aanzienlijke hoeveelheid persoonlijk identificeerbare informatie (PII) beheren, die aanzienlijke privacy-schendingen zou veroorzaken als deze wordt blootgesteld. In 2023 heeft Microsoft (MSFT ) een dergelijk incident meegemaakt, waarbij per ongeluk 38 terabytes aan privé-informatie werd blootgesteld tijdens een AI-onderzoeksproject.

AI-trainingsdatasets kunnen ook kwetsbaar zijn voor meer schadelijke tegenwerkende aanvallen. Cybercriminelen kunnen de betrouwbaarheid van een machine learning-model manipuleren door de trainingsgegevens te manipuleren als ze toegang kunnen krijgen. Het is een aanvalstype dat bekend staat als gegevensvergiftiging, en AI-ontwikkelaars kunnen de gevolgen mogelijk niet opmerken totdat het te laat is.

Onderzoek toont aan dat het vergiftigen van slechts 0,001% van een dataset voldoende is om een AI-model te corrumperen. Zonder adequate bescherming kan een aanval zoals deze ernstige gevolgen hebben zodra het model in de praktijk wordt toegepast. Bijvoorbeeld, een gecorrumpeerd algoritme voor zelfrijdende auto’s kan falen om voetgangers te zien. Alternatief kan een AI-hulpmiddel voor het scannen van cv’s vertekende resultaten produceren.

In minder ernstige omstandigheden kunnen aanvallers propriëtaire informatie uit een trainingsdataset stelen in een daad van industriële spionage. Ze kunnen ook geautoriseerde gebruikers uit de database uitsluiten en losgeld eisen.

Naarmate AI steeds belangrijker wordt voor het leven en de business, hebben cybercriminelen meer te winnen bij het richten op trainingsdatabases. Al deze risico’s worden hierdoor nog verontrustender.

5 stappen om AI-trainingsgegevens te beveiligen

In het licht van deze bedreigingen moet u de beveiliging serieus nemen bij het trainen van AI-modellen. Hier zijn vijf stappen om te volgen om uw AI-trainingsgegevens te beveiligen.

1. Minimaleer gevoelige informatie in trainingsdatasets

Een van de belangrijkste maatregelen is om de hoeveelheid gevoelige details in uw trainingsdataset te verwijderen. Hoe minder PII of andere waardevolle informatie in uw database aanwezig is, hoe minder het een doelwit is voor hackers. Een inbraak zal ook minder ingrijpend zijn als deze plaatsvindt in deze scenario’s.

AI-modellen hebben vaak geen echte wereldinformatie nodig tijdens de trainingsfase. Synthetische gegevens zijn een waardevol alternatief. Modellen getraind op synthetische gegevens kunnen net zo, zo niet nog nauwkeuriger zijn dan anderen, dus u hoeft zich geen zorgen te maken over prestatieproblemen. Zorg er alleen voor dat de gegenereerde dataset op echte wereldgegevens lijkt en zich als zodanig gedraagt.

Alternatief kunt u bestaande datasets van gevoelige details zoals namen, adressen en financiële informatie schoonmaken. Wanneer dergelijke factoren nodig zijn voor uw model, overweeg dan om ze te vervangen door dummy-gegevens of ze tussen records te wisselen.

2. Beperk toegang tot trainingsgegevens

Zodra u uw trainingsdataset hebt samengesteld, moet u de toegang ertoe beperken. Volg het principe van de minste privileges, dat wil zeggen dat elke gebruiker of programma alleen toegang moet hebben tot wat nodig is om de taak correct uit te voeren. Iedereen die niet bij het trainingsproces is betrokken, hoeft de database niet te zien of te gebruiken.

Onthoud dat privilegebeperkingen alleen effectief zijn als u ook een betrouwbare manier implementeert om gebruikers te verifiëren. Een gebruikersnaam en wachtwoord zijn niet voldoende. Multi-factor authenticatie (MFA) is essentieel, aangezien het 80% tot 90% van alle aanvallen op accounts tegenhoudt, maar niet alle MFA-methoden zijn gelijk. Text-based en app-based MFA is over het algemeen veiliger dan e-mailgebaseerde alternatieven.

Zorg ervoor dat u software en apparaten beperkt, niet alleen gebruikers. De enige tools met toegang tot de trainingsdatabase moeten het AI-model zelf zijn en eventuele programma’s die u gebruikt om deze inzichten te beheren tijdens de training.

3. Versleutel en back-up gegevens

Versleuteling is een andere cruciale beschermingsmaatregel. Hoewel niet alle machine learning-algoritmen actief kunnen trainen op versleutelde gegevens, kunt u deze versleutelen en ontsleutelen tijdens de analyse. Vervolgens kunt u deze opnieuw versleutelen zodra u klaar bent. Alternatief kunt u naar modelstructuren zoeken die informatie kunnen analyseren terwijl deze versleuteld is.

Het is belangrijk om back-ups van uw trainingsgegevens te maken voor het geval er iets met deze gegevens gebeurt. Back-ups moeten op een andere locatie worden opgeslagen dan de primaire kopie. Afhankelijk van hoe kritiek uw dataset is, moet u mogelijk één offline back-up en één in de cloud bewaren. Onthoud dat u alle back-ups moet versleutelen.

Wanneer het gaat om versleuteling, kies uw methode zorgvuldig. Hogere standaarden zijn altijd preferabel, maar u kunt quantum-resistente cryptografische algoritmen overwegen, aangezien de dreiging van quantum-aanvallen toeneemt.

4. Bewaak toegang en gebruik

Zelfs als u deze andere stappen volgt, kunnen cybercriminelen door uw verdediging heen breken. Daarom moet u toegang en gebruikspatronen van uw AI-trainingsgegevens continu bewaken.

Een geautomatiseerde bewakingsoplossing is hier waarschijnlijk noodzakelijk, aangezien weinig organisaties het personeel hebben om naar verdachte activiteit te kijken. Automatisering is ook veel sneller in het nemen van actie wanneer er iets ongebruikelijks gebeurt, wat leidt tot een gemiddelde verlaging van de kosten van gegevensinbreuken met $2,22 door snellere en effectievere reacties.

Registreer elke keer dat iemand of iets toegang heeft tot de dataset, een verzoek doet om toegang, deze verandert of op een andere manier interacteert. Naast het controleren van potentiële inbreuken in deze activiteit, moet u deze regelmatig controleren op grotere trends. Het gedrag van geautoriseerde gebruikers kan in de loop van de tijd veranderen, wat een wijziging in uw toegangsrechten of gedragsbiometrie kan vereisen als u een dergelijk systeem gebruikt.

5. Beoordeel risico’s regelmatig opnieuw

Evenzo moeten AI-ontwikkelingsteams beseffen dat beveiliging een voortdurend proces is, niet een eenmalige oplossing. Aanvalsmethoden evolueren snel – sommige kwetsbaarheden en bedreigingen kunnen door de mazen heen glippen voordat u ze opmerkt. De enige manier om veilig te blijven is om uw beveiligingspositie regelmatig te beoordelen.

Minstens één keer per jaar moet u uw AI-model, de trainingsgegevens en eventuele beveiligingsincidenten die deze hebben beïnvloed, controleren. Controleer de dataset en het algoritme om ervoor te zorgen dat deze correct werken en dat er geen vergiftigde, misleidende of anderszins schadelijke gegevens aanwezig zijn. Pas uw beveiligingscontroles aan naar behoefte op basis van eventuele ongebruikelijke zaken die u opmerkt.

Penetratietesten, waarbij beveiligingsexperts uw verdediging testen door te proberen deze te doorbreken, zijn ook nuttig. Maar 17% van de cybersecurity-professionals voert penetratietests uit, en 72% van degenen die dit doen, zegt dat het een inbraak bij hun organisatie heeft voorkomen.

Beveiliging is de sleutel tot veilige AI-ontwikkeling

Ethische en veilige AI-ontwikkeling wordt steeds belangrijker naarmate potentiële problemen rondom de afhankelijkheid van machine learning toenemen. Het beveiligen van uw trainingsdatabase is een kritische stap in het voldoen aan deze vraag.

AI-trainingsgegevens zijn te waardevol en kwetsbaar om de cyberrisico’s te negeren. Volg deze vijf stappen vandaag om uw model en de bijbehorende dataset veilig te houden.

Zac Amos is een tech-schrijver die zich richt op kunstmatige intelligentie. Hij is ook de Features Editor bij ReHack, waar u meer van zijn werk kunt lezen.