Cybersikkerhed
Sådan sikrer du AI-træningsdata
Kunstig intelligens (AI) har brug for data og massevis af det. At samle den nødvendige information er ikke altid en udfordring i dagens miljø, hvor der er mange offentlige datasæt til rådighed og så meget data genereres hver dag. At sikre det er en anden sag.
Den enorme størrelse af AI-træningsdatasæt og virkningen af AI-modellerne tiltrækker opmærksomhed fra cyberkriminelle. Da afhængigheden af AI øger, skal udviklingsteamsene være forsigtige og sikre, at de holder deres træningsdata sikre.
Hvorfor AI-træningsdata har brug for bedre sikkerhed
Data, som du bruger til at træne en AI-model, kan afspejle virkelige mennesker, virksomheder eller begivenheder. Som sådan kan du være ved at håndtere en betydelig mængde personfølsomme oplysninger (PII), som ville medføre betydelige brud på privatlivet, hvis de blev afsløret. I 2023 led Microsoft (MSFT ) under en sådan begivenhed, da de utilsigtet afslørede 38 terabyte private oplysninger under et AI-forskningsprojekt.
AI-træningsdatasæt kan også være sårbare over for mere skadelige modstanderangreb. Cyberkriminelle kan ændre pålideligheden af en maskinlæringsmodel ved at manipulere dens træningsdata, hvis de kan få adgang til det. Det er en angrebstype, der kendes som dataforgiftning, og AI-udviklere kan måske ikke opdage virkningerne, før det er for sent.
Forskning viser, at forgiftning af blot 0,001% af et datasæt er nok til at korrumperere en AI-model. Uden ordentlige beskyttelser kan et angreb af denne type føre til alvorlige konsekvenser, når modellen ser virkelighedens implementering. For eksempel kan en korrupt selvstyrende algoritme måske ikke opdage fodgængere. Alternativt kan et AI-værktøj til at gennemse CV’er producere forkortede resultater.
I mindre alvorlige omstændigheder kan angribere stjæle fortrolige oplysninger fra et træningsdatasæt i et akt af industriel spionage. De kan også låse autoriserede brugere ude af databasen og kræve løsepenge.
Da AI bliver mere og mere vigtig for liv og forretning, har cyberkriminelle mere at vinde ved at angribe træningsdatabaser. Alle disse risici bliver derefter endnu mere bekymrende.
5 trin til at sikre AI-træningsdata
I lyset af disse trusler skal man tage sikkerhed alvorligt, når man træner AI-modeller. Her er fem trin at følge for at sikre din AI-træningsdata.
1. Minimer følsomme oplysninger i træningsdatasæt
En af de vigtigste foranstaltninger er at fjerne mængden af følsomme detaljer i dit træningsdatasæt. Jo mindre PII eller andre værdifulde oplysninger, der er i din database, jo mindre er det et mål for hackere. Et brud vil også være mindre omfattende, hvis det sker i disse scenarier.
AI-modeller har ofte ikke brug for at bruge virkelige oplysninger under træningsfasen. Synthetiske data er en værdifuld alternativ. Modeller, der er trænet på synthetiske data, kan være lige så nøjagtige, hvis ikke mere nøjagtige end andre, så du behøver ikke at bekymre dig om problemer med ydeevnen. Sørg bare for, at det genererede datasæt ligner og fungerer som virkelige data.
Alternativt kan du rense eksisterende datasæt for følsomme detaljer som personers navne, adresser og finansielle oplysninger. Når sådanne faktorer er nødvendige for din model, kan du overveje at erstatte dem med dummydata eller bytte dem mellem poster.
2. Begræns adgangen til træningsdata
Når du har samlet dit træningsdatasæt, skal du begrænse adgangen til det. Følg principperne om mindst tilladelser, som fastsætter, at enhver bruger eller program kun skal have adgang til, hvad der er nødvendigt for at udføre sit arbejde korrekt. Enhver, der ikke er involveret i træningsprocessen, har ikke brug for at se eller interagere med databasen.
Husk, at tilladelsesbegrænsninger kun er effektive, hvis du også implementerer en pålidelig måde at verificere brugere på. Et brugernavn og adgangskode er ikke nok. Multifaktorautentificering (MFA) er essentiel, da den stopper 80% til 90% af alle angreb mod konti, men ikke alle MFA-metoder er lige sikre. Tekstbaseret og app-baseret MFA er generelt sikrere end email-baserede alternativer.
Sørg for at begrænse software og enheder, ikke kun brugere. De eneste værktøjer, der har adgang til træningsdatabasen, skal være AI-modellen selv og eventuelle programmer, du bruger til at administrere disse indsigt under træning.
3. Kryptér og sikkerhedskopier data
Kryptering er en anden afgørende beskyttelsesforanstaltning. Selv om ikke alle maskinlæringsalgoritmer kan aktivt træne på krypteret data, kan du kryptere og dekryptere det under analyse. Derefter kan du kryptere det igen, når du er færdig. Alternativt kan du se på modellstrukturen, der kan analysere oplysninger, mens de er krypteret.
At holde sikkerhedskopier af din træningsdata i tilfælde af, at noget sker med det, er vigtigt. Sikkerhedskopierne skal være på en anden placering end den primære kopi. Afhængigt af, hvor kritisk dit datasæt er, kan du måske være nødt til at holde en sikkerhedskopi offline og en i skyen. Husk at kryptere alle sikkerhedskopier også.
Når det kommer til kryptering, skal du vælge din metode omhyggeligt. Højere standarder er altid at foretrække, men du kan også overveje kvantumresistente krypteringsalgoritmer, da truslen om kvantumangreb stiger.
4. Overvåg adgang og brug
Selv om du følger disse andre trin, kan cyberkriminelle bryde igennem dine forsvar. Derfor skal du løbende overvåge adgangs- og brugsmønstre med din AI-træningsdata.
En automatiseret overvågningsløsning er sandsynligvis nødvendig her, da få organisationer har den nødvendige personale til at holde øje med mistænkelige aktiviteter døgnet rundt. Automatisering er også langt hurtigere til at reagere, når noget usædvanligt sker, hvilket fører til 2,22 lavere omkostninger ved dataudlad i gennemsnit fra hurtigere og mere effektive reaktioner.
Optegn hver gang, nogen eller noget adgang til datasættet, anmoder om adgang til det, ændrer det eller på anden måde interagerer med det. Ud over at overvåge potentielle brud i denne aktivitet skal du også regelmæssigt gennemgå den for større tendenser. Autoriserede brugeres adfærd kan ændre sig over tid, hvilket kan kræve en ændring i dine adgangsrettigheder eller biometriske adfærd, hvis du bruger sådan et system.
5. Gennemgå risici regelmæssigt
På samme måde skal AI-udviklingsteams forstå, at cybersikkerhed er en løbende proces, ikke en engangsordning. Angrebsmetoder udvikler sig hurtigt – nogle sårbarheder og trusler kan glide igennem sprækkerne, før du opdager dem. Den eneste måde at forblive sikker på er at gennemgå din sikkerhedsposition regelmæssigt.
Mindst en gang om året skal du gennemgå din AI-model, dens træningsdata og eventuelle sikkerhedsincidenter, der har påvirket enten af dem. Gennemgå datasættet og algoritmen for at sikre, at det fungerer korrekt, og at der ikke er noget forgiftet, misvisende eller på anden måde skadeligt data til stede. Tilpas dine sikkerheds kontroller efter behov til noget usædvanligt, du opdager.
Penetrationstest, hvor sikkerhedseksperter tester dine forsvar ved at forsøge at bryde igennem dem, er også fordelagtigt. Alle undtagen 17% af sikkerhedseksperter penetrationstest mindst en gang om året, og 72% af dem, der gør det, mener, at det har forhindret et brud i deres organisation.
Cybersikkerhed er nøgle til sikker AI-udvikling
Etisk og sikker AI-udvikling bliver mere og mere vigtig, da potentielle problemer omkring afhængighed af maskinlæring bliver mere fremtrædende. At sikre din træningsdatabase er et kritisk skridt i at opfylde dette krav.
AI-træningsdata er for værdifuld og sårbar til at ignorere dens cyberrisici. Følg disse fem trin i dag for at holde din model og dens datasæt sikre.












