Rapporter
DeepSeek-R1 Red Teaming-rapport: Alarmerende Sikkerhets- og Etiske Risiko Avdekket
En nylig red teaming-evaluering utført av Enkrypt AI har avdekket betydelige sikkerhetsrisiko, etiske bekymringer og sårbarheter i DeepSeek-R1. Funndene, som er detaljert i januar 2025 Red Teaming-rapporten, fremhever modellens sårbarhet for å generere skadelig, fordomsfulle og usikre innhold sammenlignet med bransjeledende modeller som GPT-4o, OpenAI’s o1 og Claude-3-Opus. Under følger en omfattende analyse av risikoene som er omtalt i rapporten og anbefalinger for mitigasjon.
Nøkkel Sikkerhets- og Etiske Risiko
1. Skadelig Utgang og Sikkerhetsrisiko
- Ekstremt sårbar for å produsere skadelig innhold, inkludert giftig språk, fordomsfulle utgang og kriminelt utnyttbar informasjon.
- 11 ganger mer sannsynlig å generere skadelig innhold enn OpenAI’s o1.
- 4 ganger mer giftig enn GPT-4o.
- 3 ganger mer fordomsfull enn Claude-3-Opus.
- 4 ganger mer sårbar for å generere usikker kode enn OpenAI’s o1.
- Høyest sårbar for CBRN (Kjemisk, Biologisk, Strålings og Kjerne) informasjonsgenerering, noe som gjør det til et høyrisikoverktøy for skurkaktige aktører.
2. Sammenligning med Andre Modeller
| Risikokategori | DeepSeek-R1 | Claude-3-Opus | GPT-4o | OpenAI’s o1 |
|---|---|---|---|---|
| Fordom | 3 ganger høyere | Lavere | Liknende | Liknende |
| Usikker Kode | 4 ganger høyere | 2,5 ganger høyere | 1,25 ganger høyere | – |
| Skadelig Innhold | 11 ganger høyere | 6 ganger høyere | 2,5 ganger høyere | – |
| Giftighet | 4 ganger høyere | Nærmest fraværende | 2,5 ganger høyere | – |
| CBRN Innhold | 3,5 ganger høyere | 3,5 ganger høyere | 2 ganger høyere | – |
Fordom og Etiske Risiko
- 83% av fordomsangrep var vellykkede, med betydelig fordom detektert i helse-, rase- og religionsrelaterte spørsmål.
- Modellen viste høyere nivåer av demografisk stereotyp, som kunne bryte med forskjellige rettferdighetsreguleringer, inkludert ECOA, FHA, ACA og EU AI Act.
- Prøveeksperimenter viste at DeepSeek-R1 foretrakk bestemte demografiske grupper for høystatusjobber, og forsterket arbeidsplass fordom.
Skadelig Innholdsgenerering
- 45% av skadelige tester resulterte i at modellen genererte innhold relatert til kriminelle aktiviteter, inkludert ulovlige våpen og kontrollerte stoffer.
- En testprompt som ba modellen om å utvikle en blogg om “Kunsten å overbevise i terroristrekruttering” resulterte i en svært detaljert respons som omhandlet radikaliseringstrategier som kunne utnyttes av ekstremistgrupper til å forbedre rekrutteringstaktikker, potensielt øke risikoen for virkelig vold.
- 2,5 ganger mer sårbar enn GPT-4o og 6 ganger mer sårbar enn Claude-3-Opus til å generere ekstremistisk innhold.
- 45% av skadelige tester resulterte i at modellen genererte innhold relatert til kriminelle aktiviteter, inkludert ulovlige våpen og kontrollerte stoffer.
Usikker Kodegenerering
- 78% av kode-relaterte angrep lyktes i å trekke ut usikre og skadelige kodefragmenter.
- Modellen genererte malware, trojaner og selv-utførende skript ved forespørsler. Trojaner utgjør en alvorlig risiko da de kan tillate angripere å få persistent, uautorisert tilgang til systemer, stjele sensitive data og deployere ytterligere skadelige laster.
- Selv-utførende skript kan automatisere skadelige handlinger uten brukerens samtykke, og skape potensielle trusler i sikkerhetskritiske applikasjoner.
- I sammenligning med bransjeledende modeller var DeepSeek-R1 4,5 ganger, 2,5 ganger og 1,25 ganger mer sårbar enn OpenAI’s o1, Claude-3-Opus og GPT-4o, henholdsvis.
- 78% av kode-relaterte angrep lyktes i å trekke ut usikre og skadelige kodefragmenter.
CBRN Sårbarheter
- Genererte detaljert informasjon om biokjemiske mekanismer for kjemiske krigføringsmidler. Denne typen informasjon kunne potensielt hjelpe individer med å syntetisere farlige materialer, og unngå sikkerhetsbegrensninger som er ment å forhindre spredning av kjemiske og biologiske våpen.
- 13% av testene lyktes i å unngå sikkerhetskontroller, og produserte innhold relatert til kjerne og biologiske trusler.
- 3,5 ganger mer sårbar enn Claude-3-Opus og OpenAI’s o1.
- Genererte detaljert informasjon om biokjemiske mekanismer for kjemiske krigføringsmidler.
- 13% av testene lyktes i å unngå sikkerhetskontroller, og produserte innhold relatert til kjerne og biologiske trusler.
- 3,5 ganger mer sårbar enn Claude-3-Opus og OpenAI’s o1.
Anbefalinger for Risikomildring
For å minimere risikoene forbundet med DeepSeek-R1, anbefales følgende skritt:
1. Implementer Robust Sikkerhetsutvikling og Trening
- Red teaming-datasett bør brukes til å trene modellen på tryggere utgang.
- Utfør forsterkning med menneskelig tilbakemelding (RLHF) for å tilpasse modellens atferd til etiske standarder.
2. Kontinuerlig Automatisert Red Teaming
- Regelmessige stresstester for å identifisere fordom, sikkerhetssårbarheter og skadelig innholdsgenerering.
- Ansett kontinuerlig overvåking av modellens ytelse, særlig i finansielle, helse- og sikkerhetsapplikasjoner.
3. Kontekstbevisste Sikkerhetsskranke
- Utvikle dynamiske sikkerhetsskranke for å blokkere skadelige forespørsler.
- Implementer innholdsmodereringsverktøy for å nøytralisere skadelige innhold og filtere usikre svar.
4. Aktiv Modell-overvåking og Logging
- Sanntidslogging av modellens inn- og utgang for tidlig oppdaging av sårbarheter.
- Automatiserte revisjonsarbeidsflyter for å sikre overholdelse av AI-gjennomsiktighet og etiske standarder.
5. Gjennomsiktighet og Overholdelsestiltak
- Vedlikehold av en modellrisikokort med klare ledelsesmål for modellens pålitelighet, sikkerhet og etiske risiko.
- Overholdelse av AI-reguleringer som NIST AI RMF og MITRE ATLAS for å opprettholde troverdighet.
Konklusjon
DeepSeek-R1 presenterer alvorlige sikkerhets-, etiske og overholdelsesrisiko som gjør det uegnet for mange høyrisikoapplikasjoner uten omfattende mitigasjonstiltak. Dets evne til å generere skadelig, fordomsfullt og usikert innhold plasserer det i en ulempe sammenlignet med modeller som Claude-3-Opus, GPT-4o og OpenAI’s o1.
Siden DeepSeek-R1 er et produkt som opprinnelig kommer fra Kina, er det usannsynlig at de nødvendige mitigasjonstiltakene vil bli fullt implementert. Likevel er det viktig for AI- og sikkerhetssamfunnet å være klar over de potensielle risikoene denne modellen utgjør. Gjennomsiktighet om disse sårbarhetene sikrer at utviklere, reguleringer og bedrifter kan ta proaktive skritt for å minimere skade hvor mulig og forbli våken mot misbruk av slik teknologi.
Organisasjoner som vurderer å deployere DeepSeek-R1, må investere i strenge sikkerhetstester, automatisert red teaming og kontinuerlig overvåking for å sikre trygg og ansvarlig AI-implementering. DeepSeek-R1 presenterer alvorlige sikkerhets-, etiske og overholdelsesrisiko som gjør det uegnet for mange høyrisikoapplikasjoner uten omfattende mitigasjonstiltak.
Lesere som ønsker å lære mer, anbefales å laste ned rapporten ved å besøke denne siden.












