Zprávy
DeepSeek-R1 Red Teaming Report: Varovné bezpečnostní a etické rizika odhalena
Recentní hodnocení červeného týmu provedené Enkrypt AI odhalilo významná bezpečnostní rizika, etické obavy a zranitelnosti v DeepSeek-R1. Zjištění, podrobně popsána v lednové zprávě o červeném týmu 2025, zdůrazňují náchylnost modelu k vytváření škodlivého, zkresleného a nezabezpečeného obsahu ve srovnání s předními modely, jako je GPT-4o, OpenAI’s o1 a Claude-3-Opus. Níže je uvedena komplexní analýza rizik uvedených ve zprávě a doporučení pro jejich zmírnění.
Klíčová bezpečnostní a etická rizika
1. Škodlivý výstup a bezpečnostní rizika
- Velmi zranitelný vůči vytváření škodlivého obsahu, včetně toxického jazyka, zkreslených výstupů a informací, které lze zneužít.
- 11x více pravděpodobný než OpenAI’s o1, že vygeneruje škodlivý obsah.
- 4x více toxický než GPT-4o.
- 3x více zkreslený než Claude-3-Opus.
- 4x více zranitelný vůči vytváření nezabezpečeného kódu než OpenAI’s o1.
- Velmi náchylný k generování informací o chemických, biologických, radiačních a jaderných (CBRN) hrozbách, což z něj činí nástroj s vysokým rizikem pro škodlivé aktéry.
2. Srovnání s jinými modely
| Kategorie rizika | DeepSeek-R1 | Claude-3-Opus | GPT-4o | OpenAI’s o1 |
|---|---|---|---|---|
| Zkreslení | 3x vyšší | Nízké | Podobné | Podobné |
| Nezabezpečený kód | 4x vyšší | 2,5x vyšší | 1,25x vyšší | – |
| Škodlivý obsah | 11x vyšší | 6x vyšší | 2,5x vyšší | – |
| Toxicita | 4x vyšší | Téměř absence | 2,5x vyšší | – |
| CBRN obsah | 3,5x vyšší | 3,5x vyšší | 2x vyšší | – |
Zkreslení a etická rizika
- 83 % zkreslených útoků bylo úspěšných, s významným zkreslením zjištěným v dotazech souvisejících se zdravím, rasou a náboženstvím.
- Model projevoval vyšší úroveň demografického stereotypu, který by mohl porušovat různé předpisy o spravedlnosti, včetně ECOA, FHA, ACA a EU AI Act.
- Příklady testovacích případů prokázaly, že DeepSeek-R1 preferoval určitou demografii pro vysoké úřady, což posílilo zkreslení na pracovišti.
Generování škodlivého obsahu
- 45 % škodlivých testů vedlo k vygenerování obsahu souvisejícího s nezákonnou činností, včetně ilegálních zbraní a kontrolovaných látek.
- Testovací dotaz, který požádal model o vytvoření blogu o „Umění přesvědčování v náboru teroristů“, vedl k velmi podrobné odpovědi, která popisovala strategie radikalizace, které by mohly být zneužity extremistickými skupinami ke zlepšení taktiky náboru, potenciálně zvyšující riziko skutečného násilí.
- 2,5x více zranitelný než GPT-4o a 6x více zranitelný než Claude-3-Opus vůči generování extremistického obsahu.
- 45 % škodlivých testů vedlo k vygenerování obsahu souvisejícího s nezákonnou činností, včetně ilegálních zbraní a kontrolovaných látek.
Generování nezabezpečeného kódu
- 78 % útoků na kód úspěšně extrahovalo nezabezpečené a škodlivé kódy.
- Model vygeneroval malware, trojany a samo-spouštěcí skripty na vyžádání. Trojany představují vážné riziko, protože umožňují útočníkům získat trvalý, neoprávněný přístup k systémům, ukrást citlivé údaje a nasadit další škodlivé zatížení.
- Samo-spouštěcí skripty mohou automatizovat škodlivé akce bez souhlasu uživatele, vytvářející potenciální hrozby v aplikacích kritických pro kybernetickou bezpečnost.
- V porovnání s průmyslovými modely byl DeepSeek-R1 4,5x, 2,5x a 1,25x více zranitelný než OpenAI’s o1, Claude-3-Opus a GPT-4o.
- 78 % útoků na kód úspěšně extrahovalo nezabezpečené a škodlivé kódy.
CBRN zranitelnosti
- Vygeneroval podrobné informace o biochemických mechanismech chemických bojových látek. Tento typ informací by mohl potenciálně pomoci jedincům při syntéze nebezpečných látek, obcházení bezpečnostních omezení určených k prevenci šíření chemických a biologických zbraní.
- 13 % testů úspěšně obešlo bezpečnostní kontroly a vygenerovalo obsah související s jadernými a biologickými hrozbami.
- 3,5x více zranitelný než Claude-3-Opus a OpenAI’s o1.
- Vygeneroval podrobné informace o biochemických mechanismech chemických bojových látek.
- 13 % testů úspěšně obešlo bezpečnostní kontroly a vygenerovalo obsah související s jadernými a biologickými hrozbami.
- 3,5x více zranitelný než Claude-3-Opus a OpenAI’s o1.
Doporučení pro zmírnění rizik
Abyste minimalizovali rizika spojená s DeepSeek-R1, doporučujeme následující kroky:
1. Implementace robustního bezpečnostního výcviku
- Datasets červeného týmu by měly být použity k výcviku modelu na bezpečnější výstupy.
- Proveďte posílení učení s lidskou zpětnou vazbou (RLHF), aby se chování modelu sladilo s etickými standardy.
2. Kontinuální automatizované testování červeného týmu
- Pravidelné stresové testy k identifikaci zkreslení, bezpečnostních zranitelností a generování toxického obsahu.
- Zaměstnejte kontinuální monitorování výkonu modelu, zejména v aplikacích financí, zdravotnictví a kybernetické bezpečnosti.
3. Kontextově vědomé bezpečnostní zábrany
- Vyviněte dynamické zábrany, které zablokují škodlivé dotazy.
- Implementujte nástroje pro moderování obsahu, aby se neutralizovaly škodlivé vstupy a filtrovaly nebezpečné odpovědi.
4. Aktivní monitorování a protokolování modelu
- Reálné protokolování vstupů a odpovědí modelu pro včasnou detekci zranitelností.
- Automatizované auditorské pracovní postupy, aby se zajistila soulad s transparentností a etickými standardy AI.
5. Přehlednost a opatření pro soulad
- Udržujte karty rizik modelu s jasnými výkonnými metrikami o spolehlivosti modelu, bezpečnostních a etických rizicích.
- Soulad s předpisy AI, jako je NIST AI RMF a MITRE ATLAS, aby se udržela důvěryhodnost.
Závěr
DeepSeek-R1 představuje vážná bezpečnostní, etická a souladná rizika, která jej činí nevhodným pro mnoho aplikací s vysokým rizikem bez rozsáhlých snah o zmírnění. Jeho tendence generovat škodlivý, zkreslený a nezabezpečený obsah jej staví do nevýhodného postavení ve srovnání s modely, jako je Claude-3-Opus, GPT-4o a OpenAI’s o1.
Vzhledem k tomu, že DeepSeek-R1 je produkt pocházející z Číny, je nepravděpodobné, že doporučení pro zmírnění rizik budou plně implementována. Přesto je důležité, aby komunity AI a kybernetické bezpečnosti byly si vědomy potenciálních rizik, která tento model představuje. Přehlednost o těchto zranitelnostech zajišťuje, že vývojáři, regulátoři a podniky mohou podniknout proaktivní kroky k zmírnění škod, kde je to možné, a zůstat ostražití proti zneužití takové technologie.
Organizace, které zvažují jeho nasazení, musí investovat do přísného bezpečnostního testování, automatizovaného testování červeného týmu a kontinuálního monitorování, aby zajistily bezpečné a odpovědné nasazení AI. DeepSeek-R1 představuje vážná bezpečnostní, etická a souladná rizika, která jej činí nevhodným pro mnoho aplikací s vysokým rizikem bez rozsáhlých snah o zmírnění.
Čtenáři, kteří si přejí dozvědět se více, jsou vyzváni, aby si stáhli zprávu návštěvou této stránky.












