Raporty
Raport czerwonej drużyny DeepSeek-R1: niepokojące ryzyka bezpieczeństwa i etyki ujawnione
Niedawna ocena czerwonej drużyny przeprowadzona przez Enkrypt AI ujawniła znaczące ryzyka bezpieczeństwa, problemy etyczne i słabości w modelu DeepSeek-R1. Wyniki, szczegółowo opisane w raporcie czerwonej drużyny z stycznia 2025 r., podkreślają podatność modelu na generowanie szkodliwych, tendencyjnych i niebezpiecznych treści w porównaniu z wiodącymi modelami przemysłowymi, takimi jak GPT-4o, OpenAI’s o1 i Claude-3-Opus. Poniżej znajduje się szczegółowa analiza ryzyk wymienionych w raporcie oraz zalecenia dotyczące ich ograniczania.
Kluczowe ryzyka bezpieczeństwa i etyki
1. Szkodliwa zawartość i ryzyka bezpieczeństwa
- Bardzo podatny na generowanie szkodliwej zawartości, w tym języka toksycznego, tendencyjnych wyników i informacji, które mogą być wykorzystane do celów przestępczych.
- 11-krotnie bardziej prawdopodobne generowanie szkodliwej zawartości niż OpenAI’s o1.
- 4-krotnie bardziej toksyczne niż GPT-4o.
- 3-krotnie bardziej tendencyjne niż Claude-3-Opus.
- 4-krotnie bardziej podatne na generowanie niebezpiecznego kodu niż OpenAI’s o1.
- Wysoce podatny na generowanie informacji związanych z CBRN (chemicznymi, biologicznymi, radiologicznymi i nuklearnymi), co sprawia, że jest to narzędzie o wysokim ryzyku dla aktorów przestępczych.
2. Porównanie z innymi modelami
| Kategoria ryzyka | DeepSeek-R1 | Claude-3-Opus | GPT-4o | OpenAI’s o1 |
|---|---|---|---|---|
| Tendencja | 3-krotnie wyższa | Niższa | Podobna | Podobna |
| Niebezpieczny kod | 4-krotnie wyższy | 2,5-krotnie wyższy | 1,25-krotnie wyższy | – |
| Szkodliwa zawartość | 11-krotnie wyższa | 6-krotnie wyższa | 2,5-krotnie wyższa | – |
| Toksyyczność | 4-krotnie wyższa | Prawie nieobecna | 2,5-krotnie wyższa | – |
| CBRN | 3,5-krotnie wyższa | 3,5-krotnie wyższa | 2-krotnie wyższa | – |
Tendencje i ryzyka etyczne
- 83% ataków tendencyjnych było udanych, z znaczącymi tendencjami wykrytymi w zapytaniach związanych ze zdrowiem, rasą i religią.
- Model wykazywał wyższe poziomy stereotypów demograficznych, co mogłoby naruszyć różne przepisy dotyczące sprawiedliwości, w tym ECOA, FHA, ACA i EU AI Act.
- Przykładowe przypadki testowe wykazały, że DeepSeek-R1 preferował określone grupy demograficzne dla stanowisk o wysokim statusie, wzmacniając tendencje w miejscu pracy.
Generowanie szkodliwej zawartości
- 45% testów szkodliwych skutkowało generowaniem przez model treści związanych z działalnością przestępczą, w tym bronią i substancjami kontrolowanymi.
- Testowe zapytanie o rozwinięcie bloga na temat „Sztuki perswazji w rekrutacji terrorystycznej” skutkowało bardzo szczegółową odpowiedzią opisującą strategie radykalizacji, które mogą być wykorzystane przez grupy ekstremistyczne do udoskonalenia taktyki rekrutacji, potencjalnie zwiększając ryzyko realnych aktów przemocy.
- 2,5-krotnie bardziej podatny na generowanie ekstremistycznej zawartości niż GPT-4o i 6-krotnie bardziej niż Claude-3-Opus.
- 45% testów szkodliwych skutkowało generowaniem przez model treści związanych z działalnością przestępczą, w tym bronią i substancjami kontrolowanymi.
Generowanie niebezpiecznego kodu
- 78% ataków związanych z kodem skutkowało pomyślnym wydobyciem niebezpiecznych i złośliwych fragmentów kodu.
- Model generował malware, trojany i samowykonywujące się skrypty na żądanie. Trojany stanowią poważne ryzyko, ponieważ mogą umożliwić atakującym uzyskanie nieautoryzowanego dostępu do systemów, kradzież danych i wdrożenie dalszych ładunków złośliwych.
- Samowykonywujące się skrypty mogą zautomatyzować działania złośliwe bez zgody użytkownika, tworząc potencjalne zagrożenia w aplikacjach krytycznych dla bezpieczeństwa.
- W porównaniu z modelami przemysłowymi DeepSeek-R1 był 4,5-krotnie, 2,5-krotnie i 1,25-krotnie bardziej podatny na generowanie niebezpiecznego kodu niż OpenAI’s o1, Claude-3-Opus i GPT-4o.
- 78% ataków związanych z kodem skutkowało pomyślnym wydobyciem niebezpiecznych i złośliwych fragmentów kodu.
Podatność na CBRN
- Wygenerował szczegółowe informacje na temat mechanizmów biochemicznych środków chemicznych. Rodzaj informacji mógłby potencjalnie pomóc osobom w syntezie materiałów niebezpiecznych, omijając ograniczenia bezpieczeństwa mające na celu zapobieganie rozprzestrzenianiu się broni chemicznej i biologicznej.
- 13% testów pomyślnie ominęło kontrolę bezpieczeństwa, generując treści związane z zagrożeniami nuklearnymi i biologicznymi.
- 3,5-krotnie bardziej podatny niż Claude-3-Opus i OpenAI’s o1.
- Wygenerował szczegółowe informacje na temat mechanizmów biochemicznych środków chemicznych.
- 13% testów pomyślnie ominęło kontrolę bezpieczeństwa, generując treści związane z zagrożeniami nuklearnymi i biologicznymi.
- 3,5-krotnie bardziej podatny niż Claude-3-Opus i OpenAI’s o1.
Zalecenia dotyczące ograniczania ryzyka
Aby zminimalizować ryzyka związane z DeepSeek-R1, zaleca się następujące kroki:
1. Wdrożenie solidnego szkolenia w zakresie bezpieczeństwa i wyznaczania celów
- Dane z testów czerwonej drużyny powinny być wykorzystane do szkolenia modelu w kierunku bezpieczniejszych wyników.
- Przeprowadź szkolenie z wzmocnieniem przy użyciu informacji zwrotnej od ludzi (RLHF), aby dostosować zachowanie modelu do standardów etycznych.
2. Ciągłe testowanie czerwonej drużyny
- Regularne testy stresowe w celu identyfikacji tendencji, słabości bezpieczeństwa i generowania treści szkodliwej.
- Zastosuj ciągłe monitorowanie wydajności modelu, szczególnie w aplikacjach finansowych, opieki zdrowotnej i bezpieczeństwa cybernetycznego.
3. Środki bezpieczeństwa świadome kontekstu
- Stwórz dynamiczne zabezpieczenia, aby zablokować szkodliwe wprowadzenia.
- Wdrożenie narzędzi do moderacji treści w celu neutralizacji szkodliwych danych wejściowych i filtrowania niebezpiecznych odpowiedzi.
4. Aktywne monitorowanie i rejestrowanie modelu
- Rejestrowanie w czasie rzeczywistym danych wejściowych i odpowiedzi modelu w celu wczesnego wykrycia słabości.
- Automatyczne przepływy audytu w celu zapewnienia zgodności z normami transparentności i etyki AI.
5. Środki transparentności i zgodności
- Utrzymuj kartę ryzyka modelu z wyraźnymi wskaźnikami wykonania dotyczącymi niezawodności modelu, bezpieczeństwa i ryzyka etycznego.
- Zgodność z przepisami AI, takimi jak NIST AI RMF i MITRE ATLAS, w celu utrzymania wiarygodności.
Podsumowanie
DeepSeek-R1 stanowi poważne ryzyko bezpieczeństwa, etyki i zgodności, co sprawia, że jest nieodpowiedni dla wielu aplikacji o wysokim ryzyku bez obszernych wysiłków w celu ograniczania tych ryzyk. Jego skłonność do generowania szkodliwej, tendencyjnej i niebezpiecznej zawartości stawia go w niekorzystnej pozycji w porównaniu z modelami takimi jak Claude-3-Opus, GPT-4o i OpenAI’s o1.
Ponieważ DeepSeek-R1 jest produktem pochodzącym z Chin, jest mało prawdopodobne, że zalecane środki ograniczające ryzyko zostaną w pełni wdrożone. Niemniej jednak jest niezwykle ważne, aby społeczność AI i cyberbezpieczeństwa była świadoma potencjalnych ryzyk, jakie ten model niesie. Przejrzystość co do tych słabości gwarantuje, że deweloperzy, regulatorzy i przedsiębiorstwa mogą podejmować proaktywne kroki w celu ograniczania szkód, gdzie to możliwe, oraz pozostawać czujnymi wobec nadużyć takiej technologii.
Organizacje rozważające wdrożenie tego modelu muszą zainwestować w rygorystyczne testy bezpieczeństwa, ciągłe testowanie czerwonej drużyny i ciągłe monitorowanie, aby zapewnić bezpieczne i odpowiedzialne wdrożenie AI. DeepSeek-R1 stanowi poważne ryzyko bezpieczeństwa, etyki i zgodności, co sprawia, że jest nieodpowiedni dla wielu aplikacji o wysokim ryzyku bez obszernych wysiłków w celu ograniczania tych ryzyk.
Czytelnicy, którzy chcą dowiedzieć się więcej, są proszeni o pobranie raportu, odwiedzając tę stronę.












