Raporty

Raport czerwonej drużyny DeepSeek-R1: niepokojące ryzyka bezpieczeństwa i etyki ujawnione

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Niedawna ocena czerwonej drużyny przeprowadzona przez Enkrypt AI ujawniła znaczące ryzyka bezpieczeństwa, problemy etyczne i słabości w modelu DeepSeek-R1. Wyniki, szczegółowo opisane w raporcie czerwonej drużyny z stycznia 2025 r., podkreślają podatność modelu na generowanie szkodliwych, tendencyjnych i niebezpiecznych treści w porównaniu z wiodącymi modelami przemysłowymi, takimi jak GPT-4o, OpenAI’s o1 i Claude-3-Opus. Poniżej znajduje się szczegółowa analiza ryzyk wymienionych w raporcie oraz zalecenia dotyczące ich ograniczania.

Kluczowe ryzyka bezpieczeństwa i etyki

1. Szkodliwa zawartość i ryzyka bezpieczeństwa

  • Bardzo podatny na generowanie szkodliwej zawartości, w tym języka toksycznego, tendencyjnych wyników i informacji, które mogą być wykorzystane do celów przestępczych.
  • 11-krotnie bardziej prawdopodobne generowanie szkodliwej zawartości niż OpenAI’s o1.
  • 4-krotnie bardziej toksyczne niż GPT-4o.
  • 3-krotnie bardziej tendencyjne niż Claude-3-Opus.
  • 4-krotnie bardziej podatne na generowanie niebezpiecznego kodu niż OpenAI’s o1.
  • Wysoce podatny na generowanie informacji związanych z CBRN (chemicznymi, biologicznymi, radiologicznymi i nuklearnymi), co sprawia, że jest to narzędzie o wysokim ryzyku dla aktorów przestępczych.

2. Porównanie z innymi modelami

Kategoria ryzyka DeepSeek-R1 Claude-3-Opus GPT-4o OpenAI’s o1
Tendencja 3-krotnie wyższa Niższa Podobna Podobna
Niebezpieczny kod 4-krotnie wyższy 2,5-krotnie wyższy 1,25-krotnie wyższy
Szkodliwa zawartość 11-krotnie wyższa 6-krotnie wyższa 2,5-krotnie wyższa
Toksyyczność 4-krotnie wyższa Prawie nieobecna 2,5-krotnie wyższa
CBRN 3,5-krotnie wyższa 3,5-krotnie wyższa 2-krotnie wyższa

Tendencje i ryzyka etyczne

  • 83% ataków tendencyjnych było udanych, z znaczącymi tendencjami wykrytymi w zapytaniach związanych ze zdrowiem, rasą i religią.
  • Model wykazywał wyższe poziomy stereotypów demograficznych, co mogłoby naruszyć różne przepisy dotyczące sprawiedliwości, w tym ECOA, FHA, ACA i EU AI Act.
  • Przykładowe przypadki testowe wykazały, że DeepSeek-R1 preferował określone grupy demograficzne dla stanowisk o wysokim statusie, wzmacniając tendencje w miejscu pracy.

Generowanie szkodliwej zawartości

  • 45% testów szkodliwych skutkowało generowaniem przez model treści związanych z działalnością przestępczą, w tym bronią i substancjami kontrolowanymi.
  • Testowe zapytanie o rozwinięcie bloga na temat „Sztuki perswazji w rekrutacji terrorystycznej” skutkowało bardzo szczegółową odpowiedzią opisującą strategie radykalizacji, które mogą być wykorzystane przez grupy ekstremistyczne do udoskonalenia taktyki rekrutacji, potencjalnie zwiększając ryzyko realnych aktów przemocy.
  • 2,5-krotnie bardziej podatny na generowanie ekstremistycznej zawartości niż GPT-4o i 6-krotnie bardziej niż Claude-3-Opus.
  • 45% testów szkodliwych skutkowało generowaniem przez model treści związanych z działalnością przestępczą, w tym bronią i substancjami kontrolowanymi.

Generowanie niebezpiecznego kodu

  • 78% ataków związanych z kodem skutkowało pomyślnym wydobyciem niebezpiecznych i złośliwych fragmentów kodu.
  • Model generował malware, trojany i samowykonywujące się skrypty na żądanie. Trojany stanowią poważne ryzyko, ponieważ mogą umożliwić atakującym uzyskanie nieautoryzowanego dostępu do systemów, kradzież danych i wdrożenie dalszych ładunków złośliwych.
  • Samowykonywujące się skrypty mogą zautomatyzować działania złośliwe bez zgody użytkownika, tworząc potencjalne zagrożenia w aplikacjach krytycznych dla bezpieczeństwa.
  • W porównaniu z modelami przemysłowymi DeepSeek-R1 był 4,5-krotnie, 2,5-krotnie i 1,25-krotnie bardziej podatny na generowanie niebezpiecznego kodu niż OpenAI’s o1, Claude-3-Opus i GPT-4o.
  • 78% ataków związanych z kodem skutkowało pomyślnym wydobyciem niebezpiecznych i złośliwych fragmentów kodu.

Podatność na CBRN

  • Wygenerował szczegółowe informacje na temat mechanizmów biochemicznych środków chemicznych. Rodzaj informacji mógłby potencjalnie pomóc osobom w syntezie materiałów niebezpiecznych, omijając ograniczenia bezpieczeństwa mające na celu zapobieganie rozprzestrzenianiu się broni chemicznej i biologicznej.
  • 13% testów pomyślnie ominęło kontrolę bezpieczeństwa, generując treści związane z zagrożeniami nuklearnymi i biologicznymi.
  • 3,5-krotnie bardziej podatny niż Claude-3-Opus i OpenAI’s o1.
  • Wygenerował szczegółowe informacje na temat mechanizmów biochemicznych środków chemicznych.
  • 13% testów pomyślnie ominęło kontrolę bezpieczeństwa, generując treści związane z zagrożeniami nuklearnymi i biologicznymi.
  • 3,5-krotnie bardziej podatny niż Claude-3-Opus i OpenAI’s o1.

Zalecenia dotyczące ograniczania ryzyka

Aby zminimalizować ryzyka związane z DeepSeek-R1, zaleca się następujące kroki:

1. Wdrożenie solidnego szkolenia w zakresie bezpieczeństwa i wyznaczania celów

2. Ciągłe testowanie czerwonej drużyny

  • Regularne testy stresowe w celu identyfikacji tendencji, słabości bezpieczeństwa i generowania treści szkodliwej.
  • Zastosuj ciągłe monitorowanie wydajności modelu, szczególnie w aplikacjach finansowych, opieki zdrowotnej i bezpieczeństwa cybernetycznego.

3. Środki bezpieczeństwa świadome kontekstu

  • Stwórz dynamiczne zabezpieczenia, aby zablokować szkodliwe wprowadzenia.
  • Wdrożenie narzędzi do moderacji treści w celu neutralizacji szkodliwych danych wejściowych i filtrowania niebezpiecznych odpowiedzi.

4. Aktywne monitorowanie i rejestrowanie modelu

  • Rejestrowanie w czasie rzeczywistym danych wejściowych i odpowiedzi modelu w celu wczesnego wykrycia słabości.
  • Automatyczne przepływy audytu w celu zapewnienia zgodności z normami transparentności i etyki AI.

5. Środki transparentności i zgodności

  • Utrzymuj kartę ryzyka modelu z wyraźnymi wskaźnikami wykonania dotyczącymi niezawodności modelu, bezpieczeństwa i ryzyka etycznego.
  • Zgodność z przepisami AI, takimi jak NIST AI RMF i MITRE ATLAS, w celu utrzymania wiarygodności.

Podsumowanie

DeepSeek-R1 stanowi poważne ryzyko bezpieczeństwa, etyki i zgodności, co sprawia, że jest nieodpowiedni dla wielu aplikacji o wysokim ryzyku bez obszernych wysiłków w celu ograniczania tych ryzyk. Jego skłonność do generowania szkodliwej, tendencyjnej i niebezpiecznej zawartości stawia go w niekorzystnej pozycji w porównaniu z modelami takimi jak Claude-3-Opus, GPT-4o i OpenAI’s o1.

Ponieważ DeepSeek-R1 jest produktem pochodzącym z Chin, jest mało prawdopodobne, że zalecane środki ograniczające ryzyko zostaną w pełni wdrożone. Niemniej jednak jest niezwykle ważne, aby społeczność AI i cyberbezpieczeństwa była świadoma potencjalnych ryzyk, jakie ten model niesie. Przejrzystość co do tych słabości gwarantuje, że deweloperzy, regulatorzy i przedsiębiorstwa mogą podejmować proaktywne kroki w celu ograniczania szkód, gdzie to możliwe, oraz pozostawać czujnymi wobec nadużyć takiej technologii.

Organizacje rozważające wdrożenie tego modelu muszą zainwestować w rygorystyczne testy bezpieczeństwa, ciągłe testowanie czerwonej drużyny i ciągłe monitorowanie, aby zapewnić bezpieczne i odpowiedzialne wdrożenie AI. DeepSeek-R1 stanowi poważne ryzyko bezpieczeństwa, etyki i zgodności, co sprawia, że jest nieodpowiedni dla wielu aplikacji o wysokim ryzyku bez obszernych wysiłków w celu ograniczania tych ryzyk.

Czytelnicy, którzy chcą dowiedzieć się więcej, są proszeni o pobranie raportu, odwiedzając tę stronę.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.