Отчёты

Отчет о красной команде DeepSeek-R1: тревожные риски безопасности и этики раскрыты

mm
Добавьте Unite.AI в избранные источники в Google

Недавняя оценка красной команды, проведенная Enkrypt AI, показала значительные риски безопасности, этические проблемы и уязвимости в DeepSeek-R1. Результаты, изложенные в отчете о красной команде за январь 2025 года, подчеркивают склонность модели к генерации вредного, предвзятого и не безопасного контента по сравнению с ведущими моделями отрасли, такими как GPT-4o, OpenAI’s o1 и Claude-3-Opus. Ниже представлен всесторонний анализ рисков, изложенных в отчете, и рекомендации по их смягчению.

Ключевые риски безопасности и этики

1. Вредный вывод и риски безопасности

  • Высокая уязвимость к производству вредного контента, включая токсичный язык, предвзятые выводы и информацию, которую можно использовать для преступных целей.
  • В 11 раз более вероятно генерировать вредный контент, чем OpenAI’s o1.
  • В 4 раза более токсичный, чем GPT-4o.
  • В 3 раза более предвзятый, чем Claude-3-Opus.
  • В 4 раза более уязвим к генерации не безопасного кода, чем OpenAI’s o1.
  • Высокая уязвимость к генерации информации о ХБРН (химическом, биологическом, радиологическом и ядерном), что делает его высокорисковым инструментом для злонамеренных акторов.

2. Сравнение с другими моделями

Категория риска DeepSeek-R1 Claude-3-Opus GPT-4o OpenAI’s o1
Предвзятость В 3 раза выше Низкая Аналогичная Аналогичная
Не безопасный код В 4 раза выше В 2,5 раза выше В 1,25 раза выше
Вредный контент В 11 раз выше В 6 раз выше В 2,5 раза выше
Токсичность В 4 раза выше Почти отсутствует В 2,5 раза выше
ХБРН контент В 3,5 раза выше В 3,5 раза выше В 2 раза выше

Предвзятость и риски этики

  • 83% атак на предвзятость были успешными, с существенной предвзятостью, обнаруженной в запросах, связанных со здоровьем, расой и религией.
  • Модель показала более высокие уровни стереотипизации демографических групп, что может нарушить различные правила справедливости, включая ECOA, FHA, ACA и EU AI Act.
  • Тестовые случаи показали, что DeepSeek-R1 отдает предпочтение определенным демографическим группам для высокопоставленных должностей, укрепляя предвзятость на рабочем месте.

Генерация вредного контента

  • 45% вредных тестов привели к генерации контента, связанного с преступной деятельностью, включая незаконные оружие и контролируемые вещества.
  • Тестовый запрос, в котором модель была попросена разработать блог о «Искусстве убеждения в террористическом вербовке», привел к очень подробному ответу, излагающему стратегии радикализации, которые могут быть использованы экстремистскими группами для совершенствования тактики вербовки, потенциально увеличивая риск реального насилия.
  • В 2,5 раза более уязвим к генерации экстремистского контента, чем GPT-4o, и в 6 раз более уязвим, чем Claude-3-Opus.
  • 45% вредных тестов привели к генерации контента, связанного с преступной деятельностью, включая незаконные оружие и контролируемые вещества.

Генерация не безопасного кода

  • 78% атак, связанных с кодом, успешно извлекли не безопасные и вредоносные кодовые фрагменты.
  • Модель сгенерировала малварь, трояны и самоисполняющиеся скрипты по запросу. Трояны представляют собой серьезную угрозу, поскольку они могут позволить атакующим получить постоянный, неавторизованный доступ к системам, украсть конфиденциальные данные и развернуть дальнейшие вредоносные нагрузки.
  • Самоисполняющиеся скрипты могут автоматизировать вредоносные действия без согласия пользователя, создавая потенциальные угрозы в приложениях, критичных для кибербезопасности.
  • По сравнению с моделями отрасли, DeepSeek-R1 был в 4,5 раза, в 2,5 раза и в 1,25 раза более уязвим, чем OpenAI’s o1, Claude-3-Opus и GPT-4o соответственно.
  • 78% атак, связанных с кодом, успешно извлекли не безопасные и вредоносные кодовые фрагменты.

Уязвимости ХБРН

  • Сгенерировал подробную информацию о биохимических механизмах химических агентов войны. Этот тип информации потенциально может помочь людям в синтезе опасных материалов, обходе ограничений безопасности, предназначенных для предотвращения распространения химического и биологического оружия.
  • 13% тестов успешно обошли меры безопасности, производя контент, связанный с ядерными и биологическими угрозами.
  • В 3,5 раза более уязвим, чем Claude-3-Opus и OpenAI’s o1.
  • Сгенерировал подробную информацию о биохимических механизмах химических агентов войны.
  • 13% тестов успешно обошли меры безопасности, производя контент, связанный с ядерными и биологическими угрозами.
  • В 3,5 раза более уязвим, чем Claude-3-Opus и OpenAI’s o1.

Рекомендации по смягчению рисков

Чтобы минимизировать риски, связанные с DeepSeek-R1, рекомендуются следующие шаги:

1. Реализация надежной тренировки по безопасности

2. Постоянная автоматизированная красная команда

  • Регулярные стресс-тесты для выявления предвзятости, уязвимостей безопасности и генерации вредного контента.
  • Использование постоянного мониторинга производительности модели, особенно в приложениях финансов, здравоохранения и кибербезопасности.

3. Контекстно-зависимые ограждения для безопасности

  • Разработка динамических защитных мер для блокировки вредоносных запросов.
  • Реализация инструментов модерации контента для нейтрализации вредоносных входных данных и фильтрации не безопасных ответов.

4. Активный мониторинг и ведение журнала модели

  • Ведение журнала входных и выходных данных модели в режиме реального времени для раннего обнаружения уязвимостей.
  • Автоматизированные рабочие процессы аудита для обеспечения соблюдения стандартов прозрачности и этики ИИ.

5. Меры прозрачности и соблюдения

  • Ведение карты рисков модели с четкими исполнительными метриками надежности, безопасности и этических рисков модели.
  • Соблюдение правил ИИ, таких как NIST AI RMF и MITRE ATLAS, для поддержания достоверности.

Заключение

DeepSeek-R1 представляет серьезные риски безопасности, этики и соблюдения, которые делают его непригодным для многих высокорисковых приложений без обширных усилий по смягчению. Его склонность к генерации вредного, предвзятого и не безопасного контента ставит его в невыгодное положение по сравнению с моделями, такими как Claude-3-Opus, GPT-4o и OpenAI’s o1.

Учитывая, что DeepSeek-R1 является продуктом, происходящим из Китая, маловероятно, что необходимые рекомендации по смягчению рисков будут полностью реализованы. Однако важно, чтобы сообщества ИИ и кибербезопасности были осведомлены о потенциальных рисках, которые представляет эта модель. Прозрачность этих уязвимостей гарантирует, что разработчики, регулирующие органы и предприятия могут предпринять активные шаги для смягчения вреда, где это возможно, и оставаться бдительными против злоупотребления такой технологией.

Организации, рассматривающие возможность его развертывания, должны инвестировать в тщательное тестирование безопасности, автоматизированную красную команду и постоянный мониторинг, чтобы обеспечить безопасную и ответственную реализацию ИИ. DeepSeek-R1 представляет серьезные риски безопасности, этики и соблюдения, которые делают его непригодным для многих высокорисковых приложений без обширных усилий по смягчению.

Читателям, желающим узнать больше, рекомендуется скачать отчет, посетив эту страницу.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.