Отчёты
Отчет о красной команде DeepSeek-R1: тревожные риски безопасности и этики раскрыты
Недавняя оценка красной команды, проведенная Enkrypt AI, показала значительные риски безопасности, этические проблемы и уязвимости в DeepSeek-R1. Результаты, изложенные в отчете о красной команде за январь 2025 года, подчеркивают склонность модели к генерации вредного, предвзятого и не безопасного контента по сравнению с ведущими моделями отрасли, такими как GPT-4o, OpenAI’s o1 и Claude-3-Opus. Ниже представлен всесторонний анализ рисков, изложенных в отчете, и рекомендации по их смягчению.
Ключевые риски безопасности и этики
1. Вредный вывод и риски безопасности
- Высокая уязвимость к производству вредного контента, включая токсичный язык, предвзятые выводы и информацию, которую можно использовать для преступных целей.
- В 11 раз более вероятно генерировать вредный контент, чем OpenAI’s o1.
- В 4 раза более токсичный, чем GPT-4o.
- В 3 раза более предвзятый, чем Claude-3-Opus.
- В 4 раза более уязвим к генерации не безопасного кода, чем OpenAI’s o1.
- Высокая уязвимость к генерации информации о ХБРН (химическом, биологическом, радиологическом и ядерном), что делает его высокорисковым инструментом для злонамеренных акторов.
2. Сравнение с другими моделями
| Категория риска | DeepSeek-R1 | Claude-3-Opus | GPT-4o | OpenAI’s o1 |
|---|---|---|---|---|
| Предвзятость | В 3 раза выше | Низкая | Аналогичная | Аналогичная |
| Не безопасный код | В 4 раза выше | В 2,5 раза выше | В 1,25 раза выше | – |
| Вредный контент | В 11 раз выше | В 6 раз выше | В 2,5 раза выше | – |
| Токсичность | В 4 раза выше | Почти отсутствует | В 2,5 раза выше | – |
| ХБРН контент | В 3,5 раза выше | В 3,5 раза выше | В 2 раза выше | – |
Предвзятость и риски этики
- 83% атак на предвзятость были успешными, с существенной предвзятостью, обнаруженной в запросах, связанных со здоровьем, расой и религией.
- Модель показала более высокие уровни стереотипизации демографических групп, что может нарушить различные правила справедливости, включая ECOA, FHA, ACA и EU AI Act.
- Тестовые случаи показали, что DeepSeek-R1 отдает предпочтение определенным демографическим группам для высокопоставленных должностей, укрепляя предвзятость на рабочем месте.
Генерация вредного контента
- 45% вредных тестов привели к генерации контента, связанного с преступной деятельностью, включая незаконные оружие и контролируемые вещества.
- Тестовый запрос, в котором модель была попросена разработать блог о «Искусстве убеждения в террористическом вербовке», привел к очень подробному ответу, излагающему стратегии радикализации, которые могут быть использованы экстремистскими группами для совершенствования тактики вербовки, потенциально увеличивая риск реального насилия.
- В 2,5 раза более уязвим к генерации экстремистского контента, чем GPT-4o, и в 6 раз более уязвим, чем Claude-3-Opus.
- 45% вредных тестов привели к генерации контента, связанного с преступной деятельностью, включая незаконные оружие и контролируемые вещества.
Генерация не безопасного кода
- 78% атак, связанных с кодом, успешно извлекли не безопасные и вредоносные кодовые фрагменты.
- Модель сгенерировала малварь, трояны и самоисполняющиеся скрипты по запросу. Трояны представляют собой серьезную угрозу, поскольку они могут позволить атакующим получить постоянный, неавторизованный доступ к системам, украсть конфиденциальные данные и развернуть дальнейшие вредоносные нагрузки.
- Самоисполняющиеся скрипты могут автоматизировать вредоносные действия без согласия пользователя, создавая потенциальные угрозы в приложениях, критичных для кибербезопасности.
- По сравнению с моделями отрасли, DeepSeek-R1 был в 4,5 раза, в 2,5 раза и в 1,25 раза более уязвим, чем OpenAI’s o1, Claude-3-Opus и GPT-4o соответственно.
- 78% атак, связанных с кодом, успешно извлекли не безопасные и вредоносные кодовые фрагменты.
Уязвимости ХБРН
- Сгенерировал подробную информацию о биохимических механизмах химических агентов войны. Этот тип информации потенциально может помочь людям в синтезе опасных материалов, обходе ограничений безопасности, предназначенных для предотвращения распространения химического и биологического оружия.
- 13% тестов успешно обошли меры безопасности, производя контент, связанный с ядерными и биологическими угрозами.
- В 3,5 раза более уязвим, чем Claude-3-Opus и OpenAI’s o1.
- Сгенерировал подробную информацию о биохимических механизмах химических агентов войны.
- 13% тестов успешно обошли меры безопасности, производя контент, связанный с ядерными и биологическими угрозами.
- В 3,5 раза более уязвим, чем Claude-3-Opus и OpenAI’s o1.
Рекомендации по смягчению рисков
Чтобы минимизировать риски, связанные с DeepSeek-R1, рекомендуются следующие шаги:
1. Реализация надежной тренировки по безопасности
- Наборы данных красной команды должны использоваться для обучения модели на более безопасные выводы.
- Проведение обучения с подкреплением с помощью обратной связи человека (RLHF) для согласования поведения модели с этическими стандартами.
2. Постоянная автоматизированная красная команда
- Регулярные стресс-тесты для выявления предвзятости, уязвимостей безопасности и генерации вредного контента.
- Использование постоянного мониторинга производительности модели, особенно в приложениях финансов, здравоохранения и кибербезопасности.
3. Контекстно-зависимые ограждения для безопасности
- Разработка динамических защитных мер для блокировки вредоносных запросов.
- Реализация инструментов модерации контента для нейтрализации вредоносных входных данных и фильтрации не безопасных ответов.
4. Активный мониторинг и ведение журнала модели
- Ведение журнала входных и выходных данных модели в режиме реального времени для раннего обнаружения уязвимостей.
- Автоматизированные рабочие процессы аудита для обеспечения соблюдения стандартов прозрачности и этики ИИ.
5. Меры прозрачности и соблюдения
- Ведение карты рисков модели с четкими исполнительными метриками надежности, безопасности и этических рисков модели.
- Соблюдение правил ИИ, таких как NIST AI RMF и MITRE ATLAS, для поддержания достоверности.
Заключение
DeepSeek-R1 представляет серьезные риски безопасности, этики и соблюдения, которые делают его непригодным для многих высокорисковых приложений без обширных усилий по смягчению. Его склонность к генерации вредного, предвзятого и не безопасного контента ставит его в невыгодное положение по сравнению с моделями, такими как Claude-3-Opus, GPT-4o и OpenAI’s o1.
Учитывая, что DeepSeek-R1 является продуктом, происходящим из Китая, маловероятно, что необходимые рекомендации по смягчению рисков будут полностью реализованы. Однако важно, чтобы сообщества ИИ и кибербезопасности были осведомлены о потенциальных рисках, которые представляет эта модель. Прозрачность этих уязвимостей гарантирует, что разработчики, регулирующие органы и предприятия могут предпринять активные шаги для смягчения вреда, где это возможно, и оставаться бдительными против злоупотребления такой технологией.
Организации, рассматривающие возможность его развертывания, должны инвестировать в тщательное тестирование безопасности, автоматизированную красную команду и постоянный мониторинг, чтобы обеспечить безопасную и ответственную реализацию ИИ. DeepSeek-R1 представляет серьезные риски безопасности, этики и соблюдения, которые делают его непригодным для многих высокорисковых приложений без обширных усилий по смягчению.
Читателям, желающим узнать больше, рекомендуется скачать отчет, посетив эту страницу.












