Звіти
Звіт про червоне командування DeepSeek-R1: викриті тривожні ризики безпеки та етики
Нещодавнє оцінювання червоним командуванням, проведене компанією Enkrypt AI, виявило суттєві ризики безпеки, етичні проблеми та вразливості у DeepSeek-R1. Виявлені результати, деталізовані у звіті про червоне командування за січень 2025 року, підкреслюють схильність моделі до генерації шкідливого, упередженого та незахищеного вмісту порівняно з лідерами галузі, такими як GPT-4o, OpenAI’s o1 та Claude-3-Opus. Нижче наведено комплексний аналіз ризиків, викладених у звіті, та рекомендації щодо їх мінімізації.
Ключові ризики безпеки та етики
1. Шкідливий вивід та ризики безпеки
- Високий ризик генерації шкідливого вмісту, включаючи токсичний мовлення, упереджені висновки та інформацію, яку можна використати у злочинних цілях.
- У 11 разів більше схильний до генерації шкідливого вмісту порівняно з OpenAI’s o1.
- У 4 рази більше токсичний порівняно з GPT-4o.
- У 3 рази більше упереджений порівняно з Claude-3-Opus.
- У 4 рази більше вразливий до генерації незахищеного коду порівняно з OpenAI’s o1.
- Високий ризик генерації інформації про Хімічні, Біологічні, Радіологічні та Ядерні загрози, що робить його високоризикованим інструментом для зловмисників.
2. Порівняння з іншими моделями
| Категорія ризику | DeepSeek-R1 | Claude-3-Opus | GPT-4o | OpenAI’s o1 |
|---|---|---|---|---|
| Упередженість | У 3 рази вища | Нижча | Подібна | Подібна |
| Незахищений код | У 4 рази вищий | У 2,5 рази вищий | У 1,25 рази вищий | – |
| Шкідливий вміст | У 11 разів вищий | У 6 разів вищий | У 2,5 рази вищий | – |
| Токсичність | У 4 рази вища | Практично відсутня | У 2,5 рази вища | – |
| Хімічні, Біологічні, Радіологічні та Ядерні загрози | У 3,5 рази вища | У 3,5 рази вища | У 2 рази вища | – |
Упередженість та етичні ризики
- 83% успішних атак упередженості, з суттєвою упередженістю, виявленою у запитах, пов’язаних зі здоров’ям, расою та релігією.
- Модель демонструє вищі рівні стереотипів щодо демографічних груп, що може порушувати різні нормативні акти щодо справедливості, включаючи ECOA, FHA, ACA та EU AI Act.
- Тестові випадки продемонстрували, що DeepSeek-R1 віддає перевагу певним демографічним групам для високопоставлених посад, посилюючи упередженість на робочому місці.
Генерація шкідливого вмісту
- 45% шкідливих тестів призвели до генерації вмісту, пов’язаного з злочинними діями, включаючи незаконні зброю та контрольовані речовини.
- Тестовий запит, який просив модель розробити блог про «Мистецтво переконання у вербуванні терористів», призвів до детального відповіді, який розробляє стратегії радикалізації, які можуть бути використані екстремістськими групами для вдосконалення тактики вербування, потенційно збільшуючи ризик реального насильства.
- У 2,5 рази більше вразливий до генерації екстремістського вмісту порівняно з GPT-4o та у 6 разів більше порівняно з Claude-3-Opus.
- 45% шкідливих тестів призвели до генерації вмісту, пов’язаного з злочинними діями, включаючи незаконні зброю та контрольовані речовини.
Генерація незахищеного коду
- 78% успішних атак на код призвели до генерації незахищеного та шкідливого коду.
- Модель генерувала злом, трояни та самозапускаємий скрипти у відповідь на запити. Трояни становлять серйозну загрозу, оскільки можуть дозволити зловмисникам отримати постійний, неавторизований доступ до систем, викрасти конфіденційну інформацію та розгорнути подальші шкідливі вантажі.
- Самозапускаємий скрипти можуть автоматизувати шкідливі дії без згоди користувача, створюючи потенційні загрози у критичних для кібербезпеки додатках.
- Порівняно з індустріальними моделями, DeepSeek-R1 був у 4,5 рази, у 2,5 рази та у 1,25 рази більше вразливий порівняно з OpenAI’s o1, Claude-3-Opus та GPT-4o відповідно.
- 78% атак на код призвели до генерації незахищеного та шкідливого коду.
Хімічні, Біологічні, Радіологічні та Ядерні загрози
- Генерував детальну інформацію про біохімічні механізми хімічної зброї. Ця інформація потенційно може допомогти особам у синтезі небезпечних матеріалів, обходячи обмеження безпеки, призначені для запобігання поширення хімічної та біологічної зброї.
- 13% тестів успішно обійшли заходи безпеки, генеруючи вміст, пов’язаний з ядерними та біологічними загрозами.
- У 3,5 рази більше вразливий порівняно з Claude-3-Opus та OpenAI’s o1.
- Генерував детальну інформацію про біохімічні механізми хімічної зброї.
- 13% тестів успішно обійшли заходи безпеки, генеруючи вміст, пов’язаний з ядерними та біологічними загрозами.
- У 3,5 рази більше вразливий порівняно з Claude-3-Opus та OpenAI’s o1.
Рекомендації щодо мінімізації ризиків
Щоб мінімізувати ризики, пов’язані з DeepSeek-R1, рекомендується виконати наступні кроки:
1. Реалізувати надійне навчання безпеки
- Дані червоного командування повинні бути використані для навчання моделі на безпечніший вивід.
- Провести навчання з підкріпленням за допомогою людської оцінки (RLHF), щоб виправити поведінку моделі згідно з етичними стандартами.
2. Постійне автоматичне червоне командування
- Регулярні стрес-тести для виявлення упередженості, вразливостей безпеки та генерації шкідливого вмісту.
- Застосувати постійний моніторинг продуктивності моделі, особливо у сфері фінансів, охорони здоров’я та кібербезпеки.
3. Контекстно-залежні заходи безпеки
- Розробити динамічні засоби захисту для блокування шкідливих запитів.
- Реалізувати інструменти модерації вмісту для нейтралізації шкідливого вводу та фільтрації небезпечних відповідей.
4. Активний моніторинг та реєстрація моделі
- Реальна реєстрація вводу та виводу моделі для раннього виявлення вразливостей.
- Автоматизовані робочі потоки аудиту для забезпечення відповідності стандартам прозорості та етики штучного інтелекту.
5. Заходи прозорості та відповідності
- Утримувати картку ризиків моделі з чіткими виконавчими метриками надійності, безпеки та етичних ризиків моделі.
- Відповідати нормативним вимогам штучного інтелекту, таким як NIST AI RMF та MITRE ATLAS, для підтримання довіри.
Висновок
DeepSeek-R1 представляє серйозні ризики безпеки, етики та відповідності, які роблять його непридатним для багатьох високоризикованих застосунків без суттєвих зусиль щодо мінімізації ризиків. Його схильність до генерації шкідливого, упередженого та незахищеного вмісту ставить його у невигідне становище порівняно з моделями, такими як Claude-3-Opus, GPT-4o та OpenAI’s o1.
Оскільки DeepSeek-R1 є продуктом, що походять з Китаю, малоймовірно, що необхідні рекомендації щодо мінімізації ризиків будуть повністю реалізовані. Однак залишається важливим для спільнот штучного інтелекту та кібербезпеки бути обізнаними про потенційні ризики, які ця модель представляє. Прозорість щодо цих вразливостей забезпечує, що розробники, регулятори та підприємства можуть вжити активних заходів для мінімізації шкоди, де це можливо, та залишатися пильними щодо зловживання такої технології.
Організації, які розглядають можливість його розгорнення, повинні інвестувати у суворе тестування безпеки, автоматичне червоне командування та постійний моніторинг, щоб забезпечити безпечне та відповідальне застосування штучного інтелекту. DeepSeek-R1 представляє серйозні ризики безпеки, етики та відповідності, які роблять його непридатним для багатьох високоризикованих застосунків без суттєвих зусиль щодо мінімізації ризиків.
Читачам, які бажають дізнатися більше, рекомендується завантажити звіт, відвідавши цю сторінку.












