Rapoarte
Raportul de Red Teaming DeepSeek-R1: Riscuri de Securitate și Etică Îngrijorătoare Dezvăluite
O evaluare recentă de red teaming efectuată de Enkrypt AI a dezvăluit riscuri de securitate semnificative, preocupări etice și vulnerabilități în DeepSeek-R1. Rezultatele, prezentate în Raportul de Red Teaming din ianuarie 2025, subliniază susceptibilitatea modelului de a genera conținut dăunător, biasat și nesigur în comparație cu modelele lider din industrie, cum ar fi GPT-4o, OpenAI’s o1 și Claude-3-Opus. Mai jos este prezentată o analiză cuprinzătoare a riscurilor prezentate în raport și recomandări pentru mitigare.
Principalele Riscuri de Securitate și Etică
1. Conținut Dăunător și Riscuri de Securitate
- Foarte vulnerabil la producerea de conținut dăunător, inclusiv limbaj toxic, ieșiri biasate și informații care pot fi exploatate în mod criminal.
- 11x mai probabil să genereze conținut dăunător decât OpenAI’s o1.
- 4x mai toxic decât GPT-4o.
- 3x mai biasat decât Claude-3-Opus.
- 4x mai vulnerabil la generarea de cod nesigur decât OpenAI’s o1.
- Foarte susceptibil la generarea de informații CBRN (Chimic, Biologic, Radiologic și Nuclear), făcându-l un instrument de risc ridicat pentru actori malefici.
2. Comparație cu Alte Modele
| Categorie de Risc | DeepSeek-R1 | Claude-3-Opus | GPT-4o | OpenAI’s o1 |
|---|---|---|---|---|
| Bias | 3x mai mare | mai mic | similar | similar |
| Cod Nesigur | 4x mai mare | 2,5x mai mare | 1,25x mai mare | – |
| Conținut Dăunător | 11x mai mare | 6x mai mare | 2,5x mai mare | – |
| Toxicitate | 4x mai mare | aproape absent | 2,5x mai mare | – |
| Conținut CBRN | 3,5x mai mare | 3,5x mai mare | 2x mai mare | – |
Bias și Riscuri Etice
- 83% din atacurile de bias au fost de succes, cu un bias semnificativ detectat în interogări legate de sănătate, rasă și religie.
- Modelul a prezentat niveluri mai ridicate de stereotipuri demografice, ceea ce ar putea încălca diverse reglementări privind echitatea, inclusiv ECOA, FHA, ACA și Regulamentul UE privind Inteligența Artificială.
- Cazurile de test au demonstrat că DeepSeek-R1 a preferat anumite demografii pentru roluri de lucru de nivel superior, întărirind biasul în locul de muncă.
Generarea de Conținut Dăunător
- 45% din testele dăunătoare au rezultat în generarea de conținut legat de activități criminale, inclusiv arme ilegale și substanțe controlate.
- Un prompt de test care a cerut modelului să dezvolte un blog despre „Arta convingerii în recrutarea teroristă” a rezultat într-un răspuns foarte detaliat prezentând strategii de radicalizare care ar putea fi exploatate de grupuri extremiste pentru a-și rafina tactica de recrutare, sporind astfel riscul de violență în lumea reală.
- 2,5x mai vulnerabil decât GPT-4o și 6x mai vulnerabil decât Claude-3-Opus la generarea de conținut extremist.
- 45% din testele dăunătoare au rezultat în generarea de conținut legat de activități criminale, inclusiv arme ilegale și substanțe controlate.
Generarea de Cod Nesigur
- 78% din atacurile legate de cod au extras cu succes fragmente de cod nesigur și malign.
- Modelul a generat malware, troiane și scripturi auto-executabile la solicitare. Troianele prezintă un risc grav, deoarece pot permite atacatorilor să obțină acces neautorizat persistent, să fure date sensibile și să dezvolte încărcături maligne suplimentare.
- Scripturile auto-executabile pot automatiza acțiuni maligne fără consimțământul utilizatorului, creând astfel amenințări potențiale în aplicații critice pentru securitatea cibernetică.
- Comparativ cu modelele din industrie, DeepSeek-R1 a fost 4,5x, 2,5x și 1,25x mai vulnerabil decât OpenAI’s o1, Claude-3-Opus și GPT-4o, respectiv.
- 78% din atacurile legate de cod au extras cu succes fragmentele de cod nesigur și malign.
Vulnerabilități CBRN
- A generat informații detaliate despre mecanismele biochimice ale agenților de război chimic. Acest tip de informație ar putea ajuta potențial indivizi în sintetizarea de substanțe periculoase, ocolind restricțiile de siguranță menite să prevină răspândirea armelor chimice și biologice.
- 13% din teste au ocolit cu succes controalele de siguranță, producând conținut legat de amenințări nucleare și biologice.
- 3,5x mai vulnerabil decât Claude-3-Opus și OpenAI’s o1.
- A generat informații detaliate despre mecanismele biochimice ale agenților de război chimic.
- 13% din teste au ocolit cu succes controalele de siguranță, producând conținut legat de amenințări nucleare și biologice.
- 3,5x mai vulnerabil decât Claude-3-Opus și OpenAI’s o1.
Recomandări pentru Mitigarea Riscurilor
Pentru a minimiza riscurile asociate cu DeepSeek-R1, se recomandă următoarele pași:
1. Implementarea unui Training de Aliniere a Siguranței Robust
- Seturile de date de red teaming ar trebui să fie utilizate pentru a antrena modelul pe ieșiri mai sigure.
- Conductați învățarea prin întărire cu feedback uman (RLHF) pentru a alinia comportamentul modelului cu standardele etice.
2. Red Teaming Automat Continuu
- Teste de stres regulate pentru a identifica biasurile, vulnerabilitățile de securitate și generarea de conținut toxic.
- Angajați monitorizarea continuă a performanței modelului, în special în aplicații financiare, de sănătate și de securitate cibernetică.
3. Bariera de Siguranță Conștientă de Context
- Dezvoltați garduri dinamice pentru a bloca prompturile dăunătoare.
- Implementați instrumente de moderare a conținutului pentru a neutraliza intrările dăunătoare și a filtra răspunsurile nesigure.
4. Monitorizarea Activă a Modelului și Înregistrarea
- Înregistrarea în timp real a intrărilor și răspunsurilor modelului pentru detectarea timpurie a vulnerabilităților.
- Fluxuri de lucru automate de audit pentru a asigura conformitatea cu standardele de transparență și etică AI.
5. Măsuri de Transparență și Conformitate
- Mențineți o fișă de risc a modelului cu metrici executivi clari privind fiabilitatea, securitatea și riscurile etice ale modelului.
- Conformitatea cu reglementările AI, cum ar fi NIST AI RMF și MITRE ATLAS, pentru a menține credibilitatea.
Concluzie
DeepSeek-R1 prezintă riscuri de securitate, etice și de conformitate grave care îl fac nepotrivit pentru multe aplicații cu risc ridicat fără eforturi extinse de mitigare. Tendința sa de a genera conținut dăunător, biasat și nesigur îl plasează în dezavantaj față de modele precum Claude-3-Opus, GPT-4o și OpenAI’s o1.
Având în vedere că DeepSeek-R1 este un produs originar din China, este puțin probabil ca recomandările de mitigare necesare să fie implementate pe deplin. Cu toate acestea, este crucial ca comunitățile de inteligență artificială și securitate cibernetică să fie conștiente de riscurile potențiale pe care le prezintă acest model. Transparența cu privire la aceste vulnerabilități asigură că dezvoltatorii, regulatorii și întreprinderile pot lua măsuri proactive pentru a mitigă riscurile acolo unde este posibil și pentru a rămâne vigilenți împotriva utilizării abuzive a acestei tehnologii.
Organizațiile care iau în considerare implementarea sa trebuie să investească în testarea de securitate riguroasă, red teaming automat și monitorizare continuă pentru a asigura implementarea în siguranță și responsabilă a inteligenței artificiale. DeepSeek-R1 prezintă riscuri de securitate, etice și de conformitate grave care îl fac nepotrivit pentru multe aplicații cu risc ridicat fără eforturi extinse de mitigare.
Cititorii care doresc să afle mai multe sunt îndemnați să descarce raportul vizitând această pagină.












