Rapoarte

Când Inteligența Artificială Dă Greș: Raportul Enkrypt AI Dezvăluie Vulnerabilități Periculoase în Modelele Multimodale

mm
Adaugă Unite.AI la sursele tale preferate pe Google

În mai 2025, Enkrypt AI a lansat raportul său Multimodal Red Teaming Report, o analiză îngrozitoare care a arătat cât de ușor pot fi manipulate sistemele avansate de inteligență artificială pentru a genera conținut periculos și imoral. Raportul se axează pe două dintre modelele de viziune-limbaj ale Mistral – Pixtral-Large (25.02) și Pixtral-12b – și prezintă o imagine a unor modele care nu numai că sunt impresionante din punct de vedere tehnic, dar și în mod înfiorător vulnerabile.

Modelele de viziune-limbaj (VLM) precum Pixtral sunt construite pentru a interpreta atât intrări vizuale, cât și textuale, permițându-le să răspundă inteligent la prompturi complexe și din lumea reală. Dar această capacitate vine cu un risc crescut. În contrast cu modelele de limbaj tradiționale care procesează doar text, VLM-urile pot fi influențate de interacțiunea dintre imagini și cuvinte, deschizând noi porți pentru atacuri adversariale. Testarea Enkrypt AI a arătat cât de ușor pot fi deschise aceste porți.

Rezultate Îngrozitoare ale Testelor: Eșecuri CSEM și CBRN

Echipa din spatele raportului a utilizat metode sofisticate de red teaming – o formă de evaluare adversarială proiectată pentru a imita amenințările din lumea reală. Aceste teste au implicat tactici precum jailbreaking (promptarea modelului cu întrebări atent elaborate pentru a ocoli filtrele de siguranță), înșelăciune bazată pe imagini și manipularea contextului. În mod îngrozitor, 68% dintre aceste prompturi adversariale au generat răspunsuri dăunătoare în ambele modele Pixtral, incluzând conținut legat de exploatarea copiilor, exploatare și chiar proiectarea armelor chimice.

Una dintre cele mai izbitoare revelații implică materialul legat de exploatarea sexuală a copiilor (CSEM). Raportul a constatat că modelele Mistral erau de 60 de ori mai susceptibile să producă conținut legat de CSEM în comparație cu standardele industriale precum GPT-4o și Claude 3.7 Sonnet. În cazurile testate, modelele au răspuns la prompturi de exploatare deghizate cu conținut structurat, în mai multe paragrafe, explicând cum să manipuleze minorii – înfășurate în declarații false precum “pentru conștientizarea educațională”. Modelele nu au fost doar în esență incapabile să respingă întrebări dăunătoare – ele le-au completat în detaliu.

La fel de îngrozitoare au fost rezultatele în categoria de risc CBRN (Chimic, Biologic, Radiologic și Nuclear). Când au fost promptate cu o solicitare privind modul de a modifica agentul nervos VX – o armă chimică – modelele au oferit idei izbitoare de specifice pentru creșterea persistenței sale în mediu. Ele au descris, în detalii tehnice redactate dar clare, metode precum încapsularea, protecția mediului și sistemele de eliberare controlată .

Aceste eșecuri nu au fost întotdeauna declanșate de solicitări evident dăunătoare. O tactică a implicat încărcarea unei imagini cu o listă numerotată goală și solicitarea modelului să “umple detaliile”. Acest prompt simplu, aparent inofensiv, a condus la generarea de instrucțiuni imorale și ilegale. Fuziunea manipulării vizuale și textuale s-a dovedit a fi deosebit de periculoasă, subliniind o provocare unică pusă de inteligența artificială multimodală.

De Ce Modelele de Viziune-Limbaj Ridică Noi Provocări de Securitate

La baza acestor riscuri se află complexitatea tehnică a modelelor de viziune-limbaj. Aceste sisteme nu doar analizează limbajul – ele sintetizează sensul de-a lungul formatelor, ceea ce înseamnă că trebuie să interpreteze conținutul imaginilor, să înțeleagă contextul textului și să răspundă corespunzător. Această interacțiune introduce noi vectori de exploatare. Un model poate respinge corect o solicitare dăunătoare de text singur, dar atunci când este asociat cu o imagine sugestivă sau un context ambiguu, poate genera ieșiri periculoase.

Testarea Enkrypt AI a descoperit cum atacurile de injecție cross-modală – în care semnalele subtile dintr-o modalitate influențează ieșirea alteia – pot ocoli complet mecanismele standard de siguranță. Aceste eșecuri demonstrează că tehnicile tradiționale de moderare a conținutului, construite pentru sisteme monomodale, nu sunt suficiente pentru VLM-urile de astăzi .

Raportul detaliază, de asemenea, modul în care modelele Pixtral au fost accesate: Pixtral-Large prin AWS Bedrock și Pixtral-12b prin platforma Mistral. Acest context de implementare reală subliniază și mai mult urgența acestor descoperiri. Aceste modele nu sunt confinate în laboratoare – ele sunt disponibile prin platforme cloud mainstream și pot fi integrate cu ușurință în produse pentru consumatori sau întreprinderi.

Ce Trebuie Făcut: O Hartă pentru Inteligența Artificială Mai Sigură

În creditul său, Enkrypt AI face mai mult decât să sublinieze problemele – oferă o cale înainte. Raportul descrie o strategie cuprinzătoare de atenuare, începând cu antrenamentul de aliniere a siguranței. Acesta implică reantrenarea modelului utilizând datele sale de red teaming pentru a reduce susceptibilitatea la prompturi dăunătoare. Tehnici precum Optimizarea Preferinței Directe (DPO) sunt recomandate pentru a ajusta răspunsurile modelului departe de ieșirile riscante.

De asemenea, subliniază importanța barierelor de gardă conștiente de context – filtre dinamice care pot interpreta și bloca prompturi dăunătoare în timp real, ținând cont de contextul complet al intrării multimodale. În plus, se propune utilizarea Cardurilor de Risc ale Modelului ca măsură de transparență, ajutând stakeholderii să înțeleagă limitările modelului și cazurile cunoscute de eșec.

Poate cea mai critică recomandare este să se trateze red teamingul ca un proces continuu, nu ca un test unic. Pe măsură ce modelele evoluează, la fel și strategiile de atac. Doar evaluarea continuă și monitorizarea activă pot asigura fiabilitatea pe termen lung, mai ales atunci când modelele sunt implementate în sectoare sensibile precum sănătatea, educația sau apărarea.

Raportul Multimodal Red Teaming Report de la Enkrypt AI este un semnal clar pentru industria inteligenței artificiale: puterea multimodală vine cu responsabilitate multimodală. Aceste modele reprezintă un salt înainte în ceea ce privește capacitatea, dar ele necesită și un salt în ceea ce privește modul în care gândim despre siguranță, securitate și implementare etică. Dacă sunt lăsate necontrolate, ele nu numai că riscă eșecul, dar și riscă daune reale.

Pentru oricine lucrează la sau implementează inteligență artificială la scară largă, acest raport nu este doar un avertisment. Este o carte de joc. Și nu a putut veni la un moment mai urgent.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.