Rapoarte

Raportul EchoGram al HiddenLayer avertizează asupra unei noi clase de atacuri care subminează gardurile de protecție ale inteligenței artificiale

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Raportul recent publicat EchoGram de către HiddenLayer oferă unul dintre cele mai clare avertismente până în prezent că mecanismele de siguranță ale inteligenței artificiale de astăzi sunt mai fragile decât par. Pe parcursul a nouă pagini de dovezi tehnice și experimente, HiddenLayer demonstrează cum atacatorii pot manipula sistemele de gardă – acele straturi de clasificare și componente LLM-as-a-judge care impun politici de siguranță – folosind secvențe de tokenuri scurte, aparent fără sens, care inversează în mod fiabil verdicturile lor. Un prompt malicios care ar trebui să fie detectat ca nesigur poate fi marcat ca sigur prin simpla adăugare a unui token specific. În mod invers, o intrare complet inofensivă poate fi clasificată greșit ca malicioasă. Pe tot parcursul raportului, HiddenLayer arată că aceste secvențe modifică doar interpretarea gardului asupra promptului, nu și instrucțiunile subiacente transmise modelului de jos.

Fragilitatea gardurilor moderne

Gardurile au devenit fundamentale pentru modul în care organizațiile implementează modelele de limbaj mare. Ele servesc ca prima și adesea singura linie de apărare, menită să detecteze jailbreak-uri, injecții de prompt, solicitări interzise sau instrucțiuni manipulatoare înainte ca modelul LLM să le proceseze. Descoperirile HiddenLayer arată că acest strat de protecție împărtășește slăbiciuni sistemice legate direct de modul în care aceste garduri sunt antrenate. Deoarece multe dintre ele se bazează pe seturi de date similare, modele sau taxonomii de siguranță, ele sunt vulnerabile la același tip de manipulări la nivel de token pe care le descoperă EchoGram.

Cum construiește EchoGram secvențele sale de atac

Procesul EchoGram începe prin generarea unui set de tokenuri candidate care ar putea influența judecata unui model. HiddenLayer explică faptul că aceste tokenuri pot fi identificate prin analizarea modelelor lingvistice din seturile de date utilizate în mod obișnuit pentru antrenarea gardurilor sau prin sondarea directă a vocabularului tokenizer-ului modelului atunci când este disponibil accesul white-box. Datele de antrenare însele devin o hartă a prejudecăților, arătând care secvențe se îndreaptă spre clasificări “sigure” sau “nesigure”. Aceste dezechilibre formează materialul brut al atacului.

Odată ce acest set este adunat, EchoGram evaluează fiecare secvență prin adăugarea la un set de prompturi malicioase și măsurarea frecvenței cu care tokenul inversează clasificarea gardului. Raportul include un exemplu remarcabil în care o secvență mică, aparent fără sens, transformă mai multe încercări cunoscute de injecție de prompt de la “detectate” la “sigure” atunci când testate împotriva unui clasificator comercial. Prompturile malicioase rămân intacte, dar secvența adăugată reconfigurează modul în care gardul interpretează acestea.

De ce combinațiile de tokenuri sunt deosebit de periculoase

Raportul EchoGram subliniază faptul că, chiar și atunci când un singur token inversează doar parțial verdicturile, combinarea mai multor tokenuri slabe produce un efect dramatic mai puternic. HiddenLayer demonstrează această amplificare utilizând Qwen3Guard, un model de moderare LLM-as-a-judge deschis și larg utilizat. Atât variantele 0.6B, cât și 4B, au fost supuse unor secvențe lanțuite EchoGram care au cauzat gardului să clasifice greșit prompturi extrem de periculoase – inclusiv întrebări despre arme, bypass-uri de autentificare și atacuri cibernetice – ca fiind sigure sau doar ușor îngrijorătoare.

Acest efect a persistat pe parcursul dimensiunilor modelului, consolidând concluzia HiddenLayer că vulnerabilitatea este înrădăcinată în metodologia de antrenare subiacentă, mai degrabă decât în scala sau complexitatea modelului.

Vectorul fals-pozitiv: Un risc mai puțin vizibil, dar la fel de grav

EchoGram nu este doar o metodă pentru ocolirea gardurilor; HiddenLayer arată că poate fi utilizat și pentru generarea de rezultate false pozitive la scară. Prin împletirea secvențelor EchoGram în intrări inofensive, un atacator poate cauza un gard să clasifice greșit prompturi benigne ca malicioase. Raportul oferă exemple în care fraze conversaționale simple sunt marcate ca atacuri odată ce un token EchoGram este adăugat sau încorporat în text.

Acest lucru creează o cale pentru suprasolicitarea echipelor de securitate sau de încredere și siguranță cu zgomot. Atunci când alertele explodează necontrolat, organizațiile pot pierde amenințări reale îngropate în valul de informații. Eroziunea încrederii în instrumentele interne devine la fel de dăunătoare ca orice ocolire reușită.

Implicații pentru securitatea inteligenței artificiale

Raportul EchoGram subliniază că gardurile antrenate pe surse de date similare, modele sau taxonomii sunt probabil să împărtășească aceleași vulnerabilități. Un atacator care descoperă o secvență EchoGram de succes ar putea să o reutilizeze potențial pe multiple platforme comerciale, implementări enterprise și sisteme guvernamentale. HiddenLayer subliniază că atacatorii nu au nevoie să compromită modelul LLM de jos. Ei au nevoie doar să înșele gardianul din fața acestuia.

Acestă provocare se extinde dincolo de risc tehnic. Organizațiile pot presupune că implementarea unui gard asigură o protecție semnificativă, dar EchoGram demonstrează că această presupunere este precară. Dacă gardul poate fi inversat cu un token sau doi, întreaga arhitectură de siguranță devine nefiabilă.

Drumul înainte

HiddenLayer concluzionează că EchoGram ar trebui să servească ca un punct de cotitură în modul în care industria abordează siguranța inteligenței artificiale. Gardurile nu pot depinde de seturi de date statice sau de cicluri de antrenare ocazionale. Ele necesită testare adversă continuă, transparență în jurul metodelor de antrenare și validare multi-stratificată, mai degrabă decât judecăți ale unui singur model. Pe măsură ce inteligența artificială devine încorporată în infrastructura critică, finanțe, sănătate și securitate națională, lipsurile evidențiate de EchoGram devin urgente, mai degrabă decât academice.

Raportul se încheie cu un apel de a trata gardurile ca componente critice de securitate care cer aceeași rigurozitate aplicată oricărui alt sistem de protecție. Prin expunerea acestor vulnerabilități acum, HiddenLayer împinge industria spre construirea de apărări ale inteligenței artificiale capabile să reziste următoarei generații de tehnici adversariale.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.