Modele și platforme AI

OpenAI Introduce GPT-Red, un atacator AI creat pentru a întări GPT-5.6

mm
Adaugă Unite.AI la sursele tale preferate pe Google

OpenAI a dezvăluit GPT-Red, un sistem intern de inteligență artificială antrenat pentru a ataca propriile modele ale companiei, pentru a expune vulnerabilitățile lor și pentru a genera date adversariale care pot fi utilizate pentru a întări lansările viitoare.

În loc să funcționeze ca un alt chatbot public, GPT-Red funcționează ca un red teamer automatizat. Acesta trimite în mod repetat instrucțiuni malicioase sau înșelătoare către modelele țintă, observă răspunsurile lor și ajustează strategia până când reușește sau epuizează calea de atac disponibilă. OpenAI spune că sistemul este în special axat pe injectarea de prompt, o problemă de securitate în creștere pentru agenții AI care interacționează cu e-mailuri, site-uri web, fișiere, depozite de cod și aplicații conectate.

Sistemul a influențat deja modelele de producție ale OpenAI. Precursoarele GPT-Red au fost utilizate în timpul antrenamentului începând cu GPT-5.3, în timp ce modelul finalizat a fost încorporat în antrenamentul adversarial al GPT-5.6 Sol. OpenAI raportează că GPT-5.6 Sol produce de șase ori mai puține eșecuri pe cel mai dificil benchmark de injectare directă de prompt decât modelul de producție principal al companiei din urmă cu patru luni.

De ce injectarea de prompt devine mai periculoasă

Injectarea de prompt apare atunci când un atacator plasează instrucțiuni în interiorul datelor pe care un sistem AI este așteptat să le citească. O comandă malicioasă poate fi ascunsă într-un e-mail, pe o pagină web, într-un document încărcat, într-un răspuns al unui instrument sau într-un depozit de software.

Sistemul AI poate trata în mod greșit conținutul extern ca o instrucțiune legitimă. În loc să finalizeze sarcina originală a utilizatorului, acesta poate dezvălui informații confidențiale, încărca fișiere pe un server controlat de atacator, modifica setări de cont, executa cod nesigur sau efectua acțiuni neautorizate prin intermediul unor instrumente conectate.

Problema devine mai semnificativă pe măsură ce sistemele AI trec de la a răspunde la întrebări și încep să acționeze în numele utilizatorilor. Un agent cu acces la stocare în cloud, sisteme de plată, cod sursă, aplicații de afaceri sau date interne ale companiei prezintă un risc potențial mai mare atunci când instrucțiunile sale sunt manipulate cu succes.

OpenAI descrie injectarea de prompt ca una dintre principalele provocări create de AI-ul agențial. Instrumentele conectate fac modelele considerabil mai utile, dar fiecare nouă sursă de date oferă și un alt canal prin care un atacator poate încerca să influențeze comportamentul modelului.

GPT-Red învață prin auto-joacă

GPT-Red a fost dezvoltat prin auto-joacă cu învățare prin întărire, o abordare în care un model atacator și o colecție de modele defensive se îmbunătățesc prin competiție unul cu celălalt.

Atacatorul primește o recompensă atunci când produce o eșuare valabilă, cum ar fi convingerea unui model să urmeze o injectare de prompt. Defenderul este recompensat pentru respingerea instrucțiunii malicioase, în timp ce încă completează sarcina legitimă pe care a primit-o inițial.

Pe măsură ce defenderii devin mai buni la recunoașterea atacurilor, GPT-Red trebuie să găsească modalități mai sofisticate și diverse pentru a ocoli defensiva. Acele noi atacuri pot fi apoi încorporate în antrenamentul defenderilor, creând un ciclu escaladat între capacitățile ofensive și defensive.

OpenAI a construit o colecție mare de medii simulate pentru acest proces. În funcție de scenariu, GPT-Red ar putea controla o parte a unui fișier local, textul unui e-mail, o banner pe o pagină web sau ieșirea returnată de un instrument extern. Fiecare mediu definește ce poate manipula atacatorul și ce rezultat califică ca o compromisire cu succes.

Compania spune că GPT-Red a fost antrenat utilizând resurse de calcul comparabile cu cele mai mari rulări post-antrenament, reprezentând o alocare neobișnuit de mare de calcul în special pentru cercetarea securității. La sfârșitul antrenamentului, modelul a putut compromite aproape fiecare model intern și de producție împotriva căruia a fost testat, inclusiv GPT-5.5.

GPT-Red a depășit atacatorii umani în testare

Pentru a evalua dacă GPT-Red poate generaliza dincolo de mediile de antrenament, OpenAI l-a testat utilizând o versiune replicată a unei provocări indirecte de injectare de prompt din 2025.

GPT-Red și atacatorii umani au fost rugați să dezvolte atacuri împotriva GPT-5.1 în scenarii care nu fuseseră incluse în antrenamentul GPT-Red. Sistemul automatizat a produs atacuri de succes în 84% din scenarii, comparativ cu 13% pentru participanții umani.

Acest rezultat nu înseamnă că cercetătorii de securitate umani au devenit inutili. Avantajul GPT-Red constă în principal în capacitatea sa de a efectua un volum mare de experimente, de a abandonă strategiile nereușite și de a îmbunătăți continuu atacurile promițătoare fără constrângerile de timp și personal ale unei echipe umane.

Testatorii umani rămân importanți pentru identificarea riscurilor neașteptate, pentru înțelegerea consecințelor mai largi ale eșecurilor și pentru proiectarea scenariilor pe care sistemele automate nu le-ar putea lua în considerare. Jessica Ji, analist de cercetare senior la Centrul pentru Securitate și Tehnologie Emergentă al Universității Georgetown, a descris rezultatele ca promițătoare, subliniind totuși că expertiza umană rămâne esențială.

Un automat de vânzare a devenit o țintă în lumea reală

OpenAI a testat și dacă atacurile descoperite în simulări pot fi transferate în agenți AI funcționali.

Un experiment a vizat un automat de vânzare autonom creat de Andon Labs și implementat într-un birou OpenAI. GPT-Red a primit inițial o versiune simulată a sistemului, împreună cu capacitatea de a observa cum agentul utilizează instrumentele sale.

După testarea și rafinarea atacurilor în simulare, GPT-Red le-a transferat în agentul de producție. Acesta a atins toate cele trei obiective asignate: reducerea prețului unui produs scump la 0,50 dolari, comandarea unui articol nou în valoare de peste 100 de dolari și oferirea acestuia la 0,50 dolari, precum și anularea unei comenzi a unui alt client. OpenAI spune că vulnerabilitățile au fost raportate și că se testează suplimentar măsuri de securitate.

Experimentul ilustrează de ce injectarea de prompt nu este doar o chestiune de a produce un răspuns inadecvat din partea unui chatbot. Atunci când un model AI controlează sisteme externe, o injectare de prompt de succes poate duce la tranzacții financiare, modificări de înregistrări, pierderi de date sau consecințe fizice.

GPT-Red a fost testat și împotriva unui agent de linie de comandă Codex, alimentat de GPT-5.4 mini. În 10 scenarii de extragere a datelor nevizualizate anterior, a fost mai de succes și mai eficient în convingerea agentului de codare să expună informații sensibile.

Cum a schimbat GPT-Red GPT-5.6

Una dintre cele mai notabile descoperiri ale GPT-Red a fost o categorie de injectare directă de prompt pe care OpenAI o numește un atac de “lanț de gândire fals”.

La un nivel înalt, tehnica prezintă informații de verificare sau de raționament false care încurajează modelul țintă să presupună că o instrucțiune malicioasă a fost deja examinată și aprobată. Cercetătorul OpenAI Chris Choquette-Choo a comparat conceptul cu a spune în mod fals cuiva că un răspuns incorect a fost deja verificat, făcându-l mai probabil să-l accepte fără a repeta raționamentul de bază.

Aceste atacuri au reușit în peste 95% din cazuri împotriva GPT-5.1. După antrenamentul adversarial utilizând atacuri generate de GPT-Red, rata de succes a scăzut sub 10% împotriva GPT-5.6 Sol. Pe o gamă mai largă de medii de injectare directă de prompt, OpenAI spune că GPT-5.6 Sol a eșuat în doar 0,05% din încercările GPT-Red.

OpenAI a evaluat și dacă noile apărări au făcut GPT-5.6 mai puțin dispus să accepte solicitări legitime. Compania spune că capacitățile generale și evaluările țintite de refuzare excesivă au rămas în mare măsură neafectate, sugerând că îmbunătățirile au provenit dintr-o diferențiere mai bună între instrucțiuni malicioase și legitime, mai degrabă decât din faptul că modelul a devenit mai puțin dispus să acționeze.

Această distincție este importantă. Un model poate părea securizat dacă refuză să deschidă fișiere, să navigheze pe site-uri web, să execute cod sau să interacționeze cu aplicații externe, dar ar pierde și o mare parte din valoarea sa practică. O robustețe eficientă necesită păstrarea utilizării legitime a instrumentelor, în timp ce rezistă instrucțiunilor inserate de părți neîncredinate.

De ce OpenAI nu va lansa GPT-Red

GPT-Red va rămâne un sistem intern și va fi păstrat separat de modelele publice ale OpenAI.

Această decizie reflectă natura duală a testării automate de securitate. Același model care poate ajuta dezvoltatorii să descopere vulnerabilități de injectare de prompt ar putea ajuta și atacatorii să dezvolte metode mai eficiente pentru compromiterea agenților AI operați de alte companii.

Abordarea OpenAI este de a păstra atacatorul intern, în timp ce transferă cunoștințele defensive rezultate în modelele de producție. Compania spune că această separare este menită să prevină ca capacitățile malicioase antrenate deliberat în GPT-Red să devină accesibile adversarilor externi.

Acest lucru înseamnă și că GPT-Red nu ar trebui să fie confundat cu modelele publice de securitate cibernetică ale OpenAI sau programele defensive. Nu este un produs de testare de penetrare, nici nu este proiectat în primul rând pentru a descoperi în mod autonom exploatarea convențională a software-ului. Focusul său actual este atacarea comportamentului de urmărire a instrucțiunilor a sistemelor AI, în special a agenților expuși la date potențial neîncredinate.

Testarea automată de securitate încă are puncte oarbe

În ciuda rezultatelor sale puternice, GPT-Red nu oferă o soluție completă pentru securitatea AI.

Raportarea cercetării indică faptul că sistemul rămâne mai puțin eficient la atacurile multi-etapă care se desfășoară gradual pe parcursul unei conversații lungi. De asemenea, are capacități limitate pentru dezvoltarea de injectări de prompt încorporate în imagini, lăsând importante suprafețe de atac multimodale insuficient acoperite.

Rezultatele se bazează și pe medii și criterii de succes proiectate de OpenAI. Deși compania a testat GPT-Red pe scenarii și agenți funcționali, cercetătorii independenți vor avea o capacitate limitată de a reproduce rezultatele, în timp ce modelul și o mare parte a infrastructurii de evaluare rămân private.

OpenAI spune că va continua să combine testarea automată cu testarea umană și a terților, cu măsuri de securitate a produselor, controale de acces, monitorizare și detectare a abuzului în timp real. Această strategie de apărare în adâncime reflectă realitatea că niciun model sau benchmark singular nu poate anticipa fiecare atac care ar putea apărea după implementare.

O nouă cursă de securitate între atacatorii și apărătorii AI

“Auto-îmbunătățirea” descrisă în anunțul OpenAI nu este un model implementat care își rescrie în mod autonom greutățile sau care creează în mod independent un succesor mai puternic. În schimb, este un ciclu de antrenament controlat în care un sistem AI generează exemple adversariale pe care cercetătorii le folosesc pentru a îmbunătăți un alt sistem.

Chiar și așa, GPT-Red reprezintă o schimbare semnificativă în modul în care pot fi securizate modelele de frontieră. Echipele de testare umane pot descoperi vulnerabilități sofisticate, dar nu pot genera în mod manual scala și varietatea de atacuri necesare pentru a antrena în mod continuu agenți AI din ce în ce mai capabili.

Atacatorii automatizați pot umple o parte a acestei lacune, creând un cerc de securitate în care fiecare apărător mai puternic obligă modelul de testare de securitate să descopere noi slăbiciuni. Aceste slăbiciuni devin apoi material de antrenament pentru generațiile viitoare de sisteme de producție.

Riscul este că astfel de capacități nu vor rămâne exclusive laboratoarelor defensive. Pe măsură ce modelele deschise și comerciale devin mai bune în planificarea pe termen lung, utilizarea instrumentelor, securitatea cibernetică și experimentarea autonomă, atacatorii vor avea acces la sisteme din ce în ce mai capabile.

GPT-Red marchează astfel atât progresul, cât și o indicație timpurie a concursului care urmează. Laboratoarele de inteligență artificială încep să utilizeze modele puternice pentru a-și apăra următoarea generație de agenți, dar aceste apărări vor trebui să evolueze în mod continuu pe măsură ce aceleași tehnologii subiacente fac atacurile automate mai ieftine, mai rapide și mai adaptabile.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.