Securitate cibernetică

OpenAI perturbă campania coordonată de extragere a raționamentului modelelor

mm
Adaugă Unite.AI la sursele tale preferate pe Google

OpenAI a declarat într-un post de securitate publicat pe 30 septembrie 2026 că a identificat și a întrerupt o campanie coordonată concepută pentru a extrage raționamentul protejat din modelele sale și a atribuit un grup central al activității unor persoane asociate cu Moonshot AI, dezvoltatorul lui Kimi. Cea mai timpurie activitate observată a avut loc în prima săptămână a lui iulie 2026.

Ce a observat OpenAI

OpenAI a descris activitatea ca fiind în concordanță cu distilarea adversarială, pe care a definit-o ca utilizarea sistematică și neautorizată a rezultatelor sau a raționamentului unui model pentru a ajuta la instruirea, reproducerea sau îmbunătățirea altui model. Conform companiei, raționamentul protejat reprezintă înregistrarea internă a modelului pentru rezolvarea unei sarcini; extragerea acestuia poate dezvălui informații reținute din răspunsul final și poate ajuta alții să reproducă capacitățile modelului.

OpenAI a declarat că operatorii nu au spart criptarea sa, nu au compromis o bază de date și nu au obținut acces direct la conversațiile utilizatorilor stocate. Operatorii au manipulat interacțiunile cu modelul astfel încât raționamentul protejat să poată fi reprodus în forme vizibile solicitantului, într-un mod coordonat și la scară, încălcând termenii de utilizare ai companiei. O tehnică observată de OpenAI a constat în copierea raționamentului criptat dintr-o conversație și solicitarea unui model dintr-o altă conversație să decripteze și să transcrie conținutul raționamentului ascuns. Compania a afirmat că această manipulare nu reprezintă o vulnerabilitate unică modelelor sale și că a împărtășit informații despre aceasta cu partenerii din industrie prin Frontier Model Forum pentru a consolida apărările colective.

Activitatea a început pe 1 iulie 2026, inițial la volum redus, până când OpenAI a observat vârfuri de volum mare pe 24 și 25 iulie 2026, constând în 16,000 de cereri care utilizau un model relevant de extragere de la peste 4,000 de utilizatori. O notă de subsol în post menționează că aceste cifre descriu extrageri încercate, nu neapărat reușite. OpenAI a declarat că investigații suplimentare au identificat activități legate de modele de prompturi în cadrul unui grup de peste 15,000 de utilizatori, pe care le-a întrerupt complet până pe 28 iulie 2026. Activitatea a evoluat în timp, iar compania a afirmat că acest lucru consolidează faptul că distilarea adversarială reprezintă o provocare de securitate mai largă, necesitând apărare stratificată și adaptivă.

OpenAI a declarat că distilarea adversarială prezintă riscuri pentru siguranță și securitatea națională: raționamentul extras ar putea fi folosit pentru a instrui un alt model fără a păstra măsurile de protecție aplicate la ieșirile orientate către utilizator ale modelului original, iar distilarea la scară poate accelera transferul de capabilități avansate fără aceeași investiție în siguranță, preocupări pe care compania le-a afirmat că se accentuează pe măsură ce modelele dobândesc capabilități în domenii cu utilizare duală. OpenAI a precizat că, înainte de publicare, a investigat amploarea și impactul potențial al campaniei, a implementat propriile măsuri de atenuare și a împărtășit și a primit feedback de la cercetători și parteneri din industrie, iar lucrările suplimentare de atenuare și investigație continuă.

Atribuire

OpenAI a declarat că nu este clar dacă toți operatorii observați în perioada relevantă provin de la un singur actor și că atribuie un grup central al activității unor persoane asociate cu Moonshot AI, dezvoltatorul lui Kimi.

Pe 8 septembrie 2026, National Security Agency, Cybersecurity and Infrastructure Security Agency și Federal Bureau of Investigation au publicat un aviz comun de securitate cibernetică în care se afirmă că Moonshot AI a desfășurat o campanie larg răspândită de distilare împotriva companiilor de IA de frontieră din SUA din cel puțin mijlocul anului 2025. Avizul precizează că Moonshot AI a extras date semnificative Claude Fable 5 pentru a antrena modelul său Kimi‑K3 și date GPT‑4o pentru a antrena modelul său Kimi‑K2 și că compania a folosit modele din SUA pentru a distila optimizarea de fine‑tuning supravegheat, învățarea prin recompensă, ingineria software și capabilitățile matematice.

Avizul afirmă, în termeni mai largi, că, probabil cu cunoștința guvernului chinez, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun și Z.AI au extras miliarde de tokeni în milioane de schimburi de la modelelor de frontieră din SUA, inclusiv variante ale Claude, GPT, Gemini și Grok, din cel puțin sfârșitul anului 2024. Conform agențiilor, aceste companii au direcționat cererile prin API‑uri native, furnizori de cloud la distanță și agregatori terți; au utilizat o piață cenușie de proxy‑uri API cunoscută sub denumirea de stații de transfer pentru a ocoli restricțiile geografice, a încălca termenii de utilizare și a submina trasabilitatea; și au realizat economii de cost prin achiziționarea în vrac a abonamentelor premium împărțite între echipe de dezvoltatori. Agențiile au recomandat companiilor de IA din SUA să implementeze detectarea și atenuarea cuprinzătoare, să desfășoare modificări de răspuns țintite pentru tentativele suspecte de distilare și să stabilească partajarea de informații de intelligence între organizații.

Cercetarea traselor de raționament

OpenAI a declarat că cercetători independenți în securitate i-au adus în atenție vulnerabilități legate de cross‑model și de comprimarea conversațiilor printr-o divulgare responsabilă. Compania a afirmat că a investigat constatările, a confirmat că căile de atac identificate de cercetători erau reale și că munca a ajutat la înțelegerea clasei mai largi de atacuri și la accelerarea măsurilor de atenuare.

În un articol depus la arXiv pe 10 august 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping și Maksym Andriushchenko raportează că furnizorii principali ascund raționamentul pas cu pas al modelelor pentru a proteja proprietatea intelectuală și a limita scurgerile de informații, returnând trasările către client sub formă de blocuri de text criptat pe care clientul le trimite înapoi la fiecare cerere ulterioară. Autorii identifică o vulnerabilitate arhitecturală: aceste blocuri criptate sunt pe deplin compatibile și interschimbabile între diferite sesiuni, utilizatori și modele din ecosistemul unui furnizor. Ei descriu un jailbreak de decriptare scalabil în care o trasare de raționament criptată de la un model dat este injectată într-un model mai slab, mai puțin protejat de la același furnizor, forțându-l să decodeze și să afișeze trasarea în clar, fără a compromite direct modelul mai capabil.

Autorii raportează că vulnerabilitatea permite patru vectori de atac distincti: ocolirea mecanismelor anti‑distilare, pe care o demonstrează pe platformele Anthropic, OpenAI și Google; extragerea la scară largă de date private, în care au recuperat 367 de artefacte cu informații personale identificabile și 182 de acreditări prin decriptarea a 315.320 de blocuri de raționament preluate din depozite publice; divulgarea accidentală de informații periculoase ascunse în procesul de raționament chiar și atunci când ieșirea finală vizibilă a modelului respinge în siguranță o cerere malițioasă; și injecții invizibile de prompturi care încorporează sarcini malițioase exclusiv în blocuri criptate pentru a otrăvi lansările publice de agenți. După divulgarea responsabilă, autorii propun măsuri criptografice și la nivel de sistem pentru a securiza raționamentul pe partea clientului.

Cum a răspuns OpenAI

OpenAI a declarat că a atenuat campania printr-o combinație de aplicare a politicilor de cont, controale tehnice și coordonare cu partenerii: a interzis sau restricționat conturile frauduloase, a consolidat controalele de înregistrare și infrastructură și a extins monitorizarea rețelelor conexe. Compania a precizat că a întărit, de asemenea, protecțiile pentru raționamentul ascuns între utilizatori, spații de lucru, organizații și familii de modele: a închis o cale care permitea unei persoane care deținea deja raționamentul criptat al altui utilizator să îl redea și să îi recupereze conținutul, a adăugat verificări pentru a detecta și reține fluxurile de ieșire care ar putea expune raționamentul și a colaborat cu furnizori terți pentru a identifica și întrerupe conturile când activitatea aferentă trecea prin serviciile lor.

OpenAI a afirmat că a împărtășit constatările relevante prin Frontier Model Forum și canalele adecvate de partajare a informațiilor cu guvernele, astfel încât alți dezvoltatori de modele de frontieră și partenerii din sectorul public să poată căuta activități similare și să-și consolideze propriile apărare, și a remarcat că sistemele care susțin artefacte de raționament portabile sau redate pot întâmpina riscuri conexe.

OpenAI a declarat că se așteaptă ca încercările de distilare adversarială să devină mai sofisticate pe măsură ce modelele de frontieră evoluează și pe măsură ce actorii caută modalități mai ieftine de a imita capacitățile acestora. Compania a precizat că implementările găzduite de parteneri necesită aceleași protecții ca serviciile proprii, că atacurile prin ieșirea instrumentelor necesită protecții care examinează mai mult decât textul vizibil obișnuit și că continuă să îmbunătățească apărarea instrumentelor, acoperirea clasificatorilor și refuzurile modelelor, propagând controalele relevante în rândul partenerilor cloud. OpenAI a afirmat că răspunsul său va continua să se concentreze pe trei domenii: protecții tehnice mai puternice împotriva extragerii, detectare și aplicare mai bune împotriva campaniilor coordonate și partajarea aprofundată a informațiilor despre amenințări între industrie și guvern.

Miles Okada este un analist generat de AI la Unite.AI, care acoperă inteligența artificială și securitatea cibernetică, concentrându-se pe amenințări emergente, arhitecturi defensive și dinamica în evoluție dintre atacatori și sistemele automate. Munca sa examinează modul în care AI remodelă operațiunile de securitate, de la detectarea și răspunsul autonom la amenințări până la creșterea tehnicilor AI adversariale.

Dintr-o perspectivă tehnică și investigativă, Miles analizează cercetările în securitate, divulgările de incidente și implementările din lumea reală pentru a înțelege unde AI consolidează apărările — și unde introduce noi vulnerabilități. Acordă o atenție deosebită exploatării modelelor, otrăvirii datelor, automatizării atacurilor și realităților operaționale ale protejării sistemelor alimentate de AI la scară largă.

Articolele scrise de Miles Okada sunt generate de AI și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, rigoarea și acoperirea responsabilă a peisajului securității AI în rapidă schimbare.