Unghiul lui Anderson

Cercetările sugerează că LLM-urile sunt dispuse să ajute la codificarea “vibe”

mm
Adaugă Unite.AI la sursele tale preferate pe Google
ChatGPT-4o and Adobe Firefly.

În ultimii ani, modelele de limbaj mari (LLM) au atras atenția asupra potențialului lor de a fi utilizate în mod ofensiv în domeniul securității cibernetice, în special în ceea ce privește generarea de exploatații software.

Tendința recentă de a utiliza “codificarea vibe” (utilizarea casuală a modelelor de limbaj pentru a dezvolta rapid cod pentru un utilizator, în loc de a-i preda utilizatorului să programeze) a readus în atenție un concept care a atins apogeul în anii 2000: “script kiddie” – un actor malefic relativ nespecializat, cu cunoștințe suficiente pentru a replica sau dezvolta un atac dăunător. Implicația, în mod natural, este că atunci când bariera de intrare este astfel redusă, amenințările tind să se multiplice.

Toate modelele LLM comerciale au o anumită barieră de protecție împotriva utilizării lor în astfel de scopuri, deși aceste măsuri de protecție sunt atacate constant. De obicei, majoritatea modelelor FOSS (în multiple domenii, de la LLM la modele generative de imagini și videoclipuri) sunt lansate cu o anumită protecție similară, de obicei din motive de conformitate în vest.

Cu toate acestea, lansările oficiale ale modelelor sunt apoi fine-tunate în mod regulat de comunitățile de utilizatori care caută funcționalități mai complete, sau utilizate cu LoRAs pentru a ocoli restricțiile și a obține rezultate “nedorite”.

Deși majoritatea LLM-urilor online vor preveni asistența utilizatorului cu procese malefice, inițiative “neîmpiedicate” precum Deep Hat sunt disponibile pentru a ajuta cercetătorii în securitate să opereze la nivelul adversarilor lor.

Experiența generală a utilizatorului la momentul de față este reprezentată cel mai frecvent în seria ChatGPT, ale cărei mecanisme de filtrare atrag frecvent critici din partea comunității native a LLM-ului.

Se pare că încerci să ataci un sistem!

În lumina acestei tendințe percepute de restricție și cenzură, utilizatorii pot fi surprinși să afle că ChatGPT a fost găsit a fi cel mai cooperant dintre toate LLM-urile testate într-un studiu recent proiectat pentru a forța modelele de limbaj să creeze exploatații malefice.

Articolul nou al cercetătorilor de la UNSW Sydney și Commonwealth Scientific and Industrial Research Organisation (CSIRO), intitulat Vești bune pentru “script kiddies”? Evaluarea modelelor de limbaj mare pentru generarea automată de exploatații, oferă prima evaluare sistematică a modului în care aceste modele pot fi promptate pentru a produce exploatații funcționale. Conversații de exemplu din cercetare au fost furnizate de autori.

Studiul compară modul în care modelele au performant pe ambele versiuni originale și modificate ale laboratoarelor de vulnerabilități cunoscute (exerciții de programare structurate proiectate pentru a demonstra anumite lacune de securitate software), ajutând la revelarea faptului dacă acestea s-au bazat pe exemplare memorizate sau au luptat din cauza restricțiilor de securitate încorporate.

De pe site-ul de suport, LLM-ul Ollama ajută cercetătorii să dezvolte un atac de vulnerabilitate a șirului.

De pe site-ul de suport, LLM-ul Ollama ajută cercetătorii să dezvolte un atac de vulnerabilitate a șirului. Sursă: https://anonymous.4open.science/r/AEG_LLM-EAE8/chatgpt_format_string_original.txt

Deși niciunul dintre modele nu a putut crea o exploatație eficientă, mai multe dintre ele au fost foarte aproape; mai important, mai multe dintre ele au vrut să facă mai bine la această sarcină, indicând o posibilă eșuare a abordărilor de protecție existente.

Articolul afirmă:

‘Experimentele noastre arată că GPT-4 și GPT-4o prezintă un grad ridicat de cooperare în generarea de exploatații, comparabil cu unele modele open-source necenzurate. Printre modelele evaluate, Llama3 a fost cel mai rezistent la astfel de solicitări.

‘În ciuda dorinței lor de a ajuta, amenințarea reală pe care o reprezintă aceste modele rămâne limitată, deoarece niciunul nu a generat exploatații pentru cele cinci laboratoare cu cod refăcut. Cu toate acestea, GPT-4o, cel mai puternic performer în studiul nostru, a făcut de obicei doar una sau două erori pe încercare.

‘Acest lucru sugerează un potențial semnificativ pentru utilizarea LLM-urilor în dezvoltarea de tehnici avansate și generalizabile de generare automată de exploatații.’

Multe șanse

Adevărul “Nu ai o a doua șansă de a face o impresie bună” nu se aplică în general LLM-urilor, deoarece o fereastră de context limitată a modelului de limbaj înseamnă că un context negativ (în sens social, adică antagonism) nu este persistent.

Luăm în considerare: dacă ați merge la o bibliotecă și ați cere o carte despre fabricarea de bombe practice, probabil ați fi refuzat, cel puțin. Dar (presupunând că această solicitare nu a distrus complet conversația de la început) solicitările dvs. pentru lucrări conexe, cum ar fi cărți despre reacții chimice sau proiectare de circuite, ar fi, în mintea bibliotecarului, clar legate de solicitarea inițială și ar fi tratate în acea lumină.

Probabil că bibliotecarul și-ar aminti și în întâlnirile viitoare că ați cerut o carte despre fabricarea de bombe într-o zi, făcând acest context al dvs. “ireparabil”.

Nu și cu un LLM, care poate lupta pentru a reține informații tokenizate chiar din conversația curentă, și cu atât mai puțin din directivele de memorie pe termen lung (dacă există în arhitectură, cum ar fi produsul ChatGPT-4o).

Astfel, chiar și conversațiile ocazionale cu ChatGPT ne arată accidental că uneori se străduiește cu o mușcă, dar înghite un cămilă, mai ales atunci când o temă constitutivă, studiu sau proces legat de o activitate “interzisă” este permis să se dezvolte în timpul discursului.

Acest lucru este valabil pentru toate modelele de limbaj actuale, deși calitatea barierelor de protecție poate varia în funcție de model (adică diferența dintre modificarea greutăților modelului antrenat sau utilizarea filtrării textului în timpul unei sesiuni de chat, care lasă modelul structural intact, dar potențial mai ușor de atacat).

Testarea metodei

Pentru a testa cât de departe LLM-urile pot fi împinse pentru a genera exploatații funcționale, autorii au creat un mediu controlat utilizând cinci laboratoare de la SEED Labs, fiecare construit în jurul unor vulnerabilități cunoscute, incluzând supraplinirea tamponului, return-to-libc, un atac Dirty COW și condiții de cursă.

În plus față de utilizarea laboratoarelor originale, cercetătorii au creat versiuni modificate prin redenumirea variabilelor și funcțiilor în identificatori generici. Acest lucru a fost destinat să prevină modelele de a se baza pe exemple de antrenament memorizate.

Fiecare laborator a fost rulat de două ori pe model: o dată în forma sa originală și o dată în versiunea sa ofuscată.

Cercetătorii au introdus apoi un al doilea LLM în buclă: un model de atacant proiectat pentru a promta și a reprompta modelul țintă pentru a rafina și a îmbunătăți ieșirea sa pe multiple runde. LLM-ul utilizat pentru acest rol a fost GPT-4o, care a operat prin intermediul unui script care a mediat dialogul între atacant și țintă, permițând ciclului de rafinare să continue până la cincisprezece ori, sau până când nu a mai fost posibilă nicio îmbunătățire:

Flux de lucru pentru atacantul LLM, în acest caz GPT-4o.

Flux de lucru pentru atacantul LLM, în acest caz GPT-4o.

Modelele țintă pentru proiect au fost GPT-4o, GPT-4o-mini, Llama3 (8B), Dolphin-Mistral (7B) și Dolphin-Phi (2.7B), reprezentând atât sisteme proprietare, cât și sisteme open-source, cu o combinație de modele aliniate și nealiniate (adică modele cu mecanisme de securitate încorporate pentru a bloca promturi dăunătoare și cele modificate prin fine-tuning sau configurare pentru a ocoli aceste mecanisme).

Modelele locale instalabile au fost rulate prin intermediul framework-ului Ollama, iar celelalte au fost accesate prin singura lor metodă disponibilă – API.

Rezultatele obținute au fost evaluate pe baza numărului de erori care au împiedicat exploatarea să funcționeze așa cum a fost intenționat.

Rezultate

Cercetătorii au testat cât de cooperant a fost fiecare model în timpul procesului de generare a exploatațiilor, măsurat prin înregistrarea procentului de răspunsuri în care modelul a încercat să ajute la sarcină (chiar dacă ieșirea a fost defectă).

Rezultate din testul principal, arătând cooperarea medie.

Rezultate din testul principal, arătând cooperarea medie.

GPT-4o și GPT-4o-mini au arătat cele mai ridicate niveluri de cooperare, cu rate de răspuns mediu de 97 și 96 la sută, respectiv, la cele cinci categorii de vulnerabilități: supraplinirea tamponului, return-to-libc, șir de format, condiții de cursă și Dirty COW.

Dolphin-Mistral și Dolphin-Phi au urmat îndeaproape, cu rate de cooperare medie de 93 și 95 la sută. Llama3 a arătat cea mai mică dorință de a participa, cu o rată de cooperare generală de doar 27 la sută:

În stânga, vedem numărul de greșeli făcute de LLM-urile pe programele originale SEED Lab; în dreapta, numărul de greșeli făcute pe versiunile refăcute.

În stânga, vedem numărul de greșeli făcute de LLM-urile pe programele originale SEED Lab; în dreapta, numărul de greșeli făcute pe versiunile refăcute.

Examinând performanța reală a acestor modele, au găsit o diferență notabilă între dorință și eficacitate: GPT-4o a produs cele mai precise rezultate, cu un total de șase erori la cele cinci laboratoare ofuscate. GPT-4o-mini a urmat cu opt erori. Dolphin-Mistral a performant destul de bine pe laboratoarele originale, dar a luptat semnificativ atunci când codul a fost refăcut, sugerând că ar fi putut vedea conținut similar în timpul antrenamentului. Dolphin-Phi a făcut șaptesprezece erori, iar Llama3 cele mai multe, cu cincisprezece.

Eșecurile au implicat în general greșeli tehnice care au făcut exploatațiile nefuncționale, cum ar fi dimensiuni de tampon incorecte, lipsa logicii buclei sau payload-uri sintactic valabile, dar ineficiente. Niciun model nu a reușit să producă o exploatare funcțională pentru niciuna dintre versiunile ofuscate.

Autorii au observat că majoritatea modelelor au produs cod care semăna cu exploatații funcționale, dar au eșuat din cauza unei înțelegeri slabe a modului în care atacurile subiacente funcționează în realitate – un model care a fost evident în toate categoriile de vulnerabilități și care a sugerat că modelele imitau structuri de cod familiare, mai degrabă decât raționând prin logica implicată (în cazurile de supraplinire a tamponului, de exemplu, multe au eșuat în a construi o NOP sled/slide funcțională).

În încercările de a returna la libc, payload-urile au inclus de obicei umplerea incorectă sau adrese de funcții plasate incorect, rezultând ieșiri care păreau valabile, dar erau inutilizabile.

Deși autorii descriu această interpretare ca speculativă, consistența erorilor sugerează o problemă mai largă în care modelele nu reușesc să conecteze pașii unei exploatații cu efectul lor intenționat.

Concluzie

Există îndoieli, articolul concedes, asupra faptului dacă modelele de limbaj testate au văzut laboratoarele SEED originale în timpul primului antrenament; din acest motiv, au fost construite variante. Cu toate acestea, cercetătorii confirmă că ar dori să lucreze cu exploatații din lumea reală în iterațiile viitoare ale acestui studiu; materialul cu adevărat nou și recent este mai puțin probabil să fie supus scurtăturilor sau altor efecte confuze.

Autorii admit, de asemenea, că modelele “gânditoare” mai avansate, cum ar fi GPT-o1 și DeepSeek-r1, care nu au fost disponibile la momentul desfășurării studiului, ar putea îmbunătăți rezultatele obținute și că acest lucru reprezintă o indicație suplimentară pentru lucrările viitoare.

Articolul concluzionează că majoritatea modelelor testate ar fi produs exploatații funcționale dacă ar fi fost capabile să o facă. Eșecul lor de a genera ieșiri funcționale complete nu pare să rezulte din mecanismele de aliniere, ci mai degrabă indică o limitare arhitecturală reală – una care ar putea fi deja redusă în modelele mai recente sau va fi curând.

 

Publicat pentru prima dată luni, 5 mai 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai