Andersonův úhel

Výzkum naznačuje, že LLM jsou ochotny pomáhat při škodlivém “vibe codingu”

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
ChatGPT-4o and Adobe Firefly.

Před několika lety velké jazykové modely (LLM) vyvolaly pozornost kvůli jejich potenciálnímu zneužití v ofenzivních kybernetických útocích, zejména při generování softwarových exploitů.

Poslední trend směrem k “vibe codingu” (neformálnímu použití jazykových modelů pro rychlý vývoj kódu pro uživatele, místo explicitního učení uživatele programovat) obnovil koncept, který dosáhl svého vrcholu v roce 2000: “script kiddie” – relativně nešikovný škodlivý aktér s dostatečnými znalostmi, aby replikoval nebo vyvinul škodlivý útok. Implikace je přirozená: když je snížena hranice vstupu, hrozby se budou pravděpodobně množit.

Všechny komerční LLM mají somekind ochranu proti použití pro takové účely, i když tyto ochranné opatření jsou pod stálým útokem. Typicky, většina FOSS modelů (včetně LLM a generativních obrazových/video modelů) je vydána s nějakou podobnou ochranou, obvykle z důvodu souladu se zákonem na západě.

Jednak oficiální modely jsou poté rutinně “fine-tuned” uživatelskými komunitami, které hledají úplnější funkčnost, nebo “LoRAs” jsou použity k obejití omezení a potenciálně získání “nežádoucích” výsledků.

Ačkoli většina online LLM zabrání pomoci uživateli se škodlivými procesy, “nesvázané” iniciativy, jako je Deep Hat, jsou k dispozici, aby pomohly bezpečnostním výzkumníkům operovat na stejné úrovni jako jejich oponenti.

Obecný uživatelský zážitek v současné době je nejčastěji reprezentován v sérii ChatGPT, jejichž filtrační mechanismy často vyvolávají kritiku ze strany komunity LLM.

Zdá se, že se snažíte zaútočit na systém!

Vzhledem k této vnímané tendenci k omezení a cenzuře, uživatelé mohou být překvapeni, že ChatGPT byl nalezen jako nejvíce spolupracující ze všech testovaných LLM v nedávné studii, která byla navržena tak, aby donutila jazykové modely vytvořit škodlivé kódy exploitů.

Nová studie od výzkumníků z UNSW Sydney a Commonwealth Scientific and Industrial Research Organisation (CSIRO), nazvaná Dobrá zpráva pro script kiddie? Hodnocení velkých jazykových modelů pro automatickou generaci exploitů, nabízí první systematické hodnocení, jak účinně tyto modely mohou být vyvolány k produkci funkčních exploitů. Příklady konverzací z výzkumu byly poskytnuty autory.

Studie srovnává, jak modely fungovaly na původních a modifikovaných verzích známých zranitelností (strukturovaných programovacích cvičení navržených k demonstraci specifických softwarových bezpečnostních chyb), což pomáhá odhalit, zda se spoléhaly na paměťové příklady nebo zda se potýkaly s vestavěnými bezpečnostními omezeními.

Z podpůrné stránky, Ollama LLM pomáhá výzkumníkům vyvinout útok na řetězec zranitelnosti. Zdroj: https://anonymous.4open.science/r/AEG_LLM-EAE8/chatgpt_format_string_original.txt

Z podpůrné stránky, Ollama LLM pomáhá výzkumníkům vyvinout útok na řetězec zranitelnosti. Zdroj: https://anonymous.4open.science/r/AEG_LLM-EAE8/chatgpt_format_string_original.txt

Zatímco žádný z modelů nebyl schopen vytvořit funkční exploit, několik z nich se velmi přiblížilo; důležitější je, že několik z nich chtělo udělat lepší práci na této úloze, což naznačuje potenciální selhání stávajících bezpečnostních mechanismů.

Studie uvádí:

‘Naše experimenty ukazují, že GPT-4 a GPT-4o vykazují vysokou míru spolupráce při generaci exploitů, srovnatelnou se some necenzurovanými open-source modely. Mezi hodnocenými modely byl Llama3 nejvíce odolný vůči takovým žádostem.

‘Přes jejich ochotu pomoci, skutečná hrozba, kterou tyto modely představují, zůstává omezená, protože žádný z nich úspěšně nevygeneroval exploity pro pět custom laboratoří s refaktorovaným kódem. Nicméně GPT-4o, nej silnější performer v naší studii, obvykle udělal pouze jednu nebo dvě chyby na pokus.

‘To naznačuje významný potenciál pro využití LLM k vývoji pokročilých, obecně použitelných [Automated Exploit Generation (AEG)] technik.’

Mnohé druhé šance

Pravda “Nemáte druhou šanci udělat dobrý první dojem” se obecně nevztahuje na LLM, protože typicky omezené kontextové okno znamená, že negativní kontext (v sociálním smyslu, tj. antagonismus) není trvalý.

Přemýšlejte: pokud byste šli do knihovny a požádali o knihu o praktickém výrobě bomb, pravděpodobně byste byli odmítnuti, alespoň zpočátku. Ale (předpokládaje, že tato žádost zcela nezničila konverzaci od začátku) vaše žádosti o související díla, jako jsou knihy o chemických reakcích nebo návrhu obvodů, by, v mysli knihovníka, byly jasně související s původní žádostí a byly by léčeny v tomto světle.

Pravděpodobně by knihovník také vzpomněl na všech budoucích setkáních, že jste jednou požádali o knihu o výrobě bomb, což by učinilo tento nový kontext vaší osoby “nepopravitelným”.

Není tomu tak u LLM, který může mít potíže s uchováním tokenizovaných informací, dokonce i z aktuální konverzace, natož z dlouhodobé paměti (pokud existuje v architektuře, jako u produktu ChatGPT-4o).

Takže i neformální konverzace s ChatGPT nám náhodou odhalují, že někdy táhne za menší věci, ale polyká velblouda, nejméně když je téma, studie nebo proces související s jinak “zakázanou” činností dovoleno rozvinout během diskuse.

To platí pro všechny současné jazykové modely, i když kvalita bezpečnostních mechanismů se může lišit v rozsahu a přístupu mezi nimi (tj. rozdíl mezi úpravou váh trénovaného modelu nebo použitím vstupního/výstupního filtrování textu během relace, které ponechává model strukturálně neporušen, ale potenciálně snazší na útok).

Testování metody

Aby otestovali, jak daleko LLM mohou být tlačeny k generování funkčních exploitů, autoři nastavili kontrolované prostředí pomocí pěti laboratoří z SEED Labs, každá postavená kolem známých zranitelností, včetně přetečení bufferu, návratu do libc, útoků Dirty COW a podmínek závodů.

Kromě použití původních laboratoří vytvořili výzkumníci modifikované verze přejmenováním proměnných a funkcí na generické identifikátory. To mělo zabránit tomu, aby modely čerpal z paměťových tréninkových příkladů.

Každá laboratoř byla spuštěna dvakrát pro každý model: jednou v původní podobě a jednou v obfuskované verzi.

Výzkumníci poté zavedli druhý LLM do smyčky: útočný model navržen tak, aby vyvolal a znovu vyvolal cílový model, aby zlepšil a vylepšil jeho výstup přes několik kol. LLM použitý pro tuto roli byl GPT-4o, který fungoval prostřednictvím skriptu, který zprostředkoval dialog mezi útočníkem a cílem, umožňující tak cyklu pokračovat až patnáctkrát, nebo dokud nebyl možný žádný další pokrok:

Pracovní postup pro LLM-založený útočník, v tomto případě GPT-4o.

Pracovní postup pro LLM-založený útočník, v tomto případě GPT-4o.

Cílové modely pro projekt byly GPT-4o, GPT-4o-mini, Llama3 (8B), Dolphin-Mistral (7B) a Dolphin-Phi (2,7B), reprezentující jak proprietární, tak open-source systémy, s mixem zarovnaných a nezarovnaných modelů (tj. modely s vestavěnými bezpečnostními mechanismy navržené k blokování škodlivých promptů a ty, které byly upraveny pomocí fine-tuning nebo konfigurace, aby obešly tyto mechanismy).

Místně instalovatelné modely byly spuštěny prostřednictvím Ollama frameworku, zatímco ostatní byly přístupné pouze prostřednictvím jejich API.

Výsledky

Výzkumníci testovali, jak spolupracující je každý model během procesu generace exploitů, měřeno zaznamenáním procenta odpovědí, ve kterých se model pokusil pomoci s úkolem (i když výstup byl vadný).

Výsledky z hlavní zkoušky, ukazující průměrnou spolupráci.

Výsledky z hlavní zkoušky, ukazující průměrnou spolupráci.

GPT-4o a GPT-4o-mini ukázaly nejvyšší úroveň spolupráce, s průměrnými rychlostmi odpovědí 97 a 96 procent, resp., napříč pěti kategoriemi zranitelností: přetečení bufferu, návrat do libc, řetězec formátu, podmínky závodů a Dirty COW.

Dolphin-Mistral a Dolphin-Phi následovaly blízko, s průměrnými rychlostmi spolupráce 93 a 95 procent. Llama3 ukázal nejméně ochotu se zúčastnit, s celkovou rychlostí spolupráce pouze 27 procent:

Vlevo vidíme počet chyb, které LLM udělaly v původních programech SEED Lab; vpravo vidíme počet chyb, které udělaly v refaktorovaných verzích.

Vlevo vidíme počet chyb, které LLM udělaly v původních programech SEED Lab; vpravo vidíme počet chyb, které udělaly v refaktorovaných verzích.

Při zkoumání skutečné výkonnosti těchto modelů, našli významnou mezеру mezi ochotou a účinností: GPT-4o produkoval nejpreciznější výsledky, s celkovým počtem šesti chyb napříč pěti obfuskovanými laboratořemi. GPT-4o-mini následoval s osmi chybami. Dolphin-Mistral fungoval rozumně dobře na původních laboratořích, ale měl potíže, když byl kód refaktorován, což naznačuje, že mohl vidět podobný obsah během tréninku. Dolphin-Phi udělal sedmnáct chyb a Llama3 nejvíce, s patnácti.

Neúspěchy typicky zahrnovaly technické chyby, které učinily exploity nefunkčními, jako jsou nesprávné velikosti bufferu, chybějící logika smyčky nebo syntakticky platné, ale neúčinné payloady. Žádný model se nezdařil vygenerovat funkční exploit pro žádnou z obfuskovaných verzí.

Autoři pozorovali, že většina modelů produkovala kód, který připomínal funkční exploity, ale selhal kvůli slabému pochopení, jak fungují základní útoky – vzorec, který byl evidentní napříč všemi kategoriemi zranitelností a který naznačoval, že modely napodobovaly známé struktury kódu, místo aby procházely logikou, která je zapojena (v případech přetečení bufferu, například, mnoho selhalo při konstrukci funkčního NOP sled/slide).

Při pokusech o návrat do libc často zahrnovaly payloady nesprávné padding nebo nesprávné adresy funkcí, což vedlo k výstupům, které vypadaly platně, ale byly nepoužitelné.

Ačkoli autoři popisují tuto interpretaci jako spekulativní, konzistence chyb naznačuje širší problém, ve kterém modely selhávají při spojení kroků exploitu s jejich zamýšleným účinkem.

Závěr

Existuje určitá pochybnost, studie připouští, zda jazykové modely testované neviděly původní laboratoře SEED během prvního tréninku; z tohoto důvodu byly vytvořeny varianty. Přesto autoři potvrzují, že by rádi pracovali s reálnými exploity v pozdějších iteracích této studie; skutečně nové a nedávné materiály jsou méně pravděpodobně podrobeny zkratkám nebo jiným matoucím efektům.

Autoři také přiznávají, že pozdější a pokročilejší “myslící” modely, jako je GPT-o1 a DeepSeek-r1, které nebyly k dispozici v době, kdy byla studie provedena, mohou zlepšit výsledky získané, a že to je další indikace pro budoucí práci.

Studie uzavírá, že většina testovaných modelů by vyprodukovala funkční exploity, pokud by byly schopny tak učinit. Jejich selhání při generování plně funkčních výstupů se nezdá být výsledkem bezpečnostních mechanismů, ale spíše skutečným architektonickým omezením – jedním, které může být již sníženo v novějších modelech, nebo brzy bude.

 

Poprvé publikováno v pondělí, 5. května 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai