Andersonův úhel

Identifikace krádeže modelů AI pomocí tajných sledovacích dat

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
George Washington winking and smiling on the one dollar bill. Source: https://en.wikipedia.org/wiki/Marked_bill + Flux Edit and Adobe Firefly V3

Nová metoda může tajně označit modely podobné ChatGPT během sekund bez potřebného přeškolování, aniž by zanechala stopu v obecném výstupu a přežila všechny možné pokusy o odstranění.

 

Jemný rozdíl mezi označkováním a “copyright-baiting” spočívá v tom, že označení – ať už zjevné nebo skryté – jsou obvykle určena k tomu, aby se objevila po celém souboru (jako je soubor obrázků) jako všudypřítomná překážka pro neoprávněné kopírování.

Naproti tomu je fiktivní vstup malý segment textu, obvykle slovo nebo definice, který je součástí velkého a relativně obecného souboru, určený k prokázání krádeže. Nápad spočívá v tom, že když je celý soubor neoprávněně zkopírován, buď sám o sobě nebo jako základ pro odvozený soubor, přítomnost “jedinečné” a fiktivní skutečnosti, zavedené původním vlastníkem, snadno prokáže akt krádeže.

V případě označkování velkých jazykových modelů (LLM) a modelů jazyka a vidění (VLM) je rozsah, v jakém výstup má obsahovat tyto označení, často rozdělen mezi tyto dva cíle: zajistit, aby veškerý nebo většina výstupu obsahovala zjevné nebo skryté označení; nebo zajistit, aby mohl být získána “tajná značka”, která prokáže krádež – ale která se neobjeví v běžném výstupu modelu.

Váha (y) důkazů

Druhý přístup je řešen v zajímavé nové spolupráci mezi Čínou, Itálií a Singapurem; práce, která má za cíl poskytnout takovou metodu odhalení pro open source modely, aby je nebylo možné snadno komercializovat nebo jinak používat způsoby, které původní licence nezakazuje.

Například původní licence modelu může vyžadovat, aby kdokoli, kdo z modelu profituje, musel udělat své vlastní úpravy nebo změny veřejně dostupné pod stejnými štědrými licenčními podmínkami – ale společnost může chtít uchovat své “úpravy” (jako jemně naladěné verze), aby vytvořila priehrady, kde nejsou žádné povoleny.

Velká většina výzkumu v této oblasti se zabývá detekčními rutinami souvisejícími s uzavřeným zdrojovým kódem, API-only modely nebo modely, pro které jsou k dispozici pouze optimalizované (kvantizované) váhy; a které jsou proto obtížnější efektivně upravovat a měnit způsobem, který navrhuje nová práce (protože neexistuje přímý přístup k architektuře modelu samotného).

Tato pozornost věnovaná FOSS verzím je možná nečekaná z čínského výzkumného sektoru, protože čínská produkce AI byla za poslední rok charakterizována štědrými plnými verzemi modelů, které alespoň rivality západním “uzamčeným” ekvivalentům.

Nový přístup, nazvaný EditMark, se liší tím, že nevyžaduje ani to, aby model byl jemně naladěn pro přidání “poškozených” dat, ani to, aby byl trénován od začátku se zahrnutými daty.

To má několik výhod: jedna z nich je, že jakékoli “zjevné” údaje zahrnuté do trénovacího souboru, jakmile jsou objeveny a zveřejněny, již nebudou účinné, protože je lze přímo napadnout; ale aby se napadl EditMark, útočník by musel vědět, který vrstva modelu napadnout, a jaký přístup použít. To je nepravděpodobný scénář.

Zadruhé je přístup rychlý a levný, zabere pouze několik sekund (na rozdíl od dnů nebo dokonce týdnů) k aplikaci na trénovaný model, čímž se eliminuje vysoké náklady na jemné naladění (které se zvyšují lineárně se velikostí modelu a dat, která se mají aplikovat).

Nakonec přístup způsobuje mnohem méně poškození normálnímu provozu cíleného modelu než jemné naladění nebo předchozí editační metody.

V testech EditMark – který vkládá matematické dotazy s více možnými odpověďmi do modelových váh – dosáhl extrakční rychlosti 100%.

Autoři uvádějí:

‘Komplexní experimenty prokazují výjimečné výkony EditMarku při označkování LLM. EditMark dosahuje pozoruhodné efektivity vkládáním 32bitového označení za méně než 20 sekund s 100% úspěšností extrakce (ESR).

‘Zejména doba vkládání označení je méně než 1/300 jemného naladění (průměrně 6 875 sekund), což zdůrazňuje účinnost EditMarku při implementaci vysoce kapacitních označení s bezprecedentní rychlostí a spolehlivostí.

‘Kromě toho rozsáhlé experimenty ověřují odolnost, skrytost a věrnost EditMarku.’

Nová práce se jmenuje EditMark: Označkování velkých jazykových modelů na základě editace modelu a pochází od osmi autorů z Univerzity vědy a technologie Číny, Univerzity v Sieně a CFAR/IHPC/A*STAR v Singapuru.

Metoda

Přístup EditMark se skládá ze čtyř komponent: Generátoru, Kodéru, Editoru a Dekodéru:

EditMark pipeline vkládá označení editací modelu pro odpovědi na specifické matematické otázky, které kódují skryté identifikační informace. Zdroj: https://arxiv.org/pdf/2510.16367

EditMark pipeline vkládá označení editací modelu pro odpovědi na specifické matematické otázky, které kódují skryté identifikační informace. Zdroj: https://arxiv.org/pdf/2510.16367

Generátor používá pseudo-náhodné semínko k vytvoření více odpovědí matematických otázek; Kodér vybírá odpovědi na základě označení, které jsou poté vloženy do modelu pomocí specializovaného editačního procesu. Jakmile je upravený model vydán nebo zneužit, označení lze extrahovat dotazováním na stejné otázky a dekódováním vzoru odpovědí.

Následně Editor upravuje modelové váhy tak, aby model spolehlivě produkoval cílové odpovědi, když je dotázán na tyto semínkové otázky, vkládaje označení přímo do chování modelu. Dekodér poté obnovuje označení tím, že klade stejné otázky podezřelému modelu a překládá jeho odpovědi zpět do skrytého podpisu.

Model hrozeb

Práce předpokládá, že označkování se provádí v bílém boxu. Ačkoli to není obvykle dobrý znak ve výzkumu souvisejícím s bezpečností, zde je to normální, protože metoda má za cíl chránit vlastníky, kteří mají plný přístup ke své práci.

Útočník se také předpokládá, že má bílý boxový přístup po získání modelu, což znamená, že jej může upravit (například prořezáním nebo jemným naladěním). Opět je to normální a očekávaný scénář v případě FOSS verze. Nicméně útočník nemá přístup k procesu extrakce označení nebo schématu, který se používá, a může jej objevit pouze pomocí inferencí a experimentů (nebo úniků).

Generátor konstruuje logicky a fakticky platné matematické otázky s více správnými odpověďmi pomocí GPT-4o pro diversifikaci šablon (jak je znázorněno níže) a pseudo-náhodného semínka pro zajištění jedinečnosti každé otázky. To umožňuje známému označení být vloženo deterministicky prostřednictvím permutací odpovědí, zatímco minimalizuje překryv mezi otázkami, aby se zabránilo editačnímu spojení:

Šablony MA otázek generovaných GPT-4o pro vkládání označení, každá strukturovaná pro výstup více platných celočíselných odpovědí z nasazené nerovnosti.

Šablony otázek generovaných GPT-4o pro vkládání označení, každá strukturovaná pro výstup více platných celočíselných odpovědí z nasazené nerovnosti.

Kodér transformuje každý binární segment označení do jedinečné permutace celých čísel vybraných ze souboru řešení dané matematické otázky. Používající lexikografickou teorii permutací, Kodér mapuje desetinnou hodnotu každého segmentu označení na specifickou uspořádanou selekci odpovědí, zajišťující, že označení je deterministicky vloženo do chování modelu.

Co se týče Editoru, původní AlphaEdit metoda editace modelu pro označkování postrádá přesnost a odolnost, s upraveným modelem, který často selhává ve vrácení požadovaných odpovědí. Jakékoli změny, které provede, jsou snadno rozbité prořezáním nebo šumem.

Aby se tomu zabránilo, autoři vyvinuli vícekolový editační strategii, která postupně upravuje modelové váhy v jediné MLP vrstvě až do doby, kdy jeho odpovědi jsou dostatečně sladěny s cílovými odpověďmi. Pro zpevnění úprav proti útokům se během tréninku vkládá také gausovský šum, aby se simulovaly útoky:

Rozdělení změn v K1 pro Baichuan-7B, Qwen-7B a LLaMA3-8B před a po útocích. Horní řádek ukazuje efekt náhodného šumu; spodní řádek ukazuje efekt prořezání modelu. Všechny změny zůstávají blízko nuly, naznačující, že útoky významně neovlivňují vnitřní chování modelu.

Rozdělení změn v K1 pro Baichuan-7B, Qwen-7B a LLaMA3-8B před a po útocích. Horní řádek ukazuje efekt náhodného šumu; spodní řádek ukazuje efekt prořezání modelu. Všechny změny zůstávají blízko nuly, naznačující, že útoky významně neovlivňují vnitřní chování modelu.

Systém hodnocení zastaví proces, jakmile jsou úpravy dostatečně přesné, zatímco regularizace zajišťuje, že aktualizace zůstávají stabilní po několik kol.

Dekodér klade modelu stejné speciální otázky, které se používají během označkování, a poté čte jeho odpovědi, aby odvodil skrytý ID. Protože vzor odpovědí následuje tajný pravidlo, toto ID lze obnovit bez nutnosti prohlížet vnitřek modelu.

Data a testy

Aby se otestovala EditMark, byly vyhodnoceny pět LLM: GPT2-X; GPT-J-6B; LLaMA-3-8B; Baichuan-7B; a Qwen-7B. Uvedený AlphaEdit se použil k vložení označení, zatímco míra úspěšnosti extrakce (ESR) a doba vkládání (ET) byly metriky, které se použily.

Pro referenční hodnoty autoři zvolili Model Watermark (backdoor); KIMark; a BadEdit, rámec původně navržen pro vkládání backdoorů, zde upravený pro účely projektu.

Autoři upravili 15. vrstvu LLaMA-3-8; 17. vrstvu GPT2-XL a GPT-J-6B; a 14. vrstvu Qwen-7B a Baichuan-7B.

Experimenty se prováděly na čtyřech NVIDIA RTX 4090 GPU (24 GB VRAM každý), s označeními o délce 32 bitů, 64 bitů a 128 bitů vloženými. Šablony otázek, které se použily, jsou podrobně popsány v následujícím obrázku:

Šablony použitelné pro generování více odpovědí otázek pro označkování. Každá otázka je založena na jiném typu matematické nerovnosti, s náhodnými hodnotami vloženými do proměnných. Model je požádán o vrácení seznamu celočíselných řešení, s pořadím odpovědí, které se použije pro kódování nebo dekódování bitů označení. Čtyři šablony pokrývají kvadratické, logaritmické, racionální a intervalové formy. Všechny byly vygenerovány pomocí GPT-4o.

Šablony použitelné pro generování více odpovědí (MA) otázek pro označkování. Každá otázka je založena na jiném typu matematické nerovnosti, s náhodnými hodnotami vloženými do proměnných. Model je požádán o vrácení seznamu celočíselných řešení, s pořadím odpovědí, které se použije pro kódování nebo dekódování bitů označení. Čtyři šablony pokrývají kvadratické, logaritmické, racionální a intervalové formy, a všechny byly vygenerovány pomocí GPT-4o.

Aby se snížily účinky náhodnosti, semínka od 1 do 20 se aplikovala během testování, napříč různými kapacitami označení.

Původně výzkumníci testovali jak ESR, tak časovou náročnost vkládání označení napříč rozsahem LLM:

Srovnání EditMarku proti třem předchozím metodám označkování na pěti velkých jazykových modelech. Je uvedena míra úspěšnosti extrakce (ESR) a doba vkládání (ET) v sekundách. EditMark konzistentně dosahuje 100% úspěšnosti, zatímco snižuje dobu vkládání o několik řádů, překonává všechny referenční hodnoty v přesnosti a efektivitě napříč modely různé velikosti a architektury.

Srovnání EditMarku proti třem předchozím metodám označkování na pěti velkých jazykových modelech. Je uvedena míra úspěšnosti extrakce (ESR) a doba vkládání (ET) v sekundách. EditMark konzistentně dosahuje 100% úspěšnosti, zatímco snižuje dobu vkládání o několik řádů, překonává všechny referenční hodnoty v přesnosti a efektivitě napříč modely různé velikosti a architektury.

Z těchto výsledků autoři uvádějí:

‘[EditMark] dosahuje 100% ESR a vyžaduje méně než 20 sekund pro vložení 32bitového označení pro všechny vyhodnocené LLM. Konkrétně průměrná doba vkládání pro Baichuan-7B a Qwen-7B je pod 10 sekund, což demonstruje vysokou efektivitu EditMarku.’

Pro vyhodnocení 128bitového označení, nejvyšší hodnoty, které jsou v tomto schématu proveditelné, EditMark byl schopen zachovat stav “nelze smazat”:

Míra úspěšnosti extrakce a doba vkládání pro EditMark napříč délkami označení 32, 64 a 128 bitů na pěti jazykových modelech. Dokonale úspěšné míry jsou udržovány ve všech případech, zatímco doba vkládání se zvyšuje s délkou označení, ale zůstává pod jednou minutou, dokonce i při 128 bitech.

Míra úspěšnosti extrakce a doba vkládání pro EditMark napříč délkami označení 32, 64 a 128 bitů na pěti jazykových modelech. Dokonale úspěšné míry jsou udržovány ve všech případech, zatímco doba vkládání se zvyšuje s délkou označení, ale zůstává pod jednou minutou, dokonce i při 128 bitech.

Dále se systémova schopnost zachovat věrnost označení testovala napříč několika referenčními body:

Vyhodnocení věrnosti označení na čtyřech referenčních bodech napříč pěti modely, srovnávající neupravené modely s modely označkovanými na 32bitové a 128bitové kapacity. Výkon zůstal stabilní napříč konfiguracemi, s pouze malými fluktuacemi v průměrných skórech, naznačující minimální dopad na přesnost referenčních bodů z vkládání označení.

Vyhodnocení věrnosti označení na čtyřech referenčních bodech napříč pěti modely, srovnávající neupravené modely s modely označkovanými na 32bitové a 128bitové kapacity. Výkon zůstal stabilní napříč konfiguracemi, s pouze malými fluktuacemi v průměrných skórech, naznačující minimální dopad na přesnost referenčních bodů z vkládání označení.

Odolnost EditMarku byla testována proti šesti běžným útokovým strategiím. Modely byly nejprve označkovány 128bitovými označeními pomocí pěti různých semínek. Jemné naladění, jak je znázorněno na obrázku níže, způsobilo pouze malé zhoršení míry úspěšnosti extrakce (ESR) pro většinu modelů:

Míra úspěšnosti extrakce (ESR) označkovaných LLM před a po jemném naladění po jedné až tři epochy. Zatímco většina modelů si udržuje vysokou ESR po celou dobu, Qwen-7B ukazuje výrazný pokles, naznačující větší zranitelnost vůči aktualizacím parametrů.

Míra úspěšnosti extrakce (ESR) označkovaných LLM před a po jemném naladění po jedné až tři epochy. Zatímco většina modelů si udržuje vysokou ESR po celou dobu, Qwen-7B ukazuje výrazný pokles, naznačující větší zranitelnost vůči aktualizacím parametrů.

Even after multiple epochs, most models retained ESRs above 90%, indicating that EditMark resists the parameter drift introduced by LoRA-based training.

Quantization attacks reduced model precision, but left most watermarks intact:

Míra úspěšnosti extrakce (ESR) označkovaných modelů před a po kvantizaci pomocí Int‑8 a Int‑4 přesnosti. ESR zůstala nezměněna pod Int‑8 kvantizací napříč všemi modely, zatímco Int‑4 kvantizace způsobila částečné zhoršení, naznačující, že nižší přesnost může oslabit, ale ne úplně odstranit označení.

Míra úspěšnosti extrakce (ESR) označkovaných modelů před a po kvantizaci pomocí Int‑8 a Int‑4 přesnosti. ESR zůstala nezměněna pod Int‑8 kvantizací napříč všemi modely, zatímco Int‑4 kvantizace způsobila částečné zhoršení, naznačující, že nižší přesnost může oslabit, ale ne úplně odstranit označení.

As we can see in the image above, Int-8 quantization preserved 100% ESR across all models, while Int-4 quantization had a moderate impact on ESR, but introduced unacceptable performance losses.

As the paper notes, this particular scenario suggests limited potential for an attacker, since this results in a hacked but performance-degraded model.

Tests for noise and pruning evaluated four benchmark frameworks: MMLU; BLIMP; TruthfulQA; and GLUE. These attacks led to decreasing ESR as perturbations intensified:

Effect of noise (top row) and pruning (bottom row) attacks on ESR, and benchmark performance of watermarked models. As ESR drops with increasing perturbation, benchmark accuracy also degrades, especially at higher noise intensities and pruning ratios, highlighting the (customary) tension between watermark removal and model utility.

Effect of noise (top row) and pruning (bottom row) attacks on ESR, and benchmark performance of watermarked models. As ESR drops with increasing perturbation, benchmark accuracy also degrades, especially at higher noise intensities and pruning ratios, highlighting the (customary) tension between watermark removal and model utility.

However, these also caused sharp declines in task performance, with Baichuan-7B receiving a 27-31% drop on BLIMP when noise or pruning was applied.

Model editing and adaptive attacks were also evaluated:

Extraction success rate of watermarked models subjected to varying degrees of model editing. Even with up to fifty edits applied to known watermark layers, ESR remains above 95% for all models, indicating that direct parameter modifications have limited effect on watermark removal.

Extraction success rate of watermarked models subjected to varying degrees of model editing. Even with up to fifty edits applied to known watermark layers, ESR remains above 95% for all models, indicating that direct parameter modifications have limited effect on watermark removal.

Here EditMark retained over 95% ESR, even when exact embedding layers were targeted.

Závěr

DRM, tajná označení a další bezpečnostní přístupy, které měly omezený nebo částečný úspěch v před-AI éře, jsou obtížné aplikovat na systémy strojového učení; úmyslně redukční povaha současné řady hostitelských architektur se kombinuje s nedostatkem vhodných nástrojů, aby vložená označení byla poměrně křehká.

Je působivé vidět systém zaměřený na distribuci FOSS modelů a vidět, jak vydrží proti všem scénářům, kromě těch nejméně pravděpodobných, z hlediska znalostí útočníka. Přesto může velmi malý pokles výkonu, který nastává s úpravami po tréninku, dát potenciálním adoptérům důvod k zamyšlení; nejméně proto, že ústup k API-centrickému modelu kontroly eliminuje tyto útoky téměř úplně.

 

* Tento web tvrdil, že ‘open weight’ verze z Číny nemusí nutně kvalifikovat jako plně FOSS, protože data jsou často zadržována, což brání exactní rekreaci trénovacího pipeline. Argumentuje se, že toto téma vyzývá k hlubšímu pohledu na politiku uvolňování AI modelů ve srovnání mezi západem a východem, což je mimo rozsah tohoto článku.

Poprvé publikováno v pondělí, 27. října 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai