Modely a platformy AI
MARKLLM: Otevřený zdroj nástrojů pro vodoznakování LLM
Vodoznakování LLM, které integruje neviditelné, ale detekovatelné signály do výstupů modelu pro identifikaci textu vygenerovaného LLM, je důležité pro prevenci zneužívání velkých jazykových modelů. Tyto techniky vodoznakování se dělí hlavně do dvou kategorií: KGW Family a Christ Family. KGW Family modifikuje logity vyprodukovány LLM, aby vytvořily vodoznakový výstup, kategorizující slovní zásobu do zeleného seznamu a červeného seznamu na základě předcházejícího tokenu. Bias je zaveden do logitů zeleného seznamu tokenů během generování textu, upřednostňující tyto tokeny ve vygenerovaném textu. Statistická metrika je poté vypočtena z podílu zelených slov a stanoven práh pro rozlišení mezi vodoznakovým a nevodoznakovým textem. Vylepšení metody KGW zahrnují lepší partitionování seznamu, lepší manipulaci s logity, zvýšenou kapacitu vodoznaku, odolnost proti útokům na odstranění vodoznaku a schopnost veřejně detekovat vodoznaky.
Naopak, Christ Family modifikuje proces výběru tokenů během generování textu LLM, vkládaje vodoznak změnou, jak jsou tokeny vybírány. Obě rodiny vodoznakování se snaží vyvážit detekovatelnost vodoznaku s kvalitou textu, řešíce výzvy, jako je robustnost v různých nastaveních entropie, zvýšení kapacity vodoznaku a ochrana proti pokusům o odstranění. Nedávný výzkum se zaměřil na vylepšení partitionování seznamu a manipulaci s logity, zvyšování kapacity vodoznaku, vyvíjení metod pro odolnost proti útokům na odstranění vodoznaku a umožnění veřejného detekování. V konečném důsledku je vodoznakování LLM důležité pro etické a odpovědné použití velkých jazykových modelů, poskytující metodu pro stopování a ověření textu vygenerovaného LLM. KGW a Christ Family nabízejí dva rozdílné přístupy, každý se svými jedinečnými silnými stránkami a aplikacemi, neustále se vyvíjejícími prostřednictvím probíhajícího výzkumu a inovací.
Díky schopnosti rámců vodoznakování LLM vkládat algoritmicky detekovatelné signály do výstupů modelu pro identifikaci textu vygenerovaného rámcem LLM hraje důležitou roli v zmírnění rizik spojených se zneužíváním velkých jazykových modelů. Nicméně, existuje mnoho rámců vodoznakování LLM na trhu, každý se svými vlastními perspektivami a postupy hodnocení, což činí obtížným pro výzkumníky snadno experimentovat s těmito rámcemi. Aby se tato otázka vyřešila, MarkLLM, otevřený zdroj nástrojů pro vodoznakování, nabízí extenzivní a sjednocený rámec pro implementaci algoritmů vodoznakování LLM, zatímco poskytuje uživatelsky přívětivé rozhraní pro zajištění snadného použití a přístupu. Kromě toho, rámec MarkLLM podporuje automatickou visualizaci mechanismů těchto rámců, tím zlepšuje srozumitelnost těchto modelů. Rámec MarkLLM nabízí komplexní sadu 12 nástrojů pokrývajících tři perspektivy spolu se dvěma automatizovanými procesy hodnocení pro hodnocení jeho výkonu. Tento článek se zaměřuje na rámec MarkLLM do hloubky a prozkoumává mechanismus, metodologii, architekturu rámců a jeho srovnání se stávajícími rámcemi.
MarkLLM: Nástroj pro vodoznakování LLM
Vznik velkých jazykových modelů, jako je LLaMA, GPT-4, ChatGPT a další, významně pokročil schopnost umělých modelů vykonávat specifické úkoly, včetně kreativního psaní, porozumění obsahu, formování načtení a mnoho dalšího. Nicméně, spolu s pozoruhodnými výhodami spojenými s výjimečnou schopností současných velkých jazykových modelů, objevily se určité rizika, včetně akademického ghostwritingu, LLM generovaného falešného zpravodajství a zobrazení, a individuální impersonace, aby se jmenovaly alespoň některé. Vzhledem k rizikům spojeným s těmito problémy je důležité vyvinout spolehlivé metody s možností rozlišení mezi textem vygenerovaným LLM a lidským obsahem, což je hlavní požadavek pro zajištění autenticity digitální komunikace a prevenci šíření dezinformací. Během posledních několika let bylo vodoznakování LLM doporučeno jako jedna z perspektivních řešení pro rozlišení obsahu vygenerovaného LLM od lidského obsahu, a tím, že se vkládají specifické funkce během procesu generování textu, lze výstupy LLM jedinečně identifikovat pomocí speciálně navržených detektorů.
Aby se most mezi současnou mezerou uzavřel, rámec MarkLLM se snaží učinit následující příspěvky. MarkLLM nabízí konzistentní a uživatelsky přívětivé rozhraní pro načítání algoritmů, generování vodoznakového textu, provádění detekčních procesů a sběr dat pro visualizaci. Poskytuje vlastní řešení pro visualizaci pro obě hlavní rodiny vodoznakovacích algoritmů, umožňující uživatelům vidět, jak různé algoritmy fungují v různých konfiguracích s reálnými příklady. Nástroj zahrnuje komplexní modul pro hodnocení, který pokrývá 12 nástrojů pro detekovatelnost, robustnost a dopad na kvalitu textu. Kromě toho, nabízí dva typy automatizovaných procesů hodnocení, které podporují uživatelskou konfiguraci datových sad, modelů, metrik hodnocení a útoků, usnadňující flexibilní a komplexní hodnocení. Navržený s modulární, volně spojenou architekturou, MarkLLM zlepšuje škálovatelnost a flexibilitu. Tento designový výběr podporuje integraci nových algoritmů, inovativních technik visualizace a rozšíření nástroje pro hodnocení budoucími vývojáři.
Bylo navrženo mnoho algoritmů vodoznakování, ale jejich jedinečné implementační přístupy často upřednostňují specifické požadavky před standardizací, vedoucí k několika problémům
- Chybí standardizace v návrhu třídy: To vyžaduje značné úsilí pro optimalizaci nebo rozšíření stávajících metod kvůli nedostatečně standardizovaným návrhům tříd.
- Chybí uniformita v rozhraních nejvyšší úrovně: Nesourodá rozhraní činí dávkové zpracování a replikaci různých algoritmů únavnými a časově náročnými.
- Problémy se standardy kódu: Výzvy zahrnují potřebu modifikovat nastavení napříč několika segmenty kódu a nekonzistentní dokumentaci, komplikující přizpůsobení a efektivní použití. Hardwarově kódované hodnoty a nekonzistentní zpracování chyb dále znesnadňují přizpůsobení a ladění.
Aby se tyto problémy vyřešily, náš nástroj nabízí sjednocený implementační rámec, který umožňuje pohodlné vyvolání různých stávajících algoritmů v flexibilních konfiguracích. Kromě toho, náš pečlivě navrženým tříděním třídy otevírá cestu pro budoucí rozšíření. Následující obrázek demonstruje návrh tohoto sjednoceného implementačního rámců.
Díky distributivnímu designu rámců je pro vývojáře snadné přidat další rozhraní nejvyšší úrovně do libovolné specifické třídy vodoznakovacího algoritmu, aniž by se obávali ovlivnění ostatních algoritmů.
MarkLLM: Architektura a metodologie
Techniky vodoznakování LLM se dělí hlavně do dvou kategorií: KGW Family a Christ Family. KGW Family modifikuje logity vyprodukovány LLM, aby vytvořily vodoznakový výstup, kategorizující slovní zásobu do zeleného seznamu a červeného seznamu na základě předcházejícího tokenu. Bias je zaveden do logitů zeleného seznamu tokenů během generování textu, upřednostňující tyto tokeny ve vygenerovaném textu. Statistická metrika je poté vypočtena z podílu zelených slov a stanoven práh pro rozlišení mezi vodoznakovým a nevodoznakovým textem. Vylepšení metody KGW zahrnují lepší partitionování seznamu, lepší manipulaci s logity, zvýšenou kapacitu vodoznaku, odolnost proti útokům na odstranění vodoznaku a schopnost veřejně detekovat vodoznaky.
Naopak, Christ Family modifikuje proces výběru tokenů během generování textu LLM, vkládaje vodoznak změnou, jak jsou tokeny vybírány. Obě rodiny vodoznakování se snaží vyvážit detekovatelnost vodoznaku s kvalitou textu, řešíce výzvy, jako je robustnost v různých nastaveních entropie, zvýšení kapacity vodoznaku a ochrana proti pokusům o odstranění. Nedávný výzkum se zaměřil na vylepšení partitionování seznamu a manipulaci s logity, zvyšování kapacity vodoznaku, vyvíjení metod pro odolnost proti útokům na odstranění vodoznaku a umožnění veřejného detekování. V konečném důsledku je vodoznakování LLM důležité pro etické a odpovědné použití velkých jazykových modelů, poskytující metodu pro stopování a ověření textu vygenerovaného LLM. KGW a Christ Family nabízejí dva rozdílné přístupy, každý se svými jedinečnými silnými stránkami a aplikacemi, neustále se vyvíjejícími prostřednictvím probíhajícího výzkumu a inovací.
Automatizované komplexní hodnocení
Hodnocení algoritmu vodoznakování LLM je složitý úkol. Nejprve je třeba uvážit různé aspekty, včetně detekovatelnosti vodoznaku, odolnosti proti útokům a dopadu na kvalitu textu. Za druhé, hodnocení z každé perspektivy může vyžadovat různé metriky, scénáře útoků a úkoly. Kromě toho, provádění hodnocení obvykle zahrnuje několik kroků, jako je výběr modelu a datové sady, generování vodoznakového textu, post-processing, detekce vodoznaku, útoky na text a výpočet metriky. Aby se usnadnilo pohodlné a komplexní hodnocení algoritmů vodoznakování LLM, MarkLLM nabízí dvanáct uživatelsky přívětivých nástrojů, včetně různých kalkulátorů metrik a útočníků, kteří pokrývají tři výše zmíněné perspektivy hodnocení. Kromě toho, MarkLLM poskytuje dva typy automatizovaných demo procesů, jejichž moduly lze přizpůsobit a sestavit flexibilně, umožňující snadnou konfiguraci a použití.
Pro aspekt detekovatelnosti, většina algoritmů vodoznakování nakonec vyžaduje specifikaci prahu pro rozlišení mezi vodoznakovým a nevodoznakovým textem. Poskytuje se základní kalkulátor úspěšnosti pomocí pevného prahu. Kromě toho, aby se minimalizoval dopad výběru prahu na detekovatelnost, nabízí se také kalkulátor, který podporuje dynamickou selekci prahu. Tento nástroj může určit práh, který poskytuje nejlepší F1 skóre nebo vybrat práh na základě uživatelem specifikované cílové míry falešně pozitivních výsledků (FPR).
Pro aspekt odolnosti, MarkLLM nabízí tři typy útoků na text na úrovni slov: náhodné odstranění slov v určitém poměru, náhodná substituce synonym pomocí WordNet jako synonymního souboru a kontextově závislá substituce synonym pomocí BERT jako modelu vkládání. Kromě toho, dva typy útoků na text na úrovni dokumentu jsou k dispozici: parafrázování kontextu pomocí OpenAI API nebo modelu Dipper. Pro aspekt kvality textu, MarkLLM nabízí dva přímé analytické nástroje: kalkulátor perplexity pro hodnocení srozumitelnosti a kalkulátor diversity pro hodnocení variability textu. Pro analýzu dopadu vodoznakování na kvalitu textu v konkrétních úkolech, poskytuje se kalkulátor BLEU pro úkoly strojového překladu a posuzovatel pro úkoly generování kódu. Kromě toho, vzhledem k současným metodám pro srovnání kvality vodoznakového a nevodoznakového textu, které zahrnují použití silnějšího LLM pro posouzení, MarkLLM také nabízí diskriminátor GPT, využívající GPT-4 pro srovnání kvality textu.
Procesy hodnocení
Aby se usnadnilo automatizované hodnocení algoritmů vodoznakování LLM, MarkLLM poskytuje dva procesy hodnocení: jeden pro hodnocení detekovatelnosti vodoznaku s a bez útoků a druhý pro analýzu dopadu těchto algoritmů na kvalitu textu. Následující procesy byly implementovány: WMDetect3 a UWMDetect4. Hlavní rozdíl mezi nimi spočívá ve fázi generování textu. První vyžaduje použití metody generate_watermarked_text z algoritmu vodoznakování, zatímco druhý závisí na parametru text_source pro určení, zda přímo načíst přírodní text z datové sady nebo vyvolat metodu generate_unwatermarked_text.
Pro hodnocení dopadu vodoznakování na kvalitu textu, jsou generovány páry vodoznakového a nevodoznakového textu. Texty, spolu s dalšími nezbytnými vstupy, jsou poté zpracovány a předány do určeného analyzátoru kvality textu pro produkci podrobné analýzy a srovnávacích výsledků. Následující procesy byly implementovány pro různé scénáře hodnocení:
- DirectQual.5: Tento proces je speciálně navržen pro analýzu kvality textu srovnáním charakteristik vodoznakového textu s charakteristikami nevodoznakového textu. Hodnotí metriky, jako je perplexita (PPL) a logaritmická diverzita, bez potřeby externích referenčních textů.
- RefQual.6: Tento proces hodnotí kvalitu textu srovnáním obou vodoznakového a nevodoznakového textu s běžným referenčním textem. Měří stupeň podobnosti nebo odchylky od referenčního textu, což je ideální pro scénáře, které vyžadují konkrétní úkoly pro hodnocení kvality textu, jako je strojový překlad a generování kódu.
- ExDisQual.7: Tento proces využívá externího posuzovatele, jako je GPT-4 (OpenAI, 2023), pro hodnocení kvality vodoznakového a nevodoznakového textu. Diskriminátor hodnotí texty na základě uživatelem poskytnutých popisů úkolů, identifikuje potenciální degradaci nebo zachování kvality v důsledku vodoznakování. Tato metoda je zvláště cenná, když je vyžadována pokročilá, AI-založená analýza jemných účinků vodoznakování.
MarkLLM: Experimenty a výsledky
Pro hodnocení jeho výkonu, rámec MarkLLM provedl hodnocení devíti různých algoritmů a posoudil jejich dopad, odolnost a detekovatelnost na kvalitu textu.

Následující tabulka obsahuje výsledky hodnocení detekovatelnosti devíti algoritmů podporovaných v MarkLLM. Dynamická úprava prahu se používá pro hodnocení detekovatelnosti vodoznaku, se třemi nastaveními: pod cílovou FPR 10%, pod cílovou FPR 1% a za podmínek pro optimální F1 skóre. Generováno je 200 vodoznakových textů a 200 nevodoznakových textů slouží jako negativní příklady. Poskytujeme TPR a F1-skóre pod dynamickou úpravou prahu pro 10% a 1% FPR, spolu s TPR, TNR, FPR, FNR, P, R, F1, ACC při optimálním výkonu. Následující tabulka obsahuje výsledky hodnocení odolnosti devíti algoritmů podporovaných v MarkLLM. Pro každý útok, jsou generovány 200 vodoznakových textů a poté napadeny, s dalšími 200 nevodoznakovými texty, které slouží jako negativní příklady. Zpráva obsahuje TPR a F1-skóre při optimálním výkonu za každé okolnosti.

Konečné myšlenky
V tomto článku, jsme diskutovali o MarkLLM, otevřeném zdroji nástrojů pro vodoznakování, který nabízí extenzivní a sjednocený rámec pro implementaci algoritmů vodoznakování LLM, zatímco poskytuje uživatelsky přívětivé rozhraní pro zajištění snadného použití a přístupu. Kromě toho, rámec MarkLLM podporuje automatickou visualizaci mechanismů těchto rámců, tím zlepšuje srozumitelnost těchto modelů. Rámec MarkLLM nabízí komplexní sadu 12 nástrojů pokrývajících tři perspektivy spolu se dvěma automatizovanými procesy hodnocení pro hodnocení jeho výkonu.












