Andersonův úhel

Osobní jazykové modely jsou snadné na výrobu – a těžší na detekci

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

Otevřené klonování ChatGPT lze upravit v měřítku a s omezenou nebo žádnou odborností, což usnadňuje vytváření „privátních“ jazykových modelů, které unikají detekci. Většina nástrojů nemůže určit, odkud tyto modely pocházejí nebo k čemu byly vyškoleny, což umožňuje studentům a jiným uživatelům generovat texty AI bez odhalení; ale nová metoda tvrdí, že může identifikovat tyto skryté varianty rozpoznáním sdílených „rodinných rysů“ v výstupech modelů.

 

Podle nové studie z Kanady jsou uživatelsky přizpůsobené AI chat modely, podobné ChatGPT, schopné produkovat obsah na sociálních médiích, který se podobá lidskému psaní, a který může oklamat nejmodernější detekční algoritmy a lidi.

Studie uvádí:

‘Reálně motivovaný útočník pravděpodobně upraví model pro svůj specifický styl a použití, protože je to levné a snadné. S minimálním úsilím, časem a penězi jsme vytvořili upravené generátory, které jsou schopné mnohem realističtějších sociálních médií, založených na lingvistických funkcích a detekčních přesnostech, a to bylo ověřeno pomocí lidských anotací.’

Autoři zdůrazňují, že takové přizpůsobené modely nejsou omezeny na krátký obsah na sociálních médiích:

‘Ačkoli jsme motivováni šířením AI obsahu na sociálních médiích a souvisejícími riziky astroturfingu a vlivových kampaní, zdůrazňujeme, že hlavní zjištění se vztahují na všechny textové domény.

‘Skutečně, úprava modelů pro generování stylu-specifického obsahu je obecně použitelná metoda, a je pravděpodobné, že ji již používají mnozí uživatelé generativních AI – což vyvolává otázku, zda stávající metody detekce AI jsou tak účinné ve skutečném světě jako v laboratoři.’

Jak studie poznamenává, metoda používaná k vytváření těchto přizpůsobených jazykových modelů je úprava, kde uživatelé kurátorují omezené množství vlastních cílových dat a zavádějí je do rostoucího počtu snadno použitelných a levných online tréninkových nástrojů.

Například populární repozitář Hugging Face nabízí úpravu velkých jazykových modelů (LLM) prostřednictvím zjednodušeného rozhraní, pomocí systému AutoTrain Advanced, který lze spustit za několik dolarů prostřednictvím online GPU nebo zdarma, pokud má uživatel dostatečný hardware:

Různé cenové struktury napříč rozsahem GPU dostupných pro systém Hugging Face AutoTrain. Zdroj: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Různé cenové struktury napříč rozsahem GPU dostupných pro systém Hugging Face AutoTrain. Zdroj: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Jiné zjednodušené metody a platformy zahrnují Axolotl, Unsloth a více schopný, ale náročnější TorchTune.

Příklad použití by byl student, který je unavený psaním vlastních esejí, ale bojí se, že bude odhalen online nástroji pro detekci AI, který může použít své vlastní reálné historické eseje jako tréninková data k úpravě velmi účinného otevřeného modelu, jako je série Mistral.

Ačkoli úprava modelu obvykle zkresluje jeho výkon směrem k dodatečným tréninkovým datům a snižuje celkový výkon, „přizpůsobené“ modely lze použít k „de-AI“ stále rozpoznatelnějšího výstupu z systémů, jako je ChatGPT, způsobem, který odráží uživatelský historický styl (a pro zvýšení autenticity i jeho nedostatky).

Nicméně je možné použít výhradně upravený model, který byl speciálně vyškoleno na úzkou úlohu nebo sadu úloh, jako je LLM upravený na kurzu bestimmého univerzitního modulu. Model tak specifický by měl hlubší vhled do této domény než univerzální LLM, jako je ChatGPT, a pravděpodobně by stál méně než 10-20 dolarů na trénink.

LLM ledovec

Je obtížné říci, jak velký je rozsah této praxe. Z anekdotických zpráv na různých sociálních médiích jsem nedávno viděl mnoho obchodních příkladů úprav LLM – určitě více než před rokem; v jednom případě společnost upravila jazykový model na svých vlastních publikovaných thought leadership článcích, které poté mohlo téměř v reálném čase převést neupravený Zoom hovor s novým klientem na vysoce kvalitní B2B příspěvek:

Model této povahy vyžaduje spárovaná data (příklady před a po, ve velkém měřítku), zatímco vytváření přizpůsobené „patiny“ konkrétního spisovatelova stylu je jednodušší úkol, podobný přenosu stylu.

Ačkoli je tato činnost utajená (navzdory mnoha článkům a akademickým studiím na toto téma), kde nejsou k dispozici žádné údaje, stejný zdravý rozum, který přivedl zákon TAKE IT DOWN do zákona tento rok, platí zde: cílová aktivita je možná a dostupná, a existuje silné povědomí, že potenciální uživatelé jsou vysoce motivováni.

Ještě zbývá dostatek tření v nejvíce „zjednodušeném“ online úpravném systému, aby praxe úpravy a použití upravených modelů zůstala relativně niklovou specialitou – alespoň prozatím – i když určitě není mimo tradiční vynalézavost studentů.

PhantomHunter

To nás přivádí k hlavnímu článku, který nás zde zajímá – nový přístup z Číny, který spojuje širokou škálu technik do jediného frameworku – nazvaného PhantomHunter – který tvrdí, že identifikuje výstup upravených jazykových modelů, který by jinak prošel jako originální lidská práce.

Systém je navržen tak, aby fungoval i v případě, že konkrétní upravený model nebyl dříve viděn, a místo toho se spoléhá na zbytkové stopy, které zanechává původní základní model – které autoři charakterizují jako „rodinné rysy“, které přežívají proces úprav.

V testech studie – nazvané PhantomHunter: Detekce neviditelně upraveného LLM-generovaného textu pomocí family-aware učení – hlásí silnou detekční přesnost, se systémem, který překonává hodnocení zero-shot GPT-4-mini při sledování textového vzorku zpět k jeho modelové rodině.

To naznačuje, že čím více je model upraven, tím více odhaluje o svém původu, a tím tak vyvrací předpoklad, že privátní úprava vždy maskuje původ modelu; místo toho proces úprav může zanechat detekovatelnou stopu, která, pokud je správně interpretována, prozradí hru – alespoň do té doby, než budou učiněny další pokroky, které přicházejí téměř týdně.

Studie uvádí*:

‘[Machine Generated Text] detekce obecně rozlišuje LLM-generovaný a lidsky psaný text pomocí binární klasifikace. Stávající metody buď naučí společné textové funkce sdílené napříč LLM pomocí učení reprezentací nebo navrhnou rozlišitelné metriky mezi lidským a LLM textem na základě vnitřních signálů LLM (například tokenové pravděpodobnosti).

‘Pro obě kategorie byly testy většinou prováděny na datech z veřejně dostupných LLM, s předpokladem, že uživatelé generují text pomocí veřejných, off-the-shelf služeb.

Argumentujeme, že se tato situace mění v důsledku nedávného rozvoje otevřené LLM komunity. S pomocí platforem, jako je HuggingFace, a efektivních LLM tréninkových technik, jako je low-rank adaptace (LoRA), se stalo mnohem snadnější postavit upravené LLM s přizpůsobenými privátními daty než dříve.

‘Například na HuggingFace existuje více než 60 000 Llama-based derivátových modelů. Po privátní úpravě na neznámém korpusu by se naučené charakteristiky základních modelů mohly změnit a LLMGT detektory by selhaly, vytvářející nové riziko, že zlomyslní uživatelé mohou generovat škodlivé texty bez odhalení LLMGT detektory.

‘Vzniká nová výzva: jak detekovat text generovaný privátně upravenými otevřenými LLM?

Metoda a trénink

Systém PhantomHunter používá family-aware učení, kombinující tři komponenty: extraktor funkcí, zachycující výstupní pravděpodobnosti z známých základních modelů; kontrastní kódér trénovaný k rozlišení mezi rodinami; a (jak je popsáno níže) mixture-of-experts klasifikátor, který přiřazuje rodinné štítky novým textovým vzorkům:

Schéma systému. PhantomHunter zpracovává textový vzorek tak, že nejprve extrahuje pravděpodobnostní funkce z více základních modelů, které jsou poté zakódovány pomocí CNN a transformer vrstev. Odhaduje modelovou rodinu pro výpočet bránových vah, které řídí mixture-of-experts modul při předpovídání, zda je text LLM-generován. Kontrastní ztráta se aplikuje během tréninku pro jemné rozlišení mezi modelovými rodinami. Zdroj: https://arxiv.org/pdf/2506.15683

Schéma systému. PhantomHunter zpracovává textový vzorek tak, že nejprve extrahuje pravděpodobnostní funkce z více základních modelů, které jsou poté zakódovány pomocí CNN a transformer vrstev. Odhaduje modelovou rodinu pro výpočet bránových vah, které řídí mixture-of-experts modul při předpovídání, zda je text LLM-generován. Kontrastní ztráta se aplikuje během tréninku pro jemné rozlišení mezi modelovými rodinami. Zdroj: https://arxiv.org/pdf/2506.15683

PhantomHunter funguje tak, že prochází textový vzorek několika známými základními modely a zaznamenává, jak pravděpodobné je, že každý z nich bude mít následující slovo, ve všech krocích. Tyto vzorce jsou poté zavedeny do neuronové sítě, která se učí rozlišující charakteristiky každé modelové rodiny.

Během tréninku systém porovnává texty ze stejné rodiny a učí se je seskupovat, zatímco rozlišuje mezi těmi z různých rodin, což pomáhá identifikovat skryté spojení mezi upravenými modely a jejich základními modely.

MOE

K rozhodnutí, zda byl text napsán člověkem nebo AI, PhantomHunter používá mixture-of-experts systém, ve kterém je každý „expert“ naladěn na detekci textu z konkrétní modelové rodiny.

Jakmile systém odhadne, z které rodiny text nejpravděpodobněji pochází, používá tento odhad k rozhodnutí, jakou váhu přikládat každému odborníkovi. Tyto váženými názory se poté kombinují, aby se udělal konečný verdikt: AI nebo člověk.

Trénink systému zahrnuje několik cílů: učení rozpoznávat modelové rodiny; učení rozlišovat AI text od lidského textu; a učení rozlišovat různé rodiny pomocí kontrastního učení – cíle, které se vyvažují během tréninku pomocí nastavitelných parametrů.

Soustředěním se na vzorce sdílené napříč každou rodinou by měl PhantomHunter být schopen detekovat i upravené modely, které neviděl dříve.

Data a testy

K vývoji dat pro testy se autoři soustředili na dvě nejčastější akademické scénáře: psaní a zodpovídání otázek. Pro psaní shromáždili 69 297 abstraktů z akademického archivu Arxiv, rozdělených do primárních domén. Pro zodpovídání otázek bylo z HC3 datasetu vybráno 2 062 párů napříč třemi předměty: ELI5; finance; a medicína:

Seznam zdrojů dat a jejich počtu, v datech shromážděných pro studii.

Seznam zdrojů dat a jejich počtu, v datech shromážděných pro studii.

Celkem bylo pro test trénováno dvanáct modelů. Tři základní modely byly LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; a Gemma 7B-it), z nichž bylo odvozeno devět upravených variant, každá přizpůsobená pro napodobení jiné domény nebo autorského stylu, pomocí doménově specifických dat:

Statistika evaluačního datasetu, kde 'FT Domain' označuje doménu použitou během úpravy a 'base' označuje žádnou úpravu.

Statistika evaluačního datasetu, kde ‘FT Domain’ označuje doménu použitou během úpravy a ‘base’ označuje žádnou úpravu.

Celkem tedy tři základní modely byly upraveny pomocí plných parametrů a LoRA technik napříč třemi odlišnými doménami v každém ze dvou scénářů použití: akademické abstraktní psaní a zodpovídání otázek. Pro odraz skutečných detekčních výzev byly modely upravené na datech z počítačové vědy vyloučeny z testů psaní, zatímco modely upravené na datech z financí byly vyloučeny z hodnocení zodpovídání otázek.

Srovnávací rámce vybrané byly RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; a DeTeCtive.

PhantomHunter byl trénován pomocí dvou typů neuronových vrstev: tří konvolučních vrstev s max-poolingem pro zachycení lokálních textových vzorců a dvou transformer vrstev se čtyřmi pozornostními hlavami pro modelování delších vztahů.

Pro kontrastní učení, které systém motivuje k rozlišení mezi různými modelovými rodinami, byl teplotní parametr nastaven na 0,07.

Cílem tréninku byly tři ztrátové termíny: L1 (pro klasifikaci rodin) a L2 (pro binární detekci), každý vážený na 1,0, a L3 (pro kontrastní učení), vážený na 0,5.

Model byl optimalizován pomocí Adam se learning rate 2e-5 a batch size 32. Trénink probíhal po dobu deseti plných epoch, s nejlepšími výkony vybranými pomocí validačního souboru. Všechny experimenty byly provedeny na serveru se čtyřmi NVIDIA A100 GPU.

Použité metriky byly F1 skóre pro každou testovací podmnožinu, spolu s pravdivou pozitivní rychlostí pro srovnání s komerčními detektory.

F1 skóre pro detekci textu z neviditelně upravených jazykových modelů. Dvě nejlepší výsledky v každé kategorii jsou tučné a podtržené. 'BFE' označuje extrakci základních pravděpodobnostních funkcí, 'CL' kontrastní učení a 'MoE' mixture-of-experts modul.

F1 skóre pro detekci textu z neviditelně upravených jazykových modelů. Dvě nejlepší výsledky v každé kategorii jsou tučné a podtržené. ‘BFE’ označuje extrakci základních pravděpodobnostních funkcí, ‘CL’ kontrastní učení a ‘MoE’ mixture-of-experts modul.

Výsledky počátečního testu, zobrazené v tabulce výše, ukazují, že PhantomHunter překonal všechny srovnávací systémy, přičemž udržel F1 skóre nad 90 % pro jak lidsky generovaný, tak strojově generovaný text, i když byl vyhodnocen na výstupech z upravených modelů, které nebyly zahrnuty do tréninku.

Autoři komentují:

‘S plnou úpravou PhantomHunter zlepšuje MacF1 skóre o 3,65 % a 2,96 % na obou datech, a s LoRA úpravou jsou zlepšení 2,01 % a 6,09 %.

‘Výsledek demonstruje silnou detekční schopnost PhantomHunteru pro texty generované neviditelně upravenými LLM.’

Byly provedeny ablační studie, aby se zhodnotila role každé hlavní komponenty v PhantomHunteru. Když byly jednotlivé prvky odstraněny, jako je extraktor funkcí, kontrastní kódér nebo mixture-of-experts klasifikátor, došlo k poklesu přesnosti, což naznačuje, že architektura závisí na koordinaci všech částí.

Autoři také zkoumali, zda může PhantomHunter generalizovat za hranice svého tréninkového rozdělení, a zjistili, že i když byl aplikován na výstupy z základních modelů, které nebyly během tréninku přítomny, nadále překonával srovnávací metody – naznačující, že rodinné signály zůstávají detekovatelné napříč upravenými variantami.

Závěr

Jedním argumentem ve prospěch uživatelsky trénovaných generativních jazykových modelů je, že alespoň tyto malé úpravy a LoRA uchovávají individuální chuť a excentricitu autora, v době, kdy generický, SEO-inspirovaný styl AI chatbotů ohrožuje jakékoli jazyky, kde se AI stává významným nebo dominantním přispěvatelem.

S devalvací studentské eseje a s tím, že studenti nyní nahrávají obrovské písemné seance, aby prokázali, že nepoužili AI ve svých příspěvcích, více učitelů mimo Evropu (kde jsou ústní zkoušky normalizovány) zvažuje ústní zkoušky jako alternativu k odevzdaným textům. Nedávno byla navržena i návrat k rukopisnému práci.

Argumentovatelně jsou obě tyto řešení lepší než potenciální LLM-založený opakující se závod ve zbrojení; i když jsou spojeny s lidským úsilím a pozorností, které technická kultura目前 snaží automatizovat.

 

Pokud si chcete přečíst více o tomto tématu, podívejte se na konec sekce po hlavních výsledcích, v původním článku.

* Přeložené citace autorů do hyperlinky. Zvýraznění textu je původně od autorů.

První publikováno ve čtvrtek, 19. června 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai