Kąt Andersona
Osobiste modele językowe są łatwe do stworzenia – i trudniejsze do wykrycia

Bezpośrednie klony ChatGPT mogą być dostosowywane na dużą skalę i z ograniczoną lub żadną wiedzą, ułatwiając tworzenie “prywatnych” modeli językowych, które unikają wykrycia. Większość narzędzi nie może śledzić, skąd pochodzą te modele ani do czego zostały przeszkolone, pozwalając studentom i innym użytkownikom generować teksty AI bez wykrycia; jednak nowa metoda twierdzi, że może identyfikować te ukryte warianty, wykrywając wspólne “cechy rodzinne” w danych wyjściowych modeli.
Zgodnie z nowym badaniem z Kanady, użytkownikom przypisane modele AI do rozmów, podobne do ChatGPT, są w stanie produkować treści w mediach społecznościowych, które bardzo przypominają pisanie ludzkie i które mogą oszukać najnowocześniejsze algorytmy wykrywania i ludzi.
W artykule stwierdza się:
‘Realistycznie zmotywowany atakujący prawdopodobnie dostosuje model do swojego konkretnego stylu i przypadku użycia, ponieważ jest to tanie i łatwe do zrobienia. Z minimalnym wysiłkiem, czasem i pieniędzmi, wyprodukowaliśmy dostosowane generatory, które są w stanie produkować znacznie bardziej realistyczne tweety w mediach społecznościowych, oparte na cechach językowych i dokładności wykrywania, oraz potwierdzone za pomocą adnotacji ludzkich.’
Autorzy podkreślają, że dostosowane modele tego rodzaju nie są ograniczone do krótkich treści w mediach społecznościowych:
‘Chociaż zainspirowane rozpowszechnieniem treści AI w mediach społecznościowych i związanymi z tym ryzykami astroturfingu i kampanii wpływu, podkreślamy, że główne ustalenia rozciągają się na wszystkie dziedziny tekstu.
‘W rzeczywistości, dostosowywanie modeli do generowania treści zorientowanych na styl jest powszechnie stosowaną metodą, która jest prawdopodobnie już używana przez wielu użytkowników generatywnych modeli AI – co podnosi pytanie, czy istniejące metody wykrywania AIGT są tak skuteczne w świecie rzeczywistym, jak w laboratorium badawczym.’
Jak zauważa artykuł, metoda stosowana do tworzenia tych spersonalizowanych modeli językowych polega na dostosowaniu, gdzie użytkownicy kuratorują ograniczoną ilość własnych danych docelowych i wprowadzają je do coraz większej liczby łatwych w użyciu i tanich narzędzi szkoleniowych online.
Na przykład, popularne repozytorium Hugging Face oferta dostosowanie dużych modeli językowych za pomocą uproszczonego interfejsu, przy użyciu systemu AutoTrain Advanced, który może być uruchomiony za kilka dolarów za pomocą online GPU lub za darmo, lokalnie, jeśli użytkownik ma odpowiednie urządzenie:

Różne struktury cenowe w zakresie dostępnych GPU dla systemu Hugging Face AutoTrain. Źródło: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true
Inne uproszczone metody i platformy obejmują Axolotl, Unsloth oraz bardziej zaawansowane, ale wymagające TorchTune.
Przykładowy przypadek użycia to student, który jest zmęczony pisanie własnych esejów, ale boi się, że zostanie złapany przez narzędzia do wykrywania AI online, który może użyć swoich własnych historycznych esejów jako danych szkoleniowych, aby dostosować skuteczny model open-source, taki jak seria Mistral.
Chociaż dostosowanie modelu tendencję do przesunięcia jego wydajności w kierunku dodatkowych danych szkoleniowych i pogorszenia ogólnej wydajności, “spersonalizowane” modele mogą być używane do “od-AI” coraz bardziej charakterystycznego wyjścia z systemów takich jak ChatGPT, w sposób, który odzwierciedla własny historyczny styl użytkownika (i, dla zwiększonej autentyczności, jego słabości).
Jednak można wyłącznie używać dostosowanego modelu, który został przeszkolony na wąskie zadanie lub zakres zadań, takie jak duży model językowy dostosowany do pracy naukowej z określonego uniwersyteckiego modułu. Model tak specyficzny miałby głębszą wiedzę na temat tej dziedziny niż ogólny model językowy, taki jak ChatGPT, i prawdopodobnie kosztowałby mniej niż 10-20 dolarów do przeszkolenia.
Lodowiec LLM
Trudno powiedzieć, jaka jest skala tego zjawiska. Anegdotycznie, na różnych platformach mediów społecznościowych, ostatnio spotkałem się z wieloma przykładami dostosowywania modeli językowych do celów biznesowych – zdecydowanie więcej takich przykładów niż rok temu; w jednym przypadku firma dostosowała model językowy do swoich własnych opublikowanych artykułów, który potem mógł przekształcić niechlujne połączenie Zoom z nowym klientem w błyskawiczny, profesjonalny post B2B, prawie w jednym przejściu, na żądanie.
Model tego rodzaju wymaga danych sparowanych (przykłady przed i po, w skali), podczas gdy tworzenie spersonalizowanego “połysku” cech określonego pisarza jest łatwiejszym zadaniem, bardziej podobnym do przeniesienia stylu.
Chociaż jest to tajemnicze przedsięwzięcie (pomimo licznych artykułów prasowych i badań akademickich na ten temat), gdzie dane nie są dostępne, ten sam zdrowy rozsądek, który doprowadził do uchwalenia ustawy TAKE IT DOWN w tym roku, ma zastosowanie tutaj: działanie jest możliwe i tanie, a istnieje silne poczucie, że potencjalni użytkownicy są bardzo zmotywowani.
Jest wystarczająco dużo tarcia w najbardziej “uproszczonych” systemach online, aby praktyka nieuczciwego szkolenia i używania dostosowanych modeli pozostała stosunkowo niszowym przypadkiem użycia – na razie – chociaż zdecydowanie nie poza tradycyjną pomysłowością studentów.
PhantomHunter
To prowadzi nas do głównego artykułu, który nas interesuje – nowego podejścia z Chin, które łączy różne techniki w ramach jednego systemu – zwanego PhantomHunter – który twierdzi, że może identyfikować dane wyjściowe dostosowanych modeli językowych, które w przeciwnym razie przypominałyby oryginalną pracę ludzką.
System jest zaprojektowany tak, aby działał nawet wtedy, gdy konkretny dostosowany model nie był wcześniej spotkany, opierając się zamiast tego na resztkach pozostawionych przez oryginalny model bazowy – które autorzy określają jako “cechy rodzinne”, które przetrwają proces dostosowywania.
W testach artykuł – zatytułowany PhantomHunter: Wykrywanie niewidocznych, prywatnie dostosowanych danych wyjściowych LLM za pomocą family-aware learning – donosi o silnej dokładności wykrywania, z systemem, który przewyższa ocenę zero-shot GPT-4-mini† w śledzeniu próbki tekstu do jej rodziny modelu.
To sugeruje, że im więcej model jest dostosowywany, tym więcej ujawnia o swoim pochodzeniu, przecząc założeniu, że prywatne dostosowanie zawsze maskuje pochodzenie modelu; zamiast tego, proces dostosowywania może pozostawić wykrywalny ślad palca, który, jeśli zostanie odpowiednio odczytany, zdradza grę – przynajmniej do czasu, gdy pojawią się dalsze postępy, które wydają się pojawiać co tydzień.
W artykule stwierdza się*:
‘[Wykrywanie tekstu wygenerowanego przez maszynę] ogólnie rozróżnia tekst wygenerowany przez LLM i napisany przez człowieka za pomocą klasyfikacji binarnej. Istniejące metody albo naukę wspólnych cech tekstowych wspólnych dla LLM za pomocą uczenia reprezentacji lub projektują rozróżnialne metryki między tekstem ludzkim a LLM za pomocą wewnętrznych sygnałów LLM (np. prawdopodobieństwo tokenów).
‘Dla obu kategorii ich testy były przeprowadzane głównie na danych z publicznie dostępnych LLM, zakładając, że użytkownicy generują tekst za pomocą publicznych, gotowych usług.
‘Uważamy, że sytuacja ta ulega zmianie ze względu na ostatni rozwój społeczności open-source LLM. Z pomocą platform takich jak HuggingFace i wydajnych technik szkolenia LLM, takich jak adaptacja o niskim zakresie (LoRA), budowanie dostosowanych LLM z prywatnymi zestawami danych stało się znacznie łatwiejsze niż wcześniej.
‘Na przykład, istnieje ponad 60 000 pochodnych modeli Llama na HuggingFace. Po prywatnym dostosowaniu na nieznanym korpusie, nauczone cechy modeli bazowych mogą ulec zmianie, a wykrywacze LLMGT mogą [zawieść], tworząc nowe ryzyko, że użytkownicy mogą generować szkodliwe teksty prywatnie bez wykrycia przez wykrywacze LLMGT.
‘Pojawia się nowe wyzwanie: jak wykryć tekst wygenerowany przez prywatnie dostosowane, open-source LLM?‘
Metoda i szkolenie
System PhantomHunter wykorzystuje świadome rodziny strategię uczenia, łącząc trzy komponenty: wyodrębnianie cech, przechwytujący prawdopodobieństwa wyjścia z znanych modeli bazowych; kodujący kontrastowy szkolony do rozróżniania między rodzinami; oraz (jak opisano poniżej) klasyfikator mieszany, który przypisuje etykiety rodzinne do nowych próbek tekstu:

Schemat systemu. PhantomHunter przetwarza próbkę tekstu, najpierw wyodrębniając cechy prawdopodobieństwa z wielu modeli bazowych, które są następnie zakodowane za pomocą warstw CNN i transformatora. Źródło: https://arxiv.org/pdf/2506.15683
PhantomHunter działa, przechodząc przez kilka znanych modeli bazowych i rejestrując, jak prawdopodobne jest, że każdy z nich uzna następne słowo, na każdym kroku. Te wzorce są następnie wprowadzane do sieci neuronowej, która uczy się rozróżniać charakterystyczne cechy każdej rodziny modeli.
Podczas szkolenia system porównuje teksty z tej samej rodziny i uczy się grupować je razem, różnicując je od tych z innych rodzin, co pomaga identyfikować ukryte połączenia między dostosowanymi modelami a ich modelami bazowymi.
MOE
Aby zdecydować, czy fragment tekstu został napisany przez człowieka czy przez AI, PhantomHunter wykorzystuje system mieszany, w którym każdy “ekspert” jest dostosowany do wykrywania tekstu z określonej rodziny modeli.
Gdy system zgaduje, z której rodziny pochodzi tekst, używa tej oceny, aby zdecydować, jaką wagę przywiązać do opinii każdego eksperta. Te ważone opinie są następnie łączone, aby podjąć ostateczną decyzję: AI czy człowiek.
Szkolenie systemu obejmuje wiele celów: naukę rozpoznawania rodzin modeli; naukę rozróżniania tekstu AI od ludzkiego; oraz naukę rozróżniania różnych rodzin za pomocą kontrastowego uczenia – cele, które są zbalansowane podczas szkolenia za pomocą parametrów dostosowywania.
Poprzez koncentrowanie się na wzorcach wspólnych dla każdej rodziny, zamiast na cechach poszczególnych modeli, PhantomHunter powinien teoretycznie być w stanie wykryć nawet dostosowane modele, których nigdy wcześniej nie spotkał.
Dane i testy
Aby opracować dane do testów, autorzy skoncentrowali się na dwóch najczęstszych scenariuszach akademickich: pisanie i odpowiedzi na pytania. Dla pisania zebrali 69 297 abstraktów z archiwum akademickiego Arxiv, podzielonych na główne dziedziny. Dla odpowiedzi na pytania zebrali 2 062 pary z zestawu danych HC3 w trzech przedmiotach: ELI5; finanse; i medycyna:

Lista źródeł danych i ich liczby, w danych zebranych do badania.
W sumie wytrenowano dwanaście modeli do testu. Trzy modele bazowe to LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; i Gemma 7B-it), z których dziewięć wariantów dostosowanych zostało wytworzonych, każdy dostosowany do naśladowania innego domeny lub stylu autorskiego, przy użyciu danych specyficznych dla domeny:

Statystyki zestawu danych oceny, gdzie ‘FT Domain’ odnosi się do domeny użytej podczas dostosowywania, a ‘base’ wskazuje brak dostosowywania.
Łącznie zatem trzy modele bazowe zostały dostosowane przy użyciu pełnoparametrycznych i LoRA technik w trzech różnych dziedzinach w każdym z dwóch scenariuszy użycia: pisanie abstraktów akademickich i odpowiedzi na pytania. Aby odzwierciedlić wyzwania wykrywania w świecie rzeczywistym, modele dostosowane do danych z dziedziny informatyki zostały wykluczone z testów pisarskich, podczas gdy modele dostosowane do danych finansowych zostały wykluczone z ocen odpowiedzi na pytania.
Wybrane ramy porównawcze to RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; i DeTeCtive.
PhantomHunter został wytrenowany przy użyciu dwóch typów warstw sieci neuronowej: trzech warstw konwolucyjnych z max-poolingiem w celu przechwycenia lokalnych wzorców tekstu, oraz dwóch warstw transformatora z czterema głowicami uwagi każda, aby modelować dłuższe relacje.
Dla kontrastowego uczenia, które zachęca system do rozróżniania między różnymi rodzinami modeli, parametr temperatury został ustalony na 0,07.
Cel szkolenia łączył trzy terminy straty: L1 (dla klasyfikacji rodzin) i L2 (dla wykrywania binarnego), każdy ważony na 1,0, oraz L3 (dla kontrastowego uczenia), ważony na 0,5.
Model został zoptymalizowany przy użyciu Adama z stawką uczenia 2e-5 i rozmiarem partii 32. Szkolenie odbywało się przez dziesięć pełnych epok, z najlepszym punktem kontrolnym wybranym przy użyciu zestawu walidacyjnego. Wszystkie eksperymenty zostały przeprowadzone na serwerze z czterema procesorami GPU NVIDIA A100.
Użyte metryki to wynik F1 dla każdego podzestawu testowego, wraz z wskaźnikiem prawdziwie pozytywnym, do porównania z detektorami komercyjnymi.

Wyniki F1 dla wykrywania tekstu z niewidocznych, dostosowanych modeli językowych. Dwa najlepsze wyniki w każdej kategorii są pogrubione i podkreślone.
Wyniki początkowego testu, uwidocznione w powyższej tabeli, pokazują, że PhantomHunter przewyższył wszystkie systemy bazowe, utrzymując wyniki F1 powyżej 90% zarówno dla tekstu ludzkiego, jak i wygenerowanego przez maszynę, nawet przy ocenianiu danych wyjściowych z dostosowanych modeli wykluczonych z treningu.
Autorzy komentują:
‘Z pełnym dostosowaniem PhantomHunter poprawia wynik MacF1 o 3,65% i 2,96% w obu zestawach danych, odpowiednio; a z dostosowaniem LoRA poprawy wynoszą 2,01% i 6,09%, odpowiednio.
‘Wynik ten demonstruje potężną zdolność wykrywania PhantomHuntera dla tekstów wygenerowanych przez niewidoczne, dostosowane LLM.’
Przeprowadzono badania ablacjacji, aby ocenić rolę każdego podstawowego komponentu w PhantomHunter. Gdy poszczególne elementy zostały usunięte, takie jak wyodrębnianie cech, kodujący kontrastowy lub klasyfikator mieszany, zaobserwowano spadek dokładności, co wskazuje, że architektura opiera się na koordynacji wszystkich części.
Autorzy sprawdzili również, czy PhantomHunter może uogólniać poza swoją dystrybucję szkoleniową i stwierdzili, że nawet przy aplikowaniu do danych wyjściowych z modeli bazowych, które nie były obecne podczas szkolenia, nadal przewyższał rywalizujące metody – co sugeruje, że sygnatury poziomu rodziny pozostają wykrywalne w dostosowanych wariantach.
Wnioski
Jeden z argumentów za korzyścią z modeli językowych przeszkolonych przez użytkowników jest taki, że przynajmniej te małe dostosowania i LoRA zachowują indywidualny smak i ekscentryczność autora w klimacie, w którym generyczny, zainspirowany SEO idiom chatbotów AI zagraża zgeneryzować każdy język, w którym AI staje się głównym lub dominującym wkładem.
Z deprecjacją eseju akademickiego i z uczniami, którzy teraz nagrywają ogromne sesje pisarskie, aby udowodnić, że nie używali AI w swoich pracach, więcej nauczycieli spoza Europy (gdzie egzaminy ustne są normalizowane) rozważa egzaminy ustne jako alternatywę dla zadań pisarskich. Ostatnio powrót do pracy pisaną ręcznie został zaproponowany.
Można argumentować, że oba te rozwiązania są lepsze niż to, co grozi być powtórzeniem wyścigu zbrojeń głębokich fałszerstw opartych na LLM; chociaż przychodzi to kosztem ludzkiej pracy i uwagi, której technologia obecnie stara się zautomatyzować.
† Proszę zobaczyć sekcję na końcu głównych wyników, w oryginalnym artykule, na temat tego.
* Moja konwersja adnotacji wstawianych przez autorów do hiperlinków. Podkreślenia autorów, a nie moje.
Pierwotnie opublikowane w czwartek, 19 czerwca 2025












