Modele i platformy AI
MarkLLM: Narzędzie do znakowania modeli językowych
Znakowanie modeli językowych, które integruje niewidoczne, ale wykrywalne sygnały w danych wyjściowych modelu w celu identyfikacji tekstu wygenerowanego przez modele językowe, jest niezbędne do zapobiegania nadużywaniu dużych modeli językowych. Te techniki znakowania są głównie podzielone na dwie kategorie: rodzina KGW i rodzina Christ. Rodzina KGW modyfikuje dane wyjściowe modelu językowego, tworząc znakowany wynik, klasyfikując słownictwo na listę zieloną i czerwoną w oparciu o poprzedni token. Następnie wprowadza się bias do danych wyjściowych tokenów z listy zielonej podczas generowania tekstu, faworyzując te tokeny w wygenerowanym tekście. Następnie oblicza się metrykę statystyczną z proporcji słów zielonych i ustala się próg do rozróżnienia tekstu znakowanego i nieznakowanego. Ulepszenia metody KGW obejmują poprawioną partycję listy, lepszą manipulację danymi wyjściowymi, zwiększoną pojemność informacji znakowania, odporność na ataki usuwania znakowania i możliwość wykrywania znakowania publicznie.
Natomiast rodzina Christ modyfikuje proces próbkowania podczas generowania tekstu modelu językowego, osadzając znak wody, zmieniając sposób wyboru tokenów. Obie rodziny znakowania dążą do równowagi między wykrywalnością znakowania a jakością tekstu, rozwiązując wyzwania, takie jak wytrzymałość w różnych ustawieniach entropii, zwiększona pojemność informacji znakowania i ochrona przed próbami usunięcia. Ostatnie badania koncentrowały się na udoskonaleniu partycji listy i manipulacji danymi wyjściowymi, zwiększaniu pojemności informacji znakowania, rozwijaniu metod oporu przed usuwaniem znakowania i umożliwieniu publicznego wykrywania. Ostatecznie znakowanie modeli językowych jest niezbędne dla etycznego i odpowiedzialnego użytkowania dużych modeli językowych, zapewniając sposób śledzenia i weryfikacji tekstu wygenerowanego przez modele językowe. Rodziny KGW i Christ oferują dwa odrębne podejścia, każde z unikalnymi zaletami i zastosowaniami, ciągle ewoluującymi za sprawą badań i innowacji.
Dzięki możliwościom znakowania modeli językowych, które umożliwiają osadzanie algorytmicznie wykrywalnych sygnałów w danych wyjściowych modelu w celu identyfikacji tekstu wygenerowanego przez model językowy, odgrywa kluczową rolę w łagodzeniu ryzyka związanego z nadużywaniem dużych modeli językowych. Jednakże istnieje wiele ram znakowania modeli językowych na rynku, każda z własnymi perspektywami i procedurami oceny, co utrudnia badaczom eksperymentowanie z tymi ramami. Aby przeciwdziałać temu problemowi, MarkLLM, otwarte narzędzie do znakowania, oferuje rozszerzalną i ujednolicowaną ramę do wdrażania algorytmów znakowania modeli językowych, zapewniając przyjazne dla użytkownika interfejsy, aby zapewnić łatwość użycia i dostęp. Ponadto, ramy MarkLLM obsługują automatyczne wizualizowanie mechanizmów tych ram, co zwiększa zrozumiałość tych modeli. Ramy MarkLLM oferują kompleksowy zestaw 12 narzędzi, obejmujących trzy perspektywy, oraz dwie zautomatyzowane potoki oceny do oceny ich wydajności. Artykuł ten ma na celu omówienie ram MarkLLM w szczegółach, a my będziemy badać mechanizm, metodologię, architekturę ramy oraz porównywać ją z ramami stanu sztuki.
MarkLLM: Narzędzie do znakowania modeli językowych
Pojawienie się dużych modeli językowych, takich jak LLaMA, GPT-4, ChatGPT i innych, znacznie rozwinęło możliwości modeli AI do wykonywania konkretnych zadań, w tym tworzenia treści, zrozumienia języka, generowania i wiele innych. Jednak wraz z niezwykłymi korzyściami związanych z wyjątkową efektywnością obecnych dużych modeli językowych, pojawiły się pewne ryzyka, w tym ghostwriting artykułów naukowych, fałszywe wiadomości i przedstawienia wygenerowane przez modele językowe oraz podszywanie się pod osoby. Biorąc pod uwagę te ryzyka, jest niezbędne opracowanie niezawodnych metod, które umożliwiają rozróżnienie tekstu wygenerowanego przez modele językowe i ludzkiego, co jest podstawowym wymogiem, aby zapewnić autentyczność komunikacji cyfrowej i zapobiec rozpowszechnianiu fałszywych informacji. Przez kilka ostatnich lat znakowanie modeli językowych było rekomendowane jako jedna z obiecujących rozwiązań do rozróżnienia tekstu wygenerowanego przez modele językowe i ludzkiego, a poprzez włączanie odrębnych cech podczas procesu generowania tekstu, dane wyjściowe modeli językowych mogą być unikalnie identyfikowane przy użyciu specjalnie zaprojektowanych detektorów. Jednakże, ze względu na proliferację i względnie złożone algorytmy ram znakowania modeli językowych, a także różnorodność metryk oceny i perspektyw, stało się niezwykle trudne do eksperymentowania z tymi ramami.
Aby zmostrować tę lukę, ramy MarkLLM próbują uczynić następujące wkłady. MarkLLM oferuje spójne i przyjazne dla użytkownika interfejsy do ładowania algorytmów, generowania tekstu znakowanego, prowadzenia procesów wykrywania i gromadzenia danych do wizualizacji. Zapewnia rozwiązania wizualizacji dla obu głównych rodzin algorytmów znakowania, pozwalając użytkownikom zobaczyć, jak różne algorytmy działają w różnych konfiguracjach z przykładami z życia wziętymi. Narzędzie zawiera kompleksowy moduł oceny z 12 narzędziami, które zajmują się wykrywalnością, wytrzymałością i wpływem na jakość tekstu. Ponadto, zawiera dwa typy zautomatyzowanych potoków oceny, które obsługują dostosowanie zestawów danych, modeli, metryk oceny i ataków, ułatwiając elastyczną i gruntowną ocenę. Zaprojektowane z modułową, luźno połączoną architekturą, MarkLLM zwiększa skalowalność i elastyczność. Ten wybór architektury wspiera integrację nowych algorytmów, innowacyjnych technik wizualizacji i rozszerzanie zestawu narzędzi oceny przez przyszłych deweloperów.
Wiele algorytmów znakowania zostało zaproponowanych, ale ich unikalne podejścia do wdrożenia często faworyzują określone wymagania nad standaryzacją, prowadząc do kilku problemów
- Brak standaryzacji w projekcie klasy: To wymaga znacznego wysiłku, aby zoptymalizować lub rozszerzyć istniejące metody z powodu niewystarczająco standaryzowanych projektów klasy.
- Brak jednolitości w interfejsach wywoływania na poziomie najwyższym: Niespójne interfejsy sprawiają, że przetwarzanie wsadowe i replikowanie różnych algorytmów jest uciążliwe i wymaga dużo pracy.
- Problemy ze standardami kodu: Wyzwania obejmują potrzebę modyfikacji ustawień w wielu segmentach kodu i niespójnej dokumentacji, co utrudnia dostosowanie i skuteczne użytkowanie. Twarde, zakodowane wartości i niespójne obsługiwanie błędów dodatkowo utrudniają adaptację i wysiłki debugowania.
Aby rozwiązać te problemy, nasze narzędzie oferuje ujednolicowaną ramę wdrożeniową, która umożliwia wygodne wywoływanie różnych algorytmów stanu sztuki w elastycznych konfiguracjach. Dodatkowo, nasza starannie zaprojektowana struktura klasy toruje drogę do przyszłych rozszerzeń. Poniższy rysunek pokazuje projekt tej ujednoliconej ramy wdrożeniowej.
Ze względu na rozproszoną architekturę ramy, jest łatwo dla deweloperów dodać dodatkowe interfejsy na poziomie najwyższym do dowolnej klasy algorytmu znakowania bez obawy o wpływ na inne algorytmy.
MarkLLM: Architektura i Metodologia
Techniki znakowania modeli językowych są głównie podzielone na dwie kategorie: rodzina KGW i rodzina Christ. Rodzina KGW modyfikuje dane wyjściowe modelu językowego, tworząc znakowany wynik, klasyfikując słownictwo na listę zieloną i czerwoną w oparciu o poprzedni token. Następnie wprowadza się bias do danych wyjściowych tokenów z listy zielonej podczas generowania tekstu, faworyzując te tokeny w wygenerowanym tekście. Następnie oblicza się metrykę statystyczną z proporcji słów zielonych i ustala się próg do rozróżnienia tekstu znakowanego i nieznakowanego. Ulepszenia metody KGW obejmują poprawioną partycję listy, lepszą manipulację danymi wyjściowymi, zwiększoną pojemność informacji znakowania, odporność na ataki usuwania znakowania i możliwość wykrywania znakowania publicznie.
Natomiast rodzina Christ modyfikuje proces próbkowania podczas generowania tekstu modelu językowego, osadzając znak wody, zmieniając sposób wyboru tokenów. Obie rodziny znakowania dążą do równowagi między wykrywalnością znakowania a jakością tekstu, rozwiązując wyzwania, takie jak wytrzymałość w różnych ustawieniach entropii, zwiększona pojemność informacji znakowania i ochrona przed próbami usunięcia. Ostatnie badania koncentrowały się na udoskonaleniu partycji listy i manipulacji danymi wyjściowymi, zwiększaniu pojemności informacji znakowania, rozwijaniu metod oporu przed usuwaniem znakowania i umożliwieniu publicznego wykrywania. Ostatecznie znakowanie modeli językowych jest niezbędne dla etycznego i odpowiedzialnego użytkowania dużych modeli językowych, zapewniając sposób śledzenia i weryfikacji tekstu wygenerowanego przez modele językowe. Rodziny KGW i Christ oferują dwa odrębne podejścia, każde z unikalnymi zaletami i zastosowaniami, ciągle ewoluującymi za sprawą badań i innowacji.
Ocena Całościowa
Ocena algorytmu znakowania modelu językowego jest złożonym zadaniem. Po pierwsze, wymaga rozważenia różnych aspektów, w tym wykrywalności znakowania, wytrzymałości na manipulację i wpływu na jakość tekstu. Po drugie, oceny z każdej perspektywy mogą wymagać różnych metryk, scenariuszy ataków i zadań. Ponadto, przeprowadzanie oceny zwykle obejmuje wiele kroków, takich jak wybór modelu i zestawu danych, generowanie tekstu znakowanego, przetwarzanie, wykrywanie znakowania, manipulacja tekstem i obliczanie metryk. Aby ułatwić wygodną i gruntowną ocenę algorytmów znakowania modeli językowych, MarkLLM oferuje dwanaście przyjaznych dla użytkownika narzędzi, w tym różne kalkulatory metryk i atakujących, które obejmują trzy wymienione powyżej perspektywy oceny. Dodatkowo, MarkLLM zapewnia dwa typy zautomatyzowanych potoków demo, których moduły mogą być dostosowane i złożone w elastyczny sposób, umożliwiając łatwe konfigurowanie i użycie..
W odniesieniu do aspektu wykrywalności, większość algorytmów znakowania ostatecznie wymaga określenia progu do rozróżnienia tekstu znakowanego i nieznakowanego. Zapewniamy podstawowy kalkulator współczynnika powodzenia przy użyciu stałego progu. Dodatkowo, aby zminimalizować wpływ wyboru progu na wykrywalność, oferujemy również kalkulator, który obsługuje dynamiczny wybór progu. To narzędzie może określić próg, który daje najlepszy wynik F1 lub wybrać próg na podstawie określonego przez użytkownika docelowego współczynnika fałszywie dodatnich (FPR).
W odniesieniu do aspektu wytrzymałości, MarkLLM oferuje trzy ataki manipulacji tekstu na poziomie słowa: losowe usuwanie słów w określonym stosunku, losowa substitucja synonimów przy użyciu WordNet jako zestawu synonimów i substitucja synonimów z uwzględnieniem kontekstu przy użyciu BERT jako modelu osadzania. Dodatkowo, oferujemy dwa ataki manipulacji tekstu na poziomie dokumentu: przepisywanie kontekstu za pomocą interfejsu API OpenAI lub modelu Dipper. W odniesieniu do aspektu jakości tekstu, MarkLLM oferuje dwa bezpośrednie narzędzia analizy: kalkulator zaskoczenia, aby ocenić płynność, i kalkulator różnorodności, aby ocenić zmienność tekstu. Aby ocenić wpływ znakowania na przydatność tekstu w określonych zadaniach, oferujemy kalkulator BLEU dla zadań tłumaczenia maszynowego i sędziego “prawda lub fałsz” dla zadań generowania kodu. Dodatkowo, biorąc pod uwagę obecne metody porównywania jakości tekstu znakowanego i nieznakowanego, które obejmują użycie silniejszego modelu językowego do oceny, MarkLLM oferuje również dyskryminator GPT, wykorzystujący GPT-4 do porównania jakości tekstu.
Potoki Oceny
Aby ułatwić zautomatyzowaną ocenę algorytmów znakowania modeli językowych, MarkLLM zapewnia dwa potoki oceny: jeden do oceny wykrywalności znakowania z i bez ataków, oraz drugi do analizy wpływu tych algorytmów na jakość tekstu. Po tym procesie, zaimplementowaliśmy dwa potoki: WMDetect3 i UWMDetect4. Główna różnica między nimi leży w fazie generowania tekstu. Pierwszy wymaga użycia metody generate_watermarked_text z algorytmu znakowania, podczas gdy drugi zależy od parametru text_source, aby określić, czy bezpośrednio pobrać naturalny tekst z zestawu danych, czy wywołać metodę generate_unwatermarked_text.
Aby ocenić wpływ znakowania na jakość tekstu, generowane są pary tekstu znakowanego i nieznakowanego. Teksty, wraz z innymi niezbędnymi danymi wejściowymi, są następnie przetwarzane i podawane do wybranego analizatora jakości tekstu, aby wyprodukować szczegółową analizę i porównanie wyników. Po tym procesie, zaimplementowaliśmy trzy potoki dla różnych scenariuszy oceny:
- DirectQual.5: Ten potok jest specjalnie zaprojektowany do analizy jakości tekstu, porównując bezpośrednio cechy tekstu znakowanego z tymi, które nie są znakowane. Ocenia metryki, takie jak zaskoczenie (PPL) i logarytmiczna różnorodność, bez potrzeby odniesienia do zewnętrznych tekstów referencyjnych.
- RefQual.6: Ten potok ocenia jakość tekstu, porównując zarówno tekst znakowany, jak i nieznakowany z wspólnym tekstem referencyjnym. Mierzy stopień podobieństwa lub odchylenia od tekstu referencyjnego, co sprawia, że jest idealny do scenariuszy, które wymagają określonych zadań dolnych do oceny jakości tekstu, takich jak tłumaczenie maszynowe i generowanie kodu.
- ExDisQual.7: Ten potok wykorzystuje zewnętrznego sędziego, takiego jak GPT-4 (OpenAI, 2023), do oceny jakości zarówno tekstu znakowanego, jak i nieznakowanego. Dyskryminator ocenia tekst na podstawie opisów zadań dostarczonych przez użytkownika, identyfikując potencjalne pogorszenie lub zachowanie jakości w wyniku znakowania. Ta metoda jest szczególnie cenna, gdy wymagana jest zaawansowana, oparta na AI analiza subtelnych efektów znakowania.
MarkLLM: Eksperymenty i Wyniki
Aby ocenić swoją wydajność, ramy MarkLLM przeprowadzają ocenę dziewięciu różnych algorytmów i oceniają ich wpływ, wytrzymałość i wykrywalność na jakość tekstu.

Powtarzająca się tabela zawiera wyniki oceny wykrywalności dziewięciu algorytmów obsługiwanych przez MarkLLM. Zastosowano dynamiczne dostosowanie progu do oceny wykrywalności znakowania, z trzema ustawieniami: przy docelowym współczynniku fałszywie dodatnich (FPR) 10%, przy docelowym FPR 1% i w warunkach optymalnego wyniku F1. Wygenerowano 200 tekstów znakowanych, a 200 tekstów nieznakowanych służyło jako przykłady negatywne. Przedstawiamy wyniki TPR i F1-score przy dynamicznym dostosowaniu progu dla 10% i 1% FPR, wraz z TPR, TNR, FPR, FNR, P, R, F1, ACC przy optymalnej wydajności. Poniższa tabela zawiera wyniki oceny wytrzymałości dziewięciu algorytmów obsługiwanych przez MarkLLM. Dla każdego ataku wygenerowano 200 tekstów znakowanych, a następnie poddano je manipulacji, oraz dodatkowo 200 tekstów nieznakowanych służyło jako przykłady negatywne. Przedstawiamy wyniki TPR i F1-score przy optymalnej wydajności w każdej sytuacji.

Końcowe Myśli
W tym artykule omówiliśmy MarkLLM, otwarte narzędzie do znakowania, które oferuje rozszerzalną i ujednolicowaną ramę do wdrażania algorytmów znakowania modeli językowych, zapewniając przyjazne dla użytkownika interfejsy, aby zapewnić łatwość użycia i dostęp. Ponadto, ramy MarkLLM obsługują automatyczne wizualizowanie mechanizmów tych ram, co zwiększa zrozumiałość tych modeli. Ramy MarkLLM oferują kompleksowy zestaw 12 narzędzi, obejmujących trzy perspektywy, oraz dwie zautomatyzowane potoki oceny do oceny ich wydajności.












