Kąt Andersona

Niebezpieczeństwa korzystania z cytatów w celu uwierzytelnienia treści NLG

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Opinia Modele generacji języka naturalnego, takie jak GPT-3, są skłonne do “halucynacji” materiału, który prezentują w kontekście informacji faktograficznych. W erze, która jest niezwykle zaniepokojona wzrostem fałszywych wiadomości opartych na tekście, te “chętne do zadowolenia” loty fantazji reprezentują istotną przeszkodę dla rozwoju zautomatyzowanych systemów pisarskich i podsumowujących, oraz dla przyszłości dziennikarstwa opartego na AI, wśród innych podsektorów przetwarzania języka naturalnego (NLP).

Głównym problemem jest to, że modele językowe w stylu GPT pochodzą z bardzo dużych korpusów tekstów szkoleniowych i uczą się używać tych cech jako budulca języka w sposób zręczny i autentyczny, niezależnie od dokładności wygenerowanego treści, lub nawet jej akceptowalności.

Systemy NLG polegają obecnie na weryfikacji faktów przez ludzi w jednym z dwóch podejść: albo modele są używane jako generatory tekstu, które są natychmiast przekazywane użytkownikom, albo ludzie są używani jako drogie filtry w celu poprawy jakości zbiorów danych, które mają poinformować mniej abstrakcyjne i “kreatywne” modele (które same w sobie są niezwykle trudne do zaufania pod względem dokładności faktograficznej i wymagają dalszych warstw nadzoru ludzkiego).

Stare wiadomości i fałszywe fakty

Modele generacji języka naturalnego (NLG) są w stanie produkować przekonywujące i prawdopodobne dane wyjściowe, ponieważ nauczyły się architektury semantycznej, a nie bardziej abstrakcyjnego wchłaniania rzeczywistej historii, nauki, ekonomii lub innego tematu, o którym mogą być wymagane do wyrażania opinii, które są skutecznie splecione jako “pasażerowie” w danych źródłowych.

Dokładność faktograficzna informacji generowanych przez modele NLG zakłada, że dane wejściowe, na których są szkolone, są same w sobie niezawodne i aktualne, co stanowi nadzwyczajny ciężar w zakresie przetwarzania wstępnego i dalszej weryfikacji przez ludzi – kosztowną przeszkodę, z którą sektor badań NLP obecnie się mierzy na wielu frontach.

Systemy w skali GPT-3 wymagają nadzwyczajnego czasu i pieniędzy, aby je wyszkolić, a po szkoleniu są trudne do aktualizacji na poziomie, który można by uznać za “jądrowy”. Chociaż modyfikacje sesyjne i oparte na użytkowniku mogą zwiększyć użyteczność i dokładność wdrożonych modeli, te przydatne korzyści są trudne, czasem niemożliwe do przeniesienia z powrotem do modelu rdzeniowego bez konieczności pełnego lub częściowego przeszkolenia.

W związku z tym trudno stworzyć wyszkolone modele językowe, które mogą wykorzystywać najnowsze informacje.

Wyszkolone przed samym wybuchem COVID, text-davinci-002 - iteracja GPT-3 uważana za 'najbardziej zdolną' przez jej twórcę OpenAI - może przetwarzać 4000 tokenów na żądanie, ale nie wie nic o COVID-19 ani o inwazji na Ukrainę w 2022 roku (te prompty i odpowiedzi pochodzą z 5 kwietnia 2022 r.). Co ciekawe, 'nieznany' jest tak naprawdę akceptowalną odpowiedzią w obu przypadkach awarii, ale dalsze prompty łatwo ustalają, że GPT-3 nie wie nic o tych wydarzeniach. Źródło: https://beta.openai.com/playground

Wyszkolone przed samym wybuchem COVID, text-davinci-002 – iteracja GPT-3 uważana za ‘najbardziej zdolną’ przez jej twórcę OpenAI – może przetwarzać 4000 tokenów na żądanie, ale nie wie nic o COVID-19 ani o inwazji na Ukrainę w 2022 roku (te prompty i odpowiedzi pochodzą z 5 kwietnia 2022 r.). Co ciekawe, ‘nieznany’ jest tak naprawdę akceptowalną odpowiedzią w obu przypadkach awarii, ale dalsze prompty łatwo ustalają, że GPT-3 nie wie nic o tych wydarzeniach. Źródło: https://beta.openai.com/playground

Wyszkolony model może tylko uzyskać dostęp do “prawd”, które wewnętrznie zaakceptował podczas szkolenia, i trudno uzyskać dokładną i istotną cytaty domyślnie, gdy próbuje się uzyskać od modelu potwierdzenie jego twierdzeń. Prawdziste niebezpieczeństwo polegające na uzyskaniu cytatów z domyślnego GPT-3 (na przykład) polega na tym, że czasem produkuje prawidłowe cytaty, co prowadzi do fałszywej pewności co do tej cechy jego możliwości:

Góra, trzy dokładne cytaty uzyskane przez GPT-3 z 2021 roku. Środek, GPT-3 nie potrafi cytować jednego z najbardziej znanych cytatów Einsteina (

Góra, trzy dokładne cytaty uzyskane przez GPT-3 z 2021 roku. Środek, GPT-3 nie potrafi cytować jednego z najbardziej znanych cytatów Einsteina (“Bóg nie gra w kości z wszechświatem”), pomimo niekryptograficznego promtu. Dół, GPT-3 przypisuje skandaliczny i fikcyjny cytat Albertowi Einsteinowi, wyraźnie z poprzednich pytań o Winstona Churchilla w tej samej sesji. Źródło: Artykuł autora z 2021 roku na https://www.width.ai/post/business-applications-for-gpt-3

GopherCite

W nadziei na rozwiązanie tego ogólnego problemu w modelach NLG, Google’s DeepMind niedawno zaproponował GopherCite, model o 280 miliardach parametrów, który jest w stanie cytować konkretną i dokładną dowodów w poparciu swoich wygenerowanych odpowiedzi na prompty.

Trzy przykłady GopherCite potwierdzające swoje twierdzenia rzeczywistymi cytaty. Źródło: https://arxiv.org/pdf/2203.11147.pdf

Trzy przykłady GopherCite potwierdzające swoje twierdzenia rzeczywistymi cytaty. Źródło: https://arxiv.org/pdf/2203.11147.pdf

GopherCite wykorzystuje wzmocnienie uczenia się z ludzkich preferencji (RLHP), aby trenować modele zapytań, które są w stanie cytować rzeczywiste cytaty jako dowody wspierające. Cytaty są pobierane na żywo z wielu źródeł dokumentów uzyskanych z wyszukiwarek lub z określonego dokumentu dostarczonego przez użytkownika.

Wydajność GopherCite została zmierzona za pomocą oceny ludzkiej odpowiedzi modelu, która została uznana za “wysokiej jakości” 80% czasu na zestawie danych NaturalQuestions Google, i 67% czasu na zestawie danych ELI5.

Cytaty fałszywe

Jednakże, gdy przetestowano go na benchmarku TruthfulQA Uniwersytetu w Oksfordzie, odpowiedzi GopherCite były rzadko oceniane jako prawdziwe w porównaniu z ludzkimi, kuratorowanymi “poprawnymi” odpowiedziami.

Autorzy sugerują, że jest to spowodowane tym, że pojęcie “wspieranych odpowiedzi” nie definiuje w żaden obiektywny sposób prawdy samej w sobie, ponieważ użyteczność cytatów źródłowych może być naruszona przez inne czynniki, takie jak możliwość, że autor cytatu sam “halucynuje” (tj. pisze o fikcyjnych światach, produkuje treści reklamowe lub w inny sposób fantastycznie nieautentyczne materiały.

Przypadki GopherCite, w których prawdopodobieństwo niekoniecznie równa się “prawdzie”.

Skutecznie, staje się konieczne rozróżnienie między “wspieranym” a “prawdziwym” w takich przypadkach. Ludzka kultura jest obecnie znacznie bardziej zaawansowana niż uczenie maszynowe w zakresie stosowania metodologii i ram projektowych w celu uzyskania obiektywnych definicji prawdy, a nawet tam, gdzie stan “ważnej” prawdy wydaje się sporem i marginalnym zaprzeczeniem.

Problem jest rekurencyjny w architekturach NLG, które starają się opracować ostateczne “potwierdzające” mechanizmy: ludzki konsensus jest nakładany jako benchmark prawdy przez zlecone, modele AMT, gdzie ludzcy oceniający (i inni ludzie, którzy mediaciują spory między nimi) są samodzielnie stronniczy i uprzedzeni.

Na przykład, początkowe eksperymenty z GopherCite wykorzystują model “super rater”, aby wybrać najlepszych ludzkich przedmiotów do oceny danych wyjściowych modelu, wybierając tylko tych oceniających, którzy uzyskali co najmniej 85% w porównaniu z zestawem jakościowym. Ostatecznie wybrano 113 super-oceniających do tego zadania.

Zrzut ekranu aplikacji porównawczej wykorzystywanej do oceny danych wyjściowych GopherCite.

Zrzut ekranu aplikacji porównawczej wykorzystywanej do oceny danych wyjściowych GopherCite.

Można argumentować, że jest to idealny obraz nie do wygrania fraktalnego pościgu: zestaw jakościowy wykorzystany do oceny oceniających jest sam w sobie innym “ludzkim określonym” miernikiem prawdy, tak jak zestaw TruthfulQA Uniwersytetu w Oksfordzie, przeciwko któremu GopherCite został uznany za niedostateczny.

W kwestii wspieranych i “uwierzytelnionych” treści, wszystko, co systemy NLG mogą syntetyzować z treningu na danych ludzkich, to ludzka rozbieżność i różnorodność, która sama w sobie jest źle postawionym i nierozwiązanym problemem. Mamy wrodzoną tendencję do cytowania źródeł, które wspierają nasze punkty widzenia, i do mówienia autorytatywnie i z przekonaniem w przypadkach, w których nasze informacje źródłowe mogą być nieaktualne, całkowicie niedokładne lub w inny sposób celowo przedstawione w sposób nieautentyczny; i skłonność do rozprzestrzeniania tych punktów widzenia bezpośrednio w dzikiej przyrodzie, w skali i skuteczności niezrównanej w historii ludzkości, prosto na ścieżkę ramion, które karmią nowe ramy NLG.

Dlatego niebezpieczeństwo związane z rozwojem systemów NLG z obsługą cytatu wydaje się związane z nieprzewidywalną naturą materiału źródłowego. Każdy mechanizm (taki jak bezpośrednie cytowanie i cytaty), który zwiększa zaufanie użytkownika do danych wyjściowych NLG, jest, w obecnym stanie sztuki, niebezpiecznie dodaje do autentyczności, ale nie do prawdziwości danych wyjściowych.

Takie techniki są prawdopodobnie wystarczająco przydatne, gdy NLP ostatecznie odtworzy “kalejdoskopy” fikcji z powieści Orwella Dziennik; ale reprezentują niebezpieczne pościgi dla obiektywnej analizy dokumentów, dziennikarstwa opartego na AI i innych możliwych “non-fiction” zastosowań generowania tekstu maszynowego i spontanicznej lub kierowanej generacji tekstu.

 

Pierwotnie opublikowane 5 kwietnia 2022 r. Zaktualizowane o 15:29 EET, aby poprawić termin.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai