Kąt Andersona
Niebezpieczeństwa korzystania z cytatów w celu uwierzytelnienia treści NLG

Opinia Modele generacji języka naturalnego, takie jak GPT-3, są skłonne do “halucynacji” materiału, który prezentują w kontekście informacji faktograficznych. W erze, która jest niezwykle zaniepokojona wzrostem fałszywych wiadomości opartych na tekście, te “chętne do zadowolenia” loty fantazji reprezentują istotną przeszkodę dla rozwoju zautomatyzowanych systemów pisarskich i podsumowujących, oraz dla przyszłości dziennikarstwa opartego na AI, wśród innych podsektorów przetwarzania języka naturalnego (NLP).
Głównym problemem jest to, że modele językowe w stylu GPT pochodzą z bardzo dużych korpusów tekstów szkoleniowych i uczą się używać tych cech jako budulca języka w sposób zręczny i autentyczny, niezależnie od dokładności wygenerowanego treści, lub nawet jej akceptowalności.
Systemy NLG polegają obecnie na weryfikacji faktów przez ludzi w jednym z dwóch podejść: albo modele są używane jako generatory tekstu, które są natychmiast przekazywane użytkownikom, albo ludzie są używani jako drogie filtry w celu poprawy jakości zbiorów danych, które mają poinformować mniej abstrakcyjne i “kreatywne” modele (które same w sobie są niezwykle trudne do zaufania pod względem dokładności faktograficznej i wymagają dalszych warstw nadzoru ludzkiego).
Stare wiadomości i fałszywe fakty
Modele generacji języka naturalnego (NLG) są w stanie produkować przekonywujące i prawdopodobne dane wyjściowe, ponieważ nauczyły się architektury semantycznej, a nie bardziej abstrakcyjnego wchłaniania rzeczywistej historii, nauki, ekonomii lub innego tematu, o którym mogą być wymagane do wyrażania opinii, które są skutecznie splecione jako “pasażerowie” w danych źródłowych.
Dokładność faktograficzna informacji generowanych przez modele NLG zakłada, że dane wejściowe, na których są szkolone, są same w sobie niezawodne i aktualne, co stanowi nadzwyczajny ciężar w zakresie przetwarzania wstępnego i dalszej weryfikacji przez ludzi – kosztowną przeszkodę, z którą sektor badań NLP obecnie się mierzy na wielu frontach.
Systemy w skali GPT-3 wymagają nadzwyczajnego czasu i pieniędzy, aby je wyszkolić, a po szkoleniu są trudne do aktualizacji na poziomie, który można by uznać za “jądrowy”. Chociaż modyfikacje sesyjne i oparte na użytkowniku mogą zwiększyć użyteczność i dokładność wdrożonych modeli, te przydatne korzyści są trudne, czasem niemożliwe do przeniesienia z powrotem do modelu rdzeniowego bez konieczności pełnego lub częściowego przeszkolenia.
W związku z tym trudno stworzyć wyszkolone modele językowe, które mogą wykorzystywać najnowsze informacje.

Wyszkolone przed samym wybuchem COVID, text-davinci-002 – iteracja GPT-3 uważana za ‘najbardziej zdolną’ przez jej twórcę OpenAI – może przetwarzać 4000 tokenów na żądanie, ale nie wie nic o COVID-19 ani o inwazji na Ukrainę w 2022 roku (te prompty i odpowiedzi pochodzą z 5 kwietnia 2022 r.). Co ciekawe, ‘nieznany’ jest tak naprawdę akceptowalną odpowiedzią w obu przypadkach awarii, ale dalsze prompty łatwo ustalają, że GPT-3 nie wie nic o tych wydarzeniach. Źródło: https://beta.openai.com/playground
Wyszkolony model może tylko uzyskać dostęp do “prawd”, które wewnętrznie zaakceptował podczas szkolenia, i trudno uzyskać dokładną i istotną cytaty domyślnie, gdy próbuje się uzyskać od modelu potwierdzenie jego twierdzeń. Prawdziste niebezpieczeństwo polegające na uzyskaniu cytatów z domyślnego GPT-3 (na przykład) polega na tym, że czasem produkuje prawidłowe cytaty, co prowadzi do fałszywej pewności co do tej cechy jego możliwości:

Góra, trzy dokładne cytaty uzyskane przez GPT-3 z 2021 roku. Środek, GPT-3 nie potrafi cytować jednego z najbardziej znanych cytatów Einsteina (“Bóg nie gra w kości z wszechświatem”), pomimo niekryptograficznego promtu. Dół, GPT-3 przypisuje skandaliczny i fikcyjny cytat Albertowi Einsteinowi, wyraźnie z poprzednich pytań o Winstona Churchilla w tej samej sesji. Źródło: Artykuł autora z 2021 roku na https://www.width.ai/post/business-applications-for-gpt-3
GopherCite
W nadziei na rozwiązanie tego ogólnego problemu w modelach NLG, Google’s DeepMind niedawno zaproponował GopherCite, model o 280 miliardach parametrów, który jest w stanie cytować konkretną i dokładną dowodów w poparciu swoich wygenerowanych odpowiedzi na prompty.



Trzy przykłady GopherCite potwierdzające swoje twierdzenia rzeczywistymi cytaty. Źródło: https://arxiv.org/pdf/2203.11147.pdf
GopherCite wykorzystuje wzmocnienie uczenia się z ludzkich preferencji (RLHP), aby trenować modele zapytań, które są w stanie cytować rzeczywiste cytaty jako dowody wspierające. Cytaty są pobierane na żywo z wielu źródeł dokumentów uzyskanych z wyszukiwarek lub z określonego dokumentu dostarczonego przez użytkownika.
Wydajność GopherCite została zmierzona za pomocą oceny ludzkiej odpowiedzi modelu, która została uznana za “wysokiej jakości” 80% czasu na zestawie danych NaturalQuestions Google, i 67% czasu na zestawie danych ELI5.
Cytaty fałszywe
Jednakże, gdy przetestowano go na benchmarku TruthfulQA Uniwersytetu w Oksfordzie, odpowiedzi GopherCite były rzadko oceniane jako prawdziwe w porównaniu z ludzkimi, kuratorowanymi “poprawnymi” odpowiedziami.
Autorzy sugerują, że jest to spowodowane tym, że pojęcie “wspieranych odpowiedzi” nie definiuje w żaden obiektywny sposób prawdy samej w sobie, ponieważ użyteczność cytatów źródłowych może być naruszona przez inne czynniki, takie jak możliwość, że autor cytatu sam “halucynuje” (tj. pisze o fikcyjnych światach, produkuje treści reklamowe lub w inny sposób fantastycznie nieautentyczne materiały.



Przypadki GopherCite, w których prawdopodobieństwo niekoniecznie równa się “prawdzie”.
Skutecznie, staje się konieczne rozróżnienie między “wspieranym” a “prawdziwym” w takich przypadkach. Ludzka kultura jest obecnie znacznie bardziej zaawansowana niż uczenie maszynowe w zakresie stosowania metodologii i ram projektowych w celu uzyskania obiektywnych definicji prawdy, a nawet tam, gdzie stan “ważnej” prawdy wydaje się sporem i marginalnym zaprzeczeniem.
Problem jest rekurencyjny w architekturach NLG, które starają się opracować ostateczne “potwierdzające” mechanizmy: ludzki konsensus jest nakładany jako benchmark prawdy przez zlecone, modele AMT, gdzie ludzcy oceniający (i inni ludzie, którzy mediaciują spory między nimi) są samodzielnie stronniczy i uprzedzeni.
Na przykład, początkowe eksperymenty z GopherCite wykorzystują model “super rater”, aby wybrać najlepszych ludzkich przedmiotów do oceny danych wyjściowych modelu, wybierając tylko tych oceniających, którzy uzyskali co najmniej 85% w porównaniu z zestawem jakościowym. Ostatecznie wybrano 113 super-oceniających do tego zadania.
Można argumentować, że jest to idealny obraz nie do wygrania fraktalnego pościgu: zestaw jakościowy wykorzystany do oceny oceniających jest sam w sobie innym “ludzkim określonym” miernikiem prawdy, tak jak zestaw TruthfulQA Uniwersytetu w Oksfordzie, przeciwko któremu GopherCite został uznany za niedostateczny.
W kwestii wspieranych i “uwierzytelnionych” treści, wszystko, co systemy NLG mogą syntetyzować z treningu na danych ludzkich, to ludzka rozbieżność i różnorodność, która sama w sobie jest źle postawionym i nierozwiązanym problemem. Mamy wrodzoną tendencję do cytowania źródeł, które wspierają nasze punkty widzenia, i do mówienia autorytatywnie i z przekonaniem w przypadkach, w których nasze informacje źródłowe mogą być nieaktualne, całkowicie niedokładne lub w inny sposób celowo przedstawione w sposób nieautentyczny; i skłonność do rozprzestrzeniania tych punktów widzenia bezpośrednio w dzikiej przyrodzie, w skali i skuteczności niezrównanej w historii ludzkości, prosto na ścieżkę ramion, które karmią nowe ramy NLG.
Dlatego niebezpieczeństwo związane z rozwojem systemów NLG z obsługą cytatu wydaje się związane z nieprzewidywalną naturą materiału źródłowego. Każdy mechanizm (taki jak bezpośrednie cytowanie i cytaty), który zwiększa zaufanie użytkownika do danych wyjściowych NLG, jest, w obecnym stanie sztuki, niebezpiecznie dodaje do autentyczności, ale nie do prawdziwości danych wyjściowych.
Takie techniki są prawdopodobnie wystarczająco przydatne, gdy NLP ostatecznie odtworzy “kalejdoskopy” fikcji z powieści Orwella Dziennik; ale reprezentują niebezpieczne pościgi dla obiektywnej analizy dokumentów, dziennikarstwa opartego na AI i innych możliwych “non-fiction” zastosowań generowania tekstu maszynowego i spontanicznej lub kierowanej generacji tekstu.
Pierwotnie opublikowane 5 kwietnia 2022 r. Zaktualizowane o 15:29 EET, aby poprawić termin.













