Kąt Andersona

Zapobieganie “halucynacji” w modelach językowych GPT-3 i innych złożonych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Cechą charakterystyczną “fałszywych wiadomości” jest to, że często przedstawiają fałszywe informacje w kontekście faktów, z fałszywymi danymi zyskującymi uznanie dzięki rodzajowi literackiej osmozy – niepokojącą demonstracją mocy półprawd.

Złożone generatywne modele przetwarzania języka naturalnego (NLP), takie jak GPT-3, również mają tendencję do “halucynacji” tego rodzaju fałszywych danych. Częściowo jest to spowodowane tym, że modele językowe wymagają możliwości przepisywania i podsumowywania długich i często labiryntowych tekstów, bez architektonicznego ograniczenia, które mogłoby zdefiniować, zakapsułkować i “zabezpieczyć” wydarzenia i fakty przed procesem rekonstrukcji semantycznej.

Dlatego fakty nie są święte dla modelu NLP; mogą one łatwo zostać potraktowane w kontekście “semantycznych klocków Lego”, szczególnie tam, gdzie złożona gramatyka lub arkaiczny materiał źródłowy utrudnia rozróżnienie dyskretnych jednostek od struktury językowej.

Obserwacja sposobu, w jaki skomplikowany materiał źródłowy może zmylić złożone modele językowe, takie jak GPT-3. Źródło: Paraphrase Generation Using Deep Reinforcement Learning

Obserwacja sposobu, w jaki skomplikowany materiał źródłowy może zmylić złożone modele językowe, takie jak GPT-3. Źródło: Paraphrase Generation Using Deep Reinforcement Learning

Problem ten przenosi się z tekstowych modeli uczenia maszynowego do badań nad rozpoznawaniem obrazów, szczególnie w sektorach, które wykorzystują dyskryminację semantyczną do identyfikacji lub opisu obiektów.

Halucynacja i niedokładna 'kosmetyczna' reinterpretacja wpływa również na badania nad rozpoznawaniem obrazów.

Halucynacja i niedokładna ‘kosmetyczna’ reinterpretacja wpływa również na badania nad rozpoznawaniem obrazów.

W przypadku GPT-3 model może się rozczarować, gdy zostanie ponownie zapytany o temat, który już wcześniej rozwiązał najlepiej, jak mógł. W najlepszym przypadku przyzna porażkę:

Moje niedawne doświadczenie z podstawowym silnikiem Davinci w GPT-3. Model poprawnie odpowiada na pierwsze pytanie, ale jest zirytowany, gdy zostanie zapytany ponownie. Ponieważ zachowuje krótkotrwałą pamięć poprzedniej odpowiedzi i traktuje powtórne pytanie jako odrzucenie tej odpowiedzi, przyznaje porażkę. Źródło: https://www.scalr.ai/post/business-applications-for-gpt-3

Moje niedawne doświadczenie z podstawowym silnikiem Davinci w GPT-3. Model poprawnie odpowiada na pierwsze pytanie, ale jest zirytowany, gdy zostanie zapytany ponownie. Źródło: https://www.scalr.ai/post/business-applications-for-gpt-3

DaVinci i DaVinci Instruct (Beta) radzą sobie lepiej w tym zakresie niż inne modele GPT-3 dostępne za pośrednictwem API. Tutaj model Curie podaje błędną odpowiedź, a model Babbage z pewnością rozwija równie błędną odpowiedź:

Rzeczy, których Einstein nigdy nie powiedział

Gdy poprosimy silnik GPT-3 DaVinci Instruct (który obecnie wydaje się być najbardziej zdolny) o cytaty Einsteina “Bóg nie gra w kości z wszechświatem”, DaVinci Instruct nie znajduje cytatu i wymyśla nie-cytat, a następnie halucynuje trzy inne dość prawdopodobne i całkowicie nieistniejące cytaty (przez Einsteina lub kogokolwiek) w odpowiedzi na podobne pytania:

GPT-3 generuje cztery prawdopodobne cytaty Einsteina, żaden z nich nie daje żadnych wyników w pełnej wyszukiwarce internetowej, chociaż niektóre wywołują inne (rzeczywiste) cytaty Einsteina na temat “wyobraźni”.

Jeśli GPT-3 byłby konsekwentnie błędny w cytatach, byłoby łatwiej odrzucić te halucynacje programowo. Jednak im bardziej rozproszony i sławny jest cytat, tym bardziej prawdopodobne, że GPT-3 poda poprawny cytat:

GPT-3 wydaje się znajdować poprawne cytaty, gdy są one dobrze reprezentowane w danych wejściowych.

GPT-3 wydaje się znajdować poprawne cytaty, gdy są one dobrze reprezentowane w danych wejściowych.

Drugim problemem, który może pojawić się, jest to, że dane z historii sesji GPT-3 przenikają do nowego pytania:

Einstein byłby prawdopodobnie zgorszony, gdyby mu przypisano tę wypowiedź. Cytat wydaje się być nonsensowną halucynacją prawdziwego aforyzmu Winstona Churchilla. Poprzednie pytanie w sesji GPT-3 dotyczyło Churchilla (a nie Einsteina), a GPT-3 wydaje się użyć tego tokenu sesji, aby poinformować odpowiedź.

Rozwiązywanie halucynacji ekonomicznie

Halucynacja jest znaczną przeszkodą w przyjęciu zaawansowanych modeli NLP jako narzędzi badawczych – tym bardziej, że dane wyjściowe z takich silników są bardzo abstrakcyjne w stosunku do materiału źródłowego, który je utworzył, tak że ustalenie autentyczności cytatów i faktów staje się problematyczne.

Dlatego jednym z aktualnych wyzwań badawczych w NLP jest ustalenie sposobu identyfikacji halucynacji bez potrzeby wyobrażania sobie nowych modeli NLP, które mogą definiować, uwierzytelniać i uwierzytelniać fakty jako dyskretne jednostki (długoterminowy, odrębny cel w wielu szerszych sektorach badawczych).

Identifikacja i generowanie halucynowanych treści

Nowa współpraca między Carnegie Mellon University a Facebook AI Research oferuje nowe podejście do problemu halucynacji, formułując metodę identyfikacji halucynowanych danych wyjściowych i używając syntetycznych halucynowanych tekstów do stworzenia zestawu danych, który może być użyty jako punkt odniesienia dla przyszłych filtrów i mechanizmów, które mogą ostatecznie stać się częścią architektury NLP.

Źródło: https://arxiv.org/pdf/2011.02593.pdf

Źródło: https://arxiv.org/pdf/2011.02593.pdf

Na powyższym obrazie materiał źródłowy został podzielony na słowa, z etykietą “0” przypisaną do poprawnych słów i etykietą “1” przypisaną do halucynowanych słów. Poniżej widzimy przykład halucynowanych danych wyjściowych, które są związane z informacjami wejściowymi, ale są uzupełnione o nieautentyczne dane.

System wykorzystuje wstępnie wytrenowany autoencoder, który może mapować halucynowany ciąg z powrotem do oryginalnego tekstu, z którego wygenerowano skorygowaną wersję (podobnie jak w moich przykładach powyżej, gdzie wyszukiwarka internetowa ujawniła pochodzenie fałszywych cytatów, ale z programową i zautomatyzowaną metodologią semantyczną). Konkretnie użyty jest model autoencodera BART firmy Facebook do generowania skorygowanych zdań.

Przypisanie etykiety.

Przypisanie etykiety.

Proces mapowania halucynacji na źródło, który nie jest możliwy w standardowych modelach NLP, pozwala na mapowanie “odległości edycyjnej” i ułatwia algorytmiczne podejście do identyfikacji halucynowanych treści.

Badacze odkryli, że system dobrze generalizuje, nawet gdy nie ma dostępu do materiału referencyjnego, który był dostępny podczas szkolenia, co sugeruje, że model pojęciowy jest słuszny i szeroko powtarzalny.

Rozwiązywanie przeuczenia

Aby uniknąć przeuczenia i uzyskać szeroko wdrożalną architekturę, badacze losowo usuwali tokeny z procesu i stosowali również parafrazowanie i inne funkcje szumu.

Tłumaczenie maszynowe (MT) jest również częścią tego procesu zaciemniania, ponieważ tłumaczenie tekstu między językami jest prawdopodobnie w stanie zachować znaczenie w sposób niezawodny i dalej zapobiec przeuczeniu. Dlatego halucynacje zostały przetłumaczone i zidentyfikowane w ramach projektu przez dwujęzycznych mówców w warstwie anotacji ręcznej.

Inicjatywa osiągnęła nowe najlepsze wyniki w kilku standardowych testach sektorowych i jest pierwszą, która osiągnęła akceptowalne wyniki przy użyciu danych przekraczających 10 milionów tokenów.

Kod projektu, zatytułowany Wykrywanie halucynowanych treści w warunkowej generacji sekwencji neuronowych, został opublikowany na GitHub, i pozwala użytkownikom generować własne syntetyczne dane z BART z dowolnego korpusu tekstu. Zapewniono również możliwość późniejszego wygenerowania modeli wykrywania halucynacji.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai