Kąt Andersona
Uzyskanie NLP do Wyzwania Błędnie Poinformowanych Pytań

Niektóre pytania są nieodpowiednie, ponieważ zawierają błędne informacje – założenia, które osoba słuchająca pytania musi odfiltrować i odrzucić. Zakłada to, oczywiście, że słuchający ma wystarczającą ilość poprawnych informacji, aby zakwestionować pytanie, zamiast używać samego pytania jako źródła (błędnych) informacji.
To jest wyzwanie dla systemów przetwarzania języka naturalnego (NLP), takich jak GPT-3, które mają tendencję do “hallucynacji” informacji, aby utrzymać dialog.
Obecnie, zadając GPT-3 pytanie “Kiedy Marie Curie wynalazła uran?”, prawdopodobnie otrzymamy odpowiedź “Marie Curie wynalazła uran w 1898 roku”.

Źródło: https://beta.openai.com/playground (Da Vinci instruct beta).
W rzeczywistości, uran został odkryty w 1789 roku przez niemieckiego chemika Martina Heinricha Klaprotha, podczas gdy odkrycie radu przez Curies w 1898 roku było izolacją radu.
Problem systemów NLP ignorujących błędne założenia został podkreślony w kilku przypadkach w tym roku, w tym w sposób, w jaki wyniki wyszukiwania Google z użyciem sztucznej inteligencji ignorują błędne informacje w pytaniu “Kiedy Neil Armstrong postawił stopę na Marsie?” – błąd, który nadal występuje w momencie pisania tego artykułu, i który dotyczy również postaci z filmu “Toy Story”, Buzz Lightyear, który podobno wylądował na Księżycu 21 lipca 1969 roku.
Tom Hanks, inny aktor z filmu “Toy Story”, jest również przypisywany przez Google lądowaniu na Księżycu w 1970 roku, pomimo faktu, że jego postać z filmu “Apollo 13”, astronauta Jim Lovell, jest najbardziej znany z tego, że nie osiągnął tego.

Rozwiązywanie problemów z założeniami w wymianach NLP
Teraz Google Research, wraz z badaczami z Uniwersytetu Johnsa Hopkinsa i Uniwersytetu Browna, bada nowe metody uczenia maszynowego, których można użyć do rozwoju systemów NLP, które będą w stanie zakwestionować pytania zawierające błędne informacje w sposób podobny do tego, w jaki ludzie robią to w rozmowach.
Niedawny artykuł Jaki lingwista wynalazł żarówkę? Weryfikacja założeń dla odpowiedzi na pytania przedstawia zorganizowane starania, aby opracować nowy system, który będzie w stanie identyfikować założenia i sprawdzać ich prawdziwość przed kontynuowaniem rozmowy.
Nowy algorytm skutecznie przetwarza pytania przed powrotem do rozmowy, rozkładając “uwierzytelnienie” pytania na trzy etapy.

To nie działa! Po lewej stronie, “blokada”, która występuje nawet wtedy, gdy zaawansowany system NLP jest w stanie zidentyfikować, że pytanie nie ma sensu. Po prawej stronie, rozkład proponowanego algorytmu, który próbuje rozwiązać błąd źródłowy. Źródło: https://arxiv.org/pdf/2101.00391.pdf
Chociaż wydaje się to prosta rutyna weryfikacyjna, która powinna być wbudowana w systemy wiedzy od samego początku, większość rutynowych szkoleń NLP uczy się informacji z nieuzasadnionym zaufaniem do danych źródłowych, w tym dyskursu (takiego jak fałszywe wiadomości), który mógł być opublikowany na wcześniej “zaufanych” kanałach.
W związku z tym kluczowym problemem jest identyfikacja konsensusu co do niezawodnego źródła faktów w środowisku, w którym proliferacja błędnych “wiadomości” za pośrednictwem mediów społecznościowych domyślnie nadałby im autorytet zgodnie z logiką uogólnienia maszynowego. Ostatnie zjawisko fałszywych wiadomości stało się krytycznym obszarem zainteresowania w dziedzinie w ostatnich latach.
Określenie najlepszego podejścia do nieodpowiednich pytań
Aby określić odpowiednie podejście do rozwiązania pytania zawierającego błędne informacje, badacze przeprowadzili 100 takich zapytań przez cztery różne modele Q&A i poprosili ludzi, aby wybrali najlepsze lub najmniej problematyczne rozwiązanie, które modele wygenerowały.
Cztery możliwe architektoniczne wyniki “złego” pytania to: “nieodpowiednie” – gdzie system Q&A zamyka się bez dalszego wyjaśnienia; “wyjaśnienie oparte na niepowodzeniu założenia” – gdzie system nie weryfikuje błędnego założenia, skutecznie “nieodpowiednia” odpowiedź z dodatkowym wyjaśnieniem; “wyjaśnienie ekstrakcyjne” – gdzie system pobiera powiązaną cytaty z Wikipedii i dołącza ją do wstępnego “To pytanie jest nieodpowiednie, ponieważ…”; i “przepisanie w domenie” – gdzie konkurencyjny system szuka dodatkowych źródeł z Wikipedii.

Ten przykład czterech możliwych odpowiedzi na pytanie, które wydaje się “nieodpowiednie”, ilustruje złożoność próby konkurencyjnego rozwiązania domenowego tego problemu.
W trakcie testów pięciu uczestników (zarekrutowanych na wewnętrznej platformie crowdsourcingowej Google) preferowało odpowiedzi oparte na założeniach, co skłoniło badaczy do opracowania nowego frameworku do dekompozycji i weryfikacji pytań.
W nowym systemie, wyzwalacze językowe są pobierane z pytania przez generator oparty na regułach, który dekonstruuje zdanie na potencjalne stwierdzenia faktów. Jeśli z pytania wynikają多 założenia, każde z nich jest badane, i będzie przyczyniać się do ostatecznej odpowiedzi, jeśli dotyczą błędnych założeń z oryginalnego pytania.
Zestawy danych
Wygenerowane założenia w początkowej fazie zostały ręcznie zmienione, aby utworzyć zestaw danych weryfikacyjnych z “złotymi” założeniami. Jakiekolwiek założenia, które wynikają z rozgałęzienia zapytania, ale które nie są obecne w oryginalnych pytaniach, zostały usunięte.
Dwóch autorów artykułu ręcznie oznaczyło 462 założenia w kategoriach tak/nie weryfikowalności, na podstawie odpowiedniej strony Wikipedii związanej z każdym pytaniem. Przypadki niezgodności zostały rozwiązane w dyskusji po fakcie przed zaangażowaniem do zestawu danych.
Badacze użyli zero-shot NLI, zadania klasyfikacji zdania, które wymaga dekonstrukcji artykułów Wikipedii związanych z pytaniami. Ponieważ proces ten prowadzi do wielu więcej par niż pytanie może zawierać lub model obsługiwać, wyniki zostały przefiltrowane i oznaczone.
Wyniki i formułowanie odpowiedzi
Najbardziej skuteczne wyniki zostały uzyskane przez najbardziej pracochłonne rozwiązanie: drobiazgowo dostosowany, hybrydowy generator oparty na regułach/NLI, wygenerowany z ALBERT QNLI z wyrokami Wiki i założeniami.

Wyniki modeli weryfikacyjnych, gdzie ‘zdania Wiki’ używają zdań pobranych z artykułów Wikipedii związanych z pytaniami, a ‘założenia Wiki’ są generowane założenia z tych zdań.
Używając tego sformułowania, badacze opracowali system szablonów, w którym fakt negujący z Wikipedii został dołączony do “To pytanie jest nieodpowiednie, ponieważ…” i podobnych fraz. Chociaż nie jest to idealne rozwiązanie, autorzy sugerują, że odpowiedzi oparte na nieuwierzytelnialności są prawdopodobnie zmniejszające przypadki fałszywych negatywów.
System został ostatecznie zaimplementowany w rozszerzonym modelu transformatorem (ETC).
Wnioski
W zależności od jego ostatecznej wydajności w świecie rzeczywistym, można argumentować, że całe podejście może prowadzić do prostego zastąpienia “nieuwierzytelnialnego” przez “nieodpowiednie”, w przypadkach, w których system badawczy nie może ocenić przydatnej korekty dla błędnego założenia pytania. Skutecznie wydaje się, że leży to podstawy dla przyszłych i lepszych systemów weryfikacyjnych.
Badacze już przyznają, że koszt tokenowych żądań API jest czynnikiem ograniczającym przy formułowaniu dłuższych odpowiedzi, które ten system wygeneruje, i można założyć, że dodatkowy nakład “na żywo” badania nad pytaniem prawdopodobnie doda opóźnienia nawet do dużych systemów, takich jak GPT-3, ponieważ responsywność takich systemów do tej pory zależała od uogólnionego włączenia wiedzy w czasie szkolenia, a nie od rozległych, sieciowych rutyn weryfikacyjnych.
Dodatkowo, badacze zauważają, że system ma obecnie ograniczenia związane z analizą semantyczną tekstu:
Na przykład, kto pip uważa, że jest matką Estelli, ma osadzoną własność pod niefaktualnym czasownikiem believe, ale nasz generator wygenerowałby ‘Estella’ ma ‘matkę’.
Niemniej jednak, zespół przewiduje nowe i bardziej elastyczne systemy odpowiedzi na pytania, które będą rozwijane na podstawie tej pracy:
W przyszłości planujemy rozwijać tę pracę, proponując systemy Q&A, które są bardziej elastyczne i współpracujące. Na przykład, różne rodzaje niepowodzeń założeń mogą być lepiej obsługiwane przez bardziej płynne strategie odpowiedzi – np. naruszenie założenia unikalności może być lepiej obsłużone przez dostarczenie wszystkich możliwych odpowiedzi, zamiast stwierdzenia, że założenie unikalności zostało naruszone.












