Unghiul lui Anderson

Obținerea NLP pentru a contesta întrebările înșelătoare

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Unele întrebări sunt de neatâtnat pentru că conțin informații incorecte – presupuneri pe care persoana care aude întrebarea trebuie să le filtreze și să le renunțe. Acest lucru presupune, desigur, că ascultătorul are suficiente informații corecte pentru a contesta întrebarea, în loc de a folosi întrebarea în sine ca sursă de informații (greșite).

Este o provocare pentru sistemele de procesare a limbajului natural (NLP) cum ar fi GPT-3, care au o tendință de a “halucina” informații pentru a menține dialogul.

Dacă îi cereți GPT-3 “Când a inventat Marie Curie uraniul?”, este probabil să obțineți răspunsul “Marie Curie a inventat uraniul în 1898”.

Sursă: https://beta.openai.com/playground (Da Vinci instruct beta).

Sursă: https://beta.openai.com/playground (Da Vinci instruct beta).

De fapt, uraniul a fost descoperit în 1789 de chimistul german Martin Heinrich Klaproth, în timp ce revelația Curiilor din 1898 a fost izolarea radiului.

Problema sistemelor NLP care ignoră presupunerile incorecte a devenit vizibilă într-un număr de articole publicitare în acest an, inclusiv modul în care rezultatele căutării asistate de AI de la Google ignoră informațiile incorecte din întrebarea “Când a pus Neil Armstrong piciorul pe Marte?” – o eroare care încă apare la momentul scrierii acestui articol și se aplică în mod egal lui Povestea jucăriilor, al cărui personaj Buzz Lightyear a aterizat pe Lună pe 21 iulie 1969.

Tom Hanks, un alt veteran al Povestea jucăriilor, este creditat și el de către Google pentru aterizarea pe Lună în 1970, în ciuda faptului că personajul său din Apollo 13, astronautul Jim Lovell, este cel mai cunoscut pentru faptul că nu a reușit să aterizeze pe Lună.

Abordarea problemelor de presupunere în schimburile NLP

Acum, cercetătorii de la Google Research, împreună cu cercetători de la Universitatea Johns Hopkins și Universitatea Brown, investighează noi metode de învățare automată prin care sistemele NLP pot fi în cele din urmă făcute să conteste întrebările factual incorecte în același mod în care este esențial pentru profesorii umani să o facă în timpul conversațiilor cu elevii.

Articolul recent publicat Care lingvist a inventat becul? prezintă un efort concertat de a dezvolta un sistem nou pentru a identifica presupunerile și a verifica veridicitatea lor înainte de a continua schimbul.

Noul algoritm preprocesează întrebările înainte de a reveni la conversație, descompunând “autentificarea” întrebării într-un proces în trei părți.

Nu se calculează! În stânga, 'bariera' care apare chiar și atunci când un sistem NLP avansat a reușit să identifice că întrebarea nu are sens. În dreapta, o descompunere a unui algoritm propus care încearcă să rectifice eroarea sursă.

Nu se calculează! În stânga, ‘bariera’ care apare chiar și atunci când un sistem NLP avansat a reușit să identifice că întrebarea nu are sens. În dreapta, o descompunere a unui algoritm propus care încearcă să rectifice eroarea sursă. Sursă: https://arxiv.org/pdf/2101.00391.pdf

Deși pare a fi o rutină de verificare simplă care ar fi trebuit să fie integrată în sistemele de cunoaștere de la început, majoritatea rutinelor de antrenare NLP învață informații cu un nivel excesiv de încredere pentru datele sursă, inclusiv discursul (cum ar fi știrile false) care ar fi putut fi publicate pe canale “de încredere” anterioare.

Prin urmare, o problemă cheie este identificarea prin consens a unei surse de fapte fiabile într-un climat în care proliferarea informațiilor incorecte prin rețelele sociale ar fi, prin definiție, acordat autoritate sub logica generalizării învățării automate. Aceasta din urmă a tendința de a utiliza cantitatea sau repetiția datelor ca proxy pentru acuratețe, cel puțin până când fenomenul știrilor false a devenit o zonă critică de interes în domeniu în ultimii ani.

Determinarea celei mai bune abordări pentru întrebările de neatâtnat

Pentru a determina o abordare adecvată pentru rezolvarea unei întrebări care conține informații incorecte, cercetătorii au rulat 100 de astfel de întrebări prin patru modele Q&A diferite și au cerut subiecților umani să aleagă cea mai bună sau mai puțin problematică soluție pe care modelele au generat-o.

Cele patru rezultate arhitecturale posibile pentru “întrebarea proastă” au fost: ‘De neatâtnat’ – unde un sistem Q&A cu carte închisă efectiv închide întrebarea fără alte explicații; ‘Explicație bazată pe eșecul presupunerii’ – unde sistemul nu reușește să verifice presupunerea incorectă, efectiv un răspuns “de neatâtnat”, cu o explicație adăugată; ‘Explicație extractivă’ – unde sistemul extrage o citat relevantă de pe Wikipedia și o anexează la fraza “Această întrebare este de neatâtnat pentru că…”; și ‘Rescriere de domeniu deschis’ – unde un sistem competitiv căută surse suplimentare de pe Wikipedia.

Acest exemplu de patru posibile răspunsuri la o întrebare aparent 'de neatâtnat' ilustrează complexitatea încercării de a găsi o soluție competitivă de domeniu pentru problema respectivă.

Acest exemplu de patru posibile răspunsuri la o întrebare aparent ‘de neatâtnat’ ilustrează complexitatea încercării de a găsi o soluție competitivă de domeniu pentru problema respectivă.

Pe parcursul testelor, cei cinci participanți (recruitați pe o platformă de crowd-sourcing internă Google) au preferat răspunsurile bazate pe presupuneri, ceea ce i-a determinat pe cercetători să dezvolte un cadru nou pentru a descompune și verifica întrebările.

În noul sistem, declanșatoarele lingvistice sunt obținute din întrebare printr-un generator bazat pe reguli care deconstruiește propoziția în afirmații factuale presupuse. Dacă multiple presupuneri sunt derivate din întrebare, fiecare este investigată și va contribui la răspunsul final dacă abordează presupuneri incorecte din întrebarea originală.

Datele

Presupunerile generate în stadiul inițial au fost modificate manual pentru a crea un set de date de verificare cu presupuneri “de aur”. Orice presupuneri care au apărut din ramificarea investigației, dar care nu erau prezente în întrebările originale, au fost eliminate.

Cei doi autori ai articolului au annotat manual 462 de presupuneri în termeni de da/nu verificabilitate, pe baza unei pagini Wikipedia relevante asociate cu fiecare întrebare. Cazurile de dezacord au fost rezolvate în discuții post-factum înainte de a fi incluse în setul de date.

Cercetătorii au utilizat zero-shot NLI, o sarcină de clasificare a propoziției/premisă care a necesitat deconstruirea articolelor Wikipedia legate de întrebări. Deoarece acest proces rezultă în multe mai multe perechi decât întrebarea poate implica sau modelul suportă, rezultatele filtrate au fost apoi agregate și etichetate.

Rezultate și formularea răspunsului

Cele mai eficiente rezultate au fost obținute prin soluția cea mai laborioasă: un hibrid fin reglat/rule-based/NLI generat din ALBERT QNLI cu propoziții și presupuneri Wikipedia.

Performanța modelelor de verificare, unde 'propoziții Wikipedia' utilizează propoziții obținute din articole Wikipedia legate de întrebări, și 'presupuneri Wikipedia' sunt presupuneri generate din acele propoziții.

Performanța modelelor de verificare, unde ‘propoziții Wikipedia’ utilizează propoziții obținute din articole Wikipedia legate de întrebări, și ‘presupuneri Wikipedia’ sunt presupuneri generate din acele propoziții.

Utilizând această formulă, cercetătorii au dezvoltat un sistem de șablon în care un fapt negativ din Wikipedia a fost anexat la fraze precum “Această întrebare este de neatâtnat pentru că…”. Deși nu este o soluție ideală, autorii sugerează că răspunsurile bazate pe neverificabilitate sunt probabil să reducă incidența falselor negative.

Sistemul a fost în cele din urmă implementat într-un model Extended Transformer Construction (ETC).

Implicații

În funcție de performanța sa finală în lumea reală, se poate argumenta că această abordare poate duce la simpla substituție a “neverificabil” cu “de neatâtnat”, în cazurile în care sistemul de cercetare suport nu poate evalua o corecție utilă pentru o presupunere înșelătoare a întrebării. Efectiv, pare a fi o infrastructură pentru sisteme de verificare viitoare și mai bune.

Cercetătorii recunosc deja că costul cererilor API bazate pe token este un factor limitativ atunci când se formulează răspunsuri mai lungi pe care acest sistem le va genera, și trebuie să se presupună că suplimentarul de “cercetare live” a unei întrebări pare să adauge latență chiar și pentru sisteme de scară largă, cum ar fi GPT-3, deoarece răspunsul sistemelor respective a depins până în prezent de încorporarea generalizată a cunoștințelor la momentul antrenării, și nu de rutinele de verificare extinse bazate pe rețea.

În plus, cercetătorii notează că sistemul curent are limitări legate de analiza aspectelor semantice ale textului:

De exemplu, cine crede pip că este mama Estellei are o posesie încorporată sub un verb nonfactiv crede , dar generatorul nostru ar genera totuși ‘Estella are ‘mamă .’

Cu toate acestea, echipa se imaginează noi sisteme de întrebări și răspunsuri mai flexibile care vor fi dezvoltate pe baza acestei cercetări:

În viitor, ne propunem să construim pe această lucrare prin propunerea de sisteme QA care sunt mai robuste și mai cooperante. De exemplu, diferite tipuri de eșecuri ale presupunerii ar putea fi abordate prin strategii de răspuns mai fluide – de exemplu, încălcarea presupunerii unicității ar putea fi gestionată mai bine prin furnizarea tuturor răspunsurilor posibile, în loc de a afirma că presupunerea unicității a fost încălcată.

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai