Angolo di Anderson
Ottenere NLP per Sfidare Domande Male Informate

Alcune domande sono insostenibili perchÃĐ contengono informazioni errate â presupposizioni che la persona che ascolta la domanda deve filtrare e rinnegare. CiÃē suppone, naturalmente, che lâascoltatore abbia abbastanza informazioni corrette per sfidare la domanda, piuttosto che utilizzare la domanda stessa come fonte di (erronee) informazioni.
à una sfida per i sistemi di Elaborazione del Linguaggio Naturale (NLP) come GPT-3, che hanno una tendenza a âallucinareâ informazioni per mantenere la conversazione.
Attualmente, chiedere a GPT-3 âQuando Marie Curie ha inventato lâuranio?â probabilmente otterrebbe la risposta âMarie Curie ha inventato lâuranio nel 1898â.

Fonte: https://beta.openai.com/playground (Da Vinci instruct beta).
In realtà , lâuranio ÃĻ stato scoperto nel 1789 dal chimico tedesco Martin Heinrich Klaproth, mentre la rivelazione dei Curies del 1898 ÃĻ stata lâisolamento del radio.
Il problema dei sistemi NLP che ignorano le presupposizioni errate ÃĻ stato messo in evidenza in una serie di pubblicazioni questâanno, tra cui il modo in cui i risultati di ricerca di Google assistiti da AI ignorano le informazioni errate nella domanda âQuando Neil Armstrong ha messo piede su Marte?â â un errore che ancora appare al momento della stesura di questo articolo, e che si applica anche a Toy Storyâs Buzz Lightyear, che apparentemente ÃĻ atterrato sulla Luna il 21 luglio 1969.
Tom Hanks, un altro Toy Story alumnus, ÃĻ anche accreditato da Google per aver messo piede sulla Luna nel 1970, nonostante il fatto che il suo personaggio Apollo 13, lâastronauta Jim Lovell, sia piÃđ famoso per non aver raggiunto questo obiettivo.

Addressing Presupposition Issues in NLP Exchanges
Ora Google Research, insieme a ricercatori della Johns Hopkins University e della Brown University, sta indagando nuovi metodi di apprendimento automatico per i quali i sistemi NLP possano eventualmente essere resi in grado di sfidare le domande fattualmente errate nello stesso modo in cui ÃĻ essenziale per gli insegnanti umani fare durante le conversazioni con gli studenti.
Il recente documento Which Linguist Invented the Lightbulb? Presupposition VeriïŽcation for Question-Answering descrive uno sforzo concertato per sviluppare un sistema innovativo per identificare le presupposizioni e considerarne la veridicità prima di continuare la conversazione.
Il nuovo algoritmo effettivamente pre-elabora le domande prima di tornare alla conversazione, dividendo l'âautenticazioneâ della domanda in un processo a tre parti.

Non funziona! A sinistra, il âbloccoâ che si verifica anche quando un sistema NLP avanzato ÃĻ in grado di identificare che la domanda non ha senso. A destra, una scomposizione di un algoritmo proposto che tenta di rettificare lâerrore di origine. Fonte: https://arxiv.org/pdf/2101.00391.pdf
Sebbene sembri una semplice routine di verifica che dovrebbe essere stata costruita nei sistemi di conoscenza fin dallâinizio, la maggior parte delle routine di addestramento NLP basate sullâapprendimento automatico impara informazioni con un livello eccessivo di fiducia per i dati di origine, compresi i discorsi (come le notizie false) che potrebbero essere stati pubblicati su canali precedentemente âaffidabiliâ.
Quindi un problema chiave ÃĻ identificare per consenso una fonte affidabile di fatti in un clima in cui la proliferazione di informazioni errate attraverso i social media concederebbe, per default, autorità alla logica della generalizzazione dellâapprendimento automatico. Questâultima ha tendenzialmente utilizzato la quantità o la ripetizione dei dati come proxy per lâaccuratezza, almeno fino a quando i fenomeni delle notizie false non sono diventati unâarea di interesse critica nel campo negli ultimi anni.
Determining the Best Approach to Unanswerable Questions
Per determinare un approccio adeguato per risolvere una domanda che contiene informazioni errate, i ricercatori hanno eseguito 100 di tali indagini attraverso quattro diversi modelli Q&A e hanno chiesto ai soggetti umani di selezionare la migliore o la meno problematica soluzione che i modelli hanno generato.
I quattro possibili risultati architettonici per la âcattivaâ domanda erano: âUnanswerableâ â dove un sistema Q&A chiuso effettivamente chiude lâindagine senza ulteriore elaborazione; âPresupposition failure-based explanationâ â dove il sistema non riesce a verificare la supposizione errata, effettivamente una risposta âunanswerableâ con una spiegazione aggiunta; âExtractive explanationâ â dove il sistema recupera una citazione di Wikipedia correlata e la aggiunge alla frase introduttiva âQuesta domanda ÃĻ insostenibile perchÃĐâĶâ; e âOpen domain rewriteâ â dove un sistema competitivo cerca fonti aggiuntive da Wikipedia.

Questo esempio di quattro possibili risposte a una domanda apparentemente âinsostenibileâ illustra la complessità del tentativo di una soluzione competitiva basata sul dominio.
Nel corso dei test, i cinque partecipanti (arruolati su una piattaforma di crowdsourcing interna di Google) hanno preferito le risposte basate sulle presupposizioni, il che ha portato i ricercatori a sviluppare un nuovo framework per decomporre e verificare le domande.
Nel nuovo sistema, i trigger linguistici vengono ottenuti dalla domanda da un generatore basato su regole che decompone la frase in affermazioni di fatto putative. Se multiple supposizioni vengono derivate dalla domanda, ogni una viene indagata e contribuirà alla risposta finale se affrontano le presupposizioni errate della domanda originale.
Datasets
Le presupposizioni generate nella fase iniziale sono state modificate manualmente per creare un set di dati di verifica con presupposizioni âoroâ. Le presupposizioni che sono emerse dal ramo dellâindagine, ma che non erano presenti nelle domande originali, sono state rimosse.
Due degli autori del documento hanno quindi annotato manualmente 462 presupposizioni in termini di sÎ/no verificabilità , in base a una pagina di Wikipedia pertinente associata a ogni domanda. I casi di disaccordo sono stati risolti in una discussione post-facto prima di essere impegnati nel set di dati.
I ricercatori hanno utilizzato zero-shot NLI, un compito di classificazione di premessa/Ipotesi che richiede la scomposizione di articoli di Wikipedia correlati alle domande. PoichÃĐ questo processo produce molte piÃđ coppie di quanto la domanda possa implicare o il modello supportare, i risultati filtrati sono stati quindi aggregati e etichettati.
Results and Response Formulation
I risultati piÃđ efficaci sono stati ottenuti dalla soluzione piÃđ laboriosa: un ibrido fine-tuned/rule-based/NLI generato da ALBERT QNLI con frasi di Wikipedia e presupposizioni.

Le prestazioni dei modelli di verifica, dove âFrasi di Wikipediaâ utilizza frasi ottenute da articoli di Wikipedia correlati alle domande, e âPresupposizioni di Wikipediaâ sono presupposizioni generate da quelle frasi.
Utilizzando questa formulazione, i ricercatori hanno sviluppato un sistema di template in cui un fatto negante di Wikipedia ÃĻ stato aggiunto a âQuesta domanda ÃĻ insostenibile perchÃĐâĶâ. Sebbene non sia una soluzione ideale, gli autori suggeriscono che le risposte basate sulla non verificabilità siano probabilmente in grado di ridurre lâincidenza di falsi negativi.
Il sistema ÃĻ stato infine implementato in un Extended Transformer Construction (ETC) model.
Implications
A seconda della sua prestazione finale nel mondo reale, potrebbe essere argomentato che questo approccio possa portare alla sostituzione di ânon verificabileâ con âinsostenibileâ, nei casi in cui il sistema di ricerca di supporto non possa valutare una correzione utile per una presupposizione errata della domanda. Effettivamente, sembra stia costruendo le infrastrutture per futuri e migliori sistemi di verifica.
I ricercatori già ammettono che la spesa delle richieste API basate su token ÃĻ un fattore limitante quando si formano le risposte piÃđ lunghe che questo sistema genererà , e si deve supporre che il sovraccarico aggiuntivo della ricerca âliveâ su una domanda sia probabile aggiungere latenza anche a grandi sistemi come GPT-3, poichÃĐ la risposta di tali sistemi ha finora dipeso dallâincorporazione generalizzata della conoscenza al momento dellâaddestramento, piuttosto che da estensive routine di verifica basate sulla rete.
Inoltre, i ricercatori notano che il sistema attualmente ha limitazioni relative allâanalisi degli aspetti semantici del testo:
Ad esempio, chi crede che la madre di Estella sia ha un possessivo incorporato in un verbo non fattivo credere, ma il nostro generatore genererebbe comunque âEstella ha âmadre.
Tuttavia, il team prevede nuovi e piÃđ flessibili sistemi di risposta alle domande che saranno sviluppati sulla base di questa ricerca:
Nel futuro, pianifichiamo di costruire su questo lavoro proponendo sistemi QA che siano piÃđ robusti e cooperativi. Ad esempio, diversi tipi di fallimenti di presupposizione potrebbero essere affrontati con strategie di risposta piÃđ fluide â ad esempio, la violazione delle presupposizioni di unicità potrebbe essere gestita meglio fornendo tutte le possibili risposte, piuttosto che affermare che la presupposizione di unicità ÃĻ stata violata.












