Angolo di Anderson

Ottenere NLP per Sfidare Domande Male Informate

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Alcune domande sono insostenibili perchÃĐ contengono informazioni errate – presupposizioni che la persona che ascolta la domanda deve filtrare e rinnegare. CiÃē suppone, naturalmente, che l’ascoltatore abbia abbastanza informazioni corrette per sfidare la domanda, piuttosto che utilizzare la domanda stessa come fonte di (erronee) informazioni.

È una sfida per i sistemi di Elaborazione del Linguaggio Naturale (NLP) come GPT-3, che hanno una tendenza a ‘allucinare’ informazioni per mantenere la conversazione.

Attualmente, chiedere a GPT-3 ‘Quando Marie Curie ha inventato l’uranio?’ probabilmente otterrebbe la risposta ‘Marie Curie ha inventato l’uranio nel 1898’.

Fonte: https://beta.openai.com/playground (Da Vinci instruct beta).

Fonte: https://beta.openai.com/playground (Da Vinci instruct beta).

In realtà, l’uranio ÃĻ stato scoperto nel 1789 dal chimico tedesco Martin Heinrich Klaproth, mentre la rivelazione dei Curies del 1898 ÃĻ stata l’isolamento del radio.

Il problema dei sistemi NLP che ignorano le presupposizioni errate ÃĻ stato messo in evidenza in una serie di pubblicazioni quest’anno, tra cui il modo in cui i risultati di ricerca di Google assistiti da AI ignorano le informazioni errate nella domanda ‘Quando Neil Armstrong ha messo piede su Marte?’ – un errore che ancora appare al momento della stesura di questo articolo, e che si applica anche a Toy Story‘s Buzz Lightyear, che apparentemente ÃĻ atterrato sulla Luna il 21 luglio 1969.

Tom Hanks, un altro Toy Story alumnus, ÃĻ anche accreditato da Google per aver messo piede sulla Luna nel 1970, nonostante il fatto che il suo personaggio Apollo 13, l’astronauta Jim Lovell, sia piÃđ famoso per non aver raggiunto questo obiettivo.

Addressing Presupposition Issues in NLP Exchanges

Ora Google Research, insieme a ricercatori della Johns Hopkins University e della Brown University, sta indagando nuovi metodi di apprendimento automatico per i quali i sistemi NLP possano eventualmente essere resi in grado di sfidare le domande fattualmente errate nello stesso modo in cui ÃĻ essenziale per gli insegnanti umani fare durante le conversazioni con gli studenti.

Il recente documento Which Linguist Invented the Lightbulb? Presupposition Verication for Question-Answering descrive uno sforzo concertato per sviluppare un sistema innovativo per identificare le presupposizioni e considerarne la veridicità prima di continuare la conversazione.

Il nuovo algoritmo effettivamente pre-elabora le domande prima di tornare alla conversazione, dividendo l'”autenticazione” della domanda in un processo a tre parti.

Non funziona! A sinistra, il 'blocco' che si verifica anche quando un sistema NLP avanzato ÃĻ in grado di identificare che la domanda non ha senso. A destra, una scomposizione di un algoritmo proposto che tenta di rettificare l'errore di origine. Fonte: https://arxiv.org/pdf/2101.00391.pdf

Non funziona! A sinistra, il ‘blocco’ che si verifica anche quando un sistema NLP avanzato ÃĻ in grado di identificare che la domanda non ha senso. A destra, una scomposizione di un algoritmo proposto che tenta di rettificare l’errore di origine. Fonte: https://arxiv.org/pdf/2101.00391.pdf

Sebbene sembri una semplice routine di verifica che dovrebbe essere stata costruita nei sistemi di conoscenza fin dall’inizio, la maggior parte delle routine di addestramento NLP basate sull’apprendimento automatico impara informazioni con un livello eccessivo di fiducia per i dati di origine, compresi i discorsi (come le notizie false) che potrebbero essere stati pubblicati su canali precedentemente “affidabili”.

Quindi un problema chiave ÃĻ identificare per consenso una fonte affidabile di fatti in un clima in cui la proliferazione di informazioni errate attraverso i social media concederebbe, per default, autorità alla logica della generalizzazione dell’apprendimento automatico. Quest’ultima ha tendenzialmente utilizzato la quantità o la ripetizione dei dati come proxy per l’accuratezza, almeno fino a quando i fenomeni delle notizie false non sono diventati un’area di interesse critica nel campo negli ultimi anni.

Determining the Best Approach to Unanswerable Questions

Per determinare un approccio adeguato per risolvere una domanda che contiene informazioni errate, i ricercatori hanno eseguito 100 di tali indagini attraverso quattro diversi modelli Q&A e hanno chiesto ai soggetti umani di selezionare la migliore o la meno problematica soluzione che i modelli hanno generato.

I quattro possibili risultati architettonici per la “cattiva” domanda erano: ‘Unanswerable’ – dove un sistema Q&A chiuso effettivamente chiude l’indagine senza ulteriore elaborazione; ‘Presupposition failure-based explanation’ – dove il sistema non riesce a verificare la supposizione errata, effettivamente una risposta “unanswerable” con una spiegazione aggiunta; ‘Extractive explanation’ – dove il sistema recupera una citazione di Wikipedia correlata e la aggiunge alla frase introduttiva ‘Questa domanda ÃĻ insostenibile perchÃĐâ€Ķ’; e ‘Open domain rewrite’ – dove un sistema competitivo cerca fonti aggiuntive da Wikipedia.

Questo esempio di quattro possibili risposte a una domanda apparentemente 'insostenibile' illustra la complessità del tentativo di una soluzione competitiva basata sul dominio.

Questo esempio di quattro possibili risposte a una domanda apparentemente ‘insostenibile’ illustra la complessità del tentativo di una soluzione competitiva basata sul dominio.

Nel corso dei test, i cinque partecipanti (arruolati su una piattaforma di crowdsourcing interna di Google) hanno preferito le risposte basate sulle presupposizioni, il che ha portato i ricercatori a sviluppare un nuovo framework per decomporre e verificare le domande.

Nel nuovo sistema, i trigger linguistici vengono ottenuti dalla domanda da un generatore basato su regole che decompone la frase in affermazioni di fatto putative. Se multiple supposizioni vengono derivate dalla domanda, ogni una viene indagata e contribuirà alla risposta finale se affrontano le presupposizioni errate della domanda originale.

Datasets

Le presupposizioni generate nella fase iniziale sono state modificate manualmente per creare un set di dati di verifica con presupposizioni “oro”. Le presupposizioni che sono emerse dal ramo dell’indagine, ma che non erano presenti nelle domande originali, sono state rimosse.

Due degli autori del documento hanno quindi annotato manualmente 462 presupposizioni in termini di sÎ/no verificabilità, in base a una pagina di Wikipedia pertinente associata a ogni domanda. I casi di disaccordo sono stati risolti in una discussione post-facto prima di essere impegnati nel set di dati.

I ricercatori hanno utilizzato zero-shot NLI, un compito di classificazione di premessa/Ipotesi che richiede la scomposizione di articoli di Wikipedia correlati alle domande. PoichÃĐ questo processo produce molte piÃđ coppie di quanto la domanda possa implicare o il modello supportare, i risultati filtrati sono stati quindi aggregati e etichettati.

Results and Response Formulation

I risultati piÃđ efficaci sono stati ottenuti dalla soluzione piÃđ laboriosa: un ibrido fine-tuned/rule-based/NLI generato da ALBERT QNLI con frasi di Wikipedia e presupposizioni.

Le prestazioni dei modelli di verifica, dove 'Frasi di Wikipedia' utilizza frasi ottenute da articoli di Wikipedia correlati alle domande, e 'Presupposizioni di Wikipedia' sono presupposizioni generate da quelle frasi.

Le prestazioni dei modelli di verifica, dove ‘Frasi di Wikipedia’ utilizza frasi ottenute da articoli di Wikipedia correlati alle domande, e ‘Presupposizioni di Wikipedia’ sono presupposizioni generate da quelle frasi.

Utilizzando questa formulazione, i ricercatori hanno sviluppato un sistema di template in cui un fatto negante di Wikipedia ÃĻ stato aggiunto a ‘Questa domanda ÃĻ insostenibile perchÃĐâ€Ķ’. Sebbene non sia una soluzione ideale, gli autori suggeriscono che le risposte basate sulla non verificabilità siano probabilmente in grado di ridurre l’incidenza di falsi negativi.

Il sistema ÃĻ stato infine implementato in un Extended Transformer Construction (ETC) model.

Implications

A seconda della sua prestazione finale nel mondo reale, potrebbe essere argomentato che questo approccio possa portare alla sostituzione di ‘non verificabile’ con ‘insostenibile’, nei casi in cui il sistema di ricerca di supporto non possa valutare una correzione utile per una presupposizione errata della domanda. Effettivamente, sembra stia costruendo le infrastrutture per futuri e migliori sistemi di verifica.

I ricercatori già ammettono che la spesa delle richieste API basate su token ÃĻ un fattore limitante quando si formano le risposte piÃđ lunghe che questo sistema genererà, e si deve supporre che il sovraccarico aggiuntivo della ricerca “live” su una domanda sia probabile aggiungere latenza anche a grandi sistemi come GPT-3, poichÃĐ la risposta di tali sistemi ha finora dipeso dall’incorporazione generalizzata della conoscenza al momento dell’addestramento, piuttosto che da estensive routine di verifica basate sulla rete.

Inoltre, i ricercatori notano che il sistema attualmente ha limitazioni relative all’analisi degli aspetti semantici del testo:

Ad esempio, chi crede che la madre di Estella sia ha un possessivo incorporato in un verbo non fattivo credere, ma il nostro generatore genererebbe comunque ‘Estella ha ‘madre.

Tuttavia, il team prevede nuovi e piÃđ flessibili sistemi di risposta alle domande che saranno sviluppati sulla base di questa ricerca:

Nel futuro, pianifichiamo di costruire su questo lavoro proponendo sistemi QA che siano piÃđ robusti e cooperativi. Ad esempio, diversi tipi di fallimenti di presupposizione potrebbero essere affrontati con strategie di risposta piÃđ fluide – ad esempio, la violazione delle presupposizioni di unicità potrebbe essere gestita meglio fornendo tutte le possibili risposte, piuttosto che affermare che la presupposizione di unicità ÃĻ stata violata.

Scrittore di apprendimento automatico, specialista nel dominio della sintesi di immagini umane. Ex capo del contenuto di ricerca presso Metaphysic.ai, fino alla sua dissoluzione in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]