Angolo di Anderson
I modelli NLP faticano a comprendere le frasi nominali ricorsive
I ricercatori degli Stati Uniti e della Cina hanno scoperto che nessuno dei principali modelli di elaborazione del linguaggio naturale (NLP) sembra essere in grado, per default, di analizzare le frasi inglesi che presentano frasi nominali ricorsive (NPs) e “lottano” per individuare il significato centrale in esempi strettamente correlati come Il mio film preferito nuovo e Il mio film preferito (ciascuno dei quali ha un significato diverso).

In un esempio di titolo del documento, ecco un piccolo rompicapo che i bambini spesso non riescono a risolvere: la seconda palla è verde, ma la quinta palla è la ‘seconda palla verde’. Fonte: https://arxiv.org/pdf/2112.08326.pdf
I ricercatori hanno stabilito una sfida di frasi nominali ricorsive (RNPC) per diversi modelli di generazione di linguaggio open source installati localmente: OpenAI’s GPT-3*, Google’s BERT, e Facebook’s RoBERTa e BART, scoprendo che questi modelli all’avanguardia hanno raggiunto solo prestazioni “casuali”. Concludono†:
‘I risultati mostrano che i modelli linguistici all’avanguardia (SOTA) addestrati su benchmark standard dello stesso formato hanno tutte difficoltà nel nostro dataset, suggerendo che le conoscenze target non sono facilmente disponibili.’

Esempi di coppia nella sfida RNPC in cui i modelli SOTA hanno commesso errori.
Negli esempi sopra, i modelli non sono riusciti, ad esempio, a distinguere la disparità semantica tra un animale pericoloso morto (cioè un predatore che non rappresenta una minaccia perché è morto) e un animale morto pericoloso (come un chipmunk morto, che può contenere un virus pericoloso e rappresenta una minaccia attiva).
(Inoltre, sebbene il documento non lo menzioni, ‘morto’ è anche frequentemente utilizzato come avverbio, che non riguarda nessuno dei due casi)
Tuttavia, i ricercatori hanno anche scoperto che un addestramento aggiuntivo o supplementare che include materiale RNPC può risolvere il problema:
‘I modelli linguistici pre-addestrati con prestazioni SOTA sui benchmark NLU hanno una scarsa padronanza di questa conoscenza, ma possono ancora impararla quando esposti a piccole quantità di dati da RNPC.’
I ricercatori sostengono che la capacità di un modello linguistico di navigare strutture ricorsive di questo tipo è essenziale per compiti a valle come l’analisi del linguaggio, la traduzione e fanno un caso speciale per la sua importanza nelle routine di rilevamento del danno:
‘[Noi] consideriamo lo scenario in cui un utente interagisce con un agente orientato al compito come Siri o Alexa, e l’agente deve determinare se l’attività coinvolta nella query dell’utente è potenzialmente dannosa [ad esempio ai minori]. Scegliamo questo compito perché molti falsi positivi provengono da frasi nominali ricorsive.
‘Ad esempio, come fare una bomba fatta in casa è ovviamente dannoso mentre come fare una bomba da bagno fatta in casa è inoffensivo.’
Il documento si intitola ‘Il mio film preferito nuovo’ è il mio film preferito? Verificare la comprensione delle frasi nominali ricorsive e proviene da cinque ricercatori dell’Università della Pennsylvania e uno dell’Università di Pechino.
Dati e metodo
Sebbene lavori precedenti abbiano studiato la struttura sintattica delle frasi nominali ricorsive e la categorizzazione semantica dei modificatori, nessuno di questi approcci è sufficiente, secondo i ricercatori, per affrontare la sfida.
Pertanto, sulla base dell’utilizzo di frasi nominali ricorsive con due modificatori, i ricercatori hanno cercato di stabilire se la conoscenza necessaria esiste nei sistemi NLP all’avanguardia (non esiste); se può essere insegnata loro (può essere fatto); cosa i sistemi NLP possono imparare dalle frasi nominali ricorsive; e in che modo tale conoscenza può beneficiare le applicazioni a valle.
Il dataset utilizzato dai ricercatori è stato creato in quattro fasi. In primo luogo, è stata costruita una lessicografia dei modificatori contenente 689 esempi tratti dalla letteratura precedente e da lavori nuovi.
In seguito, i ricercatori hanno raccolto frasi nominali ricorsive dalla letteratura, corpora esistenti e aggiunte di loro invenzione. Le risorse testuali includevano il Penn Treebank e il Annotated Gigaword corpus.
Quindi, il team ha assunto studenti universitari pre-selezionati per creare esempi per i tre compiti che i modelli linguistici avrebbero affrontato, validandoli successivamente in 8.260 istanze valide.
Infine, altri studenti universitari pre-selezionati sono stati assunti, questa volta tramite Amazon Mechanical Turk, per annotare ogni istanza come un compito di intelligenza umana (HIT), decidendo le dispute sulla base di una maggioranza. Ciò ha ridotto le istanze a 4.567 esempi, che sono stati ulteriormente filtrati per produrre 3.790 istanze più bilanciate.
I ricercatori hanno adattato diversi dataset esistenti per formulare le tre sezioni delle loro ipotesi di test, inclusi MNLI, SNLI, MPE e ADEPT, addestrando tutti i modelli SOTA, ad eccezione del modello HuggingFace, per cui è stato utilizzato un checkpoint.
Risultati
I ricercatori hanno scoperto che tutti i modelli “lottano” nei compiti RNPC, rispetto a un punteggio di accuratezza del 90%+ per gli esseri umani, con i modelli SOTA che hanno raggiunto prestazioni “casuali” (cioè senza alcuna evidenza di abilità innate rispetto al caso).

Risultati dei test dei ricercatori. Qui i modelli linguistici sono testati contro la loro accuratezza su un benchmark esistente, con la linea centrale che rappresenta la prestazione umana equivalente nei compiti.
Linee di indagine secondarie indicano che queste carenze possono essere compensate nella fase di addestramento o di fine-tuning di un modello NLP includendo specificamente la conoscenza delle frasi nominali ricorsive. Una volta che questo addestramento supplementare è stato eseguito, i modelli hanno raggiunto ‘una forte prestazione zero-shot su un compito di rilevamento del danno estrinseco’.
I ricercatori promettono di rilasciare il codice per questo lavoro su https://github.com/veronica320/Recursive-NPs.
Originariamente pubblicato il 16 dicembre 2021 – 17 dicembre 2021, 6:55 GMT+2: Corretto un collegamento ipertestuale rotto.
* GPT-3 Ada, che è il più veloce ma non il migliore della serie. Tuttavia, il modello più grande ‘showcase’ Davinci non è disponibile per il fine-tuning che comprende la fase successiva degli esperimenti dei ricercatori.
† La mia conversione delle citazioni in linea in collegamenti ipertestuali.












