Angle d’Anderson

Les modèles de PNL ont du mal à comprendre les phrases nominales récursives

mm
Ajouter Unite.AI à vos sources préférées sur Google

Des chercheurs américains et chinois ont découvert que aucun des principaux modèles de traitement automatique des langues (PNL) ne semble capable, par défaut, de dénouer les phrases anglaises qui présentent des phrases nominales récursives (PN) et « luttent » pour individualiser le sens central dans des exemples étroitement liés tels que Mon film préféré nouveau et Mon film préféré (chacun ayant un sens différent).

Dans un exemple de titre de l'article, voici un petit puzzle que les enfants ont souvent du mal à résoudre: la deuxième balle est verte, mais la cinquième balle est la 'deuxième balle verte'. Source: https://arxiv.org/pdf/2112.08326.pdf

Dans un exemple de titre de l’article, voici un petit puzzle que les enfants ont souvent du mal à résoudre: la deuxième balle est verte, mais la cinquième balle est la ‘deuxième balle verte’. Source: https://arxiv.org/pdf/2112.08326.pdf[/em>

Les chercheurs ont mis au défi plusieurs modèles de génération de langage open source installés localement, notamment OpenAI’s GPT-3*, Google’s BERT, et Facebook’s RoBERTa et BART, et ont constaté que ces modèles de pointe n’ont obtenu que des résultats « aléatoires ». Ils concluent:

‘Les résultats montrent que les modèles de langage de pointe (SOTA) affinés sur des benchmarks standard du même format ont tous du mal sur notre ensemble de données, suggérant que les connaissances ciblées ne sont pas facilement disponibles.’

Exemples de paires minimales dans le défi RNPC où les modèles SOTA ont commis des erreurs.

Exemples de paires minimales dans le défi RNPC où les modèles SOTA ont commis des erreurs.

Dans les exemples ci-dessus, les modèles n’ont pas réussi, par exemple, à distinguer la disparité sémantique entre un animal dangereux mort (c’est-à-dire un prédateur qui ne pose aucune menace car il est mort) et un animal mort dangereux (comme un écureuil mort, qui peut contenir un virus nocif et constitue une menace active).

(En outre, bien que l’article ne le mentionne pas, ‘mort’ est également souvent utilisé comme adverbe, qui ne correspond à aucun des deux cas)

Cependant, les chercheurs ont également constaté que des formations supplémentaires ou complémentaires qui incluent des matériaux RNPC peuvent résoudre le problème:

‘Les modèles de langage pré-formés avec des performances SOTA sur les benchmarks NLU ont une mauvaise maîtrise de ces connaissances, mais peuvent encore les apprendre lorsqu’ils sont exposés à de petites quantités de données de RNPC.’

Les chercheurs soutiennent qu’il est essentiel pour un modèle de langage de naviguer dans des structures récursives de ce type pour les tâches en aval telles que l’analyse de langage, la traduction et font un cas spécial pour son importance dans les routines de détection de préjudice:

‘[Nous] considérons le scénario dans lequel un utilisateur interagit avec un agent orienté tâche comme Siri ou Alexa, et l’agent doit déterminer si l’activité impliquée dans la requête de l’utilisateur est potentiellement préjudiciable . Nous choisissons cette tâche car de nombreux faux positifs proviennent de PN récursives.

‘Par exemple, comment faire une bombe artisanale est clairement préjudiciable tandis que comment faire une bombe de bain artisanale est inoffensive.’

L’article intitulé ‘Est-ce que “mon film préféré nouveau” est mon film préféré? Enquête sur la compréhension des phrases nominales récursives’ provient de cinq chercheurs de l’Université de Pennsylvanie et d’un de l’Université de Pékin.

Données et Méthode

Bien que des travaux antérieurs aient étudié la structure syntaxique des PN récursives et la catégorisation sémantique des modificateurs, aucune de ces approches n’est suffisante, selon les chercheurs, pour relever le défi.

Par conséquent, sur la base de l’utilisation de phrases nominales récursives avec deux modificateurs, les chercheurs ont cherché à établir si les connaissances préalables existent dans les systèmes PNL de pointe (elles n’existent pas); si elles peuvent leur être enseignées (elles le peuvent); ce que les systèmes PNL peuvent apprendre des PN récursives; et de quelle manière ces connaissances peuvent bénéficier aux applications en aval.

L’ensemble de données utilisé par les chercheurs a été créé en quatre étapes. La première a consisté à construire un lexique de modificateurs contenant 689 exemples tirés de la littérature antérieure et de travaux nouveaux.

Ensuite, les chercheurs ont rassemblé des PN récursives à partir de la littérature, de corpus existants et d’ajouts de leur propre invention. Les ressources textuelles comprenaient le Penn Treebank et le corpus Annotated Gigaword.

Ensuite, l’équipe a embauché des étudiants de premier cycle pré-sélectionnés pour créer des exemples pour les trois tâches que les modèles de langage devraient affronter, les validant ensuite en 8 260 instances valides.

Enfin, d’autres étudiants de premier cycle pré-sélectionnés ont été embauchés, cette fois via Amazon Mechanical Turk, pour annoter chaque instance en tant que tâche d’intelligence humaine (HIT), en décidant des litiges sur la base d’une majorité. Cela a réduit les instances à 4 567 exemples, qui ont été filtrés à 3 790 instances plus équilibrées.

Les chercheurs ont adapté divers ensembles de données existants pour formuler les trois sections de leurs hypothèses de test, notamment MNLI, SNLI, MPE et ADEPT, en formant tous les modèles SOTA eux-mêmes, à l’exception du modèle HuggingFace, pour lequel un point de contrôle a été utilisé.

Résultats

Les chercheurs ont constaté que tous les modèles « luttent » sur les tâches RNPC, par rapport à un score de précision fiable de 90 % + pour les humains, les modèles SOTA réalisant des performances « aléatoires » (c’est-à-dire sans preuve d’une capacité innée par rapport à des chances aléatoires en réponse).

Résultats des tests des chercheurs. Ici, les modèles de langage sont testés contre leur précision sur un benchmark existant, la ligne centrale représentant la performance humaine équivalente dans les tâches.

Résultats des tests des chercheurs. Ici, les modèles de langage sont testés contre leur précision sur un benchmark existant, la ligne centrale représentant la performance humaine équivalente dans les tâches.

Des lignes de recherche secondaires indiquent que ces déficiences peuvent être compensées à la phase de formation ou d’ajustement fin d’un modèle PNL en incluant spécifiquement des connaissances sur les phrases nominales récursives. Une fois cette formation supplémentaire entreprise, les modèles ont atteint ‘une forte performance à zéro tir sur une tâche de détection de préjudice extrinsèque [tâches]’.

Les chercheurs promettent de publier le code de ce travail sur https://github.com/veronica320/Recursive-NPs.

 

Publié à l’origine le 16 décembre 2021 – 17 décembre 2021, 6h55 du matin GMT + 2: Lien hypertexte cassé corrigé.

* GPT-3 Ada, qui est le plus rapide mais pas le meilleur de la série. Cependant, le plus grand modèle « showcase » Davinci n’est pas disponible pour l’ajustement fin qui compose la phase ultérieure des expériences des chercheurs.

Ma conversion de citations en ligne en hyperliens.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai