Angle d’Anderson

Pourquoi le langage historique est un défi pour l’intelligence artificielle

mm
Ajouter Unite.AI à vos sources préférées sur Google

L’un des défis centraux des systèmes de traitement automatique du langage (NLP) est de dériver des connaissances essentielles à partir d’une grande variété de documents écrits. Les sources contribuant à un jeu de données d’entraînement pour un nouvel algorithme NLP pourraient être aussi diverses sur le plan linguistique que Twitter, les journaux et les revues scientifiques, avec toutes les excentricités propres à chacune de ces trois sources.

La plupart du temps, cela ne s’applique qu’à l’anglais; et cela ne s’applique qu’aux sources de texte actuelles ou récentes. Lorsqu’un algorithme NLP doit prendre en compte des documents provenant de plusieurs époques, il éprouve généralement des difficultés à concilier les manières très différentes dont les gens parlent ou écrivent à travers les communautés nationales et sous-nationales, et en particulier à travers différentes périodes de l’histoire.

Cependant, utiliser des données textuelles (telles que des traités historiques et des œuvres scientifiques anciennes) qui s’étendent sur plusieurs époques est une méthode potentiellement utile pour générer une vue d’ensemble historique d’un sujet et pour formuler des reconstructions de chronologie statistique qui précèdent l’adoption et la maintenance de mesures pour un domaine.

Par exemple, les informations météorologiques contribuant aux modèles d’intelligence artificielle prédictifs de changement climatique n’ont pas été enregistrées de manière adéquate dans le monde entier jusqu’en 1880, tandis que l’exploitation de textes classiques offre des enregistrements plus anciens d’événements météorologiques majeurs qui pourraient être utiles pour fournir des données météorologiques pré-victoriennes.

Désalignement temporel

Un nouvel article de l’Université de Washington et de l’Institut Allen pour l’IA a constaté que même une période aussi courte que cinq ans peut causer un désalignement temporel qui peut compromettre l’utilité d’un modèle NLP pré-entraîné.

Dans tous les cas, les scores plus élevés sont meilleurs. Ici, nous voyons une carte de chaleur de dégradation temporelle sur quatre corpus de texte s'étendant sur une période de cinq ans. De tels écarts entre les données d'entraînement et d'évaluation, selon les auteurs de l'article, peuvent causer une 'baisse de performance massive'. Source: https://arxiv.org/pdf/2111.07408.pdf

Dans tous les cas, les scores plus élevés sont meilleurs. Ici, nous voyons une carte de chaleur de dégradation temporelle sur quatre corpus de texte s’étendant sur une période de cinq ans. De tels écarts entre les données d’entraînement et d’évaluation, selon les auteurs de l’article, peuvent causer une ‘baisse de performance massive’. Source: https://arxiv.org/pdf/2111.07408.pdf

L’article indique:

‘Nous constatons que le désalignement temporel affecte à la fois la généralisation du modèle de langage et la performance de la tâche. Nous constatons une variation considérable de dégradation à travers les domaines de texte et les tâches. Sur 5 ans, les scores F1 des classificateurs peuvent se dégrader autant que 40 points (affiliation politique sur Twitter) ou aussi peu que 1 point (notations de Yelp). Deux tâches distinctes définies sur le même domaine peuvent montrer des niveaux de dégradation différents au fil du temps.’

Partages inégaux

Le problème fondamental est que les jeux de données sont généralement divisés en deux groupes, parfois à un ratio de 80/20 assez déséquilibré, en raison de la disponibilité limitée des données. Le plus grand groupe de données est entraîné sur un réseau neuronal, tandis que les données restantes sont utilisées comme groupe de contrôle pour tester la précision de l’algorithme résultant.

Dans les jeux de données mixtes contenant des documents qui s’étendent sur plusieurs années, une répartition inégale des données de différentes périodes pourrait signifier que les données d’évaluation sont composées de manière disproportionnée de documents d’une époque particulière.

Cela entraînera une mauvaise base de test pour un modèle entraîné sur un mélange plus diversifié de périodes (c’est-à-dire sur la plupart des données disponibles). En effet, selon que les données d’évaluation minoritaires surestiment les documents plus récents ou plus anciens, c’est comme demander à votre grand-père d’évaluer les derniers idoles K-Pop.

La solution de contournement à long terme consisterait à entraîner plusieurs modèles sur des jeux de données plus restreints dans le temps et à essayer de combiner des fonctionnalités compatibles à partir des résultats de chaque modèle. Cependant, les pratiques d’initialisation aléatoire de modèle se heurtent à leur propre ensemble de problèmes pour atteindre la parité et l’équité entre les modèles, même avant de considérer si les jeux de données multiples contribuant étaient suffisamment similaires les uns aux autres pour rendre l’expérience significative.

Données et formation

Pour évaluer le désalignement temporel, les auteurs ont entraîné quatre corpus de texte sur quatre domaines:

Twitter
…où ils ont collecté des données non étiquetées en extrayant une sélection aléatoire de 12 millions de tweets uniformément répartis entre 2015-2020, où les auteurs ont étudié les entités nommées (c’est-à-dire les personnes et les organisations) et les affiliations politiques.

Articles scientifiques
…où les auteurs ont obtenu des données non étiquetées à partir du corpus Semantic Scholar, constituant 650 000 documents s’étendant sur une période de 30 ans, et sur lesquels ils ont étudié la classification des types de mention (SciERC) et la classification de la salle de conférence IA (AIC, qui distingue si un article a été publié dans AAAI ou ICML).

Articles de presse
…où les auteurs ont utilisé neuf millions d’articles à partir du jeu de données Newsroom s’étendant sur une période de 2009-2016, sur lesquels ils ont effectué trois tâches: la synthèse de la salle de presse, la classification de l’éditeur et la classification des cadres médiatiques (MFC), qui examine la priorisation perçue de divers sujets dans la production médiatique.

Avis sur la nourriture
…où les chercheurs ont utilisé le jeu de données ouvert Yelp sur une tâche unique: la classification des notes d’examen (YELPCLS), un défi d’analyse de sentiment typique de beaucoup de recherches en NLP dans ce secteur.

Résultats

Les modèles ont été évalués sur GPT-2, avec une gamme de scores F1 résultants. Les auteurs ont constaté que la perte de performance due au désalignement temporel est bidirectionnelle, ce qui signifie que les modèles entraînés sur des données récentes peuvent être défavorisés par l’influence de données plus anciennes, et vice versa (voir l’image au début de l’article pour les graphiques). Les auteurs notent que cela a des implications particulières pour les applications des sciences sociales.

En général, les résultats montrent que le désalignement temporel dégrade la perte de performance ‘de manière substantielle’, et a un effet large sur la plupart des tâches. Les jeux de données qui couvrent de très longues périodes, telles que des décennies, exacerbent naturellement le problème.

Les auteurs observent en outre que le désalignement temporel affecte également les données pré-entraînées étiquetées et non étiquetées. De plus, leurs tentatives pour atténuer les effets via l’adaptation de domaine (voir ci-dessous) n’ont pas amélioré de manière significative la situation, même s’ils affirment que la fine-tuning des informations de données dans le jeu de données peut aider dans une certaine mesure.

Conclusion

Les chercheurs confirment les résultats antérieurs selon lesquels les remèdes précédemment suggérés impliquant l’adaptation de domaine (DAPT, où une allowance est conçue pour la disparité des données) et l’adaptation temporelle (où les données sont sélectionnées par période) font peu pour atténuer le problème.

L’article conclut*:

‘Nos expériences ont révélé une variation considérable de dégradation temporelle à travers les tâches, plus importante que celle trouvée dans des études précédentes. Ces résultats motivent une étude continue du désalignement temporel à travers les applications du NLP, sa prise en compte dans les évaluations de référence, et la vigilance de la part des praticiens capables de surveiller les performances du système en temps réel.

‘Notamment, nous avons observé que la formation continue des modèles de langage sur des données temporellement alignées n’a pas beaucoup d’effet, motivant une recherche plus approfondie pour trouver des méthodes d’adaptation temporelle efficaces qui soient moins coûteuses que la collecte continue de jeux de données étiquetés/annotés au fil du temps.’

Les auteurs suggèrent que des recherches plus approfondies sur l’apprentissage continu, où les données sont constamment mises à jour, pourraient être utiles à cet égard, et que la dérive de concept, ainsi que d’autres méthodes de détection des changements de tâches, pourraient être un aide utile pour la mise à jour des jeux de données.

 

* Ma conversion des citations en ligne en hyperliens.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai