Modèles et plateformes d’IA
Comment le traitement du langage est amélioré grâce au modèle BERT open source de Google
Les représentations d’encodeur bidirectionnelles à partir de transformateurs, également connues sous le nom de BERT ; est un modèle d’entraînement qui a considérablement amélioré l’efficacité et l’effet des modèles de traitement du langage naturel. Maintenant que Google (GOOGL ) a rendu les modèles BERT open source, cela permet d’améliorer les modèles de traitement du langage naturel dans tous les secteurs. Dans cet article, nous examinons comment BERT transforme le traitement du langage naturel en l’une des solutions d’intelligence artificielle les plus puissantes et les plus utiles dans le monde d’aujourd’hui.
Application des modèles BERT à la recherche
Le moteur de recherche de Google est mondialement reconnu pour sa capacité à présenter du contenu pertinent et ils ont rendu ce programme de traitement du langage naturel open source pour le monde.
La capacité d’un système à lire et à interpréter le langage naturel devient de plus en plus vitale à mesure que le monde produit de nouvelles données de manière exponentielle. La bibliothèque de significations de mots, de phrases et la capacité générale de Google à présenter du contenu pertinent est OPEN SOURCE. Au-delà du traitement du langage naturel, son modèle BERT a la capacité d’extraire des informations à partir de grandes quantités de données non structurées et peut être appliqué pour créer des interfaces de recherche pour n’importe quelle bibliothèque. Dans cet article, nous allons voir comment cette technologie peut être appliquée dans le secteur de l’énergie.
BERT (Représentations d’encodeur bidirectionnelles à partir de transformateurs) est une approche de pré-entraînement proposée par le groupe Google AI Language, développé pour surmonter un problème courant des premiers modèles de traitement du langage naturel : le manque de données d’entraînement suffisantes.
Permettez-moi de vous expliquer, sans entrer dans les détails :
Entraînement des modèles
Les tâches de traitement du langage naturel de bas niveau (par exemple, la reconnaissance d’entités nommées, la segmentation de sujet) et de haut niveau (par exemple, l’analyse de sentiment, la reconnaissance de la parole) nécessitent des ensembles de données annotés spécifiques à la tâche. Bien qu’ils soient difficiles à obtenir et coûteux à assembler, les ensembles de données étiquetés jouent un rôle crucial dans les performances des modèles de réseau neuronal profond et peu profond. Des résultats d’inférence de haute qualité ne pouvaient être obtenus que lorsque des millions ou même des milliards d’exemples d’entraînement étiquetés étaient disponibles. Et c’était un problème qui rendait de nombreuses tâches de traitement du langage naturel inaccessibles. C’est jusqu’à ce que BERT soit développé.
BERT est un modèle de représentation de langage général, entraîné sur de grandes quantités de texte non annoté. Lorsque le modèle est exposé à de grandes quantités de contenu textuel, il apprend à comprendre le contexte et les relations entre les mots dans une phrase. Contrairement aux modèles d’apprentissage précédents qui ne représentaient que le sens au niveau du mot (banque signifierait la même chose dans « compte bancaire » et « rive herbeuse »), BERT prend réellement en compte le contexte. C’est-à-dire ce qui précède et suit le mot dans une phrase. Le contexte s’est avéré être une capacité manquante importante des modèles de traitement du langage naturel, avec un impact direct sur les performances du modèle. Concevoir un modèle sensible au contexte tel que BERT est considéré par beaucoup comme le début d’une nouvelle ère dans le traitement du langage naturel.
Entraîner BERT sur de grandes quantités de contenu textuel est une technique connue sous le nom de pré-entraînement. Cela signifie que les poids du modèle sont ajustés pour les tâches générales de compréhension du texte et que des modèles plus fins peuvent être construits sur celui-ci. Les auteurs ont prouvé la supériorité d’une telle technique lorsqu’ils ont employé des modèles basés sur BERT sur 11 tâches de traitement du langage naturel et ont obtenu des résultats à l’état de l’art.
Modèles pré-entraînés
La meilleure chose est : les modèles BERT pré-entraînés sont open source et accessibles au public. Cela signifie que n’importe qui peut aborder les tâches de traitement du langage naturel et construire ses modèles sur BERT. Rien ne peut battre cela, n’est-ce pas ? Oh, attendez : cela signifie également que les modèles de traitement du langage naturel peuvent maintenant être entraînés (affinés) sur des ensembles de données plus petits, sans avoir besoin de les entraîner à partir de zéro. Le début d’une nouvelle ère, en effet.
Ces modèles pré-entraînés aident les entreprises à réduire les coûts et le temps de déploiement pour les modèles de traitement du langage naturel à utiliser à l’interne ou à l’externe. L’efficacité des modèles de traitement du langage naturel bien entraînés est soulignée par Michael Alexis, PDG de l’entreprise de construction de la culture d’équipe virtuelle, teambuilding.com.
“Le plus grand avantage du traitement du langage naturel est l’inférence et le traitement scalables et constants de l’information.” – Michael Alexis, PDG de teambuilding.com
Michael explique comment le traitement du langage naturel peut être appliqué à des programmes de culture tels que les brise-glaces ou les enquêtes. Une entreprise peut acquérir des informations précieuses sur la façon dont la culture d’entreprise se déroule en analysant les réponses des employés. Cela est réalisé non seulement en analysant le texte, mais également en annotant le texte. En effet, le modèle « lit entre les lignes » pour tirer des conclusions sur l’émotion, le sentiment et l’orientation générale. BERT peut aider dans des situations comme celle-ci en pré-entraînant des modèles avec une base d’indicateurs qu’il peut utiliser pour découvrir les nuances du langage et fournir des informations plus précises.
Amélioration des requêtes
La capacité de modéliser le contexte a transformé BERT en un héros du traitement du langage naturel et a révolutionné la recherche Google elle-même. Voici une citation de l’équipe de produits de recherche Google et de leurs expériences de test, alors qu’ils ajustaient BERT pour comprendre l’intention derrière une requête.
“Voici quelques exemples qui démontrent la capacité de BERT à comprendre l’intention derrière votre recherche. Voici une recherche pour « 2019 brésilien voyageant aux États-Unis a besoin d’un visa ». Le mot « à » et sa relation avec les autres mots de la requête sont particulièrement importants pour comprendre le sens. Il s’agit d’un Brésilien voyageant aux États-Unis et non l’inverse. Auparavant, nos algorithmes ne comprenaient pas l’importance de cette connexion et nous retournions des résultats sur les citoyens américains voyageant au Brésil. Avec BERT, la recherche peut saisir cette nuance et savoir que le mot très courant « à » compte beaucoup ici, et nous pouvons fournir un résultat beaucoup plus pertinent pour cette requête.”
– Comprendre les recherches mieux que jamais, par Pandu Nayak, Google Fellow et Vice-Président de la Recherche.

Exemple de recherche BERT, avant et après. Source blog
Dans notre dernier article sur le traitement du langage naturel et la reconnaissance optique de caractères, nous avons illustré certaines utilisations du traitement du langage naturel dans le secteur immobilier. Nous avons également mentionné comment « les outils de traitement du langage naturel sont des outils d’extraction d’informations idéaux ». Examinons le secteur de l’énergie et voyons comment les technologies de traitement du langage naturel disruptives comme BERT permettent de nouvelles applications.
Les modèles de traitement du langage naturel peuvent extraire des informations à partir de grandes quantités de données non structurées
Une façon dont les modèles de traitement du langage naturel peuvent être utilisés est pour l’extraction d’informations critiques à partir de données textuelles non structurées. Les e-mails, les journaux, les notes, les journaux et les rapports sont tous des exemples de sources de données textuelles qui font partie des opérations quotidiennes des entreprises. Certains de ces documents peuvent s’avérer cruciaux dans les efforts des entreprises pour accroître l’efficacité opérationnelle et réduire les coûts.
Lorsque l’on vise à mettre en œuvre la maintenance prédictive des éoliennes, les rapports de défaillance peuvent contenir des informations critiques sur le comportement de différents composants. Mais comme les différents fabricants d’éoliennes ont des normes de collecte de données différentes (c’est-à-dire que les rapports de maintenance sont présentés dans différents formats et même langues), l’identification manuelle des éléments de données pertinents pourrait rapidement devenir coûteuse pour le propriétaire de l’usine. Les outils de traitement du langage naturel peuvent extraire des concepts, des attributs et des événements pertinents à partir de contenu non structuré. L’analyse de texte peut ensuite être employée pour trouver des corrélations et des modèles dans différentes sources de données. Cela donne aux propriétaires d’usine la possibilité de mettre en œuvre une maintenance prédictive basée sur des mesures quantitatives identifiées dans leurs rapports de défaillance.
Les modèles de traitement du langage naturel peuvent fournir des interfaces de recherche en langage naturel
De même, les géoscientifiques travaillant pour les compagnies pétrolières et gazières doivent généralement examiner de nombreux documents liés aux opérations de forage passées, aux journaux de puits et aux données sismiques. Puisque ces documents sont également présentés dans différents formats et sont généralement dispersés sur plusieurs emplacements (à la fois physiques et numériques), ils perdent beaucoup de temps à chercher les informations aux mauvaises places. Une solution viable dans un tel cas serait une interface de recherche basée sur le traitement du langage naturel, qui permettrait aux utilisateurs de rechercher des données en langage naturel. Ensuite, un modèle de traitement du langage naturel pourrait corréler les données à travers des centaines de documents et renvoyer un ensemble de réponses à la requête. Les travailleurs peuvent ensuite valider la sortie en fonction de leurs propres connaissances expertes et les commentaires amélioreront davantage le modèle.
Cependant, il existe également des considérations techniques pour le déploiement de tels modèles. Un aspect serait que le jargon spécifique à l’industrie peut confondre les modèles d’apprentissage traditionnels qui n’ont pas la compréhension sémantique appropriée. Deuxièmement, les performances du modèle peuvent être affectées par la taille de l’ensemble de données d’entraînement. C’est là que les modèles pré-entraînés comme BERT peuvent se révéler bénéfiques. Les représentations contextuelles peuvent modéliser le sens approprié du mot et éliminer toute confusion causée par les termes spécifiques à l’industrie. En utilisant des modèles pré-entraînés, il est possible de former le réseau sur des ensembles de données plus petits. Cela économise du temps, de l’énergie et des ressources qui auraient autrement été nécessaires pour l’entraînement à partir de zéro.
Et votre propre entreprise ?
Pouvez-vous penser à des tâches de traitement du langage naturel qui pourraient vous aider à réduire les coûts et à accroître l’efficacité opérationnelle ?
L’équipe de sciences des données de Blue Orange Digital est heureuse de personnaliser BERT pour votre bénéfice également !










