Fondamentaux de l’IA

Qu’est‑ce que les réseaux neuronaux Transformer ?

mm
Ajouter Unite.AI à vos sources préférées sur Google

Un transformer est une architecture de réseau neuronal qui traite les relations entre les jetons à l’aide de l’attention. Contrairement à un réseau récurrent qui doit transmettre un état caché d’une position à la suivante, un transformer peut calculer de nombreuses interactions jeton‑à‑jeton en parallèle pendant l’entraînement.

Les transformers alimentent de nombreux systèmes de langage, de vision, d’audio et multimodaux, mais l’architecture n’est ni une base de données ni une garantie de raisonnement. Ses sorties restent des prédictions conditionnées par les paramètres appris, le contexte fourni et la procédure de décodage.

Points clés

  • L’auto‑attention permet à chaque jeton de construire une représentation dépendante du contexte à partir des autres jetons autorisés.
  • Des informations de position sont ajoutées car l’attention seule n’encodage pas l’ordre des jetons.
  • Les transformers encodeur‑seul, décodeur‑seul et encodeur‑décodeur répondent à des objectifs différents.
  • La longueur du contexte, le calcul, les données d’entraînement et l’évaluation — et non l’attention seule — façonnent la capacité et la fiabilité.
What Are Transformer Neural Networks? diagram showing tokens, embed + position, self-attention, feed-forward, stack blocks, output
L’attention construit des représentations contextuelles ; les masques et les objectifs déterminent quelles informations sont disponibles.

Jetons, embeddings et position

Le texte est d’abord découpé en jetons, qui peuvent être des mots, des sous‑mots ou des caractères. Chaque ID de jeton sélectionne un vecteur d’embedding appris. Un transformer de vision peut, quant à lui, intégrer des patches d’image ; un transformer audio peut intégrer des trames ou des unités acoustiques apprises.

Comme une opération d’attention pure est équivariante à la permutation, le modèle a besoin d’informations de position. Les implémentations peuvent ajouter des encodages positionnels appris ou fixes, ou modifier les scores d’attention avec des schémas de position relative ou rotative. Le résultat combine ce qu’est un jeton avec l’endroit où il apparaît.

Produit scalaire à échelle et attention multi‑têtes

Pour chaque position, des projections apprises créent une requête, une clé et une valeur. La similarité entre une requête et les clés autorisées génère des poids d’attention ; leurs valeurs pondérées forment la sortie. Mettre à l’échelle le produit scalaire aide à maintenir le softmax numériquement stable lorsque la dimension du vecteur augmente.

L’attention multi‑têtes répète cette opération dans plusieurs sous‑espaces appris. Des têtes différentes peuvent se spécialiser dans différentes relations, bien qu’un schéma d’attention visuellement attrayant ne doive pas être automatiquement considéré comme une explication fidèle de la décision du modèle.

Le bloc transformer

Une sous‑couche d’attention est suivie d’un réseau feed‑forward positionnel. Les connexions résiduelles transportent les représentations antérieures autour de chaque sous‑couche, tandis que la normalisation et la régularisation favorisent l’optimisation. Empiler de nombreux blocs crée des caractéristiques de plus en plus contextuelles grâce au deep learning.

Lors d’une génération causale, un masque empêche une position de lire les jetons futurs. En phase d’inférence, un décodeur prédit un jeton, l’ajoute, puis répète l’opération. Un cache clé‑valeur évite de recomputer chaque projection d’attention antérieure, réduisant ainsi le coût de génération sans l’éliminer complètement.

Familles encodeur, décodeur et encodeur‑décodeur

Les modèles encodeur‑seul apprennent des représentations bidirectionnelles adaptées à la classification, à la recherche et à l’étiquetage de jetons. Les modèles décodeur‑seul utilisent l’attention causale pour la génération du jeton suivant. Les modèles encodeur‑décodeur permettent à un décodeur d’attendre une entrée encodée, ce qui est utile pour la traduction et d’autres tâches séquence‑à‑séquence.

Les systèmes modernes commencent souvent par un pré‑entraînement large, puis utilisent le transfer learning, le réglage d’instructions ou l’optimisation de préférence. La même architecture peut ainsi soutenir des comportements très différents selon son objectif et ses données.

Limites, efficacité et évaluation

L’attention complète sur une séquence implique des interactions paires quadratiques en fonction de la longueur de la séquence, créant une pression sur la mémoire et le calcul. L’attention parcimonieuse ou linéaire, le découpage en blocs, la récupération, la quantification et la mise en cache échangent précision, accès au contexte, latence et complexité d’implémentation.

Une fenêtre de contexte plus grande ne garantit pas que chaque fait fourni sera utilisé correctement. Évaluez la factualité, la robustesse, la calibration, la latence, le coût et les modes d’échec spécifiques à la tâche. Pour les systèmes interactifs, le prompt engineering peut façonner le comportement, mais il ne peut pas transformer un modèle probabiliste en une source infaillible.

Calcul du transformer des jetons au contexte

Un transformer mappe les jetons vers des vecteurs, ajoute des informations positionnelles et les fait passer à travers des blocs d’attention et de feed‑forward répétés. En auto‑attention, les projections apprises créent des requêtes, des clés et des valeurs. Les produits scalaires à échelle comparent chaque requête aux clés, un softmax génère des poids, et les valeurs pondérées forment le contexte. Plusieurs têtes apprennent différents espaces de projection. Les connexions résiduelles et la normalisation stabilisent les piles profondes, tandis que le réseau feed‑forward transforme chaque jeton indépendamment entre les couches d’attention.

Les modèles encodeur‑seul utilisent un contexte bidirectionnel et conviennent aux tâches de classification ou de représentation. Les modèles décodeur‑seul appliquent un masque causal afin que chaque position prévoie à partir des jetons précédents et dominent la modélisation générative du langage. Les modèles encodeur‑décodeur permettent à un décodeur d’attendre une entrée encodée pour la traduction et la génération structurée. Le coût de l’attention croît de façon quadratique avec la longueur de la séquence dans la forme standard, ce qui incite à des alternatives parcimonieuses, linéaires, découpées, récurrentes et à espace d’état. Un contexte plus long augmente les preuves disponibles, sans garantir le rappel ou le raisonnement.

Entraînement, adaptation et inférence

Les objectifs de pré‑entraînement comprennent la prédiction du jeton suivant, la reconstruction de jetons masqués et la corruption séquence‑à‑séquence. Le mélange de données, la déduplication, le tokenizer, l’empaquetage du contexte, l’optimiseur, le planning et la puissance de calcul façonnent les capacités. Le fine‑tuning peut mettre à jour tous les paramètres ou utiliser des adaptateurs et des méthodes à faible rang ; le réglage d’instructions et de préférences modifie le comportement. La récupération est souvent meilleure pour les faits qui évoluent, tandis que le tuning est utile pour le format et le comportement de tâche. Conservez un jeu d’évaluation intact et testez la contamination provenant de benchmarks publics.

L’inférence autorégressive stocke les projections clé‑valeur des jetons précédents afin d’éviter la recomputation. La latence dépend du traitement du prompt et du décodage séquentiel ; le débit dépend du batching, de la mémoire, de la gestion du cache, de la précision et du matériel. Les méthodes gloutonnes, à température, top‑k, top‑p et à faisceau échangent déterminisme et diversité. La quantification réduit la mémoire mais peut affecter les capacités rares. Validez le modèle déployé exact, le tokenizer, le modèle de prompt, le sampler et le runtime à des longueurs de séquence réalistes.

Évaluation et contrôles

Les transformers peuvent halluciner, suivre des instructions récupérées malveillantes, exposer des données mémorisées ou se dégrader selon les langues et les longs contextes. Évaluez le succès de la tâche, le soutien factuel, la calibration, le refus, la robustesse, la sécurité, la latence et le coût ; inspectez séparément les preuves et les actions des outils. Utilisez une récupération consciente des permissions, des outils typés, une autorisation externe, des limites de taux et une approbation humaine pour les actions à conséquences. Surveillez les versions du modèle et du prompt, la distribution des entrées, les erreurs d’outil et les corrections des utilisateurs. Un transformer est une architecture de calcul séquentiel, pas une preuve de compréhension ni une garantie de sortie véridique.

Exemple pratique : un assistant documentaire basé sur un transformer

Une entreprise indexe les manuels approuvés avec un ID de document, une version, une section, des permissions et une date d’entrée en vigueur. Un assistant basé sur un transformer récupère et re‑classe les preuves, puis répond uniquement à partir des passages autorisés avec des citations. Le jeu d’évaluation comprend des questions répondables, non répondables, ambiguës et conflictuelles selon les rôles et les types de documents. Le rappel de récupération, la précision des citations, la justesse des réponses fondées, le refus, le comportement en contexte long, la latence et le coût sont notés séparément.

Les documents récupérés sont considérés comme des données non fiables, de sorte que les instructions intégrées ne peuvent pas outrepasser la politique du système ou autoriser des outils. Les utilisateurs s’authentifient avant la récupération, et les actions à conséquences restent hors du modèle. Les journaux conservent les ID et les versions des preuves sans le contenu documentaire inutile. La surveillance détecte les changements de corpus, les réponses non prises en charge, les erreurs de permission et les corrections des utilisateurs. Un changement de modèle ou de tokenizer est rejoué sur l’ensemble complet du jeu de test, et la configuration précédente reste disponible jusqu’à ce que le nouveau système démontre une sécurité et une qualité égales ou supérieures.

Preuves d’implémentation et préparation opérationnelle

Une décision de production nécessite plus qu’une démonstration réussie. Définissez les utilisateurs visés, l’environnement d’exploitation, les entrées, les sorties, les dépendances, le propriétaire et les conséquences de chaque défaillance importante. Établissez une base reproductible et un jeu d’évaluation versionné avant le réglage. Testez les cas ordinaires, les conditions limites, les entrées malformées ou manquantes, le changement de distribution, les pannes de dépendances, les abus, ainsi que les groupes ou environnements les plus susceptibles d’être sous‑servis. Mesurez la qualité de la tâche conjointement avec la calibration ou l’incertitude, la latence, le débit, le coût des ressources, l’accessibilité, la confidentialité et la sécurité. Enregistrez chaque transformation et seuil afin qu’un évaluateur indépendant puisse reproduire le résultat et distinguer les preuves d’un prototype attrayant.

Avant le lancement, attribuez l’autorité pour la mise en production, les exceptions, les modifications, le retour en arrière et la mise hors service. Utilisez un déploiement progressif, conservez une solution de secours sûre et vérifiez la surveillance avec des pannes injectées délibérément. La télémétrie opérationnelle doit révéler la qualité des entrées, le comportement des sorties, la version du modèle ou de la règle, l’état des dépendances, les interventions humaines et les résultats confirmés, sans collecter de données sensibles inutiles. Définissez les seuils d’alerte et le responsable de la réponse, puis examinez les preuves du monde réel après le déploiement plutôt que de supposer que la performance hors ligne persistera. Réévaluez chaque fois que les sources de données, les utilisateurs, les modèles, les fournisseurs, les politiques, le matériel ou les objectifs changent. Un système maintenu nécessite également des procédures documentées de récupération, d’apprentissage des incidents, de suppression et de conservation, ainsi qu’un point clair où il doit être désactivé ou remplacé.

Foire aux questions

Chaque grand modèle de langage est‑il un transformer ?

La plupart des grands modèles de langage actuels utilisent des variantes de transformer, mais les modèles de langage peuvent être construits avec des architectures récurrentes, à espace d’état ou hybrides.

L’auto‑attention signifie‑t‑elle qu’un modèle comprend le texte comme une personne ?

Non. L’attention est un mécanisme de pondération appris. Un comportement linguistique semblable à celui d’un humain ne constitue pas, à lui seul, une compréhension, une véracité ou une intention humaines.

Références principales

Blogueur et programmeur avec des spécialités en Machine Learning et Deep Learning sujets. Daniel espère aider les autres à utiliser le pouvoir de l'IA pour le bien social.