Modèles et plateformes d’IA

Le mur de GPU se fissure : La révolution invisible dans les architectures post-Transformers

mm
Ajouter Unite.AI à vos sources préférées sur Google

Pendant les cinq dernières années, l’industrie de l’intelligence artificielle a été effectivement synonyme d’un seul mot : Transformer. Depuis la publication de l’article fondateur “Attention Is All You Need” en 2017, cette architecture a dominé le domaine. De GPT à Claude, virtuellement tous les modèles qui font les gros titres reposent sur le même mécanisme sous-jacent d’auto-attention. Nous avons largement supposé que le chemin vers une meilleure intelligence artificielle est simplement une question d’échelle. Dans la pratique, cela signifie former des Transformers plus grands avec plus de données sur des clusters de GPU plus importants.

Alors que cette croyance a conduit à de nombreuses avancées, elle atteint maintenant ses limites. Nous heurtons un “mur de GPU”, une barrière non seulement de puissance de calcul brute, mais également de bande passante de mémoire et de durabilité économique. Alors que le monde se concentre sur la course aux modèles à un trillion de paramètres, un changement radical se produit dans les laboratoires de recherche. Une nouvelle vague d’architectures “post-Transformers” émerge pour briser les limitations du paradigme actuel. Ce changement promet de rendre l’intelligence artificielle plus efficace, accessible et capable de raisonnement sur des contextes infinis.

Le plafond de silicium : Pourquoi les Transformers heurtent un mur

Pour comprendre pourquoi nous avons besoin d’un changement, nous devons d’abord comprendre le goulet d’étranglement du régime actuel. Les Transformers sont incroyablement puissants, mais ils sont également remarquablement inefficaces de certaines manières. Le cœur de leur capacité réside dans le “mécanisme d’attention”, qui permet au modèle de regarder chaque jeton dans une séquence et de calculer sa relation avec chaque autre jeton. C’est ce qui leur donne la capacité de comprendre le contexte de manière remarquable.

Cependant, cette capacité est assortie d’un défaut fatal de croissance quadratique. Si vous doublez la longueur du document que vous voulez que l’IA lise, le travail de calcul requis ne double pas simplement, il quadruple. Alors que nous visons des modèles de “contexte infini” qui peuvent lire des bibliothèques ou des bases de code entières, les exigences de calcul deviennent extrêmement élevées.

Mais le problème plus immédiat est la mémoire, en particulier le “KV Cache” (Cache de clés-valeurs). Pour générer du texte de manière fluide, un Transformer doit conserver une histoire en cours de tout ce qu’il a dit dans la mémoire haute vitesse de la GPU (VRAM). Alors que la conversation s’allonge, ce cache gonfle, consommant d’énormes quantités de mémoire pour se souvenir de ce qui s’est passé il y a trois paragraphes.

Cela crée le “mur de GPU”. Nous ne manquons pas seulement de puces ; nous manquons de bande passante de mémoire pour les alimenter. Nous avons construit des moteurs qui deviennent de plus en plus grands, mais ils deviennent impossibles à alimenter. Pendant longtemps, la solution de l’industrie a été simplement d’acheter plus de NVIDIA H100 (NVDA ). Mais cette force brute atteint un point de rendement décroissant. Nous n’avons pas besoin d’un moteur qui consomme du carburant de manière quadratique, mais d’une nouvelle architecture.

La révolution invisible

Alors que la recherche mainstream s’est concentrée sur les LLM, un groupe de chercheurs a revisité une ancienne idée : les Réseaux de neurones récurrents (RNN). Avant les Transformers, les RNN étaient la norme pour le langage. Ils traitaient le texte de manière séquentielle, mot par mot, en mettant à jour un état interne “caché” à mesure qu’ils progressaient. Ils étaient incroyablement efficaces car ils n’avaient pas besoin de regarder en arrière sur l’histoire entière ; ils portaient simplement l'”essence” de celle-ci dans leur mémoire.

Les RNN ont échoué car ils ne pouvaient pas gérer les dépendances longues ; ils “oubliaient” le début d’une phrase lorsqu’ils atteignaient la fin. Ils étaient également lents à former car vous ne pouviez pas les paralléliser. Cela signifie que vous deviez traiter le mot A avant de pouvoir traiter le mot B. Les Transformers ont résolu ce problème en traitant tout en même temps (parallélisation) et en conservant tout en mémoire (attention).

Nous assistons maintenant à l’émergence d’architectures qui combinent le meilleur des deux mondes. Ces architectures sont connues sous le nom de Modèles d’espace d’état (SSM). Ils offrent la vitesse de formation des Transformers (parallélisable) mais l’efficacité d’inférence des RNN (scalage linéaire).

L’une des architectures émergentes de cette nouvelle vague est Mamba. Publiée à la fin de 2023 et affinée tout au long de 2024, Mamba est un changement fondamental dans la façon dont les modèles traitent les informations. Contrairement à un Transformer, qui conserve une copie originale de chaque mot qu’il a jamais vu dans son tampon de mémoire, Mamba utilise un “espace d’état sélectif”.

Nous pouvons comprendre la différence entre Transformer et Mamba en imaginant un Transformer comme un érudit qui garde chaque livre qu’il a jamais lu ouvert sur un énorme bureau, en regardant constamment en arrière pour trouver des connexions. Mamba, en revanche, est un érudit qui lit le livre une fois et comprime les connaissances clés dans un cahier très efficace. Lorsque Mamba génère le mot suivant, il n’a pas besoin de regarder en arrière le texte brut ; il regarde son état compressé.

Cette distinction change l’économie du déploiement de l’IA. Avec Mamba et des architectures similaires comme RWKV (Receptance Weighted Key Value), le coût de la génération de texte n’explose pas à mesure que la séquence s’allonge. Vous pouvez théoriquement alimenter ces modèles avec un million de mots de contexte, et le coût de calcul pour générer le prochain jeton reste le même que si vous aviez alimenté dix mots.

Le retour de la récurrence

La percée technique derrière Mamba est la “sélectivité”. Les tentatives précédentes pour moderniser les RNN ont échoué car elles étaient trop rigides. Elles compressaient les informations de manière égale, indépendamment de leur importance ou du bruit. Mamba introduit un mécanisme qui permet au modèle de décider dynamiquement ce qu’il doit retenir et ce qu’il doit oublier à mesure qu’il traite les données.

Si le modèle reçoit une information importante, comme une définition de variable dans un bloc de code, il “ouvre la porte” et l’inscrit fortement dans son état. Si il est confronté à des mots de remplissage ou à un bruit non pertinent, il ferme la porte, préservant sa capacité de mémoire limitée pour ce qui compte.

Cette sélectivité résout effectivement le problème de “oubli” qui a défié les anciens RNN. Dans de nombreux tests, les modèles basés sur Mamba égalent les performances des Transformers de la même taille mais fonctionnent jusqu’à cinq fois plus vite pendant l’inférence. Plus important encore, leur empreinte mémoire est nettement plus petite. Cela ouvre la porte à des LLM de haute performance qui peuvent fonctionner sur des appareils qui étaient auparavant considérés comme incapables de les gérer, tels que des ordinateurs portables, des réseaux de calcul de bord ou même des smartphones, sans décharger vers le cloud.

Nous assistons également à l’émergence de Hyena, une autre architecture sous-quadratique qui utilise des convolutions longues pour traiter les données. Comme Mamba, Hyena vise à supprimer les lourdes couches d’attention du Transformer et à les remplacer par des opérations mathématiques beaucoup moins coûteuses pour le matériel. Ces modèles ont maintenant commencé à défier les Transformers établis sur les principaux tableaux de bord.

L’émergence des hybrides

La révolution, cependant, peut ne pas être un remplacement complet du Transformer, mais plutôt une évolution vers des formes hybrides. Nous voyons déjà l’émergence de modèles comme Jamba (d’AI21 Labs), qui combine des couches de Transformer avec des couches de Mamba.

Cette approche hybride offre un moyen pratique de résoudre les limitations des Transformers. Les Transformers restent exceptionnellement forts pour certaines tâches, en particulier pour copier des détails précis du contexte. En mélangeant des couches de Mamba (qui gèrent la majeure partie du traitement des données et de la mémoire à long terme) avec quelques couches d’attention de Transformer (qui gèrent le raisonnement aigu et immédiat), nous obtenons un modèle qui combine le meilleur des deux mondes.

Un modèle hybride crée une fenêtre de contexte massive qui est réellement utilisable. Actuellement, de nombreux “longs contextes” de Transformers prétendent gérer 100 000 jetons, mais leurs performances se dégradent rapidement à mesure que le contexte se remplit. Ce phénomène est connu sous le nom de “perdu dans le milieu“. L’architecture hybride maintient sa cohérence beaucoup mieux sur de longues distances car les couches SSM sont spécifiquement conçues pour compresser et transporter l’état dans le temps.

Ces développements déplacent le focus de l’industrie de “Calcul de formation” (quelle taille de cluster ai-je besoin pour construire le modèle ?) à “Économie d’inférence” (à quel point puis-je servir ce modèle à un milliard d’utilisateurs à moindre coût ?). Si un modèle hybride peut servir un utilisateur pour 10 % du coût d’un Transformer, le cas d’affaires pour les applications d’IA change du jour au lendemain.

Le futur du déploiement de l’IA

Les implications de cette révolution post-Transformer ne sont pas limitées au centre de données. Le mur de GPU a historiquement servi de gardien, garantissant que seuls les plus grands géants de la technologie avec des milliards de dollars en matériel puissent construire et exécuter des modèles de pointe. Les architectures efficaces comme Mamba et RWKV démocratisent ce pouvoir. Si vous pouvez exécuter un modèle de niveau GPT-4 sur une carte de consommation parce que vous n’avez plus besoin de teraoctets de VRAM pour le cache de clés-valeurs, le contrôle centralisé de l’IA commence à se desserrer. Nous pourrions voir un regain d’agents d’IA locaux et privés qui vivent entièrement sur votre ordinateur, traitant vos données privées sans jamais envoyer de paquet au cloud.

En outre, cette efficacité est la clé pour débloquer les systèmes d’IA “Agentic AI” qui fonctionnent en arrière-plan pendant des heures ou des jours pour effectuer des tâches complexes. Les Transformers actuels sont trop coûteux et lents pour fonctionner en boucles continues pendant de longues périodes. Une architecture efficace et linéaire peut “réfléchir” et traiter les boucles en continu sans banquer le utilisateur ou surchauffer le matériel.

Le bilan

Le Transformer a dominé les gros titres de l’IA, mais derrière la scène, une révolution silencieuse est en cours. Le mur de GPU pousse les chercheurs à repenser la façon dont les modèles gèrent la mémoire et le calcul. Les architectures post-Transformers comme Mamba et les modèles hybrides prouvent que l’efficacité, et non seulement l’échelle, définira la prochaine ère. Ces innovations rendent les fenêtres de contexte massives pratiques, l’inférence moins coûteuse et l’IA avancée accessible au-delà des centres de données. Le futur de l’IA ne réside pas dans des modèles plus grands, mais dans des modèles plus intelligents qui se souviennent, raisonnent et évoluent de manière efficace.

Dr. Tehseen Zia est un professeur associé titulaire à l'Université COMSATS d'Islamabad, titulaire d'un doctorat en intelligence artificielle de l'Université technique de Vienne, en Autriche. Spécialisé en intelligence artificielle, apprentissage automatique, science des données et vision par ordinateur, il a apporté des contributions significatives avec des publications dans des revues scientifiques réputées. Dr. Tehseen a également dirigé divers projets industriels en tant que chercheur principal et a servi en tant que consultant en intelligence artificielle.