Modèles et plateformes d’IA
xLSTM : Un guide complet sur la mémoire à long terme étendue
Comprendre les origines : les limites de LSTM
Avant de plonger dans le monde de xLSTM, il est essentiel de comprendre les limitations que les architectures LSTM traditionnelles ont rencontrées. Ces limitations ont été le moteur du développement de xLSTM et d’autres approches alternatives.
- Incapacité à réviser les décisions de stockage : L’une des principales limitations de LSTM est sa lutte pour réviser les valeurs stockées lorsqu’un vecteur plus similaire est rencontré. Cela peut conduire à des performances sous-optimales dans les tâches qui nécessitent des mises à jour dynamiques des informations stockées.
- Capacités de stockage limitées : Les LSTM compressent les informations dans des états de cellule scalaires, ce qui peut limiter leur capacité à stocker et à récupérer efficacement des modèles de données complexes, en particulier lorsqu’il s’agit de jetons rares ou de dépendances à longue portée.
- Manque de parallélisation : Le mécanisme de mélange de mémoire dans les LSTM, qui implique des connexions cachées-cachées entre les étapes temporelles, impose un traitement séquentiel, entravant la parallélisation des calculs et limitant la mise à l’échelle.
Ces limitations ont ouvert la voie à l’émergence de transformateurs et d’autres architectures qui ont dépassé les LSTM dans certains aspects, en particulier lors de la mise à l’échelle à des modèles plus grands.
L’architecture xLSTM
Au cœur de xLSTM se trouvent deux modifications majeures de la structure LSTM traditionnelle : la gestion exponentielle et les structures de mémoire novatrices. Ces améliorations introduisent deux nouvelles variantes de LSTM, connues sous le nom de sLSTM (LSTM scalaire) et mLSTM (LSTM matriciel).
- sLSTM : Le LSTM scalaire avec gestion exponentielle et mélange de mémoire
- Gestion exponentielle : Le sLSTM intègre des fonctions d’activation exponentielles pour les portes d’entrée et de sortie, permettant un contrôle plus flexible du flux d’informations.
- Normalisation et stabilisation : Pour prévenir les instabilités numériques, le sLSTM introduit un état de normalisation qui suit le produit des portes d’entrée et des portes de sortie futures.
- Mélange de mémoire : Le sLSTM prend en charge plusieurs cellules de mémoire et permet un mélange de mémoire via des connexions récurrentes, permettant l’extraction de modèles complexes et la capacité de suivre les états.
- mLSTM : Le LSTM matriciel avec capacités de stockage améliorées
- Mémoire matricielle : Au lieu d’une cellule de mémoire scalaire, le mLSTM utilise une mémoire matricielle, augmentant sa capacité de stockage et permettant une récupération d’informations plus efficace.
- Règle de mise à jour de la covariance : Le mLSTM utilise une règle de mise à jour de la covariance, inspirée des mémoires associatives bidirectionnelles (BAM), pour stocker et récupérer des paires clé-valeur de manière efficace.
- Parallélisation : En abandonnant le mélange de mémoire, le mLSTM atteint une parallélisation complète, permettant des calculs efficaces sur les accélérateurs de matériel modernes.
Ces deux variantes, sLSTM et mLSTM, peuvent être intégrées dans des architectures de blocs résiduels, formant des blocs xLSTM. En empilant résiduellement ces blocs xLSTM, les chercheurs peuvent construire des architectures xLSTM puissantes adaptées à des tâches et des domaines d’application spécifiques.
Les mathématiques
LSTM traditionnel :
L’architecture LSTM originale a introduit le carrousel d’erreur constant et les mécanismes de gestion pour surmonter le problème du gradient qui disparaît dans les réseaux de neurones récurrents.

Le module répétitif dans un LSTM – Source
Les mises à jour de l’état de mémoire LSTM sont régies par les équations suivantes :
Mise à jour de l’état de cellule : ct = ft ⊙ ct-1 + it ⊙ zt
Mise à jour de l’état caché : ht = ot ⊙ tanh(ct)
Où :
- 𝑐𝑡 est le vecteur d’état de cellule au temps 𝑡
- 𝑓𝑡 est le vecteur de la porte de sortie
- 𝑖𝑡 est le vecteur de la porte d’entrée
- 𝑜𝑡 est le vecteur de la porte de sortie
- 𝑧𝑡 est l’entrée modulée par la porte d’entrée
- ⊙ représente la multiplication élément par élément
Les portes ft, it et ot contrôlent les informations qui sont stockées, oubliées et sorties de l’état de cellule ct, atténuant le problème du gradient qui disparaît.
xLSTM avec gestion exponentielle :
L’architecture xLSTM introduit la gestion exponentielle pour permettre un contrôle plus flexible du flux d’informations. Pour la variante xLSTM scalaire (sLSTM) :
Mise à jour de l’état de cellule : ct = ft ⊙ ct-1 + it ⊙ zt
Mise à jour de l’état de normalisation : nt = ft ⊙ nt-1 + it
Mise à jour de l’état caché : ht = ot ⊙ (ct / nt)
Portes d’entrée et de sortie : it = exp(W_i xt + R_i ht-1 + b_i) ft = σ(W_f xt + R_f ht-1 + b_f) OU ft = exp(W_f xt + R_f ht-1 + b_f)
Les fonctions d’activation exponentielles pour les portes d’entrée (it) et de sortie (ft), ainsi que l’état de normalisation nt, permettent un contrôle plus efficace des mises à jour de mémoire et la révision des informations stockées.
Caractéristiques clés et avantages de xLSTM
- Capacité à réviser les décisions de stockage : Grâce à la gestion exponentielle, xLSTM peut réviser efficacement les valeurs stockées lorsqu’il rencontre des informations plus pertinentes, surmontant une limitation majeure des LSTM traditionnels.
- Capacités de stockage améliorées : La mémoire matricielle dans mLSTM fournit une capacité de stockage accrue, permettant à xLSTM de gérer plus efficacement les jetons rares, les dépendances à longue portée et les modèles de données complexes.
- Parallélisation : La variante mLSTM de xLSTM est entièrement parallélisable, permettant des calculs efficaces sur les accélérateurs de matériel modernes, tels que les GPU, et permettant une mise à l’échelle à des modèles plus grands.
- Mélange de mémoire et suivi d’état : La variante sLSTM de xLSTM conserve les capacités de mélange de mémoire des LSTM traditionnels, permettant un suivi d’état et rendant xLSTM plus expressif que les transformateurs et les modèles d’espace d’état pour certaines tâches.
- Mise à l’échelle : En exploitant les dernières techniques des grands modèles de langage (LLM), xLSTM peut être mis à l’échelle à des milliards de paramètres, débloquant de nouvelles possibilités dans la modélisation de langage et le traitement de séquences.
Évaluation expérimentale : mettant en évidence les capacités de xLSTM
L’article de recherche présente une évaluation expérimentale complète de xLSTM, mettant en évidence ses performances sur diverses tâches et benchmarks. Voici quelques résultats clés :
- Tâches synthétiques et Long Range Arena :
- xLSTM excelle dans la résolution de tâches de langage formel qui nécessitent un suivi d’état, surpassant les transformateurs, les modèles d’espace d’état et d’autres architectures de RNN.
- Dans la tâche de rappel associatif multi-requêtes, xLSTM démontre des capacités de stockage améliorées, surpassant les modèles non-transformateurs et rivalisant avec les performances des transformateurs.
- Sur le benchmark Long Range Arena, xLSTM montre des performances solides et cohérentes, démontrant son efficacité dans la gestion de problèmes à longue portée.
- Modélisation de langage et tâches en aval :
- Lorsqu’il est formé sur 15 milliards de jetons du jeu de données SlimPajama, xLSTM surpasse les méthodes existantes, y compris les transformateurs, les modèles d’espace d’état et d’autres variantes de RNN, en termes de perplexité de validation.
- À mesure que les modèles sont mis à l’échelle à des tailles plus grandes, xLSTM maintient son avantage en termes de performance, démontrant un comportement de mise à l’échelle favorable.
- Dans les tâches en aval telles que la compréhension du sens commun et la réponse aux questions, xLSTM émerge comme la meilleure méthode sur diverses tailles de modèles, surpassant les approches de pointe.
- Performances sur les tâches de langage PALOMA :
- Évalué sur 571 domaines de texte du benchmark PALOMA, xLSTM[1:0] (la variante sLSTM) atteint des perplexités plus faibles que les autres méthodes dans 99,5 % des domaines par rapport à Mamba, 85,1 % par rapport à Llama et 99,8 % par rapport à RWKV-4.
- Lois de mise à l’échelle et extrapolation de longueur :
- Lorsqu’il est formé sur 300 milliards de jetons de SlimPajama, xLSTM montre des lois de mise à l’échelle favorables, indiquant son potentiel pour des améliorations de performance supplémentaires à mesure que les tailles de modèle augmentent.
- Dans les expériences d’extrapolation de longueur de séquence, les modèles xLSTM maintiennent des perplexités faibles même pour des contextes considérablement plus longs que ceux vus pendant la formation, surpassant les autres méthodes.
Ces résultats expérimentaux mettent en évidence les capacités remarquables de xLSTM, le positionnant comme un prétendant prometteur pour la modélisation de langage, le traitement de séquences et une large gamme d’autres applications.
Applications réelles et directions futures
Les applications potentielles de xLSTM s’étendent sur un large éventail de domaines, de la modélisation de langage et de la génération à la modélisation de séquences, à l’analyse de séries temporelles et au-delà. Voici quelques domaines excitants où xLSTM pourrait avoir un impact significatif :
- Modélisation de langage et génération de texte : Grâce à ses capacités de stockage améliorées et à sa capacité à réviser les informations stockées, xLSTM pourrait révolutionner la modélisation de langage et la génération de texte, permettant une génération de texte plus cohérent, plus sensible au contexte et plus fluide.
- Traduction automatique : Les capacités de suivi d’état de xLSTM pourraient s’avérer inestimables dans les tâches de traduction automatique, où maintenir les informations contextuelles et comprendre les dépendances à longue portée est crucial pour des traductions précises.
- Reconnaissance et génération vocale : La parallélisation et la mise à l’échelle de xLSTM le rendent adapté aux applications de reconnaissance et de génération vocale, où le traitement efficace de longues séquences est essentiel.
- Analyse de séries temporelles et prévision : La capacité de xLSTM à gérer les dépendances à longue portée et à stocker efficacement des modèles de données complexes pourrait conduire à des améliorations significatives dans les tâches d’analyse de séries temporelles et de prévision dans divers domaines, tels que la finance, la prévision météorologique et les applications industrielles.
- Apprentissage par renforcement et systèmes de contrôle : Le potentiel de xLSTM dans l’apprentissage par renforcement et les systèmes de contrôle est prometteur, car ses capacités de stockage améliorées et de suivi d’état pourraient permettre une prise de décision plus intelligente et un contrôle plus efficace dans des environnements complexes.
















