Modèles et plateformes d’IA

Enfabrica présente un tissu de mémoire basé sur Ethernet qui pourrait redéfinir l’inférence IA à grande échelle

mm
Ajouter Unite.AI à vos sources préférées sur Google

Enfabrica, une startup de la Silicon Valley soutenue par Nvidia (NVDA ), a présenté un produit révolutionnaire qui pourrait considérablement modifier la façon dont les charges de travail IA à grande échelle sont déployées et mises à l’échelle. Le système de tissu de mémoire élastique (EMFASYS) de l’entreprise est le premier tissu de mémoire basé sur Ethernet spécifiquement conçu pour résoudre le goulet d’étranglement fondamental de l’inférence de l’IA générative : l’accès à la mémoire.

À une époque où les modèles d’IA sont de plus en plus complexes, sensibles au contexte et persistants – nécessitant de vastes quantités de mémoire par session utilisateur – EMFASYS offre une approche novatrice pour découpler la mémoire du calcul, permettant aux centres de données d’IA d’améliorer considérablement les performances, de réduire les coûts et d’augmenter l’utilisation de leurs ressources les plus coûteuses : les GPU.

Qu’est-ce qu’un tissu de mémoire – et pourquoi est-il important ?

Traditionnellement, la mémoire à l’intérieur des centres de données a été étroitement liée au serveur ou au nœud dans lequel elle se trouve. Chaque GPU ou CPU n’a accès qu’à la mémoire à bande passante élevée directement attachée – généralement HBM pour les GPU ou DRAM pour les CPU. Cette architecture fonctionne bien lorsque les charges de travail sont petites et prévisibles. Mais l’IA générative a changé le jeu. Les LLM nécessitent un accès à de grandes fenêtres de contexte, à l’historique de l’utilisateur et à la mémoire multi-agents – tout cela doit être traité rapidement et sans retard. Ces demandes de mémoire dépassent souvent la capacité disponible de la mémoire locale, créant des goulets d’étranglement qui bloquent les cœurs GPU et gonflent les coûts d’infrastructure.

Un tissu de mémoire résout ce problème en transformant la mémoire en une ressource partagée et distribuée – une sorte de pool de mémoire connecté au réseau accessible par n’importe quel GPU ou CPU du cluster. Imaginez-le comme la création d’un « nuage de mémoire » à l’intérieur du rack du centre de données. Au lieu de répliquer la mémoire sur les serveurs ou de surcharger la mémoire HBM coûteuse, un tissu permet à la mémoire d’être agrégée, désagrégée et accédée à la demande sur un réseau à haute vitesse. Cela permet aux charges de travail d’inférence d’IA de s’étendre plus efficacement sans être entravées par les limites de mémoire physiques d’un seul nœud.

L’approche d’Enfabrica : Ethernet et CXL, enfin réunis

EMFASYS atteint cette architecture de mémoire à l’échelle du rack en combinant deux technologies puissantes : RDMA sur Ethernet et Compute Express Link (CXL). Le premier permet un transfert de données à faible latence et à haut débit sur des réseaux Ethernet standard. Le second permet à la mémoire d’être détachée des CPU et des GPU et regroupée en ressources partagées, accessibles via des liens CXL à haute vitesse.

Au cœur d’EMFASYS se trouve le circuit ACF-S d’Enfabrica, un « SuperNIC » de 3,2 téraoctets par seconde (Tbps) qui fusionne le contrôle du réseau et de la mémoire en un seul appareil. Ce circuit permet aux serveurs d’interfacer avec de vastes pools de mémoire DRAM à 18 téraoctets par nœud, répartis dans le rack. De manière cruciale, il le fait en utilisant des ports Ethernet standard, permettant aux opérateurs de tirer parti de leur infrastructure de centre de données existante sans investir dans des interconnecteurs propriétaires.

Ce qui rend EMFASYS particulièrement attrayant, c’est sa capacité à décharger dynamiquement les charges de travail liées à la mémoire des GPU coûteux vers la DRAM beaucoup plus abordable, tout en maintenant une latence d’accès au niveau des microsecondes. La pile logicielle derrière EMFASYS comprend des mécanismes de mise en cache intelligents et d’équilibrage de charge qui masquent la latence et orchestrer le mouvement de la mémoire de manière transparente pour les LLM qui s’exécutent sur le système.

Implications pour l’industrie de l’IA

Il s’agit de plus qu’une simple solution matérielle ingénieuse – cela représente un changement philosophique dans la façon dont l’infrastructure d’IA est construite et mise à l’échelle. Alors que l’IA générative passe de la nouveauté à la nécessité, avec des milliards de requêtes utilisateur traitées quotidiennement, le coût de la fourniture de ces modèles est devenu insoutenable pour de nombreuses entreprises. Les GPU sont souvent sous-utilisés non pas en raison d’un manque de calcul, mais parce qu’ils restent inactifs en attendant la mémoire. EMFASYS répond directement à ce déséquilibre.

En permettant une mémoire partagée et attachée à un tissu, accessible via Ethernet, Enfabrica offre aux opérateurs de centres de données une alternative évolutivité pour acheter davantage de GPU ou de HBM. Au lieu de cela, ils peuvent augmenter la capacité de mémoire de manière modulaire, en utilisant la DRAM standard et un réseau intelligent, en réduisant l’empreinte globale et en améliorant l’économie de l’inférence d’IA.

Les implications vont au-delà des économies de coûts immédiates. Ce type d’architecture désagrégée ouvre la voie à des modèles de mémoire en tant que service, où le contexte, l’historique et l’état de l’agent peuvent persister au-delà d’une seule session ou serveur, ouvrant la porte à des systèmes d’IA plus intelligents et personnalisés. Cela prépare également le terrain pour des nuages d’IA plus résilients, où les charges de travail peuvent être distribuées de manière élastique sur un rack ou un centre de données entier sans limites de mémoire rigides.

Regarder vers l’avenir

Le système EMFASYS d’Enfabrica est actuellement en phase de test avec des clients sélectionnés, et même si l’entreprise n’a pas divulgué qui sont ces partenaires, Reuters rapporte que les principaux fournisseurs de cloud d’IA testent déjà le système. Cela positionne Enfabrica non seulement en tant que fournisseur de composants, mais également en tant qu’acteur clé dans la prochaine génération d’infrastructure d’IA.

En découplant la mémoire du calcul et en la rendant disponible sur des réseaux Ethernet à haute vitesse et à faible coût, Enfabrica jette les bases d’une nouvelle ère d’architecture d’IA – une ère où l’inférence peut s’étendre sans compromis, où les ressources ne sont plus gaspillées et où les économies de déploiement de grands modèles de langage finissent par avoir du sens.

Dans un monde de plus en plus défini par des systèmes d’IA riches en contexte et multi-agents, la mémoire n’est plus un acteur secondaire – c’est la scène. Et Enfabrica mise sur le fait que celui qui construit la meilleure scène définira les performances de l’IA pour les années à venir.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.