Partenariats

Infineon Technologies et d-Matrix s’associent pour des infrastructures d’IA à faible latence

mm
Ajouter Unite.AI à vos sources préférées sur Google

Infineon Technologies a annoncé un partenariat avec d-Matrix axé sur l’amélioration des performances et de l’efficacité énergétique des systèmes d’inférence d’IA utilisés dans les centres de données modernes. Le partenariat se concentre sur la plate-forme d’accélérateur d’inférence d’IA Corsair de Matrix et les modules de puissance OptiMOS à double phase d’Infineon, conçus pour supporter des environnements de calcul à haute densité pour les charges de travail d’IA interactives.

L’annonce met en évidence un changement important dans l’industrie du matériel d’IA. Alors que la majeure partie de l’essor de l’infrastructure au cours des dernières années s’est concentrée sur la formation de modèles d’IA de plus en plus grands, l’industrie s’étend maintenant rapidement vers l’inférence – le processus de l’exécution de modèles dans des applications réelles telles que les chatbots, les systèmes d’IA agents, les copilotes, la recherche, l’analyse financière et le soutien à la décision en matière de santé. Ces charges de travail imposent des exigences différentes sur le matériel, en particulier en termes de latence, de réactivité et de consommation d’énergie.

Pourquoi l’inférence d’IA devient un champ de bataille majeur pour le matériel

L’inférence d’IA est devenue l’un des segments à croissance la plus rapide du marché de l’infrastructure d’IA, car les systèmes d’IA interactifs nécessitent des réponses en millisecondes plutôt qu’en secondes. d-Matrix a positionné Corsair spécifiquement pour ces charges de travail, en mettant l’accent sur la latence ultra-basse et l’inférence économe en énergie pour les grands modèles de langage et les agents d’IA.

Selon d-Matrix, Corsair a été conçu autour d’une architecture de calcul en mémoire numérique destinée à réduire les goulets d’étranglement de la mémoire qui ralentissent souvent l’inférence d’IA générative. L’entreprise affirme que la plate-forme peut réduire considérablement la latence et améliorer le débit par rapport aux systèmes d’inférence traditionnels basés sur les GPU, en particulier pour les applications interactives.

Le partenariat avec Infineon répond à un autre défi de plus en plus critique : la livraison de puissance.

À mesure que les serveurs d’IA continuent d’augmenter en densité, la livraison efficace de puissance aux accélérateurs est devenue un facteur limitant pour la mise à l’échelle de l’infrastructure. Les modules OptiMOS TDM2254xx d’Infineon sont conçus pour les architectures de livraison de puissance verticale qui aident à réduire les pertes électriques tout en améliorant la densité de puissance à l’intérieur des systèmes de serveurs compacts.

Le passage aux systèmes d’IA en temps réel

Les entreprises ont présenté la collaboration autour de l’émergence de l’« IA interactive », où les systèmes d’inférence doivent générer en continu des sorties avec une latence extrêmement faible. Cela inclut l’IA conversationnelle, les agents d’IA, les systèmes de raisonnement en temps réel et les applications nécessitant une génération rapide de jetons à partir de grands modèles de langage.

Le fondateur et PDG de d-Matrix, Sid Sheth, a déclaré que l’architecture derrière Corsair a été conçue spécifiquement pour une latence de jeton inférieure à 2 millisecondes, une mesure qui est devenue de plus en plus importante à mesure que les entreprises déplacent les systèmes d’IA des expérimentations vers les environnements orientés client.

L’industrie d’IA dans son ensemble commence également à reconnaître que les infrastructures d’inférence pourraient évoluer différemment des infrastructures de formation. Alors que les grappes de GPU dominaient la première phase de l’expansion de l’IA générative, l’inférence récompense de plus en plus les architectures optimisées autour de la bande passante de la mémoire, de la latence, du réseau et de l’efficacité énergétique plutôt que le seul calcul brut.

L’efficacité énergétique devient centrale pour la mise à l’échelle de l’IA

L’une des principales contraintes auxquelles sont confrontés les hyperscalers et les fournisseurs de cloud d’IA est la demande d’électricité. Les charges de travail d’inférence d’IA peuvent s’exécuter en continu sur des millions de requêtes par jour, ce qui rend l’efficacité opérationnelle critique pour les coûts de déploiement.

Infineon a élargi agressivement sa position au sein de l’infrastructure d’IA grâce aux technologies de semi-conducteurs basées sur le silicium, le carbure de silicium (SiC) et le nitrure de gallium (GaN). L’entreprise s’est de plus en plus concentrée sur la fourniture de la couche de livraison de puissance sous-jacente aux accélérateurs d’IA et aux infrastructures de serveur.

La collaboration avec d-Matrix reflète la manière dont les sociétés de semi-conducteurs sont de plus en plus intégrées aux startups d’accélérateurs d’IA à mesure que l’industrie recherche des alternatives aux architectures traditionnelles basées sur les GPU.

L’infrastructure d’IA s’étend au-delà des GPU traditionnels

Le partenariat survient également au cours d’une vague plus large d’expérimentation dans le matériel d’IA. Un nombre croissant de startups développent des accélérateurs spécialisés axés spécifiquement sur l’inférence, le calcul centré sur la mémoire ou le réseau d’IA.

d-Matrix s’est distinguée par son accent sur les technologies de calcul en mémoire et les systèmes d’inférence à faible latence conçus pour l’IA générative. L’entreprise a également élargi sa stratégie d’infrastructure au-delà des seuls puces d’accélérateur, en mettant récemment l’accent sur le réseau, l’infrastructure composable et l’optimisation du système complet pour les grappes d’inférence.

À mesure que les applications d’IA deviennent de plus en plus interactives et agissantes, les fournisseurs d’infrastructure sont censés accorder une plus grande importance à la réduction de la latence, à la diminution de la consommation d’énergie et à l’amélioration de l’efficacité du système au niveau du système sur l’ensemble des piles de centre de données plutôt que de se concentrer uniquement sur la puissance de calcul brute.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.