Partnerschaften

Infineon Technologies und d-Matrix kooperieren bei Low-Latency-AI-Infrastruktur

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Infineon Technologies hat eine Zusammenarbeit mit d-Matrix bekannt gegeben, die sich auf die Verbesserung der Leistung und Energieeffizienz von AI-Inferenzsystemen in modernen Rechenzentren konzentriert. Die Partnerschaft konzentriert sich auf d-Matrix’ Corsair-AI-Inferenz-Beschleuniger-Plattform und Infineons OptiMOS-Dual-Phasen-Leistungsmodul, die für hochdichte Rechenumgebungen für interaktive AI-Workloads konzipiert sind.

Die Ankündigung unterstreicht eine wachsende Verschiebung innerhalb der AI-Hardware-Industrie. Während sich der Infrastruktur-Boom in den letzten Jahren hauptsächlich auf die Ausbildung immer größerer AI-Modelle konzentrierte, expandiert die Industrie nun schnell in die Inferenz – den Prozess des tatsächlichen Ausführens von Modellen in realen Anwendungen wie Chatbots, agierenden AI-Systemen, Co-Piloten, Suche, Finanzanalyse und Entscheidungsunterstützung im Gesundheitswesen. Diese Workloads stellen unterschiedliche Anforderungen an die Hardware, insbesondere im Hinblick auf Latenz, Reaktionsfähigkeit und Energieverbrauch.

Warum AI-Inferenz zu einem wichtigen Hardware-Schlachtfeld wird

AI-Inferenz ist zu einem der am schnellsten wachsenden Segmente des AI-Infrastrukturmarktes geworden, da interaktive AI-Systeme Antworten in Millisekunden und nicht in Sekunden benötigen. d-Matrix hat Corsair speziell für diese Workloads positioniert, wobei ultra-niedrige Latenz und energieeffiziente Inferenz für große Sprachmodelle und AI-Agenten betont werden.

Laut d-Matrix wurde Corsair um eine digitale In-Memory-Compute-Architektur herum entworfen, die darauf abzielt, die Speicher-Engpässe zu reduzieren, die oft die generative AI-Inferenz verlangsamen. Das Unternehmen behauptet, dass die Plattform die Latenz erheblich senken und die Durchsatzrate im Vergleich zu herkömmlichen GPU-zentrierten Inferenzsystemen verbessern kann, insbesondere für interaktive Anwendungen.

Die Partnerschaft mit Infineon behandelt eine weitere zunehmend kritische Herausforderung: die Stromversorgung.

Da AI-Server weiterhin an Dichte zunehmen, ist die effiziente Stromversorgung von Beschleunigern zu einem limitierenden Faktor für die Skalierung der Infrastruktur geworden. Infineons OptiMOS-TDM2254xx-Module sind für vertikale Stromversorgungsarchitekturen konzipiert, die dazu beitragen, elektrische Verluste zu reduzieren und die Leistungsdichte in kompakten Serversystemen zu verbessern.

Der Wechsel zu Echtzeit-AI-Systemen

Die Unternehmen haben die Zusammenarbeit um den Aufstieg von “interaktiver AI” herum aufgebaut, bei der Inferenzsysteme kontinuierlich Ausgaben mit extrem niedriger Verzögerung erzeugen müssen. Dazu gehören konversationale AI, AI-Agenten, Echtzeit-Reasoning-Systeme und Anwendungen, die eine schnelle Token-Generierung aus großen Sprachmodellen erfordern.

d-Matrix-Gründer und CEO Sid Sheth sagte, dass die Architektur hinter Corsair speziell für eine Token-Latenz von unter 2 Millisekunden entwickelt wurde, ein Maß, das immer wichtiger wird, da Unternehmen AI-Systeme von Experimenten in kundenorientierte Umgebungen verlagern.

Die breitere AI-Industrie beginnt auch zu erkennen, dass Inferenz-Infrastruktur möglicherweise anders als Trainings-Infrastruktur entwickelt wird. Während GPU-Cluster die erste Phase der generativen AI-Expansion dominierten, belohnt Inferenz zunehmend Architekturen, die auf Speicherbandbreite, Latenz, Netzwerk und Energieeffizienz optimiert sind, anstatt nur auf rohe Rechenleistung.

Energieeffizienz wird zum zentralen Aspekt der AI-Skalierung

Eine der größten Einschränkungen, mit denen Hyperscaler und AI-Cloud-Anbieter konfrontiert sind, ist der Strombedarf. AI-Inferenz-Workloads können kontinuierlich über Millionen von Anfragen pro Tag laufen, was die betriebliche Effizienz für die Bereitstellungskosten kritisch macht.

Infineon hat seine Position innerhalb der AI-Infrastruktur durch Halbleitertechnologien auf der Basis von Silizium, Siliziumcarbid (SiC) und Galliumnitrid (GaN) aggressiv ausgebaut. Das Unternehmen hat sich zunehmend auf die Belieferung der Stromversorgungsschicht unter AI-Beschleunigern und Server-Infrastruktur konzentriert.

Die Zusammenarbeit mit d-Matrix spiegelt wider, wie Halbleiterunternehmen enger mit AI-Beschleuniger-Startups integriert werden, da die Industrie nach Alternativen zu herkömmlichen GPU-lastigen Architekturen sucht.

AI-Infrastruktur expandiert jenseits traditioneller GPUs

Die Partnerschaft kommt auch während einer breiteren Welle von Experimenten in der AI-Hardware. Eine wachsende Anzahl von Startups entwickelt spezialisierte Beschleuniger, die sich speziell auf Inferenz, memory-zentrierte Rechnung oder AI-Netzwerke konzentrieren.

d-Matrix hat sich durch seinen Fokus auf Compute-in-Memory-Technologien und low-Latency-Inferenz-Systeme für generative AI abgehoben. Das Unternehmen hat auch seine Infrastrukturstrategie über Beschleuniger-Chips hinaus erweitert und kürzlich Netzwerke, komponierbare Infrastruktur und vollständige Systemoptimierung für Inferenz-Cluster betont.

Da AI-Anwendungen immer interaktiver und agenter werden, werden Infrastrukturanbieter erwartet, einen größeren Schwerpunkt auf die Reduzierung der Latenz, die Senkung des Energieverbrauchs und die Verbesserung der Systemeffizienz über den gesamten Rechenzentrums-Stack hinweg legen, anstatt sich ausschließlich auf die rohe Rechenleistung zu konzentrieren.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.