Kumppanuudet
Infineon Technologies ja d-Matrix tekevät yhteistyötä matalan viiveen AI-infran parantamiseksi
Infineon Technologies on ilmoittanut yhteistyöstä d-Matrixin kanssa, joka keskittyy parantamaan AI-inferenssijärjestelmien suorituskykyä ja energiatehokkuutta modernissa datakeskuksissa. Yhteistyö keskittyy d-Matrixin Corsair AI-inferenssikiihdytinplatfromiin ja Infineonin OptiMOS-kaksoisvaiheisen teho moduuleihin, jotka on suunniteltu tukemaan korkeatiheys laskentaympäristöjä interaktiivisille AI-työkuormille.
Ilmoitus korostaa kasvavaa muutosta AI-laitteistoteollisuudessa. Vaikka suuri osa infrastruktuurin kasvusta viime vuosina on keskittynyt koulutusjärjestelmiin, teollisuus on nyt nopeasti laajentamassa inferenssiin – prosessiin, jossa malleja käytetään todellisissa sovelluksissa, kuten chatboteissa, agenteissa, kopiloteissa, hakutoiminnoissa, rahoitusanalytiikassa ja terveydenhuollon päätöksenteossa. Nämä työkuormat asettavat erilaisia vaatimuksia laitteistoille, erityisesti viiveen, vastausajan ja energiankulutuksen suhteen.
Miksi AI-inferenssi on muuttumassa merkittäväksi laitteistotaistelukentäksi
AI-inferenssi on kehittynyt yhdeksi nopeimmin kasvavista AI-infrastruktuurin osa-alueista, koska interaktiiviset AI-järjestelmät vaativat vastauksia millisekunteissa eikä sekunteissa. d-Matrix on asettanut Corsairin erityisesti näille työkuormille, korostamalla erittäin matalaa viivettä ja energiatehokasta inferenssiä suurten kielen mallien ja AI-agenttien osalta.
d-Matrixin mukaan Corsair suunniteltiin digitaalisen muistin laskentarakenteen ympärille, joka on tarkoitettu vähentämään muistin pullonkauloja, jotka usein hidastavat generatiivisen AI-inferenssin. Yritys väittää, että alusta voi merkittävästi laskea viivettä ja parantaa läpäisyä perinteisiin GPU-keskeisiin inferenssijärjestelmiin verrattuna, erityisesti interaktiivisissa sovelluksissa.
Yhteistyö Infineonin kanssa koskee toista kasvavaa haasteita: tehon toimittamista.
Kun AI-palvelimet jatkavat tiheyden kasvua, tehon toimittaminen kiihdyttimille on muodostunut rajoittavaksi tekijäksi infrastruktuurin skaalautumisessa. Infineonin OptiMOS TDM2254xx -moduulit on suunniteltu pystysuoraan tehon toimittamisarkkitehtuureja varten, jotka auttavat vähentämään sähköisiä häviöitä ja parantamaan tehontiheyttä kompaktissa palvelinjärjestelmissä.
Siirtymä reaaliaikaisiin AI-järjestelmiin
Yritykset esittivät yhteistyön “interaktiivisen AI:n” nousun ympärillä, jossa inferenssijärjestelmien on tuotettava jatkuvasti tuloksia erittäin lyhyellä viiveellä. Tähän kuuluvat keskusteluai, AI-agentit, reaaliaikaiset päättelyjärjestelmät ja sovellukset, jotka vaativat nopeaa tokenin generointia suurista kielen malleista.
d-Matrixin perustaja ja toimitusjohtaja Sid Sheth sanoi, että Corsairin arkkitehtuuri suunniteltiin erityisesti alle 2 millisekunnin tokenin viiveen, mittarin, josta on tullut yhä tärkeämpää, kun yritykset siirtävät AI-järjestelmiä kokeilusta asiakaslähtöisiin ympäristöihin.
Laajempi AI-teollisuus on myös alkamassa tunnistamaan, että inferenssinfrastruktuuri saattaa kehittyä eri tavoin kuin koulutusinfrastruktuuri. Vaikka GPU-klusterit hallitsivat generatiivisen AI:n laajentumisen ensivaihetta, inferenssi palkitsee yhä enemmän arkkitehtuureja, jotka on optimoitu muistin kaistanleveyden, viiveen, verkkotöiden ja energiatehokkuuden ympärille eikä ainoastaan raakasuorituskyvyn.
Energiatehokkuus on muuttumassa keskeiseksi AI-skalaamisessa
Yksi suurimmista rajoitteista hyperskaleerien ja AI-pilviin tarjoajien on sähkön kysyntä. AI-inferenssityökuormat voivat pyöriä jatkuvasti miljoonien pyyntöjen yli päivässä, mikä tekee operatiivisen tehokkuuden kriittiseksi käyttöönoton kustannuksissa.
Infineon on laajentanut asemiaan AI-infrastruktuurissa aggressiivisesti puolijohdetechnologioita hyödyntämällä, jotka perustuvat piiriin, piikarbiidiin (SiC) ja galliumnitraattiin (GaN). Yritys on yhä enemmän keskittynyt toimittamaan tehon toimittamiskerrosta AI-kiihdyttimien ja palvelininfrastruktuurin alle.
Yhteistyö d-Matrixin kanssa heijastaa sitä, miten puolijohdeteollisuusyritykset ovat tulevat yhä enemmän integroiduksi AI-kiihdyttinstartupeihin, kun teollisuus etsii vaihtoehtoja perinteisille GPU-pohjaisille arkkitehtuureille.
AI-infrastruktuuri on laajentumassa perinteisten GPU:n ulkopuolelle
Yhteistyö saapuu myös laajemman kokeiluaallon aikana AI-laitteistossa. Kasvava määrä startup-yrityksiä kehittää erikoistuneita kiihdyttimiä, jotka on suunniteltu erityisesti inferenssiin, muistikeskeiseen laskentaan tai AI-verkkotöihin.
d-Matrix on erottautunut korostamalla laskennan muistissa -teknologioita ja matalan viiveen inferenssijärjestelmiä, jotka on suunniteltu generatiiviselle AI:lle. Yritys on myös laajentanut infrastruktuuristrategiaansa kiihdyttimien ulkopuolelle, korostamalla viime aikoina verkkotöitä, kokoonpanokelpoista infrastruktuuria ja koko järjestelmän optimointia inferenssiryhmille.
Kun AI-sovellukset tulevat yhä enemmän agenteiksi ja interaktiivisiksi, infrastruktuurin tarjoajien odotetaan panostavan enemmän viiveen vähentämiseen, energiankulutuksen laskemiseen ja järjestelmätasolla tehokkuuden parantamiseen koko datakeskuksen pinnoissa eikä ainoastaan raakasuorituskyvyn.












