Kumppanuudet

Infineon Technologies ja d-Matrix tekevät yhteistyötä matalan viiveen AI-infran parantamiseksi

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Infineon Technologies on ilmoittanut yhteistyöstä d-Matrixin kanssa, joka keskittyy parantamaan AI-inferenssijärjestelmien suorituskykyä ja energiatehokkuutta modernissa datakeskuksissa. Yhteistyö keskittyy d-Matrixin Corsair AI-inferenssikiihdytinplatfromiin ja Infineonin OptiMOS-kaksoisvaiheisen teho moduuleihin, jotka on suunniteltu tukemaan korkeatiheys laskentaympäristöjä interaktiivisille AI-työkuormille.

Ilmoitus korostaa kasvavaa muutosta AI-laitteistoteollisuudessa. Vaikka suuri osa infrastruktuurin kasvusta viime vuosina on keskittynyt koulutusjärjestelmiin, teollisuus on nyt nopeasti laajentamassa inferenssiin – prosessiin, jossa malleja käytetään todellisissa sovelluksissa, kuten chatboteissa, agenteissa, kopiloteissa, hakutoiminnoissa, rahoitusanalytiikassa ja terveydenhuollon päätöksenteossa. Nämä työkuormat asettavat erilaisia vaatimuksia laitteistoille, erityisesti viiveen, vastausajan ja energiankulutuksen suhteen.

Miksi AI-inferenssi on muuttumassa merkittäväksi laitteistotaistelukentäksi

AI-inferenssi on kehittynyt yhdeksi nopeimmin kasvavista AI-infrastruktuurin osa-alueista, koska interaktiiviset AI-järjestelmät vaativat vastauksia millisekunteissa eikä sekunteissa. d-Matrix on asettanut Corsairin erityisesti näille työkuormille, korostamalla erittäin matalaa viivettä ja energiatehokasta inferenssiä suurten kielen mallien ja AI-agenttien osalta.

d-Matrixin mukaan Corsair suunniteltiin digitaalisen muistin laskentarakenteen ympärille, joka on tarkoitettu vähentämään muistin pullonkauloja, jotka usein hidastavat generatiivisen AI-inferenssin. Yritys väittää, että alusta voi merkittävästi laskea viivettä ja parantaa läpäisyä perinteisiin GPU-keskeisiin inferenssijärjestelmiin verrattuna, erityisesti interaktiivisissa sovelluksissa.

Yhteistyö Infineonin kanssa koskee toista kasvavaa haasteita: tehon toimittamista.

Kun AI-palvelimet jatkavat tiheyden kasvua, tehon toimittaminen kiihdyttimille on muodostunut rajoittavaksi tekijäksi infrastruktuurin skaalautumisessa. Infineonin OptiMOS TDM2254xx -moduulit on suunniteltu pystysuoraan tehon toimittamisarkkitehtuureja varten, jotka auttavat vähentämään sähköisiä häviöitä ja parantamaan tehontiheyttä kompaktissa palvelinjärjestelmissä.

Siirtymä reaaliaikaisiin AI-järjestelmiin

Yritykset esittivät yhteistyön “interaktiivisen AI:n” nousun ympärillä, jossa inferenssijärjestelmien on tuotettava jatkuvasti tuloksia erittäin lyhyellä viiveellä. Tähän kuuluvat keskusteluai, AI-agentit, reaaliaikaiset päättelyjärjestelmät ja sovellukset, jotka vaativat nopeaa tokenin generointia suurista kielen malleista.

d-Matrixin perustaja ja toimitusjohtaja Sid Sheth sanoi, että Corsairin arkkitehtuuri suunniteltiin erityisesti alle 2 millisekunnin tokenin viiveen, mittarin, josta on tullut yhä tärkeämpää, kun yritykset siirtävät AI-järjestelmiä kokeilusta asiakaslähtöisiin ympäristöihin.

Laajempi AI-teollisuus on myös alkamassa tunnistamaan, että inferenssinfrastruktuuri saattaa kehittyä eri tavoin kuin koulutusinfrastruktuuri. Vaikka GPU-klusterit hallitsivat generatiivisen AI:n laajentumisen ensivaihetta, inferenssi palkitsee yhä enemmän arkkitehtuureja, jotka on optimoitu muistin kaistanleveyden, viiveen, verkkotöiden ja energiatehokkuuden ympärille eikä ainoastaan raakasuorituskyvyn.

Energiatehokkuus on muuttumassa keskeiseksi AI-skalaamisessa

Yksi suurimmista rajoitteista hyperskaleerien ja AI-pilviin tarjoajien on sähkön kysyntä. AI-inferenssityökuormat voivat pyöriä jatkuvasti miljoonien pyyntöjen yli päivässä, mikä tekee operatiivisen tehokkuuden kriittiseksi käyttöönoton kustannuksissa.

Infineon on laajentanut asemiaan AI-infrastruktuurissa aggressiivisesti puolijohdetechnologioita hyödyntämällä, jotka perustuvat piiriin, piikarbiidiin (SiC) ja galliumnitraattiin (GaN). Yritys on yhä enemmän keskittynyt toimittamaan tehon toimittamiskerrosta AI-kiihdyttimien ja palvelininfrastruktuurin alle.

Yhteistyö d-Matrixin kanssa heijastaa sitä, miten puolijohdeteollisuusyritykset ovat tulevat yhä enemmän integroiduksi AI-kiihdyttinstartupeihin, kun teollisuus etsii vaihtoehtoja perinteisille GPU-pohjaisille arkkitehtuureille.

AI-infrastruktuuri on laajentumassa perinteisten GPU:n ulkopuolelle

Yhteistyö saapuu myös laajemman kokeiluaallon aikana AI-laitteistossa. Kasvava määrä startup-yrityksiä kehittää erikoistuneita kiihdyttimiä, jotka on suunniteltu erityisesti inferenssiin, muistikeskeiseen laskentaan tai AI-verkkotöihin.

d-Matrix on erottautunut korostamalla laskennan muistissa -teknologioita ja matalan viiveen inferenssijärjestelmiä, jotka on suunniteltu generatiiviselle AI:lle. Yritys on myös laajentanut infrastruktuuristrategiaansa kiihdyttimien ulkopuolelle, korostamalla viime aikoina verkkotöitä, kokoonpanokelpoista infrastruktuuria ja koko järjestelmän optimointia inferenssiryhmille.

Kun AI-sovellukset tulevat yhä enemmän agenteiksi ja interaktiivisiksi, infrastruktuurin tarjoajien odotetaan panostavan enemmän viiveen vähentämiseen, energiankulutuksen laskemiseen ja järjestelmätasolla tehokkuuden parantamiseen koko datakeskuksen pinnoissa eikä ainoastaan raakasuorituskyvyn.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.