Parteneriate

Infineon Technologies și d-Matrix se asociază pentru infrastructura de inteligență artificială cu latență scăzută

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Infineon Technologies a anunțat un parteneriat cu d-Matrix axat pe îmbunătățirea performanței și a eficienței energetice a sistemelor de inferență cu inteligență artificială utilizate în centrele de date moderne. Parteneriatul se învârte în jurul platformei de accelerare a inferenței AI Corsair a d-Matrix și a modulelor de alimentare cu energie OptiMOS dual-fazice ale Infineon, care sunt proiectate pentru a susține medii de calcul de înaltă densitate pentru sarcini de lucru interactive cu inteligență artificială.

Anunțul subliniază o schimbare în curs de desfășurare în industria de hardware pentru inteligență artificială. În timp ce mare parte din avântul infrastructurii din ultimii ani s-a concentrat pe antrenarea unor modele de inteligență artificială din ce în ce mai mari, industria se extinde acum rapid în direcția inferenței – procesul de rulare a modelelor în aplicații din lumea reală, cum ar fi chatbot-urile, sistemele de inteligență artificială agențice, copiloții, căutarea, analiza financiară și suportul decizional pentru sănătate. Aceste sarcini de lucru impun cerințe diferite asupra hardware-ului, în special în ceea ce privește latența, răspunsul și consumul de energie.

De ce inferența cu inteligență artificială devine un câmp de bătălie major pentru hardware

Inferența cu inteligență artificială a devenit unul dintre segmentele cu cea mai rapidă creștere a pieței de infrastructură pentru inteligență artificială, deoarece sistemele de inteligență artificială interactive necesită răspunsuri în milisecunde, nu în secunde. d-Matrix a poziționat Corsair în mod special pentru aceste sarcini de lucru, subliniind latența ultra-scăzută și inferența eficientă din punct de vedere energetic pentru modele de limbaj mare și agenți de inteligență artificială.

Conform d-Matrix, Corsair a fost proiectat în jurul unei arhitecturi de calcul digitale în memorie menită să reducă blocajele de memorie care încetinesc adesea inferența generativă a inteligenței artificiale. Compania afirmă că platforma poate reduce semnificativ latența și poate îmbunătăți debitul în comparație cu sistemele tradiționale de inferență centrate pe GPU, în special pentru aplicații interactive.

Parteneriatul cu Infineon abordează o altă provocare din ce în ce mai critică: livrarea de energie.

Pe măsură ce serverele de inteligență artificială continuă să crească în densitate, livrarea eficientă de energie către acceleratoare a devenit un factor limitativ pentru scalarea infrastructurii. Modulele OptiMOS TDM2254xx ale Infineon sunt proiectate pentru arhitecturi de alimentare verticală care ajută la reducerea pierderilor electrice și la îmbunătățirea densității de putere în sisteme de server compacte.

Schimbarea către sisteme de inteligență artificială în timp real

Companiile au plasat colaborarea în jurul apariției “inteligenței artificiale interactive”, în care sistemele de inferență trebuie să genereze continuu ieșiri cu întârziere extrem de scăzută. Acest lucru include inteligența artificială conversațională, agenții de inteligență artificială, sistemele de raționament în timp real și aplicațiile care necesită generarea rapidă de tokeni din modele de limbaj mare.

Fondatorul și directorul general al d-Matrix, Sid Sheth, a declarat că arhitectura din spatele Corsair a fost creată în mod special pentru o latență a tokenului sub 2 milisecunde, o metrică care a devenit din ce în ce mai importantă pe măsură ce întreprinderile mută sistemele de inteligență artificială din faza de experimentare în medii care interacționează cu clienții.

Industria de inteligență artificială mai largă începe, de asemenea, să recunoască faptul că infrastructura de inferență poate evolua diferit de infrastructura de antrenare. În timp ce clusterurile de GPU au dominat prima fază a expansiunii inteligenței artificiale generative, inferența începe să favorizeze arhitecturi optimizate pentru lățimea de bandă a memoriei, latență, rețea și eficiență energetică, mai degrabă decât doar puterea de calcul brută.

Eficiența energetică devine centrală pentru scalarea inteligenței artificiale

Una dintre cele mai mari constrângeri cu care se confruntă hyperscalers și furnizorii de cloud pentru inteligență artificială este cererea de electricitate. Sarcinile de lucru de inferență cu inteligență artificială pot rula continuu pe milioane de solicitări pe zi, făcând eficiența operațională critică pentru costurile de implementare.

Infineon și-a extins în mod agresiv poziția în cadrul infrastructurii de inteligență artificială prin tehnologii semiconductoare bazate pe siliciu, carbură de siliciu (SiC) și nitru de galiu (GaN). Compania s-a concentrat din ce în ce mai mult pe aprovizionarea stratului de livrare a energiei sub acceleratoarele de inteligență artificială și infrastructura de server.

Colaborarea cu d-Matrix reflectă modul în care companiile de semiconductoare devin mai strâns integrate cu startup-urile de acceleratoare de inteligență artificială, pe măsură ce industria caută alternative la arhitecturile convenționale bazate pe GPU.

Infrastructura de inteligență artificială se extinde dincolo de GPU-urile tradiționale

Parteneriatul sosește în timpul unei valuri mai largi de experimentare în hardware-ul de inteligență artificială. Un număr tot mai mare de startup-uri dezvoltă acceleratoare specializate, concentrate în mod specific pe inferență, calculul centrat pe memorie sau rețelele de inteligență artificială.

d-Matrix s-a diferențiat prin accentul său pe tehnologiile de calcul în memorie și sistemele de inferență cu latență scăzută, special concepute pentru inteligența artificială generativă. Compania și-a extins, de asemenea, strategia de infrastructură dincolo de simplele cipuri de accelerare, subliniind recent rețelele, infrastructura compozabilă și optimizarea la nivel de sistem pentru clusterelor de inferență.

Pe măsură ce aplicațiile de inteligență artificială devin din ce în ce mai agențice și interactive, furnizorii de infrastructură sunt așteptați să pună un accent mai mare pe reducerea latenței, scăderea consumului de energie și îmbunătățirea eficienței la nivel de sistem pe întregul stivuit al centrelor de date, mai degrabă decât să se concentreze doar pe puterea de procesare brută.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.