Tankeledere

Hemmeligheden bag hurtigere AI er ikke flere GPU’er, men smartere netværk

mm
Føj Unite.AI til dine foretrukne kilder på Google

AI gendefinerer, hvad der er muligt på tværs af brancher, herunder sundhedsvesen, finans, fremstilling og detailhandel. Men med lovende potentiale medfører det også massive infrastrukturkrav.

Organisationer verden over investerer i GPU’er i en hidtil uset skala for at accelerere AI-træning og inferens. Ifølge Gartner forudser generativ AI IT-udgifter vil overstige 1 billion dollar i 2028. Hyperion Research forudser, at den samlede HPC-marked udgift vil overstige 100 milliarder dollar i samme periode. Alligevel ser mange CIO’er, på trods af investeringer i avancerede acceleratorer, stadig idle GPU’er, med en udnyttelsesgrad på 35% eller lavere. Dette resulterer ikke kun i underpræstation, men også i spild af energi og øgede omkostninger.

Mange AI-projekter går i stå, ikke fordi de mangler GPU’er eller beregningskraft, men fordi netværket ikke kan følge med, og derfor kræver en ny tilgang til design til AI i stor skala.

Den skjulte omkostning ved netværksbottleneck

Når netværk ikke kan levere data hurtigt nok til at holde GPU’er konstant beskæftiget, oplever organisationer flere kritiske konsekvenser:

  • Underudnyttede GPU’er og CPU’er på grund af bottleneckede dataoverførsler: GPU’er er designet til massivt parallel beregning, men de kan kun behandle data så hurtigt, som det leveres. Hvis netværksfabrikken ikke kan følge med, sidder GPU’er idle og venter på data i stedet for at udføre beregninger. CPU’er kan også gå i stå, da de koordinerer opgaver og flytter data gennem røret, hvilket resulterer i lav udnyttelsesgrad, på trods af tilstedeværelse af dyrt udstyr.
  • U ensartet inferenspræstation fra et ineffektivt netværk: Netværksinefficienser skaber uregelmæssige datastrømme, der får GPU’er til at svinge mellem fuld hastighed og idle tilstand. Dette producerer uforudsigelig inferenspræstation, der kan lamme AI-applikationer i produktion.
  • Længere træningscykler, der forsinker tid til marked: Træning af AI-modeller kræver overførsel af massive datasæt mellem servere, GPU’er og lagring. Netværksbottlenecker strammer denne proces, så GPU’er bruger mindre tid på træning og mere tid på at vente. Dette forsinkrer direkte produktudvikling og implementeringsplaner.
  • Stigende strøm- og driftsomkostninger: Selv når de er inaktive, forbruger GPU’er og den omgivende infrastruktur stadig betydelige mængder strøm. Hvis GPU’er er underudnyttede på grund af netværksinefficienser, betaler organisationer for høj strømforbrug uden at få proportional præstation. Driftsomkostninger stiger, fordi faciliteterne skal understøtte topstrøm- og kølebelastninger, selvom beregningsgennemstrømningen er kunstigt begrænset.

Virksomheder kan fortsætte med at øse penge i mere GPU’er, men uden de rette netværksforbedringer, vil de blot forstærke disse bottleneck og inefficienser.

Netværk som accelerator: En paradigmeskift

Løsningen kræver en omfattende omstrukturering af netværksarkitekturen. Introduktionen af en model, der udnytter netværket som en accelerator, ændrer den traditionelle tankegang om HPC- og AI-præstation og låser op for nye muligheder.

I stedet for at fokusere primært på at tilføje mere beregningskraft via GPU’er og CPU’er, behandler “netværk som accelerator”-tilgangen netværksfabrikken som en præstationsmultiplikator. Derved kan netværket bedre understøtte højtydende beregning og accelerere ROI ved at eliminere bottleneck og skala til at møde beregningskrav, samt rette størrelsen på hardwareinvesteringer. Ved at aktivere større beregning uden afbrydelser kan organisationer køre større arbejdsmængder på mindre plads, få resultater hurtigere og undgå at overspilde på ekstra hardware.

Hvordan ‘Netværk som accelerator’-modellen fungerer

Så, hvordan fungerer denne model, så organisationer kan omdanne deres netværk fra at være en passiv dataflytter til en aktiv enablement af beregning og begynde at realisere fordelene? Den leverer fire nøglefunktioner, som traditionelle netværk mangler:

  • Garantiseret levering på hardwareniveau: Traditionelle netværk belaster CPU’er og GPU’er med pakkeovervågning, gensendings- og omordningsoverhead. Dette forbruger beregningscykler, der ellers kunne være dedikeret til træning eller inferens. Med en netværksfabrik, der garanterer levering på hardwareniveau, overføres disse opgaver væk fra beregningsnodernes CPU’er og GPU’er, hvilket resulterer i reduceret CPU- og GPU-overhead, forudsigelig og konsekvent præstation samt skalerbarhed, der simplificerer programmering og cluster-orchestration.
  • Intelligent dynamisk routing: Konventionel routing afhænger af faste eller underoptimale ruter, der kan efterlade dele af netværket underudnyttede eller skabe bottleneck, hvor massive datastrømme flyder samtidigt. Intelligent routing udnytter dynamisk alle tilgængelige ruter til at optimere trafikfladen. Dette giver højere gennemstrømning med flere aktive ruter, der balancerer trafikken, lavere latency via optimal rutevalg samt forbedret resiliens, da netværkstrafikken automatisk omdirigerer rundt om link- eller nodefejl. Dette reducerer inaktive perioder og holder GPU’er fuldt beskæftiget med data.
  • Linkniveau-auto-gensendelse: Når pakker går tabt eller bliver ødelagt, afhænger standardnetværk af beregningslaget til at opdage og gensende dem, hvilket introducerer betydelig latency og afbryder beregningsflowet. En fabrik med indbygget linkniveau-auto-gensendelsesfunktioner håndterer gensendelser inden for netværket selv. Dette giver næsten gennemsigtig pålidelighed, da pakketab bliver usynligt for beregningsnodernes CPU’er og GPU’er, mens latency-påvirkningen reduceres, da gensendelser sker lokalt på linkniveau, ikke på tværs af hele netværksstakken. Dette eliminerer også behovet for kompleks applikationsniveau-fejlhåndtering. Auto-gensendelsesfunktioner sikrer ubrudt, effektivt distribueret beregning, hvilket er vigtigt, når man skal skala til tusinder af GPU’er.
  • Netværksbaseret beregning: Mens traditionelle netværksfabrikker primært flytter data, gør netværksbaseret beregning det muligt for netværket at blive en co-processor ved at udføre visse operationer direkte inden for fabrikken. NVIDIA SHARP er et godt eksempel – det tillader reduktioner at ske på netværksswitchene selv. Dette giver accelereret distribueret operation, reducerer latency, da data aggregere, mens de flytter gennem netværket, og øger effektiviteten, da beregningsnodernes CPU’er og GPU’er frigøres fra at udføre aggregationsopgaver, hvilket giver mere cyklus til træning og simulation.

Samlet set er disse funktioner, hvad der gør “netværksledet beregning” grundlæggende for at skala næste generations AI- og HPC-miljøer. En netværkscentreret tilgang giver mærkbare afkast, herunder højere GPU-udnyttelse, der eliminerer data-sult, hurtigere tid til indsigt, der reducerer træningscykler og stabiliserer inferenspræstation, forbedret ressourceeffektivitet samt lavere samlet ejeromkostning.

Opdag sand netværkskraft

AI i stor skala er ikke kun et beregningsproblem – det er en systemniveau-ingeniørudfordring, med netværk i centrum. At behandle netværket som en accelerator omdanner det til en multiplikator for beregning, der giver HPC- og AI-datacentre mulighed for at skala i tæthed uden at gå på kompromis med præstationen. Dette giver mærkbare ROI hurtigere ved at udtrække maksimal værdi fra eksisterende infrastruktur, før der investeres i mere silicium.

Ved at eliminere bottleneck, forbedre udnyttelse og levere forudsigelig præstation, giver smartere netværk mere produktive AI-hold, bedre ROI på GPU-infrastruktur samt hurtigere tid til indsigt, innovation og markedskontrol. Dette giver organisationer mulighed for at opdage, hvad deres netværk kan være, og udnytte kraften fra AI på nye måder.

Nishant Lodha er senior direktør for AI-netværk hos Cornelis Networks. Før han tiltrådte stillingen hos Cornelis, havde Nishant direktørroller hos Intel Corporation og Marvell. Han har mere end 25 års erfaring med datacenter-netværk, lagring og beregnings-teknologier i roller, der spænder fra produktmarkedsføring, løsninger og teknisk markedsføring til netværksingeniør. Han er baseret i Silicon Valley.