Tankeledare

VarfÃķr nÃĪsta fas av AI-infrastruktur kommer att krÃĪva mer ÃĪn hyperskala datacenter

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

Artificiell intelligens gÃĨr in i en period dÃĪr infrastrukturstrategi blir oupplÃķsligt kopplad till modellfÃķrmÃĨga. Under mÃĨnga ÃĨr har hyperskala datacenter drivit fram utvecklingen av storskalig utbildning, vilket har mÃķjliggjort att modeller kan vÃĪxa frÃĨn miljoner till biljoner parametrar. Men nÃĪr AI-anvÃĪndningen accelererar Ãķver fÃķretag, branscher och realtidsystem, ersÃĪtter inferens utbildning som den dominerande arbetsbelastningen, och inferens har fundamentalt olika krav.

NÃĪsta era av AI kan inte stÃķdjas av hyperskala-anlÃĪggningar ensamma. IstÃĪllet uppstÃĨr en hybridmodell dÃĪr centraliserade campus fÃķr utbildning kompletteras med distribuerade, effektoptimerade, kommersiella datacenter fÃķr inferens. Denna fÃķrÃĪndring drivs av latensbegrÃĪnsningar, datasuverÃĪnitetsbehov, energirealiteter och de fysiska grÃĪnserna fÃķr fortsatt hyperskaleutveckling.

Avvikelsen mellan utbildning och inferens

Utbildning fÃķrblir en centraliserad aktivitet. Den krÃĪver massiva kluster, hÃķghastighetsdata-pipelines och lÃĨngvariga jobb som drar nytta av stordriftsfÃķrdelar. Hyperskala-campus ÃĪr optimerade fÃķr detta med tÃĪt berÃĪkning, specialiserade nÃĪtverksvÃĪvar och global tillgÃĪnglighet. Men inferens beter sig annorlunda. Den ÃĪr kortvarig, hÃķgvolym, latenskÃĪnslig och ofta knuten till geografi eller fÃķretagsgrÃĪnser. Analyser frÃĨn Akamais senaste arbete om agenter visar att de flesta organisationer nu siktar pÃĨ en slut-till-slut-latens pÃĨ under 500 millisekunder fÃķr kritiska AI-anvÃĪndningsfall, och multiagent-arbetsflÃķden ofta Ãķverstiger den trÃķskeln enbart pÃĨ grund av nÃĪtverksÃķverfÃķring och CPU-sidig exekvering.

Latens ÃĪr inte en abstrakt mÃĨtt. Inom robotteknik och autonoma system kÃķrs kontrollloopar ofta med 100 till 1 000 hertz var 1 till 10 millisekunder. All avlÃĪgsen intelligens mÃĨste respektera dessa tidsbegrÃĪnsningar. En 50 millisekunders tur- och returresa till ett avlÃĪgset datacenter bryter kontrollregimen helt. Inom finansiell handel och bedrÃĪgeridetektering bestÃĪms ekonomiska resultat av millisekunder. Inom industriell automation kan fÃķrdrÃķjd inferens destabilisera processer eller ÃĪventyra sÃĪkerheten. Och i interaktiva upplevelser som spel, AR/VR och realtidsco-piloter fÃķrsÃĪmras svarstiden kraftigt ovanfÃķr 100 till 150 millisekunder.

Modern AI-system ÃĪr alltmer beroende av multiagent-arbetsflÃķden som bestÃĨr av kedjor av dussintals sekventiella samtal. Akamais analys visar att CPU-sidig exekvering kan stÃĨ fÃķr den stÃķrsta delen av den totala latensen, och varje nÃĪtverksomgÃĨng tillfÃķr ytterligare fÃķrdrÃķjning. Ett arbetsflÃķde med 50 sekventiella samtal kan ÃĨdra sig sekunder av transportlatens nÃĪr det dirigeras till ett avlÃĪgset hyperskale-omrÃĨde. Placera samma arbetsflÃķde i ett hyperlokalt datacenter belÃĪget pÃĨ samma campus eller storstadsomrÃĨde och fysiken fÃķrÃĪndras. Lokal inferens kan leverera 1 till 5 millisekunders tur- och retur-latens. Ett 50-stegs-arbetsflÃķde som skulle ta sekunder i ett avlÃĪgset omrÃĨde kan slutfÃķras pÃĨ 50 till 250 millisekunder lokalt, vilket hÃĨller sig inom fÃķretagets latensbudget.

Data-suverÃĪnitet och grid-realiteter som driver lokala distributioner

Latens ÃĪr bara en del av berÃĪttelsen. FÃķr reglerade branscher som hÃĪlsovÃĨrd, finans och offentlig sektor ÃĪr data-suverÃĪnitet ofta den primÃĪra drivkraften fÃķr lokal inferens. Att kÃķra AI-arbetsbelastningar bakom en fÃķretagsbrandvÃĪgg bevarar befintliga sÃĪkerhetsperimeter, minskar multitenant-exponering, fÃķrenklar regelefterlevnad och hÃĨller kÃĪnsliga data utanfÃķr delad molninfrastruktur. Hyperskale-leverantÃķrer erbjuder stark sÃĪkerhet, men attackytan och fÃķrtroendekedjan ÃĪr inherenter bredare. FÃķretag fÃķredrar alltmer inferens-arkitekturer som stÃĪmmer Ãķverens med deras befintliga sÃĪkerhetspostur.

FÃķrutom problem med latens och sÃĪkerhet blir energitillgÃĪnglighet en lika viktig begrÃĪnsning. Stora hyperskale-campus mÃķter ofta flerÃĨriga fÃķrseningar pÃĨ grund av transmissionsbegrÃĪnsningar och anslutningskÃķer. Mindre kommersiella skala-distributioner, sÃĪrskilt de som ÃĪr belÃĪgna nÃĪra befintliga laster eller distribuerad generation, kan ofta energiseras mycket snabbare. Detta ÃĪr viktigt eftersom AI-efterfrÃĨgan kolliderar med en mÃĪrklig paradox.

Samtidigt som operatÃķrer kÃĪmpar fÃķr att sÃĪkra nya grid-anslutningar, kastas enorma mÃĪngder fÃķrnybar energi bort. Globalt Ãķverstiger fÃķrnybar energi-kastning nu 200 terawattimmar per ÃĨr. I USA uppskattas kastningen till cirka 20 terawattimmar per ÃĨr. ERCOT ensam kastade Ãķver 9 terawattimmar av vind- och solgenerering under ett nyligt ÃĨr. CAISO slÃĪngde bort 3,4 terawattimmar av sol- och vind i 2024, med sol som stod fÃķr 93 % av all klippt utdata. Energisystem-undersÃķkningar visar konsekvent att bÃĨde sol och vind mÃķter betydande kastning nÃĪr generationen Ãķverstiger grid-kapacitet. Sol-kastning ÃĪr sÃĪrskilt vanlig i regioner med starka middags-toppar, medan vind-kastning ofta sker under lÃĨgtrafik-timmar eller i begrÃĪnsade korridorer. Distribuerade datacenter som ÃĪr belÃĪgna nÃĪra generation, sÃĪrskilt sol-rika regioner, kan omvandla strandad energi till anvÃĪndbar inferens-kapacitet.

Hyperskale-campus kommer att fÃķrbli avgÃķrande fÃķr utbildning, men de stÃĨr infÃķr vÃĪxande fysiska och ekonomiska begrÃĪnsningar. Att ansluta till transmissionsnÃĪtet kan vara en lÃĨng process, den krÃĪver nya transformatorstationer, transmissionsuppgraderingar, multi-myndighets-tillstÃĨnd och samhÃĪllsgranskning. Dessa ÃĪr processer som rutinmÃĪssigt tar ÃĨr. Hyperskale-anlÃĪggningar krÃĪver stora markytor, betydande vatten-allokeringar och komplexa miljÃķtillstÃĨnd. SamhÃĪllen ÃĪr alltmer motvilliga till ny datacenter-utveckling pÃĨ grund av buller, vattenanvÃĪndning och markpÃĨverkan. Och centraliserade campus koncentrerar risk sÃĨ att vÃĪderhÃĪndelser, grid-avbrott eller geopolitiska stÃķrningar kan pÃĨverka stora delar av den globala berÃĪkningskapaciteten. Distribuerade arkitekturer erbjuder geografisk redundans och operativ motstÃĨndskraft.

Framtiden ÃĪr en multi-nivÃĨ AI-arkitektur

NÃĪr det gÃĪller att sÃĪkerstÃĪlla att inferens-berÃĪkningar kÃķrs sÃķmlÃķst, kan effektivitet bli lika viktig som rÃĨ kapacitet. Inferens fÃķrbrukar energi kontinuerligt, och branschanalytiker fÃķreslÃĨr att inferens kan komma att representera den stÃķrsta delen av AI-relaterad energifÃķrbrukning. Effektivitetsvinster frÃĨn lokal fÃķrnybar integration, minskade transmissionsfÃķrluster, rÃĪtt storleksdistributioner, fÃķrbÃĪttrade termiska profiler och hÃķgre utnyttjandegrad kan bli avgÃķrande fÃķr att mÃķta den globala AI-efterfrÃĨgan pÃĨ ett hÃĨllbart sÃĪtt. Distribuerade kommersiella skala-datacenter ÃĪr vÃĪl positionerade fÃķr att leverera dessa vinster eftersom de kan placeras dÃĪr energi ÃĪr riklig, billig eller outnyttjad.

NÃĪsta fas av AI-infrastruktur kommer att vara en hybrid-blandning av hyperskale-campus som dominerar utbildning, distribuerade kommersiella skala-datacenter som servar inferens, och edge-enheter som servar ultra-lokala arbetsbelastningar. Denna multi-nivÃĨ-arkitektur speglar de fysiska realiteterna av effekt, latens, sÃĪkerhet och skala. NÃĪr AI blir alltmer inbÃĪddat i realtids-system Ãķver alla branscher, mÃĨste infrastrukturen utvecklas i enlighet med detta fÃķr att bringa inferens nÃĪrmare vÃĪrlden den servar.

Jeff Thramann, M.D. ÃĪr en uppfinnare och serieentreprenÃķr som nÃĪmns i Ãķver 130 patent och som har grundat och avslutat sex fÃķretag. Som grundare och VD fÃķr LT350 ÃĪr han en lÃĪkare-entreprenÃķr och AI-infrastrukturspecialist som fokuserar pÃĨ distribuerade datormiljÃķer och nÃĪsta generations datacenterdesign som utnyttjar befintlig infrastruktur fÃķr att minimera datacenterpÃĨverkan.