Tankeledare
Varför nästa fas av AI-infrastruktur kommer att kräva mer än hyperskala datacenter

Artificiell intelligens går in i en period där infrastrukturstrategi blir oupplösligt kopplad till modellförmåga. Under många år har hyperskala datacenter drivit fram utvecklingen av storskalig utbildning, vilket har möjliggjort att modeller kan växa från miljoner till biljoner parametrar. Men när AI-användningen accelererar över företag, branscher och realtidsystem, ersätter inferens utbildning som den dominerande arbetsbelastningen, och inferens har fundamentalt olika krav.
Nästa era av AI kan inte stödjas av hyperskala-anläggningar ensamma. Istället uppstår en hybridmodell där centraliserade campus för utbildning kompletteras med distribuerade, effektoptimerade, kommersiella datacenter för inferens. Denna förändring drivs av latensbegränsningar, datasuveränitetsbehov, energirealiteter och de fysiska gränserna för fortsatt hyperskaleutveckling.
Avvikelsen mellan utbildning och inferens
Utbildning förblir en centraliserad aktivitet. Den kräver massiva kluster, höghastighetsdata-pipelines och långvariga jobb som drar nytta av stordriftsfördelar. Hyperskala-campus är optimerade för detta med tät beräkning, specialiserade nätverksvävar och global tillgänglighet. Men inferens beter sig annorlunda. Den är kortvarig, högvolym, latenskänslig och ofta knuten till geografi eller företagsgränser. Analyser från Akamais senaste arbete om agenter visar att de flesta organisationer nu siktar på en slut-till-slut-latens på under 500 millisekunder för kritiska AI-användningsfall, och multiagent-arbetsflöden ofta överstiger den tröskeln enbart på grund av nätverksöverföring och CPU-sidig exekvering.
Latens är inte en abstrakt mått. Inom robotteknik och autonoma system körs kontrollloopar ofta med 100 till 1 000 hertz var 1 till 10 millisekunder. All avlägsen intelligens måste respektera dessa tidsbegränsningar. En 50 millisekunders tur- och returresa till ett avlägset datacenter bryter kontrollregimen helt. Inom finansiell handel och bedrägeridetektering bestäms ekonomiska resultat av millisekunder. Inom industriell automation kan fördröjd inferens destabilisera processer eller äventyra säkerheten. Och i interaktiva upplevelser som spel, AR/VR och realtidsco-piloter försämras svarstiden kraftigt ovanför 100 till 150 millisekunder.
Modern AI-system är alltmer beroende av multiagent-arbetsflöden som består av kedjor av dussintals sekventiella samtal. Akamais analys visar att CPU-sidig exekvering kan stå för den största delen av den totala latensen, och varje nätverksomgång tillför ytterligare fördröjning. Ett arbetsflöde med 50 sekventiella samtal kan ådra sig sekunder av transportlatens när det dirigeras till ett avlägset hyperskale-område. Placera samma arbetsflöde i ett hyperlokalt datacenter beläget på samma campus eller storstadsområde och fysiken förändras. Lokal inferens kan leverera 1 till 5 millisekunders tur- och retur-latens. Ett 50-stegs-arbetsflöde som skulle ta sekunder i ett avlägset område kan slutföras på 50 till 250 millisekunder lokalt, vilket håller sig inom företagets latensbudget.

Data-suveränitet och grid-realiteter som driver lokala distributioner
Latens är bara en del av berättelsen. För reglerade branscher som hälsovård, finans och offentlig sektor är data-suveränitet ofta den primära drivkraften för lokal inferens. Att köra AI-arbetsbelastningar bakom en företagsbrandvägg bevarar befintliga säkerhetsperimeter, minskar multitenant-exponering, förenklar regelefterlevnad och håller känsliga data utanför delad molninfrastruktur. Hyperskale-leverantörer erbjuder stark säkerhet, men attackytan och förtroendekedjan är inherenter bredare. Företag föredrar alltmer inferens-arkitekturer som stämmer överens med deras befintliga säkerhetspostur.
Förutom problem med latens och säkerhet blir energitillgänglighet en lika viktig begränsning. Stora hyperskale-campus möter ofta fleråriga förseningar på grund av transmissionsbegränsningar och anslutningsköer. Mindre kommersiella skala-distributioner, särskilt de som är belägna nära befintliga laster eller distribuerad generation, kan ofta energiseras mycket snabbare. Detta är viktigt eftersom AI-efterfrågan kolliderar med en märklig paradox.
Samtidigt som operatörer kämpar för att säkra nya grid-anslutningar, kastas enorma mängder förnybar energi bort. Globalt överstiger förnybar energi-kastning nu 200 terawattimmar per år. I USA uppskattas kastningen till cirka 20 terawattimmar per år. ERCOT ensam kastade över 9 terawattimmar av vind- och solgenerering under ett nyligt år. CAISO slängde bort 3,4 terawattimmar av sol- och vind i 2024, med sol som stod för 93 % av all klippt utdata. Energisystem-undersökningar visar konsekvent att både sol och vind möter betydande kastning när generationen överstiger grid-kapacitet. Sol-kastning är särskilt vanlig i regioner med starka middags-toppar, medan vind-kastning ofta sker under lågtrafik-timmar eller i begränsade korridorer. Distribuerade datacenter som är belägna nära generation, särskilt sol-rika regioner, kan omvandla strandad energi till användbar inferens-kapacitet.
Hyperskale-campus kommer att förbli avgörande för utbildning, men de står inför växande fysiska och ekonomiska begränsningar. Att ansluta till transmissionsnätet kan vara en lång process, den kräver nya transformatorstationer, transmissionsuppgraderingar, multi-myndighets-tillstånd och samhällsgranskning. Dessa är processer som rutinmässigt tar år. Hyperskale-anläggningar kräver stora markytor, betydande vatten-allokeringar och komplexa miljötillstånd. Samhällen är alltmer motvilliga till ny datacenter-utveckling på grund av buller, vattenanvändning och markpåverkan. Och centraliserade campus koncentrerar risk så att väderhändelser, grid-avbrott eller geopolitiska störningar kan påverka stora delar av den globala beräkningskapaciteten. Distribuerade arkitekturer erbjuder geografisk redundans och operativ motståndskraft.
Framtiden är en multi-nivå AI-arkitektur
När det gäller att säkerställa att inferens-beräkningar körs sömlöst, kan effektivitet bli lika viktig som rå kapacitet. Inferens förbrukar energi kontinuerligt, och branschanalytiker föreslår att inferens kan komma att representera den största delen av AI-relaterad energiförbrukning. Effektivitetsvinster från lokal förnybar integration, minskade transmissionsförluster, rätt storleksdistributioner, förbättrade termiska profiler och högre utnyttjandegrad kan bli avgörande för att möta den globala AI-efterfrågan på ett hållbart sätt. Distribuerade kommersiella skala-datacenter är väl positionerade för att leverera dessa vinster eftersom de kan placeras där energi är riklig, billig eller outnyttjad.
Nästa fas av AI-infrastruktur kommer att vara en hybrid-blandning av hyperskale-campus som dominerar utbildning, distribuerade kommersiella skala-datacenter som servar inferens, och edge-enheter som servar ultra-lokala arbetsbelastningar. Denna multi-nivå-arkitektur speglar de fysiska realiteterna av effekt, latens, säkerhet och skala. När AI blir alltmer inbäddat i realtids-system över alla branscher, måste infrastrukturen utvecklas i enlighet med detta för att bringa inferens närmare världen den servar.












