Myslitelé
Proč další fáze infrastruktury umělé inteligence bude vyžadovat více než hyperscale datové centrum

Umělá inteligence vstupuje do období, kdy strategie infrastruktury se stává nedílnou součástí schopností modelu. Během let hyperscale datové centrum poháněla růst velkých škálách školení, umožňujících modelům růst z milionů na trillions parametrů. Ale jak se adopce umělé inteligence urychluje napříč podniky, odvětvími a systémy v reálném čase, inference nahrazuje školení jako dominantní zátěž, a inference má fundamentálně odlišné požadavky.
Další éra umělé inteligence nemůže být podporována pouze hyperscale zařízeními. Místo toho se vyvíjí hybridní model, kde centralizované kampusy pro školení jsou doplněny distribuovanými, energeticky vyváženými, komerčními datovými centry pro inference. Tento posun je poháněn omezeními latence, potřebami suverenity dat, energetickými realitami a fyzickými limity dalšího hyperscale rozšiřování.
Rozdíly mezi školením a inferencí
Školení zůstává centralizovanou aktivitou. Požaduje masivní klastry, vysokorychlostní datové potrubí a dlouhodobé úkoly, které profitují z ekonomie měřítka. Hyperscale kampusy jsou optimalizovány pro tento účel s hustou výpočetní kapacitou, specializovanými síťovými tkaninami a globální dostupností. Ale inference se chová jinak. Je krátkodobá, objemná, citlivá na latenci a často vázaná na geografii nebo hranice podniku. Analýzy z Akamaiho recentní práce na agenticích systémech ukazují, že většina organizací nyní cílí na sub 500 milisekundovou celkovou latenci pro kritické případy použití umělé inteligence, a multi-agentní pracovní postupy často překračují tuto hranici pouze kvůli síťovému přenosu a CPU straně provedení.
Latence není abstraktní metrikou. V robotice a autonomních systémech často běží kontrolní smyčky na 100 až 1 000 hertz každých 1 až 10 milisekund. Jakékoli vnější inteligence musí respektovat tyto časové omezení. 50 milisekundová zpětná vazba do vzdáleného datového centra zcela poruší kontrolní režim. V finančním obchodování a detekci podvodů určí milisekundy ekonomické výsledky. V průmyslové automatizaci zpožděná inference může destabilizovat procesy nebo ohrozit bezpečnost. A v interaktivních zkušenostech, jako je hraní her, AR/VR a reálné časy, se odezva zhoršuje ostře nad 100 až 150 milisekundami.
Moderní systémy umělé inteligence stále více závisí na multi-agentních pracovních postupech, skládajících se z řetězců desítek sekvenčních volání. Akamaiho analýza ukazuje, že CPU straně provedení může představovat většinu celkové latence, a každá síťová zpětná vazba přidává další zpoždění. Pracovní postup s 50 sekvenčními voláními může mít sekundy transportní latence, když je směrován do vzdáleného hyperscale regionu. Umístěte stejný pracovní postup do hyperlokálního datového centra umístěného na stejném kampusu nebo metro oblasti a fyzika se změní. Místní inference může dodat 1 až 5 milisekundovou zpětnou vazbu. 50 kroků pracovního postupu, který by trval sekundy ve vzdáleném regionu, může být dokončen za 50 až 250 milisekund místně, a to zůstává v rámci podnikových rozpočtů latence.

Suverenita dat a reality sítě pohánějí místní nasazení
Latence je pouze částí příběhu. Pro regulovaná odvětví, jako je zdravotnictví, finance a veřejný sektor, suverenita dat je často primárním hnacíkem pro místní inference. Spuštění zátěží umělé inteligence za podnikovou bránou zachovává stávající bezpečnostní perimetry, snižuje expozici multitenantů, zjednodušuje dodržování předpisů a udržuje citlivé údaje mimo sdílenou cloudovou infrastrukturu. Hyperscale poskytovatelé nabízejí silnou bezpečnost, ale útočný povrch a důvěrný řetězec jsou inherentně širší. Podniky stále více preferují architektury inference, které jsou v souladu s jejich stávající bezpečnostní pozicí.
Kromě obav o latenci a bezpečnost se dostupnost energie stává stejně důležitým omezením. Velká hyperscale kampusy často čelí multiročnímu zpoždění kvůli omezením přenosu a frontám na připojení. Menší komerční datové centrum, zejména ty umístěné poblíž stávajících zátěží nebo distribuované generace, mohou být často energizovány mnohem rychleji. To záleží, protože poptávka po umělé inteligenci koliduje s podivným paradoxem.
Ve stejnou dobu, kdy operátoři bojují o zajištění nových připojení k síti, obrovské množství obnovitelné energie je omezeno. Globálně, omezení obnovitelné energie přesahuje 200 terawatt-hodin ročně. V Spojených státech je omezení odhadováno na přibližně 20 terawatt-hodin ročně. ERCOT sám omezil více než 9 terawatt-hodin větrné a solární generace v recentním roce. Zatímco CAISO odstranil 3,4 terawatt-hodiny solární a větrné energie v roce 2024, s tím, že solární energie představovala 93 % veškerého omezeného výstupu. Energetické systémy průzkumy konzistentně ukazují, že obě solární a větrná energie čelí významnému omezení, když generace překročí kapacitu sítě. Omezení solární energie je zvláště běžné v regionech s silnými poledními špičkami, zatímco omezení větrné energie často nastává během mimo špičkových hodin nebo v omezených koridorech. Distribuovaná datová centra umístěná poblíž generace, zejména solárních bohatých regionů, mohou převést izolovanou energii na užitečnou inferenční kapacitu.
Hyperscale kampusy zůstanou nepostradatelné pro školení, ale čelí rostoucím fyzickým a ekonomickým limitům. Připojení k přenosové síti může být dlouhým procesem, vyžadujícím nové transformační stanice, upgrade přenosu, víceuživatelské povolení a komunitní přezkum. Tyto jsou procesy, které rutinně trvají roky. Hyperscale zařízení vyžadují velké pozemky, významné přidělení vody a komplexní environmentální schválení. Komunity jsou stále více odporující vůči novému rozvoji datových center kvůli hluku, spotřebě vody a dopadu na půdu. A centralizované kampusy koncentrují riziko, takže povětrnostní události, výpadek sítě nebo geopolitické narušení může ovlivnit velkou část globální výpočetní kapacity. Distribuované architektury poskytují geografickou redundanci a provozní odolnost.
Budoucnost je víceúrovňová architektura umělé inteligence
Když jde o zajištění toho, aby inference výpočetní kapacity běžela bezproblémově, efektivita se může stát stejně důležitou jako surová kapacita. Inference spotřebovává energii neustále, a průmysloví analytici naznačují, že inference může nakonec představovat většinu spotřeb energie související s umělou inteligencí. Zisky z efektivnosti z místních obnovitelných zdrojů, snížení ztrát přenosu, správně dimenzovaných nasazení, vylepšených tepelných profilů a vyšších úrovní využití se stanou nezbytnými pro splnění globální poptávky po umělé inteligenci udržitelným způsobem. Distribuovaná komerční datová centra jsou dobře umístěna k dodání těchto zisků, protože mohou být umístěna tam, kde je energie hojná, levná nebo nevyužitá.
Další fáze infrastruktury umělé inteligence bude hybridní směsí hyperscale kampusů, které dominují školení, distribuovaných komerčních datových center, která obsluhují inference, a zařízení na okraji, která obsluhují ultra-místní zátěže. Tato víceúrovňová architektura odráží fyzické reality energie, latence, bezpečnosti a měřítka. Jak se umělá inteligence stává součástí systémů v reálném čase napříč všemi odvětvími, infrastruktura se musí vyvíjet odpovídajícím způsobem, aby inference byla bližší světu, který slouží.












