Liderzy opinii
Dlaczego następna faza infrastruktury sztucznej inteligencji wymaga więcej niż tylko centrów danych o skali hiperskali

Sztuczna inteligencja wkracza w okres, w którym strategia infrastruktury staje się nieodłączna od możliwości modelu. Przez lata centra danych o skali hiperskali napędzały rozwój dużych modeli szkoleniowych, umożliwiając wzrost modeli z milionów do bilionów parametrów. Jednak wraz z przyspieszaniem wdrożeń sztucznej inteligencji w przedsiębiorstwach, branżach i systemach czasu rzeczywistego, wnioskowanie zastępuje szkolenie jako dominujące obciążenie, a wnioskowanie ma fundamentalnie różne wymagania.
Następna era sztucznej inteligencji nie może być wspierana tylko przez centra danych o skali hiperskali. Zamiast tego pojawia się model hybrydowy, w którym scentralizowane kampusy szkoleniowe są uzupełniane przez rozproszone, dostosowane do mocy, komercyjne centra danych o skali dla wnioskowania. Tendencja ta jest napędzana przez ograniczenia opóźnienia, potrzeby suwerenności danych, realia energetyczne i fizyczne ograniczenia dalszej ekspansji hiperskali.
Rozbieżność szkolenia i wnioskowania
Szkolenie pozostaje scentralizowaną działalnością. Wymaga ogromnych klastrów, wysokowydajnych potoków danych i długotrwałych zadań, które korzystają z efektów skali. Centra danych o skali hiperskali są zoptymalizowane pod tym względem, z gęstymi obliczeniami, specjalistycznymi tkaninami sieciowymi i globalną dostępnością. Jednak wnioskowanie zachowuje się inaczej. Jest to krótkotrwałe, o dużej objętości, wrażliwe na opóźnienie i często związane z geografią lub granicami przedsiębiorstwa. Analizy najnowsze badania Akamai dotyczące systemów agentowych pokazują, że większość organizacji celuje obecnie w opóźnienie końcowe do 500 milisekund dla krytycznych przypadków użycia sztucznej inteligencji, a przepływy pracy wieloagentowe często przekraczają ten próg tylko ze względu na transmisję sieciową i wykonanie po stronie CPU.
Opóźnienie nie jest abstrakcyjną miarą. W robotyce i systemach autonomicznych pętle sterujące często działają z częstotliwością 100 do 1000 herców co 1 do 10 milisekund. Każda inteligencja poza pokładem musi szanować te ograniczenia czasowe. 50-milisekundowa podróż w obie strony do odległego centrum danych całkowicie łamie reżim sterowania. W handlu finansowym i wykrywaniu oszustw milisekundy decydują o wynikach ekonomicznych. W automatyce przemysłowej opóźnione wnioskowanie może destabilizować procesy lub naruszyć bezpieczeństwo. A w interaktywnych doświadczeniach, takich jak gry, AR/VR i współpilotowanie w czasie rzeczywistym, responsywność pogarsza się ostro powyżej 100 do 150 milisekund.
Nowoczesne systemy sztucznej inteligencji coraz częściej polegają na przepływach pracy wieloagentowych składających się z łańcuchów kilkudziesięciu sekwencyjnych połączeń. Analiza Akamai pokazuje, że wykonanie po stronie CPU może stanowić większość całkowitego opóźnienia, a każda transmisja sieciowa dodaje dodatkową zwłokę. Przepływ pracy z 50 sekwencyjnymi połączeniami może ponieść sekundy opóźnienia transportowego, gdy jest kierowany do odległego regionu hiperskali. Umieszczenie tego samego przepływu pracy w hiperlokalnym centrum danych zlokalizowanym na tym samym kampusie lub w obszarze metropolitalnym zmienia fizykę. Lokalne wnioskowanie może dostarczyć opóźnienie w obie strony od 1 do 5 milisekund. 50-krokowy przepływ pracy, który w odległym regionie zajmie sekundy, może zostać ukończony lokalnie w 50 do 250 milisekund, pozostając w ramach budżetu opóźnienia przedsiębiorstwa.

Suwerenność danych i realia sieciowe napędzające wdrożenia lokalne
Opóźnienie to tylko część historii. Dla regulowanych branż, takich jak opieka zdrowotna, finanse i sektor publiczny, suwerenność danych jest często głównym motywem dla wnioskowania lokalnego. Uruchamianie obciążeń sztucznej inteligencji za firewallem przedsiębiorstwa zachowuje istniejące obwody bezpieczeństwa, redukuje narażenie na wielodostępność, upraszcza zgodność i utrzymuje wrażliwe dane poza współdzieloną infrastrukturą chmury. Dostawcy hiperskali oferują silne bezpieczeństwo, ale powierzchnia ataku i łańcuch zaufania są niezbywalnie szersze. Przedsiębiorstwa coraz częściej preferują architektury wnioskowania, które są zgodne z ich istniejącą postawą bezpieczeństwa.
Oprócz problemów z opóźnieniem i bezpieczeństwem, dostępność mocy staje się równie ważnym ograniczeniem. Duże centra danych o skali hiperskali często napotykają na wieloletnie opóźnienia ze względu na ograniczenia transmisji i kolejki połączeń. Mniejsze wdrożenia komercyjne, szczególnie te zlokalizowane w pobliżu istniejących obciążeń lub rozproszonej generacji, mogą często zostać zasilane znacznie szybciej. To ma znaczenie, ponieważ popyt na sztuczną inteligencję zderza się z paradoksem.
W tym samym czasie, gdy operatorzy walczą o zabezpieczenie nowych połączeń sieciowych, ogromne ilości energii odnawialnej są ograniczane. Globalnie, ograniczenie energii odnawialnej przekracza 200 terawatogodzin rocznie. W Stanach Zjednoczonych ograniczenie szacuje się na około 20 terawatogodzin rocznie. ERCOT sam ograniczył ponad 9 terawatogodzin wiatrowej i słonecznej generacji w ostatnim roku. Tymczasem CAISO odrzuciło 3,4 terawatogodziny słonecznej i wiatrowej energii w 2024 roku, przy czym energia słoneczna stanowiła 93% wszystkich obciętych wyjść. Badania systemów energetycznych konsekwentnie pokazują, że zarówno energia słoneczna, jak i wiatrowa napotykają znaczne ograniczenia, gdy generacja przekracza pojemność sieci. Ograniczenie energii słonecznej jest szczególnie powszechne w regionach z silnymi szczytami w południe, podczas gdy ograniczenie energii wiatrowej często występuje podczas godzin nocnych lub w ograniczonych korytarzach. Rozproszone centra danych zlokalizowane w pobliżu generacji, szczególnie w regionach bogatych w energię słoneczną, mogą przekształcić uwięzioną energię w przydatną pojemność wnioskowania.
Centra danych o skali hiperskali pozostaną niezbędne dla szkolenia, ale napotykają na rosnące ograniczenia fizyczne i ekonomiczne. Podłączenie do sieci transmisyjnej może być długotrwałym procesem, wymaga nowych stacji, modernizacji transmisji, wieloagencyjnych pozwoleń i przeglądu społeczności. Są to procesy, które rutynowo trwają lata. Obiekty hiperskali wymagają dużych powierzchni, znacznych przydziałów wody i złożonych zatwierdzeń środowiskowych. Społeczności są coraz bardziej oporne wobec nowych rozwojów centrów danych ze względu na hałas, zużycie wody i wpływ na ziemię. A scentralizowane kampusy koncentrują ryzyko w taki sposób, że zdarzenia pogodowe, awarie sieciowe lub zakłócenia geopolityczne mogą wpłynąć na duże części globalnej pojemności obliczeniowej. Architektury rozproszone zapewniają redundancję geograficzną i odporność operacyjną.
Przyszłość to wielopoziomowa architektura sztucznej inteligencji
Gdy chodzi o zapewnienie, że obliczenia wnioskowania działają nieprzerwanie, wydajność może stać się równie ważna, co surowa pojemność. Wnioskowanie zużywa energię w sposób ciągły, a analitycy branżowi sugerują, że wnioskowanie może ostatecznie stanowić większość zużycia energii związanej ze sztuczną inteligencją. Zyski wydajności z lokalnej integracji odnawialnej, zmniejszone straty transmisji, wdrożenia o odpowiedniej skali, ulepszone profile termiczne i wyższe wskaźniki wykorzystania staną się niezbędne do zaspokojenia globalnego popytu na sztuczną inteligencję w sposób zrównoważony. Rozproszone centra danych komercyjne są dobrze przygotowane do dostarczania tych zysków, ponieważ mogą być zlokalizowane tam, gdzie energia jest obfita, tania lub niewykorzystana.
Następna faza infrastruktury sztucznej inteligencji będzie hybrydową mieszanką centrów danych o skali hiperskali dominujących w szkoleniu, rozproszonych centrów danych komercyjnych obsługujących wnioskowanie i urządzeń brzegowych obsługujących ultra-lokalne obciążenia. Ta wielopoziomowa architektura odzwierciedla fizyczne realia mocy, opóźnienia, bezpieczeństwa i skali. Wraz z tym, jak sztuczna inteligencja staje się wbudowana w systemy czasu rzeczywistego we wszystkich branżach, infrastruktura musi ewoluować odpowiednio, aby przybliżyć wnioskowanie do świata, który obsługuje.












