Liderzy opinii

Nowy cyfrowy podział w AI: Dlaczego modele gotowe do pracy na krawędzi i oparte na procesorach CPU wygrają wojnę o koszty

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Globalny rynek sztucznej inteligencji (AI) rozwija się w oszałamiającym tempie. W 2024 roku jego wartość wynosiła 257,68 miliarda dolarÃģw, a prognozy przewidują, Åže do końca 2025 roku wyniesie 371,71 miliarda dolarÃģw, a do 2032 roku sięgnie aÅž 2,4 biliona dolarÃģw. To prawie dziesięciokrotny wzrost w ciągu menos niÅž dekady, co stanowi jeden z najbardziej przełomowych technologicznych bumÃģw w nowoÅžytnej historii.

W ciągu ostatniej dekady około 1 500 nowo załoÅžonych firm AI zabezpieczyło inwestycje przekraczające 1,5 miliona dolarÃģw, co sygnalizuje nie tylko falę innowacji, ale takÅže silną konkurencję. Ustanovione firmy rÃģwnieÅž nie siedzą bezczynnie. Według styczniowego raportu branÅžowego McKinsey, aÅž 92% organizacji planuje zwiększyć wydatki na AI w ciągu najbliÅžszych trzech lat.

Ale gdy wdraÅžanie AI przyspiesza, infrastruktura, ktÃģra ją wspiera, zaczyna wykazywać słabości. W ciągu ostatnich dwÃģch lat AI przeszło od efektownych demonstracji do ciągłych, rzeczywistych obciÄ…Åžeń.

Prawdziwe gardło nie leÅžy tylko w jakości modelu, ale w miejscu i sposobie, w jaki te modele są uruchamiane. Nowy cyfrowy podział tworzy się nie wokÃģł dostępu do danych czy talentÃģw, ale wokÃģł strategii obliczeniowej. Organizacje stają przed kluczową decyzją: kontynuować opieranie się na systemach opartych na procesorach graficznych (GPU) i chmurowych, czy przyjąć lÅžejsze, gotowe do pracy na krawędzi, architektury oparte na procesorach centralnych (CPU), ktÃģre są tańsze w eksploatacji w skali, łatwiejsze w wdroÅženiu w rÃģÅžnych środowiskach i lepiej dostosowane do potrzeb prywatności i opÃģÅšnień.

Te wybory architektoniczne mają znaczenie, poniewaÅž prawdziwe obciÄ…Åženie nie leÅžy w tworzeniu modeli, ale w ich uruchamianiu dzień po dniu. To właśnie tutaj koszty inferencji szybko przewyÅžszają koszty szkolenia i definiują ekonomię AI w skali.

Inferencja poÅžera budÅžety AI

Podczas gdy nagłÃģwki często podkreślają ogromny wydatek na szkolenie modeli pionierskich, inferencja jest rachunkiem, ktÃģry nie przestaje przychodzić. Raport AI Index z 2025 roku stanowi, Åže szybki postęp w małych modelach spowodował obniÅženie kosztÃģw osiągania “poziomu GPT-3.5” o ponad 280-krotnie między końcem 2022 a końcem 2024 roku. Jednak ten sam raport podkreśla obsesję branÅžy na optymalizację wydajności inferencji.

Cennik chmury GPU tylko zwiększył presję. Wynajmowanie wysokiej jakości instancji GPU moÅže, w perspektywie trzech do pięciu lat, kosztować prawie dwa razy więcej niÅž cena samego sprzętu. Elastyczność jest przydatna dla obciÄ…Åžeń o zmiennej intensywności, ale długotrwałe “najmy” inferencji cichaczem wyczerpują budÅžety. Nawet NVIDIA, ktÃģrej biznes opiera się na przyspieszaczach, spędziło miniony rok na agresywnym optymalizowaniu inferencji w całym swoim zestawie. To dowÃģd, Åže prawdziwa bitwa przenosi się z wydajności szkolenia na ekonomię serwisowania.

Ten pojawiający się kryzys kosztowy oznacza, Åže organizacje, ktÃģre nie są gotowe lub nie są w stanie przemyśleć swojej strategii obliczeniowej, ryzykują pozostanie w tyle.

Dlaczego krawędÅš (i procesory CPU) zmieniają krzywą kosztÃģw

Okrutna rzeczywistość jest taka, Åže inferencja oparta na GPU tworzy niewykonalną ekonomię. Uruchamianie duÅžych, rzeczywistych obciÄ…Åžeń AI na drogich GPU nie tylko zwiększa koszty, ale takÅže przyspiesza amortyzację sprzętu. Czas cyklu innowacji jest tak krÃģtki, często krÃģtszy niÅž 18 miesięcy między nowymi generacjami chipÃģw, Åže inwestycje w infrastrukturę tracą wartość szybko. To doprowadziło do ostrzeÅžeń analitykÃģw dotyczących kosztÃģw amortyzacji związanych z zakupem chipÃģw AI, poniewaÅž juÅž teraz obcinają szacunki zyskÃģw. Na przykład Alphabet ma zaabsorbować 28 miliardÃģw dolarÃģw w kosztach amortyzacji do 2026 roku.

Fabryki, kliniki, sklepy detaliczne i urządzenia mobilne to miejsca, gdzie AI będzie coraz częściej musiało działać. Wysyłanie kaÅždego Şądania do scentralizowanego klastra GPU często jest niewłaściwym narzędziem do pracy, poniewaÅž jest drogie, energochłonne i podatne na opÃģÅšnienia i problemy z prywatnością.

Środowiska krawędzi nie są jednorodnymi farmami GPU. Są to zrÃģÅžnicowane floty procesorÃģw CPU: serwery, komputery PC, laptopy i urządzenia przenośne. Ta rÃģÅžnorodność sprawia, Åže procesory CPU są naturalną podstawą dla efektywnej wdroÅženia AI.

W tym nowym krajobrazie procesory CPU nie są juÅž tylko rozwiązaniem awaryjnym, ale są rozsądną drogą do skalowalnego, dostępnego AI.

Procesory GPU jako “prywatny jet” AI

Gdy modele stają się większe i bardziej złoÅžone, wymagają coraz więcej mocy obliczeniowej GPU, co nie tylko zwiększa koszty infrastruktury i energii, ale takÅže koncentruje zaawansowane moÅžliwości AI w rękach tych, ktÃģrzy mogą je sobie pozwolić.

Badania pokazują, Åže duÅže, ogÃģlne generatywne modele często zuÅžywają znacznie więcej energii i wytwarzają znacznie większe emisje dwutlenku węgla na 1000 inferencji w porÃģwnaniu z mniejszymi, specyficznymi systemami. Nawet gdy kontroluje się liczbę parametrÃģw, architektury oparte na GPU zwiększają zarÃģwno finansowe, jak i operacyjne bariery. Z czasem tworzy się wąskie gardło, sprawiając, Åže jest nieproporcjonalnie trudno dla startupÃģw, badaczy i społeczności o ograniczonych zasobach uzyskać dostęp do najnowocześniejszych narzędzi AI.

To jest problem wyłączności: procesory GPU są jak prywatne samoloty AI, są szybkie i potęŞne, ale dostępne tylko dla wąskiego kręgu dobrze finansowanych organizacji.

Ale uznawanie tych ograniczeń nie oznacza odrzucenia procesorÃģw GPU całkowicie. Nadal są one wyjątkowe dla pewnych klas modeli i wzorcÃģw przepływu. Strategia oparta na procesorach CPU nie jest anty-GPU. Jest to rozwiązanie oparte na efektywności kosztowej.

Ten podejście rozszerza dostęp i zapewnia, Åže wdroÅženie AI jest napędzane przez efektywność, a nie prestiÅž. Zamiast przyszłości określonej przez wyłączność GPU, procesory CPU otwierają drzwi do skalowalnego, zrÃģwnowaÅžonego i inkluzywnego wdroÅženia AI.

Konieczna zmiana na modele napędzane procesorami CPU

Jeśli gospodarka AI ma się rozwijać w sposÃģb zrÃģwnowaÅžony, rozwiązaniem jest przemyślenie, w jaki sposÃģb modele są szkolone i wdraÅžane. Jednym z podejść jest priorytetowanie danych o wysokiej entropii i przypadkÃģw granicznych podczas szkolenia. Te dane napędzają znaczący postęp i mogą zmniejszyć potrzebę ogromnych zbiorÃģw danych, pozwalając modelom działać z mniejszą liczbą parametrÃģw, pozostając przy tym bardzo skuteczne.

Poprzez to, Åže są wystarczająco kompaktowe, aby działać na procesorach CPU, niezaleÅžnie od tego, czy są to laptopy, smartfony, serwery czy urządzenia Internetu Rzeczy (IoT), te modele drastycznie zmniejszają koszty inferencji i zuÅžycie energii. Pozwalają rÃģwnieÅž na przetwarzanie w czasie rzeczywistym bezpośrednio na urządzeniu, zmniejszając opÃģÅšnienia i poprawiając prywatność przez utrzymanie danych wraÅžliwych lokalnie.

Ta zmiana nie dotyczy tylko kosztÃģw; jest to rÃģwnieÅž kwestia rÃģwności. W sektorach takich jak opieka zdrowotna, gdzie “pustynie” dostępu juÅž istnieją, wdroÅženie gotowych do pracy na krawędzi modeli opartych na procesorach CPU moÅže pomÃģc w zamykaniu luk, dostarczając zaawansowane narzędzia AI bezpośrednio do klinik, centrÃģw telefonicznych lub urządzeń polowych bez konieczności korzystania z rzadkich, scentralizowanych zasobÃģw obliczeniowych. Rezultatem jest szersze przyjęcie, poprawiona odporność i bardziej inkluzywny rozkład korzyści AI.

Od mocy do dostępu: Procesory CPU jako wielki rÃģwny w AI

Nadchodzące lata nie będą tylko testować, kto moÅže zbudować najpotęŞniejsze modele AI, ale kto moÅže je dostarczyć efektywnie, zrÃģwnowaÅženie i w skali. Modele zoptymalizowane dla procesorÃģw CPU i gotowe do pracy na krawędzi oferują drogę do przodu. Poprzez umoÅžliwienie AI działać skutecznie na sprzęcie komutowym, zmniejszają bariery dla startupÃģw i badaczy, redukują zaleÅžność od kruchych łańcuchÃģw dostaw i wprowadzają zaawansowane aplikacje do środowisk, w ktÃģrych scentralizowane klastry GPU są niepraktyczne.

Ocena infrastruktury AI za pomocą wskaÅšnikÃģw takich jak całkowity koszt na godzinę transkrypcji, wyniki wdroÅženia i gotowość do pracy na krawędzi zapewnia, Åže rozwiązania są oceniane nie tylko pod kątem dokładności benchmarkowej, ale takÅže pod kątem ich zdolności do skalowania w sposÃģb przystępny i inkluzywny w świecie rzeczywistym.

Stawka jest wysoka. Jeśli branÅža będzie nadal traktować procesory GPU jako domyślne, dostęp pozostanie wyłączny, innowacje będą skoncentrowane, a dyfuzja do usług publicznych, opieki zdrowotnej i słabiej obsługiwanych sektorÃģw będzie opÃģÅšniona. Ale jeśli strategie oparte na procesorach CPU i gotowe do pracy na krawędzi wezmą gÃģrę, AI moÅže stać się bardziej odpornym, prywatnym i zrÃģwnowaÅžonym. To nie tylko wyrÃģwnuje pole gry, ale je rÃģwnieÅž definiuje na nowo.

Ritu Mehrotra, ZałoÅžyciel i Dyrektor Generalny Shunya Labs, jest doświadczonym liderem w dziedzinie technologii konsumenckiej i sztucznej inteligencji, ktÃģry rozwinął firmy na terenie Ameryki PÃģłnocnej, Azji i Europy. Jako osoba, ktÃģra przezwycięŞyła raka, jest teraz zaangaÅžowana w poprawę zdrowia psychicznego na całym świecie, likwidując bariery dostępu, jakości i przystępności.