Modele i platformy AI

Dlaczego Inferencja AI, a nie szkolenie, jest następnym wielkim wyzwaniem inÅžynieryjnym

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Przez ostatnią dekadę, światło reflektorÃģw w sztucznej inteligencji było zmonopolizowane przez szkolenie. Przełomy następowały głÃģwnie dzięki ogromnym klastrom obliczeniowym, modelom o parametrach liczących biliony i miliardom dolarÃģw wydanych na naukę systemÃģw, aby “myślały”. Traktowaliśmy rozwÃģj AI głÃģwnie jako projekt budowlany: budowę wieÅžowca inteligencji. Ale teraz, gdy ten wieÅžowiec został zbudowany, prawdziwym wyzwaniem jest znalezienie sposobu, aby umoÅžliwić milionom ludzi, ktÃģrzy muszą Åžyć i działać w nim jednocześnie. To przesuwa focus badaczy AI i inÅžynierÃģw z szkolenia (akt tworzenia inteligencji) do inferencji (aktu korzystania z niej). Podczas gdy szkolenie jest ogromnym, jednorazowym wydatkiem kapitałowym (CapEx), inferencja jest ciągłym wydatkiem operacyjnym (OpEx), ktÃģry trwa nieograniczenie. Gdy przedsiębiorstwa wdroŞą agenci obsługujące miliony uÅžytkownikÃģw przez całą dobę, odkrywają oni okrutną rzeczywistość: inferencja nie jest po prostu “szkoleniem w odwrotnym kierunku”. Jest to zasadniczo inne, a moÅže nawet trudniejsze, wyzwanie inÅžynieryjne.

Dlaczego koszty inferencji mają znaczenie więcej niÅž kiedykolwiek

Aby zrozumieć wyzwanie inÅžynieryjne, trzeba najpierw zrozumieć podstawową imperatywę ekonomiczną. W fazie szkolenia, nieefektywność jest tolerowana. Jeśli uruchomienie szkolenia trwa cztery tygodnie zamiast trzech, jest to niedogodność. W inferencji jednak nieefektywność moÅže być katastrofalna dla biznesu. Na przykład, szkolenie modelu na granicy moÅže kosztować 100 milionÃģw dolarÃģw. Ale wdroÅženie tego modelu do odpowiedzi na 10 milionÃģw zapytań dziennie moÅže przekroczyć ten koszt w ciągu kilku miesięcy, jeśli nie zoptymalizuje się go. To dlatego jesteśmy świadkami przesunięcia rynku, z inwestycjami w inferencję przewidywanymi do przekroczenia inwestycji w szkolenie.

Dla inÅžynierÃģw to przesuwa słupki. Nie optymalizujemy juÅž dla przepustowości (jak szybko mogę przetworzyć ten ogromny zestaw danych?). Optymalizujemy dla opÃģÅšnienia (jak szybko mogę zwrÃģcić jeden token?) i wspÃģłbieÅžności (ile uÅžytkownikÃģw mogę obsłuÅžyć na jednym GPU?). Podejście “brute force”, ktÃģre dominowało w fazie szkolenia, po prostu dodając więcej obliczeń, nie działa tutaj. Nie moÅžesz rzucić więcej H100 na problem opÃģÅšnienia, jeśli wąskie gardło jest ograniczone przez przepustowość pamięci.

Ściana pamięci: prawdziwe wąskie gardło

Mało znana prawda o inferencji Large Language Model (LLM) jest taka, Åže rzadko jest ograniczona przez obliczenia; jest ograniczona przez pamięć. Podczas szkolenia przetwarzamy dane w ogromnych partiach, utrzymując jednostki obliczeniowe GPU w pełnym wykorzystaniu. W inferencji, szczegÃģlnie w aplikacjach w czasie rzeczywistym, takich jak czatboty lub agenci, Şądania przychodzą sekwencyjnie. KaÅždy wygenerowany token wymaga, aby model załadował swoje biliony parametrÃģw z pamięci o duÅžej przepustowości do rdzeni obliczeniowych. To jest “Ściana pamięci“. To jak mieć silnik Ferrari (rdzeń GPU) zakleszczony w korku (ograniczonej przepustowości pamięci).

To wyzwanie powoduje, Åže zespoły inÅžynierskie muszą przemyśleć architekturę systemu na poziomie krzemowym. To dlatego widzimy wzrost Linear Processing Units (LPUs), takich jak te od Groq, oraz specjalistyczne Neural Processing Units (NPUs). Te układy są zaprojektowane, aby ominąć wąskie gardło pamięci o duÅžej przepustowości, uÅžywając ogromnych ilości pamięci SRAM na chipie, traktując dostęp do pamięci jako ciągły przepływ danych, a nie jako prostą operację pobierania. Dla inÅžyniera oprogramowania to sygnalizuje koniec ery “domyślnie CUDA”. Musimy teraz pisać kod, ktÃģry jest świadomy sprzętu, rozumiejąc dokładnie, jak dane przepływają przez przewÃģd.

Nowa granica wydajności AI

PoniewaÅž nie zawsze moÅžemy zmienić sprzęt, nadchodząca granica inÅžynieryjna leÅžy w optymalizacji oprogramowania. To tam mają miejsce niektÃģre z najbardziej innowacyjnych przełomÃģw. Świadkowie jesteśmy renesansu technik, ktÃģre przedefiniowują, jak komputery implementują i wykonują sieci neuronowe.

  • CIĄGŁE PARTIE: Tradycyjne partienie czeka, aÅž “autobus” się zapełni, zanim odjedzie, co wprowadza opÃģÅšnienia. CIĄGŁE PARTIE (pionierskie przez ramy takie jak vLLM) działają jak system metra, pozwalając nowym Şądaniom dołączyć lub opuścić pociąg przetwarzania GPU na kaÅždej iteracji. To maksymalizuje przepustowość bez poświęcania opÃģÅšnienia, rozwiązując złoÅžony problem harmonogramowania, ktÃģry wymaga głębokiej ekspertyzy na poziomie systemu operacyjnego.
  • Spekulatywne dekodowanie: Ta technika zatrudnia mały, szybki i tani model, aby wykonać odpowiedÅš, podczas gdy większy, wolniejszy i bardziej zdolny model weryfikuje ją rÃģwnolegle. Opiera się na fakcie, Åže weryfikacja tekstu jest znacznie mniej kosztowna obliczeniowo niÅž generowanie go.
  • Zarządzanie pamięcią klucz-wartość: W długich rozmowach “historia” (pamięć klucz-wartość) rośnie szybko, konsumując duÅže ilości pamięci GPU. InÅžynierowie implementują teraz “PagedAttention“, technikę zainspirowaną stronicowaniem pamięci wirtualnej w systemach operacyjnych. Ta technika dzieli pamięć na fragmenty i zarządza nią nieciągle.

ZłoÅžoność agentywna

Jeśli standardowa inferencja jest trudna, Agentywna AI ją wykładniczo utrudnia. Standardowy czatbot jest bezstanowy: UÅžytkownik pyta, AI odpowiada, proces kończy się. Agenty AI mają pętlę. Planują, wykonują narzędzia, obserwują wyniki i iterują. Z punktu widzenia inÅžynierskiego, to jest koszmar. Ten shift architektoniczny wprowadza kilka fundamentalnych wyzwań:

  1. Zarządzanie stanem: Silnik inferencji musi utrzymywać “stan” procesu myślowego agenta na przestrzeni wielu krokÃģw, często rozciągających się na minuty.
  2. Pętle nieskończone: W odrÃģÅžnieniu od przewidywalnego pasa do przodu, agent moÅže utknąć w pętli rozumowania. InÅžynierowanie solidnych “watchdogÃģw” i “circuit breakers” dla kodu probabilistycznego jest nowym polem.
  3. Zmienna obliczeniowa: Jedno zapytanie uÅžytkownika moÅže spowodować pojedyncze wywołanie inferencji, podczas gdy inne mogą spowodować pięćdziesiąt. Zarządzanie obciÄ…Åženiem i infrastrukturą autoskalowania, gdy kaÅžde Şądanie niesie taką ekstremalną zmienność, wymaga całkowicie nowej klasy logiki orchestracji.

Przenosimy się zasadniczo z “obsługi modeli” do “orchestracji architektur kognitywnych.”

Przenoszenie AI do codziennych urządzeń

Wreszcie, ograniczenia energii i opÃģÅšnienia sieciowej ostatecznie zmuszą inferencję do krawędzi. Nie moÅžemy oczekiwać, Åže kaÅžda inteligentna ÅžarÃģwka, pojazd autonomiczny czy robot fabryczny będzie kierował swoje Şądania przez centrum danych. Wyzwanie inÅžynieryjne tutaj jest kompresja. Jak zmieścić model, ktÃģry nauczył się z całego Internetu, na chipie mniejszym niÅž paznokieć, działającym na baterii?

Techniki takie jak kwantyzacja (zmniejszanie precyzji z 16-bitowej do 4-bitowej lub nawet 1-bitowej) i destylacja modelu (uczenie małego modelu ucznia, aby naśladował duÅžy model nauczyciela) stają się standardową praktyką. Ale prawdziwe wyzwanie polega na wdroÅženiu tych modeli do fragmentowanej ekosystemu miliardÃģw urządzeń, takich jak Android, iOS, embedded Linux, niestandardowe sensory, kaÅžde z własnymi ograniczeniami sprzętowymi. To jest “koszmar fragmentacji” rozwoju mobilnego, pomnoÅžony przez złoÅžoność sieci neuronowych.

Podsumowanie

Wkraczamy w erę “Dzień 2” generatywnej AI. Dzień 1 był o tym, aby pokazać, Åže AI moÅže pisać poezję. Dzień 2 jest o inÅžynierii, robieniu tej zdolności bardziej niezawodnej, przystępnej i wszechobecnnej. InÅžynierowie, ktÃģrzy zdefiniują następną dekadę, niekoniecznie są tymi, ktÃģrzy wymyślają nowe architektury modeli. Są to inÅžynierowie systemowi, hakerzy jądra i architekci infrastruktury, ktÃģrzy mogą się dowiedzieć, jak obsłuÅžyć miliard tokenÃģw na sekundę bez stopienia sieci zasilającej ani bankructwa firmy. Inferencja AI nie jest juÅž tylko detalami czasu wykonywania. Jest produktem. A optymalizacja jest następnym wielkim wyzwaniem inÅžynieryjnym.

Dr. Tehseen Zia jest profesorem nadzwyczajnym w COMSATS University Islamabad, posiada tytuł doktora w dziedzinie sztucznej inteligencji na Vienna University of Technology, Austria. Specjalizując się w sztucznej inteligencji, uczeniu maszynowym, nauce o danych i widzeniu komputerowym, wniÃģsł znaczący wkład poprzez publikacje w renomowanych czasopismach naukowych. Dr. Tehseen Zia rÃģwnieÅž kierował rÃģÅžnymi projektami przemysłowymi jako głÃģwny badacz i pełnił funkcję konsultanta ds. sztucznej inteligencji.