Liderzy opinii

Nowa gospodarka AI oparta jest na tokenach, ale mierzymy je wszystkie niepoprawnie

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

W AI zachodzi zmiana, ktÃģrej większość ludzi jest świadoma, ale nie do końca ją rozumie: przeszliśmy od liczenia Şądań do liczenia tokenÃģw.

W erze internetu mierzyliśmy systemy w Şądaniach na sekundę. Było to czyste, intuicyjne i w większości przypadkÃģw dokładne. Åŧądanie przychodziło, odpowiedÅš wychodziła, i moÅžna było skalować infrastrukturę wokÃģł tego modelu.

Ta abstrakcja zniknęła.

W AI podstawową jednostką nie jest juÅž Şądanie — jest to token. KaÅžde Şądanie, kaÅžda odpowiedÅš i kaÅždy łańcuch rozumowania jest rozłoÅžony na tokeny, reprezentujące pracę, ktÃģrą wykonuje system, poniesione koszty i, coraz częściej, tworzoną wartość.

Naturalnie, branÅža zjednoczyła się wokÃģł tej zmiany, wprowadzając metryki takie jak tokeny na sekundę, koszt na token i nawet przychÃģd na token. Wydaje się, Åže wreszcie znaleÅšliśmy sposÃģb, aby zmierzyć systemy AI. Ale ten sposÃģb myślenia jest niekompletny.

BranÅžowy skrÃģt: tokeny rÃģwnają się wartości

Rozwija się narracja, Åže tokeny są nową walutą AI — Åže więcej tokenÃģw oznacza więcej inteligencji i, w konsekwencji, więcej przychodu. To kusząca idea, ale upraszcza to, co tak naprawdę dzieje się wewnątrz tych systemÃģw.

Nie wszystkie tokeny są rÃģwne. NiektÃģre reprezentują prawdziwą pracę: analizę danych, generowanie spostrzeÅžeń, automatyzację workflow i wspieranie decyzji, ktÃģre napędzają wyniki biznesowe. Inne są o wiele mniej znaczące — generowanie treści, eksperymenty lub przypadki uÅžycia, ktÃģre nigdy nie przechodzą do produkcji.

MoÅžna juÅž to zobaczyć wewnątrz przedsiębiorstw. Jeden zespÃģł moÅže wygenerować miliony tokenÃģw, aby wspierać produktywność deweloperÃģw lub operacje klientÃģw, bezpośrednio wpływając na efektywność i przychÃģd. Inny zespÃģł moÅže wygenerować tę samą ilość tokenÃģw, eksperymentując z narzędziami, ktÃģre nigdy nie przechodzą poza wewnętrzne eksperymenty. Na papierze liczby tokenÃģw wyglądają identycznie. W rzeczywistości wartość biznesowa jest zupełnie inna.

Traktowanie wszystkich tokenÃģw jako wymiennych jednostek wartości tworzy zniekształcony widok tego, co AI tak naprawdę robi wewnątrz organizacji. Przedsiębiorstwa nie są budowane na ilości tokenÃģw; są budowane na tym, co te tokeny umoÅžliwiają.

Aby zrozumieć tę rÃģÅžnicę, trzeba spojrzeć pod powierzchnię, jak te systemy naprawdę działają.

Dlaczego twoje drugie Şądanie jest szybsze niÅž twoje pierwsze

Jeśli kiedykolwiek uÅžywałeś narzędzia takiego jak ChatGPT, zauwaÅžyłeś, Åže twoje drugie pytanie jest często szybsze niÅž twoje pierwsze. To zachowanie nie wynika z tego, Åže model staje się mądrzejszy — wynika z tego, jak system ponownie wykorzystuje kontekst z poprzednich Şądań.

WspÃģłczesne systemy AI nie przetwarzają kaÅždego Şądania w izolacji. Budują kontekst, przechowując poprzednie Şądania i odpowiedzi w pamięci, często w tym, co nazywa się pamięcią podręczną. Ta pamięć podręczna znajduje się blisko GPU, aby mogła być szybko dostępna podczas generowania odpowiedzi na następne Şądania.

Pierwsze Şądanie jest drogie, poniewaÅž inicjuje ten stan — alokuje pamięć, przetwarza dane wejściowe i buduje kontekst. Następne Şądania wykorzystują ten stan, co redukuje opÃģÅšnienia i poprawia responsywność.

Ten dynamiczny staje się coraz waÅžniejszy, gdy okna kontekstu rozciągają się z tysięcy do setek tysięcy — lub nawet milionÃģw — tokenÃģw. Im więcej kontekstu system przechowuje, tym większą presję wywiera na pamięć i infrastrukturę, co sprawia, Åže decyzja o tym, co zostanie przechowane, skompresowane lub odrzucone, staje się krytyczna.

Z perspektywy uÅžytkownika wydaje się to szybszym systemem. Z perspektywy infrastruktury jest to złoÅžony kompromis między pamięcią, opÃģÅšnieniami i kosztami.

To jest miejsce, w ktÃģrym naprawdę się dzieje praca: nie tylko w samym modelu, ale w systemie, ktÃģry go otacza.

Ostateczny limit: energia

Gdy tylko przechodzimy poza wydajność modelu, rozmowa szybko się zmienia.

Zespoły, ktÃģre uruchamiają AI w skali, nie pytają przede wszystkim, jaki model jest najlepszy. Pytają, jak go utrzymać.

Infrastruktura AI jest wypychana przez granice fizyczne: dostępność energii, pojemność chłodzenia i przepustowość pamięci. Centra danych są przebudowywane wokÃģł tych ograniczeń, a organizacje wdraÅžające systemy AI w duŞą skalę zaczynają działać bardziej jak przedsiębiorstwa uÅžyteczności publicznej niÅž tradycyjne firmy oprogramowania.

Widzimy to juÅž w duÅžych przedsiębiorstwach budujących infrastrukturę AI, gdzie energia i chłodzenie — a nie moÅžliwości modelu — stają się podstawowym ograniczeniem.

ObciÄ…Åženia AI nie skalują się czysto ani przewidywalnie. Skalują popyt na komputery, pamięć i sieci w tym samym czasie. Generowanie większej ilości tokenÃģw nie jest po prostu kwestią dodania większej ilości GPU; jest to kwestia, czy podstawowa infrastruktura moÅže utrzymać energię i obciÄ…Åženie cieplne wymagane do efektywnego działania tych systemÃģw.

Koszt generowania tokenu obejmuje więc nie tylko komputery. Obejmuje energię elektryczną, chłodzenie, infrastrukturę fizyczną i moÅžliwość utrzymania wydajności pod obciÄ…Åženiem bez degradacji.

Większość dyskusji o “koszcie na token” nie w pełni odzwierciedla tę rzeczywistość. W skali energia staje się budÅžetem, a nie tylko jednym z punktÃģw.

Przyszłość nie jest większymi modelami. To lepsze systemy.

Przez ostatnie dwa lata branÅža była skupiona na porÃģwnaniach modeli, patrząc na benchmarki, rankingi i przyrostowe usprawnienia moÅžliwości.

Ten focus zaczyna się zmieniać.

W środowiskach produkcyjnych wydajność jest mniej związana z wyborem modelu, a bardziej z tym, jak go uÅžywa się. Organizacje przechodzą w kierunku systemÃģw modeli — łącząc duÅže i małe modele, inteligentne kierowanie zadaniami i optymalizację kosztÃģw, opÃģÅšnień i przepustowości w całym workflow.

Zamiast wysyłania kaÅždego Şądania do jednego duÅžego modelu, systemy rozłamują obciÄ…Åženia na mniejsze komponenty. Prostsze zadania mogą być obsługiwane przez bardziej efektywne modele, podczas gdy złoÅžone rozumowanie jest zarezerwowane dla większych modeli. Kontekst jest ponownie wykorzystywany, gdzie tylko moÅžliwe, i strategie buforowania są stosowane agresywnie.

Te decyzje często mają większy wpływ na wydajność i koszt niÅž przełączenie się z jednego modelu na inny. W tym sensie tokeny pozostają jednostką pracy, ale system, ktÃģry je generuje i zarządza, staje się prawdziwym differentiatorem.

Najbardziej zaniedbana warstwa w systemach AI

AI jest często opisywana w kategoriach modeli po jednej stronie i aplikacji po drugiej, ale warstwa pomiędzy nimi jest miejscem, w ktÃģrym mieszka największa złoÅžoność i moÅžliwość.

<p-Ta warstwa nie tylko przenosi Şądania; kształtuje je. Określa, jak ruch jest kierowany, jak decyzje są egzekwowane i jak systemy zachowują się w warunkach rzeczywistych.

Dostawa i bezpieczeństwo nie mogą być traktowane jako odrębne problemy. Ta sama warstwa, ktÃģra kieruje Şądania i zarządza kontekstem, jest rÃģwnieÅž miejscem, w ktÃģrym są stosowane polityki, ryzyko jest łagodzone i zaufanie jest ustanawiane.

Im większa złoÅžoność, tym bardziej rozwiązania punktowe się psują. Co jest potrzebne, to zjednoczona platforma, ktÃģra moÅže koordynować te funkcje w czasie rzeczywistym, a nie szycie ich po fakcie.

To jest miejsce, w ktÃģrym dokonuje się kompromisÃģw. To miejsce, w ktÃģrym kontrolowany jest koszt, optymalizowana jest wydajność i podejmowane są decyzje dotyczące bezpieczeństwa w czasie rzeczywistym. Im bardziej systemy AI rosną, tym bardziej ta warstwa staje się waÅžna. To rÃģÅžnica między systemem, ktÃģry działa dobrze w demo, a systemem, ktÃģry działa niezawodnie i efektywnie w produkcji. Ta zmiana ma realne konsekwencje dla tego, jak organizacje projektują i zarządzają systemami AI.

Co to oznacza dla organizacji

Gdy przedsiębiorstwa wprowadzają AI do produkcji, pytanie nie jest juÅž tylko, jaki model wybrać — jest to, jak system wokÃģł niego jest zaprojektowany, aby działać.

To oznacza myślenie poza metryki tokenÃģw i benchmarki modeli, a skupienie się na tym, jak Şądania są kierowane, jak kontekst jest zarządzany i jak polityki są egzekwowane w całym workflow.

Większość organizacji wciÄ…Åž łączy te elementy — i ten podejście nie wytrzymuje presji produkcji.

Mierzymy nie tę rzecz

Tokeny zapewniają uÅžyteczną abstrakcję. Dają branÅžy sposÃģb, aby zmierzyć coś, co kiedyś wydawało się niematerialne, ale nie są pełnym obrazem.

Obecnie branÅža skłania się ku temu, co jest najłatwiej mierzone — liczbom tokenÃģw, przepustowości i metrykom kosztÃģw — zamiast tego, co jest najwaÅžniejsze. Bez kontekstu te liczby mogą być mylące.

Następna faza AI nie będzie określona przez to, kto generuje najwięcej tokenÃģw. Będzie określona przez to, kto rozumie, co te tokeny reprezentują, i kto moÅže zbudować systemy, ktÃģre przekształcą je w znaczące, efektywne i skalowalne wyniki.

PoniewaÅž w końcu tokeny nie są produktem. Są po prostu produktem ubocznym tworzonej inteligencji.

Kunal Anand jest Dyrektorem ds. ProduktÃģw w firmie F5, gdzie kieruje strategią produktową w zakresie dostarczania aplikacji, bezpieczeństwa i infrastruktury AI.