Myslitelé
Svatý grál výpočetního výkonu v AI

Přes úžasné pokroky jsou schopnosti umělé inteligence stále omezeny ve srovnání s očekáváním z reálného světa. Budujeme komplexní modely, spouštíme neuronové sítě a testujeme algoritmy, ale někdy se pokrok zastaví na místech, kde to nejméně očekáváme.
Problém často spočívá ne v algoritmech nebo datech, ale ve výpočetním výkonu, zdrojích, které umožňují modelům učit se a fungovat v požadované škále. Co tedy stojí za touto bariérou? Podívejme se na kritický zdroj, bez kterého ani nejperspektivnější projekty AI nemohou opustit laboratoř.
Deficit výpočetního výkonu a jeho důsledky
Abychom pochopili tuto problematiku, začněme s historií mobilní komunikace. Když se objevily sítě 3G a později 4G, internet byl již téměř globální. A když byla zavedena síť 5G, mnoho lidí se ptalo na zcela rozumnou otázku: „Internet bude rychlejší – ale co z toho?“
Ve skutečnosti zvýšení rychlosti internetu nespočívá v uživatelské pohodlí. Změní celý technologický krajinný ráz. Vznikají použití, která byla dříve nemožná. 5G se ukázalo být mnohem rychlejší než 4G, a tento skok nebyl postupný, jako skok z 1G na 2G, ale exponenciální. V důsledku toho se objevily nové aplikace, zařízení a celé třídy technologií.
Kamery na semaforech, systémy pro analýzu provozu v reálném čase a automatizované mechanismy pro regulaci provozu – vše toto je možné díky novým komunikačním technologiím. Policie získává nové způsoby výměny dat a ve vesmíru mohou teleskopy a satelity přenášet obrovské množství informací na Zemi. Kvalitativní skok v základních technologiích pohání vývoj celého ekosystému.
Stejný princip platí i pro výpočetní výkon. Představte si celkovou výpočetní kapacitu lidstva v hypotetických jednotkách. Dnes bychom mohli mít, řekněme, deset takových jednotek. S nimi můžeme generovat obrázky a videa, psát texty, vytvářet marketingový materiál… To je již podstatné, ale rozsah aplikací je omezený.
Teď si představte, že bychom neměli deset, ale tisíc takových jednotek. Najednou se stávají dostupnými technologie, které byly dříve příliš drahé, a startupy, které byly opuštěny kvůli vysokým výpočetním nákladům, začínají mít ekonomický smysl.
Vezměme si například robotaxi. Dnes se většinou spoléhají na relativně slabé lokální počítače instalované ve vozidle. Pokud by však byl video tok přenesen do cloudu s enormními výpočetními zdroji, data by mohla být zpracována a vrácena v reálném čase. A to je kritické: auto pohybující se rychlostí 100 km/h musí učinit rozhodnutí za zlomek sekundy – jet rovně, zatáhnout, brzdit nebo nebrzdit.
To je okamžik, kdy se plně funkční průmysl robotaxi stává možným, ne jen izolované řešení, jaká vidíme dnes. Každý lokální počítač instalovaný v autě je sám o sobě omezený způsobem, kterýmu není spojovací systém. Čím rychleji můžeme škálovat, tím rychleji se bude měnit svět kolem nás.
Přístup k čipům a „zlatý lístek“ v AI
V kontextu výpočetního výkonu vzniká otázka: stává se přístup k moderním čipům „zlatým lístkem“ pro vstup na trh AI? Vzniká-li mezera mezi velkými hráči, kteří uzavírají smlouvy s výrobci čipů nebo je sami vyrábějí, a všemi ostatními?
Tato mezera vzniká pouze v jednom případě: pokud je obchodní model zaměřen výhradně na prodej čipů velkým klientům. Ve skutečnosti se výrobci jako NVIDIA snaží poskytovat cloudová řešení pro všechny. Jejich optimalizované čipy jsou dostupné v cloudu pro OpenAI i nezávislé vývojáře.
Navíc strategická partnerství mezi společnostmi, jako jsou Google, Anthropic, Microsoft, OpenAI, Amazon a NVIDIA, jsou primárně partnerství pro sdílení zdrojů, nikoli pokusy o uzavření trhu. Tento model umožňuje efektivní alokaci výpočetních zdrojů, a tím urychluje technologický rozvoj.
Pokud sledujeme řetězec využití výpočetních zdrojů, začíná u koncového uživatele. Například, když používáte WhatsApp pro videohovory a zasílání zpráv, společnost musí zajistit, aby služba fungovala: ukládání a zpracování dat, spouštění modelů pro čištění videa, přidávání efektů a zlepšování kvality obrazu.
Údržba vlastních serverů je drahá, stárnou a vyžadují neustálou údržbu. Proto se objevila cloudová řešení, „cloud“. Trh dominují tři hráči: Google Cloud, AWS a Microsoft Azure. Ostatní společnosti nemohou soutěžit na této úrovni: rozsah infrastruktury je příliš velký.
Cloudová řešení jsou obrovská datová centra s chlazením, napájením a nepřetržitou údržbou. Obsahují servery a specializované čipy od NVIDIA, AMD a dalších výrobců, které umožňují rozsáhlé výpočetní procesy.
Zde se dostáváme k hlavnímu otázce, o které jsem diskutoval v předchozím článku o datových centrech, a chtěl bych ji zde dále probrat: co je hlavní úzké místo v tomto systému? Je to nedostatek elektřiny nebo obtížnost chlazení datových center v regionech, kde klima dělá to zvláště náročné? Ve skutečnosti leží tajemství v čipech samotných…
Svatý grál
Proč je NVIDIA dnes hodnocena kolem 5 bilionů dolarů a počítána mezi nejúspěšnější veřejně obchodované společnosti na světě? Důvod je jednoduchý: NVIDIA vyrábí čipy, na kterých se trénují a spouštějí modely AI.
Každý z těchto čipů spotřebuje enormní množství elektřiny při trénování velkých modelů nebo zpracování neustále rostoucích objemů dat. Ale jak efektivně je tato energie využívána? Zde přicházejí specializované čipy do hry; zpracovávají specifické úkoly mnohem efektivněji než obecné účelové GPU.
Modely AI se liší. OpenAI, například, má jednu rodinu modelů, Anthropic jinou. Koncepty mohou být podobné, ale matematické struktury a výpočetní procesy jsou odlišné. Jeden obecný čip, který trénuje modely OpenAI (jako ChatGPT) versus modely Anthropic (jako Claude), funguje jako „univerzální nástroj“, spotřebuje, řekněme, 100 000 hodin výpočtu pro jeden model a 150 000 pro druhý. Efektivita se značně liší a je zřídka optimální.
Společnosti řeší tento problém produkcí specializovaných čipů. Například jeden čip může být optimalizován pro architekturu ChatGPT a trénovat ji za, řekněme, 20 minut, zatímco jiný je přizpůsoben architektuře Anthropic a také dokončuje trénink za 20 minut. Spotřeba energie a tréninkový čas jsou sníženy mnohokrát ve srovnání s obecným čipem.
Když tyto čipy jsou prodávány velkým společnostem, jako jsou Google, Amazon, Microsoft nebo Azure, jsou nabízeny jako samostatné produkty. Uživatelé si mohou vybrat, například, čip optimalizovaný pro model YOLO nebo jednodušší a levnější čip pro architekturu Xen. Tímto způsobem získávají společnosti přístup k výpočetním zdrojům přesně přizpůsobeným jejich úkolu, místo toho, aby kupovaly obecné účelové GPU. Pokud má uživatel deset různých funkcí, může použít deset různých specializovaných čipů.
Trend je jasný: specializované čipy postupně nahrazují obecné účelové čipy. Mnoho startupů nyní pracuje s ASIC (Application-Specific Integrated Circuits), čipy navržené pro specifické výpočetní úkoly. První ASIC se objevily pro těžbu Bitcoinu: původně se Bitcoin těžil na čipech NVIDIA, poté byly vytvořeny čipy výhradně pro Bitcoin a nebyly schopny provádět jiné úkoly.
Vidím to v praxi: stejná hardwarová konfigurace může produkovat zcela odlišné výsledky v závislosti na úkolu. V mém startupu Introspector studujeme tyto procesy v reálných projektech, a jako strategický poradce Keymakr pozoruji, jak klienti získávají efektivitu ze specializovaných čipů, což umožňuje modelům fungovat rychleji. Projekty, které dříve stagnovaly během tréninku nebo inferencing, dosahují stabilních výsledků s tímto přístupem.
Avšak úzká specializace nese rizika. Čip optimalizovaný pro architekturu Anthropic nebude fungovat pro trénink modelů OpenAI, a naopak. Každá nová architektura vyžaduje novou generaci hardwaru, což vytváří riziko velkého „zastarání“. Pokud Anthropic zítra vydá novou architekturu, všechny předchozí generace čipů se stanou neefektivními nebo zbytečnými. Výroba nových čipů stojí miliardy dolarů a může trvat roky.
To vytváří dilema: měli bychom vyrábět specializované čipy, které fungují dokonale v úzkém scénáři, nebo pokračovat ve výrobě obecných účelových čipů, které řeší všechny úkoly středně dobře, ale nevyžadují kompletní výměnu, když se architektury mění?
Efektivita v tomto kontextu je měřena třemi primárními parametry: době běhu, spotřebě elektřiny a generování tepla. Tyto metriky jsou přímo související: čím déle systém běží, tím více energie spotřebuje a tím více tepla produkuje. Snížení jednoho parametru automaticky zlepšuje ostatní dva.
Zde leží „svatý grál“ výkonu AI: pokud lze alespoň jeden z fundamentálních efektivních metrik optimalizovat, ostatní metriky se téměř automaticky zlepšují také.
Udržitelný proces
S rostoucím využíváním specializovaných čipů se stává problémem nadprodukce. V současné době je již přebytek zařízení značný a společnosti řeší tuto problematiku různými udržitelnými způsoby, včetně opětovného využití stávajících zdrojů.
Recyklace zařízení se stala klíčovým prvkem udržitelného rozvoje v high-tech průmyslu. Čipy obsahují značné množství drahých a základních kovů, zlata, mědi, hliníku, palladia a vzácných materiálů, jakož i materiálů používaných v mikročipech a tranzistorech. Jakmile se zařízení stane zastaralým, tyto cenné zdroje lze vrátit do výroby, snížit náklady na nové komponenty a současně snížit environmentální stopu průmyslu.
Některé specializované továrny a společnosti se zaměřují na recyklaci a extrakci drahých kovů z zastaralých komponent. Například některé zařízení používají hydrometalurgické procesy a pokročilé chemické metody k extrakci zlata a mědi s vysokou čistotou, což umožňuje再utilizovat tyto materiály v nových čipech.
Kromě toho společnosti implementují uzavřené modely, kde se stará zařízení modernizuje nebo integruje do nových řešení, čímž se snižuje potřeba primární extrakce zdrojů. Takové přístupy nejen pomáhají minimalizovat odpad, ale také snižují uhlíkovou stopu výroby, protože tradiční těžba a zpracování kovů vyžadují značné množství energie.
Udržitelné řízení životního cyklu čipů a zařízení by mohlo se stát průmyslovým standardem, kde technologický pokrok je v souladu s environmentální odpovědností.












