Modely a platformy AI

Jak DeepSeek prolomil bariéru nákladů se 5,6 miliony dolarů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Konvenční moudrost v oblasti umělé inteligence naznačuje, že vývoj velkých jazykových modelů (LLM) vyžaduje hluboké kapsy – obvykle miliardy investic. Ale DeepSeek, čínský startup v oblasti umělé inteligence, právě rozbit tento paradigm s jejich nejnovějším úspěchem: vyvinul světovou třídu AI modelu za pouhých 5,6 milionu dolarů.

Model V3 od DeepSeeku může soupeřit s průmyslovými giganty jako Google Gemini (GOOGL ) a OpenAI’s latest offerings, a to vše při použití zlomku typických výpočetních zdrojů. Tento úspěch upoutal pozornost mnoha lídrů v oboru, a co je zvláště pozoruhodné, je to, že společnost tohoto dosáhla navzdory omezením exportu ze Spojených států, které omezily jejich přístup k nejnovějším Nvidia čipům (NVDA ).

Ekonomika efektivní umělé inteligence

Čísla vyprávějí přesvědčivý příběh o efektivitě. Zatímco většina pokročilých AI modelů vyžaduje mezi 16 000 a 100 000 GPU pro školení, DeepSeek zvládl s pouhými 2 048 GPU běží po dobu 57 dní. Školení modelu spotřebovalo 2,78 milionu GPU hodin na Nvidia H800 čipech – pozoruhodně skromné pro model s 671 miliardami parametrů.

Abyste si to mohli představit, Meta potřebovala přibližně 30,8 milionu GPU hodin – zhruba 11krát více výpočetní síly – pro školení svého Llama 3 modelu, který ve skutečnosti má méně parametrů, a to 405 miliard. Přístup DeepSeeku připomíná mistrovskou třídu v optimalizaci pod omezeními. Pracují s H800 GPU – AI čipy navržené Nvidia speciálně pro čínský trh s omezenými schopnostmi – společnost proměnila potenciální omezení v inovace. Místo použití hotových řešení pro komunikaci procesorů vyvinuli vlastní řešení, která maximalizovala efektivitu.

Zatímco konkurenti pokračují v operacích pod předpokladem, že masivní investice jsou nezbytné, DeepSeek demonstruje, že vynalézavost a efektivní využívání zdrojů mohou vyrovnat hru.

Inženýrství nemožného

Úspěch DeepSeeku spočívá v jeho inovativním technickém přístupu, který ukazuje, že někdy nejvýraznější průlomy pocházejí z práce v rámci omezení, spíše než házení neomezených zdrojů na problém.

V srdci této inovace je strategie nazvaná “auxiliary-loss-free load balancing”. Představte si to jako orchestraci masivního paralelního zpracování, kde tradičně byste potřebovali komplexní pravidla a penalizace, aby vše běželo hladce. DeepSeek otočil tuto konvenční moudrost vzhůru nohama, vyvinul systém, který přirozeně udržuje rovnováhu bez režie tradičních přístupů.

Tým také uvedl, co nazývají “Multi-Token Prediction” (MTP) – techniku, která umožňuje modelu myslet dopředu předpovídáním více tokenů najednou. V praxi se to překládá do působivého 85-90% akceptačního poměru pro tyto předpovědi napříč různými tématy, poskytující 1,8krát rychlejší zpracování než předchozí přístupy.

Technická architektura sama o sobě je mistrovským dílem efektivity. Model V3 od DeepSeeku používá kombinaci expertů s celkovými 671 miliardami parametrů, ale zde je chytrá část – aktivuje pouze 37 miliard pro každý token. Tato selektivní aktivace znamená, že získávají výhody masivního modelu, zatímco udržují praktickou efektivitu.

Jejich volba rámce pro školení s míchanou přesností FP8 je dalším skokem vpřed. Místo přijetí konvenčních omezení snížené přesnosti vyvinuli vlastní řešení, která udržují přesnost, zatímco významně snižují požadavky na paměť a výpočetní prostředky.

Vlnové efekty v ekosystému umělé inteligence

Dopad úspěchu DeepSeeku se šíří daleko za jeden úspěšný model.

Pro evropský vývoj umělé inteligence je tento průlom zvláště významný. Mnoho pokročilých modelů se nedostane do EU, protože společnosti jako Meta a OpenAI buď nemohou, nebo nebudou přizpůsobovat EU AI Act. Přístup DeepSeeku ukazuje, že budování špičkové umělé inteligence nevyžaduje vždy masivní klastry GPU – je to více o efektivní utilizaci dostupných zdrojů.

Tento vývoj také ukazuje, jak omezení exportu mohou skutečně pohánět inovace. Omezený přístup DeepSeeku k high-end hardwaru je donutil přemýšlet jinak, což vedlo k softwarovým optimalizacím, které by se možná nikdy neobjevily v prostředí s bohatými zdroji. Tento princip by mohl změnit, jak přistupujeme k vývoji umělé inteligence globálně.

Demokratizační implikace jsou hluboké. Zatímco průmysloví giganti pokračují v prohoření miliard, DeepSeek vytvořil modrou tiskopis pro efektivní, nákladově efektivní vývoj umělé inteligence. To by mohlo otevřít dveře menším společnostem a výzkumným institucím, které dříve nemohly soutěžit kvůli omezením zdrojů.

Nicméně, to neznamená, že velká výpočetní infrastruktura se stává zastaralou. Průmysl se posouvá směrem ke škálování inferenční doby – jak dlouho model potřebuje k vygenerování odpovědí. Jak tento trend pokračuje, významné výpočetní prostředky budou stále nezbytné, pravděpodobně ještě více než dříve.

Ale DeepSeek fundamentálně změnil konverzaci. Dlouhodobé implikace jsou jasné: vstupujeme do éry, kde inovativní myšlení a efektivní využívání zdrojů mohou být důležitější než pouhá výpočetní síla. Pro komunitu umělé inteligence to znamená zaměřit se nejen na to, jaké zdroje máme, ale také na to, jak kreativně a efektivně je využíváme.

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.