Myslitelé

Budoucnost generativní umělé inteligence je na okraji

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Příchod ChatGPT a obecně generativní umělé inteligence je zásadním mezníkem v historii technologií a je přirovnáván k úsvitu internetu a smartphonů. Generativní umělá inteligence prokázala neomezený potenciál ve své schopnosti vést inteligentní rozhovory, skládat zkoušky, generovat komplexní programy/kód a vytvářet úchvatné obrázky a videa. Zatímco většina modelů Gen AI běží v cloudu – jak pro školení, tak pro inferenci – není to dlouhodobě škálovatelné řešení, zejména pro inferenci, kvůli faktorům, jako jsou náklady, spotřeba energie, latence, soukromí a bezpečnost. Tento článek se zabývá každým z těchto faktorů spolu s motivačními příklady pro přesun Gen AI výpočetních úloh na okraj.

Většina aplikací běží na vysokovýkonných procesorech – buď na zařízení (například smartphony, desktopy, notebooky), nebo v datových centrech. Jak se zvyšuje podíl aplikací, které využívají umělou inteligenci, jsou tyto procesory s pouze CPU nedostatečné. Kromě toho rychlý růst generativní umělé inteligence vede k exponenciální poptávce po serverech s drahými, energeticky náročnými GPU, což vede ke zvýšení nákladů na infrastrukturu. Tyto servery s umělou inteligencí mohou stát až 7krát více než běžný server a GPU představují 80 % této dodatečné ceny.

Kromě toho cloudový server spotřebuje 500 W až 2000 W, zatímco server s umělou inteligencí spotřebuje mezi 2000 W a 8000 W – 4krát více! Pro podporu těchto serverů jsou datová centra vybavena dalšími chladicími moduly a infrastrukturou – které mohou být ještě vyšší než investice do výpočetní techniky. Datová centra již spotřebují 300 TWh ročně, téměř 1 % celosvětové spotřeby energie. Pokud bude pokračovat trend adopce umělé inteligence, může být do roku 2030 spotřebováno až 5 % celosvětové energie datovými centry. Kromě toho je bezprecedentní investice do generativní umělé inteligence v datových centrech. Odhaduje se, že do roku 2027 budou datová centra spotřebovat až 500 miliard dolarů na kapitálové výdaje,主要ně poháněné požadavky na infrastrukturu umělé inteligence.

Spotřeba elektřiny datových center, již 300 TWh, se výrazně zvýší s přijetím generativní umělé inteligence.

Náklady na výpočetní operace umělé inteligence, stejně jako spotřeba energie, brání masové adopci generativní umělé inteligence. Tyto problémy se dají překonat přesunutím výpočetních úloh umělé inteligence na okraj a použitím řešení optimalizovaných pro úlohy umělé inteligence. Díky tomuto přístupu zákazník získá další výhody, včetně latence, soukromí, spolehlivosti a zvýšené kapacity.

Computace následuje data na okraj

Od doby, kdy před deseti lety umělá inteligence vyšla z akademického světa, se školení a inferencia modelů umělé inteligence prováděly v cloudu/datových centrech. Vzhledem k tomu, že většina dat je generována a spotřebována na okraji – zejména video – mělo by smysl přesunout inferenci dat na okraj, aby se zlepšila celková nákladová efektivita (TCO) pro podniky díky sníženým nákladům na síť a výpočetní operace. Zatímco náklady na inferenci umělé inteligence v cloudu jsou opakující se, náklady na inferenci na okraji jsou jednorázovým, hardwarovým nákladem. Základní augmentace systému s procesorem umělé inteligence na okraji snižuje celkové provozní náklady. Stejně jako u konvenční umělé inteligence se i generativní umělá inteligence přesune na okraj. To přinese významné úspory pro podniky a spotřebitele.

Přesun na okraj spolu s efektivním akcelerátorem umělé inteligence pro provádění inferenčních funkcí přináší další výhody. Především mezi nimi je latence. Například v herních aplikacích lze nehratelné postavy (NPC) ovládat a rozšiřovat pomocí generativní umělé inteligence. Používáním modelů LLM běžících na akcelerátorech umělé inteligence na okraji v herní konzoli nebo PC mohou hráči těmto postavám zadávat konkrétní cíle, aby mohly smysluplně participovat na příběhu. Nízká latence z lokální inferenze na okraji umožní, aby řeč a pohyby NPC reagovaly na příkazy a akce hráčů v reálném čase. To poskytne vysoce imersivní herní zkušenost nákladově efektivní a energeticky úspornou.

V aplikacích, jako je zdravotnictví, jsou soukromí a spolehlivost extrémně důležité (například hodnocení pacientů, doporučení léků). Data a související modely umělé inteligence musí být na místě, aby se chránilo soukromí pacientů a jakýkoli výpadek sítě, který zablokuje přístup k modelům umělé inteligence v cloudu, může být katastrofální. Zařízení umělé inteligence na okraji běžící na modelu umělé inteligence speciálně vytvořeném pro každého podnikového zákazníka – v tomto případě poskytovatele zdravotní péče – může bezproblémově vyřešit problémy soukromí a spolehlivosti, zatímco poskytne nižší latenci a náklady.

Generativní umělá inteligence na zařízeních na okraji zajistí nízkou latenci v herních aplikacích a zachová soukromí pacientů a zvýší spolehlivost ve zdravotnictví.

Mnohé modely umělé inteligence běžící v cloudu mohou mít téměř bilion parametrů – tyto modely mohou efektivně zpracovat obecné dotazy. Nicméně podnikové specifické aplikace vyžadují, aby modely poskytly výsledky, které jsou relevantní pro konkrétní případ použití. Vezměme si například asistenta založeného na generativní umělé inteligenci, který má za úkol přijímat objednávky v rychlém občerstvení – pro bezproblémovou interakci zákazníka musí základní model umělé inteligence být školen na menu položky restaurace, včetně alergenů a ingrediencí. Velikost modelu lze optimalizovat pomocí supersetu Large Language Model (LLM) pro školení relativně malého modelu s 10-30 miliardami parametrů a poté použít další jemné doladění se specifickými zákaznickými daty. Takový model může poskytnout výsledky se zvýšenou přesností a schopnostmi. A díky menší velikosti modelu lze efektivně nasadit na akcelerátor umělé inteligence na okraji.

Generativní umělá inteligence zvítězí na okraji

Vždy bude existovat potřeba generativní umělé inteligence běžící v cloudu, zejména pro obecné aplikace, jako je ChatGPT a Claude. Ale když se jedná o podnikové specifické aplikace, jako je generativní vyplňování Adobe Photoshop nebo Github Copilot, generativní umělá inteligence na okraji není pouze budoucností, ale i přítomností. Klíčem k tomu jsou speciálně vytvořené akcelerátory umělé inteligence. especially pro obecné aplikace, jako je ChatGPT a Claude. Ale když se jedná o podnikové specifické aplikace, jako je generativní vyplňování Adobe Photoshop nebo Github Copilot, Generativní umělá inteligence na okraji není pouze budoucností, ale i přítomností. Purpose-built AI akcelerátory jsou klíčem k tomu, aby se to stalo možným.

Jako veterán Silicon Valley a CEO společnosti Kinara Inc, Ravi Annavajjhala přináší více než 20 let zkušeností z oblastí obchodního rozvoje, marketingu a inženýrství, při kterých buduje špičkové technologické produkty a uvádí je na trh. Ve své současné roli jako generální ředitel společnosti Deep Vision Ravi působí v její správní radě a získal 50 milionů dolarů, přičemž společnost přešla s procesorem Ara-1 z před-silikonové fáze do plné výroby a nyní zvyšuje objem výroby 2. generace procesoru Ara-2. Předtím, než se připojil k společnosti Deep Vision, Ravi zastával výkonné vedoucí pozice ve společnostech Intel a SanDisk, kde hrál klíčové role při růstu výnosů, rozvoji strategických partnerství a vytváření produktových roadmap, které vedly průmysl s předními funkcemi a schopnostmi.