Rozhovory

Andrew Feldman, spoluzakladatel a CEO Cerebras Systems – Interview Series

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Andrew je spoluzakladatel a CEO Cerebras Systems (CBRS ). Je podnikatel, který se věnuje rozvoji hranic v oblasti výpočetní techniky. Předtím, než založil Cerebras, spoluzaložil a byl CEO SeaMicro, průkopníka energeticky úsporných, vysokopropustných mikroserverů. SeaMicro byla v roce 2012 koupena společností AMD za 357 milionů dolarů. Předtím, než pracoval ve společnosti SeaMicro, byl Andrew viceprezidentem pro produktový management, marketing a obchodní rozvoj ve společnosti Force10 Networks, která byla později prodána společnosti Dell Computing za 800 milionů dolarů. Předtím, než pracoval ve společnosti Force10 Networks, byl Andrew viceprezidentem pro marketing a firemní rozvoj ve společnosti RiverStone Networks od založení společnosti až do jejího vstupu na burzu v roce 2001. Andrew získal titul BA a MBA na Stanfordově univerzitě.

Cerebras Systems buduje novou třídu počítačových systémů, navržených od základu pro jediný cíl – urychlit umělou inteligenci a změnit budoucnost práce s umělou inteligencí.

Můžete sdílet příběh o vzniku Cerebras Systems?

Mojí spoluzakladatelé a já všichni pracovali společně v předchozí firmě, kterou můj CTO Gary a já založili v roce 2007, nazvané SeaMicro (která byla prodána společnosti AMD v roce 2012 za 334 milionů dolarů). Moji spoluzakladatelé jsou někteří z předních počítačových architektů a inženýrů v oboru – Gary Lauterbach, Sean Lie, JP Fricker a Michael James. Když jsme se v roce 2015 opět sešli, napsali jsme dvě věci na tabuli – že chceme pracovat společně a že chceme postavit něco, co změní průmysl a bude v Muzeu počítačové historie, které je ekvivalentem Síně slávy počítačů. Byli jsme poctěni, když Muzeum počítačové historie uznalo naše úspěchy a přidalo procesor WSE-2 do své sbírky minulý rok, s odkazem na to, jak změnil krajinný pohled na umělou inteligenci.

Cerebras Systems je tým průkopnických počítačových architektů, počítačových vědců, výzkumníků hlubokého učení a inženýrů všech typů, kteří milují bezohledné inženýrství. Naše mise, když jsme se sešli, byla postavit novou třídu počítače pro urychlení hlubokého učení, které se stalo jednou z nejvýznamnějších zátěží naší doby.

Realizovali jsme, že hluboké učení má jedinečné, masivní a rostoucí výpočetní požadavky. A není dobře sladěno s legacy stroji, jako jsou grafické procesory (GPU), které byly fundamentálně navrženy pro jinou práci. V důsledku toho je umělá inteligence dnes omezena ne aplikacemi nebo nápady, ale dostupností výpočetní techniky. Testování jediné nové hypotézy – školení nového modelu – může trvat dny, týdny nebo dokonce měsíce a stát stovky tisíc dolarů ve výpočetním čase. To je významná překážka pro inovace.

Takže původ Cerebras byl postavit nový typ počítače optimalizovaného výhradně pro hluboké učení, počínaje čistým listem papíru. Abychom splnili enormní výpočetní požadavky hlubokého učení, navrhli a vyrobili jsme největší čip, který byl kdy postaven – Wafer-Scale Engine (WSE). Při vytváření prvního wafer-škálového procesoru jsme překonali výzvy v oblasti designu, výroby a balení – všechny, které byly považovány za nemožné po celou 70letou historii počítačů. Každý prvek WSE je navržen tak, aby umožnil výzkum hlubokého učení na bezprecedentní rychlosti a měřítku, pohánějící nejrychlejší superpočítač AI v oboru, Cerebras CS-2.

S každým komponentem optimalizovaným pro práci s umělou inteligencí dodává CS-2 více výpočetního výkonu na menší ploše a při nižší spotřebě energie než jakýkoli jiný systém. Toho dosahuje, zatímco radikálně snižuje složitost programování, čas výpočtu a dobu řešení. V závislosti na zátěži, od AI po HPC, CS-2 dodává stokrát nebo tisíckrát více výkonu než legacy alternativy. CS-2 poskytuje zdroje pro hluboké učení ekvivalentní stovkám GPU, zatímco poskytuje snadnost programování, správy a nasazení jediného zařízení.

Posledních několik měsíců Cerebras Systems je všude v novinách, můžete nám říci něco o novém superpočítači Andromeda?

Oznámili jsme Andromedu v listopadu loňského roku a je to jeden z největších a nejmocnějších superpočítačů AI, který byl kdy postaven. Dodává více než 1 Exaflop AI výpočtu a 120 Petaflops hustého výpočtu, Andromeda má 13,5 milionu jader napříč 16 systémy CS-2 a je jediným superpočítačem AI, který kdy prokázal téměř dokonalé lineární škálování na velkých jazycových modelech. Je také velmi snadné ho používat.

Pro připomenutí, největší superpočítač na Zemi – Frontier – má 8,7 milionu jader. V surovém počtu jader je Andromeda více než jeden a půlkrát větší. Provádí jinou práci, ale to dává představu o rozsahu: téměř 100 terabitů vnitřní šířky pásma, téměř 20 000 jader AMD Epyc, které ho živí, a – na rozdíl od obřích superpočítačů, které trvají roky, než jsou postaveny – postavili jsme Andromedu za tři dny a okamžitě poté, co byla spuštěna, dodávala téměř dokonalé lineární škálování AI.

Argonne National Labs byl naším prvním zákazníkem, který použil Andromedu, a použili ji k řešení problému, který rozbitý jejich 2 000 GPU cluster nazvaný Polaris. Problém spočíval v běhu velmi velkých, GPT-3XL generativních modelů, zatímco umístění celé Covid genomu do sekvence, aby bylo možné analyzovat každý gen v kontextu celého genomu Covid. Andromeda běžela unikátní genetickou zátěž s dlouhými sekvencemi (MSL 10K) napříč 1, 2, 4, 8 a 16 uzly, s téměř dokonalým lineárním škálováním. Lineární škálování je mezi nejvíce požadovanými charakteristikami velkého clusteru. Andromeda dodala 15,87násobný průtok napříč 16 systémy CS-2 ve srovnání s jediným systémem CS-2 a snížení času školení na shodu.

Můžete nám říci o partnerství s Jasper, které bylo oznámeno na konci listopadu, a co to znamená pro obě společnosti?

Jasper je velmi zajímavá společnost. Jsou lídrem v oblasti generativního AI obsahu pro marketing a jejich produkty jsou používány více než 100 000 zákazníky po celém světě pro psaní kopií pro marketing, reklamy, knihy a další. Je to samozřejmě velmi zajímavý a rychle rostoucí prostor právě teď. Minulý rok jsme oznámili partnerství s nimi, aby urychlili přijetí a zlepšili přesnost generativního AI napříč podnikovými a spotřebitelskými aplikacemi. Jasper používá náš superpočítač Andromeda pro školení svých extrémně výpočetně náročných modelů za zlomek času. To prodlouží dosah modelů generativního AI na masy.

S pomocí superpočítače Andromeda může Jasper dramaticky pokročit v AI práci, včetně školení GPT sítí pro přizpůsobení AI výstupů všem úrovním složitosti a granularity koncových uživatelů. To zlepšuje kontextuální přesnost generativních modelů a umožní Jasperu personalizovat obsah napříč několika třídami zákazníků rychle a snadno.

Naše partnerství umožňuje Jasperu vynalézat budoucnost generativního AI, dělat věci, které jsou nemožné nebo nepraktické s tradiční infrastrukturou, a urychlit potenciál generativního AI, přinášet jeho výhody našemu rychle rostoucímu zákaznickému základu po celém světě.

V nedávném tiskovém prohlášení, Národní laboratoř pro energetiku a Pittsburghský superpočítačový center oznámily první simulaci Computational Fluid Dynamics na procesoru Cerebras Wafer-Scale. Můžete nám říci, co je to Wafer-Scale Engine a jak funguje?

Náš Wafer-Scale Engine (WSE) je revoluční AI procesor pro náš hluboký učení počítačový systém, CS-2. Na rozdíl od legacy, všeobecně použitelných procesorů, WSE byl postaven od základu pro urychlení hlubokého učení: má 850 000 AI-optimalizovaných jader pro sparse tensorové operace, masivní vysokopropustnou paměť na čipu a spojovací řády velikosti rychlejší než tradiční cluster mohl dosáhnout. Společně to poskytuje hluboké učení výpočetní zdroje ekvivalentní clusteru legacy strojů ve jediném zařízení, snadno programovatelném jako jediný uzel – radikálně snižující složitost programování, čas výpočtu a dobu řešení.

Náš druhý generace WSE-2, který pohání náš systém CS-2, může řešit problémy extrémně rychle. Rychle enough, aby umožnil reálné, vysoce věrné modely inženýrsky zajímavých systémů. Je to vzácný příklad úspěšného “silného škálování”, které je použití paralelismu pro snížení času řešení se stálou velikostí problému.

A to je to, co Národní laboratoř pro energetiku a Pittsburghský superpočítačový center používají. Právě jsme oznámili einige velmi zajímavé výsledky simulace Computational Fluid Dynamics (CFD), složené z asi 200 milionů buněk, při téměř reálném čase. Tento video ukazuje high-resolution simulaci Rayleigh-Bénard konvekce, která nastává, když je vrstva tekutiny ohřátá zespodu a chlazena shora. Tyto tepelně poháněné tekutiny jsou všude kolem nás – od větrných dnů, sněhových bouří, k pohybu magmy v jádru Země a plazmovému pohybu ve Slunci. Jak říká vypravěč, není to jen vizuální krása simulace, která je důležitá: je to rychlost, s jakou jsme schopni ji vypočítat. Poprvé, pomocí našeho Wafer-Scale Engine, je Národní laboratoř pro energetiku schopna manipulovat sítí téměř 200 milionů buněk v téměř reálném čase.

Jaký typ dat je simulován?

Simulovaná zátěž byla tepelně poháněné tekutiny, také známé jako přírodní konvekce, které jsou aplikací Computational Fluid Dynamics (CFD). Tekutiny se vyskytují přirozeně všude kolem nás – od větrných dnů, sněhových bouří, k pohybu tektonických desek. Tato simulace, složená z asi 200 milionů buněk, se zaměřuje na jev známý jako “Rayleigh-Bénard” konvekce, která nastává, když je tekutina ohřátá zespodu a chlazena shora. V přírodě může tento jev vést k vážným povětrnostním událostem, jako jsou downbursty, microbursty a derechos. Je také zodpovědný za pohyb magmy v jádru Země a plazmový pohyb ve Slunci.

V listopadu 2022, Národní laboratoř pro energetiku představila novou fieldovou rovnici API, poháněnou systémem CS-2, která byla až 470krát rychlejší než to, co bylo možné na superpočítači Joule. To znamená, že může dodávat rychlosti, které jsou za hranicemi toho, co mohou dosáhnout clusterů libovolného počtu CPU nebo GPU. Používáním jednoduchého Python API, které umožňuje wafer-škálování pro většinu výpočetní vědy, WFA dodává zisky ve výkonu a uživatelské přívětivosti, které nemohly být získány na konvenčních počítačích a superpočítačích – ve skutečnosti, outperformed OpenFOAM na superpočítači Joule 2.0 o více než dvě řády velikosti v čase řešení.

Protože WFA API je tak jednoduché, byly výsledky získány za pouhé几 týdny a pokračují v blízké spolupráci mezi Národní laboratoří pro energetiku, PSC a Cerebras Systems.

Transformací rychlosti CFD (která byla vždy pomalou, off-line úlohou) na našem WSE, můžeme otevřít celou řadu nových, reálných použití pro tuto a mnoho dalších základních aplikací HPC. Naším cílem je, že umožněním více výpočetní moci, naši zákazníci budou moci provádět více experimentů a vynalézat lepší vědu. Ředitel laboratoře Národní laboratoře pro energetiku Brian Anderson nám řekl, že to dramaticky urychlí a verbessí proces návrhu pro některé velké projekty, na kterých Národní laboratoř pro energetiku pracuje, jako je uhlíková sekvestrace a výroba modrého vodíku.

Cerebras Systems je neustále lepší než konkurence, co jsou některé z výzev při stavbě špičkových superpočítačů?

Ironicky, jednou z nejtěžších výzev velkého AI je ne AI samo. Je to distribuovaný výpočet.

Při školení dnešních špičkových neuronových sítí výzkumníci často používají stovky až tisíce grafických procesorů (GPU). A není to snadné. Škálování velkých jazykových modelů na cluster GPU vyžaduje distribuci zátěže napříč mnoha malými zařízeními, řešení velikosti paměti zařízení a omezení šířky pásma, a pečlivé řízení komunikace a synchronizace.

My jsme přijali zcela jiný přístup k návrhu našich superpočítačů prostřednictvím vývoje Cerebras Wafer-Scale Cluster a Cerebras Weight Streaming režimu. S těmito technologiemi, Cerebras řeší novou cestu k škálování založenou na třech klíčových bodech:

Nahrazení CPU a GPU zpracováním wafer-škálovými akcelerátory, jako je systém Cerebras CS-2. Tato změna snižuje počet výpočetních jednotek potřebných pro dosažení přijatelné rychlosti výpočtu.

Pro splnění výzvy velikosti modelu, používáme systémovou architekturu, která odděluje výpočet od úložiště modelu. Služba výpočtu založená na clusteru systémů CS-2 (poskytující dostatečnou šířku pásma výpočtu) je těsně spojena se službou paměti (s velkou kapacitou paměti), která poskytuje podmnožiny modelu clusteru výpočtu podle potřeby. Jako obvykle, služba dat poskytuje dávky školicích dat službě výpočtu podle potřeby.

Inovativní model pro naplánování a koordinaci školení práce napříč clusterem CS-2, který využívá datovou paralelnost, vrstvu po vrstvě školení se sparse váhami prouděnými podle potřeby a uchováním aktivací ve službě výpočtu.

Existuje strach z konce Mooreova zákona po téměř deset let, kolik let ještě může průmysl získat a jaké typy inovací jsou potřebné pro to?

Myslím, že otázka, se kterou všichni zápasíme, je, zda je Mooreův zákon – jak ho napsal Moore – mrtvý. Není to už dvouleté období pro získání více tranzistorů. Nyní to trvá čtyři nebo pět let. A tyto tranzistory nepřicházejí ve stejné ceně – přicházejí za mnohem vyšší ceny. Takže otázka se stává, zda ještě získáváme stejné výhody přechodu z sedmi na pět na tři nanometry. Výhody jsou menší a stojí více, a tak se řešení stávají složitějšími než jen čip.

Jack Dongarra, přední počítačový architekt, nedávno přednesl přednášku a řekl: “Stali jsme se mnohem lepšími v vytváření FLOPs a v vytváření I/O.” To je opravdu pravda. Naše schopnost pohybovat daty mimo čip zaostává za нашей schopností zvyšovat výkon na čipu o velkou míru. V Cerebras, jsme byli rádi, když to řekl, protože to potvrzuje naše rozhodnutí postavit větší čip a pohybovat méně věcí mimo čip. To také poskytuje some vedení pro budoucí způsoby, jak udělat systémy s čipy lépe. Existuje práce, která musí být provedena, ne jen vyždímat více FLOPs, ale také techniky pro pohyb dat z čipu na čip – dokonce z velmi velkého čipu na velmi velký čip.

Je něco jiného, co byste rádi sdíleli o Cerebras Systems?

Pro lepší nebo horší, lidé často dávají Cerebras do kategorie “velmi velkých čipů”. Jsme schopni poskytnout přesvědčivé řešení pro velmi velké neuronové sítě, eliminovat tak potřebu bolestivého distribuovaného výpočtu. Myslím, že to je enormně zajímavé a je v srdci toho, proč naši zákazníci nás milují. Zajímavá oblast pro rok 2023 bude, jak dělat velké výpočty na vyšší úrovni přesnosti, pomocí méně FLOPs.

Naše práce na sparse poskytuje velmi zajímavý přístup. Nemůžeme dělat práci, která nás nevede k cílové čáře, a násobení nulou je špatný nápad. Brzy budeme vydávat velmi zajímavou práci o sparse a myslím, že bude více úsilí věnováno hledání způsobů, jak dosáhnout těchto efektivních bodů, a jak to udělat za méně energie. A ne jen pro méně energie a školení; jak minimalizovat náklady a spotřebu energie při inferenci? Myslím, že sparse pomáhá na obou frontách.

Děkuji vám za tyto podrobné odpovědi, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Cerebras Systems.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.