Rozhovory

Moshe Tanach, CEO a spoluzakladatel NeuReality – rozhovor

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Moshe Tanach je CEO a spoluzakladatel NeuReality. Před založením NeuReality působil Moshe jako ředitel inženýringu ve společnostech Marvell a Intel (INTC ), kde vedl vývoj komplexních bezdrátových a síťových produktů do masové výroby. Působil také jako viceprezident pro výzkum a vývoj ve společnosti DesignArt Networks (později získané společností Qualcomm (QCOM )), kde se podílel na vývoji produktů základnových stanic 4G.

NeuReality má za cíl zjednodušit přijetí umělé inteligence. Díky systémovému přístupu k umělé inteligenci dodává tým odborníků z NeuReality komplexní řešení pro inferenci umělé inteligence, identifikuje bolestivé body a poskytuje účelově navržená řešení pro inferenci umělé inteligence, která činí umělou inteligenci dostupnou a dostupnou.

S vaším bohatým zkušenostem s vedením inženýrských projektů ve společnostech Marvell, Intel a DesignArt-Networks, co vás inspirovalo k založení NeuReality a jak vaše předchozí role ovlivnily vizi a směr společnosti?

NeuReality byla postavena od počátku, aby řešila budoucí náklady, složitost a problémy s klimatem, které by byly nevyhnutelné při inferenci umělé inteligence – což je nasazení trénovaných modelů a softwaru do produkčních center dat. Zatímco trénování umělé inteligence je proces, jakým je umělá inteligence vytvořena; inferencia umělé inteligence je proces, jakým je umělá inteligence používána a jak interaguje s miliardami lidí a zařízení po celém světě.

<p Jsme týmem systémových inženýrů, takže se díváme na všechny úhly, všechny multiple aspekty koncové inferenci umělé inteligence, včetně GPU a všech tříd účelově navržených urychlovačů umělé inteligence. Stalo se nám jasné, že se vrátíme k roku 2015, že čipové a systémy závislé na CPU – což je každý GPU, TPU, LPU, NRU, ASIC a FPGA – narazí na významnou zeď do roku 2020. Jejich systémové omezení, kde se urychlovač umělé inteligence stal lepší a rychlejší z hlediska surového výkonu, ale podkladová infrastruktura nedržela krok.

V důsledku toho jsme se rozhodli odtrhnout se od velkých gigantů, kteří jsou zablokováni byrokracií, a narušit průmysl lepší architekturou umělé inteligence, která je otevřená, agnostická a účelově navržená pro inferenci umělé inteligence. Jedním z závěrů ideální inferenci umělé inteligence je, že při zvyšování využití GPU a systémové efektivity naše nová výpočetní a síťová infrastruktura – poháněná naší novou čipovou sadou NR1, která nahrazuje hostitelský CPU a NIC – může odstranit tržní bariéry, které brání 65 % organizací v inovacích a přijetí umělé inteligence dnes – nevyužité GPU, které vedou k nákupu více, než je skutečně potřeba (protože běží idle > 50 % času) – a současně snižuje spotřebu energie, výzvy s datovými centry a provozní náklady.

Toto je jedinečná příležitost skutečně transformovat architekturu umělé inteligence k lepšímu, na základě všeho, co jsem se naučil a praktikoval po dobu 30 let, a otevřít dveře novým inovátorům umělé inteligence napříč průmysly a odstranit bariéry CPU, složitost a uhlíkovou stopu.

NeuReality má za cíl demokratizovat umělou inteligenci. Můžete vysvětlit, co znamená “umělá inteligence pro všechny” a jak NeuReality plánuje dosáhnout této vize?

Náš cíl je demokratizovat umělou inteligenci, aby byla dostupnější a dostupnější pro všechny organizace, velké i malé – tím, že uvolní maximum kapacity libovolného GPU nebo urychlovače umělé inteligence, takže získáte více z vaší investice; jinými slovy, získáte VÍCE z drahých investic do GPU, než nákup více GPU, které běží idle > 50 % času. Můžeme zvýšit urychlovače umělé inteligence až na 100 % plné kapacity, zatímco dodáváme až 15x lepší energetickou efektivitu a snižujeme systémové náklady až o 90 %. Tyto jsou řádově lepší zlepšení. Plánujeme dosáhnout této vize naší řešením NR1 AI Inference, první architekturou datového centra, která je uzpůsobena pro éru umělé inteligence. Běží vysoké objemy, různé datové potrubí umělé inteligence dostupně a efektivně s přidanou výhodou snížené uhlíkové stopy.

Dosažení umělé inteligence pro všechny také znamená, aby byla snadno použitelná. V NeuReality zjednodušujeme nasazení, správu a škálovatelnost infrastruktury umělé inteligence, zlepšujeme obchodní procesy a ziskovost a rozvíjíme sektory, jako je veřejná zdraví, bezpečnost, vymáhání práva a zákaznický servis. Naše dopad sahá do sektorů, jako je lékařská zobrazování, klinické studie, detekce podvodů, tvorba obsahu umělé inteligence a mnoho dalších.

Aktuálně jsou naše první komerčně dostupné zařízení NR1-S AI Inference k dispozici s urychlovači Qualcomm Cloud AI 100 Ultra a prostřednictvím Cirrascale, poskytovatele cloudových služeb.

Řešení NR1 AI Inference je označováno jako první architektura datového centra uzpůsobená pro éru umělé inteligence a účelově navržená pro inferenci umělé inteligence. Jaké byly klíčové inovace a průlomy, které vedly k vývoji NR1?

NR1™ je název celé systémové architektury, kterou jsme navrhli a dodali do průmyslu umělé inteligence – jako otevřenou, plně kompatibilní architekturu výpočtu a sítě, která plně doplňuje libovolný urychlovač umělé inteligence a GPU. Pokud bych měl rozdělit to na nejvýznamnější a nejzajímavější inovace, které vedly k tomuto komplexnímu řešení NR1 a odlišují nás, řekl bych:

  • Optimalizované grafy výpočtu: Náše tým navrhl akcelerátor pro optimalizaci zpracování grafů výpočtu, které jsou zásadní pro umělou inteligenci a další úkoly, jako je zpracování médií, databází a další. Grafy výpočtu reprezentují řadu operací se závislostmi a tato širší použitelnost позиcionuje NR1 jako potenciálně disruptivní nejen pro super urychlovače GPU a dalších urychlovačů umělé inteligence. Zjednodušuje nasazení modelů umělé inteligence generováním optimalizovaných grafů výpočtu (CG) na základě předzpracovaných dat a softwarových API, což vede k významným výkonovým ziskům.
  • NR1 NAPU™ (Network Addressable Processing Unit): Naše architektura pro inferenci umělé inteligence je poháněna NR1 NAPU™ – 7nm serverovým čipem, který umožňuje přímý síťový přístup pro předzpracování a pozpracování umělé inteligence. Máme 6,5x více výkonu na menším čipu NR1 než typický obecný, hostitelský CPU. Tradičně jsou úkoly předzpracování (jako čištění dat, formátování a extrakce funkcí) a úkoly pozpracování (jako interpretace výsledků a formátování) zpracovávány CPU. Odstraněním těchto úkolů na NR1 NAPU™ odstraníme jak CPU, tak NIC. To snižuje úzká místa, umožňuje rychlejší zpracování a nižší náklady na jeden dotaz umělé inteligence.
  • NR1™ AI-Hypervisor™ technologie: Patented hardwarová AI-Hypervisor™ optimalizuje orchestraci úkolů umělé inteligence a využití zdrojů, zlepšuje efektivitu a snižuje úzká místa.
  • NR1™ AI-over-Fabric™ Network Engine: NR1 zahrnuje jedinečný síťový engine AI-over-Fabric™, který zajišťuje bezproblémové síťové připojení a efektivní škálovatelnost zdrojů umělé inteligence napříč několika čipy NR1 – které jsou spojeny s libovolným GPU nebo urychlovačem umělé inteligence – ve stejném serveru nebo zařízení NR1-S.

Poslední údaje o výkonu NeuReality vyzdvihují významné úspory nákladů a energie. Můžete poskytnout více informací o tom, jak NR1 dosahuje až 90% úspor nákladů a 15x lepší energetické efektivitě ve srovnání s tradičními systémy?

NeuReality NR1 snižuje náklady a spotřebu energie pro inferenci umělé inteligence až o 90 % a 15x, resp. Tohoto je dosaženo prostřednictvím:

  • Specializovaný křemík: Naše účelově navržená infrastruktura pro inferenci umělé inteligence je poháněna NR1 NAPU™ serverovým čipem, který absorbuje funkčnost CPU a NIC do jednoho – a eliminuje potřebu CPU v inferenci. Konečným výsledkem je maximální výstup libovolného urychlovače umělé inteligence nebo GPU v nejefektivnějším možném způsobem.
  • Optimalizovaná architektura: Streamlinováním toku dat umělé inteligence a začleněním předzpracování a pozpracování umělé inteligence přímo do NR1 NAPU™, odstraníme a nahradíme CPU. To vede ke snížení latence, lineární škálovatelnosti a nižším nákladům na jeden dotaz umělé inteligence.
  • Flexibilní nasazení: Můžete zakoupit NR1 dvěma primárními způsoby: 1) uvnitř modulu NR1-M™, který je karta PCIe, která obsahuje několik NR1 NAPU (obvykle 10), určená k párování s vašimi stávajícími karty urychlovače umělé inteligence. 2) uvnitř zařízení NR1-S™, které páruje NR1 NAPU s rovnocenným počtem urychlovačů umělé inteligence (GPU, ASIC, FPGA, atd.) jako hotové řešení pro inferenci umělé inteligence.

Na Supercomputingu 2024 v listopadu uvidíte, jak budeme demonstrovat zařízení NR1-S s 4x čipy NR1 na 16x urychlovače Qualcomm Cloud AI 100 Ultra. Otestovali jsme to samé s čipy Nvidia (NVDA ) pro inferenci umělé inteligence. NeuReality revolucionalizuje inferenci umělé inteligence se svou otevřenou, účelově navrženou architekturou.

 Jak se zařízení NR1-S AI Inference vyrovnává s urychlovači Qualcomm® Cloud AI 100 ve srovnání s tradičními servery s CPU a GPU Nvidia® H100 nebo L40S v reálných aplikacích?

NR1, kombinovaný s urychlovači Qualcomm Cloud AI 100 nebo NVIDIA H100 nebo L40S, dodává podstatný výkonový impuls ve srovnání s tradičními servery s CPU v reálných aplikacích umělé inteligence napříč velkými jazykovými modely, jako je Llama 3, počítačovým viděním, zpracováním přirozeného jazyka a rozpoznáním řeči. Jinými slovy, běh vašeho systému pro inferenci umělé inteligence s NR1 optimalizuje výkon, systémové náklady, energetickou efektivitu a časy odezvy napříč obrázky, zvuky, jazykem a textem – buď samostatně (jedna modalita) nebo společně (mnoho modalit).

Výsledkem je, že zákazník získá VÍCE z drahých investic do GPU, než nákup více GPU k dosažení požadovaného výkonu.

Mimo maximalizaci využití GPU dodává NR1 výjimečnou efektivitu, což vede k 50-90% lepší cenové výkonnosti a až 13-15x lepší energetické efektivitě. To se překládá do významných úspor nákladů a snížení environmentální stopy pro vaši infrastrukturu umělé inteligence.

Zařízení NR1-S demonstruje lineární škálovatelnost bez poklesu výkonu. Můžete vysvětlit technické aspekty, které umožňují takovou bezproblémovou škálovatelnost?

Zařízení NR1-S, které spojuje naše čipy NR1 s urychlovači umělé inteligence libovolného typu nebo množství, předefinuje infrastrukturu umělé inteligence. Přesáhli jsme omezení tradičních systémů s CPU a dosáhli nové úrovně výkonu a efektivnosti.

Místo tradičního omezení NIC-CPU-urychlovač má zařízení NR1-S integrovaný přímý síťový přístup, předzpracování a pozpracování umělé inteligence uvnitř našich síťových adresovatelných procesorových jednotek (NAPU). S typicky 10 NAPU na systém, každý z nich zpracovává úkoly, jako je zpracování vidění, audio a DSP, a naše AI-Hypervisor™ orchestruje úkoly, streamlinujeme tok dat umělé inteligence. To se překládá do lineární škálovatelnosti: přidání více urychlovačů vede k proporcionálně více výkonu.

Výsledkem je, že je pozorována 100% utilizace urychlovačů umělé inteligence. Zatímco celkové náklady a energetická efektivita se liší v závislosti na konkrétních čipech umělé inteligence, maximalizovaný investiční výkon a zlepšený výkon jsou konzistentně dodávány. Jak se potřeby inferenci umělé inteligence škálovat, zařízení NR1-S poskytuje přesvědčivou alternativu k tradičním architekturám.

NeuReality má za cíl odstranit bariéry pro široké přijetí umělé inteligence. Jaké jsou nejvýznamnější výzvy, kterým čelí podniky při přijetí umělé inteligence, a jak vaše technologie pomáhá překonat tyto?

Když je špatně implementována, software a řešení umělé inteligence mohou být problematická. Mnoho podniků nemůže přijmout umělou inteligenci kvůli nákladům a složitosti budování a škálování systémů umělé inteligence. Dnes jsou řešení umělé inteligence optimalizována pro trénování, nikoli pro inferenci, a servery pro inferenci mají vysoké úzká místa. Abychom se vypořádali s touto výzvou a učinili umělou inteligenci dostupnější, vyvinuli jsme první kompletní řešení pro inferenci umělé inteligence – výpočetní a síťovou infrastrukturu poháněnou naší NAPU – která využije maximum potenciálu libovolného urychlovače umělé inteligence a sníží tržní bariéry kolem nadměrných nákladů a spotřeby energie.

Náš systémový přístup k inferenci umělé inteligence – na rozdíl od snahy vyvinout lepší GPU nebo urychlovač umělé inteligence, kde je již mnoho inovací a konkurence – znamená, že vyplňujeme významnou mezeru v průmyslu pro desítky inovátorů čipů a systémů umělé inteligence. Náš tým útočí na nedostatky v inferenci umělé inteligence systematicky a holisticky, určením bolestivých bodů, architektonických mezer a projekcí zátěže umělé inteligence – aby dodal první účelově navrženou, čipovou a softwarovou architekturu pro inferenci umělé inteligence bez CPU. A vyvinutím horní-od-dolní softwarové sady s otevřenými standardy z Pythonu a Kubernetes v kombinaci s NeuReality Toolchain, Provisioning a Inference API, naše integrovaná sada softwarových nástrojů kombinuje všechny komponenty do jediného vysoce kvalitního uživatelského rozhraní.

V konkurenčním trhu umělé inteligence, co odlišuje NeuReality od ostatních poskytovatelů řešení pro inferenci umělé inteligence?

Prostě řečeno, jsme otevřeni a agnostici k urychlovačům. Naše infrastruktura NR1 supercharges libovolný urychlovač umělé inteligence – GPU, TPU, LPU, ASIC, pojmenujte si – vytváří skutečně optimalizovaný koncový systém. Urychlovače umělé inteligence byly původně zavedeny, aby pomohly CPU zvládnout nároky neuronových sítí a strojového učení ve velkém, ale nyní jsou urychlovače umělé inteligence tak mocní, že jsou drženy zpět samotnými CPU, které měly pomoci.

Naše řešení? NR1. Je to kompletní, reimagined architektura pro inferenci umělé inteligence. Naše tajná zbraň? NR1 NAPU™ byl navržen jako ko-ingedience, aby maximalizoval výkon urychlovače umělé inteligence bez zvýšení spotřeby energie nebo rozbití banky. Vyvinuli jsme otevřený ekosystém, který bezproblémově integruje s libovolným čipem pro inferenci umělé inteligence a populárními softwarovými rámci, jako je Kubernetes, Python, TensorFlow a další.

NeuReality otevřený přístup znamená, že nesoutěžíme s krajínou umělé inteligence; jsme zde, abychom ji doplnili prostřednictvím strategických partnerství a technologické spolupráce. Poskytujeme chybějící kus puzzle: účelově navrženou, CPU-free architekturu, která ne pouze odemkne urychlovače umělé inteligence na benchmarkový výkon, ale také učiní umělou inteligenci dostupnější a dostupnější pro podniky a vlády. Představte si, že odemknete plný potenciál NVIDIA H100, Google (GOOGL ) TPUs nebo AMD MI300 – aby jim poskytly infrastrukturu, kterou si zaslouží.

NeuReality otevřená a efektivní architektura vyrovnává hřiště, činí umělou inteligenci dostupnější a dostupnější pro každého. Jsem vášnivě zapojen do toho, aby různé průmysly – fintech, biotech, zdravotnictví – zažily výhody NR1 poprvé. Porovnejte své řešení umělé inteligence na tradičních systémech s CPU s moderní infrastrukturou NR1 a svědkem rozdílu. Dnes pouze 35 % podniků a vlád přijalo umělou inteligenci a to je založeno na neuvěřitelně nízkých kvalifikačních kritériích. Umožněme, aby více než 50 % firemních zákazníků přijalo umělou inteligenci do tohoto času příštího roku bez poškození planety nebo rozbití banky.

Pohledem vpřed, co je dlouhodobá vize NeuReality pro roli umělé inteligence ve společnosti, a jak vidíte, že vaše společnost přispěje k této budoucnosti?

Představuji si budoucnost, kde umělá inteligence prospívá všem, podporuje inovace a zlepšuje životy. Nevýrobíme pouze technologii; stavíme základy pro lepší budoucnost.

Náš NR1 je klíčem k této vizi. Je to kompletní řešení pro inferenci umělé inteligence, které začíná rozbití nákladových a složitých bariér, které brání masovému podnikovému přijetí umělé inteligence. Předefinovali jsme jak infrastrukturu, tak architekturu, dodávají revoluční systém, který maximalizuje výstup libovolného GPU, libovolného urychlovače umělé inteligence, bez zvýšení provozních nákladů nebo spotřeby energie.

Obchodní model opravdu záleží na škálovatelnosti a poskytnutí koncovým zákazníkům skutečných voleb nad koncentrovanou umělou inteligencí, jak jsem psal dříve. Místo toho stavíme otevřený ekosystém, kde náš křemík funguje s ostatními křemíky, ne proti nim. Proto jsme navrhli NR1 tak, aby integroval bezproblémově s všemi urychlovači umělé inteligence a s otevřenými modely a softwarem, aby bylo co nejsnazší instalovat, spravovat a škálovat.

Ale nezastavujeme se tam. Spolupracujeme s partnery, aby ověřili naši technologii napříč různými úkoly umělé inteligence a dodali “inference-as-a-service” a “LLM-as-a-service” prostřednictvím poskytovatelů cloudových služeb, hyperscalers a přímo s výrobci doprovodných čipů. Chceme učinit pokročilou umělou inteligenci dostupnou a dostupnou pro všechny.

Představte si možnosti, kdybychom mohli zvýšit výkon inferenci umělé inteligence, energetickou efektivitu a dostupnost o desítky procent. Představte si robustní, umělou inteligencí poháněnou společnost s více hlasy a možnostmi, které se stávají realitou. Musíme všichni udělat náročnou práci prokázání obchodního dopadu a návratnosti investic, když je umělá inteligence implementována v denních operacích datových center. Soustředíme se na revoluční implementaci umělé inteligence, ne pouze na schopnosti modelu.

Toto je způsob, jak přispíváme k budoucnosti, kde umělá inteligence prospívá všem – výhra pro ziskové marže, lidi a planetu.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit NeuReality.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.