Rozhovory
Elad Raz, CEO společnosti NextSilicon – Interview Series

Elad Raz, CEO společnosti NextSilicon, je zkušený podnikatel a technologický lídr, který je široce uznáván pro svou hlubokou odbornost v oblasti low-level systémů, bezpečnosti, sítí a vývoje souborových systémů. Během své kariéry, která zahrnuje elitní vojenské inženýrské role, seniorní softwarové vedení, budování společností a dlouhodobé investice, Raz vedl komplexní, kritické projekty v oblasti vnitřností operačních systémů a integrace hardwaru a softwaru. Před založením NextSilicon postavil a prodal několik technologických společností, zastával seniorní vedoucí role v přední polovodičové firmě a investoval do rozmanitého portfolia startupů, kombinujících praktickou inženýrskou hloubku se silnou exekucí a dlouhodobou strategickou vizi.
NextSilicon je izraelská společnost pro high-performance computing a polovodiče, založená v roce 2017, která předefinuje architekturu výpočtů pro náročné úkoly, jako je umělá inteligence a vědecké výpočty. Společnost vyvinula softwarově definovanou, inteligentní platformu pro výpočty, která je navržena tak, aby poskytla vysoký výkon a efektivitu bez nutnosti, aby vývojáři přepisovali aplikace. Díky zaměření na adaptabilitu na hardwarové úrovni se NextSilicon snaží řešit základní úzká místa v moderních datových centrech a superpočítačových prostředích, a tím se позиcionuje jako next-generační alternativa k tradičním urychlovačům.
Můžete nám říci o své cestě, která vás vedla ke založení NextSilicon? Co vás inspirovalo k této myšlence a jak vaše rané zkušenosti s počítači ovlivnily váš pohled?
Již od dětství mě fascinují počítače. Tato fascinace mě vedla od experimentování se starými Commodore 64 a Atari (které stále sbírám) až po spoluzaložení startupů a nakonec až k prodeji mé předchozí společnosti firmě Mellanox. Ale i přes tyto rané úspěchy jsem neustále viděl stejnou výzvu v tomto odvětví. S rostoucí složitostí výpočtových úloh tradiční architektury CPU a GPU dosahují limitů výkonu, energetické efektivity a škálovatelnosti. Bez ohledu na optimalizaci algoritmů nebo běh velkých simulací bylo zřejmé, že současné architektury nutí úkoly přizpůsobit se hardwaru – a ne naopak.
Impulz pro NextSilicon přišel z této opakující se výzvy a vyvolal otázku: Co kdybychom mohli otočit stránku a postavit architektury, které se přizpůsobí úkolům, místo aby úkoly musely být přizpůsobeny hardwaru? Moje rané zkušenosti s návrhem algoritmů a hardwaru mě naučily, že skutečný průlom bude pocházet z kombinace obou v reálném čase. To je základ naší Inteligentní architektury pro výpočty (ICA) a vedoucí vize NextSilicon od samého počátku.
Maverick-2 je popsán jako Inteligentní urychlovač pro výpočty, který se přizpůsobuje úlohám v reálném čase. Jak se jeho architektura liší od tradičních GPU nebo FPGA a co umožňuje tuto úroveň adaptability?
Procesory CPU a GPU změnily náš svět a sloužily nám dobře. Ale nebyly navrženy tak, aby splňovaly požadavky moderních úloh umělé inteligence a high-performance computing (HPC) v oblastech, jako je věda, počasí, energie a obrana. Tyto úlohy mají komplexní datové závislosti, vzorce přístupu k paměti a výpočetní vzorce, které současné procesory nebyly navrženy tak, aby zvládly. Výsledkem jsou úzká místa, která zpomalují inovace.
Klíčový rozdíl Maverick-2 spočívá v jeho novém přístupu, který kombinuje rekonfigurovatelný datový tok s optimalizací softwaru v reálném čase. Hlavní architektonický rozdíl spočívá v tom, že hardwarová konfigurace je založena na vaší úloze, a ne naopak. U Maverick-2 datová dostupnost řídí výpočet, místo toho, aby programový čítač řídil provádění instrukcí, jako v tradičních procesorech. To nám umožňuje vytvořit softwarově definované virtuální procesorové jednotky, které lze konfigurovat a rekonfigurovat v reálném čase, aby odpovídaly konkrétním vzorcům úloh.
Výsledky mluví samy za sebe: Maverick-2 nabízí více než 4krát lepší výkon na watt než GPU a více než 20krát lepší než high-end CPU, a současně snižuje provozní náklady o více než polovinu. Díky tomu mohou výzkumníci a inženýři spouštět velké, nepravidelné simulace rychleji a efektivněji, a tím odemykají poznatky a průlomy v zlomku času.
Jaké jsou klíčové inovace, které pohání tyto výkonnostní zisky v reálných úlohách?
Výkonnostní zisky pocházejí z několika klíčových inovací, které pracují společně.
Nejprve jsme se odchýlili od Von Neumannova modelu, který dominuje výpočetní technice již 80 let. Místo sekvenční ejecice instrukcí Maverick-2 používá architekturu datového toku, kde výpočet následuje dostupnost dat. To je zásadně lépe přizpůsobeno pro nepravidelné, paměťově intenzivní úlohy.
Druhá, naše samo-optimalizující architektura generuje softwarově definované procesorové jádra v reálném čase. Hardwarová konfigurace se přizpůsobuje potřebám každé aplikace bez nutnosti přepisovat kód – získáte optimalizaci bez režie.
Třetí, a to je kritické: soustředíme se na udržitelný reálný výkon, ne teoretické vrcholy. Mnohé architektury vypadají skvěle na papíru, ale selhávají v reálných úlohách. Maverick-2 udržuje efektivitu napříč umělou inteligencí, HPC a vektorovými databázemi, a to díky kontinuální adaptaci na potřeby úloh.
Maverick-2 podporuje C/C++, Fortran, OpenMP a Kokkos bez nutnosti změn kódu. Jak reagovali vývojáři na tuto kompatibilitu a jaké jsou vaše plány na podporu CUDA, ROCm nebo populárních frameworků pro umělou inteligenci?
Vývojáři milují, že Maverick-2 je skutečnou “drop-in replacement”. Mohou okamžitě spustit své stávající aplikace bez bariér portování, které sužují toto odvětví. V současné době podporujeme C/C++, Fortran, OpenMP a Kokkos, a CUDA, ROCm a hlavní frameworky pro umělou inteligenci, jako je TensorFlow, JAX, PyTorch a ONNX, jsou ve vývoji. To eliminuje uzamčení dodavatele a nákladné přepisování kódu a umožňuje zákazníkům vyhodnotit a přijmout nové architektury bez narušení jejich pracovních postupů.
Jak funguje systém optimalizace Maverick-2 na základě telemetrie? Co je zapojeno do profilování a rekonfigurace čipu v reálném čase?
Přemýšlejte o naší systémové optimalizaci jako o kontinuálním cyklu: během provádění naše telemetrický systém měří stovky ukazatelů výkonu (například šířka pásma paměti, využití, hloubka front). Všechna tato data jsou zasílána do optimalizátoru běhu, který určuje, zda aktuální hardwarová konfigurace zůstává optimální pro úlohu a její předpokládané potřeby. Pokud ne, může přeparticionovat zdroje, reorganizovat datové cesty a upravit výpočetní potrubí kontinuálně, což znamená, že aplikace se nezastaví. To se děje během milisekund, takže aplikace udržuje konzistentní špičkovou efektivitu, jak se mění její výpočetní profil.
Jsou zde specifické typy úloh nebo edge cases, kde je adaptivní optimalizace v reálném čase méně účinná nebo zavádí kompromisy v latenci nebo spotřebě energie?
Každá architektura bude mít kompromisy. Maverick-2 vyniká v komplexních, nepravidelných úlohách se měnícími se výpočetními a přístupovými vzorci. Pro vysoce předvídatelné, pevné úlohy může být dobře naladěný GPU velmi efektivní bez režie adaptace. V těchto případech naše adaptabilita stále poskytuje solidní výkon, ale relativní výhoda může být menší.
Design NextSilicon jeすべて o versatility a konkurenceschopnosti v přímých případech, ale transformační v náročných.
Proč jste se rozhodli prioritizovat trh HPC na začátku, když většina startupů spěchala do umělé inteligence? Jak to ovlivnilo vaši produktovou a obchodickou strategii?
HPC představuje hranici výpočetní složitosti a řešení problémů pro masivní datové sady, nepravidelný přístup k paměti a nepředvídatelné výpočetní vzorce. Pokud můžete postavit architekturu, která vyniká zde – například běh simulací v klimatickém modelování nebo částicové fyzice, bude vynikající i v umělých inteligencích.
Prioritizací HPC na začátku jsme prokázali Maverick-2 na nejvíce náročných úlohách v klimatickém modelování, fyzice a life sciences. To nám dalo kredibilitu, reálná data o výkonu a zralý produkt, než jsme se ponořili do trhů umělé inteligence. Nyní jsme dobře positionováni, abychom obsloužili obě, bez toho, abychom museli kompromitovat naší architekturu, abychom využili krátkodobé trendy nebo potřeby.
Nyní, když je Maverick-2 v produkci a nasazený u desítek zákazníků, můžete sdílet příklady, jak je využíván? Jaké jsou konkrétní výsledky nebo benchmarky z vlajkových nasazení?
Příkladem je naše nasazení v Sandia National Labs, kde Maverick-2 pohání jejich superpočítač Spectra jako součást programu Vanguard-II. Vidíme působivé výsledky bez nutnosti změn kódu. Pracujeme také s ODISSEE (Online Data Intensive Solutions for Science in the Exabytes Era), které spojuje přední výzkumné instituce, aby zvládly exabytes datové z CERNova High-Luminosity Large Hadron Collider a Square Kilometre Array Observatory. Role Maverick-2 bude spočívat v řešení problému zpracování petabytes syrových experimentálních dat v zlomku času a energie, které byly dříve vyžadovány. Cílem je umožnit rychlejší fyzikální analýzy a astronomické objevy.
Vy jste získali více než 300 milionů dolarů, s významnými investičními kola v roce 2021 a nedávno. Můžete sdílet, jak toto financování urychlovalo vývoj produktu a dosah trhu?
Financování nám umožnilo učinit tři věci. První, mohli jsme posunout architekturu dále, ne pouze inkrementální vylepšení, ale fundamentální pokroky, které učinily Maverick-2 produkčně připraveným. Druhé, mohli jsme škálovat naši výrobu a dodavatelský řetězec, aby splnily rostoucí poptávku, což je ne triviální výzva pro novou polovodičovou technologii. Třetím, mohli jsme rozšířit náš softwarový ekosystém, aby zákazníci mohli integrovat a nasazovat rychleji.
To také umožnilo strategická partnerství se superpočítačovými centry a cloudovými poskytovateli, což nám umožnilo zjednodušit náš proces od konceptu k nasazení a expandovat mnohem rychleji než tradiční hardwarové startupy.
V krajině, která zahrnuje Cerebras (CBRS ), SambaNova a Nvidia (NVDA ), jak vidíte NextSilicon jako pozici? Jaký je váš přístup k trhu jako výzva?
VIDÍME NextSilicon jako více technologickou společnost než pouze další chip společnost. Optimalizujeme každou úlohu, poskytujeme adaptabilitu a nezaměřujeme se na proprietární programování nebo hardwarovou uzamčení. Naši zákazníci mohou přinést svůj stávající kód a dosáhnout okamžité akcelerace bez dlouhých cyklů portování nebo uzamčení do jediného ekosystému, jako je CUDA. To matters zejména, protože úlohy umělé inteligence se vyvíjejí za hranice čistého tréninku. Modely rozumného uvažování, prodloužené inferencing a velké kontextové okna vyžadují fundamentálně odlišné výpočetní vzorce: více dynamického přístupu k paměti, proměnlivé délky výpočtu a adaptivní alokace zdrojů. Tyto nejsou problémy, které můžete vyřešit s více stejnou fixní architekturou.
Naše strategie pro přístup k trhu se soustředí na řešení nejtěžších problémů první: práce s výzkumnými institucemi, národními laboratořemi a podniky, kde výkon, energetická efektivita a flexibilita jsou kritické. Odtud škálovat do širších trhů umělé inteligence a datově intenzivních aplikací. Odvětví je dominováno fixními architekturami. Nabízíme něco jiného, adaptabilitu od samého počátku. Umělá inteligence se posouvá od čistého měřítka k inteligenci. Větší modely umožňují chytřejší uvažování, od krátkých promptů k dlouhým kontextovým porozuměním. V této transformaci budou adaptabilní architektury nejen novinkou, ale budou nezbytné.
Děkuji vám za skvělý rozhovor, čtenářům, kteří chtějí se dozvědět více, doporučujeme navštívit NextSilicon.












