Interviews
Elad Raz, CEO af NextSilicon – Interviewserie

Elad Raz, CEO af NextSilicon, er en erfaren iværksætter og teknologileder, der er bredt respekteret for sin dybe ekspertise i lavniveau-systemer, sikkerhed, netværk og filsystemudvikling. Gennem en karriere, der omfatter elite-militær ingeniørroller, senior softwareledelse, virksomhedsbygning og langsigtede investeringer, har Raz ledet komplekse, mission-kritiske projekter på tværs af operativsystemets interne dele og hardware-software-integration. Før han grundlagde NextSilicon, byggede og afhændede han flere teknologivirksomheder, fungerede i senior ledelsesroller i en førende halvlederfirma og investerede i en diversificeret portefølje af startups, kombineret med praktisk ingeniør-dybe og stærke udførelse og langsigtede strategiske visioner.
NextSilicon er et israelsk high-performance computing- og halvlederfirma, grundlagt i 2017, der gendefinerer beregningsarkitektur for krævende workloads som AI og videnskabelig beregning. Firmaet har udviklet en software-defineret, intelligent beregningsplatform designet til at levere høj ydeevne og effektivitet uden at kræve, at udviklere gen-skriver programmer. Ved at fokusere på tilpasning på hardwareniveau sigter NextSilicon mod at løse grundlæggende flaskehalsninger i moderne datacenter og supercomputer-miljøer, og positionerer sig selv som en næste-generations-alternativ til traditionelle acceleratorer.
Kan du fortælle os om din rejse op til grundlæggelsen af NextSilicon? Hvad var det, der fik dig til at starte med det hele, og hvordan har dine tidlige erfaringer med computing formet din vision?
Jeg har været fascineret af computere, siden jeg var dreng. Den fascination har ført mig fra at lege med gamle Commodore 64’er og Ataris (som jeg stadig samler på i dag) til at grundlægge startups og til sidst at sælge mit tidligere firma til Mellanox. Men selv med disse tidlige succeser, så jeg stadig det samme problem igen og igen i denne branche. Da beregningsworkloads er blevet mere komplekse, når traditionelle CPU- og GPU-arkitekturer når deres begrænsninger for ydeevne, effektivitet og skalerbarhed. Uanset om det handler om at optimere algoritmer eller køre store simulations, blev det klart, at nuværende arkitekturer tvang workloads til at tilpasse sig hardwaren – og ikke omvendt.
Idéen til NextSilicon opstod fra dette gentagne problem, og rejste spørgsmålet: Hvad nu, hvis vi kunne vende skriptet og bygge beregningsarkitekturer, der tilpasser sig workloads, snarere end at tvinge workloads til at tilpasse sig hardwaren? Mine tidlige erfaringer med algoritme-design og hardware lærte mig, at den virkelige gennembrud ville komme fra at kombinere de to i realtid. Det er grundlaget for vores Intelligent Compute Architecture (ICA) og NextSilicons vejledende vision fra starten.
Maverick-2 beskrives som en Intelligent Compute Accelerator, der tilpasser sig til realtidsworkloads. Hvordan adskiller dens arkitektur sig fra traditionelle GPU’er eller FPGAs, og hvad giver den niveau af tilpasning?
CPUs og GPUs har forandret vores verden og har tjent os godt. Men de var aldrig designet til at møde kravene fra moderne AI- og high-performance computing-workloads i felter som videnskab, vejr, energi og forsvar. Disse workloads har komplekse dataafhængigheder, hukommelsesadgangsmønstre og beregningsmønstre, som i dag ikke er designet til at håndtere. Resultatet er flaskehalsninger, der langsomer innovationen.
Maverick-2’s nøgleforskel er dens nytænkende tilgang, der kombinerer en omkonfigurerbar dataflow-motor med realtidssoftwareoptimering. Den arkitektoniske forskel er, at hardwaren konfigureres baseret på workload, og ikke omvendt. For Maverick-2 driver data-tilgængelighed beregning, snarere end en programtæller, der driver instruktionsudførelse som i traditionelle processorer. Dette giver os mulighed for at oprette software-definerede virtuelle procesenheder, der kan konfigureres og gen-konfigureres i realtid for at matche specifikke workload-mønstre.
Resultaterne taler for sig selv: Maverick-2 leverer over 4 gange bedre ydeevne pr. watt end GPU’er og mere end 20 gange bedre end high-end CPUs, samtidig med at den reducerer driftsomkostningerne med mere end halvdelen. Forskere og ingeniører kan derefter køre store, irregulære simulationer hurtigere og mere effektivt, og låse op for indsigt og gennembrud på en brøkdel af tiden.
Du har rapporteret at have opnået over 4 gange bedre ydeevne pr. watt i forhold til GPU’er og mere end 20 gange bedre end high-end CPUs. Hvad er de nøgle-innovationer, der driver disse ydeevneforbedringer i realverdenens workloads?
Ydeevneforbedringerne kommer fra et par nøgle-innovationer, der arbejder sammen.
Først afviger vi fra Von Neumann-modellen, der har domineret computing i 80 år. I stedet for sekventiel instruktionsudførelse bruger Maverick-2 en dataflow-arkitektur, hvor beregning følger data-tilgængelighed. Dette er fundamentalt bedre egnet til irregulære, hukommelsesintensive workloads.
Anden, vores selvoptimerende arkitektur genererer software-definerede processor-kerner i realtid. Hardwaren tilpasser sig hver applikations behov uden at kræve kode-omskrivninger – du får optimering uden overhead.
Tredje, og dette er kritisk: Vi fokuserer på vedvarende realverden-ydeevne, ikke teoretiske toppunkter. Mange arkitekturer ser godt ud på papir, men svigter på faktiske workloads. Maverick-2 opretholder effektivitet på tværs af AI, HPC og vektor-databaser ved at tilpasse sig workloadens behov kontinuerligt.
Maverick-2 understøtter C/C++, Fortran, OpenMP og Kokkos uden at kræve kodeændringer. Hvordan har udviklere reageret på denne kompatibilitet, og hvad er dine planer for at understøtte CUDA, ROCm eller populære AI-rammer?
Udviklere elsker, at Maverick-2 er en ægte “drop-in-erstatning”. De kan køre deres eksisterende programmer straks uden portningsbarrierer, der plager denne branche. Vi understøtter i øjeblikket C/C++, Fortran, OpenMP og Kokkos, samt CUDA, ROCm og store AI-rammer som TensorFlow, JAX, PyTorch og ONNX i aktiv udvikling. Dette eliminerer vendor-lås og dyre kode-omskrivninger og giver kunder mulighed for at evaluere og adoptere nye arkitekturer uden at forstyrre deres arbejdsgange.
Hvordan fungerer Maverick-2’s telemetriske systemoptimering bag scenen? Hvad er involveret i at profilere og gen-konfigurere chippen i realtid?
Tænk på vores systemoptimering som en kontinuerlig løkke: under udførelse måler vores telemetrisystem hundredvis af ydeevne-indikatorer (f.eks. hukommelsesbåndbredde, utilisation, kødybde). Alle disse data indføres i en runtime-optimizer, der bestemmer, om den nuværende hardware-konfiguration stadig er optimal for workload og dens forventede behov. Hvis ikke, kan den gen-partitionere ressourcer, gen-ordne data-veje og justere beregningsrør kontinuerligt, så applikationen ikke stopper. Dette sker inden for millisekunder, så applikationen opretholder konstant top-ydeevne, mens dens beregningsprofil ændrer sig.
Er der bestemte typer workloads eller kanttilfælde, hvor adaptiv runtime-ydeevne-justering er mindre effektiv eller introducerer trade-offs i forsinkelse eller effekt?
Enhver arkitektur har trade-offs. Maverick-2 udmærker sig i komplekse, irregulære workloads med skiftende beregnings- og dataadgangsmønstre. Til højt forudsigelige, faste workloads kan en vel-justeret GPU være meget effektiv uden den ekstra overhead fra tilpasning. I disse tilfælde leverer vores tilpasning stadig solid ydeevne, men den relative fordel kan være mindre.
NextSilicons design handler om fleksibilitet og konkurrenceevne i lige tilfælde, men transformerende i udfordrende tilfælde.
Hvorfor valgte du at prioritere HPC-markedet tidligt, når de fleste startups var ivrige efter at komme ind i AI? Hvordan har det formet din produkt- og forretningsstrategi?
HPC repræsenterer fronten for beregningskompleksitet og problem-løsning for massive datasæt, irregulær hukommelsesadgang og uforudsigelige beregningsmønstre. Hvis du kan bygge en arkitektur, der trives der – såsom at køre exabyte-store simulationer i klimamodellering eller partikelfysik, vil det også udmærke sig i AI.
Ved at fokusere på HPC først, beviste vi Maverick-2 på de mest krævende workloads i klimamodellering, fysik og livsvidenskab. Det gav os troværdighed, realverden-ydeevne-data og en moden produkt, før vi gik dybere ind i AI-markederne. Nu er vi positioneret til at betjene begge, uden at have kompromitteret vores arkitektur for at kapitalisere på korte trends eller behov.
Nu, hvor Maverick-2 er i produktion og er udrullet over dusinvis af kunder, kan du dele eksempler på, hvordan det bruges? Nogen specifikke resultater eller benchmarks fra flagship-udrulninger?
Et flagship-eksempel er vores udrulning på Sandia National Labs, hvor Maverick-2 driver deres Spectra-supercomputer som en del af Vanguard-II-programmet. Vi ser imponerende ud-af-boksen-ydeevne-resultater uden at kræve kode-ændringer. Vi arbejder også med ODISSEE (Online Data Intensive Solutions for Science in the Exabytes Era), der bringer sammen førende forskningsinstitutioner for at håndtere exabyte-store datasæt fra CERNs High-Luminosity Large Hadron Collider og Square Kilometre Array-observatoriet. Rollen, Maverick-2 skal spille, er at løse udfordringen med at behandle petabyte af rå eksperimentelle data på en brøkdel af den tid og energi, der tidligere var nødvendig. Målet er at enable hurtigere fysik-analyser og astronomiske opdagelser.
Du har hævet over 300 millioner dollars, med store runder annonceret i 2021 og for nylig. Kan du dele, hvordan denne finansiering har accelereret din produktudvikling og markedstilgang?
Finansieringen gav os mulighed for at gøre tre ting. Først kunne vi skubbe arkitekturen længere, ikke blot inkrementelle forbedringer, men fundamentale fremskridt, der gjorde Maverick-2 produktion-klar. Anden, vi skalaerede vores produktion og forsyningskæde for at møde den voksende efterspørgsel, en ikke-trivial udfordring for nyt silicium. Tredje, vi udvidede vores software-økosystem for at give kunder mulighed for at integrere og udrulle hurtigere.
Det gav os også mulighed for at indgå strategiske partnerskaber med supercomputer-center og cloud-udbydere, hvilket tillod os at strømline vores koncept-til-udrulningsproces og udvide meget hurtigere end traditionelle hardware-startups.
I et landskab, der omfatter Cerebras (CBRS ), SambaNova og Nvidia (NVDA ), hvordan ser du NextSilicon positionere sig? Hvad er din go-to-market-tilgang som udfordrer?
Vi ser NextSilicon som mere en teknologivirksomhed end bare endnu et chip-firma. Vi optimerer hver workload, giver tilpasning og låser ikke kunder inde i proprietær programmering eller hardware. Vore kunder kan bringe deres eksisterende kode og opnå umiddelbar acceleration uden længere portningscykler eller vendor-lås til en enkelt økosystem, såsom CUDA. Dette betyder især, da AI-workloads udvikler sig beyond ren træning. Reasoning-modeller, forlængede inferens og store kontekstvinduer kræver fundamentalt forskellige beregningsmønstre: mere dynamisk hukommelsesadgang, variabel længde-beregning og adaptiv ressource-allocation. Disse er ikke problemer, du løser med mere af samme faste arkitektur.
Vores go-to-market-strategi fokuserer på at løse de sværeste problemer først: arbejde med forskningsinstitutioner, nationale laboratorier og virksomheder, hvor ydeevne, effektivitet og fleksibilitet er kritisk. Fra der udvider vi os til bredere AI- og data-intensiv-markeder. Branchen er domineret af faste arkitekturer. Vi tilbyder noget andet, tilpasning bygget fra starten. AI er under skift fra ren skala til intelligens. Større modeller giver mulighed for smartere resonnering, fra korte prompts til lange kontekst-forståelse. I denne overgang vil tilpasningsdygtige arkitekturer ikke blot være nyt, men essentielle.
Tak for det store interview, læsere, der ønsker at lære mere, skal besøge NextSilicon.












