Intervjuer

Elad Raz, CEO av NextSilicon – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Elad Raz, CEO av NextSilicon, er en erfaren entreprenør og teknologileder som er vidt respektert for sin dype ekspertise innen lavnivåsystemer, sikkerhet, nettverk og filsystemutvikling. Gjennom en karriere som omfatter elite militær ingeniørroller, senior programvareledelse, selskapsbygging og langvarig investering, har Raz ledet komplekse, kritiske prosjekter over operativsysteminteriører og hardware-software-integrasjon. Før han grunnla NextSilicon, bygde og solgte han flere teknologiselskaper, tjenestegjorde i senior ledelsesroller i et ledende halvlederfirma og investerte i en diversifisert portefølje av startup-selskaper, kombinerte han hånd-til-hånd ingeniør-dybde med sterk gjennomføring og langvarig strategisk visjon.

NextSilicon er et israelsk høy-ytelses datamaskin- og halvlederfirma grunnlagt i 2017 som definerer om datamaskinarkitektur for krevende arbeidsbyrder som AI og vitenskapelig datamaskining. Selskapet har utviklet en programvaredefinert, intelligent datamaskinplattform designet for å levere høy ytelse og effisiens uten å kreve at utviklere må omskrive applikasjoner. Ved å fokusere på tilpasning på maskinvarenivå, sikter NextSilicon på å løse grunnleggende flaskenakker i moderne datacenter og superdatamaskinmiljøer, og stiller seg som en neste-generasjons alternativ til tradisjonelle akseleratorer.

Kan du fortelle oss om din reise som ledet opp til grunnleggelsen av NextSilicon? Hva var det som utløste den innledende ideen, og hvordan har dine tidlige erfaringer med datamaskiner formet din visjon?

Jeg har vært fascinert av datamaskiner siden jeg var en gutt. Den fascinasjonen ledet meg fra å leke med gamle Commodore 64 og Atari (som jeg fortsatt samler på den dag i dag) til å grunnlegge startup-selskaper, og til slutt til å selge mitt forrige selskap til Mellanox. Men selv med disse tidlige suksessene, så jeg stadig den samme utfordringen igjen og igjen i denne bransjen. Ettersom beregningsarbeidsbyrdene har blitt mer komplekse, når tradisjonelle CPU- og GPU-arkitekturer nærmer seg ytelses-, effisiens- og skalerbarhetsgrenser. Uansett om man optimaliserer algoritmer eller kjører store simuleringsarbeidsbyrder, ble det klart at nåværende arkitekturer tvang arbeidsbyrdene til å tilpasse seg maskinvaren – ikke motsatt.

Tennene for NextSilicon kom fra denne gjentakende utfordringen og reiste spørsmålet: Hva hvis vi kunne snu skriptet og bygge datamaskinarkitekturer som tilpasser seg arbeidsbyrdene, i stedet for å tvinge arbeidsbyrdene til å tilpasse seg maskinvaren? Mine tidlige erfaringer med algoritmedesign og maskinvare lærte meg at den virkelige gjennombruddet ville komme fra å kombinere de to i sanntid. Det er grunnlaget for vår Intelligent Compute Architecture (ICA) og NextSilicons veiledende visjon siden begynnelsen.

Maverick-2 beskrives som en Intelligent Compute-Akselerator som tilpasser seg sanntidsarbeidsbyrder. Hvordan skiller dens arkitektur seg fra tradisjonelle GPU-er eller FPGA-er, og hva muliggjør den niveauet av tilpasning?

CPU-er og GPU-er har forandret vår verden og har tjent oss godt. Men de var aldri designet for å møte kravene til moderne AI- og høy-ytelses datamaskinarbeidsbyrder i fag som vitenskap, vær, energi og forsvar. Disse arbeidsbyrdene har komplekse dataavhengigheter, minne-tilgangsmønster og beregningsmønster som dagens prosessorer ikke var designet for å håndtere. Resultatet er flaskenakker som bremser innovasjon.

Maverick-2s nøkkeltil forskjell er dens nye tilnærming som kombinerer en omkonfigurerbar datastrøm-motor med sanntids programvareoptimalisering. Den arkitektoniske forskjellen er at maskinvaren konfigureres basert på arbeidsbyrden, ikke motsatt. For Maverick-2, driver data-tilgjengelighet beregning, i stedet for at et programteller driver instruksjonsutførelse som i tradisjonelle prosessorer. Dette muliggjør oss å skape programvaredefinerte virtuelle prosessor-enheter som kan konfigureres og omkonfigureres i sanntid for å matche bestemte arbeidsbyrde-mønster.

Resultatene taler for seg selv: Maverick-2 leverer over 4 ganger ytelsen per watt sammenlignet med GPU-er og mer enn 20 ganger sammenlignet med høykvalitets-CPU-er, samtidig som det reduserer driftskostnadene med mer enn halvparten. Som resultat kan forskere og ingeniører kjøre store, uregelmessige simuleringsarbeidsbyrder raskere og mer effektivt, og låse opp nye innsikter og gjennombrudd i en brøkdel av tiden.

Du har rapportert å ha oppnådd over 4 ganger ytelse per watt sammenlignet med GPU-er og mer enn 20 ganger sammenlignet med høykvalitets-CPU-er. Hva er de viktigste innovasjonene som driver disse ytelsesforbedringene i sanntidsarbeidsbyrder?

Ytelsesforbedringene kommer fra noen viktige innovasjoner som fungerer sammen.

Først, avviet vi fra Von Neumann-modellen som har dominert datamaskining i 80 år. I stedet for sekvensiell instruksjonsutførelse, bruker Maverick-2 en datastrøm-arkitektur hvor beregning følger data-tilgjengelighet. Dette er grunnleggende bedre egnet for uregelmessige, minne-intensive arbeidsbyrder.

Andre, vår selv-optimerende arkitektur genererer programvaredefinerte prosessor-kjerner i sanntid. Maskinvaren tilpasser seg hver applikasjons behov uten å kreve kode-omskriving – du får optimalisering uten omkostningene.

Tredje, og dette er kritisk: Vi fokuserer på vedvarende sanntids-ytelse, ikke teoretiske toppunkter. Mange arkitekturer ser bra ut på papir, men svikter på faktiske arbeidsbyrder. Maverick-2 opprettholder effisiens over AI, høy-ytelses datamaskining og vektor-databaser ved å kontinuerlig tilpasse seg arbeidsbyrdens behov.

Maverick-2 støtter C/C++, Fortran, OpenMP og Kokkos uten å kreve kodeendringer. Hvordan har utviklere reagert på denne kompatibiliteten, og hva er dine planer for å støtte CUDA, ROCm eller populære AI-rammeverk?

Utviklere elsker at Maverick-2 er en ekte “drop-in-erstatning”. De kan kjøre eksisterende applikasjoner umiddelbart uten portingsbarrierer som plager denne industrien. Vi støtter for øyeblikket C/C++, Fortran, OpenMP og Kokkos uten å kreve kodeendringer, med CUDA, ROCm og store AI-rammeverk som TensorFlow, JAX, PyTorch og ONNX i aktiv utvikling. Dette eliminerer leverandør-lås og dyre kode-omskrivinger, og lar kunder evaluere og adoptere nye arkitekturer uten å forstyrre arbeidsflyten.

Hvordan fungerer Maverick-2s telemetri-drevne systemoptimalisering bak kulissene? Hva er involvert i å profilere og omkonfigurere chipen i sanntid?

Tenk på vår systemoptimalisering som en kontinuerlig løkke: under utførelse, måler vår telemetrisystem hundrevis av ytelsesindikatorer (f.eks. minne-båndbredde, utnyttelse, kø-lengder). All denne dataen føres inn i en runtime-optimizer som bestemmer om den nåværende maskinvarekonfigurasjonen fortsatt er optimal for arbeidsbyrden og dens prosjekterte behov. Hvis ikke, kan den om-partisjonere ressurser, om-ordne data-veier og justere beregnings-pipelines kontinuerlig, noe som betyr at applikasjonen ikke stopper. Dette skjer innen millisekunder, så applikasjonen opprettholder konstant topp-effisiens ettersom dens beregningsprofil endrer seg.

Er det bestemte typer arbeidsbyrder eller kant-tilfeller hvor adaptiv runtime-ytelses-justering er mindre effektiv eller introduserer kompromisser i latens eller kraft?

Noen arkitektur vil alltid ha kompromisser. Maverick-2 utmerker seg i komplekse, uregelmessige arbeidsbyrder med skiftende beregnings- og data-tilgangsmønster. For høyt forutsigbare, faste arbeidsbyrder kan en godt justert GPU være svært effektiv uten omkostningene ved tilpasning. I disse tilfellene, leverer vår tilpasning fortsatt solid ytelse, men den relative fordelen kan være mindre.

NextSilicons design er all about fleksibilitet og konkurranse i enkle tilfeller, men transformasjonell i utfordrende tilfeller.

Hvorfor bestemte du deg for å prioritere HPC-markedet tidlig, når de fleste startup-selskaper ruslet inn i AI? Hvordan har dette formet din produkt- og forretningsstrategi?

HPC representerer grensen for beregningskompleksitet og problem-løsning for massive datasamlinger, uregelmessig minne-tilgang og uberegnelige beregningsmønster. Hvis du kan bygge en arkitektur som trives der – som å kjøre exabyte-skala simuleringsarbeidsbyrder i klimamodellering eller partikkelfysikk, vil den utmerke seg i AI også.

Ved å fokusere på HPC først, beviste vi Maverick-2 på de mest krevende arbeidsbyrdene i klimamodellering, fysikk og livsvitenskap. Det ga oss troverdighet, faktisk ytelsesdata og en moden produkt før vi gikk dyptere inn i AI-markeder. Nå er vi posisjonert for å tjene begge, uten å ha kompromittert vår arkitektur for å kapitalisere på korte-trend eller behov.

Nå som Maverick-2 er i produksjon og distribuert over dusinvis av kunder, kan du dele eksempler på hvordan det brukes? Noen bestemte resultater eller benchmark fra flaggskips-distribusjoner?

Et flaggskips-eksempel er vår distribusjon på Sandia National Labs, hvor Maverick-2 driver deres Spectra-superdatamaskin som en del av Vanguard-II-programmet. Vi ser imponerende ytelsesresultater uten å kreve kodeendringer. Vi arbeider også med ODISSEE (Online Data Intensive Solutions for Science in the Exabytes Era), som bringer sammen ledende forskningsinstitusjoner for å håndtere exabyte-skala data fra CERNs High-Luminosity Large Hadron Collider og Square Kilometre Array Observatory. Rollen Maverick-2 vil spille er å løse utfordringen med å prosessere petabyte med rå eksperimentelle data i en brøkdel av tiden og energien tidligere krevede. Målet er å muliggjøre raskere fysikk-analyser og astronomiske oppdagelser.

Du har samlet inn over 300 millioner dollar, med store runder annonsert i 2021 og mer nylig. Kan du dele hvordan denne finansieringen har akselerert din produktutvikling og markeds-rekkevidde?

Finansieringen tillot oss å gjøre tre ting. Først, kunne vi drive arkitekturen videre, ikke bare inkrementelle forbedringer, men grunnleggende fremgang som gjorde Maverick-2 produksjonsklar. Andre, skalerte vi vår produksjon og forsyningskjede for å møte økende etterspørsel, en ikke-triviell utfordring for nytt silikon. Tredje, utvidet vi vår programvare-økosystem for å muliggjøre kunder å integrere og distribuere raskere.

Det muliggjorde også strategiske partnerskap med superdatamaskin-sentre og skytjenesteleverandører, og tillot oss å strømlinje vår konsept-til-distribusjonsprosess og utvide mye raskere enn tradisjonelle hardware-startup-selskaper.

I et landskap som inkluderer Cerebras (CBRS ), SambaNova og Nvidia (NVDA ), hvordan ser du på NextSilicon som posisjonerer seg? Hva er din markeds-tilnærming som en utfordrer?

Vi ser på NextSilicon som mer en teknologiselskap enn bare et annet chip-selskap. Vi optimaliserer hver arbeidsbyrd, tilbyr tilpasning og låser ikke kunder inn i proprietær programmering eller maskinvare. Våre kunder kan bringe sin eksisterende kode og oppnå umiddelbar akselerasjon uten lengre portings-sykluser eller leverandør-lås til en enkelt økosystem, som CUDA. Dette betyr spesielt når AI-arbeidsbyrdene utvikler seg beyond ren trening. Resonans-modeller, utvidet inferens og store kontekst-vinduer krever grunnleggende forskjellige beregningsmønster: mer dynamisk minne-tilgang, variabel lengde-beregning og adaptiv ressurs-allokering. Disse er ikke problemer du løser med mer av samme faste arkitektur.

Vår markeds-tilnærming fokuserer på å løse de hardeste problemene først: å arbeide med forskningsinstitusjoner, nasjonale laboratorier og bedrifter hvor ytelse, energi-effisiens og fleksibilitet er kritisk. Deretter skalerer vi inn i bredere AI- og data-intensiv markeder. Industrien er dominert av faste arkitekturer. Vi tilbyr noe annet, tilpasning bygget fra starten. AI er i ferd med å skifte fra ren skala til intelligens. Større modeller muliggjør smartere resonans, fra korte promter til lange kontekst-forståelse. I denne overgangen, vil tilpasnings-arkitekturer ikke bare være nyskaper, de vil være essensielle.

Takk for det flotte intervjuet, lesere som ønsker å lære mer bør besøke NextSilicon.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.