Intervjuer

Elad Raz, VD för NextSilicon – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Elad Raz, VD för NextSilicon, är en erfaren entreprenör och teknisk ledare som är allmänt respekterad för sin djupa expertis inom lågnivåsystem, säkerhet, nätverk och filsystemutveckling. Under en karriär som omfattar elit militär ingenjörsroller, senior programvaruleadership, företagsbyggande och långsiktig investering, har Raz lett komplexa, kritiska projekt över operativsystemets interna delar och hårdvaru-mjukvaruintegration. Innan han grundade NextSilicon, byggde och avslutade han flera tekniska företag, tjänstgjorde i seniora ledningsroller på ett ledande halvledarföretag och investerade i en diversifierad portfölj av startups, som kombinerar hands-on ingenjörskunskap med starka genomförande- och långsiktiga strategiska visioner.

NextSilicon är ett israeliskt företag inom högpresterande datorer och halvledare som grundades 2017 och som omdefinierar beräkningsarkitektur för krävande arbetsbelastningar som AI och vetenskaplig datoranvändning. Företaget har utvecklat en programvarudefinierad, intelligent beräkningsplattform som är avsedd att leverera hög prestanda och effektivitet utan att utvecklare behöver skriva om program. Genom att fokusera på anpassningsbarhet på hårdvarunivå syftar NextSilicon till att åtgärda grundläggande flaskhalsar i moderna datacenter och superdatorer, och positionerar sig som en nästa generationsalternativ till traditionella acceleratorer.

Kan du berätta om din resa som ledde till grundandet av NextSilicon? Vad var den initiala idén, och hur påverkade dina tidiga erfarenheter av datorer din vision?

Jag har varit fascinerad av datorer sedan jag var barn. Den fascinationen ledde mig från att experimentera med gamla Commodore 64:or och Atari (som jag fortfarande samlar på) till att medgrundande startups, och slutligen till att sälja mitt föregående företag till Mellanox. Men även med dessa tidiga framgångar såg jag hela tiden samma utmaning i den här branschen. När beräkningsarbetsbelastningar har blivit mer komplexa har traditionella CPU- och GPU-arkitekturer nått prestanda-, effektivitets- och skalbarhetsgränser. Oavsett om man optimerar algoritmer eller kör storskaliga simuleringar, blev det tydligt att nuvarande arkitekturer tvingade arbetsbelastningar att anpassa sig till hårdvaran – inte tvärtom.

Idén till NextSilicon kom från denna återkommande utmaning och ställde frågan: Vad om vi kunde vända på skriptet och bygga beräkningsarkitekturer som anpassar sig till arbetsbelastningar, snarare än att tvinga arbetsbelastningar att anpassa sig till hårdvaran? Min tidiga exponering för algoritmdesign och hårdvara lärde mig att den verkliga genombrottet skulle komma från att kombinera de två i realtid. Det är grunden för vår Intelligent Compute Architecture (ICA) och NextSilicons vägledande vision sedan början.

Maverick-2 beskrivs som en Intelligent Compute Accelerator som anpassar sig till realtidsarbetsbelastningar. Hur skiljer sig dess arkitektur från traditionella GPU:er eller FPGA:er, och vad möjliggör den här nivån av anpassningsbarhet?

CPU:er och GPU:er har förändrat vår värld och har tjänat oss väl. Men de var aldrig avsedda att möta kraven från moderna AI- och högpresterande datorarbetsbelastningar inom områden som vetenskap, väder, energi och försvar. Dessa arbetsbelastningar har komplexa databeroenden, minnesåtkomstmönster och beräkningsmönster som dagens processorer inte var utformade för att hantera. Resultatet är flaskhalsar som bromsar upp innovationen.

Maverick-2:s nyckelskillnad är dess banbrytande tillvägagångssätt som kombinerar en omkonfigurerbar dataflödesmotor med realtidsprogramoptimering. Den viktigaste arkitekturskillnaden är att hårdvaran konfigureras baserat på din arbetsbelastning, snarare än tvärtom. För Maverick-2 driver data tillgänglighet beräkning, snarare än att ett programräknare driver instruktionsutförande som i traditionella processorer. Detta möjliggör för oss att skapa programvarudefinierade virtuella bearbetningsenheter som kan konfigureras och omkonfigureras i realtid för att matcha specifika arbetsbelastningsmönster.

Resultaten talar för sig själva: Maverick-2 levererar över 4 gånger prestanda per watt jämfört med GPU:er och mer än 20 gånger jämfört med högpresterande CPU:er, samtidigt som det minskar driftskostnaderna med mer än hälften. Som ett resultat kan forskare och ingenjörer köra stora, oregelbundna simuleringar snabbare och mer effektivt, och låsa upp insikter och genombrott på en bråkdel av den tid det tidigare tog.

Du har rapporterat att du har uppnått över 4 gånger prestanda per watt jämfört med GPU:er och mer än 20 gånger jämfört med högpresterande CPU:er. Vilka är de viktigaste innovationerna som driver dessa prestandavinster i realvärldens arbetsbelastningar?

Prestandavinsterna kommer från ett par viktiga innovationer som fungerar tillsammans.

För det första avvek vi från Von Neumann-modellen som har dominerat datortekniken i 80 år. Istället för sekventiell instruktionsutförande använder Maverick-2 en dataflödesarkitektur där beräkning följer data tillgänglighet. Detta är grundläggande bättre lämpat för oregelbundna, minnesintensiva arbetsbelastningar.

För det andra genererar vår självoptimerande arkitektur programvarudefinierade processorkärnor i realtid. Hårdvaran anpassar sig till varje programs behov utan att kräva omkodning – du får optimering utan överhuvudtaget.

För det tredje, och detta är kritiskt: vi fokuserar på hållbar realvärldsprestanda, inte teoretiska toppar. Många arkitekturer ser bra ut på papperet men sviktar på faktiska arbetsbelastningar. Maverick-2 upprätthåller effektivitet över AI, högpresterande datorer och vektordatabaser genom att kontinuerligt anpassa sig till arbetsbelastningens behov.

Maverick-2 stöder C/C++, Fortran, OpenMP och Kokkos utan att kräva kodändringar. Hur har utvecklare svarat på den här kompatibiliteten, och vilka är dina planer för att stödja CUDA, ROCm eller populära AI-ramverk?

Utvecklare älskar att Maverick-2 är en äkta “drop-in replacement”. De kan köra sina befintliga program omedelbart utan portningshinder som plågar den här branschen. Vi stöder för närvarande C/C++, Fortran, OpenMP och Kokkos utan extra kostnad, och CUDA, ROCm och stora AI-ramverk som TensorFlow, JAX, PyTorch och ONNX är under aktiv utveckling. Detta eliminerar leverantörsbunden och dyra omkodningar, och tillåter kunder att utvärdera och anta nya arkitekturer utan att störa sina arbetsflöden.

Hur fungerar Maverick-2:s telemetri-drivna systemoptimering bakom kulisserna? Vad är inblandat i att profilera och omkonfigurera chipen i realtid?

Tänk på vår systemoptimering som en kontinuerlig loop: under körning mäter vår telemetrisystem hundratals prestandaindikatorer (t.ex. minnesbandbredd, användning, ködjup). All den här datan matas in i en runtime-optimizer som bestämmer om den nuvarande hårdvarukonfigurationen fortfarande är optimal för arbetsbelastningen och dess förväntade behov. Om inte, kan den omkonfigurera resurser, omordna datapunkter och justera beräkningspipeliner kontinuerligt, vilket innebär att programmet inte behöver stoppas. Detta sker inom millisekunder, så programmet upprätthåller konsekvent topp-effektivitet när dess beräkningsprofil ändras.

Finns det specifika typer av arbetsbelastningar eller gränsfall där adaptiv runtime-prestandaoptimering är mindre effektiv eller introducerar trade-offs i latency eller effekt?

Varje arkitektur har trade-offs. Maverick-2 excellerar vid komplexa, oregelbundna arbetsbelastningar med skiftande beräknings- och dataåtkomstmönster. För högt förutsägbara, fasta arbetsbelastningar kan en vältrimmad GPU vara mycket effektiv utan den extra belastningen av anpassning. I dessa fall levererar vår anpassningsbarhet fortfarande solid prestanda, men den relativa fördelen kan vara mindre.

NextSilicons design handlar om allsidighet och konkurrenskraft i enkla fall, men är omvälvande i utmanande fall.

Varför bestämde du dig för att prioritera HPC-marknaden tidigt, när de flesta startups rusade in i AI? Hur har det format din produkt- och affärsstrategi?

HPC representerar gränsen för beräkningskomplexitet och problemlösning för stora datamängder, oregelbunden minnesåtkomst och oförutsägbara beräkningsmönster. Om du kan bygga en arkitektur som trivs där – som att köra exabyte-stora simuleringar i klimatmodellering eller partikelfysik, kommer den att excellerera i AI också.

Genom att fokusera på HPC först bevisade vi Maverick-2 på de mest krävande arbetsbelastningarna i klimatmodellering, fysik och livsvetenskap. Det gav oss trovärdighet, realvärldsprestandadata och en mogen produkt innan vi gick djupare in i AI-marknader. Nu är vi positionerade för att betjäna båda, utan att ha komprometterat vår arkitektur för att kapitalisera på kortvariga trender eller behov.

Nu när Maverick-2 är i produktion och distribueras över dussintals kunder, kan du dela exempel på hur det används? Finns det specifika resultat eller benchmark från flaggskeppsdistributioner?

Ett flaggskeppsexempel är vår distribution på Sandia National Labs, där Maverick-2 driver deras Spectra-superdator som en del av Vanguard-II-programmet. Vi ser imponerande prestandaresultat utan att kräva kodändringar. Vi arbetar också med ODISSEE (Online Data Intensive Solutions for Science in the Exabytes Era), som bringar samman ledande forskningsinstitutioner för att hantera exabyte-stora datamängder från CERN:s High-Luminosity Large Hadron Collider och Square Kilometre Array-observatoriet. Rollen som Maverick-2 kommer att spela är att lösa utmaningen att bearbeta petabyte råa experimentdata på en bråkdel av den tid och energi som tidigare krävdes. Slutmålet är att möjliggöra snabbare fysiska analyser och astronomiska upptäckter.

Du har samlat in över 300 miljoner dollar, med stora rundor som tillkännagavs 2021 och nyligen. Kan du dela hur den här finansieringen har accelererat din produktutveckling och marknadsräckvidd?

Finansieringen tillät oss att göra tre saker. Först kunde vi driva arkitekturen längre, inte bara inkrementella förbättringar, utan grundläggande framsteg som gjorde Maverick-2 produktionsklar. För det andra kunde vi skala vår tillverkning och leveranskedja för att möta den växande efterfrågan, en icke-trivial utmaning för nytt kisel. För det tredje kunde vi expandera vår programvaruekosystem för att möjliggöra för kunder att integrera och distribuera snabbare.

Det möjliggjorde också strategiska partnerskap med superdatorcenter och molnleverantörer, vilket tillät oss att rationalisera vår koncept-till-distribution-process och expandera mycket snabbare än traditionella hårdvarustartups.

I ett landskap som inkluderar Cerebras (CBRS ), SambaNova och Nvidia (NVDA ), hur ser du NextSilicon positionera sig? Vad är din marknadsstrategi som en utmanare?

Vi ser NextSilicon som mer av ett teknikföretag än bara ett chipföretag. Vi optimerar varje arbetsbelastning, erbjuder anpassningsbarhet och låser inte in kunder i proprietär programmering eller hårdvara. Våra kunder kan ta med sig sin befintliga kod och uppnå omedelbar acceleration utan långa portningscykler eller leverantörsbunden till en enda ekosystem, som CUDA. Detta är särskilt viktigt när AI-arbetsbelastningar utvecklas bortom ren utbildning. Resonemodeller, förlängd inferens och stora kontextfönster kräver fundamentalt olika beräkningsmönster: mer dynamisk minnesåtkomst, variabel längd beräkning och adaptiv resursallokering. Detta är inte problem som kan lösas med mer av samma fasta arkitektur.

Vår marknadsstrategi fokuserar på att lösa de svåraste problemen först: att arbeta med forskningsinstitutioner, nationella laboratorier och företag där prestanda, energieffektivitet och flexibilitet är avgörande. Därifrån skalar vi ut till bredare AI- och dataintensiva marknader. Branschen domineras av fasta arkitekturer. Vi erbjuder något annat, anpassningsbarhet byggd från början. AI är på väg att skifta från ren skala till intelligens. Större modeller möjliggör smartare resonemang, från korta prompter till långa kontextförståelser. I den här övergången kommer anpassningsbara arkitekturer inte bara att vara nya; de kommer att vara avgörande.

Tack för den underbara intervjun, läsare som vill lära sig mer kan besöka NextSilicon.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.