Interviews

Elad Raz, CEO van NextSilicon – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Elad Raz, CEO van NextSilicon, is een ervaren ondernemer en technologieleider die breed wordt gerespecteerd vanwege zijn diepe expertise in low-level systemen, beveiliging, netwerken en bestandssysteemontwikkeling. Gedurende een carrière die bestaat uit elite militaire ingenieursfuncties, senior softwareleiderschapsfuncties, bedrijfsopbouw en langetermijninvesteringen, heeft Raz complexe, missie-kritieke projecten geleid over het algemeen in het onderhoud van besturingssystemen en hardware-software-integratie. Voordat hij NextSilicon oprichtte, bouwde hij meerdere technologiebedrijven op en verliet hij deze, bekleedde hij senior leiderschapsfuncties bij een toonaangevende halfgeleiderfabrikant en investeerde hij in een divers portfolio van startups, waarbij hij hands-on technische diepgang combineerde met sterke uitvoering en langetermijnstrategische visie.

NextSilicon is een Israëlische high-performance computing- en halfgeleiderbedrijf dat in 2017 is opgericht en dat compute-architectuur voor veeleisende workloads zoals AI en wetenschappelijke computing herdefinieert. Het bedrijf heeft een software-gedefinieerd, intelligent compute-platform ontwikkeld dat is ontworpen om hoge prestaties en efficiëntie te leveren zonder dat ontwikkelaars applicaties opnieuw moeten schrijven. Door zich te concentreren op aanpasbaarheid op hardwareniveau, streeft NextSilicon ernaar om fundamentele bottlenecks in moderne datacenters en supercomputing-omgevingen aan te pakken en positioneert zichzelf als een next-generation-alternatief voor traditionele accelerators.

Kunt u ons vertellen over uw reis die leidde tot de oprichting van NextSilicon? Wat was de aanleiding voor het initiële idee, en hoe hebben uw vroege ervaringen met computing uw visie gevormd?

Ik ben al sinds mijn kindertijd gefascineerd door computers. Die fascinatie leidde me van het knutselen met oude Commodore 64’s en Ataris (die ik nog steeds verzamel) tot het mede-oprichten van startups en uiteindelijk het verkopen van mijn vorige bedrijf aan Mellanox. Maar zelfs met die vroege successen, bleef ik steeds dezelfde uitdaging zien in deze industrie. Naarmate computationele workloads complexer werden, bereikten traditionele CPU- en GPU-architecturen prestatie-, energie-efficiëntie- en schaalbaarheidslimieten. Of het nu ging om het optimaliseren van algoritmes of het uitvoeren van grootschalige simulaties, het werd duidelijk dat de huidige architectuur workloads dwong om zich aan te passen aan de hardware – en niet andersom.

De vonk voor NextSilicon kwam voort uit deze terugkerende uitdaging en stelde de vraag: Wat als we het script konden omdraaien en compute-architecturen konden bouwen die zich aanpassen aan workloads, in plaats van workloads te dwingen om zich aan te passen aan de hardware? Mijn vroege blootstelling aan algoritme-ontwerp en hardware leerde me dat de echte doorbraak zou komen van het combineren van de twee in real-time. Dat is de basis van onze Intelligent Compute Architecture (ICA) en NextSilicon’s leidende visie vanaf het begin.

Maverick-2 wordt beschreven als een Intelligent Compute Accelerator die zich aanpast aan real-time workloads. Hoe verschilt zijn architectuur van traditionele GPUs of FPGAs, en wat maakt die niveau van aanpasbaarheid mogelijk?

CPUs en GPUs hebben onze wereld getransformeerd en ons goed gediend. Maar ze waren nooit ontworpen om te voldoen aan de eisen van moderne AI- en high-performance computing (HPC)-workloads in gebieden zoals wetenschap, weer, energie en defensie. Deze workloads hebben complexe gegevensafhankelijkheden, geheugentoegangspatronen en berekeningspatronen die de huidige processoren niet zijn ontworpen om te verwerken. Het resultaat is bottlenecks die innovatie vertragen.

Maverick-2’s sleutelverschil is zijn novatieve benadering die een herschikbare dataflow-engine combineert met real-time software-optimalisatie. Het sleutelarchitectonische verschil is dat de hardware wordt geconfigureerd op basis van uw workload, in plaats van dat de workload wordt geconfigureerd op basis van de hardware. Voor Maverick-2 wordt de berekening aangedreven door gegevensbeschikbaarheid, in plaats van dat een programmateller instructie-uitvoering aandrijft zoals in traditionele processoren. Dit stelt ons in staat om software-gedefinieerde virtuele verwerkingseenheden te creëren die in real-time kunnen worden geconfigureerd en opnieuw geconfigureerd om specifieke workloadpatronen te matchen.

De resultaten spreken voor zich: Maverick-2 levert meer dan 4 keer de prestaties per watt van GPUs en meer dan 20 keer die van CPUs, terwijl de operationele kosten met meer dan de helft worden verlaagd. Als gevolg hiervan kunnen onderzoekers en ingenieurs grote, onregelmatige simulaties sneller en efficiënter uitvoeren, waardoor inzichten en doorbraken in een fractie van de tijd worden ontgrendeld.

U hebt meer dan 4 keer de prestaties per watt van GPUs en meer dan 20 keer die van high-end CPUs gerapporteerd. Wat zijn de belangrijkste innovaties die deze prestatieverbeteringen in real-world workloads drijven?

De prestatieverbeteringen komen voort uit een paar belangrijke innovaties die samenwerken.

Ten eerste zijn we afgestapt van het Von Neumann-model dat de computing heeft gedomineerd voor 80 jaar. In plaats van sequentiële instructie-uitvoering, gebruikt Maverick-2 een dataflow-architectuur waarbij de berekening volgt op gegevensbeschikbaarheid. Dit is fundamenteel beter geschikt voor onregelmatige, geheugen-intensieve workloads.

Ten tweede genereert onze zelf-optimaliserende architectuur software-gedefinieerde processor-kernen in real-time. De hardware past zich aan elke toepassing aan zonder dat code-herschrijving vereist is – u krijgt optimalisatie zonder overhead.

Ten derde, en dit is kritisch: we focussen op duurzame real-world prestaties, niet op theoretische pieken. Veel architecturen zien er goed uit op papier, maar falen op echte workloads. Maverick-2 behoudt efficiëntie over AI, HPC en vector-databases door zich voortdurend aan te passen aan de behoeften van de workload.

Maverick-2 ondersteunt C/C++, Fortran, OpenMP en Kokkos out of the box zonder dat code-wijzigingen vereist zijn. Hoe hebben ontwikkelaars gereageerd op die compatibiliteit, en wat zijn uw plannen voor het ondersteunen van CUDA, ROCm of populaire AI-frameworks?

Ontwikkelaars houden van het feit dat Maverick-2 een echte “drop-in replacement” is. Ze kunnen hun bestaande applicaties onmiddellijk uitvoeren zonder de poortbarrières die deze industrie teisteren. We ondersteunen momenteel C/C++, Fortran, OpenMP en Kokkos out of the box, met CUDA, ROCm en belangrijke AI-frameworks zoals TensorFlow, JAX, PyTorch en ONNX in actieve ontwikkeling. Dit elimineert vendor-lock-in en dure code-herschrijving en stelt klanten in staat om nieuwe architecturen te evalueren en te adopteren zonder hun workflows te verstoren.

Hoe werkt de telemetrie-gestuurde systeemoptimalisatie van Maverick-2 achter de schermen? Wat is er betrokken bij het profileren en opnieuw configureren van de chip in real-time?

Denk aan onze systeemoptimalisatie als een continue lus: tijdens de uitvoering meet onze telemetriesysteem honderden prestatie-indicatoren (bijv. geheugenbandbreedte, bezetting, wachtrijdiepten). Al deze gegevens worden gevoed naar een runtime-optimalisator die bepaalt of de huidige hardwareconfiguratie nog steeds optimaal is voor de workload en de verwachte behoeften. Als dat niet het geval is, kan het de resources opnieuw partitioneren, gegevenspaden opnieuw ordenen en berekeningspijpen aanpassen, waardoor de toepassing niet stopt. Dit gebeurt binnen milliseconden, zodat de toepassing consistent een piekefficiëntie behoudt terwijl het berekeningsprofiel verandert.

Zijn er specifieke typen workloads of randgevallen waarbij adaptieve runtime-prestatieafstemming minder effectief is of compromissen introduceert in latentie of vermogen?

Elke architectuur heeft compromissen. Maverick-2 excelleert in complexe, onregelmatige workloads met veranderende berekenings- en gegevenstoegangspatronen. Voor zeer voorspelbare, vaste-functie workloads kan een goed afgestemde GPU zeer efficiënt zijn zonder de overhead van aanpassing. In die gevallen levert onze aanpasbaarheid nog steeds solide prestaties, maar het relatieve voordeel kan kleiner zijn.

NextSilicon’s ontwerp is alles over veelzijdigheid en concurrerend vermogen in eenvoudige gevallen, maar transformatief in uitdagende gevallen.

Waarom hebt u ervoor gekozen om de HPC-markt prioriteit te geven in het begin, toen de meeste startups zich haastten om AI te betreden? Hoe heeft dat uw product- en bedrijfsstrategie gevormd?

HPC vertegenwoordigt de frontier van computationele complexiteit en probleemoplossing voor grote datasets, onregelmatige geheugen-toegang en onvoorspelbare berekeningspatronen. Als u een architectuur kunt bouwen die daar uitblinkt – zoals het uitvoeren van exabyte-schaal simulaties in klimaatmodellering of deeltjesfysica – zal het ook uitblinken in AI.

Door ons te concentreren op HPC in het begin, hebben we Maverick-2 bewezen op de meest veeleisende workloads in klimaatmodellering, fysica en levenswetenschappen. Dat gaf ons geloofwaardigheid, real-world prestatiegegevens en een volwassen product voordat we dieper gingen in AI-markten. Nu zijn we gepositioneerd om zowel HPC als AI te bedienen, zonder onze architectuur te hebben gecompromitteerd om kortetermijntrends of -behoeften te kapitaliseren.

Nu Maverick-2 in productie is en wordt uitgerold bij tientallen klanten, kunt u voorbeelden delen van hoe het wordt gebruikt? Zijn er specifieke resultaten of benchmarks van vlaggenschip-implementaties?

Een vlaggenschipvoorbeeld is onze implementatie bij Sandia National Labs, waar Maverick-2 de Spectra-supercomputer aandrijft als onderdeel van het Vanguard-II-programma. We zien indrukwekkende out-of-the-box prestatieresultaten zonder dat code-wijzigingen vereist zijn. We werken ook met ODISSEE (Online Data Intensive Solutions for Science in the Exabytes Era), dat toonaangevende onderzoeksinstellingen samenbrengt om exabyte-schaal gegevens van CERN’s High-Luminosity Large Hadron Collider en de Square Kilometre Array Observatory te verwerken. De rol die Maverick-2 zal spelen is het oplossen van de uitdaging van het verwerken van petabytes aan ruwe experimentele gegevens in een fractie van de tijd en energie die eerder nodig was. Het einddoel is om snellere fysica-analyses en astronomische ontdekkingen mogelijk te maken.

U hebt meer dan $300 miljoen opgehaald, met belangrijke ronden aangekondigd in 2021 en onlangs. Kunt u delen hoe die financiering uw productontwikkeling en marktbereik heeft versneld?

De financiering stelde ons in staat om drie dingen te doen. Ten eerste konden we de architectuur verder duwen, niet alleen incrementele verbeteringen, maar fundamentele vooruitgang die Maverick-2 productieklaar maakte. Ten tweede konden we onze productie en toeleveringsketen opschalen om aan de groeiende vraag te voldoen, een niet-triviale uitdaging voor nieuw silicium. Ten derde konden we ons software-ecosysteem uitbreiden om klanten in staat te stellen om sneller te integreren en te implementeren.

Het stelde ons ook in staat om strategische partnerschappen aan te gaan met supercomputing-centra en cloudproviders, waardoor we ons concept-tot-implementatieproces konden stroomlijnen en veel sneller konden uitbreiden dan traditionele hardware-startups.

In een landschap dat Cerebras (CBRS ), SambaNova en Nvidia (NVDA ) omvat, hoe ziet u NextSilicon zich positioneren? Wat is uw go-to-market-benadering als uitdager?

We zien NextSilicon als meer een technologiebedrijf dan alleen een chipbedrijf. We optimaliseren elke workload, bieden aanpasbaarheid en dwingen klanten niet om zich aan te passen aan propriëtaire programmering of hardware. Onze klanten kunnen hun bestaande code meenemen en onmiddellijke acceleratie bereiken zonder lange poortcycli of vendor-lock-in naar een enkel ecosysteem, zoals CUDA. Dit is vooral belangrijk als AI-workloads evolueren voorbij pure training. Redeneermodellen, uitgebreide inferentie en grote contextvensters vereisen fundamenteel andere compute-patronen: meer dynamische geheugen-toegang, variabele lengte berekening en adaptieve resource-toewijzing. Dit zijn geen problemen die u oplost met meer van hetzelfde vaste architectuur.

Onze go-to-market-strategie richt zich op het oplossen van de moeilijkste problemen eerst: werken met onderzoeksinstellingen, nationale laboratoria en ondernemingen waar prestaties, energie-efficiëntie en flexibiliteit kritiek zijn. Van daaruit schalen we op naar bredere AI- en data-intensieve markten. De industrie wordt gedomineerd door vaste architecturen. We bieden iets anders, aanpasbaarheid vanaf het begin. AI is aan het verschuiven van pure schaal naar intelligentie. Grotere modellen maken slimmere redenering mogelijk, van korte prompts tot lange-contextbegrip. In deze overgang zullen aanpasbare architecturen niet alleen nieuw zijn, maar essentieel.

Bedankt voor het geweldige interview, lezers die meer willen leren, moeten NextSilicon bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.