Intervjuer

Moshe Tanach, VD och medgrundare på NeuReality – Intervjuerien

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Moshe Tanach är VD och medgrundare av NeuReality. Innan han grundade NeuReality var Moshe teknisk direktör på Marvell och Intel (INTC ), där han ledde utvecklingen av komplexa trådlösa och nätverksprodukter till massproduktion. Han har också varit vice VD för FoU på DesignArt Networks (senare förvärvad av Qualcomm (QCOM )), där han bidrog till utvecklingen av 4G-basstationsprodukter.

NeuReality har som uppdrag att förenkla AI-användning. Genom att ta en systembaserad ansats till AI levererar NeuRealitys team av branschexperter AI-inferens holistiskt, identifierar smärtor och tillhandahåller specialbyggda, silikon-till-mjukvaru AI-inferenslösningar som gör AI både prisvärd och tillgänglig.

Med din omfattande erfarenhet av att leda ingenjörsprojekt på Marvell, Intel och DesignArt-Networks, vad inspirerade dig att medgrundare NeuReality, och hur påverkade dina tidigare roller visionen och riktningen för företaget?

NeuReality byggdes från början för att lösa de framtida kostnads-, komplexitets- och klimatproblem som skulle vara oundvikliga för AI-inferens – som är distributionen av tränade AI-modeller och programvara till produktionsnivåns AI-datacenter. Där AI-utbildning är hur AI skapas; AI-inferens är hur den används och hur den interagerar med miljarder människor och enheter runt om i världen.

Vi är ett team av systemingenjörer, så vi ser på alla aspekter, alla de många aspekterna av slut-till-slut-AI-inferens, inklusive GPU:er och alla klasser av specialbyggda AI-accelleratorer. Det blev tydligt för oss redan 2015 att CPU-baserade AI-chip och system – som är varje GPU, TPU, LPU, NRU, ASIC och FPGA där ute – skulle nå en betydande vägg 2020. Systembegränsningar där AI-accelleratorn har blivit bättre och snabbare i termer av råprestanda, men den underliggande infrastrukturen höll inte jämna steg.

Som ett resultat beslutade vi att bryta oss loss från de stora jättarna som är fulla av byråkrati som skyddar framgångsrika företag, som CPU- och NIC-tillverkare, och störa branschen med en bättre AI-arkitektur som är öppen, agnostisk och specialbyggd för AI-inferens. En av slutsatserna av att ompröva idealisk AI-inferens är att i och med att vi ökar GPU-användningen och systemnivåeffektiviteten, vår nya AI-beräknings- och nätverksinfrastruktur – som drivs av vår nya NR1-server-chip som ersätter värden CPU och NIC:er. Som en ingrediensmärke och kompanjon till vilken GPU eller AI-accellerator som helst kan vi ta bort marknadsbarriärer som avskräcker 65% av organisationerna från att innovera och anta AI idag – underutnyttjade GPU:er som leder till att man köper mer än vad som verkligen behövs (eftersom de körs i tomgång > 50% av tiden) – samtidigt som energiförbrukningen, AI-datacenterutmaningen och driftskostnaderna minskas.

Detta är en gång-i-livet-möjlighet att verkligen omvandla AI-systemarkitektur till det bättre baserat på allt jag har lärt mig och praktiserat under 30 år, och öppnar dörrarna för nya AI-innovatörer över hela branschen och tar bort CPU-flaskhalsar, komplexitet och koldioxidavtryck.

NeuRealitys uppdrag är att demokratisera AI. Kan du förklara vad “AI för alla” betyder för dig och hur NeuReality planerar att uppnå denna vision?

Vårt uppdrag är att demokratisera AI genom att göra det mer tillgängligt och prisvärt för alla organisationer, stora som små – genom att frigöra den maximala kapaciteten hos varje GPU eller varje AI-accellerator, så att du får mer från din investering; med andra ord, få MER från de dyra GPU-investeringar du gör, snarare än att KÖPA fler GPU:er som körs i tomgång > 50% av tiden. Vi kan öka AI-accelleratorer upp till 100% full kapacitet, samtidigt som vi levererar upp till 15X energieffektivitet och skär systemkostnaderna med upp till 90%. Detta är beställningsstorleksförbättringar. Vi planerar att uppnå denna vision med vår NR1 AI-inferenslösning, världens första datacenter-systemarkitektur anpassad för AI-eran. Den kör högvolym, högvariations AI-data pipelines prisvärt och effektivt med den extra fördelen av ett minskat koldioxidavtryck.

Att uppnå AI för alla betyder också att göra det enkelt att använda. På NeuReality förenklar vi AI-infrastrukturdistribution, hantering och skalbarhet, förbättrar affärsprocesser och lönsamhet och främjar sektorer som allmän hälsa, säkerhet, lag och ordning och kundservice. Vår påverkan sträcker sig över sektorer som medicinsk avbildning, kliniska prövningar, bedrägeridetektering, AI-innehållsskapande och många fler.

För närvarande är våra första kommersiellt tillgängliga NR1-S AI-inferensapparater tillgängliga med Qualcomm Cloud AI 100 Ultra-accelleratorer och genom Cirrascale, en molntjänstleverantör.

NR1 AI-inferenslösningen marknadsförs som den första datacenter-systemarkitekturen anpassad för AI-eran och specialbyggd för AI-inferens. Vilka var de viktigaste innovationerna och genombrotten som ledde till utvecklingen av NR1?

NR1 är namnet på den helasystemarkitektur vi har utformat och levererat till AI-branschen – som en öppen, fullt kompatibel AI-beräknings- och nätverksinfrastruktur som fullständigt kompletterar varje AI-accellerator och GPU. Om jag måste bryta ner det till de mest unika och spännande innovationerna som ledde till denna slut-till-slut-NR1-lösning och skiljer oss från andra, skulle jag säga:

  • Optimerade AI-beräkningsgrafer: Teamet utformade en programmerbar grafexekveringsaccelerator för att optimera bearbetningen av beräkningsgrafer, som är avgörande för AI och andra arbetsbelastningar som mediebearbetning, databaser och mer. Beräkningsgrafer representerar en serie operationer med beroenden, och denna bredare tillämplighet positionerar NR1 som potentiellt disruptiv utöver att bara superboosta GPU:er och andra AI-accelleratorer. Det förenklar AI-modelldistribution genom att generera optimerade beräkningsgrafer (CG) baserat på förbearbetad AI-data och programvaru-API:er, vilket leder till betydande prestandavinster.
  • NR1 NAPU (Network Addressable Processing Unit): Vår AI-inferensarkitektur drivs av NR1 NAPU – en 7nm server-chip som möjliggör direkt nätverksåtkomst för AI-för- och efterbearbetning. Vi packar 6,5 gånger mer kraft på en mindre NR1-chip än en typisk allmän CPU. Traditionellt hanteras förbearbetningsuppgifter (som datarengöring, formatering och funktionsextrahering) och efterbearbetningsuppgifter (som resultattolkning och formatering) av CPU. Genom att offloada dessa uppgifter till NR1 NAPU, förskjuter vi både CPU och NIC. Detta minskar flaskhalsar och tillåter snabbare övergripande bearbetning, blixtsnabba svarstider och lägre kostnad per AI-fråga. Detta minskar flaskhalsar och tillåter snabbare övergripande bearbetning.
  • NR1 AI-Hypervisor-teknologi: NR1:s patenterade maskinvarubaserade AI-Hypervisor optimerar AI-uppgiftsorkestrering och resursutnyttjande, förbättrar effektivitet och minskar flaskhalsar.
  • NR1 AI-over-Fabric-nätverksmotor: NR1 innehåller en unik AI-over-Fabric-nätverksmotor som säkerställer sömlös nätverksanslutning och effektiv skalbarhet av AI-resurser över flera NR1-chippar – som är kopplade till vilken GPU eller AI-accellerator som helst – inom samma inferensserver eller NR1-S AI-inferensapparat.

NeuRealitys senaste prestandadata betonar betydande kostnads- och energibesparingar. Kan du ge mer information om hur NR1 uppnår upp till 90% kostnadsbesparingar och 15x bättre energieffektivitet jämfört med traditionella system?

NeuRealitys NR1 skär kostnaden och energiförbrukningen för AI-inferens med upp till 90% och 15x, respektive. Detta uppnås genom:

  • Specialiserad kisel: Vår specialbyggda AI-inferensinfrastruktur drivs av NR1 NAPU-server-chipen, som absorberar CPU:ns och NIC:ens funktioner i en – och eliminerar behovet av CPU i inferens. I slutändan maximerar NR1 utdata från varje AI-accellerator eller GPU på det mest effektiva sättet som är möjligt.
  • Optimerad arkitektur: Genom att strömlinjeforma AI-dataflödet och inkorporera AI-för- och efterbearbetning direkt inom NR1 NAPU, offloader och ersätter vi CPU. Detta resulterar i minskad latens, linjär skalbarhet och lägre kostnad per AI-fråga.
  • Flexibel distribution: Du kan köpa NR1 på två primära sätt: 1) inuti NR1-M-modulen som är en PCIe-kort som innehåller flera NR1 NAPU:er (vanligtvis 10) utformade för att paras med dina befintliga AI-accellerator-kort. 2) inuti NR1-S-applikationen, som parar NR1 NAPU:er med ett lika stort antal AI-accelleratorer (GPU, ASIC, FPGA etc.) som en färdig AI-inferenssystem.

På Supercomputing 2024 i november kommer du att se oss demonstrera en NR1-S-applikation med 4x NR1-chippar per 16x Qualcomm Cloud AI 100 Ultra-accelleratorer. Vi har testat samma med Nvidia (NVDA ) AI-inferenschip. NeuReality revolutionerar AI-inferens med sin öppna, specialbyggda arkitektur.

 Hur matchar NR1-S AI-inferensappliance, i kombination med Qualcomm Cloud AI 100-accelleratorer, mot traditionella CPU-centrerade inferensservrar med Nvidia H100 eller L40S GPU:er i realvärldens tillämpningar?

NR1, i kombination med Qualcomm Cloud AI 100 eller NVIDIA H100 eller L40S GPU:er, levererar en betydande prestandaboost över traditionella CPU-centrerade inferensservrar i realvärldens AI-tillämpningar över stora språkmodeller som Llama 3, datorseende, naturligt språkbehandling och taligenkänning. Med andra ord, när du kör ditt AI-inferenssystem med NR1, optimerar du prestandan, systemkostnaden, energieffektiviteten och svarstiderna över bilder, ljud, språk och text – både separat (enkel modalitet) eller tillsammans (multi-modalitet).

Slutresultatet? När du parar NR1 med en kund, får du MER från de dyra GPU-investeringar du gör, snarare än att KÖPA fler GPU:er för att uppnå önskad prestanda.

Förutom att maximera GPU-användningen, levererar NR1 exceptionell effektivitet, vilket resulterar i 50-90% bättre pris/prestanda och upp till 13-15x större energieffektivitet. Detta översätter till betydande kostnadsbesparingar och ett minskat miljöavtryck för din AI-infrastruktur.

NR1-S visar linjär skalbarhet utan prestandaförluster. Kan du förklara de tekniska aspekterna som möjliggör en sådan sömlös skalbarhet?

NR1-S-applikationen, som parar våra NR1-chippar med AI-accelleratorer av alla typer eller kvantiteter, omdefinierar AI-infrastruktur. Vi har flyttat bortom CPU-centrerade begränsningar för att uppnå en ny nivå av prestanda och effektivitet.

Istället för den traditionella NIC-till-CPU-till-accellerator-flaskhalsen, integrerar NR1-S direkt nätverksåtkomst, AI-för- och efterbearbetning inom våra Network Addressable Processing Units (NAPU:er). Med vanligtvis 10 NAPU:er per system, var och en som hanterar uppgifter som vision, ljud och DSP-bearbetning, och vår AI-Hypervisor som orkestrerar arbetsbelastningar, uppnås strömlinjeformat AI-dataflöde. Detta översätter till linjär skalbarhet: lägg till fler accelleratorer, få proportionellt mer prestanda.

Resultatet? 100% användning av AI-accelleratorer observeras konsekvent. Medan den totala kostnaden och energieffektiviteten varierar beroende på de specifika AI-chippar som används, levereras maximalt hårdvaruinvestering och förbättrad prestanda konsekvent. När AI-inferensbehoven ökar, erbjuder NR1-S en övertygande alternativ till traditionella arkitekturer.

NeuReality syftar till att ta itu med hindren för omfattande AI-användning. Vilka är de mest betydande utmaningarna som företag möter när de antar AI, och hur hjälper din teknik till att övervinna dessa?

När de genomförs dåligt kan AI-programvara och lösningar bli besvärliga. Många företag kan inte anta AI på grund av kostnaden och komplexiteten i att bygga och skala AI-system. Idag är AI-lösningarna inte optimerade för inferens, med utbildningspoddar som vanligtvis har dålig effektivitet och inferensservrar som har höga flaskhalsar. För att ta itu med denna utmaning och göra AI mer tillgängligt har vi utvecklat den första kompletta AI-inferenslösningen – en beräknings- och nätverksinfrastruktur som drivs av vår NAPU – som gör det mesta av sin kompanjon AI-accellerator och minskar marknadsbarriärer runt överdriven kostnad och energiförbrukning.

Vår systembaserade ansats till AI-inferens – istället för att försöka utveckla en bättre GPU eller AI-accellerator där det redan finns mycket innovation och konkurrens – betyder att vi fyller en betydande branschgap för dussintals AI-inferenschip- och systeminnovatörer. Vårt team attackerade bristerna i AI-inferens systematiskt och holistiskt, genom att bestämma smärtor, arkitekturgap och AI-arbetsbelastningsprognoser – för att leverera den första specialbyggda, silikon-till-mjukvaru, CPU-fria AI-inferensarkitekturen. Och genom att utveckla en topp-till-botten AI-programvarustack med öppna standarder från Python och Kubernetes i kombination med NeuReality Toolchain, Provisioning och Inference API:er, kombinerar vår integrerade uppsättning programvaruverktyg alla komponenter i en enda högkvalitativ användargränssnitt.

I en konkurrensutsatt AI-marknad, vad skiljer NeuReality från andra AI-inferenslösningstillhandahållare?

För att säga det enkelt är vi öppna och accellerator-agnostiska. Vår NR1-inferensinfrastruktur superchargerar varje AI-accellerator – GPU, TPU, LPU, ASIC, du namnger det – och skapar en verkligt optimerad slut-till-slut-system. AI-accelleratorer infördes ursprungligen för att hjälpa CPU:er hantera kraven från neurala nätverk och maskinlärning i stor skala, men nu är AI-accelleratorerna så kraftfulla att de nu är begränsade av de CPU:er de var avsedda att hjälpa.

Vår lösning? NR1. Det är en komplett, omprövad AI-inferensarkitektur. Vår hemlig vapen? NR1 NAPU utformades som en samma ingrediens för att maximera AI-accelleratorprestanda utan att sluka extra kraft eller bryta banken. Vi har byggt ett öppet ekosystem, som sömlöst integrerar med varje AI-inferenschip och populära programvaruframework som Kubernetes, Python, TensorFlow och mer.

NeuRealitys öppna ansats betyder att vi inte konkurrerar med AI-landskapet; vi är här för att komplettera det genom strategiska partnerskap och teknologisamarbete. Vi tillhandahåller den saknade biten av pusslet: en specialbyggd, CPU-fri inferensarkitektur som inte bara låser upp AI-accelleratorer till benchmarkprestanda, utan också gör det enklare för företag och regeringar att anta AI. Tänk dig att frigöra den fulla kraften hos NVIDIA H100, Google (GOOGL ) TPUs eller AMD MI300 – och ge dem den infrastruktur de förtjänar.

NeuRealitys öppna, effektiva arkitektur nivellerar spelplanen, gör AI mer tillgängligt och prisvärt för alla. Jag är passionerad för att se olika branscher – fintech, biotech, hälso- och sjukvårdsteknik – uppleva NR1-fördelarna förstahands.

Om du ser framåt, vad är NeuRealitys långsiktiga vision för AI:s roll i samhället, och hur ser du att ditt företag bidrar till denna framtid?

Jag ser en framtid där AI gynnar alla, främjar innovation och förbättrar liv. Vi bygger inte bara teknik; vi bygger grunden för en bättre framtid.

Vår NR1 är nyckeln till den visionen. Det är en komplett AI-inferenslösning som börjar krossa kostnads- och komplexitetsbarriärerna som hindrar massiv AI-företagsadoption. Vi har omprövat både infrastrukturen och arkitekturen, levererar en revolutionerande system som maximerar utdata från varje GPU, varje AI-accellerator, utan att öka driftskostnader eller energiförbrukning.

Verksamhetsmodellen är verkligen viktig för att skala och ge slutkunderna riktiga val över koncentrerad AI-autokrati, som jag har skrivit om tidigare. Så istället bygger vi ett öppet ekosystem där vår kisel fungerar med annan kisel, inte mot den. Det är därför vi utformade NR1 för att integreras sömlöst med alla AI-accelleratorer och med öppna modeller och programvara, vilket gör det så enkelt som möjligt att installera, hantera och skala.

Men vi slutar inte där. Vi samarbetar med partners för att validera vår teknik över olika AI-arbetsbelastningar och leverera “inference-as-a-service” och “LLM-as-a-service” genom molntjänstleverantörer, hyper skalare och direkt med kompanjonschipstillverkare. Vi vill göra avancerad AI tillgänglig och prisvärd för alla.

Tänk dig möjligheterna om vi kunde förbättra AI-inferensprestanda, energieffektivitet och prisvärdhet med tvåsiffriga procentsatser. Tänk dig ett robust, AI-aktiverat samhälle med fler röster och val som blir verklighet. Så vi måste alla göra det krävande arbetet med att bevisa affärsverkan och ROI när AI implementeras i d inom dagliga datacenteroperationer. Låt oss fokusera på revolutionerande AI-implementering, inte bara AI-modellkapacitet.

Detta är hur vi bidrar till en framtid där AI gynnar alla – en vinst för vinstmarginaler, människor och planeten.

Tack för den underbara intervjun, läsare som vill lära sig mer bör besöka NeuReality.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.