Interviews

Moshe Tanach, CEO en mede-oprichter van NeuReality – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Moshe Tanach is de CEO en mede-oprichter van NeuReality. Voordat hij NeuReality oprichtte, was Moshe directeur van Engineering bij Marvell en Intel (INTC ), waar hij de ontwikkeling van complexe draadloze en netwerkproducten naar massaproductie leidde. Hij was ook vice-president van R&D bij DesignArt Networks (later overgenomen door Qualcomm (QCOM )), waar hij bijdroeg aan de ontwikkeling van 4G-basistationproducten.

NeuReality’s missie is om de adoptie van AI te vereenvoudigen. Door een systeembenadering van AI te hanteren, levert het team van NeuReality AI-inferentie holistisch, waarbij ze pijnlijke punten identificeren en doelgerichte, siliconen-tot-software AI-inferentieoplossingen bieden die AI zowel betaalbaar als toegankelijk maken.

Met uw uitgebreide ervaring in het leiden van engineeringprojecten bij Marvell, Intel en DesignArt-Networks, wat inspireerde u om NeuReality mede op te richten, en hoe hebben uw voorgaande rollen de visie en richting van het bedrijf beïnvloed?

NeuReality is vanaf het begin opgericht om de toekomstige kosten-, complexiteits- en klimaatproblemen op te lossen die onvermijdelijk zouden zijn bij AI-inferentie – het in productie brengen van getrainde AI-modellen en software. Waar AI-training is hoe AI wordt gecreëerd; AI-inferentie is hoe het wordt gebruikt en hoe het interacteert met miljarden mensen en apparaten over de hele wereld.

We zijn een team van systeemingenieurs, dus we kijken naar alle aspecten van eind-tot-eind AI-inferentie, inclusief GPUs en alle soorten doelgerichte AI-versnellers. Het werd ons duidelijk dat CPU-afhankelijke AI-chips en -systemen – wat elke GPU, TPU, LPU, NRU, ASIC en FPGA is – tegen 2020 een significante barrière zouden bereiken. De systeembeperkingen waarbij de AI-versneller beter en sneller is geworden in termen van ruwe prestaties, maar de onderliggende infrastructuur niet heeft bijgehouden.

Als gevolg daarvan besloten we om af te wijken van de grote reuzen die zijn volledig van bureaucratie en die succesvolle bedrijven beschermen, zoals CPU- en NIC-fabrikanten, en de industrie te verstoren met een betere AI-architectuur die open, agnostisch en doelgericht is voor AI-inferentie. Een van de conclusies van het herscheppen van de ideale AI-inferentie is dat door het verhogen van de GPU-gebruik en het systeemniveau-efficiëntie, onze nieuwe AI-computatie- en netwerkinfrastructuur – aangedreven door onze novelle NR1-server-on-chip die de host-CPU en NIC’s vervangt – marktbarrières kan verwijderen die 65% van de organisaties ervan weerhouden om AI vandaag te innoveren en te adopteren – onderbenutte GPUs die leiden tot het kopen van meer dan wat echt nodig is (omdat ze meer dan 50% van de tijd stil staan) – en tegelijkertijd energieverbruik, AI-datacenter-uitdagingen en operationele kosten verminderen.

Dit is een kans van een leven om echt de AI-systeemarchitectuur te transformeren voor het beter, op basis van alles wat ik heb geleerd en geoefend in 30 jaar, en de deuren te openen voor nieuwe AI-innovators in de industrie en CPU-bottlenecks, complexiteit en koolstofvoetafdrukken te verwijderen.

NeuReality’s missie is om AI te democratiseren. Kunt u uitleggen wat “AI voor iedereen” voor u betekent en hoe NeuReality deze visie wil bereiken?

Onze missie is om AI te democratiseren door het toegankelijker en betaalbaarder te maken voor alle organisaties, groot en klein – door de maximale capaciteit van elke GPU of elke AI-versneller te ontsluiten, zodat u meer krijgt van uw investering; met andere woorden, meer krijgen van de GPUs die u koopt, in plaats van meer GPUs te kopen die meer dan 50% van de tijd stil staan. We kunnen AI-versnellers tot 100% volle capaciteit boosten, terwijl we tot 15x energoefficiëntie en systeemkosten tot 90% verminderen. Dit zijn verbeteringen van een orde van grootte. We willen deze visie bereiken met onze NR1 AI-inferentieoplossing, de werelds eerste datacenter-systeemarchitectuur die speciaal is ontworpen voor de AI-tijdperk. Het draait hoge-volumineuze, hoge-variëteit AI-gegevenspijpleidingen betaalbaar en efficiënt, met het extra voordeel van een verlaagde koolstofvoetafdruk.

Het bereiken van AI voor iedereen betekent ook dat het gemakkelijk moet zijn om te gebruiken. Bij NeuReality vereenvoudigen we de implementatie, het beheer en de schaalbaarheid van AI-infrastructuur, verbeteren we bedrijfsprocessen en winstgevendheid, en stimuleren we sectoren zoals openbare gezondheid, veiligheid, rechtshandhaving en klantenservice. Ons impact beslaat sectoren zoals medische beeldvorming, klinische proeven, fraudeopsporing, AI-inhoudscreatie en veel meer.

Op dit moment zijn onze eerste commercieel beschikbare NR1-S AI-inferentieapparaten beschikbaar met Qualcomm Cloud AI 100 Ultra-versnellers en via Cirrascale, een cloudserviceprovider.

Het NR1 AI-inferentieplatform wordt geprezen als de eerste datacenter-systeemarchitectuur die speciaal is ontworpen voor de AI-tijdperk en doelgericht is voor AI-inferentie. Wat waren de belangrijkste innovaties en doorbraken die leidden tot de ontwikkeling van het NR1?

NR1™ is de naam van de gehele siliconen-tot-software-systeemarchitectuur die we hebben ontworpen en geleverd aan de AI-industrie – als een open, volledig compatibele AI-computatie- en netwerkinfrastructuur die volledig aansluit bij elke AI-versneller en GPU. Als ik het moest afbreken tot de meest unieke en spannende innovaties die leidden tot deze eind-tot-eind NR1-oplossing en ons onderscheidt, zou ik zeggen:

  • Geoptimaliseerde AI-computegrafieken: Het team ontwierp een programmeerbare grafiekuitvoeringsversneller om de verwerking van computegrafieken te optimaliseren, die cruciaal zijn voor AI en andere workloads zoals mediabewerking, databases en meer. Computegrafieken vertegenwoordigen een reeks bewerkingen met afhankelijkheden, en deze bredere toepasbaarheid positioneert NR1 als potentieel disruptief buiten alleen het super boosten van GPUs en andere AI-versnellers. Het vereenvoudigt AI-modelimplementatie door geoptimaliseerde computegrafieken (CG’s) te genereren op basis van voorbewerkte AI-gegevens en software-API’s, wat leidt tot aanzienlijke prestatieverbeteringen.
  • NR1 NAPU™ (Network Addressable Processing Unit): Onze AI-inferentiearchitectuur wordt aangedreven door de NR1 NAPU™ – een 7nm-server-on-chip die directe netwerktoegang mogelijk maakt voor AI-voor- en naverwerking. We pakken 6,5x meer kracht op een kleinere NR1-chip dan een typische algemene doel-CPU. Traditioneel worden voorbewerkingsTaken (zoals gegevensreiniging, formattering en kenmerkextractie) en naverwerkingstaken (zoals resultaatinterpretatie en formattering) door de CPU afgehandeld. Door deze taken over te dragen aan de NR1 NAPU™, vervangen we zowel de CPU’s als de NIC’s. Dit vermindert bottlenecks en maakt snellere algehele verwerking, bliksemsnelle responstijden en lagere kosten per AI-query mogelijk.
  • NR1™ AI-Hypervisor™-technologie: De NR1’s gepatenteerde hardwaregebaseerde AI-Hypervisor™ optimaliseert AI-taakorkestratie en resource-gebruik, waardoor efficiëntie en bottlenecks worden verbeterd.
  • NR1™ AI-over-Fabric™-netwerkengine: De NR1 bevat een unieke AI-over-Fabric™-netwerkengine die naadloze netwerkconnectiviteit en efficiënte schaalbaarheid van AI-bronnen over meerdere NR1-chips – die zijn gekoppeld aan elke GPU of AI-versneller – binnen dezelfde inferentieserver of NR1-S AI-inferentieapparaat garandeert.

NeuReality’s recente prestatiegegevens benadrukken aanzienlijke kosten- en energiereducties. Kunt u meer details geven over hoe het NR1 tot 90% kostenbesparingen en 15x betere energoefficiëntie bereikt in vergelijking met traditionele systemen?

NeuReality’s NR1 vermindert de kosten en energieverbruik van AI-inferentie tot 90% en 15x, respectievelijk. Dit wordt bereikt door:

  • Speciaal ontworpen silicium: Onze doelgerichte AI-inferentie-infrastructuur wordt aangedreven door de NR1 NAPU™-server-on-chip, die de functionaliteit van de CPU en NIC in één combineert – en elimineert de behoefte aan CPU’s in inferentie. Uiteindelijk maximaliseert de NR1 de output van elke AI-versneller of GPU op de meest efficiënte manier mogelijk.
  • Geoptimaliseerde architectuur: Door de AI-gegevensstroom te stroomlijnen en AI-voor- en naverwerking rechtstreeks in de NR1 NAPU™ te integreren, offloaden en vervangen we de CPU. Dit resulteert in verlaagde latentie, lineaire schaalbaarheid en lagere kosten per AI-query.
  • Flexibele implementatie: U kunt de NR1 op twee primaire manieren kopen: 1) in de NR1-M™-module, die een PCIe-kaart is die meerdere NR1 NAPU’s (typisch 10) bevat, ontworpen om te worden gekoppeld aan uw bestaande AI-versnellerkaarten. 2) in de NR1-S™-apparaat, die NR1 NAPU’s koppelt aan een gelijk aantal AI-versnellers (GPU, ASIC, FPGA, enz.) als een klaar-om-te-gebruiken AI-inferentiesysteem.

Op Supercomputing 2024 in november zult u ons zien demonstreren van een NR1-S-apparaat met 4x NR1-chips per 16x Qualcomm Cloud AI 100 Ultra-versnellers. We hebben hetzelfde getest met Nvidia (NVDA ) AI-inferentiechips. NeuReality revolutioneert AI-inferentie met zijn open, doelgerichte architectuur.

 Hoe verhoudt het NR1-S AI-inferentieapparaat zich tot traditionele CPU-gecentreerde inferentieservers met Nvidia® H100 of L40S GPUs in real-world toepassingen?

NR1, in combinatie met Qualcomm Cloud AI 100 of NVIDIA H100 of L40S GPUs, levert een aanzienlijke prestatieverbetering in real-world AI-toepassingen over traditionele CPU-gecentreerde inferentieservers. In andere woorden, het uitvoeren van uw AI-inferentiesysteem met NR1 optimaliseert de prestaties, systeemkosten, energieverbruik en responstijden over afbeeldingen, geluid, taal en tekst – zowel afzonderlijk (enkele modaliteit) als samen (meerdere modaliteiten).

Het eindresultaat? Wanneer u NR1 combineert met een klant, krijgt u meer van uw dure GPU-investeringen, in plaats van meer GPUs te kopen om de gewenste prestaties te bereiken.

Behalve het maximaliseren van de GPU-gebruik, levert de NR1 uitzonderlijke efficiëntie, waardoor 50-90% betere prijs-prestatie en tot 13-15x grotere energoefficiëntie mogelijk zijn. Dit vertaalt zich in aanzienlijke kostenbesparingen en een verlaagde milieu-impact voor uw AI-infrastructuur.

Het NR1-S-apparaat toont lineaire schaalbaarheid met geen prestatieafnames. Kunt u de technische aspecten uitleggen die zo’n naadloze schaalbaarheid mogelijk maken?

Het NR1-S-apparaat, dat onze NR1-chips koppelt aan AI-versnellers van elk type of hoeveelheid, herdefinieert AI-infrastructuur. We zijn verder gegaan dan de traditionele CPU-beperkingen om een nieuw niveau van prestaties en efficiëntie te bereiken.

In plaats van de traditionele NIC-naar-CPU-naar-versneller-bottleneck, integreert het NR1-S rechtstreeks netwerktoegang, AI-voor- en naverwerking in onze Network Addressable Processing Units (NAPU’s). Met typisch 10 NAPU’s per systeem, waarvan elk taken zoals visie, audio en DSP-verwerking afhandelt, en onze AI-Hypervisor™ die workloads orkestreert, wordt gestroomlijnde AI-gegevensstroom bereikt. Dit vertaalt zich in lineaire schaalbaarheid: voeg meer versnellers toe, krijg proportioneel meer prestaties.

Het resultaat? 100% gebruik van AI-versnellers wordt consistent waargenomen. Terwijl de algehele kosten en energoefficiëntie afhankelijk zijn van de specifieke AI-chips die worden gebruikt, worden gemaximaliseerde hardware-investeringen en verbeterde prestaties consistent geleverd. Naarmate de AI-inferentiebehoeften toenemen, biedt het NR1-S een overtuigend alternatief voor traditionele architecturen.

NeuReality heeft als doel de barrières voor brede AI-adoptie aan te pakken. Wat zijn de meest significante uitdagingen waar bedrijven mee te maken krijgen bij het adopteren van AI, en hoe helpt uw technologie deze uitdagingen te overwinnen?

Wanneer deze slecht worden geïmplementeerd, kunnen AI-software en -oplossingen problematisch worden. Veel bedrijven kunnen AI niet adopteren vanwege de kosten en complexiteit van het opbouwen en schalen van AI-systemen. Vandaag de dag zijn AI-oplossingen niet geoptimaliseerd voor inferentie, met trainingspods die typisch slechte efficiëntie hebben en inferentieservers die hoge bottlenecks hebben. Om deze uitdaging aan te pakken en AI toegankelijker te maken, hebben we de eerste complete AI-inferentieoplossing ontwikkeld – een compute- en netwerkinfrastructuur die wordt aangedreven door onze NAPU – die het meest maakt van zijn companion AI-versneller en marktbarrières rond excessieve kosten en energieverbruik vermindert.

Onze systeembenadering van AI-inferentie – in plaats van te proberen een betere GPU of AI-versneller te ontwikkelen, waar er al veel innovatie en concurrentie is – betekent dat we een significante industrieleemte invullen voor tientallen AI-inferentiechip- en systeeminnovators. Ons team heeft de tekortkomingen in AI-inferentie systematisch en holistisch aangepakt, door pijnlijke punten, architectuurgaten en AI-werkbelastingen te bepalen – om de eerste doelgerichte, siliconen-tot-software, CPU-vrije AI-inferentiearchitectuur te leveren. En door een top-tot-bodem AI-softwarestack te ontwikkelen met open standaarden van Python en Kubernetes, gecombineerd met NeuReality Toolchain, Provisioning en Inference-API’s, combineert onze geïntegreerde set van softwaretools alle componenten in een enkele high-quality UI/UX.

In een concurrerende AI-markt, wat onderscheidt NeuReality van andere AI-inferentieoplossingsleveranciers?

Om het simpel te zeggen, we zijn open en versneller-agnostisch. Onze NR1-inferentie-infrastructuur supercharged elke AI-versneller – GPU, TPU, LPU, ASIC, noem maar op – en creëert een echt geoptimaliseerd eind-tot-eind-systeem. AI-versnellers werden oorspronkelijk ingevoerd om te helpen CPU’s de eisen van neurale netwerken en machine learning op grote schaal te verwerken, maar nu zijn de AI-versnellers zo krachtig geworden dat ze worden gehinderd door de CPU’s die ze bedoeld waren te helpen.

Onze oplossing? De NR1. Het is een complete, herschapen AI-inferentiearchitectuur. Ons geheime wapen? De NR1 NAPU™ is ontworpen als een co-ingredient om AI-versnellerprestaties te maximaliseren zonder extra energie te verbruiken of de bank te breken. We hebben een open ecosysteem opgebouwd, naadloos geïntegreerd met elke AI-inferentiechip en populaire softwareframeworks zoals Kubernetes, Python, TensorFlow en meer.

NeuReality’s open benadering betekent dat we niet concurreren met het AI-landschap; we zijn hier om het te complementeren door strategische partnerschappen en technologie-samenwerking. We bieden het ontbrekende stuk van de puzzel: een doelgerichte, CPU-vrije inferentiearchitectuur die niet alleen AI-versnellers ontgrendelt om benchmarkprestaties te bereiken, maar ook het voor bedrijven en overheden gemakkelijker maakt om AI te adopteren. Stel uzelf voor dat u de volle kracht van NVIDIA H100’s, Google (GOOGL ) TPUs of AMD MI300’s ontsluit – en ze de infrastructuur geeft die ze verdienen.

NeuReality’s open, efficiënte architectuur levelt het speelveld, waardoor AI toegankelijker en betaalbaarder wordt voor iedereen. Ik ben gepassioneerd om te zien dat verschillende industrieën – fintech, biotech, healthtech – de NR1-voordelen voor het eerst meemaken. Vergelijk uw AI-oplossingen op traditionele CPU-gebonden systemen versus de moderne NR1-infrastructuur en getuige van het verschil. Vandaag de dag hebben slechts 35% van de bedrijven en overheden AI geadopteerd, en dat is gebaseerd op extreem lage kwalificatiecriteria. Laten we ervoor zorgen dat meer dan 50% van de ondernemingsklanten AI kunnen adopteren tegen deze tijd volgend jaar zonder de planeet te schaden of de bank te breken.

Kijkend naar de toekomst, wat is NeuReality’s langetermijnvisie voor de rol van AI in de samenleving, en hoe ziet u uw bedrijf bijdragen aan deze toekomst?

Ik voorzie een toekomst waarin AI iedereen ten goede komt, innovatie stimuleert en levens verbetert. We bouwen niet alleen technologie; we bouwen de basis voor een betere toekomst.

Onze NR1 is de sleutel tot die visie. Het is een complete AI-inferentieoplossing die begint met het verbreken van de kosten- en complexiteitsbarrières die massale AI-zakelijke adoptie hinderen. We hebben zowel de infrastructuur als de architectuur herschapen, en leveren een revolutionair systeem dat de output van elke GPU, elke AI-versneller, maximaliseert zonder operationele kosten of energieverbruik te verhogen.

Het bedrijfsmodel is echt belangrijk om te schalen en eindklanten echte keuzes te geven over geconcentreerde AI-autocratie, zoals ik eerder heb geschreven. In plaats daarvan bouwen we een open ecosysteem waarin ons silicium met ander silicium werkt, niet ertegen. Dat is waarom we de NR1 hebben ontworpen om naadloos te integreren met alle AI-versnellers en open modellen en software, waardoor het zo gemakkelijk mogelijk is om te installeren, beheren en schalen.

Maar we stoppen daar niet mee. We werken samen met partners om onze technologie te valideren over verschillende AI-werkbelastingen en “inference-as-a-service” en “LLM-as-a-service” te leveren via cloudserviceproviders, hyperscalers en rechtstreeks met companion-chipfabrikanten. We willen geavanceerde AI toegankelijk en betaalbaar maken voor iedereen.

Stel uzelf voor dat we AI-inferentieprestaties, energoefficiëntie en betaalbaarheid met dubbele cijfers konden verbeteren. Stel uzelf voor dat een robuust, AI-geactiveerd samenleving met meer stemmen en keuzes een realiteit wordt. Dus, we moeten allemaal het moeilijke werk doen om bedrijfsimpact en ROI te bewijzen wanneer AI wordt geïmplementeerd in dagelijkse datacenteroperaties. Laten we ons focussen op revolutionaire AI-implementatie, niet alleen op AI-modelcapaciteit.

Dit is hoe we bijdragen aan een toekomst waarin AI iedereen ten goede komt – een overwinning voor winstmarges, mensen en de planeet.

Bedankt voor het geweldige interview, lezers die meer willen leren, moeten NeuReality bezoeken NeuReality.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.