Interviews

Moshe Tanach, CEO og medstifter af NeuReality – Interviewserie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Moshe Tanach er CEO og medstifter af NeuReality. Før han startede NeuReality, var Moshe direktør for ingeniørarbejde hos Marvell og Intel (INTC ), hvor han ledte udviklingen af komplekse trådløse og netværksprodukter til masseproduktion. Han har også været vicepræsident for R&D hos DesignArt Networks (senere opkøbt af Qualcomm (QCOM )), hvor han bidrog til udviklingen af 4G-basestationsprodukter.

NeuReality‘s mission er at gøre AI-adoption mere enkel. Ved at tage en systemmæssig tilgang til AI, leverer NeuRealitys team af branchefolk AI-inferens holistisk, identificerer smertepunkter og tilbyder formål-byggede, silicium-til-software AI-inferensløsninger, der gør AI både billigere og mere tilgængelig.

Med din omfattende erfaring med at lede ingeniørprojekter hos Marvell, Intel og DesignArt-Networks, hvad inspirerede dig til at co-founder NeuReality, og hvordan har dine tidligere roller påvirket visionen og retningen for virksomheden?

NeuReality blev bygget fra begyndelsen for at løse fremtidens omkostnings-, kompleksitets- og klimaproblemer, der ville være uundgåelige for AI-inferens – hvilket er implementeringen af trænede AI-modeller og software i produktionsniveau AI-datacentre. Hvor AI-træning er, hvordan AI skabes; AI-inferens er, hvordan det bruges og interagerer med milliarder af mennesker og enheder verden over.

Vi er et team af systemingeniører, så vi ser på alle aspekter, alle de multiple facetter af slut-/slut-AI-inferens, herunder GPUs og alle klasser af formål-byggede AI-acceleratorer. Det blev klart for os tilbage i 2015, at CPU-afhængige AI-chips og systemer – hvilket er hver GPU, TPU, LPU, NRU, ASIC og FPGA derude – ville ramme en betydelig væg i 2020. Dets systembegrænsninger, hvor AI-acceleratoreren er blevet bedre og hurtigere i terms of raw ydelse, men den underliggende infrastruktur har ikke holdt trit.

Som følge heraf besluttede vi at bryde ud fra de store kæmper, der er fulde af bureaukrati, der beskytter succesfulde forretninger, som CPU- og NIC-producenter, og forstyrre branchen med en bedre AI-arkitektur, der er åben, agnostisk og formål-bygget til AI-inferens. En af konklusionerne af at genopfinde ideal AI-inferens er, at ved at øge GPU-anvendelsen og systemmæssig effektivitet, vores nye AI-compute- og netværksinfrastruktur – drevet af vores novelle NR1-server-on-chip, der erstatter værten CPU og NICs – kan fjerne markedsbarricader, der afholder 65% af organisationer fra at innovere og antage AI i dag – underudnyttede GPUs, der fører til at købe mere end hvad der virkelig er nødvendigt (fordi de kører i dvale > 50% af tiden) – samtidig med at reducere energiforbrug, AI-datacenter-udfordringer og driftsomkostninger.

Dette er en en gangs lejlighed til virkelig at transformere AI-systemarkitektur til det bedre baseret på alt, hvad jeg har lært og praktiseret i 30 år, åbner dørene for nye AI-innovatorer på tværs af brancher og fjerner CPU-bottlenecks, kompleksitet og kulstofaftryk.

NeuRealitys mission er at demokratisere AI. Kan du forklare, hvad “AI for alle” betyder for dig, og hvordan NeuReality planlægger at opnå denne vision?

Vores mission er at demokratisere AI ved at gøre det mere tilgængeligt og billigere for alle organisationer, store og små – ved at frigøre den maksimale kapacitet af enhver GPU eller AI-accelerator, så du får mere ud af din investering; med andre ord, få MERE fra de dyre GPU-investeringer, du laver, i stedet for at KØBE mere GPU’er for at opnå ønsket ydelse. Vi kan øge AI-acceleratorer op til 100% fuld kapacitet, samtidig med at vi leverer op til 15 gange energibesparelse og reducerer systemomkostninger med op til 90%. Disse er ordre af størrelsesforbedringer. Vi planlægger at opnå denne vision med vores NR1 AI-inferensløsning, verdens første datacenter-systemarkitektur tilpasset AI-alderen. Den kører højvolumen, højvariations AI-data-pipelines billigt og effektivt med den tilføjede fordel af et reduceret kulstofaftryk.

At opnå AI for alle betyder også at gøre det let at bruge. Hos NeuReality simplificerer vi AI-infrastrukturudvikling, -ledelse og -skalering, forbedrer forretningsprocesser og profit, og fremmer sektorer som offentlig sundhed, sikkerhed, lovhåndhævelse og kundeservice. Vores impact omfatter sektorer som medicinsk billedbehandling, kliniske forsøg, svindelforespørgsel, AI-indholdsskabelse og mange flere.

For tiden er vores første kommercielt tilgængelige NR1-S AI-inferens-appliances tilgængelige med Qualcomm Cloud AI 100 Ultra-acceleratorer og gennem Cirrascale, en cloud-serviceudbyder.

NR1 AI-inferensløsningen er rost som den første datacenter-systemarkitektur tilpasset AI-alderen og formål-bygget til AI-inferens. Hvad var de vigtigste innovationer og gennembrud, der ledte til udviklingen af NR1?

NR1™ er navnet på den samlede silicium-til-software-systemarkitektur, vi har designede og leveret til AI-industrien – som en åben, fuldt kompatibel AI-compute- og netværksinfrastruktur, der fuldt ud komplementerer enhver AI-accelerator og GPU. Hvis jeg skulle bryde det ned til de mest unikke og spændende innovationer, der ledte til denne slut-/slut-NR1-løsning og differentierer os, ville jeg sige:

  • Optimerede AI-compute-grafer: Teamet designede en programmerbar grafeksekutionsaccelerator til at optimere behandlingen af compute-grafer, der er afgørende for AI og andre arbejdslaster som mediebehandling, databases og mere. Compute-grafer repræsenterer en række operationer med afhængigheder, og denne bredere anvendelighed positionerer NR1 som potentielt disruptiv ud over blot at super booste GPUs og andre AI-acceleratorer. Det simplificerer AI-modeludviklingen ved at generere optimerede compute-grafer (CG’er) baseret på forudbehandlet AI-data og software-API’er, hvilket fører til betydelige ydelsesforbedringer.
  • NR1 NAPU™ (Network Addressable Processing Unit): Vores AI-inferensarkitektur er drevet af NR1 NAPU™ – en 7nm server-on-chip, der muliggør direkte netværksadgang til AI-for- og efterbehandling. Vi pakker 6,5 gange mere kraft på en mindre NR1-chip end en typisk generel formål CPU. Traditionelt håndteres forbehandlingsopgaver (som datarensning, formatering og funktionsekstraktion) og efterbehandlingsopgaver (som resultattolkning og formatering) af CPU’en. Ved at offloade disse opgaver til NR1 NAPU™, fjerner vi både CPU’erne og NIC. Dette reducerer flaskeshals og giver mulighed for hurtigere samlet behandling, lynhurtige responstider og lavere omkostninger pr. AI-spørgsmål. Dette reducerer flaskeshals og giver mulighed for hurtigere samlet behandling.
  • NR1™ AI-Hypervisor™-teknologi: NR1’s patenterede hardware-baserede AI-Hypervisor™ optimerer AI-opgave-koordinering og ressourceanvendelse, forbedrer effektivitet og reducerer flaskeshals.
  • NR1™ AI-over-Fabric™ Network Engine: NR1 inkorporerer en unik AI-over-Fabric™ netværksmotor, der sikrer problemfri netværksforbindelse og effektiv skalerbarhed af AI-resourcer på tværs af multiple NR1-chips – der er koblet med enhver GPU eller AI-accelerator – inden for samme inferensserver eller NR1-S AI-inferens-applikation.

NeuRealitys seneste præstationsdata fremhæver betydelige omkostnings- og energibesparelser. Kan du give flere detaljer om, hvordan NR1 opnår op til 90% omkostningsbesparelse og 15 gange bedre energibesparelse i forhold til traditionelle systemer?

NeuRealitys NR1 reducerer omkostningerne og energiforbrug ved AI-inferens med op til 90% og 15 gange, respektivt. Dette opnås gennem:

  • Specialiseret silicium: Vores formål-byggede AI-inferensinfrastruktur er drevet af NR1 NAPU™ server-on-chip, der absorberer funktionen af CPU og NIC i ét – og eliminerer behovet for CPU’er i inferens. Ultimate NR1 maksimerer outputtet af enhver AI-accelerator eller GPU på den mest effektive måde.
  • Optimeret arkitektur: Ved at strømlinje AI-dataflow og inkorporere AI-for- og efterbehandling direkte inden for NR1 NAPU™, offloader og erstatter vi CPU’en. Dette resulterer i reduceret latency, lineær skalerbarhed og lavere omkostninger pr. AI-spørgsmål.
  • Fleksibel installation: Du kan købe NR1 på to primære måder: 1) inden for NR1-M™-modulen, der er en PCIe-kort, der huser multiple NR1 NAPU’er (typisk 10) designet til at parre med dine eksisterende AI-accelerator-kort. 2) inden for NR1-S™-applikationen, der parre NR1 NAPU’er med et lige antal AI-acceleratorer (GPU, ASIC, FPGA osv.) som en klar AI-inferenssystem.

Ved Supercomputing 2024 i november vil du se os demonstrere en NR1-S-applikation med 4x NR1-chips pr. 16x Qualcomm Cloud AI 100 Ultra-acceleratorer. Vi har testet det samme med Nvidia (NVDA ) AI-inferens-chips. NeuReality revolutionerer AI-inferens med sin åbne, formål-byggede arkitektur.

 Hvordan matcher NR1-S AI-inferens-applikationen op med Qualcomm® Cloud AI 100-acceleratorer sammenlignet med traditionelle CPU-centrisk inferensservere med Nvidia® H100 eller L40S-GPU’er i virkelige anvendelser?

NR1, kombineret med Qualcomm Cloud AI 100 eller NVIDIA H100 eller L40S-GPU’er, leverer en betydelig ydelsesforbedring over traditionelle CPU-centriske inferensservere i virkelige AI-anvendelser på tværs af store sprogmodeller som Llama 3, computer vision, natur-sprogbehandling og talegenkendelse. Med andre ord, kører din AI-inferenssystem med NR1 optimerer ydelsen, systemomkostninger, energibesparelse og responstider på tværs af billeder, lyd, sprog og tekst – både separat (enkel modalitet) eller sammen (multi-modalitet).

Resultatet? Når parret med NR1, får en kunde MERE fra de dyre GPU-investeringer, de laver, i stedet for at KØBE mere GPU’er for at opnå ønsket ydelse.

Ud over at maksimere GPU-anvendelsen, leverer NR1 enestående effektivitet, hvilket resulterer i 50-90% bedre pris/ydelse og op til 13-15 gange større energibesparelse. Dette oversætter sig til betydelige omkostningsbesparelser og et reduceret miljøaftryk for din AI-infrastruktur.

NR1-S demonstrerer lineær skalerbarhed uden ydelsesfald. Kan du forklare de tekniske aspekter, der giver mulighed for så problemfri skalerbarhed?

NR1-S-applikationen, der parre vores NR1-chips med AI-acceleratorer af enhver type eller antal, gendefinerer AI-infrastruktur. Vi er gået ud over de traditionelle CPU-begrænsninger for at opnå et nyt niveau af ydelse og effektivitet.

I stedet for den traditionelle NIC-til-CPU-til-accelerator-flaskehals, integrerer NR1-S direkte netværksadgang, AI-forbehandling og efterbehandling inden for vores Network Addressable Processing Units (NAPU’er). Med typisk 10 NAPU’er pr. system, hver håndtering opgaver som vision, lyd og DSP-behandling, og vores AI-Hypervisor™, der orkestrerer arbejdslaster, opnås strømlinet AI-dataflow. Dette oversætter sig til lineær skalerbarhed: tilføj mere acceleratorer, få proportionalt mere ydelse.

Resultatet? 100% anvendelse af AI-acceleratorer observeres konsekvent. Mens samlede omkostninger og energibesparelse varierer afhængigt af de specifikke AI-chips, der bruges, leveres maksimeret hardwareinvestering og forbedret ydelse konsekvent. Da AI-inferensbehovene skalerer, giver NR1-S en overbevisende alternativ til traditionelle arkitekturer.

NeuReality har til formål at adresse barriererne for bred AI-adoptions. Hvad er de mest betydelige udfordringer, virksomheder står over for, når de antager AI, og hvordan hjælper jeres teknologi med at overvinde disse?

Når dårligt implementeret, kan AI-software og -løsninger blive besværlige. Mange virksomheder kan ikke antage AI på grund af omkostningerne og kompleksiteten ved at bygge og skale AI-systemer. I dag er AI-løsningerne ikke optimeret til inferens, med træningspods, der typisk har dårlig effektivitet, og inferensservere, der har høje flaskeshals. For at tage på denne udfordring og gøre AI mere tilgængeligt, har vi udviklet den første komplette AI-inferensløsning – en compute- og netværksinfrastruktur drevet af vores NAPU – der gør det bedste ud af dens companion AI-accelerator og reducerer markedsbarricader omkring overmæssig omkostning og energiforbrug.

Vores systemmæssige tilgang til AI-inferens – i modsætning til at udvikle en bedre GPU eller AI-accelerator, hvor der allerede er meget innovation og konkurrence – betyder, at vi fylder en betydelig industribobbel for dusinvis af AI-inferens-chip- og systeminnovatører. Vores team angreb svigtene i AI-inferens systematisk og holistisk, ved at bestemme smertepunkter, arkitekturgapper og AI-arbejdslast-projektioner – for at levere den første formål-byggede, silicium-til-software, CPU-frie AI-inferensarkitektur. Og ved at udvikle en top-til-bund AI-software-stack med åbne standarder fra Python og Kubernetes kombineret med NeuReality-værktøj, provisionering og inferens-API’er, kombinerer vores integrerede sæt af softwareværktøjer alle komponenter i et enkelt højkvalitets UI/UX.

I en konkurrencedygtig AI-marked, hvad adskiller NeuReality fra andre AI-inferensløsningsudbydere?

For at sige det enkelt, er vi åbne og accelerator-agnostiske. Vores NR1-inferensinfrastruktur superchargerer enhver AI-accelerator – GPU, TPU, LPU, ASIC, du navne det – og skaber en sandt optimeret slut-/slut-system. AI-acceleratorer blev oprindeligt indført for at hjælpe CPU’er med at håndtere kravene til neurale netværk og maskinlæring i stor skala, men nu er AI-acceleratorerne blevet så kraftfulde, at de nu er begrænsede af de CPU’er, de var ment til at hjælpe.

Vores løsning? NR1. Det er en komplet, genopfundet AI-inferensarkitektur. Vores hemmelige våben? NR1 NAPU™ blev designede som en co-ingedient til at maksimere AI-accelerator-ydelse uden at slugge ekstra strøm eller bryde banken. Vi har bygget en åben økosystem, der integrerer problemfrit med enhver AI-inferens-chip og populære software-rammer som Kubernetes, Python, TensorFlow og mere.

NeuRealitys åbne tilgang betyder, at vi ikke konkurrerer med AI-landskabet; vi er her for at komplementere det gennem strategiske partnerskaber og teknologisamarbejde. Vi giver den manglende del af puslespillet: en formål-bygget, CPU-fri inferensarkitektur, der ikke kun låser AI-acceleratorer op til benchmark-ydelse, men også gør det lettere for virksomheder og regeringer at antage AI. Forestil dig at frigøre den fulde kraft af NVIDIA H100’er, Google (GOOGL ) TPUs eller AMD MI300’er – og give dem den infrastruktur, de fortjener.

NeuRealitys åbne, effektive arkitektur udjævner spillefeltet, gør AI mere tilgængeligt og billigere for alle. Jeg er passioneret om at se forskellige brancher – fintech, biotech, sundheds-tech – opleve NR1-fordelene førstehånds. Sammenlign dine AI-løsninger på traditionelle CPU-bundne systemer versus den moderne NR1-infrastruktur og vidnes om forskellen. I dag har kun 35% af virksomheder og regeringer antaget AI, og det er baseret på utrolig lavt kvalificerende kriterier. Lad os gøre det muligt for over 50% af virksomhederne at antage AI uden at skade planeten eller bryde banken.

Set fremad, hvad er NeuRealitys langsigtede vision for AI’s rolle i samfundet, og hvordan ser du jeres virksomhed bidrage til denne fremtid?

Jeg forestiller mig en fremtid, hvor AI gavner alle, fremmer innovation og forbedrer liv. Vi bygger ikke kun teknologi; vi bygger grundlaget for en bedre fremtid.

Vores NR1 er nøgle til denne vision. Det er en komplet AI-inferensløsning, der begynder at knuse omkostnings- og kompleksitetsbarriererne, der hindrer masse-AI-forretningsadoption. Vi har genopfundet både infrastrukturen og arkitekturen, leverer en revolutionerende system, der maksimerer outputtet af enhver GPU, enhver AI-accelerator, uden at øge driftsomkostninger eller energiforbrug.

Forretningsmodellen betyder rigtig meget for at skale og give slutkunderne rigtige valgmuligheder over koncentreret AI-autokrati, som jeg har skrevet om før. Så i stedet bygger vi en åben økosystem, hvor vores silicium arbejder sammen med andet silicium, ikke imod det. Det er derfor, vi designede NR1 til at integrere problemfrit med alle AI-acceleratorer og med åbne modeller og software, gør det så let som muligt at installere, styre og skale.

Men vi stopper ikke der. Vi samarbejder med partnere for at validere vores teknologi på tværs af forskellige AI-arbejdslaster og leverer “inference-as-a-service” og “LLM-as-a-service” gennem cloud-serviceudbydere, hyperscalere og direkte med companion-chip-fabrikanter. Vi vil gøre avanceret AI tilgængelig og billig for alle.

Forestil dig mulighederne, hvis vi kunne booste AI-inferens-ydelse, energibesparelse og billigelse med double-digit-procent. Forestil dig et robustt, AI-aktiveret samfund med flere stemmer og valgmuligheder, der bliver en realitet. Så vi må alle gøre det krævende arbejde med at bevise forretningsimpact og ROI, når AI implementeres i daglige datacenter-operationer. Lad os fokusere på revolutionerende AI-implementation, ikke kun AI-modelkapacitet.

Dette er, hvordan vi bidrager til en fremtid, hvor AI gavner alle – en sejr for profitmargin, mennesker og planeten.

Tak for det store interview, læsere, der ønsker at lære mere, skal besøge NeuReality.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.