Intervjuer

Moshe Tanach, CEO og medgrunnlegger i NeuReality – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Moshe Tanach er CEO og medgrunnlegger av NeuReality. Før han grunnla NeuReality, var Moshe direktør for ingeniørarbeid i Marvell og Intel (INTC ), der han ledet utviklingen av komplekse trådløse og nettverksprodukter til masseproduksjon. Han har også vært AVP for FoU i DesignArt Networks (senere overtatt av Qualcomm (QCOM )), der han bidro til utviklingen av 4G-basestasjonsprodukter.

NeuRealitys misjon er å forenkle AI-tilpasning. Ved å ta en systemnivå-tilnærming til AI, leverer NeuRealitys team av bransjeeksperter AI-inferens holistisk, identifiserer smertepunkter og tilbyr formål-bygde, silikon-til-programvare AI-inferensløsninger som gjør AI både rimelig og tilgjengelig.

Med din omfattende erfaring med å lede ingeniørprosjekter i Marvell, Intel og DesignArt-Networks, hva inspirerte deg til å grunnlegge NeuReality, og hvordan påvirkte dine tidligere roller visjonen og retningen til selskapet?

NeuReality ble bygget fra begynnelsen av for å løse fremtidens kostnads-, kompleksitets- og klimaproblemer som ville være uunngåelige AI-inferens – som er utrulling av trente AI-modeller og programvare i produksjonsnivå AI-datacenter. Hvor AI-trening er hvordan AI skapes; AI-inferens er hvordan det brukes og hvordan det samhandler med milliarder av mennesker og enheter over hele verden.

Vi er et team av systemingeniører, så vi ser på alle vinkler, alle de multiple fasettene av sluttpunkt-til-sluttpunkt AI-inferens, inkludert GPUer og alle klasser av formål-bygde AI-akseleratorer. Det ble klart for oss tilbake i 2015 at CPU-avhengige AI-brikker og systemer – som er hver GPU, TPU, LPU, NRU, ASIC og FPGA der ute – ville treffen en betydelig vegg i 2020. Dets systembegrensninger hvor AI-akseleratoren har blitt bedre og raskere i terms of rå ytelse, men den underliggende infrastrukturen holdt ikke pace.

Som resultat bestemte vi oss for å bryte ut fra de store gigantene som er plaget av byråkrati som beskytter suksessfulle forretninger, som CPU- og NIC-produsenter, og å forstyrre bransjen med en bedre AI-arkitektur som er åpen, nøytral og formål-bygget for AI-inferens. En av konklusjonene av å gjenoppfinne ideal AI-inferens er at ved å øke GPU-bruk og systemnivå-effektivitet, vår nye AI-regne- og nettverksinfrastruktur – drevet av vår nye NR1-server-på-chip som erstatter vert-CPU og NICer. Som en ingrediensmerke og ledsager til noen GPU eller AI-akselerator, kan vi fjerne markedshindringer som avskrekker 65% av organisasjonene fra å innføre og bruke AI i dag – underutnyttede GPUer som fører til å kjøpe mer enn hva som virkelig er nødvendig (fordi de kjører idle > 50% av tiden) – samtidig som vi reduserer energiforbruk, AI-datacenter-utfordringer og driftskostnader.

Dette er en en gang i livet mulighet til å virkelig transformere AI-systemarkitektur til det bedre basert på alt jeg har lært og praktisert i 30 år, åpner dørene for nye AI-innovatører over hele industrien og fjerner CPU-flaskehalser, kompleksitet og karbonavtrykk.

NeuRealitys misjon er å demokratisere AI. Kan du forklare hva “AI for alle” betyr for deg og hvordan NeuReality planlegger å oppnå denne visjonen?

Vår misjon er å demokratisere AI ved å gjøre det mer tilgjengelig og rimelig for alle organisasjoner, store og små – ved å slippe ut maksimum kapasiteten til noen GPU eller noen AI-akselerator, så du får mer fra din investering; med andre ord, få MER fra de dyre GPU-investeringene du gjør, i stedet for å KJØPE mer GPUer for å oppnå ønsket ytelse. Vi kan øke AI-akseleratorer opp til 100% full kapasitet, samtidig som vi leverer opp til 15X energi-effektivitet og reduserer systemkostnader med opp til 90%. Dette er orden av størrelsesforbedringer. Vi planlegger å oppnå denne visjonen med vår NR1 AI-inferensløsning, verdens første datacentersystemarkitektur tilpasset AI-alderen. Den kjører høyvolum, høyvariasjons AI-data-rører rimelig og effektivt med den tilleggsfordelingen av et redusert karbonavtrykk.

Å oppnå AI for alle betyr også å gjøre det enkelt å bruke. Hos NeuReality, forenkler vi AI-infrastruktur-utrulling, -drift og -skalerbarhet, forbedrer forretningsprosesser og lønnsomhet, og fremmer sektorer som offentlig helse, sikkerhet, lovverket og kundeservice. Vår innvirkning omfatter sektorer som medisinsk bildebehandling, kliniske forsøk, svindel-avdekning, AI-innholdsskapning og mange flere.

Aktuelt er våre første kommersielt tilgjengelige NR1-S AI-inferens-applikasjoner tilgjengelige med Qualcomm Cloud AI 100 Ultra-akseleratorer og gjennom Cirrascale, en skytjenesteleverandør.

NR1 AI-inferensløsningen er omtalt som den første datacentersystemarkitekturen tilpasset AI-alderen, og formål-bygget for AI-inferens. Hva var de viktigste innovasjonene og gjennombruddene som ledet til utviklingen av NR1?

NR1™ er navnet på hele silikon-til-programvare-systemarkitekturen vi har designet og levert til AI-industrien – som en åpen, fullt kompatibel AI-regne- og nettverksinfrastruktur som fullt komplementerer noen AI-akselerator og GPUer. Hvis jeg måtte bryte det ned til de øverste unike og spennende innovasjonene som ledet til denne sluttpunkt-til-sluttpunkt NR1-løsningen og skiller oss, ville jeg si:

  • Optimaliserte AI-regne-grafer: Teamet designet en programmerbar graf-utførelse-akselerator for å optimalisere behandlingen av regne-grafer, som er avgjørende for AI og andre arbeidsbelastninger som mediebehandling, databaser og mer. Regne-grafer representerer en serie av operasjoner med avhengigheter, og denne bredere anvendeligheten stiller NR1 som potensielt disruptiv utover å kun super-booste GPUer og andre AI-akseleratorer. Det forenkler AI-modell-utrulling ved å generere optimaliserte regne-grafer (CG-er) basert på forbehandlet AI-data og programvare-API-er, noe som fører til betydelige ytelsesforbedringer.
  • NR1 NAPU™ (Network Addressable Processing Unit): Vår AI-inferens-arkitektur er drevet av NR1 NAPU™ – en 7nm server-på-chip som muliggjør direkte nettverks-tilgang for AI-for- og etterbehandling. Vi pakker 6,5 ganger mer kraft på en mindre NR1-chip enn en typisk generell formål-CPU. Tradisjonelt håndteres forbehandlingsoppgaver (som data-rengjøring, formatering og funksjons-uttrekk) og etterbehandlingsoppgaver (som resultattolkning og formatering) av CPU-en. Ved å overføre disse oppgavene til NR1 NAPU™, fjerner vi både CPU-ene og NIC-ene. Dette reduserer flaskenakker og tillater raskere overordnet behandling, lyn-rask respons-tid og lavere kostnad per AI-spørring. Dette reduserer flaskenakker og tillater raskere overordnet behandling.
  • NR1™ AI-Hypervisor™-teknologi: NR1s patenterede hårdvar-baserte AI-Hypervisor™ optimaliserer AI-oppdrag-orkesering og ressurs-utnyttelse, forbedrer effektivitet og reduserer flaskenakker.
  • NR1™ AI-over-Fabric™-nettverks-motor: NR1 inkorporerer en unik AI-over-Fabric™-nettverks-motor som sikrer sømløs nettverks-tilkobling og effektiv skalerbarhet av AI-ressurser over flere NR1-chip – som er koblet med noen GPU eller AI-akselerator – innen samme inferens-server eller NR1-S AI-inferens-applikasjon.

NeuRealitys nylige ytelsesdata fremhever betydelige kostnads- og energibesparelser. Kan du gi mer detaljer om hvordan NR1 oppnår opp til 90% kostnadsbesparelse og 15x bedre energi-effektivitet sammenlignet med tradisjonelle systemer?

NeuRealitys NR1 reducerer kostnaden og energiforbruket til AI-inferens med opp til 90% og 15x, henholdsvis. Dette oppnås gjennom:

  • Spesialisert silikon: Vår formål-bygde AI-inferens-infrastruktur er drevet av NR1 NAPU™-server-på-chip, som absorberer funksjonaliteten til CPU-en og NIC-en i én – og eliminerer behovet for CPU-er i inferens. Til slutt maksimerer NR1 utgangen av noen AI-akselerator eller GPU på mest effektiv måte mulig.
  • Optimalisert arkitektur: Ved å strømlinje AI-data-flyt og inkorporere AI-for- og etterbehandling direkte innen NR1 NAPU™, overfører og erstatter vi CPU-en. Dette resulterer i redusert latency, lineær skalerbarhet og lavere kostnad per AI-spørring.
  • Fleksibel utrulling: Du kan kjøpe NR1 på to primære måter: 1) innen NR1-M™-modulen som er en PCIe-kort som huset flere NR1 NAPU-er (typisk 10) designet til å pare med dine eksisterende AI-akselerator-kort. 2) innen NR1-S™-applikasjonen, som parer NR1 NAPU-er med et likt antall AI-akseleratorer (GPU, ASIC, FPGA osv.) som en ferdig AI-inferens-system.

På Supercomputing 2024 i november, vil du se oss demonstrere en NR1-S-applikasjon med 4x NR1-chip per 16x Qualcomm Cloud AI 100 Ultra-akseleratorer. Vi har testet det samme med Nvidia (NVDA ) AI-inferens-chip. NeuReality revolusjonerer AI-inferens med sin åpne, formål-bygde arkitektur.

 Hvordan sammenligner NR1-S AI-inferens-applikasjonen med Qualcomm® Cloud AI 100-akseleratorer sammenlignet med tradisjonelle CPU-sentriske inferens-servere med Nvidia® H100 eller L40S-GPUer i virkelige applikasjoner?

NR1, kombinert med Qualcomm Cloud AI 100 eller NVIDIA H100 eller L40S-GPUer, leverer en betydelig ytelsesforbedring over tradisjonelle CPU-sentriske inferens-servere i virkelige AI-applikasjoner over store språkmodeller som Llama 3, datavisualisering, naturlig språkbehandling og tale-gjenkjenning. Med andre ord, å kjøre din AI-inferens-system med NR1 optimaliserer ytelsen, systemkostnaden, energi-effektiviteten og responstidene over bilder, lyd, språk og tekst – både separat (enkel modalitet) eller sammen (fler-modalitet).

Resultatet? Når du parer NR1 med en kunde, får du MER fra de dyre GPU-investeringene du gjør, i stedet for å KJØPE mer GPUer for å oppnå ønsket ytelse.

Utenom å maksimere GPU-utnyttelse, leverer NR1 enestående effektivitet, noe som resulterer i 50-90% bedre pris/yttelse og opp til 13-15x større energi-effektivitet. Dette oversettes til betydelige kostnadsbesparelser og et redusert miljøavtrykk for din AI-infrastruktur.

NR1-S demonstrerer lineær skalerbarhet uten noen ytelses-fall. Kan du forklare de tekniske aspektene som tillater en så sømløs skalerbarhet?

NR1-S-applikasjonen, som parer våre NR1-chip med AI-akseleratorer av noen type eller mengde, definerer på nytt AI-infrastruktur. Vi har flyttet oss bort fra CPU-sentriske begrensninger til å oppnå et nytt nivå av ytelse og effektivitet.

I stedet for den tradisjonelle NIC-til-CPU-til-akselerator-flaskenakk, integrerer NR1-S direkte nettverks-tilgang, AI-forbehandling og etterbehandling innen våre nettverks-tilgjengelige prosesserings-enheter (NAPU-er). Med typisk 10 NAPU-er per system, hver håndtering oppgaver som visjon, audio og DSP-behandling, og vår AI-Hypervisor™ orkestrerer arbeidsbelastninger, oppnås strømlinjet AI-data-flyt. Dette oversettes til lineær skalerbarhet: legg til mer akseleratorer, få proporsjonalt mer ytelse.

Resultatet? 100% utnyttelse av AI-akseleratorer observeres konsekvent. Mens total kostnad og energi-effektivitet varierer avhengig av de spesifikke AI-chipene som brukes, maksimeres hardvaruinvesteringen og forbedres ytelse konsekvent. Når AI-inferens-behov skalerer, tilbyr NR1-S en overbevisende alternativ til tradisjonelle arkitekturer.

NeuReality har som mål å adresse barrierene for vidt omfattende AI-tilpasning. Hva er de mest betydelige utfordringene bedriftene møter når de tar i bruk AI, og hvordan hjelper din teknologi å overvinne disse?

Når dårlig implementert, kan AI-programvare og løsninger bli problematisk. Mange bedrifter kan ikke ta i bruk AI på grunn av kostnaden og kompleksiteten ved å bygge og skale AI-systemer. I dag er AI-løsningene ikke optimalisert for inferens, med trenings-podene som typisk har dårlig effektivitet og inferens-servere som har høye flaskenakker. For å møte denne utfordringen og gjøre AI mer tilgjengelig, har vi utviklet den første komplette AI-inferens-løsningen – en regne- og nettverks-infrastruktur drevet av vår NAPU – som gjør mest mulig ut av sin ledsager-AI-akselerator og reduserer markedshindringer rundt overflødig kostnad og energiforbruk.

Vår systemnivå-tilnærming til AI-inferens – i stedet for å prøve å utvikle en bedre GPU eller AI-akselerator der det allerede er mye innovasjon og konkurranse – betyr at vi fyller en betydelig industri-lucke for dusinvis av AI-inferens-chip- og system-innovatører. Vårt team angrep svakhetene i AI-inferens systematisk og holistisk, ved å bestemme smertepunkter, arkitektur-gapper og AI-arbeidsbelastnings-projeksjoner – for å levere den første formål-bygde, silikon-til-programvare, CPU-frie AI-inferens-arkitektur. Og ved å utvikle en topp-til-bunn AI-programvare-stakk med åpne standarder fra Python og Kubernetes kombinert med NeuReality-verktøy, tilretteleggelse og inferens-API-er, kombinerer vår integrerte sett av programvare-verktøy alle komponenter til en enkelt høykvalitets-brukergrensesnitt.

I en konkurranse-utsatt AI-marked, hva skiller NeuReality fra andre AI-inferens-løsning-leverandører?

For å si det enkelt, er vi åpen og akselerator-agnostisk. Vår NR1-inferens-infrastruktur super-chargerer noen AI-akselerator – GPU, TPU, LPU, ASIC, du navner det – og skaper en virkelig optimalisert sluttpunkt-til-sluttpunkt-system. AI-akseleratorer ble først innført for å hjelpe CPU-er med å håndtere kravene til neurale nettverk og maskinlæring i stor skala, men nå er AI-akseleratorene blitt så kraftfulle at de nå er hindret av de samme CPU-ene de var ment å assistere.

Vår løsning? NR1. Det er en fullstendig, gjenoppfunnet AI-inferens-arkitektur. Vår hemmelige våpen? NR1 NAPU™ ble designet som en ko-ingredient for å maksimere AI-akselerator-ytelse uten å sluke ekstra kraft eller bryte banken. Vi har bygget en åpen økosystem, som sømløst integrerer med noen AI-inferens-chip og populære programvare-rammeverk som Kubernetes, Python, TensorFlow og mer.

NeuRealitys åpne tilnærming betyr at vi ikke konkurranse med AI-landskapet; vi er her for å komplementere det gjennom strategiske partnerskap og teknologi-samarbeid. Vi tilbyr den manglende delen av puslespillet: en formål-bygde, CPU-fri inferens-arkitektur som ikke bare låser opp AI-akseleratorer til benchmark-ytelse, men også gjør det enklere for bedrifter og myndigheter å ta i bruk AI. Forestill deg å slippe ut full kraften til NVIDIA H100-er, Google (GOOGL ) TPUs eller AMD MI300-er – gi dem infrastrukturen de fortjener.

NeuRealitys åpne, effektive arkitektur utjevner spillere, gjør AI mer tilgjengelig og rimelig for alle. Jeg er lidenskapelig opptatt av å se ulike industrier – finansteknologi, bioteknologi, helse-teknologi – oppleve NR1-fordelen førstehånd. Sammenlign dine AI-løsninger på tradisjonelle CPU-bundne systemer versus den moderne NR1-infrastrukturen og vitne om forskjellen. I dag har bare 35% av bedriftene og myndighetene tatt i bruk AI, og det er basert på usedvanlig lav kvalifiseringskriterier. La oss gjøre det mulig for over 50% av bedriftskundene å ta i bruk AI innen neste år uten å skade planeten eller bryte banken.

Ser fremover, hva er NeuRealitys langsiktige visjon for AI-rollen i samfunnet, og hvordan ser du at ditt selskap bidrar til denne fremtiden?

Jeg forestiller meg en fremtid hvor AI fordeler alle, fremmer innovasjon og forbedrer liv. Vi bygger ikke bare teknologi; vi bygger grunnlaget for en bedre fremtid.

Vår NR1 er nøkkel til denne visjonen. Det er en fullstendig AI-inferens-løsning som begynner å knuse kostnads- og kompleksitets-barrierer som hindrer masse-AI-forretnings-tilpasning. Vi har gjenoppfunnet både infrastrukturen og arkitekturen, og levert en revolusjonerende system som maksimerer utgangen av noen GPU eller noen AI-akselerator, uten å øke driftskostnader eller energiforbruk.

Forretningsmodellen betyr virkelig noe for å skalerer og gi slutt-kundene virkelige valg over konsentrert AI-autokrati som jeg har skrevet om tidligere. Så i stedet bygger vi en åpen økosystem hvor vårt silikon fungerer sammen med andre silikon, ikke mot det. Det er derfor vi designet NR1 til å integrere sømløst med alle AI-akseleratorer og med åpne modeller og programvare, og gjør det så enkelt som mulig å installere, håndtere og skalerer.

Men vi stopper ikke der. Vi samarbeider med partnere for å validere vår teknologi over ulike AI-arbeidsbelastninger og levere “inferens-som-en-tjeneste” og “LLM-som-en-tjeneste” gjennom skytjenesteleverandører, hyper-skalerte og direkte med ledsager-chip-produsenter. Vi ønsker å gjøre avansert AI tilgjengelig og rimelig for alle.

Forestall deg mulighetene hvis vi kunne booste AI-inferens-ytelse, energi-effektivitet og rimelighet med to-sifrede prosent. Forestall deg et robust, AI-aktivert samfunn med flere stemmer og valg som blir en realitet. Så vi må alle gjøre det krevende arbeidet med å bevise forretnings-påvirkning og ROI når AI implementeres i daglige data-senter-operasjoner. La oss fokusere på revolusjonerende AI-implementering, ikke bare AI-modell-kapasitet.

Dette er hvordan vi bidrar til en fremtid hvor AI fordeler alle – en seier for lønnsomhets-marginaler, mennesker og planeten.

Takk for det flotte intervjuet, lesere som ønsker å lære mer, bør besøke NeuReality.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.