Interviuri
Moshe Tanach, CEO și Co-Fondator la NeuReality – Seria de Interviuri

Moshe Tanach este CEO și co-fondator al NeuReality. Înainte de a fonda NeuReality, Moshe a ocupat funcția de Director de Inginerie la Marvell și Intel (INTC ), unde a condus dezvoltarea de produse complexe de comunicații și rețele pentru producția de masă. De asemenea, a ocupat funcția de AVP de Cercetare și Dezvoltare la DesignArt Networks (ulterior achiziționată de Qualcomm (QCOM )), unde a contribuit la dezvoltarea de produse de stații de bază 4G.
NeuReality are misiunea de a simplifica adoptarea inteligenței artificiale. Prin abordarea sistemului de inteligență artificială la nivel de sistem, echipa de experți din industrie de la NeuReality livrează inferență de inteligență artificială în mod holistic, identificând punctele slabe și oferind soluții de inferență de inteligență artificială create special, de la siliciu la software, care fac inteligența artificială atât accesibilă, cât și ieftină.
Cu experiența dvs. vastă în conducerea proiectelor de inginerie la Marvell, Intel și DesignArt-Networks, ce v-a inspirat să co-fondați NeuReality și cum au influențat rolurile dvs. anterioare viziunea și direcția companiei?
NeuReality a fost creată de la început pentru a rezolva problemele viitoare de cost, complexitate și climă care ar fi fost inevitabile în inferența inteligenței artificiale – care este implementarea modelelor de inteligență artificială antrenate și a software-ului în centre de date de producție. Unde antrenarea inteligenței artificiale este modul în care se creează inteligența artificială; inferența inteligenței artificiale este modul în care este utilizată și interacționează cu miliarde de oameni și dispozitive din întreaga lume.
Suntem o echipă de ingineri de sistem, așa că ne uităm la toate unghiurile, la toate fețele multiple ale inferenței de inteligență artificială de la capăt la capăt, inclusiv GPU și toate clasele de acceleratoare de inteligență artificială specializate. A devenit clar pentru noi, încă din 2015, că procesoarele de inteligență artificială bazate pe CPU și sistemele – care este fiecare GPU, TPU, LPU, NRU, ASIC și FPGA de acolo – ar lovi un zid semnificativ până în 2020. Limitările sistemului în care acceleratorul de inteligență artificială a devenit mai bun și mai rapid în ceea ce privește performanța brută, dar infrastructura de bază nu a ținut pasul.
Ca urmare, am decis să ne desprindem de giganții mari plini de birocrație care protejează afacerile de succes, cum ar fi producătorii de CPU și NIC, și să perturbăm industria cu o arhitectură de inteligență artificială mai bună, care este deschisă, agnostică și specializată pentru inferența de inteligență artificială. Una dintre concluziile reimaginării inferenței de inteligență artificială ideale este că, prin îmbunătățirea utilizării GPU și a eficienței la nivel de sistem, noua noastră infrastructură de calcul și rețea de inteligență artificială – alimentată de noul nostru server-on-chip NR1, care înlocuiește CPU-ul și NIC-urile – putem elimina barierele de piață care descurajează 65% din organizații să inoveze și să adopte inteligența artificială astăzi – GPU subutilizate, ceea ce duce la cumpărarea a mai mult decât ceea ce este cu adevărat necesar (deoarece rulează inactiv > 50% din timp) – reducând în același timp consumul de energie, provocările spațiului de centre de date și costurile operaționale.
Acesta este un moment unic în viață pentru a transforma cu adevărat arhitectura sistemului de inteligență artificială în bine, pe baza a tot ceea ce am învățat și am practicat timp de 30 de ani, deschizând ușile pentru noi inovatori de inteligență artificială din diverse industrii și eliminând blocajele CPU, complexitatea și amprenta de carbon.
Misiunea NeuReality este de a democratiza inteligența artificială. Puteți explica ce înseamnă “Inteligență Artificială pentru Toți” pentru dvs. și cum NeuReality planifică să atingă această viziune?
Misiunea noastră este de a democratiza inteligența artificială, făcând-o mai accesibilă și mai ieftină pentru toate organizațiile, mari și mici – prin deblocarea capacității maxime a oricărui GPU sau accelerator de inteligență artificială, astfel încât să obțineți mai mult de la investiția dvs.; cu alte cuvinte, obțineți MAI MULT din investițiile scumpe în GPU pe care le faceți, mai degrabă decât CUMPĂRAȚI mai multe GPU care rulează inactiv > 50% din timp. Putem îmbunătăți acceleratoarele de inteligență artificială până la 100% din capacitatea lor completă, oferind în același timp până la 15X eficiență energetică și reducând costurile sistemului cu până la 90%. Acestea sunt îmbunătățiri de ordinul de mărime. Planificăm să atingem această viziune cu soluția noastră de inferență de inteligență artificială NR1, prima arhitectură de sistem de centre de date specializată pentru era inteligenței artificiale. Rulează fluxuri de date de inteligență artificială de volum mare, varietate mare, în mod accesibil și eficient, cu beneficiul suplimentar al unei amprente de carbon reduse.
Atingerea inteligenței artificiale pentru toți înseamnă și facilitarea utilizării acesteia. La NeuReality, simplificăm implementarea, gestionarea și escaladarea infrastructurii de inteligență artificială, îmbunătățim procesele și profitabilitatea afacerilor, și promovăm sectoare precum sănătatea publică, siguranța, aplicarea legii și serviciile clienților. Impactul nostru se extinde asupra sectoarelor precum imagistica medicală, studiile clinice, detectarea fraudelor, crearea de conținut de inteligență artificială și multe altele.
În prezent, primele noastre dispozitive comerciale NR1-S de inferență de inteligență artificială sunt disponibile cu acceleratoarele Qualcomm Cloud AI 100 Ultra și prin Cirrascale, un furnizor de servicii cloud.
Soluția de inferență de inteligență artificială NR1 este descrisă ca prima arhitectură de sistem de centre de date specializată pentru era inteligenței artificiale și specializată pentru inferența de inteligență artificială. Care au fost inovațiile și descoperirile cheie care au condus la dezvoltarea NR1?
NR1 este numele întregii noastre arhitecturi de sistem de la siliciu la software pe care am proiectat-o și livrat-o industriei de inteligență artificială – ca o infrastructură de calcul și rețea de inteligență artificială deschisă, pe deplin compatibilă, care completează orice accelerator de inteligență artificială și GPU. Dacă aș fi trebuit să o descompun în cele mai importante și interesante inovații care au condus la această soluție NR1 și ne diferențiază, aș spune:
- Grafuri de calcul de inteligență artificială optimizate: Echipa noastră a proiectat un accelerator de execuție de grafuri programabile pentru a optimiza procesarea grafurilor de calcul, care sunt esențiale pentru inteligența artificială și pentru alte sarcini de lucru, cum ar fi procesarea mediilor, bazele de date și multe altele. Grafurile de calcul reprezintă o serie de operații cu dependențe, iar această aplicabilitate mai largă poziționează NR1 ca potențial disruptiv dincolo de simpla îmbunătățire a GPU-urilor și a altor acceleratoare de inteligență artificială. Simplifică implementarea modelului de inteligență artificială prin generarea de grafuri de calcul optimizate (CG) pe baza datelor de inteligență artificială prelucrate și a interfețelor de programare a aplicațiilor, ceea ce conduce la câștiguri semnificative de performanță.
- NR1 NAPU (Unitate de procesare adresabilă de rețea): Arhitectura noastră de inferență de inteligență artificială este alimentată de NR1 NAPU – un server-on-chip de 7 nm care permite accesul direct la rețea pentru prelucrarea și post-procesarea inteligenței artificiale. Avem 6,5 ori mai multă putere pe un cip NR1 mai mic decât un CPU general-purpose obișnuit. În mod tradițional, sarcinile de pre-procesare (cum ar fi curățarea datelor, formatarea și extragerea caracteristicilor) și sarcinile de post-procesare (cum ar fi interpretarea și formatarea rezultatelor) sunt gestionate de CPU. Prin transferarea acestor sarcini către NR1 NAPU, înlocuim atât CPU-urile, cât și NIC-urile. Acest lucru reduce blocajele, permițând o procesare generală mai rapidă, timpi de răspuns fulminanți și un cost mai mic pe întrebare de inteligență artificială. Acest lucru reduce blocajele și permite o procesare generală mai rapidă.
- NR1 Tehnologia de hipervizor de inteligență artificială: Hipervizorul de inteligență artificială cu patente de la NR1 optimizează orchestrarea sarcinilor de inteligență artificială și utilizarea resurselor, îmbunătățind eficiența și reducând blocajele.
- NR1 Motorul de rețea de inteligență artificială peste țesătură: NR1 incorporează un motor de rețea de inteligență artificială peste țesătură unic, care asigură o conectivitate de rețea fără întrerupere și o escaladare eficientă a resurselor de inteligență artificială pe multiple cipuri NR1 – care sunt cuplate cu orice GPU sau accelerator de inteligență artificială – în cadrul aceluiași server de inferență sau aparat NR1-S de inferență de inteligență artificială.
Datele noastre recente de performanță subliniază economii semnificative de cost și energie. Puteți oferi mai multe detalii despre modul în care NR1 realizează economii de cost și eficiență energetică de până la 90% și 15 ori mai bună, comparativ cu sistemele tradiționale?
NR1 de la NeuReality reduce costul și consumul de energie al inferenței de inteligență artificială cu până la 90% și 15 ori, respectiv. Acest lucru se realizează prin:
- Siliciu specializat: Infrastructura noastră de inferență de inteligență artificială specializată este alimentată de cipul server-on-chip NR1 NAPU, care absoarbe funcționalitatea CPU-ului și a NIC-ului într-unul singur – și elimină nevoia de CPU în inferență. În cele din urmă, NR1 maximizează ieșirea oricărui accelerator de inteligență artificială sau GPU în modul cel mai eficient posibil.
- Arhitectură optimizată: Prin simplificarea fluxului de date de inteligență artificială și prin integrarea pre-procesării și post-procesării de inteligență artificială direct în cipul NR1 NAPU, transferăm și înlocuim CPU-ul. Acest lucru duce la o latență redusă, o escaladare liniară și un cost mai mic pe întrebare de inteligență artificială.
- Implementare flexibilă: Puteți cumpăra NR1 în două moduri principale: 1) în cadrul modulului NR1-M, care este o cartelă PCIe care găzduiește multiple cipuri NR1 NAPU (de obicei 10) proiectate pentru a fi pereche cu cardurile dvs. de accelerare de inteligență artificială existente. 2) în cadrul aparatului NR1-S, care asociază cipuri NR1 NAPU cu un număr egal de acceleratoare de inteligență artificială (GPU, ASIC, FPGA etc.) ca sistem de inferență de inteligență artificială gata de utilizare.
La Supercomputing 2024, în noiembrie, veți vedea demonstrația noastră a unui aparat NR1-S cu 4 cipuri NR1 pe 16 acceleratoare Qualcomm Cloud AI 100 Ultra. Am testat același lucru cu cipuri de inferență de inteligență artificială Nvidia (NVDA ). NeuReality revoluționează inferența de inteligență artificială cu arhitectura sa deschisă și specializată.
Cum se compară aparatul NR1-S de inferență de inteligență artificială, asociat cu acceleratoarele Qualcomm Cloud AI 100, cu serverele de inferență tradiționale bazate pe CPU, cu GPU-uri Nvidia H100 sau L40S, în aplicații reale?
NR1, combinat cu acceleratoarele Qualcomm Cloud AI 100 sau Nvidia H100 sau L40S, oferă o îmbunătățire semnificativă a performanței în aplicații reale de inteligență artificială, cum ar fi modelele de limbaj mare, procesarea imaginilor, procesarea limbajului natural și recunoașterea vorbirii. Cu alte cuvinte, rularea sistemului dvs. de inferență de inteligență artificială cu NR1 optimizează performanța, costul sistemului, eficiența energetică și timpii de răspuns pentru imagini, sunet, limbaj și text – atât separate (mod singular), cât și împreună (multi-mod).
Rezultatul? Când este asociat cu NR1, un client primește MAI MULT de la investițiile scumpe în GPU pe care le face, mai degrabă decât CUMPĂRĂ mai multe GPU pentru a obține performanța dorită.
În afara maximizării utilizării GPU, NR1 oferă o eficiență excepțională, ceea ce duce la o îmbunătățire de 50-90% a raportului preț-performanță și până la 13-15 ori mai multă eficiență energetică. Acest lucru se traduce în economii semnificative de cost și o amprentă de carbon redusă pentru infrastructura dvs. de inteligență artificială.
Aparatul NR1-S demonstrează o escaladare liniară, fără căderi de performanță. Puteți explica aspectele tehnice care permit o astfel de escaladare fără întrerupere?
Aparatul NR1-S, care asociază cipurile noastre NR1 cu acceleratoare de inteligență artificială de orice tip sau cantitate, redefinește infrastructura de inteligență artificială. Am depășit limitările bazate pe CPU pentru a atinge un nivel nou de performanță și eficiență.
În loc de blocajul tradițional NIC-CPU-accelerator, aparatul NR1-S integrează accesul direct la rețea, pre-procesarea și post-procesarea de inteligență artificială în unitățile noastre de procesare adresabile de rețea (NAPU). Cu 10 NAPU pe sistem, fiecare gestionând sarcini precum procesarea viziunii, a sunetului și a semnalelor, și hipervizorul nostru de inteligență artificială care orchestrează sarcinile, fluxul de date de inteligență artificială este simplificat. Acest lucru se traduce în escaladare liniară: adăugați mai multe acceleratoare, obțineți o performanță proporțional mai mare.
Rezultatul? Utilizarea de 100% a acceleratoarelor de inteligență artificială este observată în mod constant. În timp ce costul total și eficiența energetică variază în funcție de cipurile de inteligență artificială specifice utilizate, investiția maximizată în hardware și performanța îmbunătățită sunt livrate în mod constant. Pe măsură ce nevoile de inferență de inteligență artificială se extind, aparatul NR1-S oferă o alternativă convingătoare la arhitecturile tradiționale.
NeuReality își propune să elimine barierele în calea adoptării generalizate a inteligenței artificiale. Care sunt cele mai semnificative provocări cu care se confruntă afacerile atunci când adoptă inteligența artificială, și cum vă ajută tehnologia să depășiți aceste provocări?
Când sunt implementate defectuos, soluțiile și software-ul de inteligență artificială pot deveni problematice. Multe afaceri nu pot adopta inteligența artificială din cauza costului și complexității construirii și escaladării sistemelor de inteligență artificială. Astăzi, soluțiile de inteligență artificială nu sunt optimizate pentru inferență, iar podurile de antrenament au de obicei o eficiență scăzută, iar serverele de inferență au blocaje semnificative. Pentru a aborda această provocare și a face inteligența artificială mai accesibilă, am dezvoltat prima soluție completă de inferență de inteligență artificială – o infrastructură de calcul și rețea alimentată de unitatea noastră de procesare de rețea (NAPU) – care face cel mai bun uz de companionul său de accelerator de inteligență artificială și reduce barierele de piață din cauza costului excesiv și a consumului de energie.
Abordarea noastră la nivel de sistem pentru inferența de inteligență artificială – și nu încercarea de a dezvolta un GPU sau un accelerator de inteligență artificială mai bun, unde există deja multă inovație și concurență – înseamnă că umplem o lacună semnificativă a industriei pentru zeci de inovatori de cipuri și sisteme de inferență de inteligență artificială. Echipa noastră a atacat deficiențele din inferența de inteligență artificială în mod sistemic și holistic, prin determinarea punctelor slabe, a lacunelor arhitecturale și a proiecțiilor sarcinilor de inteligență artificială – pentru a livra prima arhitectură de inferență de inteligență artificială specializată, de la siliciu la software, fără CPU. Și prin dezvoltarea unui set integrat de software cu standarde deschise de la Python și Kubernetes, combinat cu Toolchain, Provisioning și API-uri de inferență de la NeuReality, setul nostru integrat de instrumente software combină toate componentele într-o singură interfață de utilizator de înaltă calitate.
Într-o piață de inteligență artificială competitivă, ce vă diferențiază pe dvs. de alți furnizori de soluții de inferență de inteligență artificială?
Pentru a pune lucrurile simplu, suntem deschiși și agnostici față de acceleratoare. Infrastructura noastră de inferență de inteligență artificială NR1 îmbunătățește orice accelerator de inteligență artificială – GPU, TPU, LPU, ASIC, numiți-l – creând un sistem de capăt la capăt cu adevărat optimizat. Acceleratoarele de inteligență artificială au fost inițial aduse pentru a ajuta CPU-urile să gestioneze cerințele rețelelor neuronale și a învățării automate la scară largă, dar acum acceleratoarele de inteligență artificială au devenit atât de puternice, încât sunt împiedicate de CPU-urile pe care ar trebui să le ajute.
Soluția noastră? NR1. Este o arhitectură de inferență de inteligență artificială complet reimaginată. Arma noastră secretă? Unitatea noastră de procesare de rețea (NAPU) a fost proiectată ca un ingredient companion pentru a maximiza performanța acceleratorului de inteligență artificială fără a consuma energie suplimentară sau a ruina bugetul. Am construit un ecosistem deschis, integrându-ne în mod seamăn cu orice cip de inferență de inteligență artificială și cu cadre de software populare, cum ar fi Kubernetes, Python, TensorFlow și multe altele.
Abordarea noastră deschisă înseamnă că nu concurențăm cu peisajul inteligenței artificiale; suntem aici pentru a-l completa prin parteneriate strategice și colaborări tehnologice. Oferim piesa lipsă a puzzle-ului: o arhitectură de inferență specializată, fără CPU, care nu numai că deblochează acceleratoarele de inteligență artificială pentru a atinge performanța de referință, dar face și mai ușor pentru afaceri și guverne să adopte inteligența artificială. Imaginați-vă deblocarea puterii complete a NVIDIA H100, Google (GOOGL ) TPU sau AMD MI300 – oferindu-le infrastructura pe care o merită.
Arhitectura deschisă și eficientă a NeuReality nivelează terenul de joc, făcând inteligența artificială mai accesibilă și mai ieftină pentru toată lumea. Sunt pasionat să văd diverse industrii – fintech, biotech, healthtech – experimentând avantajul NR1. Comparați soluțiile dvs. de inteligență artificială pe sisteme tradiționale bazate pe CPU cu infrastructura modernă NR1 și observați diferența. Astăzi, doar 35% din afaceri și guverne au adoptat inteligența artificială, și acest lucru se bazează pe criterii de calificare extrem de scăzute. Să facem posibil ca peste 50% din clienții întreprinderilor să adopte inteligența artificială până anul viitor, fără a dăuna planetei sau a ruina bugetul.
Privind înainte, ce este viziunea pe termen lung a NeuReality pentru rolul inteligenței artificiale în societate, și cum vedeți compania dvs. contribuind la acest viitor?
Îmi imaginez un viitor în care inteligența artificială beneficiază tuturor, stimulând inovația și îmbunătățind viețile. Nu construim doar tehnologie; construim fundația pentru un viitor mai bun.
NR1 nostru este cheia acestei viziuni. Este o soluție completă de inferență de inteligență artificială care începe să spargă barierele de cost și complexitate care împiedică adoptarea generalizată a inteligenței artificiale în afaceri. Am reimaginat atât infrastructura, cât și arhitectura, livrând un sistem revoluționar care maximizează ieșirea oricărui GPU, oricărui accelerator de inteligență artificială, fără a crește costurile operaționale sau consumul de energie.
Modelul de afaceri contează realmente pentru a scala și a oferi clienților finali alegeri reale asupra autocratiei concentrate de inteligență artificială, așa cum am scris anterior. Deci, în loc de asta, construim un ecosistem deschis, în care siliciul nostru lucrează împreună cu alt siliciu, nu împotriva lui. De aceea am proiectat NR1 pentru a se integra în mod nativ cu toate acceleratoarele de inteligență artificială și cu modele și software deschise, făcându-l cât mai ușor de instalat, gestionat și escaladat.
Dar nu ne oprim aici. Colaborăm cu parteneri pentru a valida tehnologia noastră în diverse sarcini de inteligență artificială și pentru a livra “infernță ca serviciu” și “LLM ca serviciu” prin furnizori de servicii cloud, hyper-scaleri și direct cu producători de cipuri companion. Vrem să facem inteligența artificială avansată accesibilă și ieftină pentru toată lumea.
Imaginați-vă posibilitățile dacă am putea îmbunătăți performanța inferenței de inteligență artificială, eficiența energetică și accesibilitatea cu procente duble. Imaginați-vă o societate robustă, bazată pe inteligență artificială, cu mai multe voci și alegeri care devin realitate. Deci, trebuie să facem toată munca solicitantă de a demonstra impactul afacerii și ROI atunci când inteligența artificială este implementată în operațiunile zilnice ale centrelor de date. Să ne concentrăm pe implementarea revoluționară de inteligență artificială, nu doar pe capacitatea modelului de inteligență artificială.
Acesta este modul în care contribuim la un viitor în care inteligența artificială beneficiază tuturor – o victorie pentru marjele de profit, oameni și planeta.
Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe despre NeuReality ar trebui să viziteze NeuReality.












