Interviste
Moshe Tanach, CEO e Co-Fondatore di NeuReality – Serie di Interviste

Moshe Tanach è il CEO e co-fondatore di NeuReality. Prima di fondare NeuReality, Moshe ha ricoperto il ruolo di Direttore dell’Ingegneria presso Marvell e Intel (INTC ), dove ha guidato lo sviluppo di prodotti wireless e di rete complessi per la produzione di massa. Ha anche ricoperto il ruolo di AVP di R&D presso DesignArt Networks (in seguito acquisita da Qualcomm (QCOM )), dove ha contribuito allo sviluppo di prodotti di stazioni di base 4G.
NeuReality ha come missione quella di semplificare l’adozione dell’AI. Adottando un approccio sistemico all’AI, il team di esperti di NeuReality fornisce l’inferenza AI in modo olistico, identificando i punti deboli e fornendo soluzioni di inferenza AI progettate appositamente, che rendono l’AI sia accessibile che economica.
Con la tua vasta esperienza nella guida di progetti di ingegneria presso Marvell, Intel e DesignArt-Networks, cosa ti ha ispirato a co-fondare NeuReality e come i tuoi ruoli precedenti hanno influenzato la visione e la direzione dell’azienda?
NeuReality è stata costruita fin dall’inizio per risolvere i problemi di costo, complessità e clima che sarebbero stati inevitabili nell’inferenza AI – ovvero la distribuzione di modelli di apprendimento automatico e software in produzione in centri di dati AI. Laddove l’addestramento AI è come viene creata l’AI; l’inferenza AI è come viene utilizzata e come interagisce con miliardi di persone e dispositivi in tutto il mondo.
Siamo un team di ingegneri di sistemi, quindi guardiamo tutti gli aspetti, tutti i molteplici aspetti dell’inferenza AI end-to-end, compresi GPU e tutte le classi di acceleratori AI progettati appositamente. È diventato chiaro per noi già nel 2015 che i chip e i sistemi AI che dipendono dalla CPU – ovvero ogni GPU, TPU, LPU, NRU, ASIC e FPGA – avrebbero raggiunto un muro significativo entro il 2020. Le limitazioni del sistema in cui l’acceleratore AI è diventato migliore e più veloce in termini di prestazioni brute, ma l’infrastruttura sottostante non ha tenuto il passo.
Di conseguenza, abbiamo deciso di staccarci dai grandi giganti pieni di burocrazia che proteggono i business di successo, come i produttori di CPU e NIC, e di interrompere l’industria con un’architettura AI migliore che è aperta, agnostica e progettata appositamente per l’inferenza AI. Una delle conclusioni del ripensamento dell’inferenza AI ideale è che, aumentando l’utilizzo della GPU e l’efficienza a livello di sistema, la nostra nuova infrastruttura di calcolo e rete AI – alimentata dal nostro nuovo chip server-on-chip NR1 che sostituisce la CPU host e le NIC – può rimuovere le barriere del mercato che scoraggiano il 65% delle organizzazioni dall’innovare e adottare l’AI oggi – l’utilizzo sottoutilizzato della GPU, che porta all’acquisto di più di quanto sia realmente necessario (poiché rimane inattiva > 50% del tempo) – riducendo al contempo il consumo di energia, la sfida dello spazio dei centri di dati AI e i costi operativi.
Questa è un’opportunità unica nella vita per trasformare veramente l’architettura del sistema AI per il meglio, sulla base di tutto ciò che ho imparato e praticato per 30 anni, aprendo le porte per nuovi innovatori AI in tutti i settori e rimuovendo i collo di bottiglia della CPU, la complessità e le impronte di carbonio.
La missione di NeuReality è quella di democratizzare l’AI. Puoi elaborare su cosa significa “AI per tutti” per te e come NeuReality pianifica di realizzare questa visione?
La nostra missione è quella di democratizzare l’AI, rendendola più accessibile e economica per tutte le organizzazioni, grandi e piccole – liberando la capacità massima di qualsiasi GPU o acceleratore AI, in modo che tu possa ottenere di più dal tuo investimento; in altre parole, ottenere DI PIÙ dai GPU che acquisti, piuttosto che ACQUISTARE più GPU che rimangono inattive > 50% del tempo. Possiamo aumentare gli acceleratori AI fino al 100% della capacità, fornendo fino a 15X di efficienza energetica e riducendo i costi di sistema fino al 90%. Questi sono miglioramenti di ordine di grandezza. Pianifichiamo di realizzare questa visione con la nostra soluzione di inferenza AI NR1, la prima architettura di sistema di centri di dati progettata per l’era AI. Esegue pipeline di dati AI ad alto volume e alta varietà in modo economico ed efficiente, con il beneficio aggiuntivo di un’impronta di carbonio ridotta.
Realizzare l’AI per tutti significa anche renderla facile da usare. In NeuReality, semplifichiamo la distribuzione, la gestione e la scalabilità dell’infrastruttura AI, miglioriamo i processi aziendali e la redditività, e avanziamo settori come la salute pubblica, la sicurezza, l’applicazione della legge e il servizio clienti. Il nostro impatto si estende a settori come l’imaging medico, gli studi clinici, la rilevazione delle frodi, la creazione di contenuti AI e molti altri.
Attualmente, i nostri primi dispositivi di inferenza AI NR1-S commercialmente disponibili sono disponibili con acceleratori Cloud AI 100 Ultra di Qualcomm e tramite Cirrascale, un fornitore di servizi cloud.
La soluzione di inferenza AI NR1 è considerata la prima architettura di sistema di centri di dati progettata per l’era AI e progettata appositamente per l’inferenza AI. Quali sono state le principali innovazioni e i progressi che hanno portato allo sviluppo del NR1?
NR1 è il nome dell’intera architettura di sistema silicon-to-software che abbiamo progettato e consegnato all’industria AI – come un’infrastruttura di calcolo e rete AI aperta e completamente compatibile che complementa qualsiasi acceleratore AI e GPU. Se dovessi elencare le principali innovazioni e le differenze che hanno portato a questa soluzione di inferenza AI NR1, direi:
- Grafici di calcolo ottimizzati: il team ha progettato un acceleratore di esecuzione del grafico programmabile per ottimizzare l’elaborazione dei grafici di calcolo, che sono cruciali per l’AI e altri carichi di lavoro come l’elaborazione dei media, i database e altro. I grafici di calcolo rappresentano una serie di operazioni con dipendenze, e questa più ampia applicabilità posiziona NR1 come potenzialmente rivoluzionario oltre il semplice aumento della velocità degli acceleratori AI e delle GPU. Semplifica la distribuzione del modello AI generando grafici di calcolo ottimizzati (CG) in base ai dati AI pre-elaborati e alle API del software, portando a significativi guadagni di prestazioni.
- NR1 NAPU (Unità di elaborazione indirizzabile di rete): la nostra architettura di inferenza AI è alimentata dal NR1 NAPU – un chip server-on-chip da 7 nm che consente l’accesso diretto alla rete per la pre-elaborazione e la post-elaborazione AI. Abbiamo un impatto 6,5 volte maggiore su un chip NR1 più piccolo rispetto a una CPU host generica. Tradizionalmente, le attività di pre-elaborazione (come la pulizia dei dati, la formattazione e l’estrazione delle caratteristiche) e le attività di post-elaborazione (come l’interpretazione dei risultati e la formattazione) sono gestite dalla CPU. Spostando queste attività nel NR1 NAPU, sostituiamo sia la CPU che la NIC. Ciò riduce i collo di bottiglia, consentendo un’elaborazione più rapida, tempi di risposta più veloci e un minor costo per query AI. Ciò riduce i collo di bottiglia e consente un’elaborazione più rapida.
- Tecnologia AI-Hypervisor di NR1: l’AI-Hypervisor basato su hardware del NR1 ottimizza l’orchestrazione delle attività AI e l’utilizzo delle risorse, migliorando l’efficienza e riducendo i collo di bottiglia.
- NR1 AI-over-Fabric Network Engine: il NR1 incorpora un motore di rete AI-over-Fabric unico che garantisce una connessione di rete senza problemi e una scalabilità efficiente delle risorse AI su più chip NR1 – che sono accoppiati con qualsiasi GPU o acceleratore AI – all’interno dello stesso server di inferenza o dispositivo di inferenza AI NR1-S.
I dati di prestazione recenti di NeuReality evidenziano risparmi significativi sui costi e sull’energia. Potresti fornire ulteriori dettagli su come il NR1 raggiunge risparmi sui costi fino al 90% e un’efficienza energetica 15 volte migliore rispetto ai sistemi tradizionali?
Il NR1 di NeuReality riduce i costi e il consumo di energia dell’inferenza AI fino al 90% e 15 volte, rispettivamente. Ciò si ottiene attraverso:
- Silicio specializzato: la nostra infrastruttura di inferenza AI progettata appositamente è alimentata dal chip server-on-chip NR1 NAPU, che assorbe la funzionalità della CPU e della NIC in uno – ed elimina la necessità di CPU nell’inferenza. In definitiva, il NR1 massimizza l’output di qualsiasi acceleratore AI o GPU nel modo più efficiente possibile.
- Architettura ottimizzata: semplificando il flusso di dati AI e incorporando la pre-elaborazione e la post-elaborazione AI direttamente nel NR1 NAPU, spostiamo e sostituiamo la CPU. Ciò si traduce in una riduzione della latenza, una scalabilità lineare e un minor costo per query AI.
- Distribuzione flessibile: puoi acquistare il NR1 in due modi principali: 1) all’interno del modulo NR1-M che è una scheda PCIe che ospita più NAPU NR1 (di solito 10) progettati per essere accoppiati con le tue schede di accelerazione AI esistenti. 2) all’interno del dispositivo NR1-S, che accoppia i NAPU NR1 con un numero uguale di acceleratori AI (GPU, ASIC, FPGA, ecc.) come sistema di inferenza AI pronto all’uso.
Al Supercomputing 2024, in novembre, vedrai noi dimostrare un dispositivo NR1-S con 4x chip NR1 per 16x acceleratori Cloud AI 100 Ultra di Qualcomm. Abbiamo testato lo stesso con chip di inferenza AI di Nvidia (NVDA ). NeuReality sta rivoluzionando l’inferenza AI con la sua architettura aperta e progettata appositamente.
Il dispositivo di inferenza AI NR1-S, abbinato agli acceleratori Cloud AI 100 di Qualcomm, come si confronta con i server di inferenza tradizionali basati su CPU con GPU Nvidia H100 o L40S in applicazioni reali?
Il NR1, combinato con gli acceleratori Cloud AI 100 di Qualcomm o con le GPU H100 o L40S di Nvidia, fornisce un sostanziale aumento delle prestazioni rispetto ai server di inferenza tradizionali basati su CPU in applicazioni AI reali, come i grandi modelli linguistici come Llama 3, il riconoscimento di immagini, l’elaborazione del linguaggio naturale e il riconoscimento vocale. In altre parole, eseguire il tuo sistema di inferenza AI con il NR1 ottimizza le prestazioni, i costi di sistema, l’efficienza energetica e i tempi di risposta su immagini, suoni, linguaggio e testo – sia separatamente (modalità singola) che insieme (modalità multipla).
Il risultato? Quando abbinato al NR1, un cliente ottiene DI PIÙ dal proprio investimento in GPU costose, piuttosto che ACQUISTARE più GPU per raggiungere le prestazioni desiderate.
Oltre a massimizzare l’utilizzo della GPU, il NR1 fornisce un’efficienza eccezionale, con un rapporto prezzo-prestazione migliore del 50-90% e un’efficienza energetica fino a 13-15 volte maggiore. Ciò si traduce in risparmi significativi sui costi e in un’impronta ambientale ridotta per la tua infrastruttura AI.
Il dispositivo NR1-S dimostra una scalabilità lineare senza cali di prestazioni. Puoi spiegare gli aspetti tecnici che consentono una scalabilità così fluida?
Il dispositivo NR1-S, che accoppia i nostri chip NR1 con acceleratori AI di qualsiasi tipo o quantità, ridefinisce l’infrastruttura AI. Siamo andati oltre i limiti della CPU per raggiungere un nuovo livello di prestazioni ed efficienza.
Invece del collo di bottiglia tradizionale NIC-CPU-acceleratore, il NR1-S integra l’accesso diretto alla rete, la pre-elaborazione e la post-elaborazione AI all’interno delle nostre Unità di elaborazione indirizzabile di rete (NAPU). Con di solito 10 NAPU per sistema, ognuno dei quali gestisce attività come l’elaborazione delle immagini, dell’audio e del DSP, e il nostro AI-Hypervisor che orchestra i carichi di lavoro, il flusso di dati AI viene semplificato. Ciò si traduce in scalabilità lineare: aggiungi più acceleratori, ottieni prestazioni proporzionalmente maggiori.
Il risultato? L’utilizzo del 100% degli acceleratori AI viene costantemente osservato. Mentre i costi e l’efficienza energetica complessivi variano a seconda degli specifici chip AI utilizzati, l’investimento hardware massimizzato e le prestazioni migliorate vengono costantemente fornite. Man mano che le esigenze di inferenza AI crescono, il NR1-S fornisce un’alternativa convincente alle architetture tradizionali.
NeuReality mira a superare le barriere all’adozione generalizzata dell’AI. Quali sono le sfide più significative che le aziende affrontano nell’adozione dell’AI e come la tua tecnologia aiuta a superare questi?
Quando implementata male, il software e le soluzioni AI possono diventare problematiche. Molte aziende non possono adottare l’AI a causa dei costi e della complessità di costruire e scalare sistemi AI. Le soluzioni AI di oggi non sono ottimizzate per l’inferenza, con pod di addestramento che hanno una scarsa efficienza e server di inferenza con alti collo di bottiglia. Per affrontare questa sfida e rendere l’AI più accessibile, abbiamo sviluppato la prima soluzione di inferenza AI completa – un’infrastruttura di calcolo e rete alimentata dal nostro NAPU – che fa il meglio del suo compagno acceleratore AI e riduce le barriere del mercato intorno ai costi eccessivi e al consumo di energia.
Il nostro approccio sistemico all’inferenza AI – anziché cercare di sviluppare una GPU o un acceleratore AI migliore, dove c’è già molta innovazione e concorrenza – significa che stiamo colmando un divario significativo nell’industria per dozzine di innovatori di chip e sistemi di inferenza AI. Il nostro team ha attaccato le carenze nell’inferenza AI in modo sistemico e olistico, determinando i punti deboli, le lacune architettoniche e le previsioni del carico di lavoro AI – per consegnare la prima architettura di inferenza AI progettata appositamente, silicon-to-software e senza CPU. E sviluppando uno stack di software AI di alta qualità con standard aperti da Python e Kubernetes combinati con gli strumenti, la provisione e le API di inferenza di NeuReality, il nostro insieme di strumenti software integrati combina tutti i componenti in un’unica interfaccia utente/un’esperienza utente di alta qualità.
Nel mercato competitivo dell’AI, cosa distingue NeuReality dalle altre soluzioni di inferenza AI?
Per dirlo semplicemente, siamo aperti e agnostici rispetto agli acceleratori. La nostra infrastruttura di inferenza NR1 supercarica qualsiasi acceleratore AI – GPU, TPU, LPU, ASIC, ecc. – creando un sistema end-to-end veramente ottimizzato. Gli acceleratori AI sono stati inizialmente introdotti per aiutare le CPU a gestire le richieste delle reti neurali e dell’apprendimento automatico su larga scala, ma ora gli acceleratori AI sono diventati così potenti che sono ora limitati dalle stesse CPU che dovevano aiutare.
La nostra soluzione? Il NR1. È una soluzione di inferenza AI completa e ripensata. Il nostro segreto? Il NR1 NAPU è stato progettato come un co-ingredient per massimizzare le prestazioni dell’acceleratore AI senza consumare energia extra o rompere la banca. Abbiamo costruito un ecosistema aperto, integrando in modo fluido con qualsiasi chip di inferenza AI e framework software popolari come Kubernetes, Python, TensorFlow e molti altri.
NeuReality si pone come complemento del panorama AI, anziché competere con esso, attraverso partnership strategiche e collaborazioni tecnologiche. Forniamo il pezzo mancante del puzzle: un’architettura di inferenza senza CPU e progettata appositamente che non solo sblocca gli acceleratori AI per le prestazioni di riferimento, ma rende anche più facile per le aziende e i governi adottare l’AI. Immagina di sbloccare il pieno potenziale delle GPU H100 di Nvidia, dei TPUs di Google (GOOGL ) o dei MI300 di AMD – dandogli l’infrastruttura che meritano.
NeuReality, con la sua architettura aperta ed efficiente, livella il campo, rendendo l’AI più accessibile e economica per tutti. Sono appassionato di vedere diversi settori – fintech, biotecnologie, healthtech – sperimentare il vantaggio NR1 per primo. Confronta le tue soluzioni AI sui sistemi tradizionali basati su CPU rispetto all’infrastruttura NR1 moderna e osserva la differenza. Oggi, solo il 35% delle aziende e dei governi ha adottato l’AI e ciò si basa su criteri di idoneità estremamente bassi. Facciamo in modo che oltre il 50% dei clienti aziendali possa adottare l’AI entro l’anno prossimo senza danneggiare il pianeta o rompere la banca.
Guardando avanti, qual è la visione a lungo termine di NeuReality per il ruolo dell’AI nella società e come vedi la tua azienda contribuire a questo futuro?
Immagino un futuro in cui l’AI beneficia tutti, promuovendo l’innovazione e migliorando la vita. Non stiamo solo costruendo tecnologia; stiamo costruendo le fondamenta per un futuro migliore.
Il nostro NR1 è la chiave di quella visione. È una soluzione di inferenza AI completa che inizia a rompere le barriere di costo e complessità che ostacolano l’adozione aziendale di massa dell’AI. Abbiamo ripensato sia l’infrastruttura che l’architettura, consegnando un sistema rivoluzionario che massimizza l’output di qualsiasi GPU, qualsiasi acceleratore AI, senza aumentare i costi operativi o il consumo di energia.
Il modello di business conta veramente per scalare e dare ai clienti finali vere scelte rispetto all’autocrazia AI concentrata, come ho scritto in precedenza. Quindi, invece, stiamo costruendo un ecosistema aperto in cui il nostro silicio lavora con altri silici, non contro di esso. È per questo che abbiamo progettato il NR1 per integrarsi in modo fluido con tutti gli acceleratori AI e con modelli e software aperti, rendendo più facile possibile installare, gestire e scalare.
Ma non ci fermiamo lì. Stiamo collaborando con i partner per convalidare la nostra tecnologia su vari carichi di lavoro AI e consegnare “inferenza come servizio” e “LLM come servizio” attraverso i fornitori di servizi cloud, gli iperscalari e direttamente con i produttori di chip di accompagnamento. Vogliamo rendere l’AI avanzata accessibile e economica per tutti.
Immagina le possibilità se potessimo aumentare le prestazioni dell’inferenza AI, l’efficienza energetica e l’accessibilità del 10%. Immagina una società robusta e abilitata all’AI, con più voci e scelte che diventano realtà. Quindi, dobbiamo tutti fare il lavoro impegnativo di dimostrare l’impatto aziendale e il ROI quando l’AI viene implementata nelle operazioni quotidiane dei centri di dati. Concentriamoci sull’implementazione rivoluzionaria dell’AI, non solo sulla capacità del modello AI.
Questo è il modo in cui contribuiamo a un futuro in cui l’AI beneficia tutti – una vittoria per i margini di profitto, le persone e il pianeta.
Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare NeuReality.












