Entretiens

Moshe Tanach, PDG et co-fondateur de NeuReality – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Moshe Tanach est le PDG et co-fondateur de NeuReality. Avant de fonder NeuReality, Moshe a occupé le poste de directeur de l’ingénierie chez Marvell et Intel (INTC ), où il a dirigé le développement de produits sans fil et de réseaux complexes pour une production de masse. Il a également occupé le poste de vice-président de la R&D chez DesignArt Networks (plus tard acquis par Qualcomm (QCOM )), où il a contribué au développement de produits de stations de base 4G.

NeuReality a pour mission de simplifier l’adoption de l’IA. En adoptant une approche système pour l’IA, l’équipe d’experts de l’industrie de NeuReality livre l’inférence IA de manière holistique, en identifiant les points de douleur et en fournissant des solutions d’inférence IA conçues sur mesure, allant du silicium au logiciel, qui rendent l’IA à la fois abordable et accessible.

Avec votre expérience approfondie dans la direction de projets d’ingénierie chez Marvell, Intel et DesignArt-Networks, qu’est-ce qui vous a inspiré pour co-fonder NeuReality, et comment vos rôles précédents ont-ils influencé la vision et la direction de l’entreprise ?

NeuReality a été créé dès le départ pour résoudre les problèmes de coût, de complexité et de climat qui seraient inévitables dans l’inférence IA – qui est le déploiement de modèles et de logiciels IA formés dans des centres de données de production. Lorsque la formation IA est la façon dont l’IA est créée ; l’inférence IA est la façon dont elle est utilisée et interagit avec des milliards de personnes et d’appareils dans le monde.

Nous sommes une équipe d’ingénieurs système, nous regardons donc tous les angles, toutes les facettes multiples de l’inférence IA de bout en bout, y compris les GPU et toutes les classes d’accélérateurs IA conçus sur mesure. Il est devenu clair pour nous, en remontant à 2015, que les puces et les systèmes IA basés sur les CPU – qui sont tous les GPU, TPU, LPU, NRU, ASIC et FPGA – atteindraient un mur important d’ici 2020. Les limitations système où l’accélérateur IA est devenu meilleur et plus rapide en termes de performances brutes, mais l’infrastructure sous-jacente n’a pas suivi.

En conséquence, nous avons décidé de nous éloigner des géants qui sont ralentis par la bureaucratie et qui protègent les entreprises réussies, comme les fabricants de CPU et de NIC, et de perturber l’industrie avec une meilleure architecture IA qui est ouverte, agnostique et conçue sur mesure pour l’inférence IA. L’une des conclusions de la réinvention de l’inférence IA idéale est que, en améliorant l’utilisation des GPU et l’efficacité au niveau du système, notre nouvelle infrastructure de calcul et de réseau IA – alimentée par notre nouveau serveur sur puce NR1 qui remplace le CPU hôte et les NIC. En tant que marque de produit et compagnon de tout GPU ou accélérateur IA, nous pouvons supprimer les barrières du marché qui découragent 65 % des organisations d’innover et d’adopter l’IA aujourd’hui – les GPU sous-utilisés qui conduisent à acheter plus que ce dont ils ont vraiment besoin (car ils sont inactifs > 50 % du temps) – tout en réduisant la consommation d’énergie, les défis de l’espace des centres de données IA et les coûts d’exploitation.

C’est une occasion unique dans une vie de vraiment transformer l’architecture du système IA pour le mieux, en fonction de tout ce que j’ai appris et pratiqué pendant 30 ans, en ouvrant les portes à de nouveaux innovateurs IA à travers les industries et en supprimant les goulots d’étranglement du CPU, la complexité et les empreintes carbone.

La mission de NeuReality est de démocratiser l’IA. Pouvez-vous élaborer sur ce que signifie “IA pour tous” pour vous et comment NeuReality prévoit de réaliser cette vision ?

Notre mission est de démocratiser l’IA en la rendant plus accessible et abordable à toutes les organisations, grandes et petites – en débloquant la capacité maximale de tout GPU ou accélérateur IA ; en d’autres termes, obtenir PLUS de votre investissement ; plutôt que d’acheter plus de GPU qui sont inactifs > 50 % du temps. Nous pouvons améliorer les accélérateurs IA jusqu’à 100 % de leur pleine capacité, tout en offrant jusqu’à 15 fois plus d’efficacité énergétique et en réduisant les coûts du système de jusqu’à 90 %. Ce sont des améliorations de plusieurs ordres de grandeur. Nous prévoyons de réaliser cette vision avec notre solution d’inférence IA NR1, la première architecture de système de centre de données conçue pour l’ère de l’IA. Elle exécute des pipelines de données IA à haute volume et à grande variété de manière abordable et efficace, avec l’avantage supplémentaire d’une empreinte carbone réduite.

Atteindre l’IA pour tous signifie également la rendre facile à utiliser. Chez NeuReality, nous simplifions le déploiement, la gestion et la mise à l’échelle de l’infrastructure IA, améliorons les processus et la rentabilité commerciale, et faisons progresser des secteurs tels que la santé publique, la sécurité, l’application de la loi et le service client. Notre impact s’étend à des secteurs tels que l’imagerie médicale, les essais cliniques, la détection de la fraude, la création de contenu IA et bien d’autres.

Actuellement, nos premiers appareils d’inférence IA NR1-S commercialement disponibles sont disponibles avec les accélérateurs Cloud AI 100 Ultra de Qualcomm et via Cirrascale, un fournisseur de services cloud.

La solution d’inférence IA NR1 est présentée comme la première architecture de système de centre de données conçue pour l’ère de l’IA, et conçue sur mesure pour l’inférence IA. Quelles étaient les principales innovations et percées qui ont conduit au développement de la NR1 ?

NR1 est le nom de l’ensemble de l’architecture de système silicium-logiciel que nous avons conçue et livrée à l’industrie IA – en tant qu’infrastructure de calcul et de réseau IA ouverte, entièrement compatible, qui complète tout accélérateur IA et GPU. Si je devais la décomposer en innovations et percées uniques et passionnantes qui ont conduit à cette solution d’inférence IA NR1 et qui nous distinguent, je dirais :

  • Graphiques de calcul IA optimisés : L’équipe a conçu un accélérateur d’exécution de graphique programmable pour optimiser le traitement des graphiques de calcul, qui sont essentiels pour l’IA et d’autres charges de travail comme le traitement des médias, les bases de données et bien d’autres. Les graphiques de calcul représentent une série d’opérations avec des dépendances, et cette applicabilité plus large positionne la NR1 comme potentiellement perturbatrice au-delà de la simple amélioration des GPU et des autres accélérateurs IA. Cela simplifie le déploiement de modèles IA en générant des graphiques de calcul (CG) optimisés en fonction des données IA prétraitées et des API logicielles, ce qui conduit à des gains de performances importants.
  • NR1 NAPU (Unité de traitement adressable en réseau) : Notre architecture d’inférence IA est alimentée par la NR1 NAPU – une puce serveur de 7 nm qui permet l’accès réseau direct pour le prétraitement et le post-traitement IA. Nous mettons 6,5 fois plus de puissance dans une puce NR1 plus petite qu’un CPU hôte généraliste typique. Traditionnellement, les tâches de prétraitement (comme le nettoyage des données, le formatage et l’extraction de caractéristiques) et les tâches de post-traitement (comme l’interprétation et le formatage des résultats) sont gérées par le CPU. En déchargeant ces tâches sur la NR1 NAPU, nous déplaçons à la fois les CPU et les NIC. Cela réduit les goulots d’étranglement, permettant un traitement plus rapide, des temps de réponse plus rapides et un coût plus bas par requête IA. Cela réduit les goulots d’étranglement et permet un traitement plus rapide.
  • Technologie d’hyperviseur IA NR1 : L’hyperviseur matériel breveté de la NR1 optimise l’orchestration des tâches IA et l’utilisation des ressources, améliorant l’efficacité et réduisant les goulots d’étranglement.
  • Moteur de réseau IA-over-Fabric NR1 : La NR1 intègre un moteur de réseau IA-over-Fabric unique qui garantit une connectivité réseau transparente et une mise à l’échelle efficace des ressources IA sur plusieurs puces NR1 – qui sont couplées avec tout GPU ou accélérateur IA – au sein du même serveur d’inférence ou appareil d’inférence IA NR1-S.

Les données de performance récentes de NeuReality mettent en évidence des économies de coûts et d’énergie importantes. Pouvez-vous fournir plus de détails sur la façon dont la NR1 atteint jusqu’à 90 % d’économies de coûts et 15 fois plus d’efficacité énergétique par rapport aux systèmes traditionnels ?

La NR1 de NeuReality réduit les coûts et la consommation d’énergie de l’inférence IA de jusqu’à 90 % et 15 fois, respectivement. Cela est réalisé grâce à :

  • Silicium spécialisé : Notre infrastructure d’inférence IA conçue sur mesure est alimentée par la puce serveur NR1 NAPU, qui absorbe la fonctionnalité du CPU et de la NIC en une seule – et élimine le besoin de CPU dans l’inférence. Finalement, la NR1 maximise la sortie de tout accélérateur IA ou GPU de la manière la plus efficace possible.
  • Architecture optimisée : En rationalisant le flux de données IA et en intégrant le prétraitement et le post-traitement IA directement dans la NR1 NAPU, nous déchargeons et remplaçons le CPU. Cela se traduit par une latence réduite, une mise à l’échelle linéaire et un coût plus bas par requête IA.
  • Déploiement flexible : Vous pouvez acheter la NR1 de deux manières principales : 1) à l’intérieur du module NR1-M qui est une carte PCIe qui abrite plusieurs NAPU NR1 (généralement 10) conçue pour être associée à vos cartes d’accélérateurs IA existantes. 2) à l’intérieur de l’appareil NR1-S, qui associe les NAPU NR1 à un nombre égal d’accélérateurs IA (GPU, ASIC, FPGA, etc.) en tant que système d’inférence IA prêt à l’emploi.

À Supercomputing 2024 en novembre, vous nous verrez démontrer un appareil NR1-S avec 4x puces NR1 par 16x accélérateurs Cloud AI 100 Ultra de Qualcomm. Nous avons testé la même chose avec les puces d’inférence AI de Nvidia (NVDA ). NeuReality révolutionne l’inférence IA avec son architecture ouverte et conçue sur mesure.

Comment l’appareil d’inférence IA NR1-S, combiné avec les accélérateurs Cloud AI 100 de Qualcomm, se compare-t-il aux serveurs d’inférence traditionnels basés sur les CPU avec les GPU H100 ou L40S de Nvidia dans les applications réelles ?

La NR1, combinée avec les accélérateurs Cloud AI 100 de Qualcomm ou les GPU H100 de Nvidia, offre une amélioration significative des performances par rapport aux serveurs d’inférence traditionnels basés sur les CPU dans les applications réelles d’IA, notamment les grands modèles de langage comme Llama 3, la vision par ordinateur, le traitement du langage naturel et la reconnaissance vocale. En d’autres termes, l’exécution de votre système d’inférence IA avec la NR1 optimise les performances, les coûts du système, l’efficacité énergétique et les temps de réponse sur les images, les sons, les langues et les textes – à la fois séparément (monomodal) et ensemble (multimodal).

Le résultat ? Lorsqu’il est associé à la NR1, un client obtient PLUS de son investissement coûteux dans les GPU, plutôt que d’ACHETER plus de GPU pour atteindre les performances souhaitées.

Au-delà de la maximisation de l’utilisation des GPU, la NR1 offre une efficacité exceptionnelle, ce qui se traduit par 50-90 % de meilleure rentabilité et jusqu’à 13-15 fois plus d’efficacité énergétique. Cela se traduit par des économies de coûts et une empreinte carbone réduite pour votre infrastructure IA.

L’appareil NR1-S démontre une mise à l’échelle linéaire sans perte de performances. Pouvez-vous expliquer les aspects techniques qui permettent une telle mise à l’échelle transparente ?

L’appareil NR1-S, qui associe nos puces NR1 à des accélérateurs IA de tout type ou quantité, redéfinit l’infrastructure IA. Nous sommes allés au-delà des limitations basées sur les CPU pour atteindre un nouveau niveau de performances et d’efficacité.

Au lieu du goulet d’étranglement traditionnel NIC-CPU-accélérateur, l’appareil NR1-S intègre l’accès réseau direct, le prétraitement et le post-traitement IA au sein de nos unités de traitement adressables en réseau (NAPU). Avec généralement 10 NAPU par système, chacun gérant des tâches telles que le traitement de la vision, de l’audio et du DSP, et notre hyperviseur IA orchestrant les charges de travail, un flux de données IA rationalisé est atteint. Cela se traduit par une mise à l’échelle linéaire : ajoutez plus d’accélérateurs, obtenez des performances proportionnellement plus élevées.

Le résultat ? Une utilisation de 100 % des accélérateurs IA est constamment observée. Même si le coût et l’efficacité énergétique globaux varient en fonction des puces IA spécifiques utilisées, l’investissement matériel maximisé et les performances améliorées sont constamment livrés. À mesure que les besoins en inférence IA augmentent, l’appareil NR1-S offre une alternative convaincante aux architectures traditionnelles.

NeuReality vise à éliminer les barrières à l’adoption généralisée de l’IA. Quels sont les défis les plus importants auxquels les entreprises sont confrontées lors de l’adoption de l’IA, et comment votre technologie aide à surmonter ces défis ?

Lorsqu’elle est mal mise en œuvre, le logiciel et les solutions IA peuvent devenir problématiques. De nombreuses entreprises ne peuvent pas adopter l’IA en raison du coût et de la complexité de la construction et de la mise à l’échelle des systèmes IA. Aujourd’hui, les solutions IA ne sont pas optimisées pour l’inférence, les pods de formation ayant généralement une faible efficacité et les serveurs d’inférence ayant des goulets d’étranglement élevés. Pour relever ce défi et rendre l’IA plus accessible, nous avons développé la première solution d’inférence IA complète – une infrastructure de calcul et de réseau alimentée par notre NAPU – qui fait le meilleur usage de son accélérateur IA compagnon et réduit les barrières du marché autour du coût et de la consommation d’énergie excessifs.

Notre approche système pour l’inférence IA – par opposition à l’amélioration d’un meilleur GPU ou accélérateur IA où il y a déjà beaucoup d’innovation et de concurrence – signifie que nous comblons un vide important dans l’industrie pour des dizaines d’innovateurs de puces et de systèmes d’inférence IA. Notre équipe a attaqué les lacunes de l’inférence IA de manière systématique et holistique, en déterminant les points de douleur, les lacunes architecturales et les projections de charges de travail IA – pour livrer la première architecture d’inférence IA conçue sur mesure, allant du silicium au logiciel, sans CPU. Et en développant une pile de logiciels IA complète avec des normes ouvertes à partir de Python et de Kubernetes combinées avec les outils, la provision et les API d’inférence de NeuReality, notre ensemble intégré d’outils logiciels combine tous les composants en une interface utilisateur/uniforme de haute qualité.

Sur un marché IA compétitif, qu’est-ce qui distingue NeuReality des autres fournisseurs de solutions d’inférence IA ?

En résumé, nous sommes ouverts et agnostiques par rapport aux accélérateurs. Notre infrastructure d’inférence IA NR1 supercharge tout accélérateur IA – GPU, TPU, LPU, ASIC, vous nommez – créant un système de bout en bout réellement optimisé. Les accélérateurs IA ont été initialement introduits pour aider les CPU à gérer les exigences des réseaux de neurones et de l’apprentissage automatique à grande échelle, mais maintenant les accélérateurs IA sont devenus si puissants qu’ils sont maintenant freinés par les CPU qu’ils étaient censés aider.

Notre solution ? La NR1. C’est une architecture d’inférence IA complète, réinventée. Notre arme secrète ? La NR1 NAPU a été conçue comme un ingrédient complémentaire pour maximiser les performances de l’accélérateur IA sans consommer de puissance supplémentaire ou casser la banque. Nous avons construit un écosystème ouvert, intégrant sans effort tout accélérateur d’inférence IA et des frameworks logiciels populaires comme Kubernetes, Python, TensorFlow et bien d’autres.

(GOOGL )

NeuReality s’engage à contribuer à un avenir où l’IA profite à tous. Quelle est la vision à long terme de l’entreprise pour le rôle de l’IA dans la société, et comment voyez-vous votre entreprise contribuer à cet avenir ?

Je me vois dans un avenir où l’IA profite à tous, favorisant l’innovation et améliorant les vies. Nous ne construisons pas seulement de la technologie ; nous construisons les fondements d’un avenir meilleur.

Notre NR1 est la clé de cette vision. C’est une solution d’inférence IA complète qui commence à briser les barrières de coût et de complexité qui entravent l’adoption commerciale massive de l’IA. Nous avons réinventé à la fois l’infrastructure et l’architecture, livrant un système révolutionnaire qui maximise la sortie de tout GPU, tout accélérateur IA, sans augmenter les coûts d’exploitation ou la consommation d’énergie.

Le modèle économique est vraiment important pour évoluer et offrir aux clients finals de véritables choix par rapport à l’autocratie IA concentrée, comme je l’ai écrit auparavant. Nous construisons donc un écosystème ouvert où notre silicium fonctionne avec d’autres silicium, et non contre. C’est pourquoi nous avons conçu la NR1 pour s’intégrer sans effort à tous les accélérateurs IA et avec des modèles et des logiciels ouverts, ce qui rend le plus facile possible l’installation, la gestion et la mise à l’échelle.

Mais nous n’arrêtons pas là. Nous collaborons avec des partenaires pour valider notre technologie sur diverses charges de travail IA et livrer des services d’inférence et de LLM via des fournisseurs de services cloud, des hyper-évolués et directement avec des fabricants de puces compagnons. Nous voulons rendre l’IA avancée accessible et abordable à tous.

Imaginez les possibilités si nous pouvions améliorer les performances d’inférence IA, l’efficacité énergétique et l’abordabilité de plusieurs pour cent. Imaginez une société robuste et dotée d’IA, avec plus de voix et de choix devenant une réalité. Nous devons donc tous faire le travail difficile de prouver l’impact commercial et le ROI lorsque l’IA est mise en œuvre d in daily data center operations. Let’s focus on revolutionary AI implementation, not just AI model capability. This is how we contribute to a future where AI benefits everyone – a win for profit margins, people, and the planet. Thank you for the great interview, readers who wish to learn more should visit NeuReality.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.