Entrevistas
Moshe Tanach, CEO y Co-Fundador de NeuReality – Serie de Entrevistas

Moshe Tanach es el CEO y co-fundador de NeuReality. Antes de fundar NeuReality, Moshe se desempeñó como Director de Ingeniería en Marvell e Intel (INTC ), donde lideró el desarrollo de productos inalámbricos y de red complejos para su producción en masa. También se desempeñó como Vicepresidente de I+D en DesignArt Networks (más tarde adquirida por Qualcomm (QCOM )), donde contribuyó al desarrollo de productos de estaciones base de 4G.
NeuReality tiene como misión simplificar la adopción de la IA. Al adoptar un enfoque de sistema para la IA, el equipo de expertos de la industria de NeuReality entrega la inferencia de IA de manera holística, identificando puntos críticos y brindando soluciones de inferencia de IA personalizadas y de silicio a software que hacen que la IA sea asequible y accesible.
Con su amplia experiencia en la dirección de proyectos de ingeniería en Marvell, Intel y DesignArt-Networks, ¿qué lo inspiró a co-fundar NeuReality, y cómo influyeron sus roles anteriores en la visión y dirección de la empresa?
NeuReality se creó desde su inicio para resolver los problemas de costo, complejidad y clima que serían inevitables en la inferencia de IA – que es la implementación de modelos de IA entrenados y software en centros de datos de producción. Donde la capacitación de IA es cómo se crea la IA; la inferencia de IA es cómo se utiliza y cómo interactúa con miles de millones de personas y dispositivos en todo el mundo.
Somos un equipo de ingenieros de sistemas, por lo que consideramos todos los ángulos, todas las facetas múltiples de la inferencia de IA de extremo a extremo, incluidas las GPU y todas las clases de aceleradores de IA personalizados. Se hizo evidente para nosotros desde 2015 que los chips y sistemas de IA que dependen de la CPU – que es cada GPU, TPU, LPU, NRU, ASIC y FPGA que hay allí – chocarían con un muro importante en 2020. Sus limitaciones de sistema donde el acelerador de IA se ha vuelto mejor y más rápido en términos de rendimiento bruto, pero la infraestructura subyacente no siguió el ritmo.
Como resultado, decidimos romper con los gigantes que están plagados de burocracia que protegen los negocios exitosos, como los fabricantes de CPU y NIC, y perturbar la industria con una mejor arquitectura de IA que sea abierta, agnóstica y personalizada para la inferencia de IA. Una de las conclusiones de reimaginar la inferencia de IA ideal es que al aumentar la utilización de la GPU y la eficiencia a nivel de sistema, nuestra nueva infraestructura de cómputo y red de IA – impulsada por nuestro servidor de chip novel NR1 que reemplaza la CPU y las NIC – puede eliminar las barreras del mercado que disuaden a 65% de las organizaciones de innovar y adoptar la IA hoy – las GPU subutilizadas que llevan a comprar más de lo que realmente se necesita (porque se ejecutan en estado de inactividad > 50% del tiempo) – al mismo tiempo que reduce el consumo de energía, el desafío de la superficie de los centros de datos de IA y los costos operativos.
Esta es una oportunidad única en la vida para transformar realmente la arquitectura del sistema de IA para mejor, basada en todo lo que he aprendido y practicado durante 30 años, abriendo las puertas para nuevos innovadores de IA en diversas industrias y eliminando los cuellos de botella de la CPU, la complejidad y las huellas de carbono.
La misión de NeuReality es democratizar la IA. ¿Puede explicar qué significa “IA para todos” para usted y cómo planea NeuReality lograr esta visión?
Nuestra misión es democratizar la IA haciendo que sea más accesible y asequible para todas las organizaciones, grandes y pequeñas – al liberar la capacidad máxima de cualquier GPU o acelerador de IA – para que obtenga más de su inversión; en otras palabras, obtenga MÁS de las GPU que compra, en lugar de COMPRAR más GPU que se ejecutan en estado de inactividad > 50% del tiempo. Podemos aumentar los aceleradores de IA hasta 100% de capacidad completa, mientras que entregamos hasta 15X de eficiencia energética y reducimos los costos del sistema hasta 90%. Estos son mejoras de orden de magnitud. Planeamos lograr esta visión con nuestra solución de inferencia de IA NR1, la primera arquitectura de sistema de centro de datos diseñada para la era de la IA. Ejecuta tuberías de datos de IA de alto volumen, variedad y costo, y eficiencia con el beneficio adicional de una huella de carbono reducida.
Lograr la IA para todos también significa hacer que sea fácil de usar. En NeuReality, simplificamos la implementación, administración y escalabilidad de la infraestructura de IA, mejoramos los procesos comerciales y la rentabilidad, y avanzamos en sectores como la salud pública, la seguridad, la aplicación de la ley y el servicio al cliente. Nuestro impacto abarca sectores como la imagen médica, los ensayos clínicos, la detección de fraude, la creación de contenido de IA y muchos más.
Actualmente, nuestros primeros electrodomésticos de inferencia de IA NR1-S están disponibles con aceleradores de IA Cloud AI 100 Ultra de Qualcomm y a través de Cirrascale, un proveedor de servicios en la nube.
La solución de inferencia de IA NR1 se considera la primera arquitectura de sistema de centro de datos diseñada para la era de la IA y personalizada para la inferencia de IA. ¿Cuáles fueron las innovaciones y avances clave que llevaron al desarrollo de la NR1?
NR1 es el nombre de la arquitectura de sistema de silicio a software que hemos diseñado y entregado a la industria de la IA – como una infraestructura de cómputo y red de IA abierta y completamente compatible que complementa completamente cualquier acelerador de IA y GPU. Si tuviera que desglosar las innovaciones más únicas y emocionantes que llevaron a esta solución de extremo a extremo de NR1 y nos diferencian, diría:
- Gráficos de cómputo de IA optimizados: El equipo diseñó un acelerador de ejecución de gráficos programable para optimizar el procesamiento de gráficos de cómputo, que son cruciales para la IA y otros trabajos como el procesamiento de medios, bases de datos y más. Los gráficos de cómputo representan una serie de operaciones con dependencias, y esta aplicabilidad más amplia posiciona a la NR1 como potencialmente disruptiva más allá de simplemente aumentar los aceleradores de IA y GPU. Simplifica la implementación de modelos de IA al generar gráficos de cómputo optimizados (CG) en función de datos de IA preprocesados y API de software, lo que lleva a ganancias de rendimiento significativas.
- NR1 NAPU (Unidad de procesamiento direccional de red): Nuestra arquitectura de inferencia de IA está impulsada por la NR1 NAPU – un servidor de chip de 7 nm que permite el acceso directo a la red para el preprocesamiento y posprocesamiento de IA. Empaquetamos 6,5 veces más potencia en un chip de NR1 más pequeño que una CPU de propósito general y host típica. Tradicionalmente, las tareas de preprocesamiento (como la limpieza de datos, el formato y la extracción de características) y las tareas de posprocesamiento (como la interpretación y formato de resultados) se manejan con la CPU. Al descargar estas tareas a la NR1 NAPU, desplazamos tanto la CPU como la NIC. Esto reduce los cuellos de botella y permite tiempos de procesamiento más rápidos y menores costos por consulta de IA. Esto reduce los cuellos de botella y permite tiempos de procesamiento más rápidos.
- Tecnología de hipervisor de IA de NR1: El hipervisor de IA basado en hardware de la NR1 optimiza la orquestación de tareas de IA y la utilización de recursos, mejorando la eficiencia y reduciendo los cuellos de botella.
- Motor de red de IA sobre tejido de NR1: La NR1 incorpora un motor de red único de IA sobre tejido que garantiza la conectividad de red sin problemas y la escalabilidad eficiente de los recursos de IA en varios chips de NR1 – que se acoplan con cualquier GPU o acelerador de IA – dentro del mismo servidor de inferencia o electrodoméstico de inferencia de IA de NR1-S.
Los datos de rendimiento recientes de NeuReality destacan ahorros de costo y energía significativos. ¿Puede proporcionar más detalles sobre cómo la NR1 logra ahorros de costo de hasta 90% y 15 veces mejor eficiencia energética en comparación con los sistemas tradicionales?
La NR1 de NeuReality reduce el costo y el consumo de energía de la inferencia de IA hasta 90% y 15 veces, respectivamente. Esto se logra a través de:
- Silicio especializado: Nuestra infraestructura de inferencia de IA personalizada está impulsada por la NR1 NAPU, que absorbe la funcionalidad de la CPU y la NIC en una – y elimina la necesidad de CPU en la inferencia. En última instancia, la NR1 maximiza la salida de cualquier acelerador de IA o GPU de la manera más eficiente posible.
- Arquitectura optimizada: Al simplificar el flujo de datos de IA y incorporar el preprocesamiento y posprocesamiento de IA directamente dentro de la NR1 NAPU, descargamos y reemplazamos la CPU. Esto da como resultado una latencia reducida, una escalabilidad lineal y un menor costo por consulta de IA.
- Despliegue flexible: Puede comprar la NR1 de dos maneras principales: 1) dentro del módulo de NR1-M que es una tarjeta de PCIe que alberga múltiples NAPU de NR1 (generalmente 10) diseñadas para emparejarse con sus tarjetas de aceleradores de IA existentes. 2) dentro del electrodoméstico de NR1-S, que empareja las NAPU de NR1 con un número igual de aceleradores de IA (GPU, ASIC, FPGA, etc.) como un sistema de inferencia de IA listo para usar.
En Supercomputing 2024 en noviembre, verán que demostramos un electrodoméstico de NR1-S con 4x chips de NR1 por 16x aceleradores de IA Cloud AI 100 Ultra de Qualcomm. Hemos probado lo mismo con chips de inferencia de IA de Nvidia (NVDA ). NeuReality está revolucionando la inferencia de IA con su arquitectura abierta y personalizada.
¿Cómo se compara el electrodoméstico de inferencia de IA de NR1-S con los aceleradores de IA Cloud AI 100 de Qualcomm en comparación con los servidores de inferencia tradicionales con GPU de Nvidia H100 o L40S en aplicaciones del mundo real?
La NR1, combinada con los aceleradores de IA Cloud AI 100 de Qualcomm o las GPU de Nvidia H100 o L40S, entrega un impulso de rendimiento sustancial sobre los servidores de inferencia tradicionales en aplicaciones de IA del mundo real en modelos de lenguaje grande como Llama 3, visión por computadora, procesamiento de lenguaje natural y reconocimiento de voz. En otras palabras, al ejecutar su sistema de inferencia de IA con la NR1, se optimiza el rendimiento, el costo del sistema, la eficiencia energética y los tiempos de respuesta en imágenes, sonido, lenguaje y texto – tanto por separado (modalidad única) como juntos (multimodalidad).
¿Cuál es el resultado? Cuando se empareja con la NR1, un cliente obtiene MÁS de sus inversiones costosas en GPU, en lugar de COMPRAR más GPU para lograr el rendimiento deseado.
Más allá de maximizar la utilización de la GPU, la NR1 entrega una eficiencia excepcional, lo que da como resultado una mejor relación precio-rendimiento de 50-90% y una eficiencia energética de hasta 13-15 veces mayor. Esto se traduce en ahorros de costo significativos y una huella de carbono reducida para su infraestructura de IA.
El electrodoméstico de NR1-S demuestra una escalabilidad lineal sin caídas de rendimiento. ¿Puede explicar los aspectos técnicos que permiten una escalabilidad tan fluida?
El electrodoméstico de NR1-S, que empareja nuestros chips de NR1 con aceleradores de IA de cualquier tipo o cantidad, redefine la infraestructura de IA. Hemos superado las limitaciones de los sistemas centrados en la CPU para lograr un nuevo nivel de rendimiento y eficiencia.
En lugar del cuello de botella tradicional de NIC a CPU a acelerador, el electrodoméstico de NR1-S integra el acceso directo a la red, el preprocesamiento de IA y el posprocesamiento dentro de nuestras Unidades de procesamiento direccional de red (NAPU). Con 10 NAPU por sistema, cada uno manejando tareas como el procesamiento de visión, audio y DSP, y nuestro hipervisor de IA orquestando las cargas de trabajo, se logra un flujo de datos de IA simplificado. Esto se traduce en escalabilidad lineal: agregue más aceleradores, obtenga un rendimiento proporcionalmente mayor.
¿Cuál es el resultado? Se observa consistentemente una utilización del 100% de los aceleradores de IA. Mientras que la eficiencia general y el costo varían según los chips de IA específicos utilizados, la inversión de hardware maximizada y el rendimiento mejorado se entregan consistentemente. A medida que las necesidades de inferencia de IA crecen, el electrodoméstico de NR1-S proporciona una alternativa convincente a las arquitecturas tradicionales.
NeuReality tiene como objetivo abordar las barreras para la adopción generalizada de la IA. ¿Cuáles son los desafíos más significativos que enfrentan las empresas al adoptar la IA, y cómo ayuda su tecnología a superar estos?
Cuando se implementa mal, el software y las soluciones de IA pueden volverse problemáticos. Muchas empresas no pueden adoptar la IA debido al costo y la complejidad de construir y escalar sistemas de IA. Hoy en día, las soluciones de IA no están optimizadas para la inferencia, con pods de capacitación que tienen una eficiencia pobre y servidores de inferencia que tienen cuellos de botella altos. Para abordar este desafío y hacer que la IA sea más accesible, hemos desarrollado la primera solución de inferencia de IA completa – una infraestructura de cómputo y red impulsada por nuestra NAPU – que aprovecha al máximo su acelerador de IA y reduce las barreras del mercado en torno al costo y el consumo excesivos de energía.
Nuestro enfoque de sistema para la inferencia de IA – en lugar de tratar de desarrollar una mejor GPU o acelerador de IA donde ya hay mucha innovación y competencia – significa que estamos llenando una brecha significativa en la industria para docenas de innovadores de chips y sistemas de inferencia de IA. Nuestro equipo atacó las deficiencias en la inferencia de IA de manera sistemática y holística, determinando los puntos críticos, las brechas arquitectónicas y las proyecciones de cargas de trabajo de IA – para entregar la primera arquitectura de inferencia de IA personalizada y de silicio a software, sin CPU. Y al desarrollar una pila de software de IA de extremo a extremo con estándares abiertos desde Python y Kubernetes combinados con la herramienta de cadena, la provisión y las API de inferencia de NeuReality, nuestro conjunto integrado de herramientas de software combina todos los componentes en una interfaz de usuario/unidad de experiencia de alta calidad.
En un mercado de IA competitivo, ¿qué distingue a NeuReality de otros proveedores de soluciones de inferencia de IA?
Para ponerlo simplemente, somos abiertos y agnósticos con respecto al acelerador. Nuestra infraestructura de inferencia de IA de NR1 supercarga cualquier acelerador de IA – GPU, TPU, LPU, ASIC, etc. – creando un sistema de extremo a extremo verdaderamente optimizado. Los aceleradores de IA se introdujeron inicialmente para ayudar a las CPU a manejar las demandas de las redes neuronales y el aprendizaje automático a gran escala, pero ahora los aceleradores de IA se han vuelto tan poderosos que están siendo frenados por las propias CPU que se suponía que debían ayudar.
Nuestra solución es la NR1. Es una arquitectura de inferencia de IA completa y reimaginada. Nuestro arma secreta es la NR1 NAPU, que se diseñó como un co-ingredient para maximizar el rendimiento del acelerador de IA sin consumir energía adicional ni romper el banco. Hemos construido un ecosistema abierto, integrándonos perfectamente con cualquier chip de inferencia de IA y marcos de software populares como Kubernetes, Python, TensorFlow y más.
El enfoque abierto de NeuReality significa que no estamos compitiendo con el paisaje de la IA; estamos aquí para complementarlo a través de asociaciones estratégicas y colaboraciones tecnológicas. Proporcionamos la pieza que falta del rompecabezas: una arquitectura de inferencia sin CPU y personalizada que no solo desbloquea los aceleradores de IA para el rendimiento de referencia, sino que también hace que sea más fácil para las empresas y los gobiernos adoptar la IA. Imagina desbloquear el poder completo de las GPU de Nvidia H100, los TPUs de Google (GOOGL ) o los MI300 de AMD – dándoles la infraestructura que merecen.
La arquitectura abierta y eficiente de NeuReality nivel la competencia, haciendo que la IA sea más accesible y asequible para todos. Estoy apasionado por ver cómo diferentes industrias – fintech, biotecnología, salud – experimentan la ventaja de la NR1 de primera mano. Compare sus soluciones de IA en sistemas tradicionales con la infraestructura moderna de la NR1 y presencie la diferencia. Hoy en día, solo el 35% de las empresas y los gobiernos han adoptado la IA y eso se basa en criterios de calificación muy bajos. Hagamos que sea posible para más del 50% de los clientes empresariales adoptar la IA para el próximo año sin dañar el planeta ni romper el banco.
Mirando hacia adelante, ¿cuál es la visión a largo plazo de NeuReality para el papel de la IA en la sociedad, y cómo ve su empresa contribuyendo a este futuro?
Me imagino un futuro donde la IA beneficia a todos, fomentando la innovación y mejorando la vida. Estamos construyendo la tecnología; estamos construyendo los cimientos para un futuro mejor.
Nuestra NR1 es clave para esa visión. Es una solución de inferencia de IA completa que comienza a romper las barreras de costo y complejidad que obstaculizan la adopción empresarial masiva de la IA. Hemos reimaginado tanto la infraestructura como la arquitectura, entregando un sistema revolucionario que maximiza la salida de cualquier GPU, cualquier acelerador de IA, sin aumentar los costos operativos o el consumo de energía.
El modelo de negocio realmente importa para escalar y dar a los clientes finales opciones reales sobre la autocracia de la IA concentrada, como he escrito antes. Así que, en cambio, estamos construyendo un ecosistema abierto donde nuestro silicio funciona con otros silicios, no en su contra. Eso es por qué diseñamos la NR1 para integrarse perfectamente con todos los aceleradores de IA y con modelos y software abiertos, haciendo que sea lo más fácil posible instalar, administrar y escalar.
Pero no nos detenemos allí. Estamos colaborando con socios para validar nuestra tecnología en varios trabajos de IA y entregar “inferencia como servicio” y “LLM como servicio” a través de proveedores de servicios en la nube, hiperescaladores y directamente con fabricantes de chips de IA. Queremos hacer que la IA avanzada sea accesible y asequible para todos.
Imagina las posibilidades si pudiéramos aumentar el rendimiento de la inferencia de IA, la eficiencia energética y la asequibilidad en porcentajes de dos dígitos. Imagina una sociedad robusta y habilitada para la IA con más voces y opciones que se vuelven una realidad. Así que todos debemos hacer el trabajo exigente de demostrar el impacto comercial y el ROI cuando se implementa la IA en las operaciones diarias de los centros de datos. Centrémonos en la implementación revolucionaria de la IA, no solo en la capacidad del modelo de IA.
Esta es la forma en que contribuimos a un futuro donde la IA beneficia a todos – una victoria para las márgenes de beneficio, las personas y el planeta.
Gracias por la gran entrevista, los lectores que deseen obtener más información deben visitar NeuReality.












