Entrevistas
Elad Raz, CEO de NextSilicon – Serie de entrevistas

Elad Raz, CEO de NextSilicon, es un experimentado empresario y líder tecnológico ampliamente respetado por su profunda experiencia en sistemas de bajo nivel, seguridad, redes y desarrollo de sistemas de archivos. A lo largo de una carrera que abarca papeles de ingeniería militar de élite, liderazgo de software senior, creación de empresas y inversión a largo plazo, Raz ha liderado proyectos complejos y críticos para la misión en internos de sistemas operativos y la integración de hardware y software. Antes de fundar NextSilicon, construyó y salió de varias empresas de tecnología, ocupó puestos de liderazgo senior en una empresa de semiconductores líder y invirtió en una cartera diversa de startups, combinando una profundidad de ingeniería práctica con una sólida ejecución y una visión estratégica a largo plazo.
NextSilicon es una empresa israelí de computación de alto rendimiento y semiconductores fundada en 2017 que está redefiniendo la arquitectura de cómputo para cargas de trabajo exigentes como la inteligencia artificial y la computación científica. La empresa ha desarrollado una plataforma de cómputo inteligente definida por software diseñada para ofrecer un alto rendimiento y eficiencia sin requerir que los desarrolladores reescriban las aplicaciones. Al centrarse en la adaptabilidad a nivel de hardware, NextSilicon pretende abordar cuellos de botella fundamentales en centros de datos modernos y entornos de supercomputación, posicionándose como una alternativa de próxima generación a los aceleradores tradicionales.
¿Puede contarnos sobre su viaje que lo llevó a la fundación de NextSilicon? ¿Qué desencadenó la idea inicial y cómo sus experiencias tempranas con la computación dieron forma a su visión?
He estado fascinado por las computadoras desde que era un niño. Esa fascinación me llevó desde manipular viejas Commodore 64 y Atari (que todavía colecciono hasta hoy) hasta cofundar startups y, finalmente, vender mi empresa anterior a Mellanox. Pero incluso con esos primeros éxitos, seguí viendo el mismo desafío una y otra vez en esta industria. A medida que las cargas de trabajo computacionales se vuelven más complejas, las arquitecturas tradicionales de CPU y GPU están alcanzando límites de rendimiento, eficiencia de energía y escalabilidad. Ya sea optimizando algoritmos o ejecutando simulaciones a gran escala, se hizo evidente que las arquitecturas actuales estaban obligando a las cargas de trabajo a adaptarse al hardware, en lugar de que el hardware se adapte a las cargas de trabajo.
La chispa para NextSilicon surgió de este desafío recurrente y planteó la pregunta: ¿Qué pasaría si pudiéramos dar la vuelta a la situación y construir arquitecturas de cómputo que se adapten a las cargas de trabajo, en lugar de obligar a las cargas de trabajo a adaptarse al hardware? Mi exposición temprana al diseño de algoritmos y hardware me enseñó que el verdadero avance vendría de combinar ambos en tiempo real. Esa es la base de nuestra Arquitectura de Cómputo Inteligente (ICA) y la visión guía de NextSilicon desde el principio.
Maverick-2 se describe como un Acelerador de Cómputo Inteligente que se adapta a cargas de trabajo en tiempo real. ¿Cómo difiere su arquitectura de las GPU o FPGA tradicionales y qué permite ese nivel de adaptabilidad?
Las CPU y GPU han transformado nuestro mundo y nos han servido bien. Pero nunca fueron diseñadas para satisfacer las demandas de las cargas de trabajo de inteligencia artificial y computación de alto rendimiento (HPC) modernas en campos como la ciencia, el clima, la energía y la defensa. Estas cargas de trabajo tienen dependencias de datos complejas, patrones de acceso a la memoria y patrones computacionales que los procesadores actuales no fueron diseñados para manejar. El resultado son cuellos de botella que frenan la innovación.
La diferencia clave de Maverick-2 es su enfoque novedoso que combina un motor de flujo de datos reconfigurable con optimización de software en tiempo real. La diferencia arquitectónica clave es que el hardware se configura en función de la carga de trabajo, no al revés. Para Maverick-2, la disponibilidad de datos impulsa la computación, en lugar de que un contador de programa impulse la ejecución de instrucciones como en los procesadores tradicionales. Esto nos permite crear unidades de procesamiento virtuales definidas por software que se pueden configurar y reconfigurar en tiempo real para coincidir con patrones de carga de trabajo específicos.
Los resultados hablan por sí mismos: Maverick-2 ofrece más de 4 veces el rendimiento por vatio de las GPU y más de 20 veces el de las CPU de alta gama, mientras reduce los costos operativos en más de la mitad. Como resultado, los investigadores y los ingenieros pueden ejecutar simulaciones grandes e irregulares más rápido y de manera más eficiente, desbloqueando conocimientos y avances en una fracción del tiempo.
¿Cuáles son las innovaciones clave que impulsan esas ganancias de rendimiento en cargas de trabajo del mundo real?
Las ganancias de rendimiento provienen de varias innovaciones clave que trabajan juntas.
En primer lugar, nos alejamos del modelo de Von Neumann que ha dominado la computación durante 80 años. En lugar de la ejecución secuencial de instrucciones, Maverick-2 utiliza una arquitectura de flujo de datos donde la computación sigue la disponibilidad de datos. Esto es fundamentalmente mejor adaptado para cargas de trabajo irregulares e intensivas en memoria.
En segundo lugar, nuestra arquitectura de autooptimización genera núcleos de procesador definidos por software en tiempo real. El hardware se adapta a las necesidades de cada aplicación sin requerir reescritura de código; obtienes optimización sin el sobrecoste.
En tercer lugar, y esto es crítico: nos centramos en el rendimiento sostenido en el mundo real, no en picos teóricos. Muchas arquitecturas se ven bien en papel pero fallan en cargas de trabajo reales. Maverick-2 mantiene la eficiencia en AI, HPC y bases de datos vectoriales al adaptarse continuamente a las necesidades de la carga de trabajo.
Maverick-2 admite C/C++, Fortran, OpenMP y Kokkos sin requerir cambios de código. ¿Cómo han respondido los desarrolladores a esa compatibilidad y qué planes hay para admitir CUDA, ROCm o marcos de inteligencia artificial populares?
Los desarrolladores aman que Maverick-2 sea un verdadero “reemplazo directo”. Pueden ejecutar sus aplicaciones existentes de inmediato sin las barreras de portabilidad que aquejan a esta industria. Actualmente admitimos C/C++, Fortran, OpenMP y Kokkos de forma predeterminada, con CUDA, ROCm y marcos de inteligencia artificial importantes como TensorFlow, JAX, PyTorch y ONNX en desarrollo activo. Esto elimina el bloqueo de proveedor y las costosas reescrituras de código, y permite a los clientes evaluar y adoptar nuevas arquitecturas sin interrumpir sus flujos de trabajo.
¿Cómo funciona la optimización del sistema basada en telemetría de Maverick-2 detrás de escena? ¿Qué está involucrado en la creación de perfiles y la reconfiguración de la placa en tiempo real?
Piense en nuestra optimización del sistema como un ciclo continuo: durante la ejecución, nuestro sistema de telemetría mide cientos de indicadores de rendimiento (por ejemplo, ancho de banda de memoria, utilización, profundidad de cola). Todos esos datos se alimentan a un optimizador en tiempo de ejecución que determina si la configuración de hardware actual sigue siendo óptima para la carga de trabajo y sus necesidades proyectadas. Si no es así, puede reparticionar recursos, reordenar rutas de datos y ajustar tuberías de cómputo continuamente, lo que significa que la aplicación no se detiene. Esto ocurre dentro de milisegundos, por lo que la aplicación mantiene una eficiencia pico consistente a medida que cambia su perfil computacional.
¿Hay tipos específicos de cargas de trabajo o casos de borde donde la optimización de rendimiento en tiempo de ejecución es menos efectiva o introduce compensaciones en latencia o potencia?
Cualquier arquitectura tendrá compensaciones. Maverick-2 sobresale en cargas de trabajo complejas e irregulares con patrones computacionales y de acceso a datos cambiantes. Para cargas de trabajo muy predecibles y de función fija, una GPU bien ajustada puede ser muy eficiente sin el sobrecoste de la adaptación. En esos casos, nuestra adaptabilidad todavía ofrece un rendimiento sólido, pero la ventaja relativa puede ser menor.
El diseño de NextSilicon se centra en la versatilidad y la competitividad en casos sencillos, pero es transformador en los desafiantes.
¿Por qué decidió priorizar el mercado de HPC al principio, cuando la mayoría de las startups se apresuraban a entrar en la inteligencia artificial? ¿Cómo ha moldeado eso su estrategia de producto y negocio?
HPC representa la frontera de la complejidad computacional y la resolución de problemas para conjuntos de datos masivos, acceso a memoria irregular y patrones computacionales impredecibles. Si puedes construir una arquitectura que prospere allí, como ejecutar simulaciones de exabyte en modelado climático o física de partículas, también sobresaldrá en la inteligencia artificial.
Al centrarnos en HPC primero, probamos a Maverick-2 en las cargas de trabajo más exigentes en modelado climático, física y ciencias de la vida. Eso nos dio credibilidad, datos de rendimiento en el mundo real y un producto maduro antes de avanzar hacia los mercados de inteligencia artificial. Ahora estamos posicionados para servir a ambos, sin haber comprometido nuestra arquitectura para capitalizar tendencias o necesidades a corto plazo.
Ahora que Maverick-2 está en producción y se ha desplegado en decenas de clientes, ¿puede compartir ejemplos de cómo se está utilizando? ¿Algunos resultados o benchmarks específicos de despliegues destacados?
Un ejemplo destacado es nuestro despliegue en Sandia National Labs, donde Maverick-2 impulsa su supercomputadora Spectra como parte del programa Vanguard-II. Estamos viendo impresionantes resultados de rendimiento fuera de la caja sin requerir modificaciones de código. También estamos trabajando con ODISSEE (Soluciones de datos intensivos en línea para la ciencia en la era de los exabytes), que reúne a instituciones de investigación líderes para manejar datos de exabyte de CERN del Large Hadron Collider de alta luminosidad y el Observatorio Square Kilometre Array. El papel que Maverick-2 desempeñará es resolver el desafío de procesar petabytes de datos experimentales brutos en una fracción del tiempo y la energía requeridos anteriormente. El objetivo final es permitir análisis de física más rápidos y descubrimientos astronómicos.
Ha recaudado más de $300 millones, con rondas importantes anunciadas en 2021 y más recientemente. ¿Puede compartir cómo esa financiación ha acelerado el desarrollo de productos y el alcance del mercado?
La financiación nos permitió hacer tres cosas. En primer lugar, pudimos impulsar la arquitectura más allá, no solo mejoras incrementales, sino avances fundamentales que hicieron que Maverick-2 estuviera listo para la producción. En segundo lugar, escalamos nuestra fabricación y cadena de suministro para satisfacer la creciente demanda, un desafío no trivial para el silicio novel. En tercer lugar, expandimos nuestro ecosistema de software para permitir que los clientes integren y desplieguen más rápido.
También nos permitió establecer asociaciones estratégicas con centros de supercomputación y proveedores de servicios en la nube, lo que nos permitió agilizar nuestro proceso de concepto a despliegue y expandirnos mucho más rápido que las startups de hardware tradicionales.
En un panorama que incluye Cerebras (CBRS ), SambaNova y Nvidia (NVDA ), ¿cómo ve a NextSilicon posicionándose? ¿Cuál es su enfoque de mercado como desafiante?
Nos vemos a nosotros mismos como más una empresa de tecnología que solo otra empresa de chips. Optimizamos cada carga de trabajo, ofrecemos adaptabilidad y no encerramos a los clientes en programación o hardware propietarios. Nuestros clientes pueden traer su código existente y lograr una aceleración inmediata sin ciclos de portabilidad prolongados o bloqueo de proveedor en un solo ecosistema, como CUDA. Esto es especialmente importante a medida que las cargas de trabajo de inteligencia artificial evolucionan más allá del entrenamiento puro. Los modelos de razonamiento, la inferencia extendida y las ventanas de contexto grandes requieren patrones de cómputo fundamentalmente diferentes: acceso a memoria más dinámico, cálculo de longitud variable y asignación de recursos adaptable. Estos no son problemas que se resuelvan con más de la misma arquitectura fija.
Nuestra estrategia de mercado se centra en resolver los problemas más difíciles primero: trabajar con instituciones de investigación, laboratorios nacionales y empresas donde el rendimiento, la eficiencia de energía y la flexibilidad son críticos. A partir de ahí, escalamos hacia mercados de inteligencia artificial y datos intensivos más amplios. La industria está dominada por arquitecturas fijas. Estamos ofreciendo algo diferente, adaptabilidad construida desde el principio. La inteligencia artificial está pasando de la pura escala a la inteligencia. Los modelos más grandes están permitiendo un razonamiento más inteligente, desde prompts cortos hasta la comprensión de contexto largo. En esta transición, las arquitecturas adaptables no serán solo novedosas; serán esenciales.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar NextSilicon.












