Entrevistas

Kismat Singh, cofundador y director ejecutivo de MachGen AI – Serie de entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Kismat Singh, cofundador y director ejecutivo de MachGen AI, es un ejecutivo de infraestructura e ingeniería de IA con más de dos décadas de experiencia construyendo sistemas de computación de alto rendimiento y aprendizaje automático. Antes de cofundar MachGen AI, Singh se desempeñó como vicepresidente de Ingeniería para Frameworks de IA en Intel y previamente ocupó cargos de ingeniería senior en NVIDIA, AMD, HP y otras compañías tecnológicas. Su trabajo ha incluido contribuciones a bibliotecas y compiladores de deep learning, optimización de frameworks de IA y mejoras en la resiliencia del entrenamiento a escala hiperescalar. En Intel, participó estrechamente en las iniciativas de PyTorch de la empresa y habló públicamente sobre cómo hacer que los frameworks de IA sean más accesibles en diferentes plataformas de hardware.

MachGen AI es una empresa de infraestructura de IA centrada en hacer que los modelos generativos de imagen y video sean drásticamente más rápidos y económicos de ejecutar. Fundada por Kismat Singh y Manoj Krishnan, la compañía está desarrollando una pila de inferencia y ajuste fino de alto rendimiento diseñada específicamente para modelos de difusión, en lugar de adaptar infraestructura originalmente construida para grandes modelos de lenguaje. MachGen optimiza áreas como el cálculo de atención, el almacenamiento en caché, los kernels de GPU, la gestión de memoria, el paralelismo, la programación y el despliegue para reducir la latencia de generación sin comprometer la calidad del modelo. Su plataforma ofrece API para generación de texto a imagen, imagen a imagen, texto a video, imagen a video y referencia a video, con la tecnología subyacente orientada a habilitar aplicaciones de baja latencia como creación de contenido interactivo, avatares en tiempo real, videojuegos y publicidad personalizada.

Has trabajado más de dos décadas en video, cómputo GPU y rendimiento de IA, incluyendo TensorRT en NVIDIA, software de IA en Intel, optimización GPU en AMD y trabajos anteriores en codificación de video en tiempo real. ¿Qué observaste durante esos años que finalmente te convenció de dejar las grandes empresas tecnológicas y cofundar MachGen, y por qué creíste que la inferencia de difusión era el problema de infraestructura que valía la pena construir una empresa alrededor?

Mi cofundador Manoj y yo jugamos al bádminton en el mismo gimnasio durante casi 10 años. Durante la mayor parte de ese tiempo, intentábamos contratar al otro. Finalmente decidimos que era más fácil trabajar juntos que seguir reclutándonos mutuamente.

La razón por la que elegimos este problema es que ambos hemos visto cómo una pila de inferencia madura desde dentro. Yo ayudé a construir el equipo de plataforma de inferencia de NVIDIA y luego dirigí el software de IA en Intel. Manoj construyó la infraestructura de entrenamiento de modelos grandes detrás de PyTorch en Meta. Observamos cómo años de trabajo en almacenamiento en caché, agrupamiento, programación y kernels transformaron los sistemas de investigación temprana de LLM en infraestructura de producción que sirve billones de tokens.

La difusión está aproximadamente donde la inferencia de LLM estaba hace tres años. Los modelos de imagen y video han avanzado rápidamente, pero los sistemas que los sirven siguen siendo lentos, costosos y difíciles de escalar. La mayor parte de la infraestructura existente se diseñó para LLM, con la difusión añadida posteriormente.

Tres factores que hicieron que el momento fuera adecuado: los modelos se volvieron lo suficientemente buenos como para construir productos reales, el problema requería exactamente las habilidades que habíamos desarrollado a lo largo de nuestras carreras, y el impacto es lo suficientemente grande como para crear una empresa generacional. Cuando un video que antes tomaba varios minutos puede generarse en segundos a una fracción del costo, la generación interactiva, la publicidad personalizada, los avatares en tiempo real y productos creativos completamente nuevos se vuelven posibles.

MachGen sostiene que muchas de las técnicas que transformaron la inferencia de grandes modelos de lenguaje no se trasladan limpiamente a los modelos de difusión. ¿Qué es fundamentalmente diferente al servir modelos de imagen y video, y dónde están los cuellos de botella de rendimiento más grandes que la infraestructura de IA convencional tiende a pasar por alto?

Los LLM y los modelos de difusión tienen patrones computacionales fundamentalmente diferentes. Los LLM son autoregresivos, con una fase de prellenado intensiva en cómputo seguida de una decodificación token a token limitada por la memoria. Técnicas como el almacenamiento en caché KV y la desagregación prellenado/decodificación se diseñaron alrededor de esa estructura.

Los modelos de difusión no son autoregresivos y permanecen limitados por el cómputo durante todo el proceso de denoising. La generación de video también implica grandes cantidades de datos espaciales y temporales, creando demandas diferentes en cuanto a atención, memoria, comunicación y paralelismo.

Como resultado, muchas de las optimizaciones desarrolladas para LLM no se trasladan limpiamente. El almacenamiento en caché KV convencional no resuelve el mismo problema, el paralelismo estándar puede introducir una sobrecarga de comunicación sustancial, y los kernels de código abierto disponibles están mucho menos maduros. El programador, el modelo de memoria, la estrategia de caché, los kernels y el paralelismo deben diseñarse en torno a la difusión misma. Por eso construimos MachGen con la difusión como un ciudadano de primera clase.

MachGen informa una latencia aproximadamente 4–6 veces menor en algunos modelos de imagen y alrededor de 6 veces de mejora en varios modelos de video mientras ejecuta los modelos originales, sin destilar. ¿Cuáles son los avances técnicos más importantes detrás de esas ganancias, y cómo garantizan que las mejoras de rendimiento no se produzcan a expensas de la calidad del output?

Las ganancias provienen de varias partes de la pila que trabajan en conjunto. La atención domina el presupuesto de cómputo en muchos modelos de video, por lo que nos enfocamos en recetas de menor precisión, atención escasa y técnicas relacionadas. También hemos desarrollado métodos de caché que explotan la redundancia espacial y temporal, kernels altamente optimizados para arquitecturas de difusión y técnicas de paralelismo que reducen la sobrecarga de comunicación.

En conjunto, esas mejoras permiten que MachGen entregue HiDream en un segundo frente a seis segundos y Flux en 1,5 segundos frente a 6,2 segundos. Para video, Wan 2.2 se ejecuta en 16,5 segundos frente a 98 segundos, mientras que LTX 2.3 se ejecuta en 10,7 segundos frente a 67 segundos. Los costos de inferencia también son de 2–4 veces menores para los modelos de imagen y de 2–3 veces menores para video.

Estos resultados utilizan los modelos originales, no destilados. Estamos mejorando la forma en que se ejecutan los modelos sin sacrificar la calidad de la salida. Para la adopción en producción, la velocidad, el costo y la calidad deben trabajar en conjunto.

Trusted TV es un ejemplo interesante porque reducir la generación de minutos a segundos cambia más que la factura de infraestructura. Una vez que la generación de video sea lo suficientemente rápida como para producir miles de campañas y variaciones creativas personalizadas, ¿qué nuevos modelos de negocio o experiencias de producto se vuelven posibles que antes simplemente no eran viables?

TrustedTV ayuda a las empresas a crear anuncios listos para transmisión con IA y a ubicarlos en plataformas de TV conectada como Prime Video, Roku y DirecTV. Muchos de sus clientes son pequeñas empresas. Realizar un anuncio de TV de forma tradicional requería un equipo de filmación y edición, con costos que comenzaban en miles y típicamente alcanzaban decenas de miles de dólares. Trusted TV lleva eso a cero. Un propietario de una pequeña empresa puede crear un anuncio completo desde un smartphone en aproximadamente cinco minutos y verlo antes de pagar nada. Se han creado más de 10 000 campañas en la plataforma.

Ian, CEO de Trusted TV, vio el benchmark de latencia de MachGen en Artificial Analysis y no lo creyó. Se inscribió para probarlo él mismo. Su primera renderización regresó en aproximadamente 25 segundos sin pérdida de calidad, y cuando realizó pruebas de concurrencia, las mejoras se mantuvieron a escala. Trasladaron todo su flujo de trabajo de producción a MachGen en menos de 48 horas, y MachGen ahora impulsa toda su nueva creación de video. En la última implementación, estamos más cerca de 10 o 11 segundos en ese modelo, y seguiremos mejorándolo.

El efecto del producto es que los anunciantes dejan de crear uno o dos anuncios generales. Sus usuarios rotan dos o tres anuncios nuevos por semana, prueban creatividades en diferentes segmentos de audiencia y iteran en lugar de comprometerse. Lo que sigue es la personalización a nivel geográfico y de audiencia a gran escala, lo que antes estaba reservado a empresas con presupuestos de varios millones de dólares.

Una versión que pienso personalmente: hoy recibo un anuncio de zapatillas grabado en una calle de Manhattan. Yo vivo en el Área de la Bahía, así que no significa nada para mí. Lo que quiero es el mismo anuncio con Mission Peak al fondo. No es un anuncio más barato; es un tipo diferente de publicidad, y solo se vuelve económicamente viable cuando la generación es lo suficientemente rápida y barata como para crear miles de variantes.

Para las empresas que integran generación de imágenes o video directamente en sus productos, ¿cómo deben abordar la economía de la inferencia? ¿A qué escala se vuelve estratégicamente importante optimizar la utilización de GPU en lugar de simplemente pagar a un proveedor de API por cada generación?

El punto de inflexión llega cuando la inferencia comienza a afectar la experiencia del cliente o los márgenes de la empresa.

Una API de propósito general puede tener sentido mientras un equipo valida un producto. Una vez que la generación se vuelve central para ese producto, los equipos deben mirar más allá del precio listado por salida. La latencia, la concurrencia, la calidad, la fiabilidad y la utilización de GPU se convierten en parte de la economía.

Una generación puede parecer económica, pero aún crea un problema de negocio si los usuarios deben esperar varios minutos y abandonan el flujo de trabajo. Una arquitectura que requiera que la capacidad de GPU crezca al mismo ritmo que el uso también ejercerá una presión creciente sobre los márgenes.

No hay un umbral único de volumen de solicitudes porque el cómputo requerido para un clip corto de 540p es muy diferente al de un video más largo de 1080p. La optimización se vuelve estratégica cuando el aumento del uso hace que los costos suban casi al mismo ritmo, la demanda pico genera colas o la latencia comienza a limitar la experiencia del producto.

MachGen funciona a través de varias capas, incluidos kernels GPU personalizados, caché, optimización de precisión, programación y paralelismo. A medida que los modelos continúan evolucionando rápidamente, ¿qué capa de la pila de inferencia crees que ofrece la mayor oportunidad restante para mejoras dramáticas en velocidad y costo?

Para la generación de video, la atención representa una de las mayores oportunidades restantes porque domina el presupuesto de cómputo en muchos modelos. Todavía hay un margen significativo para mejorar las recetas de menor precisión, la atención escasa y los kernels de atención específicos para difusión.

La atención es solo una parte de la oportunidad. Las mayores ganancias generales provendrán de combinar mejoras en toda la pila. La caché es un ejemplo. Las técnicas de caché KV usadas en los LLM no se transfieren directamente, pero los modelos de difusión contienen redundancia espacial y temporal que puede explotarse con el enfoque adecuado.

El paralelismo presenta otra oportunidad. Añadir GPUs no produce automáticamente una aceleración proporcional porque la sobrecarga de comunicación puede compensar el beneficio. Desarrollamos kernels a medida que superponen la comunicación con el cómputo independiente de datos y la canalizan con el trabajo dependiente de datos.

La atención, el almacenamiento en caché, los kernels, el paralelismo, la memoria y la planificación afectan mutuamente. Optimizar solo una capa eventualmente crea un cuello de botella en otro lugar. Las mayores mejoras provendrán de tratar la pila como un sistema completo diseñado para el perfil computacional de la difusión.

Con los modelos de video más recientes acercando los tiempos de generación al tiempo real, ¿qué tan cerca estamos de un video generativo verdaderamente interactivo y qué barreras técnicas aún deben superarse antes de que la generación de video en tiempo real sea habitual?

Ya estamos alcanzando velocidades interactivas para ciertas aplicaciones. MachGen genera un video Vidu Q3 Turbo de cinco segundos a 720p en aproximadamente seis segundos y a 540p en menos de tres. Eso es lo suficientemente rápido para una iteración creativa rápida y pone a los avatares responsivos y al video interactivo al alcance.

Un ejemplo de lo que yo entiendo por interactivo. Imagina que estás viendo una historia y puedes ver hacia dónde se dirige el final, y no te gusta. En lugar de quedarte allí pasivamente, lo rediriges: esos dos personajes deberían averiguar qué es lo que el tercero está ocultando y enfrentarlo en lugar de dejar que se desarrolle. Contenido que diriges en lugar de contenido que recibes. Eso es lo que la generación rápida y barata hace posible, y cambia casi todo lo que consumimos.

Llegar allí suele requerir más de un benchmark sólido de latencia. Toda la experiencia debe mantenerse receptiva bajo tráfico de producción mientras se mantiene la calidad visual, la consistencia cuadro a cuadro y un costo predecible. Los videos más largos, las resoluciones más altas y las solicitudes concurrentes aumentan la carga de infraestructura, y el sistema aún debe provisionar capacidad, enrutar solicitudes y recuperarse de fallas de hardware sin que el usuario lo note.

Llegará caso por caso. Los clips cortos, los avatares, los juegos y las herramientas creativas probablemente serán los primeros, porque la generación medida en segundos ya es suficiente para ellos. A medida que la calidad del modelo y el rendimiento de inferencia mejoren conjuntamente, más aplicaciones cruzarán ese umbral.

A medida que los agentes de IA generan imágenes y videos de forma autónoma en lugar de esperar a que un humano presione un botón, ¿cómo cambia eso los requisitos de infraestructura? ¿Las cargas de trabajo impulsadas por agentes crean demandas fundamentalmente diferentes en cuanto a latencia, concurrencia, costo y fiabilidad?

Un agente convierte una única solicitud de usuario en decenas o cientos de trabajos de generación. Crea varias opciones, las evalúa, revisa el prompt y repite el proceso, sin intervención humana entre pasos.

Eso hace que la latencia, la concurrencia, el costo y la fiabilidad sean mucho más importantes. Si cada generación lleva minutos, el flujo de trabajo del agente es demasiado lento para ser útil. Si cada intento es costoso, la iteración autónoma se vuelve económicamente inviable. El sistema también debe manejar muchas solicitudes simultáneas de forma fiable, porque una falla puede interrumpir toda la cadena de trabajo.

Aquí es donde capacidades como la provisión de GPU, el escalado automático y el enrutamiento son tan importantes como la optimización a nivel de modelo. La demanda de agentes es mucho más explosiva que la demanda de una aplicación creativa donde una persona hace clic en un botón.

La unidad de trabajo relevante ya no es una sola imagen o video. Es el bucle completo de generar, evaluar y refinar contenido. La infraestructura debe hacer que todo ese bucle sea rápido, asequible y fiable.

Existe una intensa competencia entre proveedores de GPU, nubes de inferencia, desarrolladores de modelos y plataformas de optimización. A medida que el hardware en sí se vuelve más rápido, ¿por qué las empresas seguirán necesitando una capa de inferencia especializada como MachGen en lugar de depender de las mejoras de NVIDIA, AMD, los proveedores de nube o los propios desarrolladores de modelos?

El hardware más rápido eleva el techo. El software determina cuánto de ese techo se alcanzará.

Vimos esto con los LLM. Cada nueva generación de aceleradores mejoró el rendimiento bruto, y el procesamiento por lotes continuo, la gestión de caché KV, la decodificación especulativa y los kernels especializados fueron lo que llevó a la industria a alcanzar un rendimiento y una economía a nivel de producción. Nada de eso provino del hardware.

Optimizar continuamente todo el camino de producción para la generación de imágenes y videos es una tarea diferente de lo que hacen los proveedores de hardware, los proveedores de nube y los desarrolladores de modelos, y no es una prioridad central para ninguno de ellos.

Existen algunas aproximaciones a esa tarea. Una es el modelo de mercado, donde los modelos se agregan y se enrutan las solicitudes. No creemos que sea sostenible a largo plazo, porque no hay control sobre la capa donde reside el rendimiento. Elegimos construir la pila nosotros mismos y alojarla de forma nativa, que es la única manera de lograr los números de latencia y costo que vemos.

Eso significa ajustar la atención, el almacenamiento en caché, los núcleos, la precisión, la memoria y el paralelismo por modelo y por acelerador, y admitir APIs gestionadas, nube dedicada y despliegue auto‑alojado. A medida que aumenta el número de modelos y opciones de hardware, también lo hace la complejidad. Nuestro papel es absorberlo para que nuestros clientes puedan dedicar su tiempo a lo que diferencia a sus productos.

Usted ha descrito los modelos de mundo como parte de la visión a largo plazo de MachGen, con muchas de sus características computacionales parecidas a cargas de trabajo de difusión. ¿Cómo debe ser la infraestructura para modelos de mundo a escala de producción, y qué aplicaciones se vuelven posibles si generar y simular entornos visuales eventualmente llega a ser tan económico y sensible como generar texto hoy?

Una forma de pensar en nuestra plataforma es similar a un LLM de propósito general. El mismo modelo redacta un contrato legal y responde a una pregunta sobre restaurantes. Para nosotros, la misma pila sirve a empresas de avatares de video, publicidad de IA, generación de historias y microdramas, y eventualmente a modelos de mundo. Diferentes verticales, un conjunto de problemas de rendimiento subyacentes.

Los modelos de mundo no son nuestro negocio principal hoy, pero son a lo que estamos avanzando, y estamos trabajando activamente en ellos. Los modelos de mundo a escala de producción necesitarán un rendimiento muy alto y una latencia muy baja porque generan y actualizan continuamente un entorno en lugar de producir una salida única. También requieren consistencia espacial y temporal, la capacidad de responder a acciones y, a menudo, la capacidad de simular múltiples resultados posibles simultáneamente. Eso genera problemas difíciles en memoria, movimiento de datos, paralelismo y fiabilidad. Un modelo de mundo que controle un robot o un juego no puede tardar minutos en producir el siguiente estado. El rendimiento decide si estos sistemas son utilizables en absoluto.

Computacionalmente, los modelos de mundo actuales se parecen mucho a los modelos de difusión, por lo que la pila que estamos construyendo ahora es la base natural. Aún no existe una capa de servicio de producción madura para ellos, comparable a lo que existe para los LLM. Tenemos la intención de construirla.

Si la simulación se vuelve tan sensible y asequible como la generación de texto hoy, los robots pueden ensayar situaciones raras antes de encontrarlas, los juegos pueden generar entornos que respondan a jugadores individuales y los diseñadores pueden probar docenas de posibilidades antes de construir en el mundo físico. La difusión es donde obtenemos nuestros ingresos hoy. Los modelos de mundo son nuestra Estrella del Norte.

Gracias por la excelente entrevista, los lectores que deseen obtener más información deberían visitar MachGen AI.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.