Entretiens
Kismat Singh, cofondateur et PDG de MachGen AI – Série d’interviews

Kismat Singh, cofondateur et PDG de MachGen AI, est un dirigeant de l’infrastructure et de l’ingénierie IA avec plus de deux décennies d’expérience dans la construction de systèmes de calcul haute performance et d’apprentissage automatique. Avant de co‑fonder MachGen AI, Singh a occupé le poste de vice‑président de l’ingénierie pour les cadres IA chez Intel et a auparavant occupé des postes d’ingénierie senior chez NVIDIA, AMD, HP et d’autres entreprises technologiques. Son travail comprend des contributions aux bibliothèques d’apprentissage profond et aux compilateurs, à l’optimisation des cadres IA et à l’amélioration de la résilience de l’entraînement à hyperscale. Chez Intel, il a été fortement impliqué dans les initiatives PyTorch de l’entreprise et a pris la parole publiquement pour rendre les cadres IA plus accessibles sur différentes plateformes matérielles.
MachGen AI est une société d’infrastructure IA axée sur la réalisation de modèles génératifs d’images et de vidéos nettement plus rapides et plus économiques à exécuter. Fondée par Kismat Singh et Manoj Krishnan, l’entreprise développe une pile d’inférence et de réglage fin haute performance spécifiquement conçue pour les modèles de diffusion plutôt que d’adapter une infrastructure initialement construite pour les grands modèles de langage. MachGen optimise des domaines tels que le calcul de l’attention, la mise en cache, les kernels GPU, la gestion de la mémoire, le parallélisme, la planification et le déploiement afin de réduire la latence de génération tout en conservant la qualité du modèle. Sa plateforme fournit des API pour la génération texte‑à‑image, image‑à‑image, texte‑à‑vidéo, image‑à‑vidéo et référence‑à‑vidéo, la technologie sous‑jacente visant à permettre des applications à faible latence telles que la création de contenu interactive, les avatars en temps réel, les jeux vidéo et la publicité personnalisée.
Vous avez passé plus de deux décennies à travailler sur la vidéo, le calcul GPU et les performances IA, notamment TensorRT chez NVIDIA, les logiciels IA chez Intel, l’optimisation GPU chez AMD, ainsi que des travaux antérieurs sur l’encodage vidéo en temps réel. Qu’avez‑vous observé au cours de ces années qui vous a finalement convaincu de quitter les grandes entreprises technologiques et de co‑fonder MachGen, et pourquoi avez‑vous estimé que l’inférence de diffusion était le problème d’infrastructure digne de fonder une entreprise autour ?
Mon cofondateur Manoj et moi avons joué au badminton dans le même gymnase pendant près de 10 ans. Pendant la majeure partie de cette période, nous essayions de recruter l’autre. Finalement, nous avons décidé qu’il était plus simple de travailler ensemble que de continuer à nous recruter mutuellement.
La raison pour laquelle nous avons choisi ce problème est que nous avons tous deux observé l’évolution d’une pile d’inférence de l’intérieur. J’ai contribué à la création de l’équipe plateforme d’inférence de NVIDIA, puis dirigé les logiciels IA chez Intel. Manoj a construit l’infrastructure d’entraînement de grands modèles derrière PyTorch chez Meta. Nous avons vu des années de travail sur la mise en cache, le regroupement, la planification et les kernels transformer les premiers systèmes de recherche LLM en une infrastructure de production servant des billions de tokens.
La diffusion se situe approximativement là où l’inférence LLM était il y a trois ans. Les modèles d’image et de vidéo ont progressé rapidement, mais les systèmes qui les desservent restent lents, coûteux et difficiles à mettre à l’échelle. La plupart des infrastructures existantes ont été conçues pour les LLM, la diffusion étant ajoutée ultérieurement.
Trois éléments ont rendu le moment propice : les modèles sont devenus suffisamment performants pour créer de vrais produits, le problème nécessitait exactement les compétences que nous avons développées tout au long de nos carrières, et l’impact est assez important pour fonder une entreprise générationnelle. Lorsqu’une vidéo qui prenait auparavant plusieurs minutes peut être générée en quelques secondes à une fraction du coût, la génération interactive, la publicité personnalisée, les avatars en temps réel et de tout nouveaux produits créatifs deviennent possibles.
MachGen soutient que de nombreuses techniques qui ont transformé l’inférence des grands modèles de langage ne se transfèrent pas proprement aux modèles de diffusion. Qu’est‑ce qui diffère fondamentalement dans le service des modèles d’image et de vidéo, et où se situent les principaux goulots d’étranglement de performance que l’infrastructure IA conventionnelle a tendance à négliger ?
Les LLM et les modèles de diffusion présentent des schémas computationnels fondamentalement différents. Les LLM sont autoregressifs, avec un pré‑remplissage gourmand en calcul suivi d’un décodage token par token limité par la mémoire. Des techniques telles que la mise en cache KV et la désagrégation pré‑remplissage/décodage ont été conçues autour de cette structure.
Les modèles de diffusion ne sont pas autoregressifs et restent limités par le calcul pendant tout le processus de débruitage. La génération vidéo implique également de grandes quantités de données spatiales et temporelles, créant des exigences différentes en matière d’attention, de mémoire, de communication et de parallélisme.
En conséquence, de nombreuses optimisations développées pour les LLM ne se transfèrent pas proprement. La mise en cache KV conventionnelle ne résout pas le même problème, le parallélisme standard peut introduire un important surcoût de communication, et les kernels open‑source disponibles sont beaucoup moins matures. Le planificateur, le modèle de mémoire, la stratégie de mise en cache, les kernels et le parallélisme doivent tous être conçus autour de la diffusion elle‑même. C’est pourquoi nous avons construit MachGen en faisant de la diffusion une première‑classe.
MachGen indique une latence environ 4 à 6 fois plus faible sur certains modèles d’image et environ 6 fois d’amélioration sur plusieurs modèles vidéo tout en exécutant les modèles originaux non distillés. Quels sont les percées techniques les plus importantes à l’origine de ces gains, et comment garantissez‑vous que les améliorations de performance ne se font pas au détriment de la qualité du résultat ?
Les gains proviennent de plusieurs parties de la pile qui fonctionnent ensemble. L’attention domine le budget de calcul dans de nombreux modèles vidéo, nous nous concentrons donc sur des recettes à précision réduite, l’attention parcimonieuse et les techniques associées. Nous avons également développé des méthodes de mise en cache qui exploitent la redondance spatiale et temporelle, des noyaux hautement optimisés pour les architectures de diffusion, et des techniques de parallélisme qui réduisent la surcharge de communication.
Ensemble, ces améliorations permettent à MachGen de livrer HiDream en une seconde contre six secondes et Flux en 1,5 seconde contre 6,2 secondes. Pour la vidéo, Wan 2.2 s’exécute en 16,5 secondes contre 98 secondes, tandis que LTX 2.3 s’exécute en 10,7 secondes contre 67 secondes. Les coûts d’inférence sont également 2 à 4 fois plus faibles pour les modèles d’image et 2 à 3 fois plus faibles pour la vidéo.
Ces résultats utilisent les modèles originaux, non distillés. Nous améliorons la façon dont les modèles fonctionnent sans sacrifier la qualité de la sortie. Pour une adoption en production, vitesse, coût et qualité doivent tous fonctionner de concert.
Trusted TV est un exemple intéressant car réduire la génération de minutes à secondes modifie plus que la facture d’infrastructure. Une fois que la génération vidéo devient suffisamment rapide pour produire des milliers de campagnes et des variantes créatives personnalisées, quels nouveaux modèles économiques ou expériences produit deviennent possibles alors qu’ils n’étaient tout simplement pas viables auparavant ?
TrustedTV aide les entreprises à créer des publicités prêtes pour la diffusion télévisée avec l’IA et à les placer sur des plateformes de TV connectée comme Prime Video, Roku et DirecTV. La plupart de ses clients sont des petites entreprises. Réaliser une publicité télévisée de manière traditionnelle nécessitait une équipe de tournage et de montage, avec des coûts commençant à plusieurs milliers de dollars et atteignant généralement plusieurs dizaines de milliers de dollars. Trusted TV ramène cela à zéro. Un propriétaire de petite entreprise peut créer une publicité complète depuis un smartphone en environ cinq minutes et la visualiser avant de payer quoi que ce soit. Plus de 10 000 campagnes ont été créées sur la plateforme.
Ian, le PDG de Trusted TV, a vu le benchmark de latence de MachGen sur Artificial Analysis et n’y a pas cru. Il s’est inscrit pour le tester lui‑même. Son premier rendu est revenu en environ 25 secondes sans perte de qualité, et lorsqu’il a effectué des tests de concurrence, les améliorations se sont maintenues à grande échelle. Ils ont migré l’ensemble de leur flux de production vers MachGen en moins de 48 heures, et MachGen alimente désormais toute leur nouvelle création vidéo. Dans le dernier déploiement, nous sommes proches de 10 ou 11 secondes sur ce modèle, et nous continuerons à l’améliorer.
L’effet produit est que les annonceurs cessent de créer une ou deux publicités générales. Leurs utilisateurs font tourner deux ou trois nouvelles publicités chaque semaine, testent la créativité auprès de différents segments d’audience et itèrent plutôt que de s’engager définitivement. Ce qui vient ensuite, c’est la personnalisation géographique et au niveau de l’audience à grande échelle, auparavant réservée aux entreprises disposant de budgets de plusieurs millions de dollars.
Une version à laquelle je pense personnellement : aujourd’hui, je reçois une publicité de baskets filmée dans une rue de Manhattan. J’habite dans la Bay Area, donc cela ne signifie rien pour moi. Ce que je veux, c’est la même publicité avec le Mission Peak en arrière‑plan. Ce n’est pas une publicité moins chère ; c’est un autre type de publicité, et elle ne devient économiquement viable que lorsque la génération est suffisamment rapide et bon marché pour créer des milliers de variantes.
Pour les entreprises qui intègrent la génération d’images ou de vidéos directement dans leurs produits, comment doivent‑elles envisager l’économie de l’inférence ? À quelle échelle l’optimisation de l’utilisation du GPU devient‑elle stratégiquement importante plutôt que de simplement payer un fournisseur d’API pour chaque génération ?
Le point d’inflexion survient lorsque l’inférence commence à affecter soit l’expérience client, soit les marges de l’entreprise.
Une API à usage général peut avoir du sens pendant qu’une équipe valide un produit. Une fois que la génération devient centrale pour ce produit, les équipes doivent regarder au‑delà du prix indiqué par sortie. La latence, la concurrence, la qualité, la fiabilité et l’utilisation du GPU font tous partie de l’économie.
Une génération peut sembler peu coûteuse, mais elle crée tout de même un problème commercial si les utilisateurs doivent attendre plusieurs minutes et abandonnent le flux de travail. Une architecture qui nécessite que la capacité GPU croisse au même rythme que l’utilisation exercera également une pression croissante sur les marges.
Il n’existe pas de seuil unique de volume de requêtes, car le calcul requis pour un court clip de 540 p est très différent d’une vidéo plus longue en 1080 p. L’optimisation devient stratégique lorsque l’augmentation de l’utilisation entraîne une hausse des coûts à un rythme presque identique, que la demande maximale crée des files d’attente, ou que la latence commence à limiter l’expérience du produit.
MachGen fonctionne à plusieurs niveaux, y compris les noyaux GPU personnalisés, la mise en cache, l’optimisation de la précision, la planification et le parallélisme. Alors que les modèles continuent d’évoluer rapidement, quel niveau de la pile d’inférence pensez‑vous offrir la plus grande opportunité restante d’améliorations spectaculaires de vitesse et de coût ?
Pour la génération vidéo, l’attention représente l’une des plus grandes opportunités restantes car elle domine le budget de calcul dans de nombreux modèles. Il reste encore une marge importante pour améliorer les recettes à précision réduite, l’attention parcimonieuse et les noyaux d’attention spécifiques à la diffusion.
L’attention n’est qu’une partie de l’opportunité. Les gains globaux les plus importants proviendront de la combinaison d’améliorations à travers toute la pile. La mise en cache en est un exemple. Les techniques de mise en cache KV utilisées dans les LLM ne se transposent pas directement, mais les modèles de diffusion contiennent une redondance spatiale et temporelle qui peut être exploitée avec la bonne approche.
Le parallélisme représente une autre opportunité. Ajouter des GPU ne génère pas automatiquement un gain de vitesse proportionnel, car la surcharge de communication peut compenser le bénéfice. Nous développons des noyaux sur mesure qui chevauchent la communication avec le calcul indépendant des données et l’enchaînent avec le travail dépendant des données.
L’attention, la mise en cache, les noyaux, le parallélisme, la mémoire et la planification s’influencent mutuellement. Optimiser une seule couche crée finalement un goulot d’étranglement ailleurs. Les plus grandes améliorations viendront du traitement de la pile comme un système complet conçu pour le profil de calcul de la diffusion.
Avec les modèles vidéo plus récents qui rapprochent les temps de génération du temps réel, à quel point sommes‑nous proches d’une véritable vidéo générative interactive, et quelles barrières techniques restent à surmonter avant que la génération vidéo en temps réel ne devienne courante ?
Nous atteignons déjà des vitesses interactives pour certaines applications. MachGen génère une vidéo Vidu Q3 Turbo de cinq secondes en 720p en environ six secondes et en 540p en moins de trois. C’est suffisamment rapide pour une itération créative rapide et rend les avatars réactifs et la vidéo interactive accessibles.
Un exemple de ce que je considère comme interactif. Imaginez que vous regardez une histoire, que vous voyez où la fin se dirige, et que cela ne vous plaît pas. Au lieu de rester passif, vous la redirigez : ces deux personnages devraient découvrir ce que le troisième cache et le confronter plutôt que de le laisser se dérouler. Un contenu que vous pilotez plutôt que de recevoir. C’est ce que rend possible une génération rapide et bon marché, et cela change presque tout ce que nous consommons.
Atteindre cet objectif nécessite généralement plus d’un benchmark de latence solide. L’ensemble de l’expérience doit rester réactif sous le trafic de production tout en conservant la qualité visuelle, la cohérence image à image et un coût prévisible. Des vidéos plus longues, des résolutions plus élevées et des requêtes simultanées augmentent toutes la charge d’infrastructure, et le système doit encore provisionner la capacité, acheminer les requêtes et se remettre des pannes matérielles sans que l’utilisateur ne le remarque.
Cela arrivera cas par cas. Les clips courts, les avatars, les jeux et les outils créatifs seront probablement les premiers, car une génération mesurée en secondes suffit déjà pour eux. À mesure que la qualité des modèles et les performances d’inférence s’améliorent conjointement, davantage d’applications franchiront ce seuil.
À mesure que les agents IA génèrent de plus en plus d’images et de vidéos de façon autonome, sans attendre qu’un humain appuie sur un bouton, comment cela modifie‑t‑il les exigences d’infrastructure ? Les charges de travail pilotées par des agents créent‑elles des besoins fondamentalement différents en termes de latence, de concurrence, de coût et de fiabilité ?
Un agent transforme une requête utilisateur unique en des dizaines ou des centaines de tâches de génération. Il crée plusieurs options, les évalue, révise l’invite et répète le processus, sans intervention humaine entre les étapes.
Cela rend la latence, la concurrence, le coût et la fiabilité beaucoup plus importants. Si chaque génération prend des minutes, le flux de travail de l’agent est trop lent pour être utile. Si chaque tentative est coûteuse, l’itération autonome devient économiquement impraticable. Le système doit également gérer de nombreuses requêtes simultanées de façon fiable, car une seule défaillance peut interrompre toute la chaîne de travail.
C’est ici que des capacités telles que la provision de GPU, l’autoscaling et le routage comptent autant que l’optimisation au niveau du modèle. La demande d’un agent est bien plus ponctuelle que celle d’une application créative où une personne clique sur un bouton.
L’unité de travail pertinente n’est plus une image ou une vidéo isolée. C’est la boucle complète de génération, d’évaluation et de raffinement du contenu. L’infrastructure doit rendre cette boucle entière rapide, abordable et fiable.
Il existe une concurrence intense entre les fournisseurs de GPU, les clouds d’inférence, les développeurs de modèles et les plateformes d’optimisation. À mesure que le matériel devient plus rapide, pourquoi les entreprises auraient‑elles encore besoin d’une couche d’inférence spécialisée comme MachGen plutôt que de compter sur les améliorations de NVIDIA, AMD, des fournisseurs de cloud ou des développeurs de modèles eux‑mêmes ?
Un matériel plus rapide élève le plafond. Le logiciel détermine quelle part de ce plafond sera atteinte.
Nous l’avons observé avec les LLM. De nouveaux accélérateurs ont amélioré les performances brutes à chaque génération, et le batch continu, la gestion du KV‑cache, le décodage spéculatif et les noyaux spécialisés étaient toujours ce qui a permis à l’industrie d’atteindre un débit et une rentabilité de niveau production. Aucun de ces éléments ne provenait du matériel.
Optimiser en continu le chemin de production complet pour la génération d’images et de vidéos est un travail différent de celui des fournisseurs de matériel, des fournisseurs de cloud et des développeurs de modèles, et ce n’est pas une priorité centrale pour aucun d’entre eux.
Il existe plusieurs approches pour ce travail. L’une d’elles est le modèle de place de marché, où les modèles sont agrégés et les requêtes routées. Nous ne pensons pas que cela soit viable à long terme, car il n’y a aucun contrôle sur la couche où réside la performance. Nous avons choisi de construire nous‑mêmes la pile et de l’héberger nativement, ce qui est la seule façon d’atteindre les chiffres de latence et de coût que nous observons.
Cela signifie régler l’attention, la mise en cache, les noyaux, la précision, la mémoire et le parallélisme par modèle et par accélérateur, ainsi que prendre en charge les API gérées, le cloud dédié et le déploiement auto‑hébergé. À mesure que le nombre de modèles et d’options matérielles augmente, la complexité augmente également. Notre rôle est d’absorber cela afin que nos clients puissent consacrer leur temps à ce qui différencie leurs produits.
Vous avez décrit les modèles de monde comme faisant partie de la vision à long terme de MachGen, dont de nombreuses caractéristiques computationnelles ressemblent à des charges de travail de diffusion. À quoi doit ressembler l’infrastructure nécessaire aux modèles de monde à l’échelle de la production, et quelles applications deviennent possibles si la génération et la simulation d’environnements visuels finissent par être aussi peu coûteuses et réactives que la génération de texte aujourd’hui ?
Une façon de concevoir notre plateforme est de la comparer à un LLM à usage général. Le même modèle rédige un contrat juridique et répond à une question sur les restaurants. Pour nous, la même pile sert les entreprises d’avatars vidéo, la publicité IA, la génération d’histoires et de microdrames, et, à terme, les modèles de monde. Différents secteurs, un même ensemble de problèmes de performance sous-jacents.
Les modèles de monde ne constituent pas notre cœur de métier aujourd’hui, mais ils représentent ce vers quoi nous nous dirigeons, et nous travaillons activement dessus. Les modèles de monde à l’échelle de la production nécessiteront un débit très élevé et une latence très faible, car ils génèrent et mettent à jour en continu un environnement plutôt que de produire une sortie unique. Ils doivent également garantir une cohérence spatiale et temporelle, la capacité de répondre aux actions, et souvent la capacité de simuler simultanément plusieurs résultats possibles. Cela engendre des problèmes difficiles en matière de mémoire, de déplacement de données, de parallélisme et de fiabilité. Un modèle de monde pilotant un robot ou un jeu ne peut pas prendre plusieurs minutes pour produire l’état suivant. La performance détermine si ces systèmes sont utilisables ou non.
Sur le plan computationnel, les modèles de monde d’aujourd’hui ressemblent beaucoup aux modèles de diffusion, de sorte que la pile que nous construisons actuellement constitue la base naturelle. Il n’existe pas encore de couche de service mature de niveau production pour eux, comparable à ce qui existe pour les LLM. Nous avons l’intention de la créer.
Si la simulation devient aussi réactive et abordable que la génération de texte aujourd’hui, les robots pourront s’entraîner à des situations rares avant de les rencontrer, les jeux pourront générer des environnements qui répondent aux joueurs individuels, et les concepteurs pourront tester des dizaines de possibilités avant de les réaliser dans le monde physique. La diffusion est aujourd’hui notre source de revenus. Les modèles de monde sont notre étoile polaire.
Merci pour cette excellente interview, les lecteurs qui souhaitent en savoir plus devraient visiter MachGen AI.












