Interviews
Kismat Singh, mede-oprichter en CEO van MachGen AI – Interviewreeks

Kismat Singh, mede-oprichter en CEO van MachGen AI, is een executive op het gebied van AI‑infrastructuur en engineering met meer dan twee decennia ervaring in het bouwen van high‑performance computing‑ en machine‑learning‑systemen. Voor hij MachGen AI mede‑stichtte, was Singh VP Engineering voor AI‑Frameworks bij Intel en bekleedde eerder senior engineering‑functies bij NVIDIA, AMD, HP en andere technologiebedrijven. Zijn werk omvatte bijdragen aan deep‑learning‑bibliotheken en -compilers, optimalisatie van AI‑frameworks en verbeteringen aan de veerkracht van hyperschaal‑training. Bij Intel was hij nauw betrokken bij de PyTorch‑initiatieven van het bedrijf en sprak hij publiekelijk over het toegankelijker maken van AI‑frameworks voor verschillende hardwareplatformen.
MachGen AI is een AI‑infrastructuurbedrijf dat zich richt op het drastisch sneller en goedkoper laten draaien van generatieve beeld‑ en videomodellen. Opgericht door Kismat Singh en Manoj Krishnan, ontwikkelt het bedrijf een high‑performance inference‑ en fine‑tuning‑stack die specifiek is ontworpen voor diffusie‑modellen, in plaats van infrastructuur die oorspronkelijk voor grote taalmodellen (LLM’s) is gebouwd. MachGen optimaliseert onder meer aandachtberekening, caching, GPU‑kernels, geheugenbeheer, parallelisme, planning en implementatie om de generatie‑latentie te verlagen terwijl de modelkwaliteit behouden blijft. Het platform biedt API’s voor tekst‑naar‑beeld, beeld‑naar‑beeld, tekst‑naar‑video, beeld‑naar‑video en referentie‑naar‑video generatie, met de onderliggende technologie gericht op low‑latency‑toepassingen zoals interactieve contentcreatie, realtime‑avatars, gaming en gepersonaliseerde reclame.
U heeft meer dan twee decennia gewerkt aan video, GPU‑computing en AI‑prestaties, waaronder TensorRT bij NVIDIA, AI‑software bij Intel, GPU‑optimalisatie bij AMD en eerder werk aan realtime video‑codering. Wat zag u gedurende die jaren dat u uiteindelijk overtuigde om grote technologiebedrijven te verlaten en MachGen mede‑op te richten, en waarom geloofde u dat diffusie‑inference het infrastructuurprobleem was dat de moeite waard was om er een bedrijf omheen te bouwen?
Mijn mede‑oprichter Manoj en ik speelden bijna 10 jaar badminton in dezelfde sportschool. Gedurende het grootste deel van die tijd probeerden we elkaar aan te nemen. Uiteindelijk besloten we dat het makkelijker was om met elkaar samen te werken dan om elkaar steeds weer te blijven rekruteren.
De reden dat we dit probleem hebben gekozen, is dat we beiden hebben gezien hoe een inference‑stack van binnenuit is geëvolueerd. Ik hielp het inference‑platformteam van NVIDIA op te bouwen en leidde daarna AI‑software bij Intel. Manoj bouwde de training‑infrastructuur voor grote modellen achter PyTorch bij Meta. We zagen hoe jarenlange inspanningen op het gebied van caching, batching, scheduling en kernels vroege LLM‑onderzoeksystemen omvormden tot productie‑infrastructuur die triljoenen tokens verwerkt.
Diffusie bevindt zich ongeveer op het niveau waar LLM‑inference drie jaar geleden stond. Beeld‑ en videomodellen zijn snel geëvolueerd, maar de systemen die ze bedienen blijven traag, duur en moeilijk schaalbaar. De meeste bestaande infrastructuur is ontworpen voor LLM’s, waarbij diffusie later is toegevoegd.
Drie zaken maakten het moment geschikt: de modellen werden goed genoeg om echte producten op te bouwen, het probleem vereiste precies de vaardigheden die wij gedurende onze carrières hebben ontwikkeld, en de impact is groot genoeg om er een generatie‑bedrijf omheen te bouwen. Wanneer een video die vroeger enkele minuten kostte nu in enkele seconden kan worden gegenereerd tegen een fractie van de kosten, worden interactieve generatie, gepersonaliseerde reclame, realtime‑avatars en volledig nieuwe creatieve producten mogelijk.
MachGen stelt dat veel van de technieken die de inference van grote taalmodellen hebben getransformeerd, niet zonder problemen overgaan op diffusie‑modellen. Wat is er fundamenteel anders aan het bedienen van beeld‑ en videomodellen, en waar liggen de grootste prestatie‑knelpunten die conventionele AI‑infrastructuur over het hoofd ziet?
LLM’s en diffusie‑modellen hebben fundamenteel verschillende computationele patronen. LLM’s zijn autoregressief, met een compute‑intensieve prefill gevolgd door een geheugen‑gebonden token‑voor‑token decode. Technieken zoals KV‑caching en prefill/decode‑disaggregatie zijn ontworpen rond die structuur.
Diffusie‑modellen zijn niet‑autoregressief en blijven gedurende het denoising‑proces compute‑gebonden. Videogeneratie omvat bovendien grote hoeveelheden ruimtelijke en temporele data, wat andere eisen stelt aan aandacht, geheugen, communicatie en parallelisme.
Als gevolg hiervan gaan veel van de optimalisaties die voor LLM’s zijn ontwikkeld, niet zonder problemen over. Conventionele KV‑caching lost niet hetzelfde probleem op, standaard parallelisme kan aanzienlijke communicatie‑overhead introduceren, en de beschikbare open‑source‑kernels zijn veel minder volwassen. De scheduler, het geheugenmodel, de caching‑strategie, de kernels en het parallelisme moeten allemaal rondom diffusie zelf worden ontworpen. Daarom hebben we MachGen gebouwd met diffusie als een first‑class‑component.
MachGen meldt ongeveer 4–6 × lagere latentie op sommige beeldmodellen en rond de 6 × verbeteringen op verschillende videomodellen terwijl de originele, niet‑gedistilleerde modellen worden uitgevoerd. Wat zijn de belangrijkste technische doorbraken achter die winst, en hoe zorgt u ervoor dat prestatie‑verbeteringen niet ten koste gaan van de output‑kwaliteit?
De winst komt voort uit verschillende delen van de stack die samenwerken. Aandacht domineert het rekencapaciteitsbudget in veel videomodellen, dus richten we ons op recepten met lagere precisie, sparse attention en gerelateerde technieken. We hebben ook caching‑methoden ontwikkeld die ruimtelijke en temporele redundantie benutten, sterk geoptimaliseerde kernels voor diffusie‑architecturen, en parallelisme‑technieken die de communicatie‑overhead verminderen.
Samen stellen die verbeteringen MachGen in staat om HiDream in één seconde te leveren in plaats van zes seconden en Flux in 1,5 seconde in plaats van 6,2 seconde. Voor video draait Wan 2.2 in 16,5 seconde versus 98 seconde, terwijl LTX 2.3 in 10,7 seconde versus 67 seconde draait. De inferentiekosten zijn ook 2–4 x lager voor beeldmodellen en 2–3 x lager voor video.
Deze resultaten gebruiken de originele, niet‑gedistilleerde modellen. We verbeteren hoe de modellen draaien zonder concessies te doen aan de output‑kwaliteit. Voor productie‑adoptie moeten snelheid, kosten en kwaliteit allemaal samen werken.
Trusted TV is een interessant voorbeeld omdat het verkorten van generatie van minuten naar seconden meer verandert dan alleen de infrastructuurkosten. Zodra videogeneratie snel genoeg is om duizenden campagnes en gepersonaliseerde creatieve varianten te produceren, welke nieuwe bedrijfsmodellen of productervaringen worden dan mogelijk die voorheen simpelweg niet haalbaar waren?
TrustedTV helpt bedrijven om uitzendingsklaar reclamespots met AI te maken en deze te plaatsen op verbonden TV‑platformen zoals Prime Video, Roku en DirecTV. Veel van haar klanten zijn kleine bedrijven. Het traditioneel maken van een tv‑commercial betekende een film‑ en montagecrew, met kosten die al bij enkele duizenden dollars beginnen en doorgaans oplopen tot tienduizenden dollars. Trusted TV brengt dat naar nul. Een kleine ondernemer kan een volledige commercial vanaf een smartphone in ongeveer vijf minuten maken en deze bekijken voordat hij iets betaalt. Meer dan 10.000 campagnes zijn op het platform gecreëerd.
Ian, CEO van Trusted TV, zag de latency‑benchmark van MachGen op Artificial Analysis en geloofde het niet. Hij schreef zich in om het zelf te testen. Zijn eerste render kwam terug na ongeveer 25 seconden zonder kwaliteitsverlies, en toen hij concurrency‑tests uitvoerde, hielden de verbeteringen stand op schaal. Ze verplaatsten hun volledige productie‑workflow naar MachGen in minder dan 48 uur, en MachGen levert nu al hun nieuwe videoproductie. In de nieuwste uitrol zitten we dichter bij 10 of 11 seconden voor dat model, en we blijven het verbeteren.
Het producteffect is dat adverteerders stoppen met het maken van één of twee algemene commercials. Hun gebruikers roteren twee of drie nieuwe advertenties per week, testen creatieve varianten over verschillende doelgroepsegmenten en itereren in plaats van zich vast te leggen. Wat hierna volgt, is personalisatie op geografisch en doelgroep‑niveau op schaal, iets wat voorheen alleen mogelijk was voor bedrijven met budgetten van meerdere miljoenen dollars.
Een versie waar ik persoonlijk aan denk: Vandaag krijg ik een sneaker‑advertentie te zien die is gefilmd op een straat in Manhattan. Ik woon in de Bay Area, dus betekent dat niets voor mij. Wat ik wil, is dezelfde advertentie met Mission Peak op de achtergrond. Dat is geen goedkopere commercial; het is een andere vorm van adverteren, en het wordt pas economisch haalbaar wanneer generatie snel en goedkoop genoeg is om duizenden varianten te maken.
Voor bedrijven die beeld‑ of videogeneratie direct in hun producten integreren, hoe moeten ze nadenken over de economie van inferentie? Bij welke schaal wordt het optimaliseren van GPU‑gebruik strategisch belangrijk in plaats van simpelweg een API‑provider per generatie te betalen?
Het keerpunt komt wanneer inferentie begint invloed te hebben op de klantervaring of de marges van het bedrijf.
Een algemene API kan zinvol zijn terwijl een team een product valideert. Zodra generatie centraal wordt in dat product, moeten teams verder kijken dan de vermelde prijs per output. Latentie, gelijktijdigheid, kwaliteit, betrouwbaarheid en GPU‑gebruik worden allemaal onderdeel van de economie.
Een generatie kan goedkoop lijken, maar het blijft een zakelijk probleem veroorzaken als gebruikers meerdere minuten moeten wachten en de workflow verlaten. Een architectuur die GPU‑capaciteit laat groeien in hetzelfde tempo als het gebruik, zal ook steeds meer druk op de marges uitoefenen.
Er is geen enkele drempel voor het aantal verzoeken, omdat de rekencapaciteit die nodig is voor een korte clip van 540 p sterk verschilt van een langere video van 1080 p. Optimalisatie wordt strategisch wanneer groeiend gebruik de kosten bijna evenredig laat stijgen, piekvraag queues veroorzaakt, of latentie de productervaring begint te beperken.
MachGen werkt over verschillende lagen, waaronder aangepaste GPU‑kernels, caching, precisie‑optimalisatie, planning en parallelisme. Naarmate modellen zich snel blijven ontwikkelen, welke laag van de inferentie‑stack biedt volgens jou de grootste resterende kans op dramatische verbeteringen in snelheid en kosten?
Voor videogeneratie vertegenwoordigt aandacht een van de grootste resterende kansen, omdat het het rekencapaciteitsbudget in veel modellen domineert. Er is nog aanzienlijke ruimte om recepten met lagere precisie, sparse attention en diffusie‑specifieke attention‑kernels te verbeteren.
Aandacht is slechts een deel van de kans. De grootste algehele winst zal komen door verbeteringen over de hele stack te combineren. Caching is een voorbeeld. De KV‑caching‑technieken die in LLM’s worden gebruikt, zijn niet direct overdraagbaar, maar diffusie‑modellen bevatten ruimtelijke en temporele redundantie die met de juiste aanpak kan worden benut.
Parallelisme biedt een nieuwe kans. Het toevoegen van GPU’s levert niet automatisch een evenredige snelheidswinst op, omdat communicatielast de voordelen kan compenseren. Wij ontwikkelen op maat gemaakte kernels die communicatie overlappen met data‑onafhankelijke berekeningen en deze in een pijplijn plaatsen met data‑afhankelijke taken.
Attention, caching, kernels, parallelisme, geheugen en planning beïnvloeden elkaar allemaal. Het optimaliseren van slechts één laag leidt uiteindelijk tot een knelpunt ergens anders. De grootste verbeteringen komen voort uit het behandelen van de stack als een volledig systeem dat is ontworpen voor het computationele profiel van diffusion.
Nu nieuwere videomodellen de generatie‑tijden dichter bij realtime brengen, hoe dicht zijn we bij echt interactieve generatieve video, en welke technische barrières moeten nog worden overwonnen voordat realtime videogeneratie alledaags wordt?
We bereiken al interactieve snelheden voor bepaalde toepassingen. MachGen genereert een vijfseconden durende Vidu Q3 Turbo‑video in 720p in ongeveer zes seconden en in 540p in minder dan drie seconden. Dat is snel genoeg voor snelle creatieve iteratie en brengt responsieve avatars en interactieve video binnen handbereik.
Een voorbeeld van wat ik onder interactief verstaat. Stel je voor dat je een verhaal bekijkt en je kunt zien hoe het einde zich ontwikkelt, en je vindt het niet leuk. In plaats van passief toe te kijken, stuur je het bij: die twee personages moeten ontdekken wat de derde verbergt en hem confronteren in plaats van het verhaal gewoon te laten verlopen. Inhoud die je stuurt in plaats van inhoud die je ontvangt. Dat is wat snelle, goedkope generatie mogelijk maakt, en het verandert bijna alles wat we consumeren.
Om dat te bereiken is meestal meer dan één sterke latentie‑benchmark nodig. De volledige ervaring moet responsief blijven onder productieverkeer, terwijl visuele kwaliteit, frame‑voor‑frame consistentie en voorspelbare kosten behouden blijven. Langere video’s, hogere resoluties en gelijktijdige verzoeken verhogen de infrastructuurlast, en het systeem moet nog steeds capaciteit voorzien, verzoeken routeren en herstellen van hardware‑storingen zonder dat de gebruiker het merkt.
Het zal per use‑case arriveren. Korte clips, avatars, games en creatieve tools zullen waarschijnlijk als eerste komen, omdat generatie in seconden al voldoende is voor hen. Naarmate modelkwaliteit en inferentie‑prestaties samen verbeteren, zullen meer toepassingen die drempel overschrijden.
Naarmate AI‑agents steeds vaker afbeeldingen en video’s autonoom genereren in plaats van te wachten tot een mens op een knop drukt, hoe verandert dat dan de infrastructuurvereisten? Creëren agent‑gedreven workloads fundamenteel andere eisen op het gebied van latentie, gelijktijdigheid, kosten en betrouwbaarheid?
Een agent zet één gebruikersverzoek om in tientallen of zelfs honderden generatie‑taken. Hij maakt verschillende opties, evalueert ze, past de prompt aan en herhaalt het proces, zonder menselijke tussenkomst tussen de stappen.
Dat maakt latentie, gelijktijdigheid, kosten en betrouwbaarheid veel belangrijker. Als elke generatie minuten duurt, is de workflow van de agent te traag om bruikbaar te zijn. Als elke poging duur is, wordt autonome iteratie economisch onpraktisch. Het systeem moet bovendien veel gelijktijdige verzoeken betrouwbaar afhandelen, omdat één fout de hele keten van werk kan onderbreken.
Hier komen mogelijkheden zoals GPU‑provisioning, autoscaling en routing net zo belangrijk als optimalisatie op modelniveau. De vraag van agents is veel piekeriger dan de vraag van een creatieve applicatie waarbij een persoon op een knop klikt.
De relevante werkeenheid is niet langer één enkele afbeelding of video. Het is de volledige cyclus van genereren, evalueren en verfijnen van content. De infrastructuur moet die hele cyclus snel, betaalbaar en betrouwbaar maken.
Er is hevige concurrentie tussen GPU‑leveranciers, inference‑clouds, modelontwikkelaars en optimalisatieplatformen. Naarmate de hardware zelf sneller wordt, waarom hebben bedrijven dan nog een gespecialiseerde inference‑laag zoals MachGen nodig in plaats van te vertrouwen op verbeteringen van NVIDIA, AMD, cloud‑providers of de modelontwikkelaars zelf?
Snellere hardware verhoogt het plafond. Software bepaalt hoeveel van dat plafond wordt bereikt.
We hebben dit gezien bij LLM’s. Nieuwe accelerators verbeterden de ruwe prestaties elke generatie, en continue batching, KV‑cache‑beheer, speculatief decoderen en gespecialiseerde kernels waren nog steeds wat de industrie naar productieniveau‑doorvoer en -economie bracht. Niets daarvan kwam van de hardware.
Het continu optimaliseren van het volledige productiepad voor beeld‑ en videogeneratie is een andere taak dan wat hardware‑leveranciers, cloud‑providers en modelontwikkelaars doen, en het is geen kernprioriteit voor een van hen.
Er zijn enkele benaderingen voor die taak. Eén is het marktplaatsmodel, waarbij modellen worden geaggregeerd en verzoeken worden gerouteerd. Wij denken dat dit op de lange termijn niet houdbaar is, omdat er geen controle is over de laag waar de prestaties zich bevinden. We hebben ervoor gekozen de stack zelf te bouwen en native te hosten, wat de enige manier is om de latentie‑ en kostencijfers die we zien te bereiken.
Dat betekent het afstemmen van aandacht, caching, kernels, precisie, geheugen en parallelisme per model en per accelerator, en het ondersteunen van beheerde API’s, dedicated cloud en zelfgehoste implementatie. Naarmate het aantal modellen en hardware‑opties toeneemt, neemt ook de complexiteit toe. Onze rol is het absorberen hiervan zodat onze klanten hun tijd kunnen besteden aan wat hun producten onderscheidt.
U heeft wereldmodellen beschreven als onderdeel van de langetermijnvisie van MachGen, waarbij veel van hun computationele kenmerken lijken op diffusion‑workloads. Hoe moet de infrastructuur voor wereldmodellen op productieschaal eruitzien, en welke toepassingen worden mogelijk als het genereren en simuleren van visuele omgevingen uiteindelijk net zo goedkoop en responsief wordt als het genereren van tekst vandaag de dag?
Een manier om over ons platform na te denken is vergelijkbaar met een algemene LLM. Hetzelfde model stelt een juridisch contract op en beantwoordt een vraag over restaurants. Voor ons bedient dezelfde stack videopersonage‑bedrijven, AI‑reclame, verhaal‑ en microdrama‑generatie, en uiteindelijk wereldmodellen. Verschillende verticale markten, één set onderliggende prestatieproblemen.
Wereldmodellen zijn vandaag niet ons kernproduct, maar ze zijn waar we naartoe bouwen, en we werken er actief aan. Wereldmodellen op productieschaal hebben een zeer hoge doorvoer en een zeer lage latentie nodig, omdat ze continu een omgeving genereren en bijwerken in plaats van één enkele output te produceren. Ze moeten bovendien ruimtelijke en temporele consistentie hebben, de mogelijkheid om op acties te reageren, en vaak de mogelijkheid om meerdere mogelijke uitkomsten gelijktijdig te simuleren. Dat veroorzaakt moeilijke problemen op het gebied van geheugen, dataverplaatsing, parallelisme en betrouwbaarheid. Een wereldmodel dat een robot of een spel aanstuurt, kan niet minuten nodig hebben om de volgende staat te produceren. Prestaties bepalen of deze systemen überhaupt bruikbaar zijn.
Computational gezien lijken de huidige wereldmodellen sterk op diffusion‑modellen, dus de stack die we nu bouwen is de natuurlijke basis. Er bestaat nog geen volwassen productie‑grade serving‑laag voor hen, vergelijkbaar met wat er bestaat voor LLM’s. Wij zijn van plan die te bouwen.
Als simulatie net zo responsief en betaalbaar wordt als tekstgeneratie nu is, kunnen robots zeldzame situaties oefenen voordat ze ze tegenkomen, games omgevingen genereren die reageren op individuele spelers, en ontwerpers tientallen mogelijkheden testen voordat ze in de fysieke wereld bouwen. Diffusion is waar we vandaag ons brood verdienen. Wereldmodellen zijn onze North Star.
Bedankt voor het geweldige interview, lezers die meer willen weten, kunnen MachGen AI bezoeken.












