Interviews
Kismat Singh, medstifter og administrerende direktør for MachGen AI – Interviewserie

Kismat Singh, medstifter og administrerende direktør for MachGen AI, er en leder inden for AI‑infrastruktur og -engineering med mere end to årtiers erfaring med at bygge højtydende computer‑ og maskinlæringssystemer. Før han medstiftede MachGen AI, tjente Singh som VP for Engineering for AI Frameworks hos Intel og har tidligere haft senior‑ingeniørstillinger hos NVIDIA, AMD, HP og andre teknologivirksomheder. Hans arbejde har omfattet bidrag til dyb‑læringsbiblioteker og kompilatorer, optimering af AI‑rammeværk og forbedringer af hyperskala‑træningsrobusthed. Hos Intel var han tæt involveret i virksomhedens PyTorch‑initiativer og talte offentligt om at gøre AI‑rammeværk mere tilgængelige på tværs af forskellige hardwareplatforme.
MachGen AI er et AI‑infrastruktur‑firma, der fokuserer på at gøre generative billed‑ og videomodeller dramatisk hurtigere og mere omkostningseffektive at køre. Grundlagt af Kismat Singh og Manoj Krishnan, udvikler virksomheden en højtydende inferens‑ og finjusterings‑stack, der er specifikt designet til diffusionsmodeller i stedet for at tilpasse infrastruktur, der oprindeligt blev bygget til store sprogmodeller. MachGen optimerer områder som attention‑beregning, caching, GPU‑kerner, hukommelsesstyring, parallelisme, planlægning og implementering for at reducere genereringslatens, samtidig med at modelkvaliteten bevares. Platformen tilbyder API’er til tekst‑til‑billede, billede‑til‑billede, tekst‑til‑video, billede‑til‑video og reference‑til‑video‑generering, med den underliggende teknologi rettet mod lav‑latens‑applikationer såsom interaktivt indholds‑skabelse, realtids‑avatars, gaming og personlig reklame.
Du har brugt mere end to årtier på video, GPU‑beregning og AI‑ydelse, herunder TensorRT hos NVIDIA, AI‑software hos Intel, GPU‑optimering hos AMD og tidligere arbejde med realtids‑video‑kodning. Hvad så du i løbet af de år, der i sidste ende overbeviste dig om at forlade store teknologivirksomheder og medstifte MachGen, og hvorfor mente du, at diffusion‑inferens var det infrastrukturproblem, der var værd at bygge en virksomhed omkring?
Min medstifter Manoj og jeg spillede badminton i det samme fitnesscenter i næsten 10 år. I størstedelen af den tid forsøgte vi at ansætte den anden. Til sidst besluttede vi, at det var lettere at arbejde sammen end at fortsætte med at rekruttere hinanden.
Årsagen til, at vi valgte dette problem, er, at vi begge har set en inferens‑stack modne indefra. Jeg hjalp med at opbygge NVIDIA’s inferens‑platformteam og ledte derefter AI‑software hos Intel. Manoj byggede den store‑model‑træningsinfrastruktur bag PyTorch hos Meta. Vi har set års arbejde med caching, batching, planlægning og kerner forvandle tidlige LLM‑forskningssystemer til produktionsinfrastruktur, der betjener billioner af tokens.
Diffusion er omtrent på det niveau, hvor LLM‑inferens var for tre år siden. Billed‑ og videomodeller har udviklet sig hurtigt, men systemerne, der betjener dem, forbliver langsomme, dyre og svære at skalere. De fleste eksisterende infrastrukturer blev designet til LLM‑modeller, med diffusion tilføjet senere.
Tre faktorer gjorde timingen rigtig: modellerne blev gode nok til at bygge rigtige produkter på, problemet krævede præcis de færdigheder, vi har brugt vores karriere på at udvikle, og påvirkningen er stor nok til at bygge en generationel virksomhed omkring. Når en video, der engang tog flere minutter at generere, kan laves på sekunder til en brøkdel af omkostningerne, bliver interaktiv generering, personlig reklame, realtids‑avatars og helt nye kreative produkter mulige.
MachGen hævder, at mange af de teknikker, der transformerede inferens af store sprogmodeller, ikke overføres gnidningsløst til diffusionsmodeller. Hvad er grundlæggende anderledes ved at betjene billed‑ og videomodeller, og hvor er de største præstationsflaskehalse, som konventionel AI‑infrastruktur typisk overser?
LLM‑modeller og diffusionsmodeller har grundlæggende forskellige beregningsmønstre. LLM‑modeller er autoregressive, med en beregningsintensiv prefill efterfulgt af en hukommelses‑begrænset token‑for‑token‑dekodning. Teknikker som KV‑caching og disaggregation af prefill/decoding blev designet omkring denne struktur.
Diffusionsmodeller er ikke‑autoregressive og forbliver beregnings‑tunge gennem hele denoise‑processen. Videogenerering involverer også store mængder rumlige og tidsmæssige data, hvilket skaber forskellige krav til attention, hukommelse, kommunikation og parallelisme.
Som følge heraf overføres mange af de optimeringer, der er udviklet til LLM‑modeller, ikke gnidningsløst. Traditionel KV‑caching løser ikke det samme problem, standard‑parallelisme kan introducere betydelig kommunikations‑overhead, og de tilgængelige open‑source‑kerner er langt mindre modne. Scheduler‑en, hukommelsesmodellen, caching‑strategien, kernerne og parallelismen skal alle designes omkring diffusionen selv. Det er derfor, vi har bygget MachGen med diffusion som en førsteklasses komponent.
MachGen rapporterer cirka 4–6‑gange lavere latens på nogle billedmodeller og omkring 6‑gange forbedringer på flere videomodeller, mens de kører de originale, udvaskede modeller. Hvad er de vigtigste tekniske gennembrud bag disse gevinster, og hvordan sikrer du, at præstationsforbedringer ikke går på bekostning af output‑kvaliteten?
Gevinsterne kommer fra flere dele af stakken, der arbejder sammen. Opmærksomhed dominerer beregningsbudgettet i mange videomodeller, så vi fokuserer på lavpræcisionsopskrifter, sparsom opmærksomhed og relaterede teknikker. Vi har også udviklet cachemetoder, der udnytter rumlig og tidsmæssig redundans, stærkt optimerede kerner til diffusionsarkitekturer og parallelle teknikker, der reducerer kommunikationsoverhead.
Sammen gør disse forbedringer det muligt for MachGen at levere HiDream på ét sekund i stedet for seks sekunder og Flux på 1,5 sekunder i stedet for 6,2 sekunder. For video kører Wan 2.2 på 16,5 sekunder i stedet for 98 sekunder, mens LTX 2.3 kører på 10,7 sekunder i stedet for 67 sekunder. Inferensomkostningerne er også 2–4 gange lavere for billedmodeller og 2–3 gange lavere for video.
Disse resultater bruger de originale, ikke-destillerede modeller. Vi forbedrer, hvordan modellerne kører uden at gå på kompromis med outputkvaliteten. For produktionsadoption skal hastighed, omkostninger og kvalitet alle fungere sammen.
Trusted TV er et interessant eksempel, fordi reduktion af generering fra minutter til sekunder ændrer mere end infrastrukturregningen. Når videogenerering bliver hurtig nok til at producere tusindvis af kampagner og personlige kreative varianter, hvilke nye forretningsmodeller eller produktoplevelser bliver så mulige, som simpelthen ikke var levedygtige før?
TrustedTV hjælper virksomheder med at skabe broadcast-klare reklamer med AI og placere dem på tilsluttede TV-platforme som Prime Video, Roku og DirecTV. Mange af deres kunder er små virksomheder. At lave en TV-reklame på traditionel vis krævede et film- og redigeringsteam, med omkostninger der starter i tusinder og typisk løber op i titusinder af dollars. Trusted TV bringer det ned til nul. En lille virksomhedsejer kan skabe en fuld reklame fra en smartphone på omkring fem minutter og se den, før der betales noget. Mere end 10.000 kampagner er blevet oprettet på platformen.
Ian, Trusted TVs administrerende direktør, så MachGens latenstest på Artificial Analysis og troede det ikke. Han tilmeldte sig for at teste det selv. Hans første rendering kom tilbage efter omkring 25 sekunder uden tab af kvalitet, og da han kørte samtidighedstests, holdt forbedringerne stand i skala. De flyttede hele deres produktionsworkflow til MachGen på under 48 timer, og MachGen driver nu al deres nye videoproduktion. I den seneste implementering er vi tættere på 10 eller 11 sekunder på den model, og vi vil fortsætte med at forbedre den.
Produktets virkning er, at annoncører stopper med at lave én eller to generelle reklamer. Deres brugere roterer to eller tre nye annoncer hver uge, tester kreativitet på tværs af forskellige målgruppesegmenter og itererer i stedet for at forpligte sig. Det næste skridt er geografisk og målgruppebaseret personalisering i stor skala, hvilket tidligere kun var forbeholdt virksomheder med budgetter på flere millioner dollars.
En version jeg tænker på personligt: I dag får jeg en sneaker-reklame optaget på en gade i Manhattan. Jeg bor i Bay Area, så den betyder ingenting for mig. Det, jeg ønsker, er den samme reklame med Mission Peak i baggrunden. Det er ikke en billigere reklame; det er en anden form for annoncering, og den bliver kun økonomisk levedygtig, når generering er hurtig og billig nok til at lave tusindvis af varianter.
For virksomheder, der indlejrer billed- eller videogenerering direkte i produkter, hvordan skal de tænke på inferensekonomi? Ved hvilken skala bliver optimering af GPU-udnyttelse strategisk vigtig frem for blot at betale en API-udbyder for hver generering?
Vendepunktet opstår, når inferens begynder at påvirke enten kundeoplevelsen eller virksomhedens marginer.
Et generelt API kan give mening, mens et team validerer et produkt. Når generering bliver central for det produkt, skal teams se ud over den angivne pris pr. output. Latens, samtidighed, kvalitet, pålidelighed og GPU-udnyttelse bliver alle en del af økonomien.
En generering kan synes billig, men den skaber stadig et forretningsproblem, hvis brugerne skal vente flere minutter og opgiver arbejdsprocessen. En arkitektur, der kræver, at GPU-kapaciteten vokser i samme tempo som brugen, vil også lægge stigende pres på marginerne.
Der er ingen enkelt grænse for anmodningsvolumen, fordi den beregning, der kræves for et kort 540p-klip, er meget anderledes end for en længere 1080p-video. Optimering bliver strategisk, når stigende brug får omkostningerne til at stige næsten i samme tempo, spidsbelastning skaber køer, eller latens begynder at begrænse produktoplevelsen.
MachGen fungerer på tværs af flere lag, herunder tilpassede GPU-kerner, caching, præcisionsoptimering, planlægning og parallelisme. Efterhånden som modellerne udvikler sig hurtigt, hvilket lag i inferensstakken mener du giver den største resterende mulighed for dramatiske forbedringer i hastighed og omkostninger?
For videogenerering udgør opmærksomhed en af de største resterende muligheder, fordi den dominerer beregningsbudgettet i mange modeller. Der er stadig betydeligt rum for at forbedre lavpræcisionsopskrifter, sparsom opmærksomhed og diffusionsspecifikke opmærksomhedskerne.
Opmærksomhed er kun en del af muligheden. De største samlede gevinster vil komme fra at kombinere forbedringer på tværs af stakken. Caching er et eksempel. KV-caching-teknikkerne, der bruges i LLM’er, overføres ikke direkte, men diffusionsmodeller indeholder rumlig og tidsmæssig redundans, som kan udnyttes med den rette tilgang.
Parallelisering giver en ny mulighed. At tilføje GPU’er giver ikke automatisk en proportional hastighedsforøgelse, fordi kommunikationsoverhead kan udligne gevinsten. Vi udvikler skræddersyede kerner, der overlapper kommunikation med data‑uafhængig beregning og pipeliner den med data‑afhængigt arbejde.
Opmærksomhed, caching, kerner, parallelisering, hukommelse og planlægning påvirker alle hinanden. Optimering af kun ét lag skaber efterhånden en flaskehals et andet sted. De største forbedringer vil komme ved at betragte stakken som et komplet system designet til diffusionens beregningsprofil.
Med nyere videomodeller, der presser genereringstiderne tættere på realtid, hvor tæt er vi på ægte interaktiv generativ video, og hvilke tekniske barrierer skal stadig overvindes, før realtidsvideogenerering bliver almindelig?
Vi når allerede interaktive hastigheder for visse anvendelser. MachGen genererer en femsekunders Vidu Q3 Turbo‑video i 720p på omkring seks sekunder og i 540p på under tre sekunder. Det er hurtigt nok til hurtig kreativ iteration og bringer responsive avatarer og interaktiv video inden for rækkevidde.
Et eksempel på, hvad jeg mener med interaktivt. Forestil dig, at du ser en historie, og du kan se, hvor slutningen er på vej hen, og du kan ikke lide den. I stedet for at sidde passivt, omdirigerer du den: de to karakterer skal finde ud af, hvad den tredje gemmer, og konfrontere ham i stedet for at lade det udfolde sig. Indhold, du styrer i stedet for indhold, du modtager. Det er, hvad hurtig, billig generering muliggør, og det ændrer næsten alt, vi forbruger.
At komme dertil kræver typisk mere end én solid latenstests. Hele oplevelsen skal forblive responsiv under produktionsbelastning, samtidig med at den bevarer visuel kvalitet, frame‑til‑frame‑konsistens og forudsigelige omkostninger. Længere videoer, højere opløsninger og samtidige forespørgsler øger alle infrastrukturbyrden, og systemet skal stadig provisionere kapacitet, routere forespørgsler og komme sig efter hardwarefejl uden at brugeren bemærker det.
Det vil ankomme case for case. Korte klip, avatarer, gaming og kreative værktøjer vil sandsynligvis være de første, fordi generering målt i sekunder allerede er tilstrækkelig for dem. Efterhånden som modelkvalitet og inferens‑performance forbedres samtidigt, vil flere anvendelser krydse den tærskel.
Efterhånden som AI‑agenter i stigende grad genererer billeder og videoer autonomt i stedet for at vente på, at et menneske trykker på en knap, hvordan ændrer det så infrastrukturkravene? Skaber agent‑drevne arbejdsbelastninger grundlæggende forskellige krav til latenstid, samtidighed, omkostninger og pålidelighed?
En agent omdanner en enkelt brugerforespørgsel til dusinvis eller hundredevis af genereringsopgaver. Den skaber flere muligheder, evaluerer dem, reviderer prompten og gentager processen uden menneskelig indblanding mellem trinnene.
Det gør latenstid, samtidighed, omkostninger og pålidelighed meget vigtigere. Hvis hver generering tager minutter, er agentens arbejdsflow for langsomt til at være nyttigt. Hvis hvert forsøg er dyrt, bliver autonom iteration økonomisk upraktisk. Systemet skal også kunne håndtere mange samtidige forespørgsler pålideligt, fordi én fejl kan afbryde hele arbejdskæden.
Her kommer funktioner som GPU‑provisionering, autoskalering og routing i spil i samme grad som model‑niveauoptimering. Agent‑efterspørgslen er langt mere spidsbelastet end efterspørgslen fra en kreativ applikation, hvor en person klikker på en knap.
Den relevante arbejdsenhed er ikke længere et enkelt billede eller en video. Det er den fulde løkke af generering, evaluering og forfinelse af indhold. Infrastruktur skal gøre denne komplette løkke hurtig, overkommelig og pålidelig.
Der er intens konkurrence mellem GPU‑udbydere, inferens‑clouds, modeludviklere og optimeringsplatforme. Efterhånden som hardwaren selv bliver hurtigere, hvorfor vil virksomheder stadig have brug for et specialiseret inferenslag som MachGen i stedet for at stole på forbedringer fra NVIDIA, AMD, cloud‑udbydere eller modeludviklerne selv?
Hurtigere hardware hæver loftet. Softwaren bestemmer, hvor meget af det loft der nås.
Vi har set dette udfolde sig med LLM’er. Nye acceleratorer forbedrede rå ydeevne i hver generation, og kontinuerlig batching, KV‑cache‑styring, spekulativ dekodning og specialiserede kerner var stadig det, der bragte branchen til produktions‑niveau gennemløb og økonomi. Intet af dette kom fra hardwaren.
Kontinuerlig optimering af den fulde produktionssti for billede‑ og videogenerering er et andet arbejde end det, hardware‑leverandører, cloud‑udbydere og modeludviklere laver, og det er ikke en kerneprioritet for nogen af dem.
Der er flere tilgange til dette arbejde. En er markedsplads‑modellen, hvor modeller samles og dirigerer forespørgsler. Vi mener ikke, at den er holdbar på lang sigt, fordi der ikke er kontrol over det lag, hvor ydeevnen ligger. Vi valgte at bygge stakken selv og hoste den native, hvilket er den eneste måde at opnå de latenstid‑ og omkostnings‑tal, vi ser,.
Det betyder, at vi finjusterer opmærksomhed, caching, kerner, præcision, hukommelse og parallelisme pr. model og pr. accelerator samt understøtter administrerede API’er, dedikeret cloud og selvhostet implementering. Efterhånden som antallet af modeller og hardware‑muligheder stiger, øges kompleksiteten også. Vores rolle er at absorbere dette, så vores kunder kan bruge deres tid på det, der differentierer deres produkter.
Du har beskrevet verdensmodeller som en del af MachGens langsigtede vision, hvor mange af deres beregningsmæssige egenskaber ligner diffusions‑arbejdsbelastninger. Hvordan skal infrastrukturen for produktions‑skala verdensmodeller se ud, og hvilke anvendelser bliver mulige, hvis generering og simulering af visuelle miljøer en dag bliver lige så billig og responsiv som tekstgenerering er i dag?
En måde at tænke på vores platform er, at den ligner en generel LLM. Den samme model udarbejder en juridisk aftale og besvarer et spørgsmål om restauranter. For os betjener den samme stack videokarakter‑virksomheder, AI‑reklame, historie‑ og mikrodrama‑generering og på sigt verdensmodeller. Forskellige brancher, men ét sæt underliggende præstationsproblemer.
Verdensmodeller er ikke vores kerneforretning i dag, men de er det, vi bygger hen imod, og vi arbejder aktivt på dem. Produktions‑skala verdensmodeller vil kræve meget høj gennemstrømning og meget lav latenstid, fordi de løbende genererer og opdaterer et miljø i stedet for kun at producere et enkelt output. De skal også have rumlig og tidsmæssig konsistens, evnen til at reagere på handlinger og ofte evnen til samtidigt at simulere flere mulige udfald. Det skaber svære udfordringer inden for hukommelse, data‑bevægelse, parallelisme og pålidelighed. En verdensmodel, der driver en robot eller et spil, kan ikke bruge minutter på at producere den næste tilstand. Ydeevnen afgør, om disse systemer overhovedet er brugbare.
Beregningsteknisk ligner dagens verdensmodeller diffusion‑modeller, så den stack, vi bygger nu, er det naturlige fundament. Der findes endnu ikke et modent produktions‑klar serveringslag til dem, som kan sammenlignes med det, der findes for LLM’er. Vi har til hensigt at bygge det.
Hvis simulering bliver lige så responsiv og overkommelig som tekstgenerering er i dag, kan robotter øve sjældne situationer, før de møder dem, spil kan generere miljøer, der reagerer på individuelle spillere, og designere kan teste dusinvis af muligheder, før de bygger i den fysiske verden. Diffusion er, hvor vi tjener til livets ophold i dag. Verdensmodeller er vores Nordstjerne.
Tak for det gode interview, læsere der ønsker at lære mere, bør besøge MachGen AI.












