Intervjuer
Kismat Singh, medgründer og administrerende direktør i MachGen AI – Intervjuserie

Kismat Singh, medgründer og administrerende direktør i MachGen AI, er en leder innen AI‑infrastruktur og ingeniørvirksomhet med mer enn to tiår med erfaring i å bygge høyytelses‑databehandling og maskinlæringssystemer. Før han medgrunnla MachGen AI, var Singh visepresident for engineering for AI‑rammeverk hos Intel og hadde tidligere senior‑ingeniørstillinger hos NVIDIA, AMD, HP og andre teknologiselskaper. Arbeidet hans har inkludert bidrag til dype‑læringsbiblioteker og kompilatorer, optimalisering av AI‑rammeverk og forbedringer av hyperskala‑treningsresiliens. Hos Intel var han tett involvert i selskapets PyTorch‑initiativ og holdt offentlige taler om å gjøre AI‑rammeverk mer tilgjengelige på ulike maskinvareplattformer.
MachGen AI er et AI‑infrastruktur‑selskap som fokuserer på å gjøre generative bilde‑ og videomodeller dramatisk raskere og mer økonomiske å kjøre. Selskapet, som ble grunnlagt av Kismat Singh og Manoj Krishnan, utvikler en høyytelses‑inference‑ og finjusteringsstabel spesielt designet for diffusionsmodeller i stedet for å tilpasse infrastruktur som opprinnelig ble bygget for store språkmodeller. MachGen optimaliserer områder som oppmerksomhetsberegning, caching, GPU‑kjerner, minnehåndtering, parallellitet, planlegging og utrulling for å redusere generasjonslatens samtidig som modellkvaliteten opprettholdes. Plattformen tilbyr API‑er for tekst‑til‑bilde, bilde‑til‑bilde, tekst‑til‑video, bilde‑til‑video og referanse‑til‑video‑generering, med den underliggende teknologien rettet mot å muliggjøre lav‑latens‑applikasjoner som interaktivt innholdsskaping, sanntids‑avatarer, spilling og personlig tilpasset reklame.
Du har tilbrakt mer enn to tiår med å jobbe med video, GPU‑beregning og AI‑ytelse, inkludert TensorRT hos NVIDIA, AI‑programvare hos Intel, GPU‑optimalisering hos AMD, samt tidligere arbeid med sanntids‑video‑koding. Hva så du i løpet av disse årene som til slutt overbeviste deg om å forlate store teknologiselskaper og medgrunnlegge MachGen, og hvorfor mente du at diffusions‑inference var infrastrukturproblemet som var verdt å bygge et selskap rundt?
Medgründer Manoj og jeg spilte badminton på samme treningsstudio i nesten 10 år. I mesteparten av den tiden prøvde vi å ansette den andre. Til slutt bestemte vi oss for at det var enklere å samarbeide med hverandre enn å fortsette å rekruttere hverandre.
Grunnen til at vi valgte dette problemet er at vi begge har sett en inference‑stabel modne fra innsiden. Jeg hjalp til med å bygge NVIDIAs inference‑plattformteam og ledet deretter AI‑programvare hos Intel. Manoj bygde den store‑modell‑treningsinfrastrukturen bak PyTorch hos Meta. Vi så år med arbeid med caching, batch‑behandling, planlegging og kjerner omforme tidlige LLM‑forskningssystemer til produksjonsinfrastruktur som betjener billioner av token.
Diffusjon er omtrent der LLM‑inference var for tre år siden. Bilde‑ og videomodeller har utviklet seg raskt, men systemene som betjener dem forblir trege, kostbare og vanskelige å skalere. De fleste eksisterende infrastrukturer ble designet for LLM‑er, med diffusjon lagt til senere.
Tre faktorer som gjorde timingen riktig: modellene ble gode nok til å bygge ekte produkter på, problemet krevde akkurat de ferdighetene vi har brukt karrieren vår på å utvikle, og virkningen er stor nok til å bygge et generasjonsbedrift rundt. Når en video som tidligere tok flere minutter kan genereres på sekunder til en brøkdel av kostnaden, blir interaktiv generering, personlig tilpasset reklame, sanntids‑avatarer og helt nye kreative produkter mulig.
MachGen hevder at mange av teknikkene som transformerte store språkmodell‑inference ikke overføres rent til diffusionsmodeller. Hva er grunnleggende forskjellig ved å betjene bilde‑ og videomodeller, og hvor er de største ytelsesflaskehalsene som konvensjonell AI‑infrastruktur ofte overser?
LLM‑er og diffusionsmodeller har grunnleggende ulike beregningsmønstre. LLM‑er er autoregressive, med en beregningsintensiv forhåndsfylling etterfulgt av en minne‑bundet, token‑for‑token‑dekoding. Teknikker som KV‑caching og disaggregasjon av forhåndsfylling/dekoding ble designet rundt denne strukturen.
Diffusjonsmodeller er ikke‑autoregressive og forblir beregnings‑bundne gjennom hele denoising‑prosessen. Videogenerering involverer også store mengder romlig og tidsmessig data, noe som skaper ulike krav til oppmerksomhet, minne, kommunikasjon og parallellitet.
Som et resultat overføres mange av optimaliseringene utviklet for LLM‑er ikke rent. Konvensjonell KV‑caching løser ikke det samme problemet, standard parallellitet kan introdusere betydelig kommunikasjons‑overhead, og de tilgjengelige open‑source‑kjernene er mye mindre modne. Planleggeren, minnemodellen, caching‑strategien, kjernene og parallelliteten må alle designes rundt selve diffusjon. Det er derfor vi bygde MachGen med diffusjon som en førsteklasses komponent.
MachGen rapporterer omtrent 4–6 ganger lavere latens på noen bildemodeller og rundt 6 ganger forbedring på flere videomodeller mens de kjører de originale, udistilte modellene. Hva er de viktigste tekniske gjennombruddene bak disse gevinstene, og hvordan sikrer du at ytelsesforbedringene ikke går på bekostning av utskriftskvaliteten?
Gevinstene kommer fra flere deler av stakken som jobber sammen. Oppmerksomhet dominerer beregningsbudsjettet i mange videomodeller, så vi fokuserer på lavpresisjonsoppskrifter, sparsom oppmerksomhet og relaterte teknikker. Vi har også utviklet cache‑metoder som utnytter romlig og tidsmessig redundans, høyt optimaliserte kjerner for diffusjonsarkitekturer og parallelitetsteknikker som reduserer kommunikasjonskostnadene.
Sammen gjør disse forbedringene at MachGen kan levere HiDream på ett sekund i stedet for seks sekunder, og Flux på 1,5 sekunder i stedet for 6,2 sekunder. For video kjører Wan 2.2 på 16,5 sekunder i stedet for 98 sekunder, mens LTX 2.3 kjører på 10,7 sekunder i stedet for 67 sekunder. Inferenskostnadene er også 2–4 ganger lavere for bildemodeller og 2–3 ganger lavere for video.
Disse resultatene bruker de originale, udestillerte modellene. Vi forbedrer hvordan modellene kjører uten å gå på bekostning av utdataenes kvalitet. For produksjonsadopsjon må hastighet, kostnad og kvalitet fungere sammen.
Trusted TV er et interessant eksempel fordi reduksjon av generering fra minutter til sekunder påvirker mer enn bare infrastrukturregningen. Når videogenerering blir rask nok til å produsere tusenvis av kampanjer og personlige kreative varianter, hvilke nye forretningsmodeller eller produktopplevelser blir mulige som tidligere ikke var levedyktige?
TrustedTV hjelper bedrifter med å lage kringkastingsklare reklamer med AI og distribuere dem på tilkoblede TV‑plattformer som Prime Video, Roku og DirecTV. Mange av kundene er små bedrifter. Å lage en TV‑reklame på tradisjonell måte krevde et film‑ og redigeringsteam, med kostnader som startet i tusenvis og ofte løp opp i titalls tusen dollar. Trusted TV gjør dette til null. En liten bedriftsleder kan lage en full reklame fra en smarttelefon på omtrent fem minutter og se den før noen betaling skjer. Mer enn 10 000 kampanjer er blitt opprettet på plattformen.
Ian, administrerende direktør i Trusted TV, så MachGens latenstidsbenchmark på Artificial Analysis og trodde det ikke. Han registrerte seg for å teste det selv. Den første renderen kom tilbake på omtrent 25 sekunder uten tap i kvalitet, og da han kjørte samtidighetstester holdt forbedringene seg i skala. De flyttet hele produksjonsarbeidsflyten til MachGen på under 48 timer, og MachGen driver nå all deres nye videoproduksjon. I den siste utrullingen er vi nærmere 10 eller 11 sekunder på den modellen, og vi vil fortsette å forbedre den.
Produktets effekt er at annonsører slutter å lage én eller to generelle reklamer. Brukerne deres roterer to eller tre nye annonser per uke, tester kreativitet på ulike målgruppesegmenter, og itererer i stedet for å forplikte seg. Det neste blir geografisk og målgruppe‑spesifikk personalisering i skala, noe som tidligere kun var reservert for selskaper med budsjetter på flere millioner dollar.
En versjon jeg tenker på personlig: I dag får jeg en sneaker‑annonse filmet på en gate i Manhattan. Jeg bor i Bay‑Area, så den betyr ingenting for meg. Det jeg ønsker er den samme annonsen med Mission Peak i bakgrunnen. Det er ikke en billigere reklame; det er en annen type annonsering, og den blir økonomisk levedyktig først når generering er rask og billig nok til å lage tusenvis av varianter.
For selskaper som integrerer bilde‑ eller videogenerering direkte i produkter, hvordan bør de tenke på økonomien rundt inferens? På hvilken skala blir optimalisering av GPU‑utnyttelse strategisk viktig i stedet for bare å betale en API‑leverandør per generering?
Vendepunktet kommer når inferens begynner å påvirke enten kundeopplevelsen eller selskapets marginer.
Et generelt API kan gi mening mens et team validerer et produkt. Når generering blir sentral i produktet, må teamet se utover den oppgitte prisen per output. Latens, samtidighet, kvalitet, pålitelighet og GPU‑utnyttelse blir alle en del av økonomien.
En generering kan virke billig, men den skaper fortsatt et forretningsproblem hvis brukerne må vente flere minutter og gir opp arbeidsflyten. En arkitektur som krever at GPU‑kapasiteten vokser i takt med bruken vil også legge økende press på marginene.
Det finnes ingen enkelt terskel for forespørselsvolum fordi beregningene som kreves for et kort 540p‑klipp er svært forskjellige fra et lengre 1080p‑video. Optimalisering blir strategisk når økende bruk får kostnadene til å stige nesten i samme takt, toppbelastning skaper køer, eller latens begynner å begrense produktopplevelsen.
MachGen fungerer på flere lag, inkludert tilpassede GPU‑kjerner, caching, presisjonsoptimalisering, planlegging og parallelitet. Etter hvert som modellene utvikler seg raskt, hvilket lag i inferens‑stakken tror du gir den største gjenværende muligheten for dramatiske forbedringer i hastighet og kostnad?
For videogenerering representerer oppmerksomhet en av de største gjenværende mulighetene fordi den dominerer beregningsbudsjettet i mange modeller. Det er fortsatt betydelig rom for å forbedre lavpresisjonsoppskrifter, sparsom oppmerksomhet og diffusjons‑spesifikke oppmerksomhetskjerner.
Oppmerksomhet er bare en del av muligheten. De største samlede gevinstene vil komme fra å kombinere forbedringer på tvers av stakken. Caching er ett eksempel. KV‑caching‑teknikkene som brukes i LLM‑er overføres ikke direkte, men diffusjonsmodeller inneholder romlig og tidsmessig redundans som kan utnyttes med riktig tilnærming.
Parallellisering gir en ny mulighet. Å legge til GPU‑er gir ikke automatisk en proporsjonal hastighetsøkning fordi kommunikasjonskostnaden kan oppveie fordelen. Vi utvikler skreddersydde kjerner som overlapper kommunikasjon med datauavhengig beregning og pipeliner den med datavdependent arbeid.
Oppmerksomhet, caching, kjerner, parallellisering, minne og planlegging påvirker hverandre. Å optimalisere kun ett lag skaper etter hvert en flaskehals et annet sted. De største forbedringene vil komme ved å behandle stakken som et komplett system designet for diffusjonens beregningsprofil.
Etter hvert som nyere videomodeller presser generasjonstiden nærmere sanntid, hvor nær er vi virkelig interaktiv generativ video, og hvilke tekniske barrierer må fortsatt overvinnes før sanntidsvideogenerering blir vanlig?
Vi når allerede interaktive hastigheter for enkelte applikasjoner. MachGen genererer en fem sekunders Vidu Q3 Turbo‑video i 720p på omtrent seks sekunder og i 540p på under tre sekunder. Det er raskt nok for rask kreativ iterasjon og gjør responsive avatarer og interaktiv video innen rekkevidde.
Et eksempel på hva jeg mener med interaktivt. Forestill deg at du ser på en historie, og du kan se hvor slutten går, og du liker den ikke. I stedet for å sitte passivt, omdirigerer du den: de to karakterene bør finne ut hva den tredje skjuler, og konfrontere ham i stedet for å la det utspille seg. Innhold du styrer i stedet for innhold du mottar. Det er det raske, billige generering gjør mulig, og det endrer nesten alt vi konsumerer.
Å komme dit krever vanligvis mer enn én solid latensmåling. Hele opplevelsen må forbli responsiv under produksjonstrafikk samtidig som den opprettholder visuell kvalitet, ramme‑til‑ramme‑konsistens og forutsigbare kostnader. Lengre videoer, høyere oppløsninger og samtidige forespørsler øker alle infrastrukturbelastningen, og systemet må fortsatt tildele kapasitet, rute forespørsler og gjenopprette fra maskinvarefeil uten at brukeren merker det.
Det vil komme sakte, case for case. Korte klipp, avatarer, spill og kreative verktøy vil sannsynligvis være først, fordi generering i sekunder allerede er tilstrekkelig for dem. Etter hvert som modellkvalitet og inferensytelse forbedres sammen, vil flere applikasjoner krysse den terskelen.
Etter hvert som AI‑agenter i økende grad genererer bilder og videoer autonomt i stedet for å vente på at et menneske trykker på en knapp, hvordan endrer det infrastrukturkravene? Skaper agent‑drevne arbeidsbelastninger grunnleggende forskjellige krav til latens, samtidighet, kostnad og pålitelighet?
En agent gjør en enkelt brukerforespørsel om til dusinvis eller hundrevis av generasjonsjobber. Den lager flere alternativer, evaluerer dem, reviderer prompten og gjentar prosessen, uten menneskelig innspill mellom trinnene.
Det gjør latens, samtidighet, kostnad og pålitelighet mye viktigere. Hvis hver generering tar minutter, er agentens arbeidsflyt for treg til å være nyttig. Hvis hvert forsøk er dyrt, blir autonom iterasjon økonomisk upraktisk. Systemet må også håndtere mange samtidige forespørsler pålitelig, fordi én feil kan avbryte hele arbeidskjeden.
Her kommer funksjoner som GPU‑provisjonering, autoskalering og ruting til nytte like mye som modellnivåoptimalisering. Agent‑etterspørselen er langt mer burst‑aktig enn etterspørselen fra en kreativ applikasjon hvor en person klikker på en knapp.
Den relevante arbeidsenheten er ikke lenger ett enkelt bilde eller én video. Det er hele sløyfen med å generere, evaluere og finpusse innhold. Infrastruktur må gjøre hele denne sløyfen rask, rimelig og pålitelig.
Det er intens konkurranse mellom GPU‑leverandører, inferens‑skyer, modellutviklere og optimaliseringsplattformer. Etter hvert som maskinvaren selv blir raskere, hvorfor vil selskaper fortsatt trenge et spesialisert inferenslag som MachGen i stedet for å stole på forbedringer fra NVIDIA, AMD, sky‑leverandører eller modellutviklerne selv?
Raskere maskinvare hever taket. Programvaren bestemmer hvor mye av dette taket som nås.
Vi har sett dette skje med LLM‑er. Nye akseleratorer forbedret råytelsen hver generasjon, og kontinuerlig batch‑behandling, KV‑cache‑styring, spekulativ dekoding og spesialiserte kjerner var fortsatt det som førte industrien til produksjonsnivå‑gjennomstrømning og økonomi. Ingenting av dette kom fra maskinvaren.
Kontinuerlig optimalisering av hele produksjonsløpet for bilde‑ og videogenerering er en annen oppgave enn det maskinvareleverandører, sky‑leverandører og modellutviklere gjør, og det er ikke en kjerneprioritet for noen av dem.
Det finnes noen tilnærminger til denne oppgaven. En er markedsplassmodellen, hvor modeller samles og ruter forespørsler. Vi mener ikke dette er holdbart på lang sikt, fordi man ikke har kontroll over laget hvor ytelsen ligger. Vi valgte å bygge stakken selv og hoste den nativt, noe som er den eneste måten å oppnå de latens‑ og kostnadsverdiene vi ser på.
Det betyr at vi må finjustere oppmerksomhet, caching, kjerner, presisjon, minne og parallellitet per modell og per akselerator, samt støtte administrerte API-er, dedikert sky og selvhostet distribusjon. Etter hvert som antallet modeller og maskinvarealternativer øker, øker også kompleksiteten. Vår rolle er å absorbere dette slik at kundene våre kan bruke tiden sin på det som skiller produktene deres.
Du har beskrevet verdensmodeller som en del av MachGens langsiktige visjon, med mange av deres beregningsmessige egenskaper som ligner på diffusionsarbeidsbelastninger. Hvordan må infrastrukturen for produksjons‑skala verdensmodeller se ut, og hvilke applikasjoner blir mulige dersom generering og simulering av visuelle miljøer etter hvert blir like billig og responsiv som tekstgenerering er i dag?
En måte å tenke på plattformen vår er at den ligner en generell LLM. Den samme modellen utarbeider en juridisk avtale og svarer på et spørsmål om restauranter. For oss betjener den samme stakken videokarakter‑selskaper, AI‑reklame, historiefortelling og mikrodraamaproduksjon, og etter hvert verdensmodeller. Ulike vertikaler, ett sett med underliggende ytelsesproblemer.
Verdensmodeller er ikke vår kjernevirksomhet i dag, men de er det vi bygger mot, og vi arbeider aktivt med dem. Verdensmodeller i produksjons‑skala vil kreve svært høy gjennomstrømning og svært lav latens fordi de kontinuerlig genererer og oppdaterer et miljø i stedet for å produsere ett enkelt resultat. De trenger også romlig og tidsmessig konsistens, evnen til å reagere på handlinger, og ofte evnen til samtidig å simulere flere mulige utfall. Dette skaper vanskelige problemer knyttet til minne, databevegelse, parallellitet og pålitelighet. En verdensmodell som styrer en robot eller et spill kan ikke bruke minutter på å produsere neste tilstand. Ytelsen avgjør om disse systemene i det hele tatt er brukbare.
Beregningsteknisk ligner dagens verdensmodeller i stor grad på diffusionsmodeller, så stakken vi bygger nå er det naturlige fundamentet. Det finnes ennå ikke et modent produksjons‑klare tjenestelag for dem, sammenlignbart med det som finnes for LLM‑er. Vi har til hensikt å bygge det.
Hvis simulering blir like responsiv og rimelig som tekstgenerering er i dag, kan roboter øve på sjeldne situasjoner før de møter dem, spill kan generere miljøer som reagerer på individuelle spillere, og designere kan teste dusinvis av muligheter før de bygger i den fysiske verden. Diffusjon er der vi tjener til livets opphold i dag. Verdensmodeller er vår Nordstjerne.
Takk for det flotte intervjuet, lesere som ønsker å lære mer bør besøke MachGen AI.












