Intervjuer

Kismat Singh, medgrundare och VD för MachGen AI – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Kismat Singh, medgrundare och VD för MachGen AI, är en ledande befattningshavare inom AI‑infrastruktur och teknik med mer än två decennier av erfarenhet av att bygga högpresterande dator- och maskininlärningssystem. Innan han medgrundade MachGen AI tjänstgjorde Singh som vice verkställande direktör för AI‑ramverk på Intel och hade tidigare seniora ingenjörsroller på NVIDIA, AMD, HP och andra teknikföretag. Hans arbete har inkluderat bidrag till djupinlärningsbibliotek och kompilatorer, optimering av AI‑ramverk samt förbättringar av resilienst för hyperskalig träning. På Intel var han nära involverad i företagets PyTorch‑initiativ och talade offentligt om att göra AI‑ramverk mer tillgängliga över olika hårdvaruplattformar.

MachGen AI är ett AI‑infrastrukturföretag som fokuserar på att göra generativa bild‑ och videomodeller dramatiskt snabbare och mer kostnadseffektiva att köra. Företaget, som grundades av Kismat Singh och Manoj Krishnan, utvecklar en högpresterande inferens‑ och finjusteringsstack som är specifikt utformad för diffusion‑modeller snarare än att anpassa infrastruktur som ursprungligen byggdes för stora språkmodeller. MachGen optimerar områden som uppmärksamhetsberäkning, cachning, GPU‑kärnor, minneshantering, parallellism, schemaläggning och distribution för att minska genereringslatens samtidigt som modellkvaliteten bevaras. Plattformen erbjuder API:er för text‑till‑bild, bild‑till‑bild, text‑till‑video, bild‑till‑video och referens‑till‑video‑generering, med den underliggande teknologin avsedd att möjliggöra låglatensapplikationer såsom interaktivt innehållsskapande, realtidsavatarer, spel och personligt anpassad reklam.

Du har tillbringat mer än två decennier med att arbeta med video, GPU‑beräkning och AI‑prestanda, inklusive TensorRT på NVIDIA, AI‑programvara på Intel, GPU‑optimering på AMD och tidigare arbete med realtidsvideokodning. Vad såg du under dessa år som slutligen övertygade dig om att lämna stora teknikföretag och medgrunda MachGen, och varför ansåg du att diffusion‑inferens var det infrastrukturella problemet som var värt att bygga ett företag kring?

Min medgrundare Manoj och jag spelade badminton i samma gym i nästan 10 år. Under större delen av den tiden försökte vi anställa varandra. Till slut bestämde vi oss för att det var enklare att samarbeta med varandra än att fortsätta rekrytera varandra.

Anledningen till att vi valde detta problem är att vi båda har sett en inferensstack mogna inifrån. Jag hjälpte till att bygga NVIDIAs inferensplattformteam och ledde sedan AI‑programvara på Intel. Manoj byggde den stora modell‑träningsinfrastrukturen bakom PyTorch på Meta. Vi såg hur år av arbete med cachning, batchning, schemaläggning och kärnor förvandlade tidiga LLM‑forskningssystem till produktionsinfrastruktur som betjänar biljoner token.

Diffusion befinner sig ungefär där LLM‑inferens var för tre år sedan. Bild‑ och videomodeller har utvecklats snabbt, men systemen som betjänar dem förblir långsamma, dyra och svåra att skala. Den största delen av befintlig infrastruktur designades för LLM:er, med diffusion tillagd i efterhand.

Tre faktorer som gjorde tidpunkten rätt: modellerna blev tillräckligt bra för att bygga riktiga produkter på, problemet krävde exakt de färdigheter vi har utvecklat under våra karriärer, och påverkan är tillräckligt stor för att bygga ett generationsföretag kring. När en video som tidigare tog flera minuter kan genereras på sekunder till en bråkdel av kostnaden, blir interaktiv generering, personlig reklam, realtidsavatarer och helt nya kreativa produkter möjliga.

MachGen hävdar att många av de tekniker som transformerade inferens för stora språkmodeller inte överförs rent till diffusion‑modeller. Vad är fundamentalt annorlunda med att betjäna bild‑ och videomodeller, och var finns de största prestandaflaskhalsarna som konventionell AI‑infrastruktur tenderar att missa?

LLM:er och diffusion‑modeller har fundamentalt olika beräkningsmönster. LLM:er är autoregressiva, med en beräkningsintensiv förfylla‑fas följt av en minnesbunden token‑för‑token‑avkodning. Tekniker som KV‑cachning och separering av förfylla/avkodning designades kring den strukturen.

Diffusion‑modeller är icke‑autoregressiva och förblir beräkningsbundna under hela avbrusningsprocessen. Videogenerering innebär också stora mängder rumslig och temporär data, vilket skapar olika krav på uppmärksamhet, minne, kommunikation och parallellism.

Som ett resultat överförs många av de optimeringar som utvecklats för LLM:er inte rent. Konventionell KV‑cachning löser inte samma problem, standardparallellism kan introducera betydande kommunikationskostnader, och de tillgängliga öppen‑källkods‑kärnorna är mycket mindre mogna. Schemaläggaren, minnesmodellen, cachningsstrategin, kärnorna och parallellismen måste alla utformas kring diffusion i sig. Det är därför vi byggde MachGen med diffusion som en förstklassig komponent.

MachGen rapporterar ungefär 4–6 gånger lägre latens på vissa bildmodeller och omkring 6 gånger förbättringar på flera videomodeller samtidigt som de kör de ursprungliga, odestillerade modellerna. Vilka är de viktigaste tekniska genombrotten bakom dessa vinster, och hur säkerställer ni att prestandaförbättringarna inte sker på bekostnad av utskriftskvaliteten?

Vinsterna kommer från flera delar av stacken som arbetar tillsammans. Uppmärksamhet dominerar beräkningsbudgeten i många videomodeller, så vi fokuserar på recept med lägre precision, gles uppmärksamhet och relaterade tekniker. Vi har också utvecklat cachemetoder som utnyttjar rumslig och tidsmässig redundans, starkt optimerade kärnor för diffusionsarkitekturer och parallellismtekniker som minskar kommunikationsöverhead.

Tillsammans gör dessa förbättringar det möjligt för MachGen att leverera HiDream på en sekund jämfört med sex sekunder och Flux på 1.5 sekunder jämfört med 6.2 sekunder. För video kör Wan 2.2 på 16.5 sekunder jämfört med 98 sekunder, medan LTX 2.3 kör på 10.7 sekunder jämfört med 67 sekunder. Inferenskostnaderna är också 2–4x lägre för bildmodeller och 2–3x lägre för video.

Dessa resultat använder de ursprungliga, odestillerade modellerna. Vi förbättrar hur modellerna körs utan att offra utskriftskvaliteten. För produktionsadoption måste hastighet, kostnad och kvalitet samverka.

Trusted TV är ett intressant exempel eftersom minskning av generering från minuter till sekunder förändrar mer än bara infrastrukturkostnaden. När videogenerering blir tillräckligt snabb för att producera tusentals kampanjer och personliga kreativa varianter, vilka nya affärsmodeller eller produktupplevelser blir möjliga som tidigare helt enkelt inte var genomförbara?

TrustedTV hjälper företag att skapa sändningsklara reklamfilmer med AI och placera dem på anslutna TV-plattformar som Prime Video, Roku och DirecTV. Många av deras kunder är små företag. Att göra en TV-reklam på traditionellt sätt innebar en film- och redigeringscrew, med kostnader som började på tusentals dollar och ofta gick upp i tiotusentals dollar. Trusted TV sänker det till noll. En småföretagare kan skapa en hel reklamfilm från en smartphone på ungefär fem minuter och se den innan någon betalning sker. Mer än 10 000 kampanjer har skapats på plattformen.

Ian, Trusted TVs VD, såg MachGens latensbenchmark på Artificial Analysis och trodde inte på den. Han registrerade sig för att testa den själv. Hans första rendering kom tillbaka på ungefär 25 sekunder utan förlust i kvalitet, och när han körde samtidighetstester höll förbättringarna i stor skala. De flyttade hela sin produktionsarbetsflöde till MachGen på under 48 timmar, och MachGen driver nu all deras nya videoproduktion. I den senaste utrullningen ligger vi närmare 10 eller 11 sekunder på den modellen, och vi kommer fortsätta förbättra den.

Produktens effekt är att annonsörer slutar göra en eller två generella reklamfilmer. Deras användare roterar två eller tre nya annonser per vecka, testar kreativa idéer över olika målgruppssegment och itererar istället för att binda sig. Nästa steg är geografisk och målgruppsnivåpersonaliserad reklam i skala, vilket tidigare var reserverat för företag med budgetar på flera miljoner dollar.

En version jag tänker på personligen: Idag får jag en sneaker‑annons filmad på en gata i Manhattan. Jag bor i Bay Area, så den betyder ingenting för mig. Vad jag vill ha är samma annons med Mission Peak i bakgrunden. Det är inte en billigare reklam; det är en annan typ av annonsering, och den blir bara ekonomiskt lönsam när genereringen är tillräckligt snabb och billig för att skapa tusentals varianter.

För företag som integrerar bild- eller videogenerering direkt i sina produkter, hur bör de tänka kring inferensekonomin? Vid vilken skala blir optimering av GPU‑utnyttjande strategiskt viktigt snarare än att bara betala en API‑leverantör för varje generering?

Vändpunkten kommer när inferens börjar påverka antingen kundupplevelsen eller företagets marginaler.

Ett generellt API kan vara meningsfullt medan ett team validerar en produkt. När generering blir central för den produkten måste teamet se bortom det angivna priset per utdata. Latens, samtidighet, kvalitet, pålitlighet och GPU‑utnyttjande blir alla en del av ekonomin.

En generering kan verka billig, men den skapar fortfarande ett affärsproblem om användare måste vänta flera minuter och överger arbetsflödet. En arkitektur som kräver att GPU‑kapaciteten växer i samma takt som användningen kommer också att lägga ökande press på marginalerna.

Det finns ingen enskild tröskel för antalet förfrågningar eftersom beräkningarna som krävs för ett kort 540p‑klipp är mycket annorlunda än för en längre 1080p‑video. Optimering blir strategisk när ökande användning får kostnaderna att stiga i nästan samma takt, topptider skapar köer eller latensen börjar begränsa produktupplevelsen.

MachGen fungerar över flera lager, inklusive anpassade GPU‑kärnor, cachning, precisionsoptimering, schemaläggning och parallellism. När modellerna fortsätter att utvecklas snabbt, vilket lager i inferensstacken tror du erbjuder den största återstående möjligheten för dramatiska förbättringar i hastighet och kostnad?

För videogenerering representerar uppmärksamhet en av de största återstående möjligheterna eftersom den dominerar beräkningsbudgeten i många modeller. Det finns fortfarande betydande utrymme att förbättra recept med lägre precision, gles uppmärksamhet och uppmärksamhetskärnor specifika för diffusion.

Uppmärksamhet är bara en del av möjligheten. De största totala vinsterna kommer från att kombinera förbättringar över hela stacken. Cachning är ett exempel. KV‑cachningsteknikerna som används i LLM‑modeller överförs inte direkt, men diffusionsmodeller innehåller rumslig och tidsmässig redundans som kan utnyttjas med rätt metod.

Parallellism ger en ytterligare möjlighet. Att lägga till GPU:er ger inte automatiskt en proportionell hastighetsökning eftersom kommunikationsöverhead kan motverka vinsten. Vi utvecklar skräddarsydda kärnor som överlappar kommunikation med datalös oberoende beräkning och pipelinar den med datadrivet arbete.

Uppmärksamhet, cachning, kärnor, parallellism, minne och schemaläggning påverkar varandra. Att optimera endast ett lager skapar så småningom en flaskhals någon annanstans. De största förbättringarna kommer av att behandla stacken som ett komplett system utformat för diffusions beräkningsprofil.

När nyare videomodeller driver genereringstiderna närmare realtid, hur nära är vi verkligt interaktiv generativ video, och vilka tekniska hinder måste fortfarande övervinnas innan realtidsvideogenerering blir vanligt?

Vi når redan interaktiva hastigheter för vissa tillämpningar. MachGen genererar en femsekunders Vidu Q3 Turbo‑video i 720p på cirka sex sekunder och i 540p på under tre sekunder. Det är tillräckligt snabbt för snabb kreativ iteration och gör responsiva avatarer och interaktiv video inom räckhåll.

Ett exempel på vad jag menar med interaktivt. Föreställ dig att du tittar på en berättelse och kan se vart slutet är på väg, och du gillar det inte. Istället för att sitta passivt omdirigerar du den: de två karaktärerna bör gå och ta reda på vad den tredje döljer, och konfrontera honom i stället för att låta det utvecklas. Innehåll som du styr istället för innehåll som du mottar. Det är vad snabb, billig generering möjliggör, och det förändrar nästan allt vi konsumerar.

Att nå dit kräver vanligtvis mer än ett starkt latensmått. hela upplevelsen måste förbli responsiv under produktionsbelastning samtidigt som den behåller visuell kvalitet, bild‑till‑bild‑konsistens och förutsägbar kostnad. Längre videor, högre upplösningar och samtidiga förfrågningar ökar alla infrastrukturbördan, och systemet måste fortfarande tillhandahålla kapacitet, dirigera förfrågningar och återhämta sig från hårdvarufel utan att användaren märker det.

Det kommer att komma fall för fall. Kortklipp, avatarer, spel och kreativa verktyg kommer sannolikt först eftersom generering på sekunder redan är tillräcklig för dem. När modellkvalitet och inferensprestanda förbättras samtidigt, kommer fler tillämpningar att passera den tröskeln.

När AI‑agenter i allt högre grad genererar bilder och videor autonomt istället för att vänta på att en människa trycker på en knapp, hur förändrar det infrastrukturbehoven? Skapar agentdrivna arbetsbelastningar fundamentalt olika krav på latens, samtidighet, kostnad och tillförlitlighet?

En agent omvandlar en enskild användarförfrågan till dussintals eller hundratals genereringsjobb. Den skapar flera alternativ, utvärderar dem, reviderar prompten och upprepar processen, utan mänsklig inblandning mellan stegen.

Det gör latens, samtidighet, kostnad och tillförlitlighet mycket viktigare. Om varje generering tar minuter är agentens arbetsflöde för långsamt för att vara användbart. Om varje försök är dyrt blir autonom iteration ekonomiskt orealistisk. Systemet måste också kunna hantera många samtidiga förfrågningar på ett pålitligt sätt eftersom ett fel kan avbryta hela kedjan av arbete.

Det är här funktioner som GPU‑tilldelning, autoskalning och routing är lika viktiga som optimering på modellnivå. Agentens efterfrågan är mycket mer spikig än efterfrågan från en kreativ applikation där en person klickar på en knapp.

Den relevanta arbetsenheten är inte längre en enskild bild eller video. Det är hela slingan av att generera, utvärdera och förfina innehåll. Infrastruktur måste göra hela slingan snabb, prisvärd och pålitlig.

Det råder intensiv konkurrens bland GPU‑leverantörer, inferens‑moln, modellutvecklare och optimeringsplattformar. När hårdvaran själv blir snabbare, varför kommer företag fortfarande behöva ett specialiserat inferens‑lager som MachGen i stället för att förlita sig på förbättringar från NVIDIA, AMD, molnleverantörer eller modellutvecklarna själva?

Snabbare hårdvara höjer taket. Mjukvara avgör hur mycket av det taket som nås.

Vi har sett detta spela ut med LLM:er. Nya acceleratorer förbättrade råprestanda varje generation, och kontinuerlig batchning, KV‑cache‑hantering, spekulativ avkodning och specialiserade kärnor var fortfarande det som förde branschen till produktionsnivåns genomströmning och ekonomi. Inget av detta kom från hårdvaran.

Att kontinuerligt optimera hela produktionsvägen för bild‑ och videogenerering är ett annat arbete än vad hårdvaruleverantörer, molnleverantörer och modellutvecklare gör, och det är inte en kärnprioritet för någon av dem.

Det finns några tillvägagångssätt för det arbetet. Ett är marknadsplatsmodellen, där modeller samlas och dirigerar förfrågningar. Vi anser inte att det är hållbart på lång sikt, eftersom man saknar kontroll över det lager där prestandan ligger. Vi valde att bygga stacken själva och hosta den nativt, vilket är det enda sättet att uppnå de latens‑ och kostnadsnivåer vi ser.

Det innebär att finjustera uppmärksamhet, cachning, kärnor, precision, minne och parallellism per modell och per accelerator, samt stödja hanterade API:er, dedikerad moln och självhostad distribution. Allt eftersom antalet modeller och hårdvarualternativ ökar, ökar också komplexiteten. Vår roll är att absorbera detta så att våra kunder kan ägna sin tid åt det som särskiljer deras produkter.

Du har beskrivit världmodeller som en del av MachGens långsiktiga vision, där många av deras beräkningsmässiga egenskaper liknar diffusionsarbetsbelastningar. Hur måste infrastrukturen för produktionsskaliga världmodeller se ut, och vilka tillämpningar blir möjliga om generering och simulering av visuella miljöer så småningom blir lika billig och responsiv som textgenerering är idag?

Ett sätt att betrakta vår plattform är att likna den vid en generell LLM. Samma modell utformar ett juridiskt avtal och svarar på en fråga om restauranger. För oss betjänar samma stack videokaraktärsföretag, AI-annonsering, berättelse- och mikrodramagenerering och så småningom världmodeller. Olika vertikaler, men en gemensam uppsättning underliggande prestandaproblem.

Världmodeller är inte vår kärnverksamhet idag, men de är det vi bygger mot, och vi arbetar aktivt med dem. Produktionsskaliga världmodeller kommer att kräva mycket hög genomströmning och mycket låg latens eftersom de kontinuerligt genererar och uppdaterar en miljö snarare än att producera ett enda resultat. De måste också ha rumslig och tidsmässig konsistens, förmågan att svara på handlingar och ofta möjligheten att simulera flera möjliga utfall samtidigt. Det skapar svåra problem med minne, datatransport, parallellism och tillförlitlighet. En världmodell som driver en robot eller ett spel kan inte ta minuter på sig för att producera nästa tillstånd. Prestanda avgör om dessa system är användbara över huvud taget.

Ur ett beräkningsperspektiv liknar dagens världmodeller diffusion-modeller, så den stack vi bygger nu är den naturliga grunden. Det finns ännu inget moget produktionsklassat serveringslager för dem, jämförbart med det som finns för LLM:er. Vi avser att bygga det.

Om simulering blir lika responsiv och prisvärd som textgenerering är idag, kan robotar öva på sällsynta situationer innan de möter dem, spel kan generera miljöer som svarar på enskilda spelare, och formgivare kan testa dussintals möjligheter innan de bygger i den fysiska världen. Diffusion är där vi tjänar vårt levebröd idag. Världmodeller är vår ledstjärna.

Tack för den fantastiska intervjun, läsare som vill lära sig mer bör besöka MachGen AI.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.