Interviste
Kismat Singh, cofondatore e CEO di MachGen AI – Serie di interviste

Kismat Singh, cofondatore e CEO di MachGen AI, è un dirigente dell’infrastruttura AI e dell’ingegneria con più di due decenni di esperienza nella costruzione di sistemi di calcolo ad alte prestazioni e di apprendimento automatico. Prima di co‑fondare MachGen AI, Singh è stato VP Engineering per AI Frameworks presso Intel e ha ricoperto ruoli senior di ingegneria presso NVIDIA, AMD, HP e altre aziende tecnologiche. Il suo lavoro ha incluso contributi a librerie di deep learning e compilatori, ottimizzazione di framework AI e miglioramenti alla resilienza dell’addestramento su iperscale. Presso Intel è stato strettamente coinvolto nelle iniziative PyTorch dell’azienda e ha parlato pubblicamente di come rendere i framework AI più accessibili su diverse piattaforme hardware.
MachGen AI è un’azienda di infrastruttura AI focalizzata sul rendere i modelli generativi di immagini e video notevolmente più veloci e più economici da eseguire. Fondata da Kismat Singh e Manoj Krishnan, l’azienda sta sviluppando uno stack di inferenza e fine‑tuning ad alte prestazioni specificamente progettato per i modelli di diffusione, anziché adattare infrastrutture originariamente costruite per i grandi modelli linguistici. MachGen ottimizza aree quali il calcolo dell’attenzione, la cache, i kernel GPU, la gestione della memoria, il parallelismo, la pianificazione e il deployment per ridurre la latenza di generazione mantenendo la qualità del modello. La sua piattaforma fornisce API per la generazione testo‑a‑immagine, immagine‑a‑immagine, testo‑a‑video, immagine‑a‑video e riferimento‑a‑video, con la tecnologia sottostante mirata a consentire applicazioni a bassa latenza come la creazione interattiva di contenuti, avatar in tempo reale, gaming e pubblicità personalizzata.
Hai lavorato per più di due decenni su video, calcolo GPU e prestazioni AI, includendo TensorRT presso NVIDIA, software AI presso Intel, ottimizzazione GPU presso AMD e lavori precedenti sulla codifica video in tempo reale. Cosa hai osservato in quegli anni che alla fine ti ha convinto a lasciare le grandi aziende tecnologiche e co‑fondare MachGen, e perché hai ritenuto che l’inferenza di diffusione fosse il problema infrastrutturale su cui valeva la pena costruire un’azienda?
Il mio cofondatore Manoj ed io abbiamo giocato a badminton nella stessa palestra per quasi 10 anni. Per la maggior parte di quel periodo, cercavamo di assumere l’altro. Alla fine abbiamo deciso che fosse più semplice lavorare insieme piuttosto che continuare a reclutare l’uno l’altro.
Il motivo per cui abbiamo scelto questo problema è che entrambi abbiamo osservato da dentro la maturazione di uno stack di inferenza. Ho contribuito a costruire il team della piattaforma di inferenza di NVIDIA e poi ho guidato il software AI presso Intel. Manoj ha costruito l’infrastruttura di addestramento per grandi modelli alla base di PyTorch presso Meta. Abbiamo visto anni di lavoro su cache, batching, scheduling e kernel trasformare i primi sistemi di ricerca LLM in infrastrutture di produzione che servono trilioni di token.
La diffusione è più o meno dove si trovava l’inferenza LLM tre anni fa. I modelli di immagine e video sono progrediti rapidamente, ma i sistemi che li servono rimangono lenti, costosi e difficili da scalare. La maggior parte dell’infrastruttura esistente è stata progettata per i LLM, con la diffusione aggiunta in seguito.
Tre fattori hanno reso il momento giusto: i modelli sono diventati sufficientemente buoni da costruire prodotti reali, il problema richiedeva esattamente le competenze che avevamo sviluppato nelle nostre carriere, e l’impatto è abbastanza grande da giustificare la creazione di un’azienda generazionale. Quando un video che una volta richiedeva diversi minuti può essere generato in pochi secondi a una frazione del costo, diventano possibili la generazione interattiva, la pubblicità personalizzata, gli avatar in tempo reale e interi nuovi prodotti creativi.
MachGen sostiene che molte delle tecniche che hanno trasformato l’inferenza dei grandi modelli linguistici non si trasferiscono agevolmente ai modelli di diffusione. Qual è la differenza fondamentale nel servire modelli di immagine e video, e dove si trovano i colli di bottiglia di prestazione più grandi che l’infrastruttura AI convenzionale tende a trascurare?
I LLM e i modelli di diffusione hanno pattern computazionali fondamentalmente diversi. I LLM sono autoregressivi, con un pre‑riempimento ad alta intensità di calcolo seguito da una decodifica token‑per‑token limitata dalla memoria. Tecniche come la cache KV e la disaggregazione pre‑riempimento/decodifica sono state progettate attorno a quella struttura.
I modelli di diffusione sono non autoregressivi e rimangono limitati dal calcolo per tutto il processo di denoising. La generazione video comporta anche grandi quantità di dati spaziali e temporali, creando esigenze diverse per attenzione, memoria, comunicazione e parallelismo.
Di conseguenza, molte delle ottimizzazioni sviluppate per i LLM non si trasferiscono agevolmente. La cache KV convenzionale non risolve lo stesso problema, il parallelismo standard può introdurre notevoli overhead di comunicazione, e i kernel open‑source disponibili sono molto meno maturi. Lo scheduler, il modello di memoria, la strategia di caching, i kernel e il parallelismo devono tutti essere progettati attorno alla diffusione stessa. È per questo che abbiamo costruito MachGen con la diffusione come cittadino di prima classe.
MachGen segnala una latenza circa 4–6 volte inferiore su alcuni modelli di immagine e circa 6 volte migliorata su diversi modelli video, mantenendo i modelli originali non distillati. Quali sono le innovazioni tecniche più importanti dietro questi guadagni e come garantite che i miglioramenti di prestazione non avvengano a scapito della qualità dell’output?
I guadagni provengono da diverse parti dello stack che lavorano insieme. L’attenzione domina il budget di calcolo in molti modelli video, quindi ci concentriamo su ricette a bassa precisione, attenzione sparsa e tecniche correlate. Abbiamo inoltre sviluppato metodi di caching che sfruttano la ridondanza spaziale e temporale, kernel altamente ottimizzati per architetture di diffusione e tecniche di parallelismo che riducono l’overhead di comunicazione.
Insieme, tali miglioramenti consentono a MachGen di fornire HiDream in un secondo rispetto a sei secondi e Flux in 1,5 secondi rispetto a 6,2 secondi. Per i video, Wan 2.2 impiega 16,5 secondi rispetto a 98 secondi, mentre LTX 2.3 impiega 10,7 secondi rispetto a 67 secondi. I costi di inferenza sono anche da 2 a 4 volte inferiori per i modelli immagine e da 2 a 3 volte inferiori per i video.
Questi risultati utilizzano i modelli originali, non distillati. Stiamo migliorando il modo in cui i modelli vengono eseguiti senza sacrificare la qualità dell’output. Per l’adozione in produzione, velocità, costo e qualità devono lavorare insieme.
Trusted TV è un esempio interessante perché ridurre la generazione da minuti a secondi cambia più della semplice fattura infrastrutturale. Una volta che la generazione video diventa sufficientemente veloce da produrre migliaia di campagne e varianti creative personalizzate, quali nuovi modelli di business o esperienze di prodotto diventano possibili, che prima semplicemente non erano fattibili?
TrustedTV aiuta le aziende a creare spot pubblicitari pronti per la trasmissione con l’IA e a distribuirli su piattaforme TV connesse come Prime Video, Roku e DirecTV. Molti dei suoi clienti sono piccole imprese. Realizzare uno spot televisivo in modo tradizionale richiedeva una troupe di riprese e montaggio, con costi a partire da migliaia di dollari e tipicamente arrivando a decine di migliaia di dollari. Trusted TV porta tutto a zero. Un piccolo imprenditore può creare uno spot completo da uno smartphone in circa cinque minuti e visualizzarlo prima di pagare nulla. Sono state create più di 10.000 campagne sulla piattaforma.
Ian, CEO di Trusted TV, ha visto il benchmark di latenza di MachGen su Artificial Analysis e non ci ha creduto. Si è iscritto per testarlo personalmente. Il suo primo rendering è tornato in circa 25 secondi senza perdita di qualità e, quando ha eseguito test di concorrenza, i miglioramenti si sono mantenuti su larga scala. Hanno trasferito l’intero flusso di produzione su MachGen in meno di 48 ore, e MachGen ora alimenta tutta la loro nuova creazione video. Nell’ultima implementazione, siamo più vicini a 10 o 11 secondi su quel modello, e continueremo a migliorarlo.
L’effetto sul prodotto è che gli inserzionisti smettono di realizzare uno o due spot generici. I loro utenti ruotano due o tre nuovi annunci a settimana, testano la creatività su diversi segmenti di pubblico e iterano invece di impegnarsi definitivamente. Ciò che segue è la personalizzazione a livello geografico e di pubblico su larga scala, precedentemente riservata a aziende con budget di diversi milioni di dollari.
Una versione a cui penso personalmente: oggi ricevo una pubblicità di sneaker girata su una strada a Manhattan. Vivo nella Bay Area, quindi non ha alcun significato per me. Quello che desidero è la stessa pubblicità con Mission Peak sullo sfondo. Non si tratta di uno spot più economico; è un tipo diverso di pubblicità, e diventa economicamente sostenibile solo quando la generazione è sufficientemente veloce ed economica da produrre migliaia di varianti.
Per le aziende che integrano la generazione di immagini o video direttamente nei prodotti, come dovrebbero considerare l’economia dell’inferenza? A quale scala l’ottimizzazione dell’utilizzo della GPU diventa strategicamente importante piuttosto che semplicemente pagare un fornitore di API per ogni generazione?
Il punto di svolta arriva quando l’inferenza inizia a influenzare sia l’esperienza del cliente sia i margini dell’azienda.
Un’API generica può avere senso mentre un team sta validando un prodotto. Una volta che la generazione diventa centrale per quel prodotto, i team devono guardare oltre il prezzo indicato per output. Latenza, concorrenza, qualità, affidabilità e utilizzo della GPU diventano tutti parte dell’economia.
Una generazione può sembrare poco costosa, ma crea comunque un problema di business se gli utenti devono attendere diversi minuti e abbandonano il flusso di lavoro. Un’architettura che richiede che la capacità della GPU cresca allo stesso ritmo dell’utilizzo eserciterà anche una pressione crescente sui margini.
Non esiste una soglia unica di volume di richieste perché la potenza di calcolo necessaria per una breve clip a 540p è molto diversa da quella per un video più lungo a 1080p. L’ottimizzazione diventa strategica quando l’aumento dell’uso fa sì che i costi crescano quasi allo stesso ritmo, la domanda di picco crea code o la latenza inizia a limitare l’esperienza del prodotto.
MachGen opera su diversi livelli, inclusi kernel GPU personalizzati, caching, ottimizzazione della precisione, pianificazione e parallelismo. Man mano che i modelli continuano a evolversi rapidamente, quale livello dello stack di inferenza ritieni offra la più grande opportunità residua per miglioramenti drastici in velocità e costo?
Per la generazione video, l’attenzione rappresenta una delle più grandi opportunità residue perché domina il budget di calcolo in molti modelli. C’è ancora ampio margine per migliorare le ricette a bassa precisione, l’attenzione sparsa e i kernel di attenzione specifici per la diffusione.
L’attenzione è solo una parte dell’opportunità. I maggiori guadagni complessivi arriveranno combinando miglioramenti su tutto lo stack. Il caching è un esempio. Le tecniche di caching KV utilizzate nei LLM non si trasferiscono direttamente, ma i modelli di diffusione contengono ridondanza spaziale e temporale che può essere sfruttata con l’approccio corretto.
Il parallelismo presenta un’altra opportunità. Aggiungere GPU non produce automaticamente un’accelerazione proporzionale perché l’overhead di comunicazione può compensare il beneficio. Sviluppiamo kernel su misura che sovrappongono la comunicazione al calcolo indipendente dai dati e la inseriscono in pipeline con il lavoro dipendente dai dati.
L’attenzione, la cache, i kernel, il parallelismo, la memoria e la pianificazione influenzano tutti a vicenda. Ottimizzare solo un livello alla fine crea un collo di bottiglia altrove. I maggiori miglioramenti arriveranno trattando lo stack come un sistema completo progettato per il profilo computazionale della diffusione.
Con i nuovi modelli video che avvicinano i tempi di generazione al tempo reale, quanto siamo vicini a un video generativo veramente interattivo e quali ostacoli tecnici devono ancora essere superati prima che la generazione video in tempo reale diventi comune?
Stiamo già raggiungendo velocità interattive per alcune applicazioni. MachGen genera un video Vidu Q3 Turbo di cinque secondi a 720p in circa sei secondi e a 540p in meno di tre. È sufficientemente veloce per iterazioni creative rapide e rende gli avatar reattivi e il video interattivo alla portata di tutti.
Un esempio di ciò che, a mio avviso, significa interattivo. Immagina di stare guardando una storia e di poter vedere dove sta andando il finale, e che non ti piaccia. Invece di restare passivamente, la reindirizzi: quei due personaggi dovrebbero scoprire cosa nasconde il terzo e affrontarlo anziché lasciarlo svolgersi. Contenuto che guidi invece di contenuto che ricevi. È quello che la generazione rapida ed economica rende possibile, e cambia quasi tutto ciò che consumiamo.
Raggiungere questo obiettivo richiede comunemente più di un benchmark di latenza solido. L’intera esperienza deve rimanere reattiva sotto il traffico di produzione mantenendo la qualità visiva, la coerenza fotogramma per fotogramma e un costo prevedibile. Video più lunghi, risoluzioni più elevate e richieste concorrenti aumentano tutti il carico sull’infrastruttura, e il sistema deve comunque fornire capacità, instradare le richieste e riprendersi dai guasti hardware senza che l’utente se ne accorga.
Arriverà caso per caso. Clip brevi, avatar, videogiochi e strumenti creativi probabilmente saranno i primi, poiché una generazione misurata in secondi è già sufficiente per loro. Man mano che la qualità del modello e le prestazioni di inferenza migliorano insieme, più applicazioni supereranno quella soglia.
Man mano che gli agenti IA generano sempre più autonomamente immagini e video invece di attendere che un umano prema un pulsante, come cambiano i requisiti dell’infrastruttura? I carichi di lavoro guidati dagli agenti creano esigenze fondamentalmente diverse in termini di latenza, concorrenza, costo e affidabilità?
Un agente trasforma una singola richiesta dell’utente in decine o centinaia di lavori di generazione. Crea diverse opzioni, le valuta, rivede il prompt e ripete il processo, senza alcun intervento umano tra i passaggi.
Ciò rende latenza, concorrenza, costo e affidabilità molto più importanti. Se ogni generazione richiede minuti, il flusso di lavoro dell’agente è troppo lento per essere utile. Se ogni tentativo è costoso, l’iterazione autonoma diventa economicamente impraticabile. Il sistema deve inoltre gestire molte richieste simultanee in modo affidabile, poiché un singolo guasto può interrompere l’intera catena di lavoro.
Qui è dove funzionalità come il provisioning di GPU, l’autoscaling e l’instradamento contano tanto quanto l’ottimizzazione a livello di modello. La domanda degli agenti è molto più irregolare rispetto a quella di un’applicazione creativa in cui una persona preme un pulsante.
L’unità di lavoro rilevante non è più una singola immagine o video. È l’intero ciclo di generazione, valutazione e perfezionamento del contenuto. L’infrastruttura deve rendere quel ciclo completo veloce, conveniente e affidabile.
C’è una forte concorrenza tra fornitori di GPU, cloud di inferenza, sviluppatori di modelli e piattaforme di ottimizzazione. Man mano che l’hardware stesso diventa più veloce, perché le aziende avrebbero ancora bisogno di uno strato di inferenza specializzato come MachGen invece di affidarsi ai miglioramenti di NVIDIA, AMD, dei provider cloud o degli stessi sviluppatori di modelli?
Hardware più veloce alza il limite. Il software determina quanto di quel limite sarà effettivamente raggiunto.
Abbiamo osservato questo con i LLM. I nuovi acceleratori hanno migliorato le prestazioni grezze a ogni generazione, e il batching continuo, la gestione della KV‑cache, il decoding speculativo e i kernel specializzati sono stati comunque ciò che ha portato l’industria a una capacità e a un’economia a livello di produzione. Nulla di tutto ciò è derivato dall’hardware.
Ottimizzare continuamente l’intero percorso di produzione per la generazione di immagini e video è un compito diverso da quello che svolgono i fornitori di hardware, i provider cloud e gli sviluppatori di modelli, e non è una priorità principale per nessuno di loro.
Esistono diversi approcci a questo compito. Uno è il modello di marketplace, in cui i modelli vengono aggregati e le richieste instradate. Non riteniamo che sia difendibile a lungo termine, perché non si ha controllo sul livello in cui risiede le prestazioni. Abbiamo scelto di costruire lo stack internamente e di ospitarlo nativamente, l’unico modo per raggiungere i valori di latenza e costo che osserviamo.
Ciò significa ottimizzare l’attenzione, la cache, i kernel, la precisione, la memoria e il parallelismo per modello e per acceleratore, oltre a supportare API gestite, cloud dedicato e distribuzione self‑hosted. Man mano che aumenta il numero di modelli e di opzioni hardware, cresce anche la complessità. Il nostro ruolo è assorbirla, così i nostri clienti possono dedicare il loro tempo a ciò che differenzia i loro prodotti.
Hai descritto i world model come parte della visione a lungo termine di MachGen, con molte delle loro caratteristiche computazionali simili ai carichi di lavoro di diffusione. Come dovrebbe essere l’infrastruttura per world model su scala di produzione e quali applicazioni diventerebbero possibili se la generazione e la simulazione di ambienti visivi dovessero diventare, alla fine, economiche e reattive quanto lo è oggi la generazione di testo?
Un modo per concepire la nostra piattaforma è paragonarla a un LLM a uso generale. Lo stesso modello redige un contratto legale e risponde a una domanda sui ristoranti. Per noi, la stessa stack serve le aziende di avatar video, la pubblicità AI, la generazione di storie e microdramma, e, in futuro, i world model. Settori diversi, un unico insieme di problemi di prestazioni sottostanti.
I world model non sono il nostro core business attuale, ma sono ciò verso cui stiamo costruendo e su cui lavoriamo attivamente. I world model su scala di produzione richiederanno una larghezza di banda molto elevata e una latenza molto bassa, poiché generano e aggiornano continuamente un ambiente anziché produrre un singolo output. Necessitano inoltre di coerenza spaziale e temporale, della capacità di rispondere alle azioni e, spesso, della possibilità di simulare simultaneamente molteplici esiti possibili. Ciò genera problemi complessi di memoria, spostamento dei dati, parallelismo e affidabilità. Un world model che controlla un robot o un gioco non può impiegare minuti per produrre lo stato successivo. Le prestazioni determinano se questi sistemi sono utilizzabili o meno.
Dal punto di vista computazionale, i world model odierni assomigliano molto ai modelli di diffusione, quindi lo stack che stiamo costruendo ora è la base naturale. Non esiste ancora uno strato di serving maturo a livello di produzione per essi, comparabile a quello disponibile per i LLM. Abbiamo intenzione di costruirlo.
Se la simulazione diventerà tanto reattiva e conveniente quanto lo è oggi la generazione di testo, i robot potranno provare situazioni rare prima di incontrarle, i giochi potranno generare ambienti che rispondono ai singoli giocatori e i designer potranno testare decine di possibilità prima di realizzarle nel mondo fisico. La diffusione è il settore in cui guadagniamo oggi. I world model sono la nostra stella polare.
Grazie per la splendida intervista, i lettori che desiderano saperne di più dovrebbero visitare MachGen AI.












