Haastattelut
Kismat Singh, yhteisperustaja ja toimitusjohtaja MachGen AI – Haastattelusarja

Kismat Singh, yhteisperustaja ja toimitusjohtaja MachGen AI, on tekoälyinfrastruktuurin ja -insinöörityön johtaja, jolla on yli kaksikymmentä vuotta kokemusta suorituskykyisten laskenta- ja koneoppimisjärjestelmien rakentamisesta. Ennen MachGen AI:n perustamista Singh toimi Intelin AI Frameworks -osaston teknologiajohtajana (VP of Engineering) ja on aiemmin työskennellyt vanhempina insinööritehtävissä NVIDIAlla, AMD:llä, HP:llä ja muissa teknologiayrityksissä. Hänen työnsä on sisältänyt panoksia syväoppimiskirjastoihin ja -kääntäjiin, AI‑kehysten optimointiin sekä massiivisen mittakaavan koulutuksen kestävyyden parantamiseen. Intelillä hän oli tiiviisti mukana yrityksen PyTorch‑aloitteissa ja puhui julkisesti AI‑kehysten saavutettavuuden parantamisesta eri laitteistoalustoilla.
MachGen AI on tekoälyinfrastruktuuriyritys, jonka tavoitteena on tehdä generatiivisista kuva- ja videomalleista huomattavasti nopeampia ja taloudellisempia käyttää. Kismat Singhin ja Manoj Krishnanin perustama yritys kehittää suorituskykyistä inferenssi- ja hienosäätöpinopinoa, joka on erityisesti suunniteltu diffuusio-malleille sen sijaan, että sovellettaisiin alun perin suurille kielimalleille rakennettua infrastruktuuria. MachGen optimoi alueita kuten huomion laskenta, välimuisti, GPU‑ytimet, muistinhallinta, rinnakkaisuus, ajoitus ja käyttöönotto vähentääkseen generoinnin viivettä säilyttäen mallin laadun. Sen alusta tarjoaa API-rajapintoja tekstistä kuvaan, kuva-kuvaan, teksti‑videoon, kuva‑videoon ja referenssi‑videoon -generointiin, ja sen taustalla oleva teknologia mahdollistaa matalan viiveen sovelluksia, kuten interaktiivisen sisällön luomisen, reaaliaikaiset avatarit, pelit ja personoitu mainonta.
Olet työskennellyt yli kaksi vuosikymmentä videoiden, GPU‑laskennan ja tekoälyn suorituskyvyn parissa, mukaan lukien TensorRT NVIDIAlla, AI‑ohjelmistot Intelillä, GPU‑optimointi AMD:llä sekä aikaisempi työ reaaliaikaisen videokoodauksen parissa. Mitä näit näiden vuosien aikana, mikä lopulta vakuutti sinut jättämään suurten teknologiayritysten palveluksen ja perustamaan MachGenin, ja miksi uskoit, että diffuusio‑inferenssi on infrastruktuuri‑ongelma, jonka ympärille yritys kannattaa rakentaa?
Yhteisperustajani Manoj ja minä pelasimme sulkapalloa samassa kuntosalissa lähes 10 vuotta. Suurin osa siitä ajasta yritimme palkata toisiamme. Lopulta päätimme, että on helpompaa työskennellä yhdessä kuin jatkaa toistemme rekrytointia.
Syynä, että valitsimme tämän ongelman, on se, että olemme molemmat seuranneet inferenssipinon kehittymistä sisältäpäin. Autoin rakentamaan NVIDIA:n inferenssi‑alustatiimin ja johdin sen jälkeen AI‑ohjelmistoja Intelillä. Manoj rakensi suurten mallien koulutusinfrastruktuurin PyTorchin takana Metassa. Olemme nähneet, kuinka vuosien työtä välimuistien, eräajon, ajoituksen ja ytimen parissa on muokannut varhaiset LLM‑tutkimusjärjestelmät tuotantoinfrastruktuuriksi, jotka palvelevat biljoonia tokeneita.
Diffuusio on suurin piirtein siinä vaiheessa, jossa LLM‑inferenssi oli kolme vuotta sitten. Kuva- ja videomallit ovat kehittyneet nopeasti, mutta niiden palvelevat järjestelmät ovat edelleen hitaita, kalliita ja vaikeita skaalata. Suurin osa nykyisestä infrastruktuurista on suunniteltu LLM:eille, ja diffuusio on lisätty myöhemmin.
Kolme tekijää, jotka ajoittivat tilanteen oikein: mallit tulivat riittävän hyviksi todellisten tuotteiden rakentamiseen, ongelma vaati juuri niitä taitoja, joita olemme uramme aikana kehittäneet, ja vaikutus on niin suuri, että sen ympärille voidaan rakentaa sukupolvien välinen yritys. Kun video, jonka tuottaminen aiemmin kesti useita minuutteja, voidaan luoda sekunneissa murto‑osalla kustannuksista, interaktiivinen generointi, personoitu mainonta, reaaliaikaiset avatarit ja täysin uudet luovat tuotteet tulevat mahdollisiksi.
MachGen väittää, että monet suuria kielimalleja muuttaneet tekniikat eivät siirry puhtaasti diffuusio‑malleihin. Mikä on olennaisesti erilaista kuva- ja videomallien palvelemisessa, ja missä ovat suurimmat suorituskyvyn pullonkaulat, jotka perinteinen AI‑infrastruktuuri usein jättää huomiotta?
LLM:t ja diffuusio‑mallit noudattavat perustavanlaatuisesti erilaisia laskentamalleja. LLM:t ovat autoregressiivisiä, joissa on laskennallisesti raskas esitäyttö (prefill) ja sen jälkeen muistirajoitettu, token‑kerrallaan tapahtuva dekoodaus. Tekniikat kuten KV‑välimuisti ja esitäyttö‑dekoodaus‑erottelu on suunniteltu juuri tätä rakennetta varten.
Diffuusio‑mallit eivät ole autoregressiivisiä ja pysyvät laskentavetoisina koko denoisointiprosessin ajan. Videogenerointi sisältää myös suuria määriä spatiaalista ja aikapohjaista dataa, mikä asettaa erilaisia vaatimuksia huomion, muistin, viestinnän ja rinnakkaisuuden suhteen.
Tämän seurauksena monet LLM:ille kehitetyt optimoinnit eivät siirry puhtaasti. Perinteinen KV‑välimuisti ei ratkaise samaa ongelmaa, tavallinen rinnakkaisuus voi aiheuttaa merkittävää viestintäkuormitusta, ja saatavilla olevat avoimen lähdekoodin ytimet ovat paljon vähemmän kehittyneitä. Aikatauluttaja, muistimalli, välimuististrategia, ytimet ja rinnakkaisuus on suunniteltava diffuusio‑mallin ympärille. Siksi rakensimme MachGenin siten, että diffuusio on ensisijainen komponentti.
MachGen raportoi noin 4–6‑kertaisesti alhaisemmasta viiveestä joillakin kuva‑malleilla ja noin 6‑kertaisesta parannuksesta useilla video‑malleilla ajettaessa alkuperäisiä, tislattomia malleja. Mitkä ovat tärkeimmät tekniset läpimurrot näiden hyötyjen takana, ja miten varmistatte, että suorituskyvyn parannukset eivät heikennä lopputuloksen laatua?
Hyödyt tulevat useista pinon osista, jotka toimivat yhdessä. Huomio hallitsee laskentabudjettia monissa videomalleissa, joten keskitymme alhaisemman tarkkuuden resepteihin, harvaan huomioon ja niihin liittyviin tekniikoihin. Olemme myös kehittäneet välimuistimenetelmiä, jotka hyödyntävät spatiaalista ja aikapohjaista redundanssia, erittäin optimoituja ytimiä diffuusiomalleille ja rinnakkaisuustekniikoita, jotka vähentävät viestintäkuormitusta.
Yhdessä nämä parannukset mahdollistavat MachGenin tuottavan HiDreamin sekunnissa yhden sekunnin verrattuna kuuteen sekuntiin ja Fluxin 1.5 sekunnissa verrattuna 6.2 sekuntiin. Videolle Wan 2.2 suoriutuu 16.5 sekunnissa verrattuna 98 sekuntiin, kun taas LTX 2.3 suoriutuu 10.7 sekunnissa verrattuna 67 sekuntiin. Inferenzikustannukset ovat myös 2–4x alhaisemmat kuvamalleille ja 2–3x alhaisemmat videoille.
Nämä tulokset perustuvat alkuperäisiin, tislattomiin malleihin. Parannamme mallien suoritusta tinkimättä tulosteen laadusta. Tuotantokäyttöönotossa nopeuden, kustannusten ja laadun on toimittava yhdessä.
Trusted TV on mielenkiintoinen esimerkki, koska generaation lyhentäminen minuuteista sekunneiksi muuttaa enemmän kuin pelkkä infrastruktuurilasku. Kun videogenerointi on riittävän nopeaa tuottamaan tuhansia kampanjoita ja personoituja luovia variaatioita, millaisia uusia liiketoimintamalleja tai tuotekokemuksia voi syntyä, joita ei aiemmin ollut kannattavaa toteuttaa?
TrustedTV auttaa yrityksiä luomaan lähetettävään televisioon soveltuvia mainoksia tekoälyn avulla ja sijoittamaan ne eri yhdistettyihin TV-alustoihin, kuten Prime Video, Roku ja DirecTV. Monet sen asiakkaista ovat pieniä yrityksiä. Perinteinen TV-mainoksen tekeminen vaati elokuvan- ja leikkausryhmän, ja kustannukset alkoivat tuhansista dollareista ja nousivat yleensä kymmeniin tuhansiin dollareihin. Trusted TV vie sen nollaan. Pieni yritys voi luoda täyden mainoksen älypuhelimella noin viidessä minuutissa ja nähdä sen ennen kuin maksaa mitään. Alustalla on luotu yli 10 000 kampanjaa.
Ian, Trusted TV:n toimitusjohtaja, näki MachGenin latenssivertailun Artificial Analysis -sovelluksessa eikä uskonut sitä. Hän ilmoittautui testaamaan sitä itse. Hänen ensimmäinen renderöintinsä palautui noin 25 sekunnissa ilman laadun heikkenemistä, ja kun hän suoritti samanaikaisuus testejä, parannukset kestäivät mittakaavassa. He siirsivät koko tuotantotyönkulunsa MachGeniin alle 48 tunnissa, ja MachGen ohjaa nyt kaikkia heidän uusia videotuotantojaan. Viimeisimmässä käyttöönotossa olemme lähellä 10–11 sekuntia kyseisessä mallissa, ja jatkamme sen parantamista.
Tuotteen vaikutus on, että mainostajat lopettavat yhden tai kahden yleisen mainoksen tekemisen. Heidän käyttäjänsä kierrättävät kaksi tai kolme uutta mainosta viikossa, testaavat luovuutta eri yleisösegmenttien välillä ja iteroivat sen sijaan, että sitoutuisivat. Seuraavaksi tulee maantieteellinen ja yleisötason personointi suuressa mittakaavassa, mikä aiemmin oli varattu vain monen miljoonan dollarin budjettia omaaville yrityksille.
Versio, jonka mietin henkilökohtaisesti: Tänään saan lenkkarit-mainoksen, joka on kuvattu Manhattanin kadulla. Asun Bay Area -alueella, joten se ei merkitse minulle mitään. Haluan saman mainoksen, jossa taustalla on Mission Peak. Se ei ole halvempi mainos; se on erilaista mainontaa, ja siitä tulee taloudellisesti kannattavaa vain, kun generointi on tarpeeksi nopeaa ja edullista tuottamaan tuhansia variaatioita.
Yrityksille, jotka upottavat kuvan- tai videogeneroinnin suoraan tuotteisiinsa, miten niiden tulisi ajatella inferenssin taloutta? Missä mittakaavassa GPU:n hyödyntämisen optimointi muuttuu strategisesti tärkeäksi sen sijaan, että maksaisi pelkästään API-palveluntarjoajalle jokaisesta generoinnista?
Käännekohta saavutetaan, kun inferenssi alkaa vaikuttaa joko asiakaskokemukseen tai yrityksen katteisiin.
Yleiskäyttöinen API voi olla järkevä, kun tiimi testaa tuotetta. Kun generointi nousee tuotteen keskeiseksi osaksi, tiimien on tarkasteltava hintaa per tuotettu tulos listatun hinnan lisäksi. Latenssi, samanaikaisuus, laatu, luotettavuus ja GPU:n hyödyntäminen kaikki tulevat osaksi taloutta.
Generointi saattaa vaikuttaa edulliselta, mutta se aiheuttaa silti liiketoimintaongelman, jos käyttäjien täytyy odottaa useita minuutteja ja hylätä työnkulku. Arkkitehtuuri, joka vaatii GPU-kapasiteetin kasvavan samassa tahdissa kuin käyttö, asettaa myös kasvavaa painetta katteisiin.
Yhtä ainoaa pyyntömäärän raja-arvoa ei ole, koska lyhyen 540p‑videoleikkeen vaatima laskentateho poikkeaa merkittävästi pidemmän 1080p‑videon vaatimuksista. Optimointi muuttuu strategiseksi, kun kasvava käyttö nostaa kustannuksia lähes samassa tahdissa, huippukysyntä aiheuttaa jonoja tai latenssi alkaa rajoittaa tuotteen käyttökokemusta.
MachGen toimii useilla tasoilla, mukaan lukien mukautetut GPU-ytimet, välimuisti, tarkkuusoptimointi, ajoitus ja rinnakkaisuus. Kun mallit kehittyvät nopeasti, mikä inferenssikasan taso tarjoaa mielestäsi suurimman jäljellä olevan mahdollisuuden dramaattisiin nopeus- ja kustannusparannuksiin?
Videogeneroinnissa attention on yksi suurimmista jäljellä olevista mahdollisuuksista, koska se hallitsee laskentabudjettia monissa malleissa. Alhaisemman tarkkuuden resepteissä, harvassa attentionissa ja diffuusioon spesifisissä attention-ytimissä on edelleen merkittävästi parannusmahdollisuuksia.
Attention on vain yksi osa mahdollisuutta. Suurimmat kokonaisparannukset syntyvät, kun yhdistetään parannuksia koko pinossa. Välimuisti on yksi esimerkki. LLM-malleissa käytetyt KV‑välimuistitekniikat eivät siirry suoraan, mutta diffuusiomallit sisältävät spatiaalista ja aikapohjaista redundanssia, jota voidaan hyödyntää oikealla lähestymistavalla.
Rinnakkaisuus tarjoaa toisen mahdollisuuden. GPU:iden lisääminen ei automaattisesti tuota suhteellista nopeutusta, koska viestintäylijäämä voi kumota hyödyn. Kehitämme räätälöityjä ytimiä, jotka päällekkäin suorittavat viestinnän data‑riippumattoman laskennan kanssa ja putkittavat sen data‑riippuvaisen työn kanssa.
Huomio, välimuisti, ytimet, rinnakkaisuus, muisti ja ajoitus vaikuttavat kaikki toisiinsa. Vain yhden kerroksen optimointi lopulta aiheuttaa pullonkaulan jossain muualla. Suurimmat parannukset tulevat, kun pinoa käsitellään kokonaisvaltaisena järjestelmänä, joka on suunniteltu diffusionin laskennalliseen profiiliin.
Kun uudemmat videomallit vievät generointiaikoja lähemmäs reaaliaikaa, kuinka lähellä olemme todellisesti interaktiivista generatiivista videota, ja mitkä tekniset esteet on vielä voitettava, ennen kuin reaaliaikainen videogenerointi yleistyy?
Olemme jo saavuttaneet interaktiivisia nopeuksia tietyissä sovelluksissa. MachGen tuottaa viiden sekunnin Vidu Q3 Turbo -videon 720p-resoluutiolla noin kuudessa sekunnissa ja 540p-resoluutiolla alle kolmessa sekunnissa. Se on riittävän nopea nopeaan luovaan iterointiin ja tuo reagoivat avatarit ja interaktiivisen videon ulottuville.
Esimerkki siitä, mitä pidän interaktiivisena. Kuvittele, että katsot tarinaa ja näet, mihin loppu on menossa, etkä pidä siitä. Sen sijaan, että istuisit passiivisesti, ohjaat sitä: niiden kahden hahmon pitäisi selvittää, mitä kolmas piilottaa, ja kohdata hänet sen sijaan, että tarina vain jatkuu. Sisältöä, jota ohjaat, eikä vain vastaanotat. Tämä on se, mitä nopea ja edullinen generointi mahdollistaa, ja se muuttaa lähes kaikkea, mitä kulutamme.
Saavuttaakseen sen vaaditaan yleensä useampi kuin yksi vahva latenssikoe. Koko kokemuksen on pysyttävä reagoivana tuotantoliikenteessä säilyttäen visuaalinen laatu, ruutu‑ruutu‑yhtenäisyys ja ennustettava kustannus. Pidemmät videot, korkeammat resoluutiot ja samanaikaiset pyynnöt lisäävät infrastruktuurin kuormitusta, ja järjestelmän on edelleen varmistettava kapasiteetti, reititettävä pyynnöt ja palautettava toiminta laitteistovioista ilman, että käyttäjä huomaa.
Se saapuu tapaus kerrallaan. Lyhyet leikkeet, avatarit, pelit ja luovat työkalut todennäköisesti tulevat ensin, koska sekunneissa mitattu generointi riittää jo heille. Kun mallin laatu ja inferenssisuorituskyky paranevat yhdessä, yhä useammat sovellukset ylittävät sen kynnyksen.
Kun tekoälyagentit yhä enemmän tuottavat kuvia ja videoita itsenäisesti sen sijaan, että odottaisivat ihmisen painavan nappia, miten se muuttaa infrastruktuurivaatimuksia? Luovatko agenttipohjaiset työkuormat perustavanlaatuisesti erilaisia vaatimuksia latenssin, samanaikaisuuden, kustannusten ja luotettavuuden suhteen?
Agentti muuntaa yhden käyttäjän pyynnön kymmeniksi tai sadoiksi generointitehtäväksi. Se luo useita vaihtoehtoja, arvioi ne, tarkentaa kehotetta ja toistaa prosessin ilman ihmisen väliinputtia.
Tämä tekee latenssista, samanaikaisuudesta, kustannuksista ja luotettavuudesta paljon tärkeämpiä. Jos jokainen generointi kestää minuutteja, agentin työnkulku on liian hidas ollakseen hyödyllinen. Jos jokainen yritys on kallis, autonominen iterointi käy taloudellisesti epäkäytännölliseksi. Järjestelmän on myös käsiteltävä monet samanaikaiset pyynnöt luotettavasti, koska yksi vika voi keskeyttää koko työketjun.
Tässä kohtaa kyvyt kuten GPU‑varaus, automaattinen skaalaus ja reititys ovat yhtä tärkeitä kuin mallitasoinen optimointi. Agenttien kysyntä on paljon räjähdyksellisempi kuin luovan sovelluksen, jossa henkilö painaa nappia, kysyntä.
Relevantti työyksikkö ei ole enää yksittäinen kuva tai video. Se on koko silmukka sisällön generoinnista, arvioinnista ja hiomisesta. Infrastruktuurin on tehtävä tämä koko silmukka nopeaksi, edulliseksi ja luotettavaksi.
GPU‑toimittajien, inferenssi‑pilvien, mallinkehittäjien ja optimointialustojen välillä on kovaa kilpailua. Kun laitteisto itsessään nopeutuu, miksi yritykset edelleen tarvitsevat erikoistuneen inferenssikerroksen kuten MachGen sen sijaan, että luottaisivat NVIDIA:n, AMD:n, pilvipalveluiden tai mallinkehittäjien omiin parannuksiin?
Nopeampi laitteisto nostaa kattoa. Ohjelmisto määrää, kuinka paljon siitä katosta saavutetaan.
Näimme tämän tapahtuvan LLM:ien kanssa. Uudet kiihdyttimet paransivat raakasuorituskykyä jokaisessa sukupolvessa, ja jatkuva eräajo, KV‑välimuistin hallinta, spekulatiivinen dekoodaus ja erikoistuneet ytimet olivat edelleen ne tekijät, jotka saivat alan tuotantotason läpimenon ja taloudellisuuden. Mikään tästä ei tullut laitteistosta.
Kuvan ja videon generoinnin koko tuotantopolun jatkuva optimointi on eri tehtävä kuin mitä laitteistotoimittajat, pilvipalvelut ja mallinkehittäjät tekevät, eikä se ole kenenkään niiden keskeinen prioriteetti.
Tähän tehtävään on muutamia lähestymistapoja. Yksi on markkinapaikkamalli, jossa mallit kerätään ja reititetään pyynnöt. Emme usko, että se on pitkällä aikavälillä kestävä, koska suorituskyvyn tasoa ei voida hallita. Valitsimme rakentaa pinon itse ja isännöidä natiivisti, mikä on ainoa tapa saavuttaa havaitsemamme latenssi‑ ja kustannuslukemat.
Se tarkoittaa tarkkaavaisuuden, välimuistin, ytimien, tarkkuuden, muistin ja rinnakkaisuuden säätämistä mallikohtaisesti ja kiihdyttimittäin sekä hallittujen API:iden, omistetun pilven ja itseisännöidyn käyttöönoton tukemista. Mallien ja laitteistovaihtoehtojen määrän kasvaessa myös monimutkaisuus kasvaa. Roolimme on ottaa se vastaan, jotta asiakkaamme voivat käyttää aikansa tuotteidensa erottaviin tekijöihin.
Olet kuvannut maailmanmalleja osana MachGenin pitkän aikavälin visiota, ja niiden monia laskennallisia ominaisuuksia muistuttaa diffuusio‑työkuormia. Millainen infrastruktuuri tuotantotason maailmanmalleille tarvitaan, ja millaisia sovelluksia on mahdollista toteuttaa, jos visuaalisten ympäristöjen luominen ja simulointi lopulta olisi yhtä edullista ja reagoivaa kuin tekstin tuottaminen tänä päivänä?
Yksi tapa ajatella alustaamme on, että se muistuttaa yleiskäyttöistä LLM:ää. Sama malli laatii oikeudellisen sopimuksen ja vastaa ravintoloihin liittyviin kysymyksiin. Meille sama pinnoitus palvelee videoavatar‑yrityksiä, AI‑mainontaa, tarina‑ ja mikrodrama‑generointia, ja lopulta maailmanmalleja. Eri toimialoja, yksi joukko perus‑suorituskykyongelmia.
Maailmanmallit eivät ole nykyinen ydinliiketoimintamme, mutta ne ovat sitä, mihin rakennamme, ja työskentelemme niiden parissa aktiivisesti. Tuotantotason maailmanmallit vaativat erittäin suurta läpimenoa ja erittäin alhaista viivettä, koska ne luovat ja päivittävät ympäristön jatkuvasti sen sijaan, että tuottaisivat yhden tuloksen. Niiden on myös oltava tilallisesti ja aikaisesti johdonmukaisia, kyettävä reagoimaan toimintoihin ja usein kyettävä simuloimaan useita mahdollisia lopputuloksia samanaikaisesti. Tämä aiheuttaa vaikeita ongelmia muistissa, datan siirrossa, rinnakkaisuudessa ja luotettavuudessa. Maailmanmalli, joka ohjaa robottia tai peliä, ei voi käyttää minuutteja seuraavan tilan tuottamiseen. Suorituskyky päättää, ovatko nämä järjestelmät lainkaan käyttökelpoisia.
Laskennallisesti nykyiset maailmanmallit muistuttavat paljon diffuusio‑malleja, joten nyt rakennettava pinnoitus on luonnollinen perusta. Niille ei ole vielä kypsää tuotantotason palvelukerrosta, verrattavissa siihen, mitä LLM:ille on olemassa. Aiomme rakentaa sen.
Jos simulointi saa yhtä reagoivan ja edullisen kuin tekstin generointi on nyt, robotit voivat harjoitella harvinaisia tilanteita ennen niiden kohtaamista, pelit voivat luoda ympäristöjä, jotka reagoivat yksittäisiin pelaajiin, ja suunnittelijat voivat testata kymmeniä mahdollisuuksia ennen kuin ne toteutetaan fyysisessä maailmassa. Diffuusio on se, mistä ansaitsemme elantomme tänään. Maailmanmallit ovat meidän Pohjantähdistömme.
Kiitos erinomaisesta haastattelusta, lukijat, jotka haluavat oppia lisää, kannattaa käydä osoitteessa MachGen AI.












