Interviuri

Kismat Singh, co-fondator și CEO al MachGen AI – Seria de interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Kismat Singh, co-fondator și CEO al MachGen AI, este un executiv în infrastructura și ingineria AI cu peste două decenii de experiență în construirea de sisteme de calcul de înaltă performanță și învățare automată. Înainte de a co-fonda MachGen AI, Singh a ocupat funcția de vicepreședinte de inginerie pentru cadre AI la Intel și anterior a deținut roluri de inginer senior la NVIDIA, AMD, HP și alte companii tehnologice. Munca sa a inclus contribuții la biblioteci și compilatoare de învățare profundă, optimizarea cadrelor AI și îmbunătățiri ale rezilienței antrenamentului la scară hiperscală. La Intel, a fost implicat îndeaproape în inițiativele PyTorch ale companiei și a vorbit public despre facilitarea accesului la cadrele AI pe diferite platforme hardware.

MachGen AI este o companie de infrastructură AI concentrată pe a face modelele generative de imagini și video mult mai rapide și mai economice de rulat. Fondată de Kismat Singh și Manoj Krishnan, compania dezvoltă un stack de inferență și fine‑tuning de înaltă performanță conceput special pentru modele de difuzie, în loc să adapteze infrastructura inițial creată pentru modele de limbaj mari. MachGen optimizează domenii precum calculul atenției, caching‑ul, nucleele GPU, gestionarea memoriei, paralelismul, programarea și implementarea pentru a reduce latența generării menținând calitatea modelului. Platforma sa oferă API‑uri pentru generare text‑la‑imagine, imagine‑la‑imagine, text‑la‑video, imagine‑la‑video și referință‑la‑video, cu tehnologia de bază menită să permită aplicații cu latență scăzută, cum ar fi crearea interactivă de conținut, avatare în timp real, jocuri și publicitate personalizată.

Ați petrecut peste două decenii lucrând la video, calcul GPU și performanță AI, inclusiv TensorRT la NVIDIA, software AI la Intel, optimizare GPU la AMD și lucrări anterioare privind codarea video în timp real. Ce ați observat în acei ani care v-a convins în final să părăsiți companiile tehnologice mari și să co-fondați MachGen și de ce ați crezut că inferența difuziei reprezintă problema de infrastructură care merită să fie construită ca o companie?

Co-fondatorul meu, Manoj, și eu am jucat badminton în aceeași sală de sport timp de aproape 10 ani. Pentru cea mai mare parte a acelei perioade, încercam să angajăm pe celălalt. În cele din urmă am decis că este mai ușor să lucrăm împreună decât să ne recrutăm în continuare reciproc.

Motivul pentru care am ales această problemă este că am urmărit amândoi evoluția unui stack de inferență din interior. Am contribuit la construirea echipei de platformă de inferență a NVIDIA și apoi am condus software‑ul AI la Intel. Manoj a dezvoltat infrastructura de antrenament pentru modele mari din spatele PyTorch la Meta. Am observat cum ani de muncă asupra caching‑ului, batch‑ului, programării și nucleelor au transformat sistemele de cercetare LLM timpurii în infrastructură de producție care servește trilioane de tokenuri.

Difuzia se află aproximativ acolo unde era inferența LLM cu trei ani în urmă. Modelele de imagini și video au avansat rapid, dar sistemele care le servesc rămân lente, costisitoare și dificil de scalat. Majoritatea infrastructurii existente a fost concepută pentru LLM‑uri, cu difuzia adăugată ulterior.

Trei aspecte care au făcut momentul potrivit: modelele au devenit suficient de bune pentru a construi produse reale, problema necesita exact abilitățile pe care le-am dezvoltat în carierele noastre, iar impactul este suficient de mare pentru a construi în jurul său o companie de generație. Când un video care odată dura câteva minute poate fi generat în secunde la o fracțiune din cost, generarea interactivă, publicitatea personalizată, avatarele în timp real și produse creative complet noi devin posibile.

MachGen susține că multe dintre tehnicile care au transformat inferența modelelor de limbaj mari nu se transferă curat la modelele de difuzie. Ce este fundamental diferit în servirea modelelor de imagini și video și unde se află cele mai mari blocaje de performanță pe care infrastructura AI convențională tinde să le omită?

LLM‑urile și modelele de difuzie au modele computaționale fundamental diferite. LLM‑urile sunt autoregresive, având o etapă de preumplere intensivă din punct de vedere al calculului, urmată de o decodare limitată de memorie, token cu token. Tehnici precum caching‑ul KV și desagregarea preumplere/decodare au fost concepute în jurul acestei structuri.

Modelele de difuzie nu sunt autoregresive și rămân limitate de calcul pe tot parcursul procesului de denoising. Generarea video implică, de asemenea, cantități mari de date spațiale și temporale, creând cerințe diferite în ceea ce privește atenția, memoria, comunicarea și paralelismul.

Ca rezultat, multe dintre optimizările dezvoltate pentru LLM‑uri nu se transferă curat. Caching‑ul KV convențional nu rezolvă aceeași problemă, paralelismul standard poate introduce o suprasarcină semnificativă de comunicare, iar nucleele open‑source disponibile sunt mult mai puțin mature. Scheduler‑ul, modelul de memorie, strategia de caching, nucleele și paralelismul trebuie toate să fie concepute în jurul difuziei în sine. De aceea am construit MachGen având difuzia ca un cetățean de primă clasă.

MachGen raportează aproximativ o latență cu 4–6 ori mai mică pe unele modele de imagini și în jur de 6 ori îmbunătățiri pe mai multe modele video, în timp ce rulează modelele originale, nedistilate. Care sunt cele mai importante inovații tehnice din spatele acestor progrese și cum vă asigurați că îmbunătățirile de performanță nu vin în detrimentul calității rezultatelor?

Câștigurile provin din mai multe părți ale stack-ului care lucrează împreună. Atenția domină bugetul de calcul în multe modele video, așa că ne concentrăm pe rețete cu precizie redusă, atenție rară și tehnici conexe. De asemenea, am dezvoltat metode de caching care exploatează redundanța spațială și temporală, nuclee extrem de optimizate pentru arhitecturi de difuzie și tehnici de paralelism care reduc supraîncărcarea comunicațiilor.

Împreună, aceste îmbunătățiri permit MachGen să livreze HiDream în o secundă, comparativ cu șase secunde, și Flux în 1,5 secunde, comparativ cu 6,2 secunde. Pentru video, Wan 2.2 rulează în 16,5 secunde versus 98 de secunde, în timp ce LTX 2.3 rulează în 10,7 secunde versus 67 de secunde. Costurile de inferență sunt, de asemenea, cu 2–4 ori mai mici pentru modelele de imagini și cu 2–3 ori mai mici pentru video.

Aceste rezultate utilizează modelele originale, nedistilate. Îmbunătățim modul în care rulează modelele fără a sacrifica calitatea ieșirii. Pentru adoptarea în producție, viteza, costul și calitatea trebuie să lucreze împreună.

Trusted TV este un exemplu interesant deoarece reducerea generării de la minute la secunde schimbă mai mult decât factura de infrastructură. Odată ce generarea video devine suficient de rapidă pentru a produce mii de campanii și variații creative personalizate, ce noi modele de afaceri sau experiențe de produs devin posibile, care pur și simplu nu erau viabile anterior?

TrustedTV ajută afacerile să creeze reclame pregătite pentru difuzare cu AI și să le plaseze pe platforme de TV conectate precum Prime Video, Roku și DirecTV. Mulți dintre clienții săi sunt întreprinderi mici. Realizarea unei reclame TV în mod tradițional necesita o echipă de filmare și editare, cu costuri care începeau de la câteva mii de dolari și de obicei ajungeau la zeci de mii de dolari. Trusted TV reduce acest cost la zero. Un proprietar de afacere mică poate crea o reclamă completă de pe un smartphone în aproximativ cinci minute și o poate vizualiza înainte de a plăti ceva. Peste 10.000 de campanii au fost create pe platformă.

Ian, CEO-ul Trusted TV, a văzut benchmark-ul de latență al MachGen pe Artificial Analysis și nu i-a crezut. S-a înscris pentru a-l testa personal. Prima sa redare a revenit în aproximativ 25 de secunde, fără pierdere de calitate, și când a efectuat teste de concurență, îmbunătățirile s-au menținut la scară. Au mutat întregul flux de producție la MachGen în mai puțin de 48 de ore, iar MachGen alimentează acum toate noile lor creații video. În cea mai recentă implementare, suntem aproape de 10 sau 11 secunde pentru acel model și vom continua să îl îmbunătățim.

Efectul produsului este că advertiserii încetează să mai creeze una sau două reclame generale. Utilizatorii lor rotesc două sau trei reclame noi pe săptămână, testează creativitatea în diferite segmente de audiență și iterează în loc să se angajeze. Ce urmează este personalizarea la nivel de geografie și audiență la scară, care anterior era rezervată companiilor cu bugete de milioane de dolari.

O versiune la care mă gândesc personal: Astăzi, primesc o reclamă pentru adidași filmată pe o stradă din Manhattan. Locuiesc în Bay Area, așa că nu are nicio semnificație pentru mine. Ce îmi doresc este aceeași reclamă cu Mission Peak în fundal. Nu este o reclamă mai ieftină; este un alt tip de publicitate și devine viabilă din punct de vedere economic doar când generarea este suficient de rapidă și ieftină pentru a produce mii de variante.

Pentru companiile care încorporează generarea de imagini sau video direct în produse, cum ar trebui să abordeze economia inferenței? La ce scară devine optimizarea utilizării GPU-ului strategic importantă, în loc să plătească pur și simplu un furnizor de API pentru fiecare generare?

Punctul de cotitură apare atunci când inferența începe să afecteze fie experiența clientului, fie marjele companiei.

Un API cu scop general poate avea sens în timp ce o echipă validează un produs. Odată ce generarea devine centrală pentru acel produs, echipele trebuie să privească dincolo de prețul listat pe rezultat. Latența, concurența, calitatea, fiabilitatea și utilizarea GPU-ului devin toate parte a economiei.

O generare poate părea ieftină, dar creează totuși o problemă de afaceri dacă utilizatorii trebuie să aștepte câteva minute și abandonează fluxul de lucru. O arhitectură care necesită ca capacitatea GPU să crească în același ritm cu utilizarea va exercita, de asemenea, o presiune tot mai mare asupra marjelor.

Nu există un prag unic de volum de cereri, deoarece calculul necesar pentru un clip scurt de 540p este foarte diferit de cel pentru un video mai lung de 1080p. Optimizarea devine strategică când creșterea utilizării determină costurile să crească aproape în același ritm, cererea maximă creează cozi sau latența începe să limiteze experiența produsului.

MachGen funcționează pe mai multe niveluri, inclusiv nuclee GPU personalizate, caching, optimizare a preciziei, programare și paralelism. Pe măsură ce modelele continuă să evolueze rapid, care nivel al stack-ului de inferență credeți că oferă cea mai mare oportunitate rămasă pentru îmbunătățiri dramatice în viteză și cost?

Pentru generarea video, atenția reprezintă una dintre cele mai mari oportunități rămase, deoarece domină bugetul de calcul în multe modele. Există încă spațiu semnificativ pentru a îmbunătăți rețetele cu precizie redusă, atenția rară și nucleele de atenție specifice difuziei.

Atenția este doar o parte a oportunității. Cele mai mari câștiguri globale vor veni din combinarea îmbunătățirilor pe întregul stack. Caching-ul este un exemplu. Tehnicile de caching KV utilizate în LLM-uri nu se transferă direct, dar modelele de difuzie conțin redundanță spațială și temporală care poate fi exploatată cu abordarea potrivită.

Paralelismul reprezintă o altă oportunitate. Adăugarea de GPU-uri nu produce automat o creștere proporțională a vitezei, deoarece supraîncărcarea de comunicare poate compensa beneficiul. Dezvoltăm nuclee personalizate care suprapun comunicarea cu calculul independent de date și le înlănțuie cu sarcini dependente de date.

Atenția, caching‑ul, nucleele, paralelismul, memoria și programarea se influențează reciproc. Optimizarea unei singure straturi creează în cele din urmă un blocaj în altă parte. Cele mai mari îmbunătățiri vor veni din tratarea întregului stack ca un sistem complet conceput pentru profilul computațional al difuziei.

Pe măsură ce modelele video noi reduc timpii de generare aproape de timp real, cât de aproape suntem de un video generativ cu adevărat interactiv și ce bariere tehnice mai trebuie depășite înainte ca generarea video în timp real să devină obișnuită?

Deja atingem viteze interactive pentru anumite aplicații. MachGen generează un video Vidu Q3 Turbo de cinci secunde la 720p în aproximativ șase secunde și la 540p în sub trei secunde. Este suficient de rapid pentru iterații creative rapide și aduce în prim‑plan avatarele receptive și video‑ul interactiv.

Un exemplu al a ceea ce consider interactiv. Imaginează‑ți că urmărești o poveste și poți vedea încotro se îndreaptă finalul, iar nu îți place. În loc să stai pasiv, redirecționezi acțiunea: acei doi personaje ar trebui să afle ce ascunde al treilea și să îl confrunte în loc să lase povestea să se desfășoare. Conținut pe care îl controlezi în loc să îl primești. Asta este ceea ce permite generarea rapidă și ieftină și schimbă aproape tot ce consumăm.

Atingerea acestui nivel necesită, de obicei, mai mult de un benchmark solid de latență. Întreaga experiență trebuie să rămână receptivă sub trafic de producție, menținând calitatea vizuală, consistența cadru‑la‑cadru și costul previzibil. Videoclipurile mai lungi, rezoluțiile mai mari și cererile concurente cresc povara infrastructurii, iar sistemul trebuie în continuare să aloce capacitate, să direcționeze cererile și să se recupereze din defecțiuni hardware fără ca utilizatorul să observe.

Va apărea treptat, caz cu caz. Clipurile scurte, avatarele, jocurile și instrumentele creative vor fi probabil primele, deoarece generarea în câteva secunde este deja suficientă pentru ele. Pe măsură ce calitatea modelului și performanța inferenței se îmbunătățesc simultan, tot mai multe aplicații vor depăși acest prag.

Pe măsură ce agenții IA generează din ce în ce mai des imagini și videoclipuri în mod autonom, fără să aștepte ca un om să apese un buton, cum se modifică cerințele de infrastructură? Crează sarcini conduse de agenți cerințe fundamental diferite în ceea ce privește latența, concurența, costul și fiabilitatea?

Un agent transformă o singură cerere a utilizatorului în zeci sau sute de sarcini de generare. Creează mai multe opțiuni, le evaluează, revizuiește promptul și repetă procesul, fără intervenție umană între pași.

Acest lucru face ca latența, concurența, costul și fiabilitatea să devină mult mai importante. Dacă fiecare generare durează minute, fluxul de lucru al agentului este prea lent pentru a fi util. Dacă fiecare încercare este costisitoare, iterația autonomă devine economic impracticabilă. Sistemul trebuie, de asemenea, să gestioneze multe cereri simultane în mod fiabil, deoarece o singură defecțiune poate întrerupe întreaga lanț de lucru.

Aici intră în joc capabilități precum aprovizionarea cu GPU, scalarea automată și rutarea, la fel de importante ca optimizarea la nivel de model. Cererea generată de agenți este mult mai „burst‑y” decât cea provenită dintr‑o aplicație creativă în care o persoană apasă un buton.

Unitatea relevantă de lucru nu mai este o singură imagine sau un singur video. Este bucla completă de generare, evaluare și rafinare a conținutului. Infrastructura trebuie să facă întreaga buclă rapidă, accesibilă și fiabilă.

Există o concurență intensă între furnizorii de GPU, cloud‑urile de inferență, dezvoltatorii de modele și platformele de optimizare. Pe măsură ce hardware‑ul devine mai rapid, de ce vor companiile avea în continuare nevoie de un strat de inferență specializat precum MachGen, în loc să se bazeze pe îmbunătățirile de la NVIDIA, AMD, furnizorii de cloud sau dezvoltatorii de modele înșiși?

Hardware‑ul mai rapid ridică plafonul. Software‑ul determină cât de mult din acel plafon va fi atins.

Am văzut acest lucru în cazul LLM‑urilor. Acceleratoarele noi au îmbunătățit performanța brută la fiecare generație, iar batch‑area continuă, gestionarea cache‑ului KV, decodarea speculativă și nucleele specializate au fost în continuare cele care au adus industria la nivelul de producție și la economie. Nimic din acestea nu a venit din hardware.

Optimizarea continuă a întregului flux de producție pentru generarea de imagini și video este o sarcină diferită de cea pe care o au furnizorii de hardware, furnizorii de cloud și dezvoltatorii de modele, și nu reprezintă o prioritate principală pentru niciunul dintre ei.

Există câteva abordări pentru această sarcină. Una este modelul de piață, în care modelele sunt agregate și cererile sunt rutate. Nu credem că este defensabil pe termen lung, deoarece nu există control asupra stratului în care se află performanța. Am ales să construim stack‑ul noi înșine și să îl găzduim nativ, ceea ce este singura modalitate de a atinge cifrele de latență și cost pe care le vedem.

Aceasta înseamnă reglarea atenției, a memoriei cache, a nucleelor, a preciziei, a memoriei și a paralelismului pentru fiecare model și pentru fiecare accelerator, precum și susținerea API-urilor gestionate, a cloud-ului dedicat și a implementării auto-găzduite. Pe măsură ce numărul de modele și de opțiuni hardware crește, crește și complexitatea. Rolul nostru este să absorbim această complexitate, astfel încât clienții noștri să își poată dedica timpul la ceea ce diferențiază produsele lor.

Ați descris modelele de lume ca parte a viziunii pe termen lung a MachGen, cu multe dintre caracteristicile lor computaționale asemănătoare sarcinilor de difuzie. Cum ar trebui să arate infrastructura pentru modele de lume la scară de producție și ce aplicații devin posibile dacă generarea și simularea mediilor vizuale devine în cele din urmă la fel de ieftină și receptivă ca generarea de text în prezent?

Un mod de a înțelege platforma noastră este similar cu un LLM cu scop general. Același model redactează un contract legal și răspunde la o întrebare despre restaurante. Pentru noi, aceeași stivă deservește companii de avatare video, publicitate AI, generarea de povești și microdramă și, în cele din urmă, modele de lume. Diferite verticale, același set de probleme de performanță de bază.

Modelele de lume nu reprezintă astăzi activitatea noastră principală, dar sunt obiectivul spre care lucrăm și le dezvoltăm în mod activ. Modelele de lume la scară de producție vor necesita un debit foarte mare și o latență foarte scăzută, deoarece generează și actualizează continuu un mediu în loc să producă o singură ieșire. De asemenea, au nevoie de consistență spațială și temporală, de capacitatea de a răspunde la acțiuni și, adesea, de abilitatea de a simula simultan multiple rezultate posibile. Acest lucru creează probleme dificile în memorie, mișcarea datelor, paralelism și fiabilitate. Un model de lume care controlează un robot sau un joc nu poate să ia minute pentru a produce următoarea stare. Performanța decide dacă aceste sisteme sunt utilizabile deloc.

Din punct de vedere computațional, modelele de lume de astăzi seamănă mult cu modelele de difuzie, astfel că stiva pe care o construim acum este fundația naturală. Nu există încă un strat de servire matur, de nivel producție, pentru ele, comparabil cu cel existent pentru LLM-uri. Intenționăm să îl construim.

Dacă simularea devine la fel de receptivă și accesibilă ca generarea de text în prezent, roboții pot exersa situații rare înainte de a le întâlni, jocurile pot genera medii care răspund jucătorilor individuali, iar designerii pot testa zeci de posibilități înainte de a le construi în lumea fizică. Difuzia este domeniul în care ne asigurăm veniturile astăzi. Modelele de lume sunt steaua noastră călăuzitoare.

Vă mulțumim pentru interviul excelent, cititorii care doresc să afle mai multe ar trebui să viziteze MachGen AI.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.