Interviuri
Kirill Solodskih, Co-Fondator și CEO al TheStage AI – Seria de Interviuri

Kirill Solodskih, PhD, este Co-Fondator și CEO al TheStage AI, precum și un cercetător și antreprenor experimentat în domeniul inteligenței artificiale, cu peste un deceniu de experiență în optimizarea rețelelor neuronale pentru aplicații comerciale din lumea reală. În 2024, el a co-fondat TheStage AI, care a obținut 4,5 milioane de dolari pentru a automatiza complet accelerarea rețelelor neuronale pe orice platformă de hardware.
Înainte, ca lider de echipă la Huawei, Kirill a condus accelerarea aplicațiilor camerelor cu inteligență artificială pentru procesoarele Qualcomm (QCOM ) NPUs, contribuind la performanța smartphone-urilor P50 și P60 și obținând multiple brevete de inovare. Cercetările sale au fost prezentate la conferințe de top, cum ar fi CVPR și ECCV, unde a primit premii și recunoaștere la nivel de industrie. El gazduiește, de asemenea, un podcast despre optimizarea și inferența inteligenței artificiale.
Ce v-a inspirat să co-fondați TheStage AI și cum ați trecut de la academia și cercetare la optimizarea inferenței ca fondator de startup?
Bazele pentru ceea ce a devenit TheStage AI au început cu munca mea la Huawei, unde eram profund implicat în automatizarea implementărilor și optimizarea rețelelor neuronale. Aceste inițiative au devenit baza unor inovații revoluționare, și acolo am văzut adevărata provocare. Antrenarea unui model este una, dar a-l face să ruleze eficient în lumea reală și a-l face accesibil utilizatorilor este altceva. Implementarea este stânjenitorul care împiedică multe idei bune să devină realitate. Pentru a face ceva la fel de ușor de utilizat ca ChatGPT, există multe provocări tehnice implicate. Din punct de vedere tehnic, optimizarea rețelelor neuronale se referă la minimizarea parametrilor, menținând în același timp performanța ridicată. Este o problemă matematică dificilă, cu mult spațiu pentru inovație.
Optimizarea inferenței manuale a fost mult timp un stânjenitor în inteligența artificială. Puteți explica cum TheStage AI automatizează acest proces și de ce este un factor de schimbare?
TheStage AI abordează o problemă majoră a inteligenței artificiale: comprimarea și accelerarea manuală a rețelelor neuronale. Rețelele neuronale au miliarde de parametri, și determinarea celor care pot fi eliminați pentru o performanță mai bună este aproape imposibilă manual. ANNA (Analizorul de Rețele Neuronale Automat) automatizează acest proces, identificând care straturi pot fi excluse de la optimizare, similar cu modul în care a fost automatizată comprimarea ZIP.
Acest lucru schimbă jocul, făcând adoptarea inteligenței artificiale mai rapidă și mai accesibilă. În loc de a se baza pe procese manuale costisitoare, startup-urile pot optimiza modelele automat. Tehnologia oferă companiilor o vedere clară asupra performanței și costurilor, asigurând eficiența și scalabilitatea fără a fi nevoie de presupuneri.
TheStage AI susține că reduce costurile inferenței cu până la 5x — ce face tehnologia de optimizare atât de eficientă în comparație cu metodele tradiționale?
TheStage AI reduce costurile de ieșire cu până la 5x printr-o abordare de optimizare care merge dincolo de metodele tradiționale. În loc de a aplica același algoritm întregii rețele neuronale, ANNA o descompune în straturi mai mici și decide care algoritm să aplice pentru fiecare parte pentru a oferi comprimarea dorită, maximizând în același timp calitatea modelului. Prin combinarea unor heuristici matematice inteligente cu aproximații eficiente, abordarea noastră este foarte scalabilă și face adoptarea inteligenței artificiale mai ușoară pentru companii de toate dimensiunile. De asemenea, integrăm setări flexibile de compilator pentru a optimiza rețelele pentru anumite hardware, cum ar fi iPhone-uri sau procesoare NVIDIA GPU. Acest lucru ne oferă mai mult control pentru a regla performanța, creșterea vitezei fără a pierde calitatea.
Cum se compară accelerarea inferenței TheStage AI cu compilatorul nativ PyTorch, și care sunt avantajele pe care le oferă dezvoltatorilor de inteligență artificială?
TheStage AI accelerează ieșirea cu mult dincolo de compilatorul nativ PyTorch. PyTorch folosește o metodă de compilare “la momentul cererii”, care compilează modelul de fiecare dată când rulează. Acest lucru duce la timpuri lungi de pornire, uneori care pot dura minute sau chiar mai mult. În medii scalabile, acest lucru poate crea ineficiențe, mai ales atunci când sunt necesare noi GPU-uri pentru a face față creșterii încărcăturii utilizatorilor, ceea ce poate afecta experiența utilizatorului.
În contrast, TheStage AI permite modelului să fie compilat dinainte, astfel încât, odată ce modelul este gata, poate fi implementat instantaneu. Acest lucru conduce la lansări mai rapide, o eficiență a serviciului îmbunătățită și economii de costuri. Dezvoltatorii pot implementa și scala modele de inteligență artificială mai rapid, fără stânjenitorile compilării tradiționale, făcându-le mai eficiente și mai receptive pentru cazuri de utilizare cu cerințe ridicate.
Puteți să ne spuneți mai multe despre kit-ul de instrumente QLIP al TheStage AI și cum îmbunătățește performanța modelului, menținând în același timp calitatea?
QLIP, kit-ul de instrumente al TheStage AI, este o bibliotecă Python care oferă un set esențial de primitive pentru construirea rapidă a unor algoritmi de optimizare personalizați pentru diferite hardware, cum ar fi GPU-uri și NPUs. Kit-ul include componente cum ar fi cuantificarea, tăierea, specificarea, compilarea și servirea, toate fiind critice pentru dezvoltarea unor sisteme de inteligență artificială eficiente și scalabile.
Ceea ce diferențiază QLIP este flexibilitatea sa. Permite inginerilor de inteligență artificială să creeze și să implementeze noi algoritmi cu doar câteva linii de cod. De exemplu, o lucrare recentă de conferință despre rețelele neuronale cuantificate poate fi transformată într-un algoritm funcțional folosind primitivele QLIP în doar câteva minute. Acest lucru face ca pentru dezvoltatori să fie ușor să integreze cele mai recente cercetări în modelele lor, fără a fi împiedicați de cadre rigide.
Spre deosebire de cadrele deschise tradiționale care vă limitează la un set fix de algoritmi, QLIP permite oricui să adauge noi tehnici de optimizare. Această adaptabilitate ajută echipele să rămână înaintea evoluției rapide a peisajului inteligenței artificiale, îmbunătățind performanța, în timp ce asigură flexibilitate pentru inovațiile viitoare.
Ați contribuit la cadrele de cuantificare a inteligenței artificiale utilizate în camerele P50 și P60 de la Huawei. Cum a influențat această experiență abordarea dvs. față de optimizarea inteligenței artificiale?
Experiența mea de a lucra la cadrele de cuantificare a inteligenței artificiale pentru camerele P50 și P60 de la Huawei mi-a oferit perspective valoroase despre modul în care optimizarea poate fi eficientizată și escaladată. Când am început cu PyTorch, lucrul cu graficul complet de execuție al rețelelor neuronale era rigid, iar algoritmii de cuantificare trebuiau implementați manual, strat cu strat. La Huawei, am construit un cadru care a automatizat procesul. Pur și simplu introduceți modelul, și acesta va genera automat codul pentru cuantificare, eliminând munca manuală.
Acest lucru m-a făcut să realizez că automatizarea în optimizarea inteligenței artificiale se referă la permiterea vitezei fără a sacrifica calitatea. Unul dintre algoritmii pe care i-am dezvoltat și brevetat a devenit esențial pentru Huawei, mai ales atunci când au trebuit să treacă de la procesoarele Kirin la arhitectura Qualcomm din cauza sancțiunilor. Acesta a permis echipei să adapteze rapid rețelele neuronale la arhitectura Qualcomm fără a pierde performanță sau precizie.
Prin eficientizarea și automatizarea procesului, am redus timpul de dezvoltare de la peste un an la doar câteva luni. Acest lucru a avut un impact enorm asupra unui produs utilizat de milioane și a modelat abordarea mea față de optimizare, concentrându-mă pe viteză, eficiență și pierderi minime de calitate. Această mentalitate o aduc cu mine la ANNA astăzi.
Cercetările dvs. au fost prezentate la CVPR și ECCV — care sunt câteva dintre cele mai importante descoperiri în eficiența inteligenței artificiale de care sunteți cel mai mândru?
Când mă gândesc la realizările mele în eficiența inteligenței artificiale, mă întorc mereu la lucrarea noastră care a fost selectată pentru o prezentare orală la CVPR 2023. A fi ales pentru o prezentare orală la o astfel de conferință este rar, deoarece doar 12 lucrări sunt selectate. Acest lucru se adaugă la faptul că inteligența artificială generativă domină de obicei atenția, iar lucrarea noastră a abordat o abordare diferită, concentrându-se pe aspectul matematic, în special analiza și comprimarea rețelelor neuronale.
Am dezvoltat o metodă care ne-a ajutat să înțelegem câți parametri are nevoie o rețea neuronală pentru a funcționa eficient. Prin aplicarea unor tehnici din analiza funcțională și trecerea de la o formulare discretă la una continuă, am putut obține rezultate bune de comprimare, păstrând în același timp capacitatea de a integra aceste schimbări înapoi în model. Lucrarea a introdus, de asemenea, câteva algoritmi noi care nu fuseseră utilizați de comunitate și au găsit aplicații ulterioare.
Acesta a fost unul dintre primele mele lucrări în domeniul inteligenței artificiale, și, important, a fost rezultatul efortului colectiv al echipei mele, inclusiv al co-fondatorilor mei. A fost un moment semnificativ pentru toți noi.
Puteți explica cum funcționează Rețelele Neuronale Integrale (INN) și de ce sunt o inovație importantă în învățarea profundă?
Rețelele neuronale tradiționale folosesc matrice fixe, similare cu tabelele Excel, unde dimensiunea și parametrii sunt predefiniți. INN, însă, descriu rețelele ca funcții continue, oferind mult mai multă flexibilitate. Gândiți-vă la aceasta ca la o pătură cu ace la diferite înălțimi, și aceasta reprezintă unda continuă.
Ceea ce face INN-uri interesante este capacitatea lor de a se “comprima” sau “extinde” dinamic, în funcție de resursele disponibile, similar cu modul în care un semnal analogic este digitalizat în sunet. Puteți reduce rețeaua fără a sacrifica calitatea, și atunci când este nevoie, o puteți extinde înapoi fără a o reantrena.
Am testat acest lucru, și în timp ce metodele tradiționale de comprimare duc la o pierdere semnificativă de calitate, INN-uri mențin o calitate aproape de original, chiar și sub comprimare extremă. Matematica din spatele acestora este mai neconvențională pentru comunitatea inteligenței artificiale, dar valoarea reală se află în capacitatea de a oferi rezultate practice solide, cu efort minim.
TheStage AI a lucrat la algoritmi de annealare cuantică — cum vedeți inteligența cuantică jucând un rol în optimizarea inteligenței artificiale în viitorul apropiat?
Când vine vorba de calculul cuantic și de rolul său în optimizarea inteligenței artificiale, ideea cheie este că sistemele cuantice oferă o abordare complet diferită a rezolvării problemelor, cum ar fi optimizarea. Deși nu am inventat algoritmii de annealare cuantică de la zero, companii cum ar fi D-Wave oferă biblioteci Python pentru a construi algoritmi cuantici specifici pentru sarcini de optimizare discretă, care sunt ideale pentru computerele cuantice.
Aici, nu încărcăm direct o rețea neuronală într-un computer cuantic. Acest lucru nu este posibil cu arhitectura actuală. În schimb, aproximăm modul în care rețelele neuronale se comportă sub diferite tipuri de degradare, făcându-le să se potrivească într-un sistem pe care un cip cuantic îl poate procesa.
În viitor, sistemele cuantice ar putea scala și optimiza rețelele cu o precizie pe care sistemele tradiționale o pot doar simula, utilizând resurse suplimentare. Avantajul sistemelor cuantice se află în paralelismul încorporat, ceva pe care sistemele clasice îl pot simula doar utilizând resurse suplimentare. Acest lucru ar putea accelera semnificativ procesul de optimizare, mai ales pe măsură ce învățăm cum să modelăm rețele mai mari și mai complexe în mod eficient.
Potențialul real vine din utilizarea calculului cuantic pentru a rezolva sarcini masive și complexe de optimizare și pentru a descompune parametrii în grupuri mai mici și mai ușor de gestionat. Cu tehnologii cum ar fi cuantice și optice, există posibilități imense pentru optimizarea inteligenței artificiale, care merg mult dincolo de ceea ce calculul tradițional poate oferi.
Care este viziunea dvs. pe termen lung pentru TheStage AI? Unde vedeți optimizarea inferenței mergând în următorii 5-10 ani?
Pe termen lung, TheStage AI își propune să devină un Hub Global de Modele, unde oricine poate accesa ușor o rețea neuronală optimizată cu caracteristici dorite, fie pentru un smartphone sau orice alt dispozitiv. Scopul nostru este de a oferi o experiență de drag-and-drop, unde utilizatorii introduc parametrii, și sistemul generează automat rețeaua. Dacă rețeaua nu există deja, ea va fi creată automat utilizând ANNA.
Scopul nostru este de a face rețelele neuronale să ruleze direct pe dispozitivele utilizatorilor, reducând costurile cu 20 până la 30 de ori. În viitor, acest lucru ar putea elimina aproape complet costurile, deoarece dispozitivul utilizatorului ar gestiona calculul, în loc de a se baza pe servere cloud. Acest lucru, combinat cu progresele în comprimarea modelului și accelerarea hardware, ar putea face implementarea inteligenței artificiale mult mai eficientă.
De asemenea, planificăm să integrăm tehnologia noastră cu soluții de hardware, cum ar fi senzori, cipuri și roboți, pentru aplicații în domenii cum ar fi conducerea autonomă și robotică. De exemplu, ne propunem să construim camere cu inteligență artificială capabile să funcționeze în orice mediu, fie în spațiu sau în condiții extreme, cum ar fi întunericul sau praful. Acest lucru ar face inteligența artificială utilizabilă într-o gamă largă de aplicații și ne-ar permite să creăm soluții personalizate pentru hardware și cazuri de utilizare specifice.
Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe despre TheStage AI ar trebui să viziteze TheStage AI.












