Interviuri
Neetu Pathak, Co-Fondator și CEO al Skymel – Seria de Interviuri

Neetu Pathak, Co-Fondator și CEO al Skymel, conduce compania în revoluționarea inferenței AI cu tehnologia sa inovatoare NeuroSplit™. Alături de CTO Sushant Tripathy, ea conduce misiunea Skymel de a îmbunătăți performanța aplicațiilor AI, reducând în același timp costurile computaționale.
NeuroSplit™ este o tehnologie de inferență adaptivă care distribuie dinamic sarcinile de lucru AI între dispozitivele utilizatorilor și serverele cloud. Acestă abordare utilizează resursele de calcul inactiv de pe dispozitivele utilizatorilor, reducând costurile infrastructurii cloud cu până la 60%, accelerând viteza de inferență, asigurând confidențialitatea datelor și permițând o scalabilitate fără probleme.
Prin optimizarea puterii de calcul locale, NeuroSplit™ permite aplicațiilor AI să ruleze eficient chiar și pe dispozitive mai vechi, reducând semnificativ costurile și îmbunătățind experiența utilizatorului.
Ce v-a inspirat să co-fondați Skymel și care au fost principalele provocări în infrastructura AI pe care le-ați urmărit să le rezolvați cu NeuroSplit?
Inspiratia pentru Skymel a venit din convergența experiențelor noastre complementare. În timpul șederii sale la Google (GOOGL ), co-fondatorul meu, Sushant Tripathy, a implementat modele de inteligență artificială bazate pe voce pe miliarde de dispozitive Android. El a descoperit că există o cantitate enormă de putere de calcul inactivă disponibilă pe dispozitivele utilizatorilor, dar majoritatea companiilor nu au putut să o utilizeze eficient din cauza provocărilor tehnice complexe de accesare a acestor resurse fără a compromite experiența utilizatorului.
Între timp, experiența mea de lucru cu întreprinderi și startup-uri la Redis mi-a oferit o înțelegere profundă a importanței latenței pentru afaceri. Pe măsură ce aplicațiile AI au devenit mai răspândite, a devenit clar că trebuie să mutăm procesarea mai aproape de locul unde sunt create datele, în loc să le trimitem în mod constant înapoi și încolo către centrele de date.
Acesta a fost momentul în care Sushant și eu am realizat că viitorul nu este despre alegerea între procesarea locală sau cea cloud, ci despre crearea unei tehnologii inteligente care să poată adapta în mod transparent între procesarea locală, cloud sau hibridă, în funcție de fiecare cerere de inferență specifică. Această înțelegere ne-a condus să fondăm Skymel și să dezvoltăm NeuroSplit, mergând dincolo de limitările tradiționale ale infrastructurii care împiedicau inovația AI.
Puteți explica cum NeuroSplit optimizează dinamic resursele de calcul, menținând în același timp confidențialitatea utilizatorului și performanța?
Una dintre principalele capcane ale inferenței AI locale a fost reprezentată de cerințele sale statice de calcul – în mod tradițional, rularea unui model de inteligență artificială cere aceleași resurse computaționale, indiferent de condițiile dispozitivului sau de comportamentul utilizatorului. Acestă abordare de tip “unul pentru toți” ignoră realitatea că dispozitivele au capacități de hard diferite, de la diverse procesoare (GPU, NPU, CPU, XPU) până la lățimi de bandă de rețea variate, și utilizatorii au comportamente diferite în ceea ce privește utilizarea aplicațiilor și modelele de încărcare a dispozitivului.
NeuroSplit monitorizează în mod continuu diverse telemetrie de dispozitiv – de la capacitățile de hard până la utilizarea curentă a resurselor, starea bateriei și condițiile de rețea. De asemenea, luăm în considerare modelele de comportament ale utilizatorilor, cum ar fi numărul de aplicații care rulează și modelele tipice de utilizare a dispozitivului. Această monitorizare cuprinzătoare permite NeuroSplit să determine în mod dinamic cât de multă inferență poate fi rulată în siguranță pe dispozitivul utilizatorului, optimizând în același timp indicatorii de performanță cheie pentru dezvoltatori.
Când confidențialitatea datelor este esențială, NeuroSplit asigură că datele brute nu părăsesc dispozitivul, procesând informațiile sensibile local și menținând în același timp o performanță optimă. Capacitatea noastră de a diviza, tăia sau decupla modelele de inteligență artificială ne permite să încărcăm 50-100 de modele de inteligență artificială în spațiul de memorie al unui singur model cuantificat pe un dispozitiv utilizator, fără a compromite performanța.
Care sunt principalele beneficii ale inferenței adaptive NeuroSplit pentru companiile de inteligență artificială, în special pentru cele care lucrează cu tehnologie mai veche de GPU?
NeuroSplit oferă trei beneficii transformative pentru companiile de inteligență artificială. În primul rând, reduce dramatic costurile infrastructurii prin două mecanisme: companiile pot utiliza GPU-uri mai ieftine și mai vechi în mod eficient, iar capacitatea noastră unică de a încărca atât modele complete, cât și modele de inteligență artificială reduse pe GPU-urile cloud permite rate de utilizare semnificativ mai mari a GPU-urilor. De exemplu, o aplicație care necesită în mod normal mai multe procesoare NVIDIA A100 la 2,74 dolari pe oră poate rula acum pe un singur A100 sau pe mai multe V100 la doar 83 de cenți pe oră.
În al doilea rând, îmbunătățim semnificativ performanța prin procesarea inițială a datelor brute direct pe dispozitivele utilizatorilor. Acest lucru înseamnă că datele care ajung în cele din urmă în cloud sunt mult mai mici ca mărime, reducând semnificativ latența rețelei și menținând acuratețea. Acestă abordare hibridă oferă companiilor cel mai bun din ambele lumi – viteza procesării locale și puterea calculului cloud.
În al treilea rând, prin procesarea inițială a datelor sensibile pe dispozitivul utilizatorului, ajutăm companiile să mențină puternice protecții pentru confidențialitatea utilizatorilor fără a sacrifica performanța. Acest lucru devine din ce în ce mai important pe măsură ce reglementările privind confidențialitatea devin mai stricte și utilizatorii devin mai conștienți de confidențialitate.
Cum reduce soluția Skymel costurile pentru inferența de inteligență artificială fără a compromite complexitatea sau acuratețea modelului?
În primul rând, prin divizarea modelelor de inteligență artificială individuale, distribuim calculul între dispozitivele utilizatorilor și cloud. Prima parte rulează pe dispozitivul utilizatorului, gestionând 5% până la 100% din calculul total, în funcție de resursele disponibile ale dispozitivului. Doar calculul rămas trebuie procesat pe GPU-urile cloud.
Acest lucru înseamnă că GPU-urile cloud gestionează o sarcină de calcul redusă – dacă un model necesita inițial un GPU A100 complet, după divizare, aceeași sarcin de lucru ar putea necesita doar 30-40% din capacitatea GPU-ului. Acest lucru permite companiilor să utilizeze instanțe de GPU mai ieftine, cum ar fi V100.
În al doilea rând, NeuroSplit optimizează utilizarea GPU-urilor în cloud. Prin aranjarea eficientă a modelelor complete și a modelelor de inteligență artificială reduse pe același GPU cloud, realizăm rate de utilizare semnificativ mai mari comparativ cu abordările tradiționale. Acest lucru înseamnă că mai multe modele pot rula simultan pe același GPU cloud, reducând și mai mult costurile pe inferență.
Ce distinge abordarea hibridă (locală + cloud) a Skymel de alte soluții de infrastructură de inteligență artificială de pe piață?
Peisajul inteligenței artificiale se află la un punct de inflexiune fascinant. În timp ce Apple (AAPL ), Samsung și Qualcomm (QCOM ) demonstrează puterea inteligenței artificiale hibride prin caracteristicile lor de ecosistem, acestea rămân grădini închise. Dar inteligența artificială nu ar trebui să fie limitată de dispozitivul pe care îl utilizează un anumit utilizator.
NeuroSplit este fundamental agnostic la dispozitiv, cloud și arhitectură de rețea neurală. Acest lucru înseamnă că dezvoltatorii pot livra în sfârșit experiențe de inteligență artificială consistente, indiferent dacă utilizatorii lor sunt pe un iPhone, dispozitiv Android sau laptop – sau dacă utilizează AWS, Azure sau Google Cloud.
Gândiți-vă la ce înseamnă acest lucru pentru dezvoltatori. Ei pot construi aplicația lor de inteligență artificială o singură dată și știu că va adapta în mod inteligent pe orice dispozitiv, orice cloud și orice arhitectură de rețea neurală. Nu mai trebuie să construiască versiuni diferite pentru diferite platforme sau să compromită funcționalitățile pe baza capacităților dispozitivului.
Noi aducem capacitățile de inteligență artificială hibridă de nivel enterprise dincolo de grădinile închise și le facem universal accesibile. Pe măsură ce inteligența artificială devine centrală pentru fiecare aplicație, acest tip de flexibilitate și consistență nu este doar un avantaj – este esențial pentru inovare.
Cum completează Agentul Orchestrator NeuroSplit și ce rol joacă în transformarea strategiilor de implementare a inteligenței artificiale?
Agentul Orchestrator (OA) și NeuroSplit lucrează împreună pentru a crea un sistem de implementare a inteligenței artificiale care se optimizează singur:
1. Dezvoltatorii setează limitele:
- Restricții: modele permise, versiuni, furnizori de cloud, zone, reguli de conformitate
- Obiective: latență țintă, limite de cost, cerințe de performanță, nevoi de confidențialitate
2. OA lucrează în cadrul acestor restricții pentru a atinge obiectivele:
- Decide care modele/API-uri să utilizeze pentru fiecare cerere
- Adaptează strategiile de implementare pe baza performanței din lumea reală
- Face compromisuri pentru a optimiza obiectivele specificate
- Poate fi reconfigurat instantaneu pe măsură ce nevoile se schimbă
3. NeuroSplit execută deciziile OA:
- Utilizează telemetria dispozitivului în timp real pentru a optimiza execuția
- Împarte procesarea între dispozitiv și cloud atunci când este benefic
- Asigură că fiecare inferență rulează în mod optim, ținând cont de condițiile curente
Este ca și cum ai avea un sistem de inteligență artificială care se optimizează singur, în cadrul regulilor și obiectivelor definite, fără a necesita o optimizare manuală pentru fiecare scenariu.
În opinia dvs., cum va rescrie Agentul Orchestrator modul în care inteligența artificială este implementată în diverse industrii?
El rezolvă trei provocări critice care au împiedicat până acum adoptarea și inovarea inteligenței artificiale.
În primul rând, permite companiilor să țină pasul cu cele mai recente avansuri în domeniul inteligenței artificiale, fără efort. Cu Agentul Orchestrator, puteți profita instantaneu de noile modele și tehnici fără a fi nevoie să restructurați infrastructura. Acesta este un avantaj competitiv major într-o lume în care inovarea inteligenței artificiale evoluează cu o viteză fără precedent.
În al doilea rând, permite o optimizare dinamică, pe cerere, a selecției de modele de inteligență artificială. Agentul Orchestrator poate combina inteligent modele din ecosistemul vast de opțiuni pentru a oferi cele mai bune rezultate posibile pentru fiecare interacțiune a utilizatorului. De exemplu, un sistem de inteligență artificială pentru servicii clienți ar putea utiliza un model specializat pentru întrebări tehnice și un altul pentru întrebări de facturare, oferind rezultate mai bune pentru fiecare tip de interacțiune.
În al treilea rând, maximizează performanța și minimizează costurile. Agentul optimizează automat balanța între rularea inteligenței artificiale pe dispozitivul utilizatorului sau în cloud, pe baza a ceea ce are cel mai mult sens în acel moment. Când confidențialitatea este importantă, procesează datele local. Când este nevoie de putere de calcul suplimentară, utilizează cloud-ul. Toate acestea se întâmplă în fundal, creând o experiență netedă pentru utilizatori, în timp ce resursele sunt optimizate pentru afaceri.
Dar ceea ce cu adevărat diferențiază Agentul Orchestrator este modul în care permite companiile să creeze experiențe hiper-personalizate de ultimă generație pentru utilizatorii lor. Luați, de exemplu, o platformă de învățământ la distanță – cu tehnologia noastră, ei pot construi un sistem care se adaptează automat la nivelul de înțelegere al fiecărui student. Când un utilizator caută “învățare automată”, platforma nu afișează doar rezultate generice – ea poate evalua instantaneu înțelegerea curentă a utilizatorului și personaliza explicațiile, utilizând concepte pe care utilizatorul le cunoaște deja.
În cele din urmă, Agentul Orchestrator reprezintă viitorul implementării inteligenței artificiale – o schimbare de la infrastructura statică și monolitică de inteligență artificială la o orchestrare dinamică, adaptivă și auto-optimizantă de inteligență artificială. Nu este doar despre a face implementarea inteligenței artificiale mai ușoară – este despre a face posibile clase întregi noi de aplicații de inteligență artificială.
Care a fost feedbackul pe care l-ați primit până acum de la companiile care participă la beta-ul privat al Agentului Orchestrator?
Feedbackul de la participanții noștri la beta a fost excelent! Companiile sunt încântate să descopere că pot, în sfârșit, să scape de blocajul infrastructurii, fie că este vorba de modele proprietare sau de servicii de găzduire. Capacitatea de a lua decizii de implementare fără a fi nevoie de luni de restructurare a fost un factor de schimbare, eliminând teama de a schimba abordări.
Rezultatele noastre de performanță NeuroSplit au fost remarcabile – abia așteptăm să putem împărtăși datele public. Ceea ce este deosebit de interesant este modul în care conceptul de implementare adaptivă de inteligență artificială a capturat imaginația oamenilor. Faptul că inteligența artificială se implementează singură pare futurist și nu este ceva pe care l-ar fi așteptat acum, așa că doar din punctul de vedere al progresului tehnologic, oamenii sunt entuziasmați de posibilitățile și piețele noi pe care le-ar putea crea în viitor.
Având în vedere progresele rapide în inteligența artificială generativă, ce sunt următoarele provocări majore pentru infrastructura de inteligență artificială și cum plănuiți să le abordați la Skymel?
Ne îndreptăm spre un viitor pe care majoritatea oamenilor nu l-au înțeles încă pe deplin: nu va exista un singur model de inteligență artificială dominant, ci miliarde de astfel de modele. Chiar dacă am crea cel mai puternic model de inteligență artificială generală imaginabil, tot am avea nevoie de versiuni personalizate pentru fiecare persoană de pe Pământ, adaptate la contexte, preferințe și nevoi unice. Acesta este un salt revoluționar de la abordarea de tip “unul pentru toți” de astăzi.
Viitorul cere o infrastructură inteligentă care să poată gestiona miliarde de modele. La Skymel, nu doar rezolvăm provocările de implementare de astăzi, ci și construim deja fundația pentru ceea ce urmează.
Cum vă imaginați că va evolua infrastructura de inteligență artificială în următorii cinci ani și care va fi rolul Skymel în această evoluție?
Peisajul infrastructurii de inteligență artificială este pe cale să suporte o schimbare fundamentală. În timp ce astăzi accentul este pe scalarea modelelor de limbaj mari în cloud, următorii cinci ani vor vedea inteligența artificială devenind profund personalizată și conștientă de context. Acesta nu este doar despre fine-tuning, ci despre inteligența artificială care se adaptează la utilizatori specifici, dispozitive și situații în timp real.
Această schimbare creează două provocări majore de infrastructură. În primul rând, abordarea tradițională de a rula totul în centrele de date centralizate devine nesustenabilă atât din punct de vedere tehnic, cât și economic. În al doilea rând, complexitatea crescândă a aplicațiilor de inteligență artificială necesită o infrastructură care să poată optimiza dinamic între multiple modele, dispozitive și locații de calcul.
La Skymel, construim o infrastructură care abordează în mod specific aceste provocări. Tehnologia noastră permite inteligenței artificiale să ruleze acolo unde are cel mai mult sens – fie pe dispozitivul unde sunt generate datele, fie în cloud, unde este disponibilă mai multă putere de calcul, sau inteligent împărțită între cele două. Mai important, aceste decizii se adaptează în timp real în funcție de condiții și cerințe schimbătoare.
În cele din urmă, aplicațiile de inteligență artificială de succes nu vor fi definite de mărimea modelelor lor sau de cantitatea de calcul pe care o pot accesa. Vor fi definite de capacitatea lor de a oferi experiențe personalizate și receptive, gestionând în același timp resursele în mod eficient. Obiectivul nostru este de a face acest nivel de optimizare inteligentă accesibil fiecărei aplicații de inteligență artificială, indiferent de scară sau complexitate.
Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe despre Skymel pot vizita Skymel.












