Interviuri

Div Garg, CEO și Co-Fondator al AGI, Inc – Seria de Interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Div Garg, CEO și Co-Fondator al AGI, Inc, este cercetător și antreprenor în domeniul inteligenței artificiale, cu accent pe agenți autonomi, inteligență de margine, viziune computațională și robotică. Înainte de a fonda AGI, Inc., el a co-fondat și condus MultiOn, o companie pionieră în domeniul agenților de calculator, și ulterior a ocupat funcția de președinte al consiliului de administrație. Garg a petrecut aproape patru ani ca membru adjunct al facultății de la Universitatea Stanford, unde a creat CS 25: Transformers United, primul curs dedicat arhitecturilor de transformatori. Experiența sa anterioară include conducerea dezvoltării inteligenței artificiale la Collaborative Robotics, efectuarea de cercetări la NVIDIA (NVDA ) și Apple (AAPL ), și lucrul la tehnologii de viziune computațională și conducere autonomă la Google, Uber și Universitatea Cornell, unde cercetarea sa a inclus abordarea influentă Pseudo-LiDAR pentru percepția 3D bazată pe cameră.

AGI, Inc este o companie de cercetare a inteligenței artificiale care dezvoltă inteligență privată, securizată și accesibilă, care funcționează direct pe dispozitivele de margine. Tehnologia sa principală, AGI-0, este un sistem de inteligență artificială orientat spre acțiune, proiectat pentru a înțelege preferințele utilizatorilor și a finaliza sarcini în aplicații de pe telefoane, computere, dispozitive purtabile și alte dispozitive conectate, inclusiv fluxuri de lucru care implică cumpărături, transport, programare, mesagerie și divertisment. Compania oferă, de asemenea, o platformă care permite producătorilor de hardware și dezvoltatorilor să adauge agenți conștienți de ecran, capabili să raționeze și să acționeze în aplicații existente, fără a necesita integrări separate pentru fiecare aplicație. AGI, Inc. a demonstrat tehnologia sa împreună cu Lenovo și optimizează stiva sa de agenți pentru dispozitivele Qualcomm (QCOM ) Snapdragon.

Ați lucrat la Apple, Google, Nvidia și ați ajutat la crearea sistemelor de agenți timpurii la MultiOn, înainte de a întrerupe studiile de doctorat la Stanford pentru a fonda AGI, Inc. Care a fost limitarea specifică sau momentul care v-a convins că abordările actuale de inteligență artificială nu sunt suficiente și că construirea unui agent autonom pe dispozitiv este calea corectă de urmat?

Acest schimbare a avut loc undeva între 2023 și 2024, în timp ce lucram la agenți web. Am putut crea agenți care să efectueze acțiuni în browsere, dar numai dacă site-ul web avea o structură corespunzătoare cu care agentul putea lucra. De îndată ce ceva nu a mers bine și nu s-a comportat ca o versiune idealizată a DOM, cum ar fi o fereastră modală sau un efect de animație, agentul a încetat să funcționeze. Pe de altă parte, tot ceea ce contează atunci când oamenii vor să interacționeze cu smartphone-urile lor se întâmplă în aplicații. Aplicațiile nu oferă niciun fel de API; ele prezintă ecrane în schimb.

A fost această diferență care ne-a condus la concluzii. Soluția la problema nu a fost să creăm API-uri mai sofisticate sau modele mai mari, ci mai degrabă un agent care să opereze dispozitivul din perspectiva unei persoane. Acest lucru a însemnat să tratăm smartphone-ul ca o persoană – să interacționăm cu ecranele sale.

Majoritatea asistenților de inteligență artificială de astăzi se bazează încă foarte mult pe API-uri, integrări și orchestrare în cloud. Ce se rupe fundamental în acest model și de ce credeți că execuția pe dispozitiv este stratul lipsă?

Există trei probleme cu acest lucru. Primul este acoperirea. API-urile necesită ca toți dezvoltatorii să se interfețeze cu noi, ceea ce limitează capacitățile agentului la cel mai lent partener. Intențiile de aplicații de la Apple sunt un exemplu bun de astfel de tehnologie care a început să fie lucrată înapoi la WWDC 2024. Apoi există problema confidențialității. Orchestarea în cloud necesită ca conținutul ecranului, mesajele și activitățile dvs. să fie trimise pe serverele unei terțe părți. În final, există problema costului și a întârzierii. Toate procesările prin cloud fac ca acest lucru să fie lent și scump.

Execuția pe dispozitiv rezolvă toate aceste probleme. Agentul dvs. nu depinde de nimeni altcineva și se interfețează cu sistemul prin interacțiunea directă cu interfața utilizatorului.

Abordarea dvs. schimbă inteligența artificială de la a răspunde la întrebări la a efectua realmente sarcini în aplicații. Care au fost cele mai dificile provocări tehnice în permisivarea unui agent să opereze un telefon ca o persoană?

Controlul fiabil al unui telefon este mai dificil decât pare. Mai întâi, un agent trebuie să perceapă ecranul telefonului ca o persoană, să înțeleagă ce urmează și să efectueze acțiunea corespunzătoare. Percepția este realizată de un model de viziune și limbaj capabil să recunoască butoane, cutii de text, meniuri, layout-uri, etc. Selectarea acțiunii este necesară pentru a gestiona ambiguitățile, paginile parțial încărcate, dialogurile modale și erorile. În cele din urmă, acțiunea trebuie să fie suficient de precisă pentru a plasa o atingere în locul corect.

Cea mai semnificativă problemă, cu toate acestea, constă în capacitatea de a interacționa fiabil cu aplicații complexe pe o perioadă lungă de timp. Rezervarea unui Uber este una, dar efectuarea unui proces în mai multe etape într-o aplicație în care fiecare etapă depinde de interacțiunile anterioare este cu totul altceva. Acesta este exact motivul pentru care antrenarea modelelor de la capăt a fost esențială pentru dezvoltarea produsului.

Ați descris acest lucru ca o schimbare de la asistenți la agenți. Ce înseamnă această tranziție în practică pentru utilizatorii de zi cu zi și cum de repede vă așteptați ca comportamentul să se schimbe?

Schimbarea practică vine din interfață însăși. Unde astăzi avem aplicația și învățăm să o folosim, mâine vom avea agentul, iar aplicațiile vor deveni capacități compuse de agent în numele nostru. Încetăm să ne gândim la aplicații și începem să ne gândim la intenție: “Rezervă-mi o cursă acasă.” “Trimite pozele de la weekend mama.” “Arată-mi hoteluri în Lisabona unde pot găsi liniște pentru weekendul viitor.” Agentul știe care aplicații să folosească.

Schimbarea comportamentului începe încet și se accelerează pe măsură ce progresează. La început, oamenii vor încerca această abordare pentru sarcini simple pe care le pot încredința și apoi se vor extinde pe măsură ce pot. Declanșatorul pentru acceptarea pe scară largă va veni atunci când agentul va face sarcinile zilnice corect pe telefoanele noastre.

Cu parteneriate precum Qualcomm și Lenovo, cât de importantă este integrarea strânsă a hardware-ului și software-ului pentru a face inteligența artificială agențială utilizabilă la scară largă?

Acesta este diferența dintre un prototip utilizat pentru scopuri de cercetare și o aplicație care este cu adevărat utilizabilă. Dispozitivele alimentate de Snapdragon au unități de procesare neuronale, care vor asigura că algoritmii agentului pot funcționa pe dispozitiv cu întârzieri și consum de energie minim. Qualcomm a lucrat ani de zile pentru a atinge această optimizare, iar parteneriatul pe care l-am anunțat la MWC 2026 a avut exact acest scop în vedere.

Cealaltă extremă este Lenovo. Lenovo poate ajunge la sute de milioane de utilizatori din întreaga lume, prin smartphone-uri, tablete și computere, care doresc să se diferențieze utilizând inteligența artificială. A merge prin parteneri cu portofolii de dispozitive existente și a ajunge la ei rapid și transparent este mai bun decât ruta alternativă. Știu acest lucru din experiență.

Încrederea pare a fi o barieră majoră. Cum proiectați sisteme în care utilizatorii se simt confortabil lăsând inteligența artificială să ia acțiuni în numele lor, mai ales atunci când aceste acțiuni se extind la multiple aplicații și date sensibile?

Încrederea se construiește pe baza de a fi deschis cu privire la ceea ce agentul este și nu este capabil să facă. Orice acțiune care implică ceva important, cum ar fi efectuarea unei achiziții reale, trimiterea unui mesaj sau modificarea setărilor contului, necesită aprobarea utilizatorului. Agentul are capacitatea de a merge până la pagina de checkout pe cont propriu, dar nu mai departe, până când utilizatorul face acest lucru. Parteneriatul nostru cu Visa adaugă căi de plată autentificate deasupra acestuia.

Acest lucru se face pe baza a două filosofii simple. Prima este “omul în buclă pentru orice lucru substanțial.” A doua este “reversibilitate ori de câte ori este posibil.” În plus, agentul va vedea doar ceea ce este vizibil pe ecran și va respecta permisiunile sistemului de operare stabilite.

Există o narativă în creștere că economia aplicațiilor ar putea fi perturbată. Ați vedea agenții înlocuind aplicațiile în întregime sau reshapând modul în care aplicațiile sunt accesate și monetizate?

Aplicațiile nu dispar niciodată. Dinamica se schimbă pur și simplu. Pentru azi, aplicația este modul în care brandul comunică cu consumatorul. Mâine, agentul va fi, iar aplicația va fi instrumentul utilizat de agent. Dezvoltatorii de aplicații sunt aici pentru a rămâne, deoarece va exista întotdeauna nevoie de aplicația din spatele apelului de serviciu, mesajului text sau tranzacției. Diferența va consta în interfața pe care se fac aceste alegeri.

Acest lucru reprezintă o frontieră nouă pentru aplicații și pentru brandurile care le utilizează. Acest lucru reprezintă o oportunitate uimitoare de a explora și dezvolta împreună cu partenerii noștri în dezvoltare și platforme deopotrivă.

Sistemul dvs. evită să se bazeze pe API-uri. Acest lucru creează tensiuni cu dezvoltatorii și platformele, sau în cele din urmă deblochează un ecosistem mai deschis?

Este mai puțin controversat decât sună. Nu există nicio competiție între dezvoltatori și noi. Modul în care funcționează o interfață este același proces pe care o persoană l-ar folosi o aplicație, astfel încât agentul utilizează aceleași interfețe ca oricine altcineva. Dezvoltatorii pot utiliza practici tehnice comune pentru a bloca accesul, și înțelegem motivul lor.

Un rezultat mai interesant este absența conflictului. Un sistem deschis cu interoperabilitate universală beneficiază pe toată lumea, în comparație cu un sistem închis, în care fiecare asistent poate fi utilizat doar pe anumite aplicații, deoarece suportă doar integrări personalizate. Universalitatea ajută utilizatorii, dar ajută și aplicațiile cu valoare reală.

Inteligența artificială pe dispozitiv este adesea prezentată ca un avantaj al confidențialității. Cum echilibrați procesarea locală cu nevoia de modele puternice care, de obicei, necesită calcul pe scară largă?

Acesta este un sistem hibrid care va continua să evolueze către un sistem complet pe dispozitiv. Atât acțiunile, cât și raționamentul ușor au loc pe telefon, în timp ce raționamentul puternic are loc în cloud. Cu optimizarea stivei prin munca noastră cu Qualcomm și capacitățile unităților de procesare neuronale ale telefoanelor, care devin din ce în ce mai avansate, există o schimbare către un model mai localizat. În prezent, majoritatea telefoanelor de top de pe piață au capacitatea de a gestiona sarcina de lucru necesară.

Dicotomia dintre performanță puternică și sacrificarea localizării sau invers este, de asemenea, învechită. Modelele devin mai eficiente, iar hardware-ul de pe telefon devine mai capabil. Toate acestea pot fi realizate atunci când stiva este optimizată corespunzător.

Privind înainte, trei până la cinci ani, ce arată un dispozitiv nativ de inteligență artificială complet realizat și ce trebuie să se întâmple din punct de vedere tehnic și cultural, înainte ca această viziune să devină mainstream?

Implementarea reală ar fi un singur agent care ne urmărește pe dispozitive. Spuneți calculatorului să găsească informații despre cadouri, comutați-vă pe smartphone pentru a face o cumpărătură, apoi spuneți mașinii să se încălzească. Intenția este aceeași; contextul rămâne constant, în timp ce suprafața se schimbă. Telefoanele sunt punctul de inserție, deoarece acolo se întâmplă cea mai mare parte a calculului în prezent. Ulterior, se va muta la computere, TV, mașini și, în cele din urmă, la ochelari inteligenți, iar colaborarea cu Qualcomm face o mare diferență în acest sens.

Din punct de vedere tehnic, este vorba despre continuarea raționamentului pe dispozitiv și creșterea fiabilității pe termen lung, precum și despre tranzițiile corecte între dispozitive. Din punct de vedere cultural, schimbarea ar consta în creșterea încrederii în agenți cu sarcini din ce în ce mai complexe, ceea ce se bazează pe agentul care vă spune tot ceea ce nu poate face fără ezitare și, de asemenea, nu încalcă niciuna dintre promisiunile simple făcute vouă.

Mulțumim pentru acest interviu minunat. Citiitorii care doresc să afle mai multe despre AGI, Inc. pot vizita AGI, Inc.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.