Modele și platforme AI

Agenți Mobili: Agent Autonom Multimodal pentru Dispozitive Mobile cu Percepție Vizuală

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Apariția Modelelor Mari de Limbaj Multimodale (MLLM) a deschis o nouă eră a agenților de dispozitive mobile, capabili să ÃŪnțeleagă și să interacționeze cu lumea prin text, imagini și voce. Acești agenți marchează o avansare semnificativă față de inteligența artificială tradițională, oferind o modalitate mai bogată și mai intuitivă pentru utilizatori de a interacționa cu dispozitivele lor. Prin utilizarea MLLM, acești agenți pot procesa și sintetiza cantități uriașe de informații din diverse modalități, permițÃĒndu-le să ofere asistență personalizată și să ÃŪmbunătățească experiența utilizatorilor ÃŪn moduri anterior de neimaginat.

Acești agenți sunt alimentați de tehnici de ÃŪnvățare automată de ultimă generație și de capacități avansate de procesare a limbajului natural, permițÃĒndu-le să ÃŪnțeleagă și să genereze text umanoid, precum și să interpreteze date vizuale și auditive cu o acuratețe remarcabilă. De la recunoașterea obiectelor și a scenelor din imagini la ÃŪnțelegerea comenzilor vocale și analiza sentimentului textului, acești agenți multimodali sunt echipați pentru a gestiona o gamă largă de intrări ÃŪn mod transparent. Potențialul acestei tehnologii este vast, oferind servicii mai sofisticate și mai conștiente de context, cum ar fi asistenți virtuali atenți la emoțiile umane și instrumente educaționale care se adaptează la stilurile individuale de ÃŪnvățare. De asemenea, au potențialul de a revoluționa accesibilitatea, făcÃĒnd tehnologia mai accesibilă pe bariera lingvistică și senzorială.

În acest articol, vom discuta despre Agenți Mobili, un agent autonom multimodal de dispozitiv care utilizează inițial capacitatea de percepție vizuală pentru a identifica și a localiza elementele vizuale și textuale din interfața unei aplicații mobile cu precizie. UtilizÃĒnd acest context de percepție vizuală, cadrul Agenților Mobili planifică și descompune operațiunile complexe ÃŪn mod autonom și navighează prin aplicațiile mobile prin operații pas cu pas. Cadrul Agenților Mobili se diferențiază de soluțiile existente, deoarece nu se bazează pe metadatele sistemului mobil sau pe fișierele XML ale aplicațiilor mobile, permițÃĒnd o adaptabilitate ÃŪmbunătățită ÃŪn diverse medii de operare mobile, cu accent pe procesarea vizuală. Abordarea utilizată de cadrul Agenților Mobili elimină necesitatea de adaptări specifice sistemului, conducÃĒnd la o eficiență ÃŪmbunătățită și la cerințe computaționale reduse.

Agenți Mobili: Agent Autonom Multimodal de Dispozitiv Mobil

În lumea rapidă a tehnologiei mobile, un concept pionierat apare ca o realizare deosebită: Modelele Mari de Limbaj, ÃŪn special Modelele Mari de Limbaj Multimodale (MLLM) capabile să genereze o gamă largă de texte, imagini, videouri și discursuri ÃŪn diverse limbi. Dezvoltarea rapidă a cadrului MLLM ÃŪn ultimii ani a dat naștere unei noi și puternice aplicații a MLLM: agenți mobili autonomi. Agenții mobili autonomi sunt entități software care acționează, se deplasează și funcționează independent, fără a necesita comenzi umane directe, proiectate pentru a traversa rețele sau dispozitive pentru a ÃŪndeplini sarcini, a colecta informații sau a rezolva probleme.

Agenții Mobili sunt proiectați pentru a opera dispozitivul mobil al utilizatorului pe baza instrucțiunilor utilizatorului și a vizualizărilor ecranului, o sarcină care necesită ca agenții să posedă atÃĒt ÃŪnțelegere semantică, cÃĒt și capacități de percepție vizuală. Cu toate acestea, agenții mobili existenți sunt departe de a fi perfecti, deoarece se bazează pe modele mari de limbaj multimodale, iar chiar și stadiul actual al cadrului MLLM, inclusiv GPT-4V, lipsesc capacitățile de percepție vizuală necesare pentru a servi ca un agent mobil eficient.

Pentru a aborda această problemă, unele cadre au optat pentru utilizarea fișierelor de layout ale interfeței utilizatorului pentru a asista GPT-4V sau alte MLLM cu capacități de localizare, unele cadre reușind să extragă poziții de operare pe ecran prin accesarea fișierelor XML ale aplicației, ÃŪn timp ce alte cadre au optat pentru utilizarea codului HTML din aplicațiile web. Așa cum se poate observa, majoritatea acestor cadre se bazează pe accesarea fișierelor locale și a aplicațiilor subiacente, făcÃĒnd metoda aproape ineficientă dacă cadrul nu poate accesa aceste fișiere. Pentru a aborda această problemă și a elimina dependența de fișierele locale ale agenților de metodele de localizare, dezvoltatorii au lucrat la Agenții Mobili, un agent mobil autonom cu impresionante capacități de percepție vizuală. UtilizÃĒnd modulul său de percepție vizuală, cadrul Agenților Mobili utilizează capturi de ecran de la dispozitivul mobil pentru a localiza operațiunile cu precizie.

De asemenea, cadrul Agenților Mobili are ca scop să utilizeze capacitățile contextuale ale cadrului MLLM de ultimă generație, cum ar fi GPT-4V, pentru a atinge capacități de auto-planificare care permit modelului să planifice sarcini pe baza istoricului de operare, a instrucțiunilor utilizatorului și a capturilor de ecran ÃŪn mod holistic. Pentru a ÃŪmbunătăți și mai mult capacitatea agentului de a identifica instrucțiuni incomplete și operațiuni greșite, cadrul Agenților Mobili introduce o metodă de auto-reflexie. Sub ÃŪndrumarea unor promturi atent create, agentul reflectă asupra operațiunilor incorecte și invalide ÃŪn mod constant și oprește operațiunile odată ce sarcina sau instrucțiunea a fost finalizată.

În general, contribuțiile cadrului Agenților Mobili pot fi rezumate astfel:

  1. Agenții Mobili acționează ca agenți autonomi de dispozitiv mobil, utilizÃĒnd unelte de percepție vizuală pentru a efectua localizarea operațiunilor. Planifică metodic fiecare pas și se angajează ÃŪn introspecție. Notabil, Agenții Mobili se bazează exclusiv pe capturi de ecran ale dispozitivului, fără a utiliza codul sistemului, demonstrÃĒnd o soluție bazată pur pe tehnici de percepție vizuală.
  2. Agenții Mobili introduc Mobile-Eval, o benchmark concepută pentru a evalua agenții de dispozitiv mobil. Această benchmark include o varietate de cele mai utilizate 10 aplicații mobile, ÃŪmpreună cu instrucțiuni inteligente pentru aceste aplicații, categorisite ÃŪn trei niveluri de dificultate.

Agenți Mobili: Arhitectură și Metodologie

La nivelul său de bază, cadrul Agenților Mobili constă ÃŪntr-un model de limbaj multimodal de ultimă generație, GPT-4V, și un modul de detectare a textului utilizat pentru sarcinile de localizare a textului. Împreună cu GPT-4V, Agenții Mobili utilizează și un modul de detectare a iconitelor pentru localizarea iconitelor.

Percepție Vizuală

Așa cum s-a menționat anterior, modelul MLLM GPT-4V oferă rezultate satisfăcătoare pentru instrucțiuni și capturi de ecran, dar nu reușește să ofere locația eficientă unde au loc operațiunile. Din cauza acestei limitări, cadrul Agenților Mobili care implementează modelul GPT-4V trebuie să se bazeze pe unelte externe pentru a asista la localizarea operațiunilor, facilitÃĒnd astfel operațiunile de ieșire pe ecranul mobil.

Localizarea Textului

Cadrul Agenților Mobili implementează un instrument OCR pentru a detecta poziția textului corespunzător pe ecran atunci cÃĒnd agentul trebuie să apese pe un anumit text afișat pe ecranul mobil. Există trei scenarii unice de localizare a textului.

Scenariu 1: Nu s-a detectat niciun text specificat

Problemă: Instrumentul OCR nu reușește să detecteze textul specificat, ceea ce poate apărea ÃŪn imagini complexe sau din cauza limitărilor instrumentului OCR.

Răspuns: Instruiți agentul să:

  • Realege textul pentru apăsare, permițÃĒnd o corectură manuală a omisiunii instrumentului OCR, sau
  • Să aleagă o operațiune alternativă, cum ar fi utilizarea unei metode de intrare diferite sau efectuarea unei alte acțiuni relevante pentru sarcina respectivă.

Motivare: Această flexibilitate este necesară pentru a gestiona inexactitățile ocazionale sau halucinațiile modelului GPT-4V, asigurÃĒnd că agentul poate continua ÃŪn mod eficient.

Scenariu 2: A fost detectat un singur exemplar de text specificat

Operațiune: Generează ÃŪn mod automat o acțiune pentru a face clic pe coordonatele centrale ale casetei de text detectate.

Justificare: Cu doar un singur exemplar detectat, probabilitatea de identificare corectă este ridicată, făcÃĒnd eficientă procedura de a continua cu o acțiune directă.

Scenariu 3: Au fost detectate multiple exemplare de text specificat

Evaluare: Evaluează mai ÃŪntÃĒi numărul de exemplare detectate:

Multe Exemplare: Indică un ecran aglomerat cu conținut similar, complicÃĒnd procesul de selecție.

Acțiune: Cere agentului să realeagă textul, urmărind să refine selecția sau să ajusteze parametrii de căutare.

CÃĒteva Exemplare: Un număr gestionabil de detectări permite o abordare mai nuanțată.

Acțiune: Decupează regiunile din jurul acestor exemplare, extinzÃĒnd cutiile de text detectate spre exterior pentru a captura contextul suplimentar. Această extindere asigură că mai multe informații sunt păstrate, ajutÃĒnd la luarea deciziilor.

Următorul Pas: Desenează cutii de detectare pe imaginile decupate și prezintă-le agentului. Această asistență vizuală ajută agentul ÃŪn a decide care exemplar să interacționeze, pe baza indiciilor contextuale sau a cerințelor sarcinii.

Acestă abordare structurată optimizează interacțiunea dintre rezultatele OCR și operațiunile agentului, ÃŪmbunătățind fiabilitatea și adaptabilitatea sistemului ÃŪn gestionarea sarcinilor bazate pe text ÃŪn diverse scenarii. Întregul proces este demonstrat ÃŪn imaginea următoare.

Localizarea Iconitelor

Cadrul Agenților Mobili implementează un instrument de detectare a iconitelor pentru a localiza poziția unei iconite atunci cÃĒnd agentul trebuie să facă clic pe ea pe ecranul mobil. Mai specific, cadrul solicită agentului să furnizeze atribute specifice ale imaginii, inclusiv formă și culoare, și apoi implementează metoda Grounding DINO cu promptul iconitei pentru a identifica toate iconitele conținute ÃŪn captura de ecran. În final, Agenții Mobili utilizează cadrul CLIP pentru a calcula similaritatea dintre descrierea regiunii de clic și iconitele șterse, selectÃĒnd regiunea cu cea mai mare similaritate pentru a face clic.

Executarea Instrucțiunilor

Pentru a traduce acțiunile ÃŪn operațiuni pe ecran de către agenți, cadrul Agenților Mobili definește 8 operațiuni diferite.

  • Lansarea Aplicației (Numele Aplicației): Inițiază aplicația desemnată de pe interfața de desktop.
  • Apăsarea pe Text (Eticheta Textului): Interacționează cu porțiunea ecranului care afișează eticheta “Eticheta Textului”.
  • Interacțiunea cu Iconita (Descrierea Iconitei, Locația): Țintește și apelează zona specificată a iconitei, unde “Descrierea Iconitei” detaliază atribute precum culoarea și forma iconitei. Alege “Locația” din opțiuni precum partea superioară, inferioară, stÃĒnga, dreapta sau centru, posibil combinÃĒnd două pentru navigare precisă și pentru a reduce greșelile.
  • Introducerea Textului (Textul de Intrare): Introduce textul dat ÃŪn cÃĒmpul de text activ.
  • Derularea ÃŪn Sus și ÃŪn Jos: Navighează ÃŪn sus sau ÃŪn jos prin conținutul paginii curente.
  • Întoarcerea: Reveniți la pagina vizualizată anterior.
  • Închiderea: Reveniți direct la desktop din ecranul curent.
  • Oprește: Încheiați operațiunea odată ce sarcina a fost ÃŪndeplinită.

Auto-Planificarea

Fiecare pas al operațiunii este executat iterativ de cadrul Agenților Mobili, și ÃŪnainte de ÃŪnceperea fiecărei iterații, utilizatorul este solicitat să furnizeze o instrucțiune de intrare, iar modelul Agenților Mobili utilizează instrucțiunea pentru a genera un prompt de sistem pentru ÃŪntregul proces. De asemenea, ÃŪnainte de ÃŪnceperea fiecărei iterații, cadrul capturează o imagine a ecranului și o furnizează agentului. Agentul observă apoi imaginea ecranului, istoricul de operare și prompturile de sistem pentru a produce următorul pas al operațiunilor.

Auto-Reflexia

În timpul operațiunilor sale, agentul poate ÃŪntÃĒmpina erori care ÃŪl ÃŪmpiedică să execute corect o comandă. Pentru a ÃŪmbunătăți rata de ÃŪndeplinire a instrucțiunilor, a fost implementată o abordare de auto-evaluare, care se activează ÃŪn două circumstanțe specifice. Inițial, dacă agentul execută o acțiune defectuoasă sau invalidă care oprește progresul, cum ar fi atunci cÃĒnd recunoaște că imaginea ecranului rămÃĒne neschimbată după operațiune sau afișează o pagină incorectă, va fi direcționat să considere acțiuni alternative sau să ajusteze parametrii operațiunii existente. În al doilea rÃĒnd, agentul poate să nu detecteze anumite elemente ale unei directive complexe. Odată ce agentul a executat o serie de acțiuni pe baza planului inițial, va fi solicitat să revizuiască secvența de acțiuni, imaginea ecranului curent și directiva utilizatorului pentru a evalua dacă sarcina a fost finalizată. Dacă se găsesc discrepanțe, agentul este ÃŪnsărcinat să genereze ÃŪn mod autonom noi acțiuni pentru a ÃŪndeplini directiva.

Agenți Mobili: Experimente și Rezultate

Pentru a evalua capacitățile sale ÃŪn mod cuprinzător, cadrul Agenților Mobili introduce benchmark-ul Mobile-Eval, care constă ÃŪn 10 aplicații mobile utilizate ÃŪn mod obișnuit, și proiectează trei instrucțiuni pentru fiecare aplicație. Prima operațiune este una simplă și acoperă doar operațiunile de bază ale aplicației, ÃŪn timp ce a doua operațiune este puțin mai complexă decÃĒt prima, avÃĒnd cerințe suplimentare. În final, a treia operațiune este cea mai complexă, conținÃĒnd instrucțiuni abstracte ale utilizatorului, fără a specifica explicit ce aplicație să utilizeze sau ce operațiune să efectueze.

De asemenea, pentru a evalua performanța din perspective diferite, cadrul Agenților Mobili proiectează și implementează 4 metrice diferite.

  • Succes (Su): Dacă agentul mobil finalizează instrucțiunile, este considerat un succes.
  • Scor de Proces (PS): Metrica Scor de Proces măsoară acuratețea fiecărui pas ÃŪn timpul executării instrucțiunilor utilizatorului și este calculată prin ÃŪmpărțirea numărului de pași corecți la numărul total de pași.
  • Eficiență Relativă (RE): Scorul de eficiență relativă este un raport ÃŪntre numărul de pași necesari unui utilizator pentru a efectua manual instrucțiunea și numărul de pași necesari agentului pentru a executa aceeași instrucțiune.
  • Rată de Finalizare (CR): Metrica Ratei de Finalizare ÃŪmparte numărul de pași operați de cadrul care finalizează cu succes cu numărul total de pași efectuați de un utilizator pentru a finaliza instrucțiunea. Valoarea CR este 1 atunci cÃĒnd agentul finalizează instrucțiunea cu succes.

Rezultatele sunt demonstrate ÃŪn figura următoare.

Inițial, pentru cele trei sarcini date, Agenții Mobili au atins rate de finalizare de 91%, 82% și 82%, respectiv. Deși nu toate sarcinile au fost executate fără erori, ratele de realizare pentru fiecare categorie de sarcină au depășit 90%. De asemenea, metrica Scor de Proces arată că Agenții Mobili demonstrează ÃŪn mod constant o probabilitate ridicată de a executa acțiuni corecte pentru cele trei sarcini, cu rate de succes de aproximativ 80%. În plus, conform metricii de Eficiență Relativă, Agenții Mobili prezintă o eficiență de 80% ÃŪn executarea operațiunilor la un nivel comparabil cu optimizarea umană. Aceste rezultate subliniază ÃŪn mod colectiv competența Agenților Mobili ca asistenți pentru dispozitive mobile.

Figura următoare ilustrează capacitatea Agenților Mobili de a ÃŪnțelege comenzile utilizatorilor și de a-și orkestra acțiunile ÃŪn mod independent. Chiar și ÃŪn absența detaliilor explicite de operare ÃŪn instrucțiuni, Agenții Mobili au interpretat cu pricepere nevoile utilizatorilor, transformÃĒndu-le ÃŪn sarcini realizabile. UrmÃĒnd această ÃŪnțelegere, agentul a executat instrucțiunile prin intermediul unui proces de planificare sistematică.

GÃĒnduri Finale

În acest articol am discutat despre Agenții Mobili, un agent autonom multimodal de dispozitiv care utilizează inițial tehnologii de percepție vizuală pentru a detecta și a localiza cu precizie atÃĒt elementele vizuale, cÃĒt și cele textuale din interfața unei aplicații mobile. Cu acest context de percepție vizuală, cadrul Agenților Mobili planifică și descompune sarcinile complexe ÃŪn mod autonom și navighează prin aplicațiile mobile prin operații pas cu pas. Acest cadru se diferențiază de soluțiile existente, deoarece nu se bazează pe metadatele sistemului mobil sau pe fișierele XML ale aplicațiilor mobile, permițÃĒnd o adaptabilitate ÃŪmbunătățită ÃŪn diverse medii de operare mobile, cu accent pe procesarea vizuală. Strategia utilizată de cadrul Agenților Mobili elimină necesitatea de adaptări specifice sistemului, conducÃĒnd la o eficiență ÃŪmbunătățită și la cerințe computaționale reduse, facilitÃĒnd astfel o flexibilitate mai mare ÃŪn ceea ce privește fișierele XML ale aplicațiilor mobile, permițÃĒnd o abordare mai flexibilă și mai eficientă ÃŪn diverse medii de operare mobile, cu accent pe procesarea vizuală.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o ÃŪnțelegere profundă a inteligenței artificiale și a ÃŪnvățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.