Modele și platforme AI

Agenți Mobili: Agent Autonom Multimodal pentru Dispozitive Mobile cu Percepție Vizuală

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Apariția Modelelor Mari de Limbaj Multimodale (MLLM) a deschis o nouă eră a agenților de dispozitive mobile, capabili să înțeleagă și să interacționeze cu lumea prin text, imagini și voce. Acești agenți marchează o avansare semnificativă față de inteligența artificială tradițională, oferind o modalitate mai bogată și mai intuitivă pentru utilizatori de a interacționa cu dispozitivele lor. Prin utilizarea MLLM, acești agenți pot procesa și sintetiza cantități uriașe de informații din diverse modalități, permițându-le să ofere asistență personalizată și să îmbunătățească experiența utilizatorilor în moduri anterior de neimaginat.

Acești agenți sunt alimentați de tehnici de învățare automată de ultimă generație și de capacități avansate de procesare a limbajului natural, permițându-le să înțeleagă și să genereze text umanoid, precum și să interpreteze date vizuale și auditive cu o acuratețe remarcabilă. De la recunoașterea obiectelor și a scenelor din imagini la înțelegerea comenzilor vocale și analiza sentimentului textului, acești agenți multimodali sunt echipați pentru a gestiona o gamă largă de intrări în mod transparent. Potențialul acestei tehnologii este vast, oferind servicii mai sofisticate și mai conștiente de context, cum ar fi asistenți virtuali atenți la emoțiile umane și instrumente educaționale care se adaptează la stilurile individuale de învățare. De asemenea, au potențialul de a revoluționa accesibilitatea, făcând tehnologia mai accesibilă pe bariera lingvistică și senzorială.

În acest articol, vom discuta despre Agenți Mobili, un agent autonom multimodal de dispozitiv care utilizează inițial capacitatea de percepție vizuală pentru a identifica și a localiza elementele vizuale și textuale din interfața unei aplicații mobile cu precizie. Utilizând acest context de percepție vizuală, cadrul Agenților Mobili planifică și descompune operațiunile complexe în mod autonom și navighează prin aplicațiile mobile prin operații pas cu pas. Cadrul Agenților Mobili se diferențiază de soluțiile existente, deoarece nu se bazează pe metadatele sistemului mobil sau pe fișierele XML ale aplicațiilor mobile, permițând o adaptabilitate îmbunătățită în diverse medii de operare mobile, cu accent pe procesarea vizuală. Abordarea utilizată de cadrul Agenților Mobili elimină necesitatea de adaptări specifice sistemului, conducând la o eficiență îmbunătățită și la cerințe computaționale reduse.

Agenți Mobili: Agent Autonom Multimodal de Dispozitiv Mobil

În lumea rapidă a tehnologiei mobile, un concept pionierat apare ca o realizare deosebită: Modelele Mari de Limbaj, în special Modelele Mari de Limbaj Multimodale (MLLM) capabile să genereze o gamă largă de texte, imagini, videouri și discursuri în diverse limbi. Dezvoltarea rapidă a cadrului MLLM în ultimii ani a dat naștere unei noi și puternice aplicații a MLLM: agenți mobili autonomi. Agenții mobili autonomi sunt entități software care acționează, se deplasează și funcționează independent, fără a necesita comenzi umane directe, proiectate pentru a traversa rețele sau dispozitive pentru a îndeplini sarcini, a colecta informații sau a rezolva probleme.

Agenții Mobili sunt proiectați pentru a opera dispozitivul mobil al utilizatorului pe baza instrucțiunilor utilizatorului și a vizualizărilor ecranului, o sarcină care necesită ca agenții să posedă atât înțelegere semantică, cât și capacități de percepție vizuală. Cu toate acestea, agenții mobili existenți sunt departe de a fi perfecti, deoarece se bazează pe modele mari de limbaj multimodale, iar chiar și stadiul actual al cadrului MLLM, inclusiv GPT-4V, lipsesc capacitățile de percepție vizuală necesare pentru a servi ca un agent mobil eficient.

Pentru a aborda această problemă, unele cadre au optat pentru utilizarea fișierelor de layout ale interfeței utilizatorului pentru a asista GPT-4V sau alte MLLM cu capacități de localizare, unele cadre reușind să extragă poziții de operare pe ecran prin accesarea fișierelor XML ale aplicației, în timp ce alte cadre au optat pentru utilizarea codului HTML din aplicațiile web. Așa cum se poate observa, majoritatea acestor cadre se bazează pe accesarea fișierelor locale și a aplicațiilor subiacente, făcând metoda aproape ineficientă dacă cadrul nu poate accesa aceste fișiere. Pentru a aborda această problemă și a elimina dependența de fișierele locale ale agenților de metodele de localizare, dezvoltatorii au lucrat la Agenții Mobili, un agent mobil autonom cu impresionante capacități de percepție vizuală. Utilizând modulul său de percepție vizuală, cadrul Agenților Mobili utilizează capturi de ecran de la dispozitivul mobil pentru a localiza operațiunile cu precizie.

De asemenea, cadrul Agenților Mobili are ca scop să utilizeze capacitățile contextuale ale cadrului MLLM de ultimă generație, cum ar fi GPT-4V, pentru a atinge capacități de auto-planificare care permit modelului să planifice sarcini pe baza istoricului de operare, a instrucțiunilor utilizatorului și a capturilor de ecran în mod holistic. Pentru a îmbunătăți și mai mult capacitatea agentului de a identifica instrucțiuni incomplete și operațiuni greșite, cadrul Agenților Mobili introduce o metodă de auto-reflexie. Sub îndrumarea unor promturi atent create, agentul reflectă asupra operațiunilor incorecte și invalide în mod constant și oprește operațiunile odată ce sarcina sau instrucțiunea a fost finalizată.

În general, contribuțiile cadrului Agenților Mobili pot fi rezumate astfel:

  1. Agenții Mobili acționează ca agenți autonomi de dispozitiv mobil, utilizând unelte de percepție vizuală pentru a efectua localizarea operațiunilor. Planifică metodic fiecare pas și se angajează în introspecție. Notabil, Agenții Mobili se bazează exclusiv pe capturi de ecran ale dispozitivului, fără a utiliza codul sistemului, demonstrând o soluție bazată pur pe tehnici de percepție vizuală.
  2. Agenții Mobili introduc Mobile-Eval, o benchmark concepută pentru a evalua agenții de dispozitiv mobil. Această benchmark include o varietate de cele mai utilizate 10 aplicații mobile, împreună cu instrucțiuni inteligente pentru aceste aplicații, categorisite în trei niveluri de dificultate.

Agenți Mobili: Arhitectură și Metodologie

La nivelul său de bază, cadrul Agenților Mobili constă într-un model de limbaj multimodal de ultimă generație, GPT-4V, și un modul de detectare a textului utilizat pentru sarcinile de localizare a textului. Împreună cu GPT-4V, Agenții Mobili utilizează și un modul de detectare a iconitelor pentru localizarea iconitelor.

Percepție Vizuală

Așa cum s-a menționat anterior, modelul MLLM GPT-4V oferă rezultate satisfăcătoare pentru instrucțiuni și capturi de ecran, dar nu reușește să ofere locația eficientă unde au loc operațiunile. Din cauza acestei limitări, cadrul Agenților Mobili care implementează modelul GPT-4V trebuie să se bazeze pe unelte externe pentru a asista la localizarea operațiunilor, facilitând astfel operațiunile de ieșire pe ecranul mobil.

Localizarea Textului

Cadrul Agenților Mobili implementează un instrument OCR pentru a detecta poziția textului corespunzător pe ecran atunci când agentul trebuie să apese pe un anumit text afișat pe ecranul mobil. Există trei scenarii unice de localizare a textului.

Scenariu 1: Nu s-a detectat niciun text specificat

Problemă: Instrumentul OCR nu reușește să detecteze textul specificat, ceea ce poate apărea în imagini complexe sau din cauza limitărilor instrumentului OCR.

Răspuns: Instruiți agentul să:

  • Realege textul pentru apăsare, permițând o corectură manuală a omisiunii instrumentului OCR, sau
  • Să aleagă o operațiune alternativă, cum ar fi utilizarea unei metode de intrare diferite sau efectuarea unei alte acțiuni relevante pentru sarcina respectivă.

Motivare: Această flexibilitate este necesară pentru a gestiona inexactitățile ocazionale sau halucinațiile modelului GPT-4V, asigurând că agentul poate continua în mod eficient.

Scenariu 2: A fost detectat un singur exemplar de text specificat

Operațiune: Generează în mod automat o acțiune pentru a face clic pe coordonatele centrale ale casetei de text detectate.

Justificare: Cu doar un singur exemplar detectat, probabilitatea de identificare corectă este ridicată, făcând eficientă procedura de a continua cu o acțiune directă.

Scenariu 3: Au fost detectate multiple exemplare de text specificat

Evaluare: Evaluează mai întâi numărul de exemplare detectate:

Multe Exemplare: Indică un ecran aglomerat cu conținut similar, complicând procesul de selecție.

Acțiune: Cere agentului să realeagă textul, urmărind să refine selecția sau să ajusteze parametrii de căutare.

Câteva Exemplare: Un număr gestionabil de detectări permite o abordare mai nuanțată.

Acțiune: Decupează regiunile din jurul acestor exemplare, extinzând cutiile de text detectate spre exterior pentru a captura contextul suplimentar. Această extindere asigură că mai multe informații sunt păstrate, ajutând la luarea deciziilor.

Următorul Pas: Desenează cutii de detectare pe imaginile decupate și prezintă-le agentului. Această asistență vizuală ajută agentul în a decide care exemplar să interacționeze, pe baza indiciilor contextuale sau a cerințelor sarcinii.

Acestă abordare structurată optimizează interacțiunea dintre rezultatele OCR și operațiunile agentului, îmbunătățind fiabilitatea și adaptabilitatea sistemului în gestionarea sarcinilor bazate pe text în diverse scenarii. Întregul proces este demonstrat în imaginea următoare.

Localizarea Iconitelor

Cadrul Agenților Mobili implementează un instrument de detectare a iconitelor pentru a localiza poziția unei iconite atunci când agentul trebuie să facă clic pe ea pe ecranul mobil. Mai specific, cadrul solicită agentului să furnizeze atribute specifice ale imaginii, inclusiv formă și culoare, și apoi implementează metoda Grounding DINO cu promptul iconitei pentru a identifica toate iconitele conținute în captura de ecran. În final, Agenții Mobili utilizează cadrul CLIP pentru a calcula similaritatea dintre descrierea regiunii de clic și iconitele șterse, selectând regiunea cu cea mai mare similaritate pentru a face clic.

Executarea Instrucțiunilor

Pentru a traduce acțiunile în operațiuni pe ecran de către agenți, cadrul Agenților Mobili definește 8 operațiuni diferite.

  • Lansarea Aplicației (Numele Aplicației): Inițiază aplicația desemnată de pe interfața de desktop.
  • Apăsarea pe Text (Eticheta Textului): Interacționează cu porțiunea ecranului care afișează eticheta “Eticheta Textului”.
  • Interacțiunea cu Iconita (Descrierea Iconitei, Locația): Țintește și apelează zona specificată a iconitei, unde “Descrierea Iconitei” detaliază atribute precum culoarea și forma iconitei. Alege “Locația” din opțiuni precum partea superioară, inferioară, stânga, dreapta sau centru, posibil combinând două pentru navigare precisă și pentru a reduce greșelile.
  • Introducerea Textului (Textul de Intrare): Introduce textul dat în câmpul de text activ.
  • Derularea în Sus și în Jos: Navighează în sus sau în jos prin conținutul paginii curente.
  • Întoarcerea: Reveniți la pagina vizualizată anterior.
  • Închiderea: Reveniți direct la desktop din ecranul curent.
  • Oprește: Încheiați operațiunea odată ce sarcina a fost îndeplinită.

Auto-Planificarea

Fiecare pas al operațiunii este executat iterativ de cadrul Agenților Mobili, și înainte de începerea fiecărei iterații, utilizatorul este solicitat să furnizeze o instrucțiune de intrare, iar modelul Agenților Mobili utilizează instrucțiunea pentru a genera un prompt de sistem pentru întregul proces. De asemenea, înainte de începerea fiecărei iterații, cadrul capturează o imagine a ecranului și o furnizează agentului. Agentul observă apoi imaginea ecranului, istoricul de operare și prompturile de sistem pentru a produce următorul pas al operațiunilor.

Auto-Reflexia

În timpul operațiunilor sale, agentul poate întâmpina erori care îl împiedică să execute corect o comandă. Pentru a îmbunătăți rata de îndeplinire a instrucțiunilor, a fost implementată o abordare de auto-evaluare, care se activează în două circumstanțe specifice. Inițial, dacă agentul execută o acțiune defectuoasă sau invalidă care oprește progresul, cum ar fi atunci când recunoaște că imaginea ecranului rămâne neschimbată după operațiune sau afișează o pagină incorectă, va fi direcționat să considere acțiuni alternative sau să ajusteze parametrii operațiunii existente. În al doilea rând, agentul poate să nu detecteze anumite elemente ale unei directive complexe. Odată ce agentul a executat o serie de acțiuni pe baza planului inițial, va fi solicitat să revizuiască secvența de acțiuni, imaginea ecranului curent și directiva utilizatorului pentru a evalua dacă sarcina a fost finalizată. Dacă se găsesc discrepanțe, agentul este însărcinat să genereze în mod autonom noi acțiuni pentru a îndeplini directiva.

Agenți Mobili: Experimente și Rezultate

Pentru a evalua capacitățile sale în mod cuprinzător, cadrul Agenților Mobili introduce benchmark-ul Mobile-Eval, care constă în 10 aplicații mobile utilizate în mod obișnuit, și proiectează trei instrucțiuni pentru fiecare aplicație. Prima operațiune este una simplă și acoperă doar operațiunile de bază ale aplicației, în timp ce a doua operațiune este puțin mai complexă decât prima, având cerințe suplimentare. În final, a treia operațiune este cea mai complexă, conținând instrucțiuni abstracte ale utilizatorului, fără a specifica explicit ce aplicație să utilizeze sau ce operațiune să efectueze.

De asemenea, pentru a evalua performanța din perspective diferite, cadrul Agenților Mobili proiectează și implementează 4 metrice diferite.

  • Succes (Su): Dacă agentul mobil finalizează instrucțiunile, este considerat un succes.
  • Scor de Proces (PS): Metrica Scor de Proces măsoară acuratețea fiecărui pas în timpul executării instrucțiunilor utilizatorului și este calculată prin împărțirea numărului de pași corecți la numărul total de pași.
  • Eficiență Relativă (RE): Scorul de eficiență relativă este un raport între numărul de pași necesari unui utilizator pentru a efectua manual instrucțiunea și numărul de pași necesari agentului pentru a executa aceeași instrucțiune.
  • Rată de Finalizare (CR): Metrica Ratei de Finalizare împarte numărul de pași operați de cadrul care finalizează cu succes cu numărul total de pași efectuați de un utilizator pentru a finaliza instrucțiunea. Valoarea CR este 1 atunci când agentul finalizează instrucțiunea cu succes.

Rezultatele sunt demonstrate în figura următoare.

Inițial, pentru cele trei sarcini date, Agenții Mobili au atins rate de finalizare de 91%, 82% și 82%, respectiv. Deși nu toate sarcinile au fost executate fără erori, ratele de realizare pentru fiecare categorie de sarcină au depășit 90%. De asemenea, metrica Scor de Proces arată că Agenții Mobili demonstrează în mod constant o probabilitate ridicată de a executa acțiuni corecte pentru cele trei sarcini, cu rate de succes de aproximativ 80%. În plus, conform metricii de Eficiență Relativă, Agenții Mobili prezintă o eficiență de 80% în executarea operațiunilor la un nivel comparabil cu optimizarea umană. Aceste rezultate subliniază în mod colectiv competența Agenților Mobili ca asistenți pentru dispozitive mobile.

Figura următoare ilustrează capacitatea Agenților Mobili de a înțelege comenzile utilizatorilor și de a-și orkestra acțiunile în mod independent. Chiar și în absența detaliilor explicite de operare în instrucțiuni, Agenții Mobili au interpretat cu pricepere nevoile utilizatorilor, transformându-le în sarcini realizabile. Urmând această înțelegere, agentul a executat instrucțiunile prin intermediul unui proces de planificare sistematică.

Gânduri Finale

În acest articol am discutat despre Agenții Mobili, un agent autonom multimodal de dispozitiv care utilizează inițial tehnologii de percepție vizuală pentru a detecta și a localiza cu precizie atât elementele vizuale, cât și cele textuale din interfața unei aplicații mobile. Cu acest context de percepție vizuală, cadrul Agenților Mobili planifică și descompune sarcinile complexe în mod autonom și navighează prin aplicațiile mobile prin operații pas cu pas. Acest cadru se diferențiază de soluțiile existente, deoarece nu se bazează pe metadatele sistemului mobil sau pe fișierele XML ale aplicațiilor mobile, permițând o adaptabilitate îmbunătățită în diverse medii de operare mobile, cu accent pe procesarea vizuală. Strategia utilizată de cadrul Agenților Mobili elimină necesitatea de adaptări specifice sistemului, conducând la o eficiență îmbunătățită și la cerințe computaționale reduse, facilitând astfel o flexibilitate mai mare în ceea ce privește fișierele XML ale aplicațiilor mobile, permițând o abordare mai flexibilă și mai eficientă în diverse medii de operare mobile, cu accent pe procesarea vizuală.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.