Modele Či platforme AI
AgenČi Mobili: Agent Autonom Multimodal pentru Dispozitive Mobile cu PercepČie VizualÄ

ApariČia Modelelor Mari de Limbaj Multimodale (MLLM) a deschis o nouÄ erÄ a agenČilor de dispozitive mobile, capabili sÄ ÃŪnČeleagÄ Či sÄ interacČioneze cu lumea prin text, imagini Či voce. AceČti agenČi marcheazÄ o avansare semnificativÄ faČÄ de inteligenČa artificialÄ tradiČionalÄ, oferind o modalitate mai bogatÄ Či mai intuitivÄ pentru utilizatori de a interacČiona cu dispozitivele lor. Prin utilizarea MLLM, aceČti agenČi pot procesa Či sintetiza cantitÄČi uriaČe de informaČii din diverse modalitÄČi, permiČÃĒndu-le sÄ ofere asistenČÄ personalizatÄ Či sÄ ÃŪmbunÄtÄČeascÄ experienČa utilizatorilor ÃŪn moduri anterior de neimaginat.
AceČti agenČi sunt alimentaČi de tehnici de ÃŪnvÄČare automatÄ de ultimÄ generaČie Či de capacitÄČi avansate de procesare a limbajului natural, permiČÃĒndu-le sÄ ÃŪnČeleagÄ Či sÄ genereze text umanoid, precum Či sÄ interpreteze date vizuale Či auditive cu o acurateČe remarcabilÄ. De la recunoaČterea obiectelor Či a scenelor din imagini la ÃŪnČelegerea comenzilor vocale Či analiza sentimentului textului, aceČti agenČi multimodali sunt echipaČi pentru a gestiona o gamÄ largÄ de intrÄri ÃŪn mod transparent. PotenČialul acestei tehnologii este vast, oferind servicii mai sofisticate Či mai conČtiente de context, cum ar fi asistenČi virtuali atenČi la emoČiile umane Či instrumente educaČionale care se adapteazÄ la stilurile individuale de ÃŪnvÄČare. De asemenea, au potenČialul de a revoluČiona accesibilitatea, fÄcÃĒnd tehnologia mai accesibilÄ pe bariera lingvisticÄ Či senzorialÄ.
Ãn acest articol, vom discuta despre AgenČi Mobili, un agent autonom multimodal de dispozitiv care utilizeazÄ iniČial capacitatea de percepČie vizualÄ pentru a identifica Či a localiza elementele vizuale Či textuale din interfaČa unei aplicaČii mobile cu precizie. UtilizÃĒnd acest context de percepČie vizualÄ, cadrul AgenČilor Mobili planificÄ Či descompune operaČiunile complexe ÃŪn mod autonom Či navigheazÄ prin aplicaČiile mobile prin operaČii pas cu pas. Cadrul AgenČilor Mobili se diferenČiazÄ de soluČiile existente, deoarece nu se bazeazÄ pe metadatele sistemului mobil sau pe fiČierele XML ale aplicaČiilor mobile, permiČÃĒnd o adaptabilitate ÃŪmbunÄtÄČitÄ ÃŪn diverse medii de operare mobile, cu accent pe procesarea vizualÄ. Abordarea utilizatÄ de cadrul AgenČilor Mobili eliminÄ necesitatea de adaptÄri specifice sistemului, conducÃĒnd la o eficienČÄ ÃŪmbunÄtÄČitÄ Či la cerinČe computaČionale reduse.
AgenČi Mobili: Agent Autonom Multimodal de Dispozitiv Mobil
Ãn lumea rapidÄ a tehnologiei mobile, un concept pionierat apare ca o realizare deosebitÄ: Modelele Mari de Limbaj, ÃŪn special Modelele Mari de Limbaj Multimodale (MLLM) capabile sÄ genereze o gamÄ largÄ de texte, imagini, videouri Či discursuri ÃŪn diverse limbi. Dezvoltarea rapidÄ a cadrului MLLM ÃŪn ultimii ani a dat naČtere unei noi Či puternice aplicaČii a MLLM: agenČi mobili autonomi. AgenČii mobili autonomi sunt entitÄČi software care acČioneazÄ, se deplaseazÄ Či funcČioneazÄ independent, fÄrÄ a necesita comenzi umane directe, proiectate pentru a traversa reČele sau dispozitive pentru a ÃŪndeplini sarcini, a colecta informaČii sau a rezolva probleme.
AgenČii Mobili sunt proiectaČi pentru a opera dispozitivul mobil al utilizatorului pe baza instrucČiunilor utilizatorului Či a vizualizÄrilor ecranului, o sarcinÄ care necesitÄ ca agenČii sÄ posedÄ atÃĒt ÃŪnČelegere semanticÄ, cÃĒt Či capacitÄČi de percepČie vizualÄ. Cu toate acestea, agenČii mobili existenČi sunt departe de a fi perfecti, deoarece se bazeazÄ pe modele mari de limbaj multimodale, iar chiar Či stadiul actual al cadrului MLLM, inclusiv GPT-4V, lipsesc capacitÄČile de percepČie vizualÄ necesare pentru a servi ca un agent mobil eficient.
Pentru a aborda aceastÄ problemÄ, unele cadre au optat pentru utilizarea fiČierelor de layout ale interfeČei utilizatorului pentru a asista GPT-4V sau alte MLLM cu capacitÄČi de localizare, unele cadre reuČind sÄ extragÄ poziČii de operare pe ecran prin accesarea fiČierelor XML ale aplicaČiei, ÃŪn timp ce alte cadre au optat pentru utilizarea codului HTML din aplicaČiile web. AČa cum se poate observa, majoritatea acestor cadre se bazeazÄ pe accesarea fiČierelor locale Či a aplicaČiilor subiacente, fÄcÃĒnd metoda aproape ineficientÄ dacÄ cadrul nu poate accesa aceste fiČiere. Pentru a aborda aceastÄ problemÄ Či a elimina dependenČa de fiČierele locale ale agenČilor de metodele de localizare, dezvoltatorii au lucrat la AgenČii Mobili, un agent mobil autonom cu impresionante capacitÄČi de percepČie vizualÄ. UtilizÃĒnd modulul sÄu de percepČie vizualÄ, cadrul AgenČilor Mobili utilizeazÄ capturi de ecran de la dispozitivul mobil pentru a localiza operaČiunile cu precizie.
De asemenea, cadrul AgenČilor Mobili are ca scop sÄ utilizeze capacitÄČile contextuale ale cadrului MLLM de ultimÄ generaČie, cum ar fi GPT-4V, pentru a atinge capacitÄČi de auto-planificare care permit modelului sÄ planifice sarcini pe baza istoricului de operare, a instrucČiunilor utilizatorului Či a capturilor de ecran ÃŪn mod holistic. Pentru a ÃŪmbunÄtÄČi Či mai mult capacitatea agentului de a identifica instrucČiuni incomplete Či operaČiuni greČite, cadrul AgenČilor Mobili introduce o metodÄ de auto-reflexie. Sub ÃŪndrumarea unor promturi atent create, agentul reflectÄ asupra operaČiunilor incorecte Či invalide ÃŪn mod constant Či opreČte operaČiunile odatÄ ce sarcina sau instrucČiunea a fost finalizatÄ.
Ãn general, contribuČiile cadrului AgenČilor Mobili pot fi rezumate astfel:
- AgenČii Mobili acČioneazÄ ca agenČi autonomi de dispozitiv mobil, utilizÃĒnd unelte de percepČie vizualÄ pentru a efectua localizarea operaČiunilor. PlanificÄ metodic fiecare pas Či se angajeazÄ ÃŪn introspecČie. Notabil, AgenČii Mobili se bazeazÄ exclusiv pe capturi de ecran ale dispozitivului, fÄrÄ a utiliza codul sistemului, demonstrÃĒnd o soluČie bazatÄ pur pe tehnici de percepČie vizualÄ.
- AgenČii Mobili introduc Mobile-Eval, o benchmark conceputÄ pentru a evalua agenČii de dispozitiv mobil. AceastÄ benchmark include o varietate de cele mai utilizate 10 aplicaČii mobile, ÃŪmpreunÄ cu instrucČiuni inteligente pentru aceste aplicaČii, categorisite ÃŪn trei niveluri de dificultate.
AgenČi Mobili: ArhitecturÄ Či Metodologie
La nivelul sÄu de bazÄ, cadrul AgenČilor Mobili constÄ ÃŪntr-un model de limbaj multimodal de ultimÄ generaČie, GPT-4V, Či un modul de detectare a textului utilizat pentru sarcinile de localizare a textului. ÃmpreunÄ cu GPT-4V, AgenČii Mobili utilizeazÄ Či un modul de detectare a iconitelor pentru localizarea iconitelor.
PercepČie VizualÄ
AČa cum s-a menČionat anterior, modelul MLLM GPT-4V oferÄ rezultate satisfÄcÄtoare pentru instrucČiuni Či capturi de ecran, dar nu reuČeČte sÄ ofere locaČia eficientÄ unde au loc operaČiunile. Din cauza acestei limitÄri, cadrul AgenČilor Mobili care implementeazÄ modelul GPT-4V trebuie sÄ se bazeze pe unelte externe pentru a asista la localizarea operaČiunilor, facilitÃĒnd astfel operaČiunile de ieČire pe ecranul mobil.
Localizarea Textului
Cadrul AgenČilor Mobili implementeazÄ un instrument OCR pentru a detecta poziČia textului corespunzÄtor pe ecran atunci cÃĒnd agentul trebuie sÄ apese pe un anumit text afiČat pe ecranul mobil. ExistÄ trei scenarii unice de localizare a textului.
Scenariu 1: Nu s-a detectat niciun text specificat
ProblemÄ: Instrumentul OCR nu reuČeČte sÄ detecteze textul specificat, ceea ce poate apÄrea ÃŪn imagini complexe sau din cauza limitÄrilor instrumentului OCR.
RÄspuns: InstruiČi agentul sÄ:
- Realege textul pentru apÄsare, permiČÃĒnd o corecturÄ manualÄ a omisiunii instrumentului OCR, sau
- SÄ aleagÄ o operaČiune alternativÄ, cum ar fi utilizarea unei metode de intrare diferite sau efectuarea unei alte acČiuni relevante pentru sarcina respectivÄ.
Motivare: AceastÄ flexibilitate este necesarÄ pentru a gestiona inexactitÄČile ocazionale sau halucinaČiile modelului GPT-4V, asigurÃĒnd cÄ agentul poate continua ÃŪn mod eficient.
Scenariu 2: A fost detectat un singur exemplar de text specificat
OperaČiune: GenereazÄ ÃŪn mod automat o acČiune pentru a face clic pe coordonatele centrale ale casetei de text detectate.
Justificare: Cu doar un singur exemplar detectat, probabilitatea de identificare corectÄ este ridicatÄ, fÄcÃĒnd eficientÄ procedura de a continua cu o acČiune directÄ.
Scenariu 3: Au fost detectate multiple exemplare de text specificat
Evaluare: EvalueazÄ mai ÃŪntÃĒi numÄrul de exemplare detectate:
Multe Exemplare: IndicÄ un ecran aglomerat cu conČinut similar, complicÃĒnd procesul de selecČie.
AcČiune: Cere agentului sÄ realeagÄ textul, urmÄrind sÄ refine selecČia sau sÄ ajusteze parametrii de cÄutare.
CÃĒteva Exemplare: Un numÄr gestionabil de detectÄri permite o abordare mai nuanČatÄ.
AcČiune: DecupeazÄ regiunile din jurul acestor exemplare, extinzÃĒnd cutiile de text detectate spre exterior pentru a captura contextul suplimentar. AceastÄ extindere asigurÄ cÄ mai multe informaČii sunt pÄstrate, ajutÃĒnd la luarea deciziilor.
UrmÄtorul Pas: DeseneazÄ cutii de detectare pe imaginile decupate Či prezintÄ-le agentului. AceastÄ asistenČÄ vizualÄ ajutÄ agentul ÃŪn a decide care exemplar sÄ interacČioneze, pe baza indiciilor contextuale sau a cerinČelor sarcinii.
AcestÄ abordare structuratÄ optimizeazÄ interacČiunea dintre rezultatele OCR Či operaČiunile agentului, ÃŪmbunÄtÄČind fiabilitatea Či adaptabilitatea sistemului ÃŪn gestionarea sarcinilor bazate pe text ÃŪn diverse scenarii. Ãntregul proces este demonstrat ÃŪn imaginea urmÄtoare.

Localizarea Iconitelor
Cadrul AgenČilor Mobili implementeazÄ un instrument de detectare a iconitelor pentru a localiza poziČia unei iconite atunci cÃĒnd agentul trebuie sÄ facÄ clic pe ea pe ecranul mobil. Mai specific, cadrul solicitÄ agentului sÄ furnizeze atribute specifice ale imaginii, inclusiv formÄ Či culoare, Či apoi implementeazÄ metoda Grounding DINO cu promptul iconitei pentru a identifica toate iconitele conČinute ÃŪn captura de ecran. Ãn final, AgenČii Mobili utilizeazÄ cadrul CLIP pentru a calcula similaritatea dintre descrierea regiunii de clic Či iconitele Čterse, selectÃĒnd regiunea cu cea mai mare similaritate pentru a face clic.

Executarea InstrucČiunilor
Pentru a traduce acČiunile ÃŪn operaČiuni pe ecran de cÄtre agenČi, cadrul AgenČilor Mobili defineČte 8 operaČiuni diferite.
- Lansarea AplicaČiei (Numele AplicaČiei): IniČiazÄ aplicaČia desemnatÄ de pe interfaČa de desktop.
- ApÄsarea pe Text (Eticheta Textului): InteracČioneazÄ cu porČiunea ecranului care afiČeazÄ eticheta âEticheta Textuluiâ.
- InteracČiunea cu Iconita (Descrierea Iconitei, LocaČia): ČinteČte Či apeleazÄ zona specificatÄ a iconitei, unde âDescrierea Iconiteiâ detaliazÄ atribute precum culoarea Či forma iconitei. Alege âLocaČiaâ din opČiuni precum partea superioarÄ, inferioarÄ, stÃĒnga, dreapta sau centru, posibil combinÃĒnd douÄ pentru navigare precisÄ Či pentru a reduce greČelile.
- Introducerea Textului (Textul de Intrare): Introduce textul dat ÃŪn cÃĒmpul de text activ.
- Derularea ÃŪn Sus Či ÃŪn Jos: NavigheazÄ ÃŪn sus sau ÃŪn jos prin conČinutul paginii curente.
- Ãntoarcerea: ReveniČi la pagina vizualizatÄ anterior.
- Ãnchiderea: ReveniČi direct la desktop din ecranul curent.
- OpreČte: ÃncheiaČi operaČiunea odatÄ ce sarcina a fost ÃŪndeplinitÄ.
Auto-Planificarea
Fiecare pas al operaČiunii este executat iterativ de cadrul AgenČilor Mobili, Či ÃŪnainte de ÃŪnceperea fiecÄrei iteraČii, utilizatorul este solicitat sÄ furnizeze o instrucČiune de intrare, iar modelul AgenČilor Mobili utilizeazÄ instrucČiunea pentru a genera un prompt de sistem pentru ÃŪntregul proces. De asemenea, ÃŪnainte de ÃŪnceperea fiecÄrei iteraČii, cadrul captureazÄ o imagine a ecranului Či o furnizeazÄ agentului. Agentul observÄ apoi imaginea ecranului, istoricul de operare Či prompturile de sistem pentru a produce urmÄtorul pas al operaČiunilor.
Auto-Reflexia
Ãn timpul operaČiunilor sale, agentul poate ÃŪntÃĒmpina erori care ÃŪl ÃŪmpiedicÄ sÄ execute corect o comandÄ. Pentru a ÃŪmbunÄtÄČi rata de ÃŪndeplinire a instrucČiunilor, a fost implementatÄ o abordare de auto-evaluare, care se activeazÄ ÃŪn douÄ circumstanČe specifice. IniČial, dacÄ agentul executÄ o acČiune defectuoasÄ sau invalidÄ care opreČte progresul, cum ar fi atunci cÃĒnd recunoaČte cÄ imaginea ecranului rÄmÃĒne neschimbatÄ dupÄ operaČiune sau afiČeazÄ o paginÄ incorectÄ, va fi direcČionat sÄ considere acČiuni alternative sau sÄ ajusteze parametrii operaČiunii existente. Ãn al doilea rÃĒnd, agentul poate sÄ nu detecteze anumite elemente ale unei directive complexe. OdatÄ ce agentul a executat o serie de acČiuni pe baza planului iniČial, va fi solicitat sÄ revizuiascÄ secvenČa de acČiuni, imaginea ecranului curent Či directiva utilizatorului pentru a evalua dacÄ sarcina a fost finalizatÄ. DacÄ se gÄsesc discrepanČe, agentul este ÃŪnsÄrcinat sÄ genereze ÃŪn mod autonom noi acČiuni pentru a ÃŪndeplini directiva.
AgenČi Mobili: Experimente Či Rezultate
Pentru a evalua capacitÄČile sale ÃŪn mod cuprinzÄtor, cadrul AgenČilor Mobili introduce benchmark-ul Mobile-Eval, care constÄ ÃŪn 10 aplicaČii mobile utilizate ÃŪn mod obiČnuit, Či proiecteazÄ trei instrucČiuni pentru fiecare aplicaČie. Prima operaČiune este una simplÄ Či acoperÄ doar operaČiunile de bazÄ ale aplicaČiei, ÃŪn timp ce a doua operaČiune este puČin mai complexÄ decÃĒt prima, avÃĒnd cerinČe suplimentare. Ãn final, a treia operaČiune este cea mai complexÄ, conČinÃĒnd instrucČiuni abstracte ale utilizatorului, fÄrÄ a specifica explicit ce aplicaČie sÄ utilizeze sau ce operaČiune sÄ efectueze.
De asemenea, pentru a evalua performanČa din perspective diferite, cadrul AgenČilor Mobili proiecteazÄ Či implementeazÄ 4 metrice diferite.
- Succes (Su): DacÄ agentul mobil finalizeazÄ instrucČiunile, este considerat un succes.
- Scor de Proces (PS): Metrica Scor de Proces mÄsoarÄ acurateČea fiecÄrui pas ÃŪn timpul executÄrii instrucČiunilor utilizatorului Či este calculatÄ prin ÃŪmpÄrČirea numÄrului de paČi corecČi la numÄrul total de paČi.
- EficienČÄ RelativÄ (RE): Scorul de eficienČÄ relativÄ este un raport ÃŪntre numÄrul de paČi necesari unui utilizator pentru a efectua manual instrucČiunea Či numÄrul de paČi necesari agentului pentru a executa aceeaČi instrucČiune.
- RatÄ de Finalizare (CR): Metrica Ratei de Finalizare ÃŪmparte numÄrul de paČi operaČi de cadrul care finalizeazÄ cu succes cu numÄrul total de paČi efectuaČi de un utilizator pentru a finaliza instrucČiunea. Valoarea CR este 1 atunci cÃĒnd agentul finalizeazÄ instrucČiunea cu succes.
Rezultatele sunt demonstrate ÃŪn figura urmÄtoare.

IniČial, pentru cele trei sarcini date, AgenČii Mobili au atins rate de finalizare de 91%, 82% Či 82%, respectiv. DeČi nu toate sarcinile au fost executate fÄrÄ erori, ratele de realizare pentru fiecare categorie de sarcinÄ au depÄČit 90%. De asemenea, metrica Scor de Proces aratÄ cÄ AgenČii Mobili demonstreazÄ ÃŪn mod constant o probabilitate ridicatÄ de a executa acČiuni corecte pentru cele trei sarcini, cu rate de succes de aproximativ 80%. Ãn plus, conform metricii de EficienČÄ RelativÄ, AgenČii Mobili prezintÄ o eficienČÄ de 80% ÃŪn executarea operaČiunilor la un nivel comparabil cu optimizarea umanÄ. Aceste rezultate subliniazÄ ÃŪn mod colectiv competenČa AgenČilor Mobili ca asistenČi pentru dispozitive mobile.
Figura urmÄtoare ilustreazÄ capacitatea AgenČilor Mobili de a ÃŪnČelege comenzile utilizatorilor Či de a-Či orkestra acČiunile ÃŪn mod independent. Chiar Či ÃŪn absenČa detaliilor explicite de operare ÃŪn instrucČiuni, AgenČii Mobili au interpretat cu pricepere nevoile utilizatorilor, transformÃĒndu-le ÃŪn sarcini realizabile. UrmÃĒnd aceastÄ ÃŪnČelegere, agentul a executat instrucČiunile prin intermediul unui proces de planificare sistematicÄ.

GÃĒnduri Finale
Ãn acest articol am discutat despre AgenČii Mobili, un agent autonom multimodal de dispozitiv care utilizeazÄ iniČial tehnologii de percepČie vizualÄ pentru a detecta Či a localiza cu precizie atÃĒt elementele vizuale, cÃĒt Či cele textuale din interfaČa unei aplicaČii mobile. Cu acest context de percepČie vizualÄ, cadrul AgenČilor Mobili planificÄ Či descompune sarcinile complexe ÃŪn mod autonom Či navigheazÄ prin aplicaČiile mobile prin operaČii pas cu pas. Acest cadru se diferenČiazÄ de soluČiile existente, deoarece nu se bazeazÄ pe metadatele sistemului mobil sau pe fiČierele XML ale aplicaČiilor mobile, permiČÃĒnd o adaptabilitate ÃŪmbunÄtÄČitÄ ÃŪn diverse medii de operare mobile, cu accent pe procesarea vizualÄ. Strategia utilizatÄ de cadrul AgenČilor Mobili eliminÄ necesitatea de adaptÄri specifice sistemului, conducÃĒnd la o eficienČÄ ÃŪmbunÄtÄČitÄ Či la cerinČe computaČionale reduse, facilitÃĒnd astfel o flexibilitate mai mare ÃŪn ceea ce priveČte fiČierele XML ale aplicaČiilor mobile, permiČÃĒnd o abordare mai flexibilÄ Či mai eficientÄ ÃŪn diverse medii de operare mobile, cu accent pe procesarea vizualÄ.












