AI-modeller og platforme
Mobile-Agents: Autonome Multimodale Mobilagent med Visuel Perception

Med udviklingen af Multimodale Store Sprogmodeller (MLLM) er der opstået en ny æra af mobileagentteknologi, der kan forstå og interagere med verden gennem tekst, billeder og tale. Disse agenter markerer en betydelig fremgang i forhold til traditionel AI, og giver brugerne en rigere og mere intuitiv måde at interagere med deres enheder på. Ved at udnytte MLLM kan disse agenter behandle og syntetisere store mængder af information fra forskellige modaliteter, og tilbyde brugerne personlig assistance og forbedre brugeroplevelsen på måder, der tidligere var umulige.
Disse agenter er drevet af avancerede maskinelærings-teknikker og avancerede naturligsprogsbehandlingsfunktioner, der giver dem mulighed for at forstå og generere menneske-lignende tekst, samt fortolke visuelle og auditive data med bemærkelsesværdig nøjagtighed. Fra genkendelse af objekter og scener i billeder til forståelse af talekommandoer og analyse af tekstsentiment, er disse multimodale agenter udstyret til at håndtere en bred vifte af inputs uden besvær. Potentialet for denne teknologi er enormt, og tilbyder mere avancerede og kontekst-bevidste tjenester, såsom virtuelle assistenter, der er afstemt til menneskelige følelser, og uddannelsesværktøjer, der tilpasser sig til individuelle læringsstile. De har også potentialet til at revolutionere tilgængeligheden, og gøre teknologien mere tilgængelig på tværs af sprog- og sansningsbarrierer.
I denne artikel vil vi tale om Mobile-Agents, en autonom multimodal enhedsagent, der først udnytter visuel perceptionsværktøjer til at identificere og lokalisere visuelle og tekstlige elementer i en mobilapplikations frontend-grænseflade nøjagtigt. Ved at bruge denne opfattede visuelle kontekst, planlægger og opdeler Mobile-Agent-rammen komplekse operationer selvstændigt, og navigerer gennem mobilapplikationer trin for trin. Mobile-Agent-rammen adskiller sig fra eksisterende løsninger, da den ikke afhænger af mobile systems metadata eller XML-filer, hvilket giver plads til forbedret tilpasning på tværs af forskellige mobile operativsystemer med fokus på visuel-centreret behandling. Tilgangen, der følges af Mobile-Agent-rammen, eliminerer behovet for system-specifikke tilpasninger, hvilket resulterer i forbedret ydeevne og lavere beregningskrav.
Mobile-Agents: Autonome Multimodale Mobilagent
I den hurtigt udviklende verden af mobilteknologi opstår et banebrydende koncept: Store Sprogmodeller, især Multimodale Store Sprogmodeller eller MLLM’er, der kan generere en bred vifte af tekst, billeder, videoer og tale på tværs af forskellige sprog. Den hurtige udvikling af MLLM-rammer i de seneste år har ført til en ny og kraftfuld anvendelse af MLLM’er: autonome mobile agenter. Autonome mobile agenter er software-enheder, der handler, bevæger sig og fungerer uafhængigt, uden at kræve direkte menneskelige kommandoer, og er designet til at trænge ind i netværk eller enheder for at udføre opgaver, indsamle information eller løse problemer.
Mobile-Agenter er designet til at operere brugerens mobilenhed på basis af brugerens instruktioner og skærmbilleder, en opgave, der kræver, at agenten besidder både semantisk forståelse og visuel perceptionsevne. Men eksisterende mobile agenter er langt fra perfekte, da de er baseret på multimodale store sprogmodeller, og selv de nuværende MLLM-rammer, herunder GPT-4V, mangler visuel perceptionsevne, der er nødvendig for at fungere som en effektiv mobilagent.
For at tackle dette problem har nogle rammer valgt at udnytte brugergrænsefladens layout-filer til at hjælpe GPT-4V eller andre MLLM’er med lokaliseringsfunktioner, hvor nogle rammer har formået at trække ud actionable positioner på skærmen ved at få adgang til XML-filerne i applikationen, mens andre rammer har valgt at bruge HTML-koden fra webapplikationerne. Som det kan ses, afhænger de fleste af disse rammer af adgang til underliggende og lokale applikationsfiler, hvilket gør metoden næsten ineffektiv, hvis rammen ikke kan få adgang til disse filer. For at løse dette problem og eliminere afhængigheden af lokale agenter af underliggende filer på lokaliseringsmetoderne, har udviklere arbejdet på Mobile-Agent, en autonom mobilagent med imponerende visuel perceptionsevne.
Yderligere har Mobile-Agents-rammen til formål at udnytte den kontekstuelle kapacitet af avancerede MLLM-rammer som GPT-4V til at opnå selvplanlægningsfunktioner, der giver modellen mulighed for at planlægge opgaver på basis af operationshistorik, brugerinstruktioner og skærmbilleder holistisk. For at yderligere forbedre agentens evne til at identificere ufuldstændige instruktioner og forkerte operationer, introducerer Mobile-Agents-rammen en selvrefleksionsmetode.
Samlet set kan bidragene fra Mobile-Agents-rammen sammenfattes som følger:
- Mobile-Agent fungerer som en autonom mobilagent, der udnytter visuel perceptionsværktøjer til at udføre operationer. Den planlægger og udfører hver trin selvstændigt og reflekterer over sine handlinger. Bemærkelsesværdigt er, at Mobile-Agent kun afhænger af enhedsskærmbilleder, uden brug af systemkode, og viser en løsning, der er baseret på ren visuel teknik.
- Mobile-Agent introducerer Mobile-Eval, en benchmark til at evaluere mobil-agenter. Denne benchmark omfatter en række af de ti mest almindeligt brugte mobilapplikationer, samt intelligente instruktioner for disse applikationer, inddelt i tre niveauer af sværhedsgrad.
Mobile-Agent: Arkitektur og Metodologi
I sin kerne består Mobile-Agents-rammen af en avanceret Multimodal Large Language Model, GPT-4V, samt en tekstdetektionsmodul til tekstlokaliseringsopgaver. Sammen med GPT-4V bruger Mobile-Agent også en ikondetektionsmodul til ikonlokaliseringsopgaver.
Visuel Perception
Som nævnt tidligere giver GPT-4V MLLM tilfredsstillende resultater for instruktioner og skærmbilleder, men den kan ikke udgive lokaliseringspositionerne effektivt, hvor operationerne finder sted. På grund af denne begrænsning har Mobile-Agents-rammen, der implementerer GPT-4V-modellen, brug for at afhænge af eksterne værktøjer til at hjælpe med operationer, og dermed faciliterer operationer på mobilskærmen.
Textlokaliseringsopgaver
Mobile-Agents-rammen implementerer en OCR-værktøj til at detektere positionen af den pågældende tekst på skærmen, når agenten skal trykke på en bestemt tekst, der vises på mobilskærmen. Der er tre unikke tekstlokaliserings-scenarier.
Scenario 1: Ingen Specifik Tekst Detekteret
Problem: OCR’en kan ikke detektere den specificerede tekst, hvilket kan opstå i komplekse billeder eller på grund af OCR-begrænsninger.
Svar: Instruer agenten til enten at:
- Vælge tekst til trykning igen, hvilket giver mulighed for en manuel korrektion af OCR’ens oversigt, eller
- Vælge en alternativ operation, såsom brug af en anden indtastningsmetode eller udførelse af en anden handling, der er relevant for opgaven.
Begrundelse: Denne fleksibilitet er nødvendig for at håndtere de lejlighedsvise uændringer eller hallucinationer af GPT-4V, og sikre, at agenten kan fortsætte effektivt.
Scenario 2: Enkelt Eksempel af Specifik Tekst Detekteret
Operation: Automatisk generer en handling til at klikke på centerkoordinaterne af den detekterede tekstboks.
Begrundelse: Med kun ét eksempel detekteret er sandsynligheden for korrekt identifikation høj, hvilket gør det effektivt at fortsætte med en direkte handling.
Scenario 3: Flere Eksempler af Specifik Tekst Detekteret
Vurdering: Først vurderer antallet af detekterede eksempler:
Mange Eksempler: Indikerer en skærm fyldt med lignende indhold, hvilket komplicerer valget.
Handling: Anmod agenten om at vælge tekst igen, med det formål at finjustere valget eller tilpasse søgeparametrene.
Få Eksempler: En håndterbar mængde af detektioner giver mulighed for en mere nuanceret tilgang.
Handling: Beskær områderne omkring disse eksempler, og udvid tekstdetektionsboksen udad for at fange mere kontekst. Denne udvidelse sikrer, at mere information bevares, og hjælper med beslutningstagningen.
Næste Trin: Tegn detektionsbokse på de beskårne billeder, og præsenter dem for agenten. Denne visuelle hjælp hjælper agenten med at afgøre, hvilket eksempel at interagere med, baseret på kontekstuelle hints eller opgavekrav.
Denne strukturerede tilgang optimerer interaktionen mellem OCR-resultater og agentoperationer, og forbedrer systemets pålidelighed og tilpasningsevne i håndtering af tekstbaserede opgaver på tværs af forskellige scenarier. Den hele proces demonstreres i følgende billede.

Ikondetektion
Mobile-Agents-rammen implementerer en ikondetektionsværktøj til at lokalisere positionen af en ikon, når agenten skal klikke på det på mobilskærmen. For at være mere specifik anmoder rammen først agenten om at give bestemte attributter af billedet, herunder form og farve, og derefter implementerer rammen Grounding DINO-metoden med ikonprompten til at identificere alle ikoner indeholdt i skærmbilledet. Til sidst bruger Mobile-Agent CLIP-rammen til at beregne ligheden mellem beskrivelsen af klikområdet og ligheden mellem de slettede ikoner, og vælger området med den højeste lighed til et klik.

Instruction Execution
For at oversætte handlinger til operationer på skærmen af agenten definerer Mobile-Agents-rammen 8 forskellige operationer.
- Start Applikation (Applikationsnavn): Initierer den pågældende applikation fra desktop-grænsefladen.
- Klik på Tekst (Tekstlabel): Interagerer med skærmdelen, der viser label “Tekstlabel”.
- Interager med Ikondetektion (Ikondetektionsbeskrivelse, Position): Target og klik på det specificerede ikonområde, hvor “Ikondetektionsbeskrivelse” detaljerer attributter som farve og form af ikonet. Vælg “Position” fra muligheder som top, bottom, venstre, højre eller center, muligvis kombineret for præcis navigation og reducere fejl.
- Indtast Tekst (Indtastningstekst): Indtast den givne “Indtastningstekst” i den aktive tekstfelt.
- Rul Op & Ned: Naviger op eller ned gennem indholdet af den nuværende side.
- Gå Tilbage: Gå tilbage til den forrige side.
- Luk: Gå tilbage til desktop direkte fra den nuværende skærm.
- Stop: Afslut operationen, når opgaven er fuldført.
Selvplanlægning
Hver trin af operationen udføres iterativt af rammen, og før starten af hver iteration anmoder brugeren om at give en input-instruktion, og Mobile-Agent-modellen bruger instruktionen til at generere en systemprompt for hele processen. Yderligere anmoder rammen om at fange et skærmbillede og føde det til agenten før starten af hver iteration. Agenten observerer derefter skærmbilledet, operationshistorik og systemprompts for at outputte det næste trin af operationerne.
Selvrefleksion
Under operationerne kan agenten møde fejl, der forhindrer den i at udføre en kommando succesfuldt. For at forbedre instruktionsopfyldningsraten er en selv-evalueringstilgang implementeret, der aktiveres under to bestemte omstændigheder. Først, hvis agenten udfører en fejl eller ugyldig handling, der standser fremdrift, som når den erkender, at skærmbilledet forbliver uændret efter operationen eller viser en forkert side, vil den blive anmodet om at overveje alternative handlinger eller tilpasse eksisterende operationsparametre. For det andet kan agenten gå glip af nogle elementer i en kompleks direktiv. Når agenten har udført en række handlinger baseret på sin oprindelige plan, vil den blive anmodet om at gennemgå sin handlingsserie, det seneste skærmbillede og brugerens direktiv for at vurdere, om opgaven er fuldført. Hvis der findes afvigelser, vil agenten blive bedt om at generere nye handlinger for at opfylde direktivet.
Mobile-Agent: Eksperimenter og Resultater
For at evaluere dets evner omfattende introducerer Mobile-Agents-rammen Mobile-Eval-benchmarken, der består af 10 almindeligt brugte applikationer, og designer tre instruktioner for hver applikation. Den første operation er ret fremad, og dækker kun grundlæggende applikationsoperationer, mens den anden operation er lidt mere kompleks end den første, da den har nogle ekstra krav. Endelig er den tredje operation den mest komplekse af alle, da den indeholder abstrakt brugerinstruktion, hvor brugeren ikke udtrykkeligt specificerer, hvilken applikation der skal bruges eller hvilken operation der skal udføres.
For at vurdere ydeevnen fra forskellige perspektiver designer og implementerer Mobile-Agents-rammen fire forskellige metrikker.
- Succes eller Succes: Hvis mobile-agenten fuldfører instruktionerne, betragtes det som en succes.
- Process Score eller PS: Process Score-metriken måler nøjagtigheden af hver trin under udførelsen af brugerinstruktionerne, og beregnes ved at dividere antallet af korrekte trin med det totale antal trin.
- Relativ Effektivitet eller RE: Den relative effektivitetsscore er en ratio eller sammenligning mellem antallet af trin, det tager en menneskelig at udføre instruktionen manuelt, og antallet af trin, det tager agenten at udføre den samme instruktion.
- Fuldførelsesrate eller CR: Fuldførelsesratemetriken dividerer antallet af menneske-opererede trin, som rammen fuldfører succesfuldt, med det totale antal trin, det tager en menneskelig at fuldføre instruktionen. Værdien af CR er 1, når agenten fuldfører instruktionen succesfuldt.
Resultaterne demonstreres i følgende figur.

Initielt for de tre givne opgaver opnåede Mobile-Agent fuldførelsesrater på 91%, 82% og 82%, henholdsvis. Selv om ikke alle opgaver blev udført fejlfrit, overgik opfyldningsraterne for hver opgavekategori 90%. Yderligere viser PS-metriken, at Mobile-Agent konsekvent demonstrerer en høj sandsynlighed for at udføre korrekte handlinger for de tre opgaver, med succesrater omkring 80%. Desuden viser RE-metriken, at Mobile-Agent udviser en effektivitet på 80% i udførelse af operationer på et niveau, der er sammenligneligt med menneskelig optimalitet. Disse resultater understreger samlet Mobile-Agents dygtighed som en mobil enhedsassistent.
Den følgende figur illustrerer Mobile-Agents evne til at forstå brugerinstruktioner og selvstændigt orkestrere sine handlinger. Selv i mangelen på eksplicit operationsdetaljer i instruktionerne tolkede Mobile-Agent brugerens behov korrekt og omdannede dem til handlinger via en systematisk planlægningsproces.

Endelige Tanker
I denne artikel har vi talt om Mobile-Agents, en multimodal autonom enhedsagent, der først udnytter visuel perceptionsteknologi til at præcist detektere og lokalisere både visuelle og tekstlige komponenter i en mobilapplikations grænseflade. Med denne visuelle kontekst i mente planlægger og opdeler Mobile-Agents-rammen komplekse operationer selvstændigt og navigerer gennem mobilapplikationer trin for trin. Denne ramme adskiller sig fra eksisterende løsninger, da den ikke afhænger af mobile systems metadata eller mobilapplikationernes XML-filer, hvilket giver plads til forbedret tilpasning på tværs af forskellige mobile operativsystemer med fokus på visuel-centreret behandling. Tilgangen, der følges af Mobile-Agents-rammen, eliminerer behovet for system-specifikke tilpasninger, hvilket resulterer i forbedret ydeevne og lavere beregningskrav. Mobile-Agents-rammen obviaterer behovet for system-specifikke tilpasninger, hvilket fører til forbedret effektivitet og reducerede beregningskrav. Denne strategi giver mulighed for en større fleksibilitet på tværs af forskellige mobile operativsystemer med fokus på visuel-centreret behandling, og giver mobile-applikationernes XML-filer større fleksibilitet på tværs af forskellige mobile operativsystemer med fokus på visuel-centreret behandling.












