AI-modeller og platforme
Mobile-Agents: Autonome Multimodale Mobilagent med Visuel Perception

Med udviklingen af Multimodale Store Sprogmodeller (MLLM) er der opstÃĨet en ny ÃĶra af mobileagentteknologi, der kan forstÃĨ og interagere med verden gennem tekst, billeder og tale. Disse agenter markerer en betydelig fremgang i forhold til traditionel AI, og giver brugerne en rigere og mere intuitiv mÃĨde at interagere med deres enheder pÃĨ. Ved at udnytte MLLM kan disse agenter behandle og syntetisere store mÃĶngder af information fra forskellige modaliteter, og tilbyde brugerne personlig assistance og forbedre brugeroplevelsen pÃĨ mÃĨder, der tidligere var umulige.
Disse agenter er drevet af avancerede maskinelÃĶrings-teknikker og avancerede naturligsprogsbehandlingsfunktioner, der giver dem mulighed for at forstÃĨ og generere menneske-lignende tekst, samt fortolke visuelle og auditive data med bemÃĶrkelsesvÃĶrdig nÃļjagtighed. Fra genkendelse af objekter og scener i billeder til forstÃĨelse af talekommandoer og analyse af tekstsentiment, er disse multimodale agenter udstyret til at hÃĨndtere en bred vifte af inputs uden besvÃĶr. Potentialet for denne teknologi er enormt, og tilbyder mere avancerede og kontekst-bevidste tjenester, sÃĨsom virtuelle assistenter, der er afstemt til menneskelige fÃļlelser, og uddannelsesvÃĶrktÃļjer, der tilpasser sig til individuelle lÃĶringsstile. De har ogsÃĨ potentialet til at revolutionere tilgÃĶngeligheden, og gÃļre teknologien mere tilgÃĶngelig pÃĨ tvÃĶrs af sprog- og sansningsbarrierer.
I denne artikel vil vi tale om Mobile-Agents, en autonom multimodal enhedsagent, der fÃļrst udnytter visuel perceptionsvÃĶrktÃļjer til at identificere og lokalisere visuelle og tekstlige elementer i en mobilapplikations frontend-grÃĶnseflade nÃļjagtigt. Ved at bruge denne opfattede visuelle kontekst, planlÃĶgger og opdeler Mobile-Agent-rammen komplekse operationer selvstÃĶndigt, og navigerer gennem mobilapplikationer trin for trin. Mobile-Agent-rammen adskiller sig fra eksisterende lÃļsninger, da den ikke afhÃĶnger af mobile systems metadata eller XML-filer, hvilket giver plads til forbedret tilpasning pÃĨ tvÃĶrs af forskellige mobile operativsystemer med fokus pÃĨ visuel-centreret behandling. Tilgangen, der fÃļlges af Mobile-Agent-rammen, eliminerer behovet for system-specifikke tilpasninger, hvilket resulterer i forbedret ydeevne og lavere beregningskrav.
Mobile-Agents: Autonome Multimodale Mobilagent
I den hurtigt udviklende verden af mobilteknologi opstÃĨr et banebrydende koncept: Store Sprogmodeller, isÃĶr Multimodale Store Sprogmodeller eller MLLMâer, der kan generere en bred vifte af tekst, billeder, videoer og tale pÃĨ tvÃĶrs af forskellige sprog. Den hurtige udvikling af MLLM-rammer i de seneste ÃĨr har fÃļrt til en ny og kraftfuld anvendelse af MLLMâer: autonome mobile agenter. Autonome mobile agenter er software-enheder, der handler, bevÃĶger sig og fungerer uafhÃĶngigt, uden at krÃĶve direkte menneskelige kommandoer, og er designet til at trÃĶnge ind i netvÃĶrk eller enheder for at udfÃļre opgaver, indsamle information eller lÃļse problemer.
Mobile-Agenter er designet til at operere brugerens mobilenhed pÃĨ basis af brugerens instruktioner og skÃĶrmbilleder, en opgave, der krÃĶver, at agenten besidder bÃĨde semantisk forstÃĨelse og visuel perceptionsevne. Men eksisterende mobile agenter er langt fra perfekte, da de er baseret pÃĨ multimodale store sprogmodeller, og selv de nuvÃĶrende MLLM-rammer, herunder GPT-4V, mangler visuel perceptionsevne, der er nÃļdvendig for at fungere som en effektiv mobilagent.
For at tackle dette problem har nogle rammer valgt at udnytte brugergrÃĶnsefladens layout-filer til at hjÃĶlpe GPT-4V eller andre MLLMâer med lokaliseringsfunktioner, hvor nogle rammer har formÃĨet at trÃĶkke ud actionable positioner pÃĨ skÃĶrmen ved at fÃĨ adgang til XML-filerne i applikationen, mens andre rammer har valgt at bruge HTML-koden fra webapplikationerne. Som det kan ses, afhÃĶnger de fleste af disse rammer af adgang til underliggende og lokale applikationsfiler, hvilket gÃļr metoden nÃĶsten ineffektiv, hvis rammen ikke kan fÃĨ adgang til disse filer. For at lÃļse dette problem og eliminere afhÃĶngigheden af lokale agenter af underliggende filer pÃĨ lokaliseringsmetoderne, har udviklere arbejdet pÃĨ Mobile-Agent, en autonom mobilagent med imponerende visuel perceptionsevne.
Yderligere har Mobile-Agents-rammen til formÃĨl at udnytte den kontekstuelle kapacitet af avancerede MLLM-rammer som GPT-4V til at opnÃĨ selvplanlÃĶgningsfunktioner, der giver modellen mulighed for at planlÃĶgge opgaver pÃĨ basis af operationshistorik, brugerinstruktioner og skÃĶrmbilleder holistisk. For at yderligere forbedre agentens evne til at identificere ufuldstÃĶndige instruktioner og forkerte operationer, introducerer Mobile-Agents-rammen en selvrefleksionsmetode.
Samlet set kan bidragene fra Mobile-Agents-rammen sammenfattes som fÃļlger:
- Mobile-Agent fungerer som en autonom mobilagent, der udnytter visuel perceptionsvÃĶrktÃļjer til at udfÃļre operationer. Den planlÃĶgger og udfÃļrer hver trin selvstÃĶndigt og reflekterer over sine handlinger. BemÃĶrkelsesvÃĶrdigt er, at Mobile-Agent kun afhÃĶnger af enhedsskÃĶrmbilleder, uden brug af systemkode, og viser en lÃļsning, der er baseret pÃĨ ren visuel teknik.
- Mobile-Agent introducerer Mobile-Eval, en benchmark til at evaluere mobil-agenter. Denne benchmark omfatter en rÃĶkke af de ti mest almindeligt brugte mobilapplikationer, samt intelligente instruktioner for disse applikationer, inddelt i tre niveauer af svÃĶrhedsgrad.
Mobile-Agent: Arkitektur og Metodologi
I sin kerne bestÃĨr Mobile-Agents-rammen af en avanceret Multimodal Large Language Model, GPT-4V, samt en tekstdetektionsmodul til tekstlokaliseringsopgaver. Sammen med GPT-4V bruger Mobile-Agent ogsÃĨ en ikondetektionsmodul til ikonlokaliseringsopgaver.
Visuel Perception
Som nÃĶvnt tidligere giver GPT-4V MLLM tilfredsstillende resultater for instruktioner og skÃĶrmbilleder, men den kan ikke udgive lokaliseringspositionerne effektivt, hvor operationerne finder sted. PÃĨ grund af denne begrÃĶnsning har Mobile-Agents-rammen, der implementerer GPT-4V-modellen, brug for at afhÃĶnge af eksterne vÃĶrktÃļjer til at hjÃĶlpe med operationer, og dermed faciliterer operationer pÃĨ mobilskÃĶrmen.
Textlokaliseringsopgaver
Mobile-Agents-rammen implementerer en OCR-vÃĶrktÃļj til at detektere positionen af den pÃĨgÃĶldende tekst pÃĨ skÃĶrmen, nÃĨr agenten skal trykke pÃĨ en bestemt tekst, der vises pÃĨ mobilskÃĶrmen. Der er tre unikke tekstlokaliserings-scenarier.
Scenario 1: Ingen Specifik Tekst Detekteret
Problem: OCRâen kan ikke detektere den specificerede tekst, hvilket kan opstÃĨ i komplekse billeder eller pÃĨ grund af OCR-begrÃĶnsninger.
Svar: Instruer agenten til enten at:
- VÃĶlge tekst til trykning igen, hvilket giver mulighed for en manuel korrektion af OCRâens oversigt, eller
- VÃĶlge en alternativ operation, sÃĨsom brug af en anden indtastningsmetode eller udfÃļrelse af en anden handling, der er relevant for opgaven.
Begrundelse: Denne fleksibilitet er nÃļdvendig for at hÃĨndtere de lejlighedsvise uÃĶndringer eller hallucinationer af GPT-4V, og sikre, at agenten kan fortsÃĶtte effektivt.
Scenario 2: Enkelt Eksempel af Specifik Tekst Detekteret
Operation: Automatisk generer en handling til at klikke pÃĨ centerkoordinaterne af den detekterede tekstboks.
Begrundelse: Med kun ÃĐt eksempel detekteret er sandsynligheden for korrekt identifikation hÃļj, hvilket gÃļr det effektivt at fortsÃĶtte med en direkte handling.
Scenario 3: Flere Eksempler af Specifik Tekst Detekteret
Vurdering: FÃļrst vurderer antallet af detekterede eksempler:
Mange Eksempler: Indikerer en skÃĶrm fyldt med lignende indhold, hvilket komplicerer valget.
Handling: Anmod agenten om at vÃĶlge tekst igen, med det formÃĨl at finjustere valget eller tilpasse sÃļgeparametrene.
FÃĨ Eksempler: En hÃĨndterbar mÃĶngde af detektioner giver mulighed for en mere nuanceret tilgang.
Handling: BeskÃĶr omrÃĨderne omkring disse eksempler, og udvid tekstdetektionsboksen udad for at fange mere kontekst. Denne udvidelse sikrer, at mere information bevares, og hjÃĶlper med beslutningstagningen.
NÃĶste Trin: Tegn detektionsbokse pÃĨ de beskÃĨrne billeder, og prÃĶsenter dem for agenten. Denne visuelle hjÃĶlp hjÃĶlper agenten med at afgÃļre, hvilket eksempel at interagere med, baseret pÃĨ kontekstuelle hints eller opgavekrav.
Denne strukturerede tilgang optimerer interaktionen mellem OCR-resultater og agentoperationer, og forbedrer systemets pÃĨlidelighed og tilpasningsevne i hÃĨndtering af tekstbaserede opgaver pÃĨ tvÃĶrs af forskellige scenarier. Den hele proces demonstreres i fÃļlgende billede.

Ikondetektion
Mobile-Agents-rammen implementerer en ikondetektionsvÃĶrktÃļj til at lokalisere positionen af en ikon, nÃĨr agenten skal klikke pÃĨ det pÃĨ mobilskÃĶrmen. For at vÃĶre mere specifik anmoder rammen fÃļrst agenten om at give bestemte attributter af billedet, herunder form og farve, og derefter implementerer rammen Grounding DINO-metoden med ikonprompten til at identificere alle ikoner indeholdt i skÃĶrmbilledet. Til sidst bruger Mobile-Agent CLIP-rammen til at beregne ligheden mellem beskrivelsen af klikomrÃĨdet og ligheden mellem de slettede ikoner, og vÃĶlger omrÃĨdet med den hÃļjeste lighed til et klik.

Instruction Execution
For at oversÃĶtte handlinger til operationer pÃĨ skÃĶrmen af agenten definerer Mobile-Agents-rammen 8 forskellige operationer.
- Start Applikation (Applikationsnavn): Initierer den pÃĨgÃĶldende applikation fra desktop-grÃĶnsefladen.
- Klik pÃĨ Tekst (Tekstlabel): Interagerer med skÃĶrmdelen, der viser label âTekstlabelâ.
- Interager med Ikondetektion (Ikondetektionsbeskrivelse, Position): Target og klik pÃĨ det specificerede ikonomrÃĨde, hvor âIkondetektionsbeskrivelseâ detaljerer attributter som farve og form af ikonet. VÃĶlg âPositionâ fra muligheder som top, bottom, venstre, hÃļjre eller center, muligvis kombineret for prÃĶcis navigation og reducere fejl.
- Indtast Tekst (Indtastningstekst): Indtast den givne âIndtastningstekstâ i den aktive tekstfelt.
- Rul Op & Ned: Naviger op eller ned gennem indholdet af den nuvÃĶrende side.
- GÃĨ Tilbage: GÃĨ tilbage til den forrige side.
- Luk: GÃĨ tilbage til desktop direkte fra den nuvÃĶrende skÃĶrm.
- Stop: Afslut operationen, nÃĨr opgaven er fuldfÃļrt.
SelvplanlÃĶgning
Hver trin af operationen udfÃļres iterativt af rammen, og fÃļr starten af hver iteration anmoder brugeren om at give en input-instruktion, og Mobile-Agent-modellen bruger instruktionen til at generere en systemprompt for hele processen. Yderligere anmoder rammen om at fange et skÃĶrmbillede og fÃļde det til agenten fÃļr starten af hver iteration. Agenten observerer derefter skÃĶrmbilledet, operationshistorik og systemprompts for at outputte det nÃĶste trin af operationerne.
Selvrefleksion
Under operationerne kan agenten mÃļde fejl, der forhindrer den i at udfÃļre en kommando succesfuldt. For at forbedre instruktionsopfyldningsraten er en selv-evalueringstilgang implementeret, der aktiveres under to bestemte omstÃĶndigheder. FÃļrst, hvis agenten udfÃļrer en fejl eller ugyldig handling, der standser fremdrift, som nÃĨr den erkender, at skÃĶrmbilledet forbliver uÃĶndret efter operationen eller viser en forkert side, vil den blive anmodet om at overveje alternative handlinger eller tilpasse eksisterende operationsparametre. For det andet kan agenten gÃĨ glip af nogle elementer i en kompleks direktiv. NÃĨr agenten har udfÃļrt en rÃĶkke handlinger baseret pÃĨ sin oprindelige plan, vil den blive anmodet om at gennemgÃĨ sin handlingsserie, det seneste skÃĶrmbillede og brugerens direktiv for at vurdere, om opgaven er fuldfÃļrt. Hvis der findes afvigelser, vil agenten blive bedt om at generere nye handlinger for at opfylde direktivet.
Mobile-Agent: Eksperimenter og Resultater
For at evaluere dets evner omfattende introducerer Mobile-Agents-rammen Mobile-Eval-benchmarken, der bestÃĨr af 10 almindeligt brugte applikationer, og designer tre instruktioner for hver applikation. Den fÃļrste operation er ret fremad, og dÃĶkker kun grundlÃĶggende applikationsoperationer, mens den anden operation er lidt mere kompleks end den fÃļrste, da den har nogle ekstra krav. Endelig er den tredje operation den mest komplekse af alle, da den indeholder abstrakt brugerinstruktion, hvor brugeren ikke udtrykkeligt specificerer, hvilken applikation der skal bruges eller hvilken operation der skal udfÃļres.
For at vurdere ydeevnen fra forskellige perspektiver designer og implementerer Mobile-Agents-rammen fire forskellige metrikker.
- Succes eller Succes: Hvis mobile-agenten fuldfÃļrer instruktionerne, betragtes det som en succes.
- Process Score eller PS: Process Score-metriken mÃĨler nÃļjagtigheden af hver trin under udfÃļrelsen af brugerinstruktionerne, og beregnes ved at dividere antallet af korrekte trin med det totale antal trin.
- Relativ Effektivitet eller RE: Den relative effektivitetsscore er en ratio eller sammenligning mellem antallet af trin, det tager en menneskelig at udfÃļre instruktionen manuelt, og antallet af trin, det tager agenten at udfÃļre den samme instruktion.
- FuldfÃļrelsesrate eller CR: FuldfÃļrelsesratemetriken dividerer antallet af menneske-opererede trin, som rammen fuldfÃļrer succesfuldt, med det totale antal trin, det tager en menneskelig at fuldfÃļre instruktionen. VÃĶrdien af CR er 1, nÃĨr agenten fuldfÃļrer instruktionen succesfuldt.
Resultaterne demonstreres i fÃļlgende figur.

Initielt for de tre givne opgaver opnÃĨede Mobile-Agent fuldfÃļrelsesrater pÃĨ 91%, 82% og 82%, henholdsvis. Selv om ikke alle opgaver blev udfÃļrt fejlfrit, overgik opfyldningsraterne for hver opgavekategori 90%. Yderligere viser PS-metriken, at Mobile-Agent konsekvent demonstrerer en hÃļj sandsynlighed for at udfÃļre korrekte handlinger for de tre opgaver, med succesrater omkring 80%. Desuden viser RE-metriken, at Mobile-Agent udviser en effektivitet pÃĨ 80% i udfÃļrelse af operationer pÃĨ et niveau, der er sammenligneligt med menneskelig optimalitet. Disse resultater understreger samlet Mobile-Agents dygtighed som en mobil enhedsassistent.
Den fÃļlgende figur illustrerer Mobile-Agents evne til at forstÃĨ brugerinstruktioner og selvstÃĶndigt orkestrere sine handlinger. Selv i mangelen pÃĨ eksplicit operationsdetaljer i instruktionerne tolkede Mobile-Agent brugerens behov korrekt og omdannede dem til handlinger via en systematisk planlÃĶgningsproces.

Endelige Tanker
I denne artikel har vi talt om Mobile-Agents, en multimodal autonom enhedsagent, der fÃļrst udnytter visuel perceptionsteknologi til at prÃĶcist detektere og lokalisere bÃĨde visuelle og tekstlige komponenter i en mobilapplikations grÃĶnseflade. Med denne visuelle kontekst i mente planlÃĶgger og opdeler Mobile-Agents-rammen komplekse operationer selvstÃĶndigt og navigerer gennem mobilapplikationer trin for trin. Denne ramme adskiller sig fra eksisterende lÃļsninger, da den ikke afhÃĶnger af mobile systems metadata eller mobilapplikationernes XML-filer, hvilket giver plads til forbedret tilpasning pÃĨ tvÃĶrs af forskellige mobile operativsystemer med fokus pÃĨ visuel-centreret behandling. Tilgangen, der fÃļlges af Mobile-Agents-rammen, eliminerer behovet for system-specifikke tilpasninger, hvilket resulterer i forbedret ydeevne og lavere beregningskrav. Mobile-Agents-rammen obviaterer behovet for system-specifikke tilpasninger, hvilket fÃļrer til forbedret effektivitet og reducerede beregningskrav. Denne strategi giver mulighed for en stÃļrre fleksibilitet pÃĨ tvÃĶrs af forskellige mobile operativsystemer med fokus pÃĨ visuel-centreret behandling, og giver mobile-applikationernes XML-filer stÃļrre fleksibilitet pÃĨ tvÃĶrs af forskellige mobile operativsystemer med fokus pÃĨ visuel-centreret behandling.












