AI-modeller och plattformar
Mobilagenter: Autonoma Multimodala Mobilagenter Med Visuell Perception

Genombrottet med Multimodala Stora Språkmodeller (MLLM) har inletts en ny era för mobilagenter, som kan förstå och interagera med världen genom text, bilder och röst. Dessa agenter markerar en betydande framsteg jämfört med traditionell AI, och erbjuder ett rikare och mer intuitivt sätt för användare att interagera med sina enheter. Genom att utnyttja MLLM kan dessa agenter bearbeta och syntetisera stora mängder information från olika modaliteter, vilket möjliggör personlig assistans och förbättrade användarupplevelser på sätt som tidigare var otänkbart.
Dessa agenter drivs av state-of-the-art maskinlärningstekniker och avancerade naturliga språkbehandlingsförmågor, vilket möjliggör förståelse och generering av mänsklig text, samt tolkning av visuell och auditiv data med anmärkningsvärd noggrannhet. Från att känna igen objekt och scener i bilder till att förstå talade kommandon och analysera textsentiment, är dessa multimodala agenter utrustade för att hantera en mängd olika indata utan ansträngning. Potentialen för denna teknik är enorm, med mer sofistikerade och kontextuellt medvetna tjänster, såsom virtuella assistenter som är anpassade till mänskliga känslor och utbildningsverktyg som anpassar sig till individuella inlärningsstilar. De har också potentialen att revolutionera tillgänglighet, vilket gör tekniken mer tillgänglig över språk- och sensoriska barriärer.
I denna artikel kommer vi att diskutera Mobilagenter, en autonom multimodal enhetsagent som först utnyttjar visuell perception för att identifiera och lokalisera visuella och textbaserade element i en mobilapplikations gränssnitt med stor noggrannhet. Med denna uppfattade visuella kontext planerar och bryter ner den komplexa operationen autonomt, och navigerar genom mobilappar genom stegvisa operationer. Mobilagenter-ramverket skiljer sig från befintliga lösningar eftersom det inte förlitar sig på mobilsystemets metadata eller XML-filer för mobilapplikationer, vilket möjliggör ökad anpassningsförmåga över olika mobila operativsystem på ett visuellt centrerat sätt. Tillvägagångssättet som används av Mobilagenter-ramverket eliminerar behovet av systemspecifika anpassningar, vilket leder till förbättrad prestanda och lägre beräkningskrav.
Mobilagenter: Autonoma Multimodala Mobilagenter
I den snabbt föränderliga världen av mobilteknik framträder ett banbrytande koncept: Stora Språkmodeller, särskilt Multimodala Stora Språkmodeller eller MLLM, som kan generera en mängd olika texter, bilder, videor och tal över olika språk. Den snabba utvecklingen av MLLM-ramverk under de senaste åren har gett upphov till en ny och kraftfull tillämpning av MLLM: autonoma mobilagenter. Autonoma mobilagenter är programvaruenheter som agerar, rör sig och fungerar oberoende, utan att behöva direkt mänskliga kommandon, utformade för att traversera nätverk eller enheter för att utföra uppgifter, samla information eller lösa problem.
Mobilagenter är utformade för att operera användarens mobil enhet baserat på användarens instruktioner och skärmvisuella data, en uppgift som kräver att agenterna besitter både semantisk förståelse och visuell perception. Men befintliga mobilagenter är långt ifrån perfekta, eftersom de bygger på multimodala stora språkmodeller, och även den nuvarande tillståndet för MLLM-ramverk, inklusive GPT-4V, saknar visuell perception för att fungera som en effektiv mobilagent. Dessutom, även om befintliga ramverk kan generera effektiva operationer, har de svårt att lokalisera operationernas position på skärmen, vilket begränsar mobilagenternas förmåga att operera på mobila enheter.
För att tackla detta problem har vissa ramverk valt att utnyttja användargränssnitts layoutfiler för att assistera GPT-4V eller andra MLLM med lokalisationsförmågor, med vissa ramverk som lyckats extrahera åtgärdbara positioner på skärmen genom att komma åt XML-filerna för applikationen, medan andra ramverk valt att använda HTML-koden från webbapplikationer. Som det kan ses, förlitar sig de flesta av dessa ramverk på att komma åt underliggande och lokala applikationsfiler, vilket gör metoden nästan ineffektiv om ramverket inte kan komma åt dessa filer. För att lösa detta problem och eliminera beroendet av lokala agenter av underliggande filer för lokalisering, har utvecklare arbetat med Mobilagenter, en autonom mobilagent med imponerande visuell perception. Med hjälp av sitt visuella perceptionsmodul använder Mobilagenter-ramverket skärmdumpar från den mobila enheten för att lokalisera operationer med stor noggrannhet.
Dessutom syftar Mobilagenter-ramverket till att utnyttja den kontextuella förmågan hos state-of-the-art MLLM-ramverk som GPT-4V för att uppnå självplaneringsförmåga, som tillåter modellen att planera uppgifter baserat på operationshistorik, användarinstruktioner och skärmdumpar i sin helhet. För att ytterligare förbättra agentens förmåga att identifiera ofullständiga instruktioner och felaktiga operationer, introducerar Mobilagenter-ramverket en självreflektionsmetod. Under ledning av noggrant utformade promptrar, reflekterar agenten över felaktiga och ogiltiga operationer konsekvent, och avbryter operationerna när uppgiften eller instruktionen har slutförts.
Sammantaget kan bidragen från Mobilagenter-ramverket sammanfattas på följande sätt:
- Mobilagenter fungerar som en autonom mobil enhetsagent, som använder visuell perception för att lokalisera operationer. Det planerar metodiskt varje steg och engagerar i introspektion. Noterbart är att Mobilagenter enbart förlitar sig på enhetsskärmdumpar, utan att använda någon systemkod, och visar en lösning som är baserad på visuella tekniker.
- Mobilagenter introducerar Mobile-Eval, en benchmark utformad för att utvärdera mobil enhetsagenter. Denna benchmark innehåller en mängd olika vanligt använda mobilapplikationer, tillsammans med intelligenta instruktioner för dessa applikationer, kategoriserade i tre nivåer av svårighetsgrad.

Mobilagenter: Arkitektur och Metodik
I sin kärna består Mobilagenter-ramverket av en state-of-the-art Multimodal Stor Språkmodell, GPT-4V, och en textdetektionsmodul som används för textlokalisering. Utöver GPT-4V använder Mobilagenter också en ikondetektionsmodul för ikonlokalisering.
Visuell Perception
Som tidigare nämnts ger GPT-4V MLLM tillfredsställande resultat för instruktioner och skärmdumpar, men det misslyckas med att utge lokaliseringsplatsen effektivt där operationerna äger rum. På grund av denna begränsning behöver Mobilagenter-ramverket, som implementerar GPT-4V-modellen, förlita sig på externa verktyg för att assistera med operationlokalisering, vilket möjliggör operationer på mobilskärmen.
Textlokalisering
Mobilagenter-ramverket implementerar ett OCR-verktyg för att upptäcka textens position på skärmen när agenten behöver trycka på en specifik text som visas på mobilskärmen. Det finns tre unika textlokaliseringsscenarier.
Scenario 1: Inga Angivna Texter Upptäckta
Problem: OCR misslyckas med att upptäcka den angivna texten, vilket kan inträffa i komplexa bilder eller på grund av OCR-begränsningar.
Svar: Instruerar agenten att antingen:
- Välja texten för tryckning igen, vilket möjliggör manuell korrigering av OCR-översikten, eller
- Välja en alternativ operation, såsom att använda en annan inmatningsmetod eller utföra en annan åtgärd som är relevant för uppgiften.
Resonemang: Denna flexibilitet är nödvändig för att hantera de tillfälliga ofullständigheterna eller hallucinationerna hos GPT-4V, vilket säkerställer att agenten fortfarande kan fortsätta effektivt.
Scenario 2: Enstaka Instans av Angiven Text Upptäckt
Operation: Automatiskt generera en åtgärd för att klicka på den upptäckta textboxens mittkoordinater.
Motivering: Med endast en instans upptäckt är sannolikheten för korrekt identifiering hög, vilket gör det effektivt att fortsätta med en direkt åtgärd.
Scenario 3: Flera Instanser av Angiven Text Upptäckta
Bedömning: Först utvärdera antalet upptäckta instanser:
Många Instanser: Indikerar en skärm som är belamrad med liknande innehåll, vilket komplicerar urvalet.
Åtgärd: Begär att agenten väljer texten igen, i syfte att förbättra urvalet eller justera sökparametrarna.
Få Instanser: Ett hanterbart antal upptäckter möjliggör en mer nyanserad strategi.
Åtgärd: Beskär regionerna runt dessa instanser, utvidga textdetektionsboxarna utåt för att fånga ytterligare kontext. Denna utvidgning säkerställer att mer information bevaras, vilket underlättar beslutsfattandet.
Nästa Steg: Rita detektionsboxar på de beskurna bilderna och presentera dem för agenten. Denna visuella assistans hjälper agenten att avgöra vilken instans som ska interagera med, baserat på kontextuella ledtrådar eller uppgiftskrav.
Denna strukturerade strategi optimerar interaktionen mellan OCR-resultat och agentoperationer, vilket förbättrar systemets tillförlitlighet och anpassningsförmåga i hanteringen av textbaserade uppgifter i olika scenarier. Hela processen visas i följande bild.

Ikondetektion
Mobilagenter-ramverket implementerar en ikondetektionsmodul för att lokalisera ikonens position när agenten behöver klicka på den på mobilskärmen. Mer specifikt begär ramverket att agenten ska ange specifika attribut för bilden, inklusive form och färg, och sedan implementerar ramverket Grounding DINO-metoden med ikonprompten för att identifiera alla ikoner inom skärmdumpen. Slutligen använder Mobilagenter CLIP-ramverket för att beräkna likheten mellan beskrivningen av klickområdet och likheten mellan de raderade ikonerna, och väljer området med den högsta likheten för ett klick.

Instruktionsutförande
För att översätta åtgärder till operationer på skärmen av agenterna, definierar Mobilagenter-ramverket 8 olika operationer.
- Starta Applikation (Applikationsnamn): Initiera den angivna applikationen från skrivbordets gränssnitt.
- Klicka på Text (Textetikett): Interagera med skärmdelen som visar etiketten “Textetikett”.
- Interagera med Ikon (Ikonbeskrivning, Placering): Målinrikta och klicka på det angivna ikonområdet, där “Ikonbeskrivning” detaljerar attribut som färg och form på ikonen. Välj “Placering” från alternativ som topp, botten, vänster, höger eller mitt, eventuellt i kombination för exakt navigering och för att minska misstag.
- Ange Text (Inmatad Text): Mata in den angivna “Inmatad Text” i det aktiva textfältet.
- Rulla Upp & Ner: Navigera uppåt eller nedåt genom innehållet på den nuvarande sidan.
- Gå Tillbaka: Återgå till den tidigare visade sidan.
- Stäng: Navigera tillbaka till skrivbordet direkt från den nuvarande skärmen.
- Avbryt: Avsluta operationen när uppgiften är slutförd.
Självplanering
Varje steg i operationen utförs iterativt av ramverket, och innan varje iteration börjar, krävs det att användaren tillhandahåller en inmatad instruktion, och Mobilagenter-modellen använder instruktionen för att generera en systemprompt för hela processen. Dessutom, innan varje iterations början, fångar ramverket en skärmdump och matar in den till agenten. Agenten observerar sedan skärmdumpen, operationshistorik och systemprompt för att producera nästa steg i operationerna.
Självreflektion
Under sina operationer kan agenten stöta på fel som förhindrar den från att framgångsrikt utföra ett kommando. För att förbättra instruktionsutfyllnadsgraden har en självutvärderingsmetod implementerats, som aktiveras under två specifika omständigheter. Inledningsvis, om agenten utför en felaktig eller ogiltig åtgärd som stoppar framstegen, såsom när den känner igen att skärmdumpen förblir oförändrad efter operationen eller visar en felaktig sida, kommer den att dirigeras att överväga alternativa åtgärder eller justera den befintliga operationens parametrar. Dessutom kan agenten missa vissa element i en komplex direktiv. När agenten har utfört en serie åtgärder baserat på sin initiala plan, kommer den att uppmanas att granska sin åtgärdsserie, den senaste skärmdumpen och användarens direktiv för att bedöma om uppgiften är slutförd. Om avvikelser påträffas, åläggs agenten att autonomt generera nya åtgärder för att uppfylla direktivet.
Mobilagenter: Experiment och Resultat
För att utvärdera dess förmågor omfattande, introducerar Mobilagenter-ramverket Mobile-Eval, en benchmark som består av 10 vanligt använda applikationer, och utformar tre instruktioner för varje applikation. Den första operationen är enkel och täcker endast grundläggande applikationsoperationer, medan den andra operationen är något mer komplex än den första, eftersom den har några extra krav. Slutligen är den tredje operationen den mest komplexa av alla, eftersom den innehåller abstrakta användarinstruktioner, där användaren inte explicit anger vilken applikation som ska användas eller vilken operation som ska utföras.
För att bedöma prestandan från olika perspektiv, utformar och implementerar Mobilagenter-ramverket 4 olika metriker.
- Su eller Framgång: Om mobilagenten slutför instruktionerna, anses det vara en framgång.
- Processpoäng eller PS: Processpoängmätningen mäter noggrannheten för varje steg under utförandet av användarinstruktionerna och beräknas genom att dividera antalet korrekta steg med det totala antalet steg.
- Relativ Effektivitet eller RE: Den relativa effektivitetspoängen är en kvot eller jämförelse mellan antalet steg det tar för en människa att utföra instruktionen manuellt och antalet steg det tar för agenten att utföra samma instruktion.
- Slutförandegrad eller CR: Slutförandegradmätningen dividerar antalet mänskligt opererade steg som ramverket slutför framgångsrikt med det totala antalet steg som en människa tar för att slutföra instruktionen. Värdet på CR är 1 när agenten slutför instruktionen framgångsrikt.
Resultaten visas i följande figur.

Inledningsvis, för de tre givna uppgifterna, uppnådde Mobilagenter slutförandegrad på 91%, 82% och 82%, respektive. Medan inte alla uppgifter utfördes felfritt, översteg slutförandegraderna för varje uppgiftskategori 90%. Dessutom avslöjar PS-mätningen att Mobilagenter konsekvent visar en hög sannolikhet för att utföra korrekta åtgärder för de tre uppgifterna, med framgångsgrader runt 80%. Dessutom, enligt RE-mätningen, visar Mobilagenter en effektivitet på 80% i att utföra operationer på en nivå jämförbar med mänsklig optimalitet. Dessa resultat understryker kollektivt Mobilagentens kompetens som en mobil enhetsassistent.
Följande figur illustrerar Mobilagentens förmåga att förstå användarinstruktioner och autonomt orkestrera sina åtgärder. Även i frånvaro av explicita operationsdetaljer i instruktionerna, tolkade Mobilagenter användarens behov skickligt och omvandlade dem till åtgärder via en systematisk planeringsprocess.

Slutliga Tankar
I denna artikel har vi diskuterat Mobilagenter, en autonom multimodal enhetsagent som först utnyttjar visuell perceptionsteknik för att identifiera och lokalisera visuella och textbaserade element i en mobilapplikations gränssnitt med stor noggrannhet. Med denna uppfattade visuella kontext planerar och bryter ner den komplexa operationen autonomt, och navigerar genom mobilapplikationer stegvis. Detta ramverk skiljer sig från befintliga metoder eftersom det inte förlitar sig på mobilsystemets metadata eller mobilapplikationernas XML-filer, vilket möjliggör ökad anpassningsförmåga över olika mobila operativsystem med fokus på visuellt centrerad bearbetning. Strategin som används av Mobilagenter-ramverket eliminerar behovet av systemspecifika anpassningar, vilket leder till förbättrad prestanda och lägre beräkningskrav. Mobilagenter-ramverket möjliggör större flexibilitet genom att utnyttja mobilapparnas XML-filer, vilket underlättar en högre grad av anpassningsförmåga över olika mobila operativsystem med fokus på visuellt centrerad bearbetning.












