AI-modellen en platforms
Mobiele-Agenten: Autonome Multimodale Mobiele Apparaatagent met Visuele Perceptie

De komst van Multimodale Large Language Models (MLLM) heeft een nieuwe era van mobiele apparaatagenten ingeluid, die in staat zijn om de wereld te begrijpen en te communiceren via tekst, afbeeldingen en spraak. Deze agenten markeren een significante vooruitgang ten opzichte van traditionele AI, waardoor ze een rijker en intuïtiever kunnen communiceren met hun apparaten. Door MLLM te gebruiken, kunnen deze agenten grote hoeveelheden informatie uit verschillende modaliteiten verwerken en synthetiseren, waardoor ze persoonlijke assistentie kunnen bieden en gebruikerservaringen kunnen verbeteren op manieren die eerder ondenkbaar waren.
Deze agenten worden aangedreven door state-of-the-art machine learning-technieken en geavanceerde natuurlijke taalverwerking, waardoor ze mensachtige tekst kunnen begrijpen en genereren, evenals visuele en auditieve gegevens met opmerkelijke nauwkeurigheid kunnen interpreteren. Van het herkennen van objecten en scènes in afbeeldingen tot het begrijpen van gesproken commando’s en het analyseren van tekstsentiment, zijn deze multimodale agenten uitgerust om een breed scala aan invoer naadloos te verwerken. Het potentieel van deze technologie is enorm, met meer geavanceerde en contextueel bewuste diensten, zoals virtuele assistenten die zijn afgestemd op menselijke emoties en educatieve hulpmiddelen die zich aanpassen aan individuele leervormen. Ze hebben ook het potentieel om toegankelijkheid te revolutioneren, waardoor technologie meer toegankelijk wordt voor mensen met taal- en sensorische beperkingen.
In dit artikel zullen we het hebben over Mobiele-Agenten, een autonome multimodale apparaatagent die allereerst de mogelijkheid van visuele perceptietools gebruikt om visuele en tekstuele elementen in de interface van een mobiele applicatie nauwkeurig te identificeren en te lokaliseren. Met deze waargenomen visuele context plannen en decomposeren de Mobiele-Agent-kaders de complexe operatie taken autonoom en navigeren ze stap voor stap door de mobiele apps. De Mobiele-Agent-kaders verschillen van bestaande oplossingen omdat ze niet afhankelijk zijn van mobiele systeemmetadata of XML-bestanden van mobiele applicaties, waardoor er ruimte is voor verbeterde aanpasbaarheid in diverse mobiele omgevingen op een visueel centrische manier. De aanpak die wordt gevolgd door de Mobiele-Agent-kaders elimineert de behoefte aan systeemspecifieke aanpassingen, waardoor de prestaties worden verbeterd en de berekeningsvereisten worden verlaagd.
Mobiele-Agenten: Autonome Multimodale Mobiele Apparaatagent
In de snel veranderende wereld van mobiele technologie komt een baanbrekend concept naar voren: Large Language Models, met name Multimodale Large Language Models of MLLM’s die in staat zijn om een breed scala aan tekst, afbeeldingen, video’s en spraak in verschillende talen te genereren. De snelle ontwikkeling van MLLM-kaders in de afgelopen jaren heeft geleid tot een nieuwe en krachtige toepassing van MLLM’s: autonome mobiele agenten. Autonome mobiele agenten zijn software-entiteiten die onafhankelijk handelen, bewegen en functioneren zonder directe menselijke opdrachten, ontworpen om netwerken of apparaten te doorzoeken om taken uit te voeren, informatie te verzamelen of problemen op te lossen.
Mobiele Agenten zijn ontworpen om de gebruiker zijn mobiele apparaat te bedienen op basis van de instructies van de gebruiker en de schermvisualisaties, een taak die vereist dat de agenten zowel semantische begrip als visuele perceptiebevoegdheden bezitten. Echter, bestaande mobiele agenten zijn verre van perfect, aangezien ze zijn gebaseerd op multimodale large language models, en zelfs de huidige staat van de kunst MLLM-kaders, waaronder GPT-4V, ontbreken visuele perceptiebevoegdheden die nodig zijn om te functioneren als een efficiënte mobiele agent. Bovendien, hoewel bestaande kaders effectieve operaties kunnen genereren, hebben ze moeite om de positie van deze operaties nauwkeurig op het scherm te lokaliseren, waardoor de toepassingen en mogelijkheden van mobiele agenten om te functioneren op mobiele apparaten worden beperkt.
Om dit probleem aan te pakken, hebben sommige kaders gekozen voor het gebruik van gebruikersinterface lay-outbestanden om de GPT-4V of andere MLLM’s te helpen bij de lokaliseringsmogelijkheden, waarbij sommige kaders erin slaagden om actieposities op het scherm te extraheren door toegang te krijgen tot de XML-bestanden van de applicatie, terwijl andere kaders kozen voor het gebruik van de HTML-code van webapplicaties. Zoals te zien is, zijn de meeste van deze kaders afhankelijk van toegang tot onderliggende en lokale applicatiebestanden, waardoor de methode bijna ineffectief is als de kader geen toegang heeft tot deze bestanden. Om dit probleem aan te pakken en de afhankelijkheid van lokale agenten van onderliggende bestanden op de lokaliseringsmethoden te elimineren, hebben ontwikkelaars gewerkt aan Mobiele-Agent, een autonome mobiele agent met indrukwekkende visuele perceptiebevoegdheden. Met zijn visuele perceptiemodule gebruikt de Mobiele-Agent-kader screenshots van het mobiele apparaat om operaties nauwkeurig te lokaliseren.
Bovendien heeft de Mobiele-Agent-kader als doel om de contextuele mogelijkheden van state-of-the-art MLLM-kaders zoals GPT-4V te benutten om zelfplanningsmogelijkheden te bereiken die de model toelaten om taken te plannen op basis van de operatiegeschiedenis, gebruikersinstructies en screenshots holistisch. Om de mogelijkheden van de agent verder te vergroten om onvolledige instructies en incorrecte operaties te identificeren, introduceert de Mobiele-Agent-kader een zelfreflectiemethode. Onder de leiding van zorgvuldig geformuleerde prompts, reflecteert de agent op onjuiste en ongeldige operaties consistent, en stopt de operaties zodra de taak of instructie is voltooid.
Over het algemeen kunnen de bijdragen van de Mobiele-Agent-kader als volgt worden samengevat:
- Mobiele-Agent fungeert als een autonome mobiele apparaatagent, die visuele perceptietools gebruikt om operatie lokaliseren uit te voeren. Het plannen van elke stap en de introspectie worden methodisch uitgevoerd. Opmerkelijk is dat Mobiele-Agent uitsluitend afhankelijk is van apparaatschermopnames, zonder het gebruik van enige systeemcode, waardoor een oplossing wordt geboden die puur is gebaseerd op visuele technieken.
- Mobiele-Agent introduceert Mobiele-Eval, een benchmark ontworpen om mobiele apparaatagenten te evalueren. Deze benchmark omvat een reeks van de tien meest gebruikte mobiele apps, samen met intelligente instructies voor deze apps, ingedeeld in drie niveaus van moeilijkheid.

Mobiele-Agent : Architectuur en Methodologie
De Mobiele-Agent-kader bestaat in zijn kern uit een state-of-the-art Multimodaal Large Language Model, de GPT-4V, een tekstdetectiemodule voor tekstlokaliseringsTaken. Naast GPT-4V maakt Mobiele-Agent ook gebruik van een icoondetectiemodule voor icoonlokaliseren.
Visuele Perceptie
Zoals eerder vermeld, levert de GPT-4V MLLM bevredigende resultaten voor instructies en screenshots, maar faalt het om de locatie effectief te produceren waar de operaties plaatsvinden. Als gevolg van deze beperking moet de Mobiele-Agent-kader die de GPT-4V-model gebruikt, afhankelijk zijn van externe tools om te helpen bij de operatie lokaliseren, waardoor de operaties output op het mobiele scherm wordt gefaciliteerd.
Tekst Lokalisatie
De Mobiele-Agent-kader implementeert een OCR-tool om de positie van de overeenkomstige tekst op het scherm te detecteren wanneer de agent moet tikken op een specifieke tekst die op het mobiele scherm wordt weergegeven. Er zijn drie unieke tekstlokaliseringscenario’s.
Scenario 1: Geen Gespecificeerde Tekst Gedetecteerd
Probleem: De OCR faalt om de gespecificeerde tekst te detecteren, wat kan gebeuren in complexe afbeeldingen of als gevolg van OCR-beperkingen.
Reactie: Instructeer de agent om ofwel:
- De tekst opnieuw te selecteren voor tikken, waardoor een handmatige correctie van de OCR-naleving mogelijk is, of
- Een alternatieve operatie te kiezen, zoals het gebruik van een andere invoermethode of het uitvoeren van een andere actie die relevant is voor de taak.
Redenering: Deze flexibiliteit is noodzakelijk om de occasionele onnauwkeurigheden of hallucinaties van GPT-4V te beheren, waardoor de agent nog steeds effectief kan doorgaan.
Scenario 2: Enkel Exemplaar van Gespecificeerde Tekst Gedetecteerd
Operatie: Automatisch een actie genereren om op de centrale coördinaten van de gedetecteerde tekstbox te klikken.
Rechtvaardiging: Met slechts één exemplaar gedetecteerd, is de waarschijnlijkheid van correcte identificatie hoog, waardoor het efficiënt is om door te gaan met een directe actie.
Scenario 3: Meerdere Exemplaren van Gespecificeerde Tekst Gedetecteerd
Beoordeling: Eerst de hoeveelheid gedetecteerde exemplaren evalueren:
Veel Exemplaren: Duidt op een scherm dat is volgepakt met soortgelijk inhoud, waardoor de selectie wordt bemoeilijkt.
Actie: De agent vragen om de tekst opnieuw te selecteren, om de selectie te verfijnen of de zoekparameters aan te passen.
Weinig Exemplaren: Een beheersbaar aantal detecties maakt het mogelijk om een meer nuances aanpak te hanteren.
Actie: De regio’s rondom deze exemplaren bijsnijden, de tekstdetectieboxen uitbreiden naar buiten toe om meer context te behouden. Deze uitbreiding zorgt ervoor dat meer informatie wordt behouden, waardoor de besluitvorming wordt ondersteund.
Volgende Stap: De detectieboxen op de bijsneden afbeeldingen tekenen en deze presenteren aan de agent. Deze visuele assistentie helpt de agent bij het bepalen van welk exemplaar te interacteren, op basis van contextuele aanwijzingen of taakvereisten.
Deze gestructureerde aanpak optimaliseert de interactie tussen OCR-resultaten en agentoperaties, waardoor de betrouwbaarheid en aanpasbaarheid van het systeem in het omgaan met tekstgebaseerde taken in verschillende scenario’s wordt verbeterd. Het gehele proces wordt gedemonstreerd in de volgende afbeelding.

Icoon Lokalisatie
De Mobiele-Agent-kader implementeert een icoondetectietool om de positie van een icoon te lokaliseren wanneer de agent moet klikken op het icoon op het mobiele scherm. Om specifieker te zijn, vraagt de kader de agent om specifieke attributen van de afbeelding, inclusief vorm en kleur, en implementeert vervolgens de Grounding DINO-methode met de prompt icoon om alle icoontjes te identificeren die zijn opgenomen in de screenshot. Ten slotte gebruikt Mobiele-Agent de CLIP-kader om de overeenkomst tussen de beschrijving van de klikregio en de verwijderde icoontjes te berekenen en selecteert de regio met de hoogste overeenkomst voor een klik.

Instructie Uitvoering
Om de acties om te zetten in operaties op het scherm door de agenten, definieert de Mobiele-Agent-kader 8 verschillende operaties.
- Applicatie Lancering (App Naam): De aangewezen applicatie initiëren vanaf het bureaublad.
- Tik op Tekst (Tekst Label): Interactie met het schermgedeelte dat de label “Tekst Label” weergegeven.
- Interactie met Icoon (Icoon Beschrijving, Locatie): Het gespecificeerde icoongebied targeten en tikken, waar “Icoon Beschrijving” attributen zoals kleur en vorm van het icoon details. Kies “Locatie” uit opties zoals boven, onder, links, rechts of centrum, mogelijk in combinatie met twee voor nauwkeurige navigatie en om fouten te verminderen.
- Tekst Invoeren (Invoer Tekst): De gegeven “Invoer Tekst” invoeren in het actieve tekstveld.
- Scrollen Omhoog & Omlaag: Navigeren door de inhoud van de huidige pagina omhoog of omlaag.
- Terug Gaan: Terugkeren naar de vorige pagina.
- Sluiten: Direct naar het bureaublad navigeren vanaf het huidige scherm.
- Stoppen: De operatie beëindigen zodra de taak is voltooid.
Zelfplanning
Elke stap van de operatie wordt iteratief uitgevoerd door de kader, en voordat elke iteratie begint, moet de gebruiker een invoerinstructie verstrekken, en de Mobiele-Agent-model gebruikt de instructie om een systeemprompt voor het gehele proces te genereren. Bovendien, voordat elke iteratie begint, captureert de kader een screenshot en voedt deze aan de agent. De agent observeert vervolgens de screenshot, operatiegeschiedenis en systeemprompts om de volgende stap van de operaties uit te voeren.
Zelfreflectie
Tijdens zijn operaties kan de agent fouten tegenkomen die het beletten om een opdracht succesvol uit te voeren. Om de instructie-uitvoeringsgraad te verbeteren, is een zelfevaluatie-aanpak geïmplementeerd, die wordt geactiveerd onder twee specifieke omstandigheden. Eerst, als de agent een defecte of ongeldige actie uitvoert die de voortgang stopt, zoals wanneer het herkent dat de screenshot ongewijzigd blijft na de operatie of een onjuiste pagina weergeeft, zal het worden gericht om alternatieve acties te overwegen of de parameters van de bestaande operatie aan te passen. Ten tweede kan de agent sommige elementen van een complexe richtlijn missen. Zodra de agent een reeks acties heeft uitgevoerd op basis van zijn initiële plan, zal het worden geprompt om zijn actiesequens, de laatste screenshot en de richtlijn van de gebruiker te herzien om te beoordelen of de taak is voltooid. Als afwijkingen worden gevonden, wordt de agent opgedragen om autonoom nieuwe acties te genereren om de richtlijn uit te voeren.
Mobiele-Agent : Experimenten en Resultaten
Om zijn capaciteiten grondig te evalueren, introduceert de Mobiele-Agent-kader de Mobiele-Eval-benchmark, bestaande uit 10 veelgebruikte applicaties, en ontwerpt drie instructies voor elke applicatie. De eerste operatie is eenvoudig en dekt alleen basisapplicatieoperaties, terwijl de tweede operatie enigszins complexer is dan de eerste, omdat het enkele extra vereisten heeft. Ten slotte is de derde operatie de meest complexe van allemaal, omdat het abstracte gebruikersinstructies bevat waarin de gebruiker niet expliciet specificeert welke app te gebruiken of welke operatie uit te voeren.
Verder, om de prestaties vanuit verschillende perspectieven te beoordelen, ontwerpt en implementeert de Mobiele-Agent-kader 4 verschillende metrics.
- Su of Succes: Als de mobiele-agent de instructies voltooit, wordt het beschouwd als een succes.
- Proces Score of PS: De Proces Score-metric meet de nauwkeurigheid van elke stap tijdens de uitvoering van de gebruikersinstructies en wordt berekend door het aantal correcte stappen te delen door het totale aantal stappen.
- Relatieve Efficiëntie of RE: De relatieve efficiëntiescore is een verhouding tussen het aantal stappen dat een mens nodig heeft om de instructie handmatig uit te voeren en het aantal stappen dat de agent nodig heeft om dezelfde instructie uit te voeren.
- Voltooiingsgraad of CR: De voltooiingsgraad-metric deelt het aantal door de mens bediende stappen dat de kader met succes voltooit door het totale aantal stappen dat een mens neemt om de instructie te voltooien. De waarde van CR is 1 wanneer de agent de instructie met succes voltooit.
De resultaten worden gedemonstreerd in de volgende figuur.

Aanvankelijk, voor de drie gegeven taken, bereikte de Mobiele-Agent voltooiingspercentages van 91%, 82% en 82%, respectievelijk. Hoewel niet alle taken feilloos werden uitgevoerd, overtroffen de prestaties voor elke taakcategorie 90%. Bovendien toont de PS-metric aan dat de Mobiele-Agent consistent een hoge waarschijnlijkheid van correcte acties voor de drie taken aantoont, met succespercentages rond de 80%. Daarnaast toont de RE-metric aan dat de Mobiele-Agent een efficiëntie van 80% vertoont bij het uitvoeren van operaties op een niveau dat vergelijkbaar is met menselijke optimaliteit. Deze resultaten onderstrepen collectief de vaardigheid van de Mobiele-Agent als een mobiele apparaatassistent.
De volgende figuur illustreert de capaciteit van de Mobiele-Agent om gebruikersinstructies te begrijpen en onafhankelijk zijn acties te coördineren. Zelfs in de afwezigheid van expliciete operatie-details in de instructies, interpreteerde de Mobiele-Agent vaardig de behoeften van de gebruiker en zette deze om in actie door een systematisch planningsproces.

Slotgedachten
In dit artikel hebben we het gehad over Mobiele-Agenten, een multimodale autonome apparaatagent die allereerst de mogelijkheid van visuele perceptietools gebruikt om visuele en tekstuele elementen in de interface van een mobiele applicatie nauwkeurig te identificeren en te lokaliseren. Met deze waargenomen visuele context plannen en decomposeren de Mobiele-Agent-kaders de complexe operatie taken autonoom en navigeren ze stap voor stap door de mobiele apps. Deze kaders verschillen van bestaande oplossingen omdat ze niet afhankelijk zijn van mobiele systeemmetadata of XML-bestanden van mobiele applicaties, waardoor er ruimte is voor verbeterde aanpasbaarheid in diverse mobiele omgevingen op een visueel centrische manier. De aanpak die wordt gevolgd door de Mobiele-Agent-kaders elimineert de behoefte aan systeemspecifieke aanpassingen, waardoor de prestaties worden verbeterd en de berekeningsvereisten worden verlaagd. De Mobiele-Agent-kaders bieden een oplossing die puur is gebaseerd op visuele technieken, waardoor een grotere flexibiliteit wordt geboden bij het gebruik van mobiele apparaten, en het potentieel heeft om toegankelijkheid te verbeteren door technologie meer toegankelijk te maken voor mensen met taal- en sensorische beperkingen.












