AI-modeller og plattformer
Mobile-Agenter: Autonome Multi-Modale Mobile Enhetsagent Med Visuell Persepsjon

Introduksjonen av Multimodale Store Språkmodeller (MLLM) har innledet en ny æra for mobile enhetsagenter, som kan forstå og samhandle med verden gjennom tekst, bilder og tale. Disse agentene markerer en betydelig fremgang over tradisjonell AI, og gir en rikere og mer intuitiv måte for brukerne å samhandle med enhetene sine på. Ved å utnytte MLLM kan disse agentene prosessere og syntetisere store mengder informasjon fra ulike modi, og tilby personlig assistanse og forbedre brukeropplevelser på måter som tidligere var uhørte.
Disse agentene er drevet av state-of-the-art maskinlærings-teknikker og avanserte naturlige språkbehandlingskapasiteter, som gjør det mulig for dem å forstå og generere menneskelignende tekst, samt tolke visuelle og auditive data med merkelig nøyaktighet. Fra å gjenkjenne objekter og scener i bilder til å forstå talekommandoer og analysere tekstsentiment, er disse multimodale agentene utstyrt for å håndtere en rekke innputt på en sammenhengende måte. Potensialet for denne teknologien er enormt, og tilbyr mer sofistikerte og kontekstuell bevisste tjenester, som virtuelle assistenter som er avstemt med menneskelige emosjoner og utdanningsverktøy som tilpasser seg til individuelle læringsstiler. De har også potensialet til å revolusjonere tilgjengelighet, og gjøre teknologien mer tilgjengelig over språk- og sansbarrierer.
I denne artikkelen skal vi diskutere Mobile-Agenter, en autonom multi-modal enhetsagent som først utnytter evnen til visuell persepsjon for å identifisere og lokalisere visuelle og tekstlige elementer i en mobilapplikasjons grensesnitt nøyaktig. Ved å bruke denne persepsjonen, planlegger og dekomponerer Mobile-Agent-rammeverket komplekse operasjoner autonomt, og navigerer gjennom mobilapplikasjonene gjennom steg-for-steg-operasjoner. Mobile-Agent-rammeverket skiller seg fra eksisterende løsninger, da det ikke avhenger av mobil-systemmetadata eller XML-filer for mobilapplikasjonene, og åpner for økt tilpasning over ulike mobile operativsystemer på en visuell sentral måte. Tilnærmingen som brukes i Mobile-Agent-rammeverket eliminerer behovet for systemspesifikke tilpasninger, og fører til forbedret ytelse og reduserte beregningskrav.
Mobile-Agenter: Autonome Multi-Modale Mobile Enhetsagenter
I den raske verden av mobilteknologi, dukker et banebrytende konsept opp som en fremragende: Store Språkmodeller, spesielt Multimodale Store Språkmodeller eller MLLM, som kan generere en rekke tekst, bilder, videoer og tale over ulike språk. Den raske utviklingen av MLLM-rammeverk de siste årene har ført til en ny og kraftfull anvendelse av MLLM: autonome mobile agenter. Autonome mobile agenter er programvare-enheter som handler, beveger seg og fungerer uavhengig, uten å trenge direkte menneskelige kommandoer, og er designet for å traversere nettverk eller enheter for å utføre oppgaver, samle informasjon eller løse problemer.
Mobile-Agenter er designet for å operere brukerens mobile enhet basert på brukerens instruksjoner og skjermvisninger, en oppgave som krever at agentene besitter både semantisk forståelse og visuell persepsjon. Imidlertid er eksisterende mobile agenter langt fra perfekte, da de er basert på multimodale store språkmodeller, og selv de nåværende statens MLLM-rammeverk, inkludert GPT-4V, mangler visuell persepsjonsevne for å fungere som en effektiv mobilagent. Videre, selv om eksisterende rammeverk kan generere effektive operasjoner, sliter de med å lokalisere posisjonen av disse operasjonene nøyaktig på skjermen, og begrenser dermed anvendelsen og evnen til mobile agenter til å operere på mobile enheter.
For å løse dette problemet, har noen rammeverk valgt å utnytte brukergrensesnittets layout-filer for å assistere GPT-4V eller andre MLLM med lokaliseringskapasiteter, og noen rammeverk har klart å trekke ut aksjonsposisjoner på skjermen ved å aksessere XML-filene til applikasjonen, mens andre rammeverk har valgt å bruke HTML-koden fra web-applikasjonene. Som det kan ses, avhenger de fleste av disse rammeverkene av å aksessere underliggende og lokale applikasjonsfiler, og gjør metoden nærmest ueffektiv hvis rammeverket ikke kan aksessere disse filene. For å løse dette problemet og eliminere avhengigheten av lokale agenter av underliggende filer på lokaliseringsmetodene, har utviklere arbeidet med Mobile-Agent, en autonom mobilagent med imponerende visuell persepsjonsevne. Ved å bruke sin visuelle persepsjonsmodul, lokalerer Mobile-Agent-rammeverket operasjoner nøyaktig ved å bruke skjermbilder fra mobil enheten.
Videre har Mobile-Agents-rammeverket som mål å utnytte den kontekstuelle kapasiteten til statens MLLM-rammeverk, som GPT-4V, for å oppnå selvplanleggingskapasiteter som tillater modellen å planlegge oppgaver basert på operasjons-historikk, bruker-instruksjoner og skjermbilder holistisk. For å ytterligere forbedre agentens evne til å identifisere ufullstendige instruksjoner og feilaktige operasjoner, introduserer Mobile-Agent-rammeverket en selv-refleksjonsmetode. Under ledelse av nøye utformede promter, reflekterer agenten over feilaktige og ugyldige operasjoner jevnt, og stopper operasjonene når oppgaven eller instruksjonen er fullført.
Samlet sett kan bidragene til Mobile-Agent-rammeverket sammenfattes som følger:
- Mobile-Agent fungerer som en autonom mobil enhetsagent, som utnytter visuell persepsjon for å lokalisere operasjoner. Det planlegger hver steg og engasjerer i introspeksjon. Notabelt, Mobile-Agent avhenger kun av skjermbilder fra enheten, uten å bruke noen systemkode, og viser en løsning som er basert på visuelle teknikker.
- Mobile-Agent introduserer Mobile-Eval, en benchmark designet for å evaluere mobil enhetsagenter. Denne benchmarken inkluderer en rekke av de ti mest brukte mobilapplikasjonene, samt intelligente instruksjoner for disse applikasjonene, kategorisert i tre nivåer av vanskelighetsgrad.

Mobile-Agent: Arkitektur og Metodologi
I kjernen består Mobile-Agent-rammeverket av en statisk MLLM, GPT-4V, en tekst-dettektionsmodul brukt for tekst-lokaliseringsoppgaver. I tillegg til GPT-4V, brukes også en ikon-dettektionsmodul for ikon-lokaliseringsoppgaver.
Visuell Persepsjon
Som nevnt tidligere, leverer GPT-4V MLLM tilfredsstillende resultater for instruksjoner og skjermbilder, men den mangler å kunne lokalisere operasjonene nøyaktig. På grunn av denne begrensningen, må Mobile-Agent-rammeverket som implementerer GPT-4V-modellen, avhenge av eksterne verktøy for å assistere med operasjons-lokaliseringsoppgaver, og dermed kunne utføre operasjonene på mobilskjermen.
Tekst-Lokalisering
Mobile-Agent-rammeverket implementerer en OCR-verktøy for å detektere posisjonen av tekst på skjermen når agenten må trykke på en bestemt tekst som vises på mobilskjermen. Det finnes tre unike tekst-lokaliserings-scenarier.
Scenario 1: Ingen Spesifisert Tekst Detektert
Problem: OCR-en detekterer ikke den spesifiserte teksten, som kan skje i komplekse bilder eller på grunn av OCR-begrensninger.
Respons: Instruer agenten til å enten:
- Velg tekst for trykking på nytt, og tillate manuell korreksjon av OCR-oversikten, eller
- Velg en alternativ operasjon, som å bruke en annen innmatingsmetode eller utføre en annen handling relevant for oppgaven.
Begrunnelse: Denne fleksibiliteten er nødvendig for å håndtere de occasionelle uakkuratene eller hallucinasjonene til GPT-4V, og sikre at agenten kan fortsatte effektivt.
Scenario 2: Enkelt Eksemplar av Spesifisert Tekst Detektert
Operasjon: Automatisk generer en handling for å trykke på midtpunktet av det detekterte tekst-boksen.
Begrunnelse: Med kun ett eksemplar detektert, er sannsynligheten for korrekt identifikasjon høy, og det er effektivt å fortsette med en direkte handling.
Scenario 3: Flere Eksemplarer av Spesifisert Tekst Detektert
Vurdering: Først, vurder antallet detekterte eksemplarer:
Mange Eksemplarer: Indikerer en skjerm som er fyldig med lignende innhold, og kompliserer valgprosessen.
Handling: Be agenten om å velge tekst på nytt, og forsøke å finne en mer presis valg eller justere søkeparametere.
Få Eksemplarer: En håndterbar mengde detekterte eksemplarer tillater en mer nuansert tilnærming.
Handling: Beskjær områdene rundt disse eksemplarene, og utvid tekst-dettektionsboksene utover for å fange ekstra kontekst. Dette sikrer at mer informasjon blir bevart, og hjelper i beslutningsprosessen.
Neste Steg: Tegn dettektionsbokser på de beskårede bildene, og presentere dem for agenten. Denne visuelle hjelpen hjelper agenten med å bestemme hvilket eksemplar å samhandle med, basert på kontekstuelle hint eller oppgavekrav.
Denne strukturerte tilnærmingen optimaliserer samspillet mellom OCR-resultater og agent-operasjoner, og forbedrer systemets pålitelighet og tilpasningsevne i håndtering av tekst-baserte oppgaver over ulike scenarier. Hele prosessen demonstreres i følgende bilde.

Ikoon-Lokalisering
Mobile-Agent-rammeverket implementerer en ikon-dettektionsverktøy for å lokalisere posisjonen av en ikon når agenten må trykke på det på mobilskjermen. For å være mer spesifikt, ber rammeverket først agenten om å angi bestemte attributter til bildet, inkludert form og farge, og deretter implementerer det Grounding DINO-metoden med ikon-prompten for å identifisere alle ikonene innholdt i skjermbildet. Til slutt, bruker Mobile-Agent CLIP-rammeverket for å beregne likheten mellom beskrivelsen av klikk-området og likheten mellom de slettede ikonene, og velger området med høyest likhet for et klikk.

Instruksjons-Utførelse
For å oversette handlinger til operasjoner på skjermen utført av agentene, definerer Mobile-Agent-rammeverket 8 forskjellige operasjoner.
- Lanser Applikasjon (Applikasjonsnavn): Initierer den angitte applikasjonen fra skrivebordets grensesnitt.
- Trykk på Tekst (Tekst-etikett): Samhandler med skjerm-delen som viser etiketten “Tekst-etikett”.
- Samhandler med Ikoon (Ikoon-beskrivelse, Posisjon): Target og trykk på det spesifiserte ikon-området, hvor “Ikoon-beskrivelse” detaljer attributter som farge og form av ikonet. Velg “Posisjon” fra alternativer som topp, bunn, venstre, høyre eller senter, muligens i kombinasjon for presis navigasjon og å redusere feil.
- Skriv Inn Tekst (Inn-tekst): Skriv inn den angitte “Inn-teksten” i den aktive tekstfeltet.
- Rull Opp & Ned: Naviger oppover eller nedover gjennom innholdet på den nåværende siden.
- Gå Tilbake: Gå tilbake til den forrige siden.
- Lukk: Gå tilbake til skrivebordet direkte fra den nåværende skjermen.
- Stopp: Avslutt operasjonen når oppgaven er fullført.
Selv-Planlegging
Hver steg av operasjonen utføres iterativt av rammeverket, og før starten av hver iterasjon, må brukeren angi en inn-instruksjon, og Mobile-Agent-modellen bruker instruksjonen for å generere en system-prompt for hele prosessen. Videre, før starten av hver iterasjon, fanger rammeverket en skjermbilde og matar det til agenten. Agenten observerer deretter skjermbildet, operasjons-historikk og system-prompts for å utgive neste steg av operasjonene.
Selv-Refleksjon
Under operasjonene kan agenten møte feil som hindrer den i å utføre en kommando suksessfullt. For å forbedre instruksjons-oppfylnings-raten, er en selv-evalueringsteknikk implementert, som aktiveres under to bestemte omstendigheter. Først, hvis agenten utfører en feilaktig eller ugyldig handling som stopper fremdrift, som når den gjenkjenner at skjermbildet forblir uendret etter operasjon eller viser en feil side, vil den bli dirigert til å vurdere alternative handlinger eller justere eksisterende operasjons-parametere. For det andre, kan agenten gå glipp av noen elementer i en kompleks direktiv. Når agenten har utført en rekke handlinger basert på sin opprinnelige plan, vil den bli bedt om å gjennomgå sin handlingsekvens, den siste skjermbildet og brukerens direktiv for å vurdere om oppgaven er fullført. Hvis det finnes diskrepanser, blir agenten bedt om å generere nye handlinger for å oppfylle direktivet.
Mobile-Agent: Eksperimenter og Resultater
For å evaluere sine evner komprehensivt, introduserer Mobile-Agent-rammeverket Mobile-Eval-benchmarken, som består av 10 vanlige mobil-applikasjoner, og designer tre instruksjoner for hver applikasjon. Den første operasjonen er enkel, og dekker kun grunnleggende applikasjons-operasjoner, mens den andre operasjonen er mer kompleks enn den første, og har noen ekstra krav. Til slutt er den tredje operasjonen den mest komplekse av alle, og inneholder abstrakte bruker-instruksjoner, hvor brukeren ikke spesifiserer hvilken applikasjon å bruke eller hvilken operasjon å utføre.
For å vurdere ytelsen fra ulike perspektiver, designer og implementerer Mobile-Agent-rammeverket 4 forskjellige metrikker.
- Su eller Suksess: Hvis mobile-agenten fullfører instruksjonene, regnes det som en suksess.
- Prosess-Score eller PS: Prosess-Score-metrikken måler nøyaktigheten av hver steg under utførelsen av bruker-instruksjonene, og beregnes ved å dividere antallet korrekte steg med det totale antallet steg.
- Relativ Effektivitet eller RE: Den relative effektivitets-scoren er en sammenligning mellom antallet steg det tar en menneske å utføre instruksjonen manuelt, og antallet steg det tar agenten å utføre samme instruksjon.
- Fullførings-Rate eller CR: Fullførings-raten måler hvor mange menneske-opererte steg rammeverket fullfører suksessfullt, dividert med det totale antallet steg mennesket tok for å fullføre instruksjonen. Verdiene til CR er 1 når agenten fullfører instruksjonen suksessfullt.
Resultatene demonstreres i følgende figur.

Initialt, for de tre gitt oppgavene, oppnådde Mobile-Agent fullførings-rater på 91%, 82% og 82%, henholdsvis. Selv om ikke alle oppgaver ble utført feilfritt, overgikk oppnåelses-ratene for hver oppgave-kategori 90%. Videre avslører PS-metrikken at Mobile-Agent konsistent viser en høy sannsynlighet for å utføre korrekte handlinger for de tre oppgavene, med suksess-rater rundt 80%. I tillegg, ifølge RE-metrikken, viser Mobile-Agent en effektivitet på 80% i å utføre operasjoner på et nivå sammenlignbart med menneskelig optimalitet. Disse resultater understreker kollektivt Mobile-Agents kompetanse som en mobil enhets-assistent.
Følgende figur illustrerer Mobile-Agents evne til å forstå bruker-instruksjoner og selvstendig planlegge sine handlinger. Selv i fravær av eksplisitte operasjons-detaljer i instruksjonene, tolket Mobile-Agent brukerens behov og konverterte dem til utførbare oppgaver. Etter å ha forstått dette, utførte agenten instruksjonene gjennom en systematisk planleggingsprosess.

Slutt-tanker
I denne artikkelen har vi diskutert Mobile-Agenter, en multi-modal autonom enhetsagent som først utnytter visuell persepsjonsteknologi for å nøyaktig detektere og lokalisere både visuelle og tekstlige komponenter i et mobil-applikasjons grensesnitt. Med denne visuelle konteksten i mente, planlegger og dekomponerer Mobile-Agent-rammeverket komplekse operasjoner autonomt, og navigerer gjennom mobil-applikasjoner steg-for-steg. Dette rammeverket skiller seg fra eksisterende løsninger, da det ikke avhenger av mobil-system-metadata eller mobil-applikasjonens XML-filer, og åpner for økt tilpasning over ulike mobile operativsystemer på en visuell sentral måte. Tilnærmingen som brukes i Mobile-Agent-rammeverket eliminerer behovet for systemspesifikke tilpasninger, og fører til forbedret ytelse og reduserte beregningskrav. Mobile-Agent-rammeverkets strategi gjør det mulig å unngå systemspesifikke adaptasjoner, og fører til økt effektivitet og reduserte beregningskrav, og åpner for større fleksibilitet over ulike mobile operativsystemer med fokus på visuell-sentrert prosessering.












