Modely a platformy AI

Mobilní agenti: autonomní multimodální mobilní agent s vizuální percepcí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Příchod multimodálních velkých jazykových modelů (MLLM) zahájil novou éru mobilních agentů, kteří jsou schopni porozumět a interagovat se světem prostřednictvím textu, obrazů a hlasu. Tyto agenti představují významný pokrok oproti tradičnímu AI, poskytují bohatší a intuitivnější způsob, jak uživatelé interagují se svými zařízeními. Díky využití MLLM mohou tito agenti zpracovat a syntetizovat velké množství informací z různých modalit, umožňujíc jim nabízet personalizovanou pomoc a zlepšovat uživatelské zkušenosti způsoby, které byly dříve nepředstavitelné.

Tito agenti jsou poháněni nejmodernějšími technikami strojového učení a pokročilými schopnostmi zpracování přirozeného jazyka, umožňující jim porozumět a generovat text podobný lidskému, stejně jako interpretovat vizuální a auditivní data s pozoruhodnou přesností. Od rozpoznávání objektů a scén v obrazech až po porozumění mluveným příkazům a analýzu sentimentu textu, jsou tito multimodální agenti vybaveni pro zpracování širokého spektra vstupů bezproblémově. Potenciál této technologie je obrovský, nabízí sofistikovanější a kontextově aware služby, jako jsou virtuální asistenti ladění na lidské emoce a vzdělávací nástroje, které se přizpůsobují individuálním stylům učení. Také mají potenciál revolucionizovat přístupnost, činící technologie přístupnějšími napříč jazykovými a smyslovými bariérami.

V tomto článku budeme mluvit o Mobilních agentech, autonomním multimodálním zařízení agentovi, který jako první využívá schopnosti vizuálních percepčních nástrojů k identifikaci a lokalizaci vizuálních a textových prvků v uživatelském rozhraní mobilní aplikace přesně. Používaje tento kontext vizuální percepce, Mobilní agent framework autonomně plánuje a rozkládá komplexní operace do zvládnutelných kroků a naviguje prostřednictvím mobilních aplikací po jednotlivých operacích. Mobilní agent framework se liší od stávajících řešení, protože nezávisí na metadatach mobilního systému nebo souborech XML mobilních aplikací, což umožňuje větší flexibilitu napříč různými mobilními operačními systémy se zaměřením na vizuálně centrické zpracování. Přístup použitý Mobilním agentem eliminuje potřebu systémově specifických přizpůsobení, vedoucí k lepší efektivitě a nižším výpočetním nárokům.

Mobilní agenti: autonomní multimodální mobilní agent

V rychlém světě mobilní technologie se objevuje průkopnický koncept, který vyniká: Velké jazykové modely, zejména multimodální velké jazykové modely nebo MLLM, schopné generovat širokou škálu textu, obrazů, videí a řeči napříč různými jazyky. Rychlý vývoj MLLM rámců v posledních letech vedl k novému a mocnému uplatnění MLLM: autonomním mobilním agentům. Autonomní mobilní agenti jsou softwarové entity, které jednají, pohybují se a fungují nezávisle, bez potřeby přímých lidských příkazů, navržené pro pohyb po sítích nebo zařízeních za účelem splnění úkolů, sběru informací nebo řešení problémů.

Mobilní agenti jsou navrženi tak, aby fungovali na základě uživatelských příkazů a obrazovky, úkol, který vyžaduje, aby agenti měli jak sémantické porozumění, tak vizuální percepční schopnosti. Existující mobilní agenti jsou však daleko od dokonalosti, protože jsou založeni na multimodálních velkých jazykových modelech, a dokonce i současný stav MLLM rámců, včetně GPT-4V, postrádá vizuální percepční schopnosti nezbytné pro efektivní mobilního agenta.

Abyste řešili tuto otázku, některé rámce zvolily využití uživatelského rozhraní layout souborů, aby pomohly GPT-4V nebo jiným MLLM s lokalizačními schopnostmi, přičemž některé rámce dokázaly extrahovat akční pozice na obrazovce přístupem k souborům XML aplikace, zatímco jiné rámce zvolily použití HTML kódu z webových aplikací. Jak je vidět, většina těchto rámců závisí na přístupu k podkladovým a lokálním aplikacím, což činí metodu téměř neúčinnou, pokud rámec nemůže přístup k těmto souborům. Aby se tato otázka vyřešila a odstranila závislost lokálních agentů na podkladových souborech v lokalizačních metodách, vývojáři pracovali na Mobilním agentovi, autonomním mobilním agentovi s působivými vizuálními percepčními schopnostmi. Používajíc jeho vizuální percepční modul, Mobilní agent framework používá snímky z mobilního zařízení k přesné lokalizaci operací.

Navíc se Mobilní agent framework snaží využít kontextové schopnosti státních MLLM rámců, jako je GPT-4V, k dosažení samo-plánovacích schopností, které umožňují modelu plánovat úkoly na základě operací historie, uživatelských příkazů a snímků holisticky. Aby dále zlepšil schopnost agenta identifikovat neúplné příkazy a chybné operace, Mobilní agent framework zavedl metodu sebe-reflexe. Pod vedením pečlivě vytvořených příkazů, agent reflektuje chybné a neplatné operace konzistentně a zastavuje operace, jakmile je úkol nebo příkaz dokončen.

Celkově lze příspěvky Mobilního agenta shrnout takto:

  1. Mobilní agent funguje jako autonomní mobilní zařízení agent, využívající vizuální percepční nástroje k provedení operace lokalizace. Metodicky plánuje každý krok a zapojuje se do sebe-reflexe. Pozoruhodně, Mobilní agent závisí výhradně na snímcích zařízení, bez použití jakéhokoli systémového kódu, což představuje řešení založené čistě na vizuálních technikách.
  2. Mobilní agent zavedl Mobilní-Eval, benchmark navržený pro hodnocení mobilních zařízení agentů. Tento benchmark zahrnuje řadu deseti nejčastěji používaných mobilních aplikací, spolu s inteligentními příkazy pro tyto aplikace, kategorizované do tří úrovní obtížnosti.

Mobilní agent: Architektura a metodologie

V jádru Mobilního agenta frameworku se nachází stav současného multimodálního velkého jazykového modelu, GPT-4V, a textového detekčního modulu pro textovou lokalizaci. Kromě GPT-4V Mobilní agent také využívá ikonový detekční modul pro ikonovou lokalizaci.

Vizuální percepce

Jak bylo zmíněno dříve, GPT-4V MLLM poskytuje uspokojivé výsledky pro příkazy a snímky, ale selhává při výstupu umístění, kde operace probíhají. Kvůli této omezení, Mobilní agent framework implementující GPT-4V model potřebuje spoléhat se na externí nástroje, aby pomohly s lokalizací operací, a tak usnadnit výstup operací na mobilní obrazovce.

Textová lokalizace

Mobilní agent framework implementuje OCR nástroj k detekci polohy příslušného textu na obrazovce, kdykoli agent potřebuje kliknout na konkrétní text zobrazený na mobilní obrazovce. Existují tři jedinečné textové lokalizační scénáře.

Scénář 1: Žádný specifický text nebyl detekován

Problém: OCR selhává při detekci specifikovaného textu, což může nastat v komplexních obrazech nebo kvůli omezením OCR.

Reakce: Instruuje agenta, aby buď:

  • Znovu vybral text pro kliknutí, umožňující ruční korekci OCR přehlédnutí, nebo
  • Vybral alternativní operaci, jako je použití jiného vstupního metody nebo provedení jiného akce relevantní k úkolu.

Důvod: Tato flexibilita je nezbytná pro řízení příležitostných nepřesností nebo halucinací GPT-4V, zajišťujíc, aby agent mohl pokračovat účinně.

Scénář 2: Jedna instance specifikovaného textu byla detekována

Operace: Automaticky generuje akci pro kliknutí na středové souřadnice detekované textové oblasti.

Odůvodnění: S pouze jednou detekovanou instancí je pravděpodobnost správné identifikace vysoká, což činí efektivní postup s přímou akcí.

Scénář 3: Více instancí specifikovaného textu bylo detekováno

Hodnocení: Nejprve vyhodnotí počet detekovaných instancí:

Několik instancí: Označuje obrazovku znečištěnou podobným obsahem, komplikující výběr.

Akce: Požádá agenta, aby znovu vybral text, snažící se upřesnit výběr nebo upravit parametry stávající operace.

Málo instancí: Zvládnutelný počet detekcí umožňuje nuancovanější přístup.

Akce: Ořeže oblasti kolem těchto instancí, rozšiřující textové detekční oblasti ven, aby zachytil další kontext. Tento rozšíření zajišťuje, aby více informací bylo zachováno, pomáhající při rozhodování.

Další krok: Nakreslí detekční rámečky na ořezaných obrazech a předloží je agentovi. Tato vizuální pomoc pomáhá agentovi rozhodnout, se kterou instancí interagovat, na základě kontextových podnětů nebo požadavků úkolu.

Tento strukturovaný přístup optimalizuje interakci mezi výsledky OCR a operacemi agenta, zvyšujíc spolehlivost a adaptabilitu systému při zpracování textových úkolů napříč různými scénáři. Celý proces je demonstrován v následujícím obrázku.

Ikona lokalizace

Mobilní agent framework implementuje ikonový detekční nástroj k lokalizaci polohy ikony, když agent potřebuje kliknout na ni na mobilní obrazovce. Konkrétněji, framework nejdříve požádá agenta, aby poskytl specifické atributy obrazu, včetně tvaru a barvy, a poté framework implementuje Grounding DINO metodu s ikonovým promptem k identifikaci všech ikon obsažených ve snímku. Nakonec Mobilní agent framework využívá CLIP framework k výpočtu podobnosti mezi popisem kliknuté oblasti a popisem odstraněných ikon, a vybírá oblast s nejvyšší podobností pro kliknutí.

Příkazová exekuce

Pro překlad akcí do operací na obrazovce agenta, Mobilní agent framework definuje 8 různých operací.

  • Spuštění aplikace (název aplikace): Spustí určenou aplikaci z desktopového rozhraní.
  • Kliknutí na text (textový label): Interaguje s částí obrazovky, která zobrazuje label „textový label“.
  • Interakce s ikonou (ikonový popis, umístění): Cílí a kliká na specifikovanou ikonovou oblast, kde „ikonový popis“ popisuje atributy, jako je barva a tvar ikony. Vybere „umístění“ z možností, jako je horní, dolní, levý, pravý nebo střed, možná kombinující dvě pro přesnou navigaci a snížení chyb.
  • Vstup textu (vstupní text): Vstupuje zadaný „vstupní text“ do aktivního textového pole.
  • Posun nahoru a dolů: Prochází nahoru nebo dolů prostřednictvím obsahu současné stránky.
  • Návrat zpět: Vrací se na předchozí stránku.
  • Zavření: Naviguje zpět na desktop přímo z aktuální obrazovky.
  • Zastavení: Ukončuje operaci, jakmile je úkol dokončen.

Samo-plánování

Každý krok operace je prováděn iterativně rámcem, a před začátkem každé iterace, uživatel je požádán, aby poskytl vstupní příkaz, a Mobilní agent model používá příkaz k vygenerování systémového promptu pro celý proces. Kromě toho, před začátkem každé iterace, framework zachytí snímek a předá ho agentovi. Agent poté pozoruje snímek, historii operací a systémové prompty, aby vyprodukoval další krok operací.

Samo-reflexe

Během svých operací může agent čelit chybám, které brání úspěšnému provedení příkazu. Aby se zvýšila míra plnění příkazů, byla implementována metoda sebe-hodnocení, aktivující se ve dvou specifických případech. Za prvé, pokud agent provede vadnou nebo neplatnou akci, která zastaví pokrok, například když rozpozná, že snímek zůstal nezměněn po operaci nebo zobrazí nesprávnou stránku, bude nasměrován k úvahám o alternativních akcích nebo úpravám stávajících operací. Za druhé, agent může přehlédnout některé prvky komplexního příkazu. Jakmile agent provede řadu akcí na základě svého počátečního plánu, bude vyzván, aby přezkoumal svou akční sekvenci, nejnovější snímek a uživatelský příkaz, aby zhodnotil, zda úkol byl dokončen. Pokud jsou zjištěny nesrovnalosti, agent je pověřen autonomně generovat nové akce k plnění příkazu.

Mobilní agent: Experimenty a výsledky

Aby byly jeho schopnosti komplexně vyhodnoceny, Mobilní agent framework zavedl Mobilní-Eval benchmark, který se skládá z 10 nejčastěji používaných aplikací, a navrhl tři příkazy pro každou aplikaci. První operace je přímá a pokrývá pouze základní operace aplikace, zatímco druhá operace je o něco složitější než první, protože obsahuje některé další požadavky. Konečně, třetí operace je nejsložitější ze všech, protože obsahuje abstraktní uživatelský příkaz, kde uživatel výslovně nespecifikuje, kterou aplikaci použít nebo jakou operaci provést.

Dále, aby se vyhodnotila výkonnost z různých perspektiv, Mobilní agent framework navrhl a implementoval 4 různé metriky.

  • Úspěch nebo Success: Pokud mobilní agent dokončí příkazy, je považován za úspěch.
  • Procesní skóre nebo PS: Metrika Procesního skóre měří přesnost každého kroku během provedení uživatelských příkazů a je vypočtenadělením počtu správných kroků celkovým počtem kroků.
  • Relativní efektivita nebo RE: Relativní efektivita je poměr nebo srovnání mezi počtem kroků, které člověk potřebuje k provedení příkazu ručně, a počtem kroků, které agent potřebuje k provedení stejného příkazu.
  • Dokončovací poměr nebo CR: Metrika dokončovacího poměru dělí počet lidsky provedených kroků, které framework úspěšně dokončí, celkovým počtem kroků provedených člověkem k dokončení příkazu. Hodnota CR je 1, když agent úspěšně dokončí příkaz.

Výsledky jsou demonstrovány v následujícím obrázku.

Počátečně, pro tři dané úkoly, Mobilní agent dosáhl dokončovacích poměrů 91%, 82% a 82%, resp. Přestože ne všechny úkoly byly provedeny bezchybně, dosáhly sazby dokončení pro každou kategorii úkolů více než 90%. Kromě toho, metrika PS odhaluje, že Mobilní agent konzistentně prokazuje vysokou pravděpodobnost provedení přesných akcí pro tři úkoly, s úspěchem kolem 80%. Navíc, podle metriky RE, Mobilní agent prokázal 80% efektivitu při provádění operací na úrovni srovnatelné s lidskou optimalitou. Tyto výsledky společně podtrhují schopnosti Mobilního agenta jako mobilního zařízení asistenta.

Následující obrázek ilustruje schopnost Mobilního agenta pochopit uživatelské příkazy a nezávisle orchestrovat své akce. I v případě absence explicitních operativních detailů v příkazech, Mobilní agent úspěšně interpretoval uživatelské potřeby a přeměnil je na proveditelné úkoly. Následně, agent provedl příkazy prostřednictvím systematického plánovacího procesu.

Závěrečné myšlenky

V tomto článku jsme mluvili o Mobilních agentech, multimodálním autonomním zařízení agentovi, který jako první využívá schopnosti vizuálních percepčních nástrojů k identifikaci a lokalizaci vizuálních a textových prvků v uživatelském rozhraní mobilní aplikace přesně. S tímto kontextem vizuální percepce, Mobilní agent framework autonomně plánuje a rozkládá komplexní operace do zvládnutelných kroků a naviguje prostřednictvím mobilních aplikací po jednotlivých operacích. Tento framework se liší od stávajících řešení, protože nezávisí na metadatach mobilního systému nebo souborech XML mobilních aplikací, což umožňuje větší flexibilitu napříč různými mobilními operačními systémy se zaměřením na vizuálně centrické zpracování. Přístup použitý Mobilním agentem eliminuje potřebu systémově specifických přizpůsobení, vedoucí k lepší efektivitě a nižším výpočetním nárokům. Strategie použité Mobilním agentem frameworkem eliminuje potřebu systémově specifických přizpůsobení, vedoucí k lepší efektivitě a nižším výpočetním nárokům. Mobilní agent framework využívá vizuální percepční modul k lokalizaci operací na mobilní obrazovce, což umožňuje větší flexibilitu a lepší efektivitu. Tento přístup umožňuje Mobilnímu agentovi fungovat jako efektivní mobilní zařízení asistent, schopný plnit úkoly a operace na mobilních zařízeních.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.