Modele i platformy AI
Agenci Mobilni: Autonomiczny Wielomodalny Agent Urządzenia Mobilnego z Wizją

Wraz z pojawieniem się wielomodalnych dużych modeli językowych (MLLM) rozpoczęła się nowa era agentów urządzeń mobilnych, zdolnych do zrozumienia i interakcji ze światem za pomocą tekstu, obrazów i głosu. Agenci ci stanowią znaczący postęp w stosunku do tradycyjnego AI, zapewniając bogatszy i bardziej intuicyjny sposób interakcji użytkowników z urządzeniami. Dzięki wykorzystaniu MLLM, agenci ci mogą przetwarzać i syntetyzować ogromne ilości informacji z różnych modalności, umożliwiając im oferowanie personalizowanej pomocy i poprawę doświadczeń użytkowników w sposób wcześniej niewyobrażalny.
Agenci ci są napędzani przez najnowocześniejsze techniki uczenia maszynowego i zaawansowane możliwości przetwarzania języka naturalnego, umożliwiające im zrozumienie i generowanie tekstu podobnego do ludzkiego, a także interpretację wizualnych i słuchowych danych zgodnie z zadaniem. Od rozpoznawania obiektów i scen w obrazach po zrozumienie poleceń głosowych i analizę sentymentu tekstu, ci wielomodalni agenci są wyposażeni w możliwość obsługi szerokiego zakresu danych wejściowych w sposób niezakłócony. Potencjał tej technologii jest ogromny, oferując bardziej zaawansowane i kontekstowo świadome usługi, takie jak wirtualni asystenci dostosowani do emocji ludzkich i narzędzia edukacyjne, które dostosowują się do indywidualnych stylów uczenia się. Mogą one również rewolucjonizować dostępność, czyniąc technologię bardziej dostępną w różnych językach i barierach sensorycznych.
W tym artykule będziemy rozmawiać o Agencie Mobilnym, autonomicznym wielomodalnym agencie urządzenia mobilnego, który jako pierwszy wykorzystuje zdolność narzędzi percepcji wizualnej do identyfikacji i lokalizacji wizualnych i tekstowych elementów interfejsu aplikacji mobilnej. Wykorzystując ten kontekst percepcji wizualnej, ramy Agenta Mobilnego planują i rozkładają złożone zadania operacyjne w sposób autonomiczny, nawigując przez aplikacje mobilne krok po kroku. Różni się to od istniejących rozwiązań, ponieważ nie opiera się na metadanych systemu mobilnego ani plikach XML aplikacji mobilnych, umożliwiając większą elastyczność w różnych środowiskach operacyjnych urządzeń mobilnych zorientowanych na przetwarzanie wizualne. Podejście zastosowane w ramach Agenta Mobilnego eliminuje potrzebę adaptacji specyficznych dla systemu, prowadząc do poprawy wydajności i zmniejszenia wymagań obliczeniowych.
Agenci Mobilni: Autonomiczny Wielomodalny Agent Urządzenia Mobilnego
W szybko rozwijającym się świecie technologii mobilnych, pojawił się nowy i interesujący koncept: Duże Modele Językowe, zwłaszcza Wielomodalne Duże Modele Językowe (MLLM), które mogą generować szeroki zakres tekstu, obrazów, filmów i mowy w różnych językach. Szybki rozwój ram MLLM w ciągu ostatnich kilku lat doprowadził do nowego i potężnego zastosowania MLLM: autonomicznych agentów mobilnych. Autonomiczni agenci mobilni to jednostki programowe, które działają, poruszają się i funkcjonują niezależnie, bez potrzeby bezpośrednich poleceń ludzkich, zaprojektowane do nawigacji po sieciach lub urządzeniach w celu wykonania zadań, zebrania informacji lub rozwiązania problemów.
Agenci Mobilni są zaprojektowani do działania na urządzeniu mobilnym użytkownika na podstawie instrukcji użytkownika i wizualizacji ekranu, co wymaga od agentów posiadania zarówno zdolności zrozumienia semantycznego, jak i percepcji wizualnej. Istniejący agenci mobilni są jednak dalecy od ideału, ponieważ opierają się na wielomodalnych dużych modelach językowych, a nawet obecny stan techniki w ramach MLLM, w tym GPT-4V, brakuje zdolności percepcji wizualnej niezbędnej do efektywnej roli agenta mobilnego. Ponadto, chociaż istniejące ramy mogą generować skuteczne operacje, mają trudności z lokalizacją tych operacji na ekranie, ograniczając aplikacje i zdolność agentów mobilnych do działania na urządzeniach mobilnych.
Aby rozwiązać ten problem, niektóre ramy wybrały wykorzystanie plików układu interfejsu użytkownika do wspomagania GPT-4V lub innych MLLM z funkcjami lokalizacji, przy czym niektóre ramy były w stanie wyodrębnić pozycje działania na ekranie, dostając dostęp do plików XML aplikacji, podczas gdy inne ramy zdecydowały się użyć kodu HTML z aplikacji internetowych. Jak widać, większość tych ram opiera się na dostępie do plików podstawowych i lokalnych aplikacji, co sprawia, że metoda jest prawie nieskuteczna, jeśli ramy nie mogą uzyskać dostępu do tych plików. Aby rozwiązać ten problem i wyeliminować zależność od plików podstawowych w metodach lokalizacji, deweloperzy pracowali nad Agencie Mobilnym, autonomicznym agentem mobilnym z imponującymi zdolnościami percepcji wizualnej. Wykorzystując swój moduł percepcji wizualnej, ramy Agenta Mobilnego używają zrzutów ekranu z urządzenia mobilnego do precyzyjnej lokalizacji operacji. Moduł percepcji wizualnej zawiera modele OCR i wykrywania, które są odpowiedzialne za identyfikację tekstu na ekranie i opisanie zawartości w określonym regionie ekranu urządzenia mobilnego. Ramy Agenta Mobilnego wykorzystują starannie opracowane prompty i ułatwiają efektywną interakcję między narzędziami a agentami, automatyzując w ten sposób operacje urządzenia mobilnego.
Ponadto, ramy Agenta Mobilnego mają na celu wykorzystanie zdolności kontekstowych najnowocześniejszych ram MLLM, takich jak GPT-4V, do osiągnięcia zdolności planowania, które pozwalają modelowi planować zadania na podstawie historii operacji, instrukcji użytkownika i zrzutów ekranu w sposób całościowy. Aby dalej poprawić zdolność agenta do identyfikacji niekompletnych instrukcji i błędnych operacji, ramy Agenta Mobilnego wprowadzają metodę samoreflaksji. Pod kierunkiem starannie opracowanych prompty, agent reflektuje na nieprawidłowe i nieważne operacje w sposób ciągły i zatrzymuje operacje, gdy zadanie lub instrukcja została wykonana.
Ogólnie, wkład ram Agenta Mobilnego można podsumować w następujący sposób:
- Agent Mobilny działa jako autonomiczny agent urządzenia mobilnego, wykorzystując narzędzia percepcji wizualnej do lokalizacji operacji. Planuje każdy krok w sposób metodyczny i angażuje się w introspekcję. Co więcej, Agent Mobilny opiera się wyłącznie na zrzutach ekranu urządzenia, bez użycia jakiegokolwiek kodu systemowego, prezentując rozwiązanie oparte wyłącznie na technice wizualnej.
- Agent Mobilny wprowadza Mobile-Eval, benchmark zaprojektowany do oceny agentów urządzeń mobilnych. Ten benchmark zawiera różnorodne aplikacje mobilne, wraz z inteligentnymi instrukcjami dla tych aplikacji, sklasyfikowanymi w trzech poziomach trudności.

Agent Mobilny: Architektura i Metodologia
W swojej istocie, ramy Agenta Mobilnego składają się z najnowocześniejszego Wielomodalnego Dużego Modelu Językowego, GPT-4V, modułu wykrywania tekstu używanego do zadań lokalizacji tekstu. Wraz z GPT-4V, Agent Mobilny wykorzystuje również moduł wykrywania ikon do lokalizacji ikon.
Percepcja Wizualna
Jak wcześniej wspomniano, model MLLM GPT-4V dostarcza satysfakcjonujących wyników dla instrukcji i zrzutów ekranu, ale nie jest w stanie wyjść na lokalizację operacji w sposób skuteczny. Z powodu tego ograniczenia, ramy Agenta Mobilnego wykorzystujące model GPT-4V muszą polegać na zewnętrznych narzędziach, aby pomóc w lokalizacji operacji, ułatwiając w ten sposób operacje wyjściowe na ekranie urządzenia mobilnego.
Lokalizacja Tekstu
Ramy Agenta Mobilnego implementują narzędzie OCR do wykrywania pozycji odpowiedniego tekstu na ekranie, gdy agent musi kliknąć na konkretny tekst wyświetlany na ekranie urządzenia mobilnego. Istnieją trzy unikalne scenariusze lokalizacji tekstu.
Scenariusz 1: Nie Wykryto Określonego Tekstu
Problem: OCR nie jest w stanie wykryć określonego tekstu, co może wystąpić w przypadku złożonych obrazów lub ograniczeń OCR.
Odpowiedź: Nakazuje agentowi:
- Ponownie wybrać tekst do kliknięcia, umożliwiając ręczną korektę przeoczenia OCR, lub
- Wybrać alternatywną operację, taką jak użycie innego sposobu wejściowego lub wykonanie innej akcji związanej z zadaniem.
Uzasadnienie: Ta elastyczność jest konieczna, aby zarządzać okazjonalnymi nieścisłościami lub halucynacjami GPT-4V, zapewniając, że agent może nadal postępować w sposób skuteczny.
Scenariusz 2: Wykryto Jedną Instancję Określonego Tekstu
Operacja: Automatycznie generuje akcję, aby kliknąć na środkowe współrzędne wykrytego pola tekstu.
Uzasadnienie: Z tylko jedną wykrytą instancją, prawdopodobieństwo prawidłowej identyfikacji jest wysokie, co sprawia, że jest to wydajne, aby postępować z bezpośrednią akcją.
Scenariusz 3: Wykryto Wiele Instancji Określonego Tekstu
Ocena: Po pierwsze, ocenić liczbę wykrytych instancji:
Wiele Instancji: Wskazuje na ekran, który jest zagęszczony podobnymi treściami, co utrudnia wybór.
Akcja: Poprosić agenta o ponowne wybranie tekstu, aby sfinansować wybór lub dostosować parametry wyszukiwania.
Niewiele Instancji: Zarządzalna liczba wykryć pozwala na bardziej nuansowane podejście.
Akcja: Przytnij regiony wokół tych instancji, rozszerzając pola tekstu na zewnątrz, aby zachować więcej kontekstu. To rozszerzenie zapewnia, że więcej informacji jest zachowane, ułatwiając podejmowanie decyzji.
Następny Krok: Narysuj pola wykrywania na przytniętych obrazach i przedstaw je agentowi. Ten wizualny wsparcie pomaga agentowi w decyzji, którą instancję wybrać, opierając się na wskazówkach kontekstowych lub wymaganiach zadania.
Ten uporządkowany proces optymalizuje interakcję między wynikami OCR a operacjami agenta, zwiększając niezawodność i elastyczność systemu w obsłudze zadań opartych na tekście w różnych scenariuszach. Cały proces jest przedstawiony na poniższym obrazie.

Lokalizacja Ikony
Ramy Agenta Mobilnego implementują narzędzie wykrywania ikon, aby zlokalizować pozycję ikony, gdy agent musi kliknąć ją na ekranie urządzenia mobilnego. Aby być bardziej konkretnym, ramy najpierw proszą agenta o podanie konkretnych atrybutów obrazu, w tym kształtu i koloru, a następnie ramy wykorzystują metodę Grounding DINO z promtem ikony, aby zidentyfikować wszystkie ikony zawarte w zrzucie ekranu. Następnie Agent Mobilny wykorzystuje ramę CLIP do obliczania podobieństwa między opisem regionu kliknięcia a ikonami usuniętymi, a następnie wybiera region o najwyższym podobieństwie do kliknięcia.

Wykonanie Instrukcji
Aby przetłumaczyć akcje w operacje na ekranie przez agenta, ramy Agenta Mobilnego definiują 8 różnych operacji.
- Uruchom Aplikację (Nazwa Aplikacji): Zainicjuj wybraną aplikację z interfejsu pulpitu.
- Kliknij na Tekst (Etykieta Tekstu): Interakcja z częścią ekranu, która wyświetla etykietę „Etykieta Tekstu”.
- Interakcja z Ikoną (Opis Ikony, Lokalizacja): Celuj i kliknij określony obszar ikony, gdzie „Opis Ikony” zawiera atrybuty takie jak kolor i kształt ikony. Wybierz „Lokalizację” z opcji takich jak górna, dolna, lewa, prawa lub środkowa, ewentualnie łącząc dwie, aby zmniejszyć błędy.
- Wprowadź Tekst (Tekst Wejściowy): Wprowadź podany „Tekst Wejściowy” do aktywnego pola tekstowego.
- Przewiń w Górę i w Dół: Nawiguj w górę lub w dół przez zawartość bieżącej strony.
- Powróć: Wróć do poprzednio wyświetlanej strony.
- Zamknij: Wróć bezpośrednio do pulpitu z bieżącego ekranu.
- Zatrzymaj: Zakończ operację, gdy zadanie zostanie wykonane.
Samoplanowanie
Każdy krok operacji jest wykonywany iteracyjnie przez ramy, a przed rozpoczęciem każdej iteracji, użytkownik musi podać instrukcję wejściową, a model Agenta Mobilnego wykorzystuje tę instrukcję do wygenerowania promtu systemowego dla całego procesu. Ponadto, przed rozpoczęciem każdej iteracji, ramy przechwytują zrzut ekranu i podają go agentowi. Agent obserwuje zrzut ekranu, historię operacji i prompty systemowe, aby wyjść z następnym krokiem operacji.
Samoreflaksja
Podczas swoich operacji, agent może napotkać błędy, które uniemożliwiają mu wykonanie polecenia. Aby poprawić stopień realizacji instrukcji, zaimplementowano podejście samoreflaktywne, które aktywuje się w dwóch określonych okolicznościach. Po pierwsze, jeśli agent wykonuje wadliwą lub nieważną akcję, która zatrzymuje postęp, tak jak w przypadku, gdy zrzut ekranu pozostaje niezmieniony po operacji lub wyświetla niewłaściwą stronę, zostanie skierowany do rozważenia alternatywnych akcji lub dostosowania parametrów istniejącej operacji. Po drugie, agent może ominąć niektóre elementy złożonej dyrektywy. Po wykonaniu serii akcji zgodnie z pierwotnym planem, agent zostanie poproszony o przegląd sekwencji akcji, najnowszego zrzutu ekranu i dyrektywy użytkownika, aby ocenić, czy zadanie zostało ukończone. Jeśli zostaną znalezione rozbieżności, agent zostanie poproszony o autonomiczne wygenerowanie nowych akcji w celu wypełnienia dyrektywy.
Agent Mobilny: Eksperymenty i Wyniki
Aby ocenić jego zdolności w sposób wszechstronny, ramy Agenta Mobilnego wprowadzają benchmark Mobile-Eval, składający się z 10 powszechnie używanych aplikacji, oraz projektują trzy instrukcje dla każdej aplikacji. Pierwsza operacja jest prosta i obejmuje tylko podstawowe operacje aplikacji, podczas gdy druga operacja jest nieco bardziej złożona niż pierwsza, zawierając dodatkowe wymagania. Ostatecznie, trzecia operacja jest najbardziej złożona, ponieważ zawiera abstrakcyjne polecenia użytkownika, bez wyraźnego określenia, którą aplikację użyć lub jaką operację wykonać.
Przechodząc dalej, aby ocenić wydajność z różnych perspektyw, ramy Agenta Mobilnego projektują i wdrażają 4 różne metryki.
- Sukces lub Powodzenie: Jeśli agent mobilny ukończy instrukcje, jest to uważane za sukces.
- Wynik Procesu lub PS: Metryka Wyniku Procesu mierzy dokładność każdego kroku podczas wykonywania instrukcji użytkownika i jest obliczana przez podzielenie liczby poprawnych kroków przez łączną liczbę kroków.
- Względna Wydajność lub RE: Względna wydajność jest stosunkiem między liczbą kroków, które osoba musi wykonać ręcznie, a liczbą kroków, które agent musi wykonać, aby wykonać tę samą instrukcję.
- Stopień Ukończenia lub CR: Metryka stopnia ukończenia dzieli liczbę kroków wykonanych przez ramy z powodzeniem przez łączną liczbę kroków wykonanych przez człowieka, aby ukończyć instrukcję. Wartość CR jest równa 1, gdy agent ukończy instrukcję pomyślnie.
Wyniki są przedstawione na poniższym obrazie.

Początkowo, dla trzech zadanych zadań, Agent Mobilny osiągnął wskaźniki ukończenia na poziomie 91%, 82% i 82%, odpowiednio. Chociaż nie wszystkie zadania zostały wykonane bezbłędnie, wskaźniki osiągnięć dla każdej kategorii zadań przekroczyły 90%. Ponadto, metryka PS ujawnia, że Agent Mobilny konsekwentnie wykazuje wysokie prawdopodobieństwo wykonania poprawnych akcji dla trzech zadań, z wskaźnikami powodzenia wokół 80%. Dodatkowo, zgodnie z metryką RE, Agent Mobilny wykazuje 80% wydajności w wykonywaniu operacji na poziomie porównywalnym z optymalnością ludzką. Te wyniki łącznie podkreślają umiejętności Agenta Mobilnego jako asystenta urządzenia mobilnego.
Poniższy obraz ilustruje zdolność Agenta Mobilnego do zrozumienia poleceń użytkownika i niezależnego ukierunkowania swoich działań. Nawet w przypadku braku wyraźnych szczegółów operacji w instrukcjach, Agent Mobilny sprawnie interpretował potrzeby użytkownika, konwertując je w zadania wykonalne. Po zrozumieniu, agent wykonał instrukcje za pomocą systematycznego procesu planowania.

Podsumowanie
W tym artykule omówiliśmy Agenta Mobilnego, wielomodalnego autonomicznego agenta urządzenia mobilnego, który jako pierwszy wykorzystuje technologie percepcji wizualnej do precyzyjnego wykrywania i lokalizowania wizualnych i tekstowych elementów interfejsu aplikacji mobilnej. Z tym kontekstem wizualnym, ramy Agenta Mobilnego planują i rozkładają złożone zadania operacyjne w sposób autonomiczny, nawigując przez aplikacje mobilne krok po kroku. Różnią się one od istniejących rozwiązań, ponieważ nie zależą od metadanych systemu mobilnego ani plików XML aplikacji mobilnych, umożliwiając większą elastyczność w różnych środowiskach operacyjnych urządzeń mobilnych zorientowanych na przetwarzanie wizualne. Strategia zastosowana w ramach Agenta Mobilnego eliminuje potrzebę adaptacji specyficznych dla systemu, prowadząc do poprawy wydajności i zmniejszenia wymagań obliczeniowych.












