Моделі та платформи ШІ

Мобільні-Агенти: Автономний мульти-модальний мобільний пристрій-агент із візуальним сприйняттям

mm
Додайте Unite.AI до бажаних джерел у Google

Поява мульти-модальних великих мовних моделей (MLLM) відкрила нову еру мобільних пристроїв-агентів, здатних розуміти та взаємодіяти зі світом через текст, зображення та голос. Ці агенти представляють значний крок вперед у порівнянні з традиційним ІІ, забезпечуючи більш багатий і інтуїтивний спосіб взаємодії користувачів зі своїми пристроями. Використовуючи MLLM, ці агенти можуть обробляти та синтезувати великі об’єми інформації з різних модальностей, що дозволяє їм пропонувати персоналізовану допомогу та підвищувати досвід користувачів способами, які раніше були неможливі.

Ці агенти працюють завдяки сучасним технікам машинного навчання та передовим можливостям обробки природної мови, що дозволяє їм розуміти та генерувати текст, подібний до людського, а також інтерпретувати візуальні та аудіо-дані з вражаючою точністю. Від розпізнавання об’єктів та сцен у зображеннях до розуміння голосових команд та аналізу текстових настроїв, ці мульти-модальні агенти здатні обробляти широкий спектр входів безперебійно. Потенціал цієї технології величезний, пропонуючи більш складні та контекстно-відчутливі послуги, такі як віртуальні помічники, налаштовані на людські емоції, та освітні інструменти, які адаптуються до індивідуальних стилів навчання. Вони також мають потенціал революціонізувати доступність, роблячи технології більш доступними через мовні та сенсорні бар’єри.

У цій статті ми говоримо про Мобільні-Агенти, автономного мульти-модального пристрій-агента, який спочатку використовує візуальне сприйняття для точного виявлення та визначення візуальних та текстових елементів інтерфейсу мобільного додатка. З цим візуальним контекстом Мобільний-Агент планує та розбиває складні операції на керованні дії, плавно переміщаючись через мобільні додатки крок за кроком. Цей каркас виділяється серед існуючих рішень, оскільки він не залежить від метаданих мобільної системи або файлів XML мобільних додатків, забезпечуючи більшу гнучкість у різних мобільних операційних системах з акцентом на візуально-орієнтовану обробку. Підхід, використаний у Мобільному-Агенті, усуває необхідність системно-специфічних адаптацій, що призводить до покращення ефективності та зниження обчислювальних вимог.

Мобільні-Агенти: Автономний мульти-модальний мобільний пристрій-агент

У швидкозмінному світі мобільних технологій виникає новаторська концепція: великі мовні моделі, особливо мульти-модальні великі мовні моделі (MLLM), здатні генерувати широкий спектр текстів, зображень, відео та мови через різні мови. Швидкий розвиток каркасів MLLM за останні кілька років привів до появи нового та потужного застосування MLLM: автономних мобільних агентів. Автономні мобільні агенти – це програмні сутності, які діють, рухаються та функціонують незалежно, без прямої команди людини, призначені для переміщення через мережі або пристрої для виконання завдань, збору інформації або вирішення проблем.

Мобільні-Агенти розроблені для роботи на основі інструкцій користувача та візуальних даних екрану, завдання, яке вимагає від агентів володіння як семантичним розумінням, так і візуальним сприйняттям. Однак існуючі мобільні агенти далеко не досконалі, оскільки вони базуються на мульти-модальних великих мовних моделях, а навіть поточний стан каркасів MLLM, включаючи GPT-4V, не володіє візуальним сприйняттям, необхідним для ефективної роботи мобільного агента. Крім того, хоча існуючі каркаси можуть генерувати ефективні операції, вони мають труднощі з точним визначенням місця цих операцій на екрані, обмежуючи застосування та здатність мобільних агентів працювати на мобільних пристроях.

Для вирішення цієї проблеми деякі каркаси обрали використання макетів інтерфейсу користувача для допомоги GPT-4V або іншим MLLM у локалізації, деякі каркаси змогли витягнути діючі позиції на екрані, отримуючи доступ до файлів XML додатків, тоді як інші каркаси обрали використання HTML-коду веб-додатків. Як видно, більшість цих каркасів залежить від доступу до підляжних та локальних файлів додатків, що робить метод майже неефективним, якщо каркас не може отримати доступ до цих файлів. Для вирішення цієї проблеми та усунення залежності місцевих агентів від підляжних файлів у методах локалізації розробники працювали над Мобільним-Агентом, автономним мобільним агентом з вражаючими візуальними сприйняттями. Використовуючи свій візуальний модуль сприйняття, каркас Мобільного-Агента використовує знімки екрана мобільного пристрою для точного визначення операцій.

Крім того, каркас Мобільного-Агента спрямований на використання контекстних можливостей каркасів MLLM, таких як GPT-4V, для досягнення самопланування, яке дозволяє моделі планувати завдання на основі історії операцій, інструкцій користувача та знімків екрана в цілому. Для подальшого підвищення здатності агента визначати незавершені інструкції та неправильні операції, каркас Мобільного-Агента вводить метод саморефлексії. Під керівництвом ретельно створених підказок, агент рефлексує над неправильними та недійсними операціями постійно та зупиняє операції, коли завдання або інструкція завершені.

У цілому, внесок каркаса Мобільного-Агента можна підсумувати наступним чином:

  1. Мобільний-Агент діє як автономний мобільний пристрій-агент, використовуючи візуальне сприйняття для виконання операцій. Він методично планує кожен крок та займається інтроспекцією. Особливо, Мобільний-Агент залежить виключно від знімків екрана пристрою, без використання будь-якого системного коду, демонструючи рішення, яке повністю базується на візуальних техніках.
  2. Мобільний-Агент вводить Mobile-Eval, бенчмарк, розроблений для оцінки мобільних пристроїв-агентів. Цей бенчмарк включає різноманітність з десяти найбільш часто використовуваних мобільних додатків, разом з інтелектуальними інструкціями для цих додатків, категоризованих на три рівні складності.

Мобільний-Агент : Архітектура та методологія

У своєму ядрі каркас Мобільного-Агента складається з сучасної мульти-модальної великої мовної моделі (MLLM), GPT-4V, модуля виявлення тексту для завдань локалізації тексту. Разом з GPT-4V, Мобільний-Агент також використовує модуль виявлення іконок для локалізації іконок.

Візуальне сприйняття

Як згадувалося раніше, MLLM GPT-4V дає задовільні результати для інструкцій та знімків екрана, але не може ефективно вивести місце, де відбуваються операції. Через цю обмеженість, каркас Мобільного-Агента, який реалізує модель GPT-4V, потребує зовнішніх інструментів для допомоги у локалізації операцій, тим самим забезпечуючи виконання операцій на мобільному екрані.

Локалізація тексту

Каркас Мобільного-Агента реалізує інструмент OCR для виявлення позиції відповідного тексту на екрані, коли агент需要 натиснути на певний текст, відображений на мобільному екрані. Є три унікальні сценарії локалізації тексту.

Сценарій 1: Не виявлений жоден текст

Проблема: OCR не може виявити вказаний текст, що може статися в складних зображеннях або через обмеження OCR.

Відповідь: Інструктувати агента або переобрати текст для натискання, дозволяючи ручну корекцію недоліку OCR, або вибрати альтернативну операцію, таку як використання іншого методу вводу або виконання іншої дії, пов’язаної з завданням.
Обґрунтування: Ця гнучкість необхідна для управління випадковими неточностями або галюцинаціями GPT-4V, забезпечуючи можливість агента продовжувати ефективно.

Сценарій 2: Виявлений один екземпляр вказаного тексту

Операція: Автоматично генерувати дію для кліку на центр координат виявленої текстової коробки.

Обґрунтування: З лише одним виявленим екземпляром, ймовірність правильної ідентифікації висока, що робить ефективним продовжувати безпосередню дію.

Сценарій 3: Виявлено кілька екземплярів вказаного тексту

Оцінка: Спочатку оцінити кількість виявлених екземплярів:

Багато екземплярів: Показує, що екран заповнений подібним вмістом, ускладнюючи процес вибору.

Дія: Запросити агента переобрати текст, спрямовуючись на уточнення вибору або корекцію параметрів пошуку.

Невелика кількість екземплярів: Кероване число виявлень дозволяє застосувати більш нюансований підхід.

Дія: Обрізати регіони навколо цих екземплярів, розширюючи текстові коробки назовні для захоплення додаткового контексту. Це розширення забезпечує збереження більшої кількості інформації, допомагаючи у процесі прийняття рішень.

Наступний крок: Нанести виявлені коробки на обрізані зображення та представити їх агенту. Ця візуальна допомога допомагає агенту у виборі екземпляра для взаємодії на основі контекстних підказок або вимог завдання.

Цей структурований підхід оптимізує взаємодію між результатами OCR та операціями агента, підвищуючи надійність та адаптивність системи у обробці текстових завдань у різних сценаріях. Цій процес демонструється на наступному зображенні.

Локалізація іконки

Каркас Мобільного-Агента реалізує інструмент виявлення іконок для визначення позиції іконки, коли агент потрібно натиснути на неї на мобільному екрані. Конкретно, каркас спочатку запитує агента надати конкретні атрибути зображення, включаючи форму та колір, а потім реалізує метод Grounding DINO для ідентифікації всіх іконок, що містяться у знімку екрана. Нарешті, Мобільний-Агент використовує каркас CLIP для розрахунку схожості між описом регіону кліку та видаленими іконками, та вибирає регіон з найбільшою схожістю для кліку.

Виконання інструкцій

Для перекладу дій у операції на екрані агентом, каркас Мобільного-Агента визначає 8 різних операцій.

  • Запуск додатка (Назва додатка): Ініціювати призначений додаток з інтерфейсу робочого столу.
  • Натиснути на текст (Мітка тексту): Взаємодіяти з частиною екрана, що відображає мітку «Мітка тексту».
  • Взаємодія з іконкою (Опис іконки, Розташування): Цільовий та натиснути на вказану іконку, де «Опис іконки» деталізує атрибути, такі як колір та форма іконки. Вибрати «Розташування» з варіантів, таких як верх, низ, ліво, право, або центр, можливо, поєднуючи два для точної навігації та зменшення помилок.
  • Ввести текст (Вхідний текст): Ввести заданий «Вхідний текст» у активне текстове поле.
  • Прокрутити вгору та вниз: Навігація вгору чи вниз через вміст поточної сторінки.
  • Повернутися назад: Повернутися до попередньої сторінки.
  • Закрити: Перейти напряму до робочого столу з поточної сторінки.
  • Зупинити: Завершити операцію, коли завдання виконано.

Самопланування

Кожен крок операції виконується ітеративно каркасами, а перед початком кожної ітерації користувач повинен надати вхідну інструкцію, а модель Мобільного-Агента використовує інструкцію для генерації системної підказки для всього процесу. Крім того, перед початком кожної ітерації каркас захоплює знімок екрана та подає його агенту. Агент потім спостерігає за знімком екрана, історією операцій та системними підказками для виводу наступного кроку операцій.

Саморефлексія

Під час виконання операцій агент може зустріти помилки, які заважають йому успішно виконувати команди. Для підвищення рівня виконання інструкцій реалізований підхід саморефлексії, який активується у двох конкретних обставинах. Спочатку, якщо агент виконує пошкоджену або недійсну дію, яка зупиняє прогрес, наприклад, коли він визнає, що знімок екрана залишається незмінним після операції або відображає неправильну сторінку, він буде спрямований на розгляд альтернативних дій або корекцію параметрів існуючої операції. Другою обставиною є те, що агент може пропустити деякі елементи складної директиви. Після виконання серії дій згідно з початковим планом, агент буде підказаний переглянути свій послідовник дій, останній знімок екрана та директиву користувача для оцінки, чи завдання виконано. Якщо виявлені розбіжності, агент спрямований на автономну генерацію нових дій для виконання директиви.

Мобільний-Агент : Експерименти та результати

Для комплексної оцінки своїх можливостей каркас Мобільного-Агента вводить бенчмарк Mobile-Eval, який складається з 10 найбільш часто використовуваних мобільних додатків, та розробляє три інструкції для кожного додатка. Перша операція проста та покриває лише базові операції додатка, тоді як друга операція трохи складніша за першу, оскільки включає додаткові вимоги. Нарешті, третя операція є найбільш складною, оскільки містить абстрактні інструкції користувача, де користувач явно не вказує, який додаток використовувати або яку операцію виконувати.

Далі, для оцінки продуктивності з різних поглядів, каркас Мобільного-Агента розробляє та реалізує 4 різні метрики.

  • Успіх (Su): Якщо мобільний агент завершує інструкції, це вважається успіхом.
  • Бал за процес (PS): Метрика Бал за процес вимірює точність кожного кроку під час виконання інструкцій користувача та обчислюється шляхом ділення кількості правильних кроків на загальну кількість кроків.
  • Відносна ефективність (RE): Відносна ефективність – це співвідношення між кількістю кроків, які людина виконає інструкцію вручну, та кількістю кроків, які агент виконає ту саму інструкцію.
  • Коефіцієнт завершення (CR): Метрика коефіцієнта завершення ділить кількість кроків, які агент успішно завершує, на загальну кількість кроків, які людина виконала для виконання інструкції. Значення CR дорівнює 1, коли агент успішно завершує інструкцію.

Результати демонструються на наступному зображенні.

Спочатку, для трьох заданих завдань, Мобільний-Агент досягнув рівня завершення 91%, 82% та 82% відповідно. Хоча не всі завдання були виконані бездоганно, показники успіху для кожної категорії завдань перевищили 90%. Крім того, метрика Бал за процес показує, що Мобільний-Агент демонструє високу ймовірність виконання точних дій для трьох завдань, з показниками успіху близько 80%. Додатково, згідно з метрикою Відносної ефективності, Мобільний-Агент демонструє ефективність на рівні 80% у виконанні операцій на рівні, порівняному з людською оптимальністю. Ці результати колективно підкреслюють професіоналізм Мобільного-Агента як мобільного помічника.

Наступне зображення демонструє здатність Мобільного-Агента зрозуміти інструкції користувача та самостійно оркеструвати свої дії. Навіть у відсутності явних операційних деталей у інструкціях, Мобільний-Агент успішно інтерпретував потреби користувача, перетворюючи їх у дії. Після цього розуміння агент виконав інструкції через систематичний процес планування.

Фінальні думки

У цій статті ми говорили про Мобільних-Агентів, мульти-модального автономного пристрій-агента, який спочатку використовує візуальне сприйняття для точного виявлення та визначення візуальних та текстових елементів інтерфейсу мобільного додатка. З цим візуальним контекстом каркас Мобільного-Агента планує та розбиває складні операції на керованні дії, плавно переміщаючись через мобільні додатки крок за кроком. Цей каркас виділяється серед існуючих рішень, оскільки він не залежить від метаданих мобільної системи або файлів XML мобільних додатків, забезпечуючи більшу гнучкість у різних мобільних операційних системах з акцентом на візуально-орієнтовану обробку. Підхід, використаний у Мобільному-Агенті, усуває необхідність системно-специфічних адаптацій, що призводить до покращення ефективності та зниження обчислювальних вимог.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.