Модели и платформы ИИ

Мобильные-Агенты: Автономные Мультимодальные Мобильные Устройства С Визуальным Восприятием

mm
Добавьте Unite.AI в избранные источники в Google

Развитие Мультимодальных Больших Языковых Моделей (MLLM) открыло новую эру мобильных устройств-агентов, способных понимать и взаимодействовать с миром через текст, изображения и голос. Эти агенты представляют собой значительный шаг вперед по сравнению с традиционным ИИ, обеспечивая более богатый и интуитивно понятный способ взаимодействия пользователей с устройствами. Благодаря использованию MLLM, эти агенты могут обрабатывать и синтезировать огромные объемы информации из различных модальностей, позволяя им предоставлять персонализированную помощь и улучшать опыт пользователей способами, ранее невообразимыми.

Эти агенты работают на основе передовых методов машинного обучения и продвинутых возможностей обработки естественного языка, позволяя им понимать и генерировать текст, похожий на человеческий, а также интерпретировать визуальные и слуховые данные с замечательной точностью. От распознавания объектов и сцен в изображениях до понимания голосовых команд и анализа настроений текста, эти мультимодальные агенты способны обрабатывать широкий спектр входных данных без проблем. Потенциал этой технологии огромен, предлагая более сложные и контекстно-зависимые услуги, такие как виртуальные помощники, настроенные на эмоции человека, и образовательные инструменты, адаптируемые к индивидуальным стилям обучения. Они также имеют потенциал революционизировать доступность, делая технологии более доступными через языковые и сенсорные барьеры.

В этой статье мы будем говорить о Мобильных-Агентах, автономном мультимодальном устройстве-агенте, который первым использует возможность визуального восприятия для точного определения и локализации визуальных и текстовых элементов на интерфейсе мобильного приложения. Используя этот контекст визуального восприятия,框架 Мобильного-Агента планирует и разбивает сложные операции на управляемые действия, плавно перемещаясь через мобильные приложения шаг за шагом. Этот框架 отличается от существующих решений, поскольку он не полагается на метаданные мобильной системы или файлы XML мобильных приложений, обеспечивая большую гибкость в различных мобильных операционных системах с фокусом на визуально-центрированной обработке. Стратегия, используемая框架ом Мобильного-Агента, исключает необходимость системных адаптаций, что приводит к повышению эффективности и снижению вычислительных требований.

Мобильные-Агенты: Автономные Мультимодальные Мобильные Устройства

В быстро меняющемся мире мобильных технологий появляется новая концепция: Большие Языковые Модели, особенно Мультимодальные Большие Языковые Модели (MLLM), способные генерировать широкий спектр текста, изображений, видео и речи на разных языках. Быстрое развитие MLLM-рамок в последние годы привело к новому и мощному применению MLLM: автономным мобильным агентам. Автономные мобильные агенты – это программные сущности, которые действуют, перемещаются и функционируют самостоятельно, без необходимости прямых человеческих команд, предназначенные для перемещения по сетям или устройствам для выполнения задач, сбора информации или решения проблем.

Мобильные-Агенты предназначены для работы на мобильном устройстве пользователя на основе инструкций пользователя и визуальных данных экрана, задача, которая требует от агентов обладать как семантическим пониманием, так и визуальным восприятием. Однако существующие мобильные агенты далеки от совершенства, поскольку они основаны на мультимодальных больших языковых моделях, и даже текущее состояние MLLM-рамок, включая GPT-4V, не обладает визуальными возможностями восприятия, необходимыми для эффективного мобильного агента.

Для решения этой проблемы некоторые рамки выбрали использование файлов макета пользовательского интерфейса для помощи GPT-4V или другим MLLM с возможностями локализации, причем некоторые рамки смогли извлечь действенные позиции на экране, получая доступ к файлам XML приложения, в то время как другие рамки выбрали использование HTML-кода из веб-приложений. Как можно увидеть, большинство этих рамок полагаются на доступ к основным и локальным файлам приложения, что делает метод几乎 неэффективным, если рамка не может получить доступ к этим файлам. Для решения этой проблемы и исключения зависимости локальных агентов от основных файлов на методах локализации разработчики работали над Мобильным-Агентом, автономным мобильным агентом с впечатляющими визуальными возможностями восприятия. Используя свой модуль визуального восприятия, рамка Мобильного-Агента использует скриншоты с мобильного устройства для точного определения операций.

Кроме того, рамка Мобильных-Агентов направлена на использование контекстных возможностей современных MLLM-рамок, таких как GPT-4V, для достижения возможностей само-планирования, позволяющих модели планировать задачи на основе истории операций, инструкций пользователя и скриншотов в целом. Для дальнейшего улучшения способности агента определять неполные инструкции и неправильные операции, рамка Мобильного-Агента вводит метод само-рефлексии. Под руководством тщательно созданных подсказок, агент размышляет о неправильных и недействительных операциях последовательно и останавливает операции, как только задача или инструкция выполнена.

В целом, вклад рамки Мобильного-Агента можно суммировать следующим образом:

  1. Мобильный-Агент действует как автономный мобильный устройство-агент, использующий инструменты визуального восприятия для локализации операций. Он методически планирует каждый шаг и занимается интроспекцией. Заметно, что Мобильный-Агент полагается исключительно на скриншоты устройства, не используя системный код, демонстрируя решение, основанное исключительно на визуальных методах.
  2. Мобильный-Агент вводит Мобильную-Оценку, эталон, предназначенный для оценки мобильных устройств-агентов. Этот эталон включает в себя разнообразные из 10 наиболее часто используемых мобильных приложений, а также интеллектуальные инструкции для этих приложений, категоризированные на три уровня сложности.

Мобильный-Агент: Архитектура и Методология

В своей основе, рамка Мобильного-Агента состоит из современной Мультимодальной Большей Языковой Модели (MLLM), GPT-4V, модуля обнаружения текста для задач локализации текста. Вместе с GPT-4V, Мобильный-Агент также использует модуль обнаружения иконок для локализации иконок.

Визуальное Восприятие

Как упоминалось ранее, MLLM GPT-4V обеспечивает удовлетворительные результаты для инструкций и скриншотов, но он не может вывести местоположение эффективно, где происходят операции. Из-за этого ограничения, рамка Мобильного-Агента, реализующая модель GPT-4V, должна полагаться на внешние инструменты для помощи в локализации операций, тем самым облегчая вывод операций на мобильном экране.

Локализация Текста

Рамка Мобильного-Агента реализует инструмент OCR для обнаружения позиции соответствующего текста на экране, когда агент должен нажать на конкретный текст, отображаемый на мобильном экране. Существуют три уникальных сценария локализации текста.

Сценарий 1: Не Обнаружен Текст

Проблема: OCR не может обнаружить указанный текст, что может произойти в сложных изображениях или из-за ограничений OCR.

Ответ: Инструктируйте агента либо:

  • Перевыбрать текст для нажатия, позволяя сделать ручную коррекцию ошибки OCR, или
  • Выбрать альтернативную операцию, такую как использование другого метода ввода или выполнение другого действия, связанного с задачей.

Обоснование: Эта гибкость необходима для управления случайными неточностями или зрительными ошибками GPT-4V, обеспечивая возможность агенту продолжать эффективно.

Сценарий 2: Обнаружен Один Экземпляр Текста

Операция: Автоматически сгенерировать действие для нажатия на центр обнаруженного текстового поля.

Обоснование: С только одним обнаруженным экземпляром, вероятность правильной идентификации высока, что делает эффективным продолжение прямого действия.

Сценарий 3: Обнаружено Много Экземпляров Текста

Оценка: Сначала оцените количество обнаруженных экземпляров:

Много Экземпляров: Указывает на экран, загроможденный подобным контентом, что усложняет процесс выбора.

Действие: Запросите агента повторно выбрать текст, стремясь уточнить выбор или скорректировать параметры поиска.

Немного Экземпляров: Управляемое количество обнаружений позволяет использовать более тонкий подход.

Действие: Обрежьте области вокруг этих экземпляров, расширяя текстовые поля обнаружения наружу, чтобы захватить дополнительный контекст. Это расширение обеспечивает сохранение большего количества информации, помогая в принятии решений.

Следующий Шаг: Нарисуйте поля обнаружения на обрезанных изображениях и представьте их агенту. Эта визуальная помощь помогает агенту решить, какой экземпляр взаимодействовать, основываясь на контекстных подсказках или требованиях задачи.

Этот структурированный подход оптимизирует взаимодействие между результатами OCR и операциями агента, повышая надежность и адаптивность системы в обработке текстовых задач в различных сценариях. Всю эту процедуру демонстрирует следующее изображение.

Локализация Иконок

Рамка Мобильного-Агента реализует инструмент обнаружения иконок для определения позиции иконки, когда агент должен нажать на нее на мобильном экране. Более конкретно, рамка сначала запрашивает агента предоставить конкретные атрибуты изображения, включая форму и цвет, а затем рамка использует метод Grounding DINO с подсказкой иконки для определения всех иконок, содержащихся в скриншоте. Наконец, Мобильный-Агент использует рамку CLIP для расчета сходства между описанием области нажатия и удаляет иконки, и выбирает область с наибольшим сходством для нажатия.

Выполнение Инструкций

Для перевода действий в операции на экране агентом, рамка Мобильного-Агента определяет 8 различных операций.

  • Запуск Приложения (Имя Приложения): Инициируйте указанное приложение с интерфейса рабочего стола.
  • Нажатие на Текст (Метка Текста): Взаимодействуйте с частью экрана, отображающей метку «Метка Текста».
  • Взаимодействие с Иконкой (Описание Иконки, Местоположение): Целевая иконка и нажмите на указанную область иконки, где «Описание Иконки» содержит атрибуты, такие как цвет и форма иконки. Выберите «Местоположение» из вариантов, таких как верх, низ, левый, правый или центр, возможно, объединив два для точной навигации и снижения ошибок.
  • Ввод Текста (Вводимый Текст): Введите заданный «Вводимый Текст» в активное текстовое поле.
  • Прокрутка Вверх и Вниз: Навигируйте вверх или вниз через содержимое текущей страницы.
  • Вернуться Назад: Вернитесь к предыдущей странице.
  • Закрыть: Вернитесь на рабочий стол напрямую из текущего экрана.
  • Остановить: Завершите операцию, как только задача выполнена.

Само-Планирование

Каждый шаг операции выполняется итеративно рамкой, и перед началом каждой итерации, пользователю необходимо предоставить входную инструкцию, и модель Мобильного-Агента использует инструкцию для генерации системной подсказки для всего процесса. Кроме того, перед началом каждой итерации, рамка захватывает скриншот и подает его агенту. Агент затем наблюдает скриншот, историю операций и системные подсказки, чтобы вывести следующий шаг операций.

Само-Рефлексия

Во время выполнения операций, агент может столкнуться с ошибками, которые предотвращают успешное выполнение команды. Для повышения уровня выполнения инструкций, был реализован подход само-оценки, активирующий в двух конкретных обстоятельствах. Сначала, если агент выполняет ошибочное или недействительное действие, которое останавливает прогресс, такое как когда он распознает, что скриншот остается неизменным после операции или отображает неправильную страницу, он будет направлен на рассмотрение альтернативных действий или корректировку существующих параметров операции. Во-вторых, агент может пропустить некоторые элементы сложной директивы. Как только агент выполнил серию действий на основе своего первоначального плана, он будет побужден просмотреть последовательность действий, последний скриншот и директиву пользователя, чтобы оценить, выполнена ли задача. Если обнаружены расхождения, агент будет задачен автономно сгенерировать новые действия для выполнения директивы.

Мобильный-Агент: Эксперименты и Результаты

Для оценки его возможностей комплексно, рамка Мобильного-Агента вводит эталон Мобильной-Оценки, состоящий из 10 наиболее часто используемых приложений, и проектирует три инструкции для каждого приложения. Первая операция простая и только покрывает базовые операции приложения, тогда как вторая операция немного более сложная, чем первая, поскольку она имеет дополнительные требования. Наконец, третья операция является самой сложной из всех, поскольку она содержит абстрактные инструкции пользователя, где пользователь не указывает явно, какое приложение использовать или какую операцию выполнить.

Далее, для оценки производительности с различных точек зрения, рамка Мобильного-Агента проектирует и реализует 4 различных метрики.

  • Успех или Успешность: Если мобильный агент завершает инструкции, он считается успешным.
  • Оценка Процесса или ОП: Метрика Оценки Процесса измеряет точность каждого шага во время выполнения инструкций пользователя и рассчитывается путем деления количества правильных шагов на общее количество шагов.
  • Относительная Эффективность или ОЭ: Относительная эффективность является соотношением или сравнением между количеством шагов, которое человеку необходимо выполнить для выполнения инструкции вручную, и количеством шагов, которое агенту необходимо выполнить для выполнения той же инструкции.
  • Коэффициент Завершения или КЗ: Коэффициент завершения делит количество шагов, успешно выполненных рамкой, на общее количество шагов, которые человеку необходимо выполнить для завершения инструкции. Значение КЗ равно 1, когда агент завершает инструкцию успешно.

Результаты демонстрируются на следующем рисунке.

Первоначально, для трех заданных задач, Мобильный-Агент достиг коэффициентов завершения 91%, 82% и 82% соответственно. Хотя не все задачи были выполнены безупречно, коэффициенты достижения для каждой категории задач превысили 90%. Кроме того, метрика ОП показывает, что Мобильный-Агент последовательно демонстрирует высокую вероятность выполнения точных действий для трех задач, с коэффициентами успеха около 80%. Кроме того, согласно метрике ОЭ, Мобильный-Агент демонстрирует эффективность на уровне 80% при выполнении операций на уровне, сравнимом с человеческой оптимальностью. Эти результаты в совокупности подчеркивают профессионализм Мобильного-Агента как мобильного устройства-помощника.

Следующее изображение иллюстрирует способность Мобильного-Агента понимать команды пользователя и независимо планировать свои действия. Даже в отсутствие явных деталей операций в инструкциях, Мобильный-Агент умело интерпретировал потребности пользователя, преобразуя их в выполнимые задачи. Следуя этому пониманию, агент выполнил инструкции через системный процесс планирования.

Окончательные Мысли

В этой статье мы говорили о Мобильных-Агентах, мультимодальном автономном устройстве-агенте, который первым использует возможность визуального восприятия для точного определения и локализации визуальных и текстовых элементов на интерфейсе мобильного приложения. С учетом этого контекста визуального восприятия, рамка Мобильного-Агента планирует и разбивает сложные операции на управляемые действия, плавно перемещаясь через мобильные приложения шаг за шагом. Этот рамка отличается от существующих решений, поскольку он не полагается на метаданные мобильной системы или файлы XML мобильных приложений, обеспечивая большую гибкость в различных мобильных операционных системах с фокусом на визуально-центрированной обработке. Стратегия, используемая рамкой Мобильного-Агента, исключает необходимость системных адаптаций, что приводит к повышению эффективности и снижению вычислительных требований.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.