Modelos y plataformas de IA

Agentes Móviles: Agente Autónomo Multi-modal de Dispositivo Móvil con Percepción Visual

mm
Añade Unite.AI a tus fuentes preferidas en Google

La llegada de los Modelos de Lenguaje Grande Multimodal (MLLM) ha inaugurado una nueva era de agentes de dispositivos móviles, capaces de entender y interactuar con el mundo a través de texto, imágenes y voz. Estos agentes marcan un avance significativo sobre la inteligencia artificial tradicional, proporcionando una forma más rica y intuitiva para que los usuarios interactúen con sus dispositivos. Al aprovechar los MLLM, estos agentes pueden procesar y sintetizar vastas cantidades de información de diversas modalidades, lo que les permite ofrecer asistencia personalizada y mejorar las experiencias del usuario de maneras anteriormente inimaginables.

Estos agentes están impulsados por técnicas de aprendizaje automático de última generación y capacidades avanzadas de procesamiento de lenguaje natural, lo que les permite entender y generar texto similar al humano, así como interpretar datos visuales y auditivos con notable precisión. Desde reconocer objetos y escenas en imágenes hasta entender comandos hablados y analizar el sentimiento del texto, estos agentes multimodales están equipados para manejar una amplia gama de entradas de manera fluida. El potencial de esta tecnología es vasto, ofreciendo servicios más sofisticados y contextualmente conscientes, como asistentes virtuales sintonizados con las emociones humanas y herramientas educativas que se adaptan a los estilos de aprendizaje individuales. También tienen el potencial de revolucionar la accesibilidad, haciendo que la tecnología sea más accesible a través de barreras lingüísticas y sensoriales.

En este artículo, hablaremos sobre los Agentes Móviles, un agente autónomo multi-modal de dispositivo que primero aprovecha la capacidad de las herramientas de percepción visual para identificar y localizar los elementos visuales y textuales con precisión en la interfaz de usuario de una aplicación móvil. Utilizando este contexto de visión percibida, el marco de trabajo del Agente Móvil planifica y descompone la tarea compleja de manera autónoma, y navega a través de las aplicaciones móviles mediante operaciones paso a paso. El marco de trabajo del Agente Móvil se diferencia de las soluciones existentes ya que no depende de los metadatos del sistema móvil o de los archivos XML de las aplicaciones móviles, lo que permite una mayor adaptabilidad en diversos entornos de operación móvil de manera centrada en la visión. El enfoque seguido por el marco de trabajo del Agente Móvil elimina la necesidad de personalizaciones específicas del sistema, lo que resulta en un mejor rendimiento y menor demanda computacional.

Agentes Móviles: Agente Autónomo Multi-modal de Dispositivo Móvil

En el mundo rápido de la tecnología móvil, un concepto pionero emerge como destacado: los Modelos de Lenguaje Grande, especialmente los Modelos de Lenguaje Grande Multimodal o MLLM, capaces de generar una amplia variedad de texto, imágenes, videos y habla en diferentes idiomas. El rápido desarrollo de los marcos de trabajo MLLM en los últimos años ha dado lugar a una nueva y poderosa aplicación de los MLLM: los agentes móviles autónomos. Los agentes móviles autónomos son entidades de software que actúan, se mueven y funcionan de manera independiente, sin necesidad de comandos humanos directos, diseñados para atravesar redes o dispositivos para realizar tareas, recopilar información o resolver problemas.

Los Agentes Móviles están diseñados para operar el dispositivo móvil del usuario en función de las instrucciones del usuario y los visuales de la pantalla, una tarea que requiere que los agentes posean tanto comprensión semántica como capacidades de percepción visual. Sin embargo, los agentes móviles existentes están lejos de ser perfectos, ya que se basan en modelos de lenguaje grande multimodal, y incluso el estado actual de los marcos de trabajo MLLM, incluyendo GPT-4V, carecen de capacidades de percepción visual necesarias para servir como un agente móvil eficiente. Además, aunque los marcos de trabajo existentes pueden generar operaciones efectivas, luchan por localizar la posición de estas operaciones con precisión en la pantalla, lo que limita las aplicaciones y la capacidad de los agentes móviles para operar en dispositivos móviles.

Para abordar este problema, algunos marcos de trabajo optaron por aprovechar los archivos de diseño de la interfaz de usuario para asistir a GPT-4V o a otros MLLM con capacidades de localización, con algunos marcos de trabajo que logran extraer posiciones de acción en la pantalla accediendo a los archivos XML de la aplicación, mientras que otros marcos de trabajo optaron por utilizar el código HTML de las aplicaciones web. Como se puede ver, la mayoría de estos marcos de trabajo dependen del acceso a archivos subyacentes y locales de la aplicación, lo que hace que el método sea casi ineficaz si el marco de trabajo no puede acceder a estos archivos. Para abordar este problema y eliminar la dependencia de los agentes locales de los métodos de localización subyacentes, los desarrolladores han trabajado en el Agente Móvil, un agente móvil autónomo con impresionantes capacidades de percepción visual. Utilizando su módulo de percepción visual, el marco de trabajo del Agente Móvil utiliza capturas de pantalla del dispositivo móvil para localizar operaciones con precisión. El módulo de percepción visual alberga modelos de OCR y detección que son responsables de identificar texto dentro de la pantalla y describir el contenido dentro de una región específica de la pantalla del dispositivo móvil. El marco de trabajo del Agente Móvil emplea instrucciones cuidadosamente elaboradas y facilita una interacción eficiente entre las herramientas y los agentes, automatizando así las operaciones del dispositivo móvil.

Además, el marco de trabajo del Agente Móvil tiene como objetivo aprovechar las capacidades contextuales de los marcos de trabajo MLLM de última generación, como GPT-4V, para lograr capacidades de auto-planificación que permitan al modelo planificar tareas en función de la historia de operaciones, las instrucciones del usuario y las capturas de pantalla de manera holística. Para mejorar aún más la capacidad del agente para identificar instrucciones incompletas y operaciones incorrectas, el marco de trabajo del Agente Móvil introduce un método de auto-reflexión. Bajo la guía de instrucciones cuidadosamente elaboradas, el agente reflexiona sobre operaciones incorrectas e inválidas de manera consistente, y detiene las operaciones una vez que la tarea o instrucción ha sido completada.

En general, las contribuciones del marco de trabajo del Agente Móvil se pueden resumir de la siguiente manera:

  1. El Agente Móvil actúa como un agente autónomo de dispositivo móvil, utilizando herramientas de percepción visual para llevar a cabo la localización de operaciones. Planifica cada paso de manera metódica y se involucra en la introspección. Notablemente, el Agente Móvil depende exclusivamente de capturas de pantalla del dispositivo, sin el uso de ningún código del sistema, lo que muestra una solución que se basa únicamente en técnicas de visión.
  2. El Agente Móvil introduce Mobile-Eval, una referencia diseñada para evaluar a los agentes de dispositivos móviles. Esta referencia incluye una variedad de las 10 aplicaciones móviles más comúnmente utilizadas, junto con instrucciones inteligentes para estas aplicaciones, categorizadas en tres niveles de dificultad.

Agente Móvil: Arquitectura y Metodología

En su núcleo, el marco de trabajo del Agente Móvil consiste en un Modelo de Lenguaje Grande Multimodal (MLLM) de última generación, el GPT-4V, un módulo de detección de texto utilizado para tareas de localización de texto. Junto con GPT-4V, el Agente Móvil también emplea un módulo de detección de iconos para la localización de iconos.

Percepción Visual

Como se mencionó anteriormente, el MLLM GPT-4V entrega resultados satisfactorios para instrucciones y capturas de pantalla, pero no logra output la ubicación de manera efectiva donde se llevan a cabo las operaciones. Debido a esta limitación, el marco de trabajo del Agente Móvil que implementa el modelo GPT-4V necesita depender de herramientas externas para ayudar con la localización de operaciones, facilitando así la salida de las operaciones en la pantalla del dispositivo móvil.

Localización de Texto

El marco de trabajo del Agente Móvil implementa una herramienta de OCR para detectar la posición del texto correspondiente en la pantalla cada vez que el agente necesita hacer clic en un texto específico que se muestra en la pantalla del dispositivo móvil. Hay tres escenarios únicos de localización de texto.

Escenario 1: No se detecta texto especificado

Problema: La herramienta de OCR no logra detectar el texto especificado, lo que puede ocurrir en imágenes complejas o debido a limitaciones de la herramienta de OCR.

Respuesta: Instruir al agente para que:

  • Vuelva a seleccionar el texto para hacer clic, lo que permite una corrección manual del error de la herramienta de OCR, o
  • Elija una operación alternativa, como utilizar un método de entrada diferente o realizar otra acción relevante para la tarea en cuestión.

Razonamiento: Esta flexibilidad es necesaria para gestionar las posibles inexactitudes o alucinaciones de GPT-4V, asegurando que el agente pueda seguir adelante de manera efectiva.

Escenario 2: Se detecta una instancia única de texto especificado

Operación: Generar automáticamente una acción para hacer clic en las coordenadas centrales de la caja de texto detectada.

Justificación: Con solo una instancia detectada, es alta la probabilidad de identificación correcta, lo que hace que sea eficiente proceder con una acción directa.

Escenario 3: Se detectan múltiples instancias de texto especificado

Evaluación: Primero, evalúe el número de instancias detectadas:

Múltiples instancias: Indica una pantalla llena de contenido similar, lo que complica la selección.

Acción: Solicitar al agente que vuelva a seleccionar el texto, con el fin de refinar la selección o ajustar los parámetros de búsqueda.

Pocas instancias: Un número manejable de detecciones permite un enfoque más matizado.

Acción: Recortar las regiones alrededor de estas instancias, expandiendo las cajas de texto de detección hacia afuera para capturar más contexto. Esta expansión asegura que se preserve más información, ayudando en la toma de decisiones.

Siguiente paso: Dibujar cajas de detección en las imágenes recortadas y presentarlas al agente. Esta ayuda visual asiste al agente en decidir con qué instancia interactuar, basándose en pistas contextuales o requisitos de la tarea.

Este enfoque estructurado optimiza la interacción entre los resultados de la herramienta de OCR y las operaciones del agente, mejorando la confiabilidad y la adaptabilidad del sistema en el manejo de tareas basadas en texto en varios escenarios. Todo el proceso se demuestra en la siguiente imagen.

Localización de Iconos

El marco de trabajo del Agente Móvil implementa una herramienta de detección de iconos para localizar la posición de un icono cuando el agente necesita hacer clic en él en la pantalla del dispositivo móvil. Para ser más específicos, el marco de trabajo primero solicita al agente que proporcione atributos específicos de la imagen, incluyendo forma y color, y luego el marco de trabajo implementa el método Grounding DINO con el icono de la instrucción para identificar todos los iconos contenidos en la captura de pantalla. Finalmente, el Agente Móvil emplea el marco de trabajo CLIP para calcular la similitud entre la descripción de la región de clic y los iconos eliminados, y selecciona la región con la mayor similitud para hacer clic.

Ejecución de Instrucciones

Para traducir las acciones en operaciones en la pantalla por parte de los agentes, el marco de trabajo del Agente Móvil define 8 operaciones diferentes.

  • Lanzar Aplicación (Nombre de la Aplicación): Iniciar la aplicación designada desde la interfaz de escritorio.
  • Hacer clic en Texto (Etiqueta de Texto): Interactuar con la parte de la pantalla que muestra la etiqueta “Etiqueta de Texto”.
  • Interactuar con Icono (Descripción del Icono, Ubicación): Apuntar y hacer clic en el área del icono especificada, donde “Descripción del Icono” detalla atributos como color y forma del icono. Elegir “Ubicación” de opciones como arriba, abajo, izquierda, derecha o centro, posiblemente combinando dos para una navegación precisa y reducir errores.
  • Introducir Texto (Texto de Entrada): Introducir el “Texto de Entrada” dado en el campo de texto activo.
  • Desplazarse hacia Arriba y Abajo: Navegar hacia arriba o hacia abajo a través del contenido de la página actual.
  • Volver Atrás: Regresar a la página vista anteriormente.
  • Cerrar: Regresar directamente al escritorio desde la pantalla actual.
  • Detener: Concluir la operación una vez que la tarea esté completada.

Auto-planificación

Cada paso de la operación se ejecuta de manera iterativa por el marco de trabajo, y antes del comienzo de cada iteración, el usuario debe proporcionar una instrucción de entrada, y el modelo del Agente Móvil utiliza la instrucción para generar una instrucción del sistema para todo el proceso. Además, antes del comienzo de cada iteración, el marco de trabajo captura una captura de pantalla y se la proporciona al agente. El agente entonces observa la captura de pantalla, la historia de operaciones y las instrucciones del sistema para output la siguiente acción de las operaciones.

Auto-reflexión

Durante sus operaciones, el agente puede enfrentar errores que le impiden ejecutar una instrucción con éxito. Para mejorar la tasa de cumplimiento de instrucciones, se ha implementado un enfoque de auto-evaluación, que se activa en dos circunstancias específicas. Inicialmente, si el agente ejecuta una acción defectuosa o inválida que detiene el progreso, como cuando reconoce que la captura de pantalla permanece sin cambios después de la operación o muestra una página incorrecta, se le dirigirá a considerar acciones alternativas o ajustar los parámetros de la operación existente. En segundo lugar, el agente puede perder algunos elementos de una instrucción compleja. Una vez que el agente ha ejecutado una serie de acciones basadas en su plan inicial, se le pedirá que revise la secuencia de acciones, la última captura de pantalla y la instrucción del usuario para evaluar si la tarea ha sido completada. Si se encuentran discrepancias, se le pedirá al agente que genere acciones nuevas de manera autónoma para cumplir con la instrucción.

Agente Móvil: Experimentos y Resultados

Para evaluar sus capacidades de manera integral, el marco de trabajo del Agente Móvil introduce la referencia Mobile-Eval, que consiste en 10 aplicaciones móviles comúnmente utilizadas, y diseña tres instrucciones para cada aplicación. La primera operación es directa y solo cubre operaciones básicas de la aplicación, mientras que la segunda operación es un poco más compleja que la primera, ya que tiene algunos requisitos adicionales. Finalmente, la tercera operación es la más compleja de todas, ya que contiene una instrucción abstracta del usuario sin especificar explícitamente qué aplicación usar o qué operación realizar.

A continuación, para evaluar el rendimiento desde diferentes perspectivas, el marco de trabajo del Agente Móvil diseña e implementa 4 métricas diferentes.

  • Éxito o Su: Si el agente móvil completa las instrucciones, se considera un éxito.
  • Puntuación de Proceso o PS: La métrica de Puntuación de Proceso mide la precisión de cada paso durante la ejecución de las instrucciones del usuario, y se calcula dividiendo el número de pasos correctos por el número total de pasos.
  • Eficiencia Relativa o ER: La puntuación de eficiencia relativa es una proporción o comparación entre el número de pasos que toma un humano para realizar la instrucción manualmente y el número de pasos que toma el agente para ejecutar la misma instrucción.
  • Tasa de Completitud o TC: La métrica de tasa de completitud divide el número de pasos operados por humanos que el marco de trabajo completa con éxito por el número total de pasos que toma un humano para completar la instrucción. El valor de TC es 1 cuando el agente completa la instrucción con éxito.

Los resultados se demuestran en la siguiente figura.

Inicialmente, para las tres tareas dadas, el Agente Móvil logró tasas de completitud del 91%, 82% y 82%, respectivamente. Aunque no todas las tareas se ejecutaron de manera impecable, las tasas de logro para cada categoría de tarea superaron el 90%. Además, la métrica PS revela que el Agente Móvil demuestra consistentemente una alta probabilidad de ejecutar acciones precisas para las tres tareas, con tasas de éxito alrededor del 80%. Además, según la métrica ER, el Agente Móvil exhibe una eficiencia del 80% en la realización de operaciones a un nivel comparable a la optimidad humana. Estos resultados en conjunto subrayan la competencia del Agente Móvil como asistente de dispositivo móvil.

La siguiente figura ilustra la capacidad del Agente Móvil para comprender las instrucciones del usuario y orquestar sus acciones de manera independiente. Incluso en ausencia de detalles de operación explícitos en las instrucciones, el Agente Móvil interpretó hábilmente las necesidades del usuario, convirtiéndolas en tareas realizables. Siguiendo esta comprensión, el agente ejecutó las instrucciones a través de un proceso de planificación sistemático.

Pensamientos Finales

En este artículo, hemos hablado sobre los Agentes Móviles, un agente autónomo multi-modal de dispositivo que inicialmente utiliza tecnologías de percepción visual para detectar y localizar con precisión tanto los componentes visuales como los textuales dentro de la interfaz de usuario de una aplicación móvil. Con este contexto visual en mente, el marco de trabajo del Agente Móvil planifica y descompone las tareas complejas de manera autónoma, y navega a través de las aplicaciones móviles mediante operaciones paso a paso. Este marco de trabajo se diferencia de las soluciones existentes ya que no depende de los metadatos del sistema móvil o de los archivos XML de las aplicaciones móviles, lo que facilita una mayor flexibilidad en diversos entornos de operación móvil con un enfoque en el procesamiento centrado en la visión. La estrategia empleada por el marco de trabajo del Agente Móvil elimina la necesidad de adaptaciones específicas del sistema, lo que conduce a una mayor eficiencia y menores demandas computacionales. El marco de trabajo del Agente Móvil obvia la necesidad de adaptaciones específicas del sistema, lo que lleva a una mayor eficiencia y menores demandas computacionales. La estrategia empleada por el marco de trabajo del Agente Móvil facilita una mayor flexibilidad en various entornos de operación móvil con un enfoque en el procesamiento centrado en la visión, lo que permite una mayor adaptabilidad en los archivos XML de las aplicaciones móviles, facilitando así una mayor flexibilidad en various entornos de operación móvil con un enfoque en el procesamiento centrado en la visión.

Un ingeniero por profesión, un escritor por corazón. Kunal es un escritor técnico con un profundo amor y comprensión de la IA y el ML, dedicado a simplificar conceptos complejos en estos campos a través de su documentación atractiva e informativa.