Modelos y plataformas de IA
Transformadores de Visión Superan Desafíos con Nuevo Método de ‘Atención de Cluster a Patch’
Las tecnologías de inteligencia artificial (IA), particularmente los Transformadores de Visión (ViTs), han demostrado un gran potencial en su capacidad para identificar y categorizar objetos en imágenes. Sin embargo, su aplicación práctica ha sido limitada por dos desafíos importantes: los altos requisitos de potencia computacional y la falta de transparencia en la toma de decisiones. Ahora, un grupo de investigadores ha desarrollado una solución innovadora: una nueva metodología conocida como “Atención de Cluster a Patch” (PaCa). PaCa tiene como objetivo mejorar las capacidades de los ViTs en la identificación, clasificación y segmentación de objetos en imágenes, al mismo tiempo que resuelve los problemas de larga data de los requisitos computacionales y la claridad en la toma de decisiones.
Abordando los Desafíos de los ViTs: Un Vistazo a la Nueva Solución
Los Transformadores, debido a sus capacidades superiores, son uno de los modelos más influyentes en el mundo de la IA. El poder de estos modelos se ha extendido a los datos visuales a través de los ViTs, una clase de transformadores que se entrenan con entradas visuales. A pesar del gran potencial que ofrecen los ViTs en la interpretación y comprensión de imágenes, han sido frenados por un par de problemas importantes.
Primero, debido a la naturaleza de las imágenes que contienen grandes cantidades de datos, los ViTs requieren una gran potencia computacional y memoria. Esta complejidad puede ser abrumadora para muchos sistemas, especialmente cuando se manejan imágenes de alta resolución. Segundo, el proceso de toma de decisiones dentro de los ViTs es a menudo confuso y opaco. Los usuarios encuentran difícil comprender cómo los ViTs diferencian entre varios objetos o características en una imagen, lo que es crucial para numerosas aplicaciones.
Sin embargo, la innovadora metodología PaCa ofrece una solución a ambos desafíos. “Abordamos el desafío relacionado con los requisitos computacionales y de memoria utilizando técnicas de clustering, que permiten a la arquitectura del transformador identificar y enfocarse mejor en los objetos de una imagen”, explica Tianfu Wu, autor correspondiente de un artículo sobre el trabajo y profesor asociado de Ingeniería Eléctrica y Computacional en la Universidad Estatal de Carolina del Norte.
El uso de técnicas de clustering en PaCa reduce drásticamente los requisitos computacionales, convirtiendo el problema de un proceso cuadrático en uno lineal manejable. Wu explica el proceso: “Al clusterizar, podemos convertir este proceso en lineal, donde cada unidad más pequeña solo necesita ser comparada con un número predeterminado de clusters”.
El clustering también sirve para aclarar el proceso de toma de decisiones en los ViTs. El proceso de formar clusters revela cómo el ViT decide qué características son importantes para agrupar secciones de los datos de la imagen. Como el AI solo crea un número limitado de clusters, los usuarios pueden comprender y examinar fácilmente el proceso de toma de decisiones, mejorando significativamente la interpretación del modelo.
Metodología PaCa Superó a Otros ViTs de Última Generación
A través de pruebas exhaustivas, los investigadores encontraron que la metodología PaCa superó a otros ViTs en varios frentes. Wu explica: “Encontramos que PaCa superó a SWin y PVT en todos los aspectos”. El proceso de prueba reveló que PaCa destacó en la clasificación y identificación de objetos en imágenes y segmentación, delineando eficientemente los límites de los objetos en las imágenes. Además, se encontró que era más eficiente en términos de tiempo, realizando tareas más rápidamente que otros ViTs.
Animados por el éxito de PaCa, el equipo de investigación busca desarrollarlo aún más entrenándolo con conjuntos de datos fundamentales más grandes. Al hacerlo, esperan empujar los límites de lo que es posible actualmente con la IA basada en imágenes.
El artículo de investigación, “PaCa-ViT: Aprendiendo Atención de Cluster a Patch en Transformadores de Visión“, se presentará en la próxima Conferencia IEEE/CVF sobre Visión por Computadora y Reconocimiento de Patrones. Es un hito importante que podría allanar el camino para sistemas de IA más eficientes, transparentes y accesibles.












