Modelos y plataformas de IA

Presentando SAM 2: El nuevo modelo de código abierto de Meta para la segmentación de objetos en tiempo real en imágenes y videos

mm
Añade Unite.AI a tus fuentes preferidas en Google

En los últimos años, el mundo de la inteligencia artificial ha experimentado avances notables en la procesamiento de texto, con logros que han transformado industrias desde el servicio al cliente hasta el análisis legal. Sin embargo, cuando se trata de procesamiento de imágenes, apenas estamos arañando la superficie. La complejidad de los datos visuales y los desafíos de entrenar modelos para interpretar y analizar imágenes con precisión han presentado obstáculos significativos. A medida que los investigadores continúan explorando la inteligencia artificial para imágenes y videos, el futuro del procesamiento de imágenes en la inteligencia artificial tiene el potencial de innovar en áreas como la atención médica, los vehículos autónomos y más allá.

La segmentación de objetos, que implica identificar los píxeles exactos en una imagen que corresponden a un objeto de interés, es una tarea crítica en la visión por computadora. Tradicionalmente, esto ha involucrado la creación de modelos de inteligencia artificial especializados, lo que requiere una infraestructura extensa y grandes cantidades de datos anotados. El año pasado, Meta presentó el Modelo de Segmentación de Cualquier Cosa (SAM), un modelo de inteligencia artificial que simplifica este proceso permitiendo a los usuarios segmentar imágenes con una simple solicitud. Esta innovación redujo la necesidad de experiencia especializada y recursos informáticos extensos, lo que hizo que la segmentación de imágenes sea más accesible.

Ahora, Meta está llevando esto un paso más allá con SAM 2. Esta nueva iteración no solo mejora las capacidades de segmentación de imágenes de SAM, sino que también las extiende a la procesamiento de videos. SAM 2 puede segmentar cualquier objeto en imágenes y videos, incluso aquellos que no ha encontrado antes. Este avance es un salto adelante en el ámbito de la visión por computadora y el procesamiento de imágenes, proporcionando una herramienta más versátil y poderosa para analizar contenido visual. A continuación, exploramos los emocionantes avances de SAM 2 y su potencial para redefinir el campo de la visión por computadora.

Presentando el Modelo de Segmentación de Cualquier Cosa (SAM)

Los métodos de segmentación tradicionales requieren una refinación manual, conocida como segmentación interactiva, o grandes cantidades de datos anotados para la segmentación automática en categorías predefinidas. SAM es un modelo de inteligencia artificial que admite la segmentación interactiva utilizando solicitudes versátiles como clics, cuadros o entradas de texto. También se puede ajustar con datos mínimos y recursos informáticos para la segmentación automática. Entrenado con más de 1.000 millones de anotaciones de imágenes diversas, SAM puede manejar nuevos objetos y imágenes sin necesidad de recopilación de datos personalizados o ajuste.

SAM funciona con dos componentes principales: un codificador de imágenes que procesa la imagen y un codificador de solicitudes que maneja entradas como clics o texto. Estos componentes se combinan con un decodificador ligero para predecir máscaras de segmentación. Una vez que se procesa la imagen, SAM puede crear un segmento en solo 50 milisegundos en un navegador web, lo que lo convierte en una herramienta poderosa para tareas interactivas en tiempo real. Para construir SAM, los investigadores desarrollaron un proceso de recopilación de datos de tres pasos: anotación asistida por modelo, una combinación de anotación automática y asistida, y creación automática de máscaras. Este proceso dio como resultado el conjunto de datos SA-1B, que incluye más de 1.100 millones de máscaras en 11 millones de imágenes con licencia y preservación de la privacidad, lo que lo hace 400 veces más grande que cualquier conjunto de datos existente. El rendimiento impresionante de SAM se debe a este conjunto de datos extenso y diverso, lo que garantiza una mejor representación en diversas regiones geográficas en comparación con conjuntos de datos anteriores.

Presentando SAM 2: Un salto de la segmentación de imágenes a la segmentación de videos

Basándose en la base de SAM, SAM 2 está diseñado para la segmentación de objetos en tiempo real y con solicitudes en imágenes y videos. A diferencia de SAM, que se centra únicamente en imágenes estáticas, SAM 2 procesa videos tratando cada cuadro como parte de una secuencia continua. Esto permite a SAM 2 manejar escenas dinámicas y contenido cambiante de manera más efectiva. Para la segmentación de imágenes, SAM 2 no solo mejora las capacidades de SAM, sino que también opera tres veces más rápido en tareas interactivas.

SAM 2 conserva la misma arquitectura que SAM, pero introduce un mecanismo de memoria para el procesamiento de videos. Esta característica permite a SAM 2 mantener un registro de información de cuadros anteriores, lo que garantiza una segmentación de objetos coherente a pesar de los cambios en el movimiento, la iluminación o la occlusión. Al hacer referencia a cuadros anteriores, SAM 2 puede refinar sus predicciones de máscaras a lo largo del video.

El modelo se entrena con un conjunto de datos recién desarrollado, SA-V dataset, que incluye más de 600.000 anotaciones de máscaras en 51.000 videos de 47 países. Este conjunto de datos diverso cubre tanto objetos completos como partes de ellos, lo que mejora la precisión de SAM 2 en la segmentación de videos del mundo real.

SAM 2 está disponible como un modelo de código abierto bajo la licencia Apache 2.0, lo que lo hace accesible para diversos usos. Meta también ha compartido el conjunto de datos utilizado para SAM 2 bajo una licencia CC BY 4.0. Además, hay una demostración basada en web que permite a los usuarios explorar el modelo y ver cómo funciona.

Casos de uso potenciales

Las capacidades de SAM 2 en la segmentación de objetos en tiempo real y con solicitudes para imágenes y videos han desbloqueado numerosas aplicaciones innovadoras en diferentes campos. Por ejemplo, algunas de estas aplicaciones son las siguientes:

  • Diagnósticos de atención médica: SAM 2 puede mejorar significativamente la asistencia quirúrgica en tiempo real segmentando estructuras anatómicas e identificando anomalías durante las transmisiones en vivo en el quirófano. También puede mejorar el análisis de imágenes médicas proporcionando una segmentación precisa de órganos o tumores en exploraciones médicas.
  • Vehículos autónomos: SAM 2 puede mejorar los sistemas de vehículos autónomos mediante la detección de objetos con mayor precisión a través de la segmentación y seguimiento continuo de peatones, vehículos y señales de tráfico en cuadros de video. Su capacidad para manejar escenas dinámicas también apoya sistemas de navegación adaptativa y evasión de colisiones al reconocer y responder a cambios ambientales en tiempo real.
  • Medios interactivos y entretenimiento: SAM 2 puede mejorar las aplicaciones de realidad aumentada (AR) segmentando objetos en tiempo real, lo que facilita la integración de elementos virtuales con el mundo real. También beneficia la edición de video al automatizar la segmentación de objetos en metraje, lo que simplifica procesos como la eliminación de fondo y el reemplazo de objetos.
  • Monitoreo ambiental: SAM 2 puede ayudar en el seguimiento de la vida silvestre segmentando y monitoreando animales en metraje de video, lo que apoya la investigación de especies y los estudios de hábitat. En la respuesta a desastres, puede evaluar daños y guiar esfuerzos de respuesta al segmentar y identificar áreas y objetos afectados en transmisiones de video.
  • Minoristas y comercio electrónico: SAM 2 puede mejorar la visualización de productos en el comercio electrónico al permitir la segmentación interactiva de productos en imágenes y videos. Esto puede dar a los clientes la capacidad de ver artículos desde varios ángulos y contextos. Para el manejo de inventario, ayuda a los minoristas a rastrear y segmentar productos en estantes en tiempo real, lo que simplifica la toma de inventario y mejora el control general del inventario.

Superar las limitaciones de SAM 2: Soluciones prácticas y mejoras futuras

Aunque SAM 2 funciona bien con imágenes y videos cortos, tiene algunas limitaciones que deben considerarse para su uso práctico. Puede tener dificultades para rastrear objetos a través de cambios significativos de perspectiva, occlusiones largas o en escenas concurridas, especialmente en videos extendidos. La corrección manual con clics interactivos puede ayudar a abordar estos problemas.

En entornos concurridos con objetos que se parecen, SAM 2 podría ocasionalmente identificar mal los objetivos, pero solicitudes adicionales en cuadros posteriores pueden resolver esto. Aunque SAM 2 puede segmentar múltiples objetos, su eficiencia disminuye porque procesa cada objeto por separado. Actualizaciones futuras podrían beneficiarse de la integración de información contextual compartida para mejorar el rendimiento.

SAM 2 también puede perder detalles finos con objetos en movimiento rápido, y las predicciones pueden ser inestables en diferentes cuadros. Sin embargo, un entrenamiento adicional podría abordar esta limitación. Aunque la generación automática de anotaciones ha mejorado, los anotadores humanos siguen siendo necesarios para controles de calidad y selección de cuadros, y una mayor automatización podría mejorar la eficiencia.

En resumen

SAM 2 representa un avance significativo en la segmentación de objetos en tiempo real para imágenes y videos, basándose en la base establecida por su predecesor. Al mejorar las capacidades y extender la funcionalidad a contenido de video dinámico, SAM 2 promete transformar una variedad de campos, desde la atención médica y los vehículos autónomos hasta los medios interactivos y el comercio minorista. Aunque siguen existiendo desafíos, particularmente en el manejo de escenas complejas y concurridas, la naturaleza de código abierto de SAM 2 fomenta la mejora continua y la adaptación. Con su poderoso rendimiento y accesibilidad, SAM 2 está listo para impulsar la innovación y expandir las posibilidades en la visión por computadora y más allá.

El Dr. Tehseen Zia es un profesor asociado titular en la Universidad COMSATS de Islamabad, con un doctorado en Inteligencia Artificial de la Universidad Técnica de Viena, Austria. Especializado en Inteligencia Artificial, Aprendizaje Automático, Ciencia de Datos y Visión por Computadora, ha hecho contribuciones significativas con publicaciones en revistas científicas reputadas. El Dr. Tehseen también ha liderado varios proyectos industriales como investigador principal y ha servido como consultor de Inteligencia Artificial.