Modelos y plataformas de IA
YOLO-Mundo: Detección de Objetos en Tiempo Real con Vocabulario Abierto
La detección de objetos ha sido un desafío fundamental en la visión por computadora industry, con aplicaciones en robótica, comprensión de imágenes, vehículos autónomos y reconocimiento de imágenes. En los últimos años, el trabajo innovador en IA, particularmente a través de redes neuronales profundas, ha avanzado significativamente la detección de objetos. Sin embargo, estos modelos tienen un vocabulario fijo, limitado a detectar objetos dentro de las 80 categorías del conjunto de datos COCO. Esta limitación se debe al proceso de entrenamiento, donde los detectores de objetos se entrenan para reconocer solo categorías específicas, lo que limita su aplicabilidad.
Para superar esto, presentamos YOLO-Mundo, un enfoque innovador destinado a mejorar el marco YOLO (You Only Look Once) con capacidades de detección de vocabulario abierto. Esto se logra mediante el preentrenamiento del marco en conjuntos de datos a gran escala y la implementación de un enfoque de modelado de visión-lenguaje. En particular, YOLO-Mundo emplea una Red de Agregación de Caminos de Visión-Lenguaje Re-parametrizable (RepVL-PAN) y una pérdida contrastiva de región-texto para fomentar la interacción entre la información lingüística y visual. A través de RepVL-PAN y la pérdida contrastiva de región-texto, YOLO-Mundo puede detectar con precisión una amplia gama de objetos en un entorno de disparo cero, mostrando un rendimiento notable en tareas de segmentación y detección de objetos de vocabulario abierto.
Este artículo tiene como objetivo proporcionar una comprensión exhaustiva de los fundamentos técnicos de YOLO-Mundo, su arquitectura de modelo, proceso de entrenamiento y escenarios de aplicación. Vamos a sumergirnos.
YOLO-Mundo: Detección de Objetos en Tiempo Real con Vocabulario Abierto
YOLO o You Only Look Once es uno de los métodos más populares para la detección de objetos moderna dentro de la industria de visión por computadora. Renombrado por su increíble velocidad y eficiencia, la aparición del mecanismo YOLO ha revolucionado la forma en que las máquinas interpretan y detectan objetos específicos dentro de imágenes y videos en tiempo real. Los marcos de detección de objetos tradicionales implementan un enfoque de detección de objetos de dos pasos: en el primer paso, el marco propone regiones que pueden contener el objeto, y el marco clasifica el objeto en el siguiente paso. El marco YOLO, por otro lado, integra estos dos pasos en un solo modelo de red neuronal, un enfoque que permite al marco mirar la imagen solo una vez para predecir el objeto y su ubicación dentro de la imagen, y por lo tanto, el nombre YOLO o You Only Look Once.
Además, el marco YOLO trata la detección de objetos como un problema de regresión, y predice las probabilidades de clase y las cajas delimitadoras directamente desde la imagen completa en una sola mirada. La implementación de este método no solo aumenta la velocidad del proceso de detección, sino que también mejora la capacidad del modelo para generalizar desde datos complejos y diversos, lo que lo convierte en una opción adecuada para aplicaciones que operan en tiempo real, como conducción autónoma, detección de velocidad o reconocimiento de matrículas. Además, el avance significativo de las redes neuronales profundas en los últimos años también ha contribuido significativamente al desarrollo de marcos de detección de objetos, pero el éxito de los marcos de detección de objetos todavía está limitado, ya que solo pueden detectar objetos con un vocabulario limitado. Esto se debe principalmente a que, una vez que se definen y etiquetan las categorías de objetos en el conjunto de datos, los detectores de objetos entrenados en el marco solo pueden reconocer esas categorías específicas, lo que limita la aplicabilidad y la capacidad de implementar modelos de detección de objetos en escenarios de tiempo real y abierto.
Avanzando, los modelos de visión-lenguaje recientemente desarrollados emplean conocimientos de vocabulario destilados de codificadores de lenguaje para abordar la detección de vocabulario abierto. Aunque estos marcos funcionan mejor que los modelos de detección de objetos tradicionales en la detección de vocabulario abierto, todavía tienen una aplicabilidad limitada debido a la escasez de datos de entrenamiento con diversidad de vocabulario limitada. Además, los marcos seleccionados entrenan detectores de objetos de vocabulario abierto a gran escala y categorizan los detectores de objetos de entrenamiento como preentrenamiento de visión-lenguaje a nivel de región. Sin embargo, el enfoque todavía lucha para detectar objetos en tiempo real debido a dos razones principales: un proceso de implementación complejo para dispositivos de borde y requisitos computacionales pesados. Por el lado positivo, estos marcos han demostrado resultados positivos al preentrenar detectores grandes para emplearlos con capacidades de reconocimiento abierto.
El marco YOLO-Mundo tiene como objetivo lograr una detección de vocabulario abierto altamente eficiente, y explorar la posibilidad de enfoques de preentrenamiento a gran escala para mejorar la eficiencia de los detectores de objetos YOLO tradicionales para la detección de objetos de vocabulario abierto. Contrariamente a los trabajos anteriores en detección de objetos, el marco YOLO-Mundo muestra una eficiencia notable con altas velocidades de inferencia, y puede implementarse en aplicaciones posteriores con facilidad. El modelo YOLO-Mundo sigue la arquitectura YOLO tradicional y codifica textos de entrada aprovechando las capacidades de un codificador de texto CLIP preentrenado. Además, el marco YOLO-Mundo incluye un componente de Red de Agregación de Caminos de Visión-Lenguaje Re-parametrizable (RepVL-PAN) en su arquitectura para conectar características de imagen y texto para representaciones visuales-semánticas mejoradas. Durante la fase de inferencia, el marco elimina el codificador de texto y re-parametriza las incrustaciones de texto en pesos de RepVL-PAN, lo que resulta en una implementación eficiente. El marco también incluye aprendizaje contrastivo de región-texto en su marco para estudiar métodos de preentrenamiento de vocabulario abierto para los modelos YOLO tradicionales. El método de aprendizaje contrastivo de región-texto unifica datos de imagen-texto, datos de anclaje y datos de detección en pares de región-texto. Basándose en esto, el marco YOLO-Mundo preentrenado en pares de región-texto demuestra capacidades notables para la detección de vocabulario grande y abierto. Además, el marco YOLO-Mundo también explora un paradigma de “prompt-then-detect” con el objetivo de mejorar la eficiencia de la detección de objetos de vocabulario abierto en escenarios de tiempo real y del mundo real.
Como se muestra en la siguiente imagen, los detectores de objetos tradicionales se centran en un conjunto cerrado de detección de vocabulario fijo con categorías predefinidas, mientras que los detectores de vocabulario abierto detectan objetos codificando las promociones del usuario con codificadores de texto para vocabulario abierto. En comparación, el enfoque “prompt-then-detect” de YOLO-Mundo primero construye un vocabulario fuera de línea (vocabulario variable para necesidades variables) codificando las promociones del usuario, lo que permite a los detectores interpretar el vocabulario fuera de línea en tiempo real sin tener que volver a codificar las promociones.

YOLO-Mundo: Método y Arquitectura
Pares de Región-Texto
Tradicionalmente, los marcos de detección de objetos, incluyendo la familia de detectores de objetos YOLO, se entrenan utilizando anotaciones de instancias que contienen etiquetas de categoría y cajas delimitadoras. En contraste, el marco YOLO-Mundo reformula las anotaciones de instancias como pares de región-texto, donde el texto puede ser la descripción del objeto, frases nominales o nombre de categoría. Es importante destacar que el marco YOLO-Mundo adopta tanto textos como imágenes como entrada y salida cajas predichas con sus incrustaciones de objeto correspondientes.
Arquitectura del Modelo
En su núcleo, el modelo YOLO-Mundo consiste en un Codificador de Texto, un detector YOLO y el componente de Red de Agregación de Caminos de Visión-Lenguaje Re-parametrizable (RepVL-PAN), como se ilustra en la siguiente imagen.

Para un texto de entrada, el componente del codificador de texto codifica el texto en incrustaciones de texto, seguido de la extracción de características multi-escala de la imagen de entrada por los detectores de imagen en el componente del detector YOLO. El componente de Red de Agregación de Caminos de Visión-Lenguaje Re-parametrizable (RepVL-PAN) explota entonces la fusión cruzada de modalidad entre las incrustaciones de texto y las características para mejorar las representaciones de texto e imagen.
Detector YOLO
El modelo YOLO-Mundo se basa en el marco YOLOv8 existente, que contiene un componente de backbone Darknet como codificador de imagen, una cabeza para incrustaciones de objeto y regresión de caja delimitadora, y una Red de Agregación de Caminos (PAN) para pirámides de características multi-escala.
Codificador de Texto
Para un texto dado, el modelo YOLO-Mundo extrae las incrustaciones de texto correspondientes adoptando un codificador de texto Transformer CLIP preentrenado con un cierto número de sustantivos y dimensión de incrustación. La razón principal por la que el marco YOLO-Mundo adopta un codificador de texto CLIP es que ofrece un mejor rendimiento visual-semántico para conectar textos con objetos visuales, superando significativamente a los codificadores de lenguaje tradicionales solo texto. Sin embargo, si el texto de entrada es una leyenda o una expresión de referencia, el modelo YOLO-Mundo opta por un algoritmo de n-gramas más simple para extraer las frases. Estas frases se alimentan entonces al codificador de texto.
Cabeza de Contraste de Texto
La cabeza desacoplada es un componente utilizado por modelos de detección de objetos anteriores, y el marco YOLO-Mundo adopta una cabeza desacoplada con convoluciones duales 3×3 para regresar incrustaciones de objeto y cajas delimitadoras para un número fijo de objetos. El marco YOLO-Mundo emplea una cabeza de contraste de texto para obtener la similitud objeto-texto utilizando el enfoque de normalización L2 y las incrustaciones de texto. Además, el modelo YOLO-Mundo también emplea el enfoque de transformación afín con un factor de desplazamiento y un factor de escalado aprendible, con la normalización L2 y la transformación afín mejorando la estabilidad del modelo durante el entrenamiento de región-texto.
Entrenamiento de Vocabulario en Línea
Durante la fase de entrenamiento, el modelo YOLO-Mundo construye un vocabulario en línea para cada muestra de mosaico que consiste en 4 imágenes cada una. El modelo muestrea todos los sustantivos positivos incluidos en las imágenes de mosaico y muestrea algunos sustantivos negativos aleatoriamente del conjunto de datos correspondiente. El vocabulario para cada muestra consiste en un máximo de n sustantivos, con un valor predeterminado de 80.
Inferencia de Vocabulario Fuera de Línea
Durante la inferencia, el modelo YOLO-Mundo presenta una estrategia de “prompt-then-detect” con vocabulario fuera de línea para mejorar aún más la eficiencia del modelo. El usuario define primero una serie de promociones personalizadas que pueden incluir categorías o incluso leyendas. El modelo YOLO-Mundo obtiene entonces incrustaciones de vocabulario fuera de línea utilizando el codificador de texto para codificar estas promociones. Como resultado, el vocabulario fuera de línea para la inferencia ayuda al modelo a evitar cálculos para cada entrada y también permite al modelo ajustar el vocabulario de manera flexible según las necesidades.
Red de Agregación de Caminos de Visión-Lenguaje Re-parametrizable (RevVL-PAN)
La siguiente figura ilustra la estructura de la Red de Agregación de Caminos de Visión-Lenguaje Re-parametrizable propuesta, que sigue los caminos de arriba hacia abajo y de abajo hacia arriba para establecer la pirámide de características multi-escala.

Para mejorar la interacción entre las características de texto e imagen, el modelo YOLO-Mundo propone una Atención de Agrupación de Imagen y una Capa de CSPL (Cross-Stage Partial Layers) guiada por texto, con el objetivo final de mejorar las representaciones visuales-semánticas para capacidades de vocabulario abierto. Durante la inferencia, el modelo YOLO-Mundo re-parametriza las incrustaciones de vocabulario fuera de línea en los pesos de las capas lineales o convolucionales para una implementación efectiva.
Como se puede ver en la figura anterior, el modelo YOLO-Mundo utiliza la Capa de CSPL después de la fusión de arriba hacia abajo o de abajo hacia arriba, e incorpora la guía de texto en las características de imagen multi-escala, formando la Capa de CSPL guiada por texto, extendiendo así la Capa de CSPL. Para cualquier característica de imagen dada y su incrustación de texto correspondiente, el modelo adopta la atención de sigmoid máximo después del último bloque de cuello para agregar características de texto en las características de imagen. La característica de imagen actualizada se concatena entonces con las características de etapa cruzada y se presenta como la salida.
Avanzando, el modelo YOLO-Mundo agrega características de imagen para actualizar la incrustación de texto introduciendo la Capa de Atención de Agrupación de Imagen para mejorar las incrustaciones de texto con información consciente de la imagen. En lugar de utilizar la atención cruzada directamente en las características de imagen, el modelo aprovecha el agrupamiento máximo en características multi-escala para obtener 3×3 regiones, lo que resulta en 27 tokens de parche, con el modelo actualizando las incrustaciones de texto en el siguiente paso.
Esquemas de Preentrenamiento
El modelo YOLO-Mundo sigue dos esquemas de preentrenamiento principales: Aprendizaje de la Pérdida de Contraste de Región-Texto y Etiquetado de Pseudo con Datos de Imagen-Texto. Para el esquema de preentrenamiento principal, el modelo produce predicciones de objeto junto con anotaciones para un texto y muestras de mosaico dados. El marco YOLO-Mundo coincide con las predicciones con anotaciones de verdad de tierra siguiendo y aprovechando la asignación de etiquetas de tarea, y asigna predicciones individuales positivas con un índice de texto que sirve como la etiqueta de clasificación. Por otro lado, el esquema de preentrenamiento de Etiquetado de Pseudo con Datos de Imagen-Texto propone utilizar un enfoque de etiquetado automatizado en lugar de utilizar pares de imagen-texto para generar pares de región-texto. El enfoque de etiquetado propuesto consiste en tres pasos: extracción de frases nominales, etiquetado de pseudo y filtrado. El primer paso utiliza el algoritmo de n-gramas para extraer frases nominales del texto de entrada, el segundo paso adopta un detector de vocabulario abierto preentrenado para generar cajas de pseudo para la frase nominal dada para imágenes individuales, mientras que el tercer y último paso emplea un marco CLIP preentrenado para evaluar la relevancia de los pares de región-texto y texto-imagen, después de lo cual el modelo filtra imágenes y anotaciones de baja relevancia.
YOLO-Mundo: Resultados
Una vez que el modelo YOLO-Mundo ha sido preentrenado, se evalúa directamente en el conjunto de datos LVIS en un entorno de disparo cero, con el conjunto de datos LVIS que consiste en más de 1200 categorías, significativamente más que los conjuntos de datos de preentrenamiento utilizados por los marcos existentes para probar su rendimiento en la detección de vocabulario grande. La siguiente figura demuestra el rendimiento del marco YOLO-Mundo con algunos de los marcos de detección de objetos actuales en el conjunto de datos LVIS en un entorno de disparo cero.

Como se puede observar, el marco YOLO-Mundo supera a la mayoría de los marcos existentes en términos de velocidades de inferencia y rendimiento de disparo cero, incluso con marcos como Grounding DINO, GLIP y GLIPv2 que incorporan más datos. En general, los resultados demuestran que los modelos de detección de objetos pequeños como YOLO-Mundo-S con solo 13 millones de parámetros pueden utilizarse para el preentrenamiento en tareas de visión-lenguaje con capacidades de vocabulario abierto notables.
Pensamientos Finales
En este artículo, hemos hablado sobre YOLO-Mundo, un enfoque innovador que apunta a mejorar las capacidades del marco YOLO o You Only Look Once con capacidades de detección de vocabulario abierto mediante el preentrenamiento del marco en conjuntos de datos a gran escala y la implementación del enfoque de modelado de visión-lenguaje. Para ser más específicos, el marco YOLO-Mundo propone implementar una Red de Agregación de Caminos de Visión-Lenguaje Re-parametrizable (RepVL-PAN) junto con la pérdida de contraste de región-texto para facilitar la interacción entre la información lingüística y visual. Al implementar RepVL-PAN y la pérdida de contraste de región-texto, el marco YOLO-Mundo puede detectar con precisión una amplia gama de objetos en un entorno de disparo cero, mostrando un rendimiento notable en tareas de segmentación y detección de objetos de vocabulario abierto.












