Modelos y plataformas de IA

Ferret: Referencia y Localización a Cualquier Granularidad

mm
Añade Unite.AI a tus fuentes preferidas en Google

Permitir la comprensión espacial en los modelos de aprendizaje de lenguaje y visión sigue siendo un desafío de investigación fundamental. Esta comprensión subyace a dos capacidades cruciales: la localización y la referencia. La referencia permite al modelo interpretar con precisión la semántica de regiones específicas, mientras que la localización implica el uso de descripciones semánticas para localizar estas regiones.

Los desarrolladores han presentado Ferret, un Modelo de Lenguaje Multimodal Grande (MLLM), capaz de comprender la referencia espacial en cualquier granularidad o forma en una imagen y localizar descripciones de vocabulario abierto con precisión. Ferret utiliza una representación híbrida innovadora que combina características continuas y coordenadas discretas para representar regiones de la imagen. Su muestreador visual espacialmente consciente maneja la variabilidad en la densidad de las formas, lo que le permite procesar diversas entradas de regiones como formas libres, rectángulos y puntos.

El enfoque de Ferret le permite destacarse en tareas clásicas de localización y referencia y superar a otros MLLM en comunicación multimodal que requiere localización y regiones. Este artículo explora la arquitectura y la metodología de Ferret, destacando su impresionante rendimiento en diversas tareas de lenguaje multimodal. Veamos esto más a fondo.

Ferret: Rendimiento Superior en Tareas de Referencia y Localización

La referencia en un modelo es una capacidad que permite al modelo comprender la semántica de regiones específicas dadas con precisión, mientras que la localización hace que sea esencial para el modelo utilizar las descripciones semánticas dadas para localizar las regiones. Aunque pueden diferir en sus tareas respectivas, tanto la referencia como la localización tienen el mismo concepto fundamental: la alineación de la semántica y la información espacial. Sin embargo, a pesar de compartir el mismo concepto, los modelos existentes aprenden la localización y la referencia de forma individual. Aunque el método funciona, plantea un obstáculo para lograr capacidades similares a las humanas, ya que los humanos pueden aprender de una tarea y aplicar los conocimientos a otras tareas de manera fluida y pueden integrar capacidades de localización y referencia con razonamiento y diálogo cotidiano sin esfuerzo. El marco de Ferret se inspira en la brecha mencionada en los marcos de MLLM existentes y estudia tres preguntas principales:

  1. ¿Cómo unificar las capacidades de localización y referencia en el marco, y cómo beneficiarán una a la otra?
  2. ¿Cómo representar las diversas regiones que los humanos utilizan para la referencia, como cajas, puntos, garabatos y formas libres?
  3. ¿Cómo hacer que la localización y la referencia sean robustas, sigan instrucciones y tengan un vocabulario abierto, lo que es crucial para sus aplicaciones prácticas y en tiempo real?

El marco de Ferret es un Modelo de Lenguaje Multimodal Grande innovador que intenta abordar estas preguntas. El marco de Ferret elige un Modelo de Lenguaje Multimodal Grande como su base debido a sus notables capacidades de comprensión de visión y lenguaje globales. Además, para unificar las capacidades de localización y referencia, el marco de Ferret representa las coordenadas de las regiones en forma numérica de lenguaje natural. Sin embargo, en la práctica, no es eficiente utilizar coordenadas de caja o incluso puntos para representar formas de regiones versátiles como garabatos, trazos o polígonos complejos, ya que estas formas son fundamentales para una precisión mejorada y una interacción humano-máquina más universal. Para abordar este problema, el marco de Ferret emplea un muestreador visual espacialmente consciente que adquiere las regiones visuales para regiones independientemente de la forma, lo que negocia con la variabilidad en la densidad de estas formas. El marco luego combina las características visuales continuas con coordenadas discretas para representar las regiones visuales en la entrada, lo que da como resultado la creación de una representación de región híbrida en Ferret.

El marco de Ferret utiliza los métodos anteriores para resolver la entrada que mezcla texto libre con regiones referenciadas y es capaz de generar suavemente las coordenadas para cada objeto que se puede localizar con el texto generado para localizar los objetos mencionados en la salida. Al hacerlo, Ferret es el primer marco que procesa regiones de entrada de forma libre en Modelos de Lenguaje Multimodal Grandes. Además, el marco de Ferret absorbe notables capacidades de localización y comprensión de vocabulario abierto, lo que permite al marco lograr un rendimiento superior cuando se evalúa en tareas de localización y referencia convencionales.

A continuación, el marco de Ferret busca inspiración en tres marcos de inteligencia artificial existentes, incluidos Modelos de Lenguaje Multimodal Grandes, MLLM para Referencia y Localización, y la Unificación de la Comprensión de Localización y Visión-Lenguaje.

La introducción de Modelos de Lenguaje Grande, incluidos GPT, DALL-E, PaLM, LLaMA y BLOOM, ha cambiado el panorama de la investigación en NLP, lo que ha llevado a avances significativos en los modelos de lenguaje multimodal. Los modelos de lenguaje multimodal anteriores se centraron principalmente en la generación de imagen-texto a gran escala, con algunos ejemplos notables como PaLI, SimVLM, GIT, BLIP-2, FLAMINGO, CM3 y PaLI-X. Sin embargo, desde que el marco de Flamingo logró una integración eficiente de LLM con un codificador de imagen CLIP preentrenado a través de bloques de atención cruzada, lo que resultó en notables capacidades de aprendizaje multimodal de pocos disparos. La investigación actual busca formas de utilizar modelos de lenguaje grande preentrenados para el ajuste de instrucciones visuales, con ejemplos notables como MiniGPT-4, Otter, InstructBLIP y más. Además, modelos recientes como Emu y GILL han demostrado un éxito notable en el uso de MLLM para la generación y recuperación de imágenes. El marco de Ferret también se refiere a investigaciones anteriores que se centran en la unificación de la salida de texto y caja delimitadora para Modelos de Lenguaje-Visión.

Ferret: Metodología y Arquitectura

Representaciones de Región Híbrida

Punto, caja y formas libres son los tres formatos dominantes que un modelo de lenguaje utiliza al referirse a regiones específicas. Por un lado, el punto y el formato de caja se pueden representar con precisión mediante coordenadas, pero mapear formas libres es un poco desafiante, ya que las formas libres son versátiles. Al ser versátiles, las formas libres pueden abarcar una amplia gama de regiones, incluidas máscaras, polígonos y garabatos. Utilizar coordenadas para describir formas libres es una tarea compleja que obstaculiza la capacidad del modelo para aprender a establecer una correlación entre las regiones y las coordenadas correspondientes. Además, el uso de coordenadas para formas libres es computacionalmente costoso y oscuro.

Para abordar este problema y generalizar en todos los formatos, el marco de Ferret propone una representación de región híbrida que combina características visuales continuas con coordenadas discretas para referirse a una región en particular.

Para las características visuales continuas, para una región dada, el marco de Ferret primero construye una máscara binaria 2D del mismo tamaño que la imagen y marca un valor 1 dentro de la región objetivo, mientras asigna un valor 0 fuera de la región. El modelo luego extrae la máscara binaria junto con la mapa de características de imagen extraído y luego la envía al muestreador visual espacialmente consciente.

Arquitectura

La arquitectura del modelo de Ferret consta de tres componentes principales

  1. Un codificador de imagen para extraer incrustaciones de imagen.
  2. Un muestreador visual espacialmente consciente para extraer características continuas regionales.
  3. Un Modelo de Lenguaje Grande para modelar texto, imagen y características de región de manera conjunta.

La imagen se alimenta primero al codificador visual preentrenado para extraer las incrustaciones de imagen. Para las entradas de texto, el marco primero utiliza un tokenizador de LLM preentrenado para tokenizar la secuencia de texto y luego proyecta estos tokens en incrustaciones de texto. Para regiones referenciadas, Ferret agrega un token especial y las coordenadas como un marcador de posición para características continuas después del nombre de la región. Si el nombre de la región es desconocido o es complejo de describir como resultado de la inclusión de varios objetos, el marco solo utiliza el nombre de la región o el área.

Uno de los principales desafíos al tratar con regiones referenciadas es que su forma puede ser muy variable, lo que significa que pueden tener diferentes formas y no se limitan solo a cajas rectangulares o puntos. Las regiones referenciadas con formas irregulares no se pueden procesar con métodos tradicionales como el procesamiento basado en cuadrícula, que incluye la atención de parches o técnicas de convolución. Para abordar este problema, el marco de Ferret propone un muestreador visual espacialmente consciente. Para un mapa de características extraído dado con una máscara binaria de región, el modelo de Ferret primero muestrea aleatoriamente N puntos dentro de la máscara binaria de región.

Para cada punto individual, el modelo obtiene su característica realizando una interpolación bilineal. Los N puntos se alimentan luego a una cascada de bloques, cada uno de los cuales pasa por tres etapas diferentes: muestreo, recolección y agrupación. En la fase de muestreo, se muestrean un número fijo de puntos de N puntos disponibles utilizando el algoritmo de muestreo de punto más lejano (FPS) que garantiza una cobertura adecuada. En el segundo paso, para cada punto de muestreo, el marco busca sus k vecinos más cercanos del grupo de N puntos disponibles. Para cada grupo, el modelo luego fusiona las características del punto de muestreo con las características de los puntos vecinos. En el paso final, el marco de Ferret realiza una agrupación para fusionar las características de los k vecinos en una característica que actúa como la representación del punto muestreado. Al realizar estos tres pasos, el marco de Ferret se queda con menos puntos pero con un espacio de características de mayor densidad, ya que no solo incorpora las características de los vecinos locales, sino también sus posiciones relativas.

Generación de Datos Visuales Asistida por GPT

Los datos de ajuste de instrucciones de diálogo son de importancia crítica para los Modelos de Lenguaje Multimodal Grandes, ya que no solo ayudan a convertir los conjuntos de datos existentes mediante plantillas, sino que también ayudan al modelo a comprender la intención humana y generar respuestas adecuadas. La mayoría de los MLLM utilizan un método de prompting de pocos disparos para obtener datos de ajuste de instrucciones visuales, donde el modelo proporciona descripciones textuales de escenas en la imagen junto con diálogos anotados por humanos como demostraciones de pocos disparos. Sin embargo, los métodos de ajuste de instrucciones existentes se centran principalmente en describir la imagen completa sin especificar información espacial relacionada explícitamente. El marco de Ferret enfatiza el conocimiento basado en regiones para recopilar datos de ajuste de instrucciones de referencia y localización en tres pasos.

  1. Además de utilizar subtítulos globales y objetos, el marco proporciona una descripción simbólica de la escena que describe la relación física entre las descripciones de la región y los objetos, así como sus coordenadas.
  2. Para los diálogos anotados por humanos, el marco agrega coordenadas después de los objetos o regiones que se pueden localizar en la entrada o la salida, o en ambos, con los diálogos centrados principalmente en regiones específicas que ayudan a impulsar al modelo de lenguaje a seguir patrones similares para la generación de nuevos diálogos.
  3. Es posible que el diálogo generado por el marco no siga las reglas y patrones como se indica en las demostraciones de pocos disparos y las instrucciones del sistema. Para abordar este problema, el marco utiliza nuevamente un modelo de lenguaje para refinar los diálogos generados por el modelo inicialmente.

Minería de Negativos Espaciales

La investigación previa ha demostrado que los modelos de lenguaje multimodal grande tienen una alta probabilidad de alucinar cuando responden a preguntas de sí o no. Para asegurarse de que el modelo de Ferret no alucine en condiciones similares, el marco emplea el enfoque de Minería de Negativos Espaciales con Localización de Categoría Condicional de Imagen y Semántica. Ambos métodos piden al modelo que localice categorías de objetos específicas que permiten al modelo reconocer la ausencia de ciertos objetos en la imagen.

Ferret: Resultados y Experimentación

Para analizar su rendimiento, el marco de Ferret se evalúa en benchmarks de localización y referencia convencionales después de lo cual el marco se evalúa en una tarea de conversación multimodal más compleja y se prueba su capacidad de referencia y localización.

La capacidad del modelo para comprender la referencia se evalúa por cómo precisamente un modelo puede comprender la semántica de la región referenciada dada una región referenciada en la imagen o la pregunta. Para medir la precisión del modelo, se consideran los objetos, la semántica más básica, primero, ya que no solo es fundamental sino también fácil de definir. Para imitar la versatilidad humana, el marco reemplaza la ubicación del objeto dentro de la imagen con una forma libre, una caja y un punto. Para una forma libre, el modelo genera aleatoriamente trazos dentro del objeto de la verdad de la tierra para la simulación. Para una caja, el marco de Ferret utiliza la caja delimitadora de la verdad de la tierra proporcionada por el componente LVIS. Finalmente, para un punto, el modelo muestrea aleatoriamente un punto dentro del objeto de la verdad de la tierra que también está cerca del límite del objeto de la verdad de la tierra. Los resultados de los tres tipos de referencia se demuestran en la siguiente imagen.

El marco de Ferret demuestra un rendimiento notable en tareas de diálogo referencial, lo que permite la integración con diferentes tareas de aprendizaje visual, especialmente aquellas con salidas de localización. Para evaluar su capacidad de localización, el marco de Ferret se somete primero a tareas de localización visual con un paradigma generativo. El marco luego evalúa su capacidad en tareas de subtítulación localizada para medir la alineación entre las regiones y las palabras.

En tareas de localización visual, el marco tiene como objetivo localizar consultas de lenguaje en regiones alineadas de la imagen, y como se puede ver en la siguiente imagen, el marco de Ferret demuestra un rendimiento notable en todos los benchmarks, y el rendimiento es comparable al logrado por métodos de ajuste especializados.

Para las tareas de subtítulación localizada, el modelo necesita generar un subtítulo y luego localizar las frases nominales generadas en regiones de la imagen. La predicción final hecha por el modelo consta de tres componentes: regiones visuales como cajas, subtítulos de texto y alineaciones de localización entre cajas y palabras. Los resultados se demuestran en la siguiente imagen, y como se puede observar, el marco entrega un rendimiento comparable a los métodos de estado del arte.

Finalmente, la conversación multimodal es una de las capacidades más deseables dentro de un MLLM, y los MLLM existentes principalmente evalúan descripciones detalladas, conversación y razonamiento complejo con el modelo de lenguaje como juez. Sin embargo, como no hay un conjunto de datos que evalúe la conversación multimodal con acciones de referencia o localización obligatorias, esto deja un vacío. Para llenar este vacío, el marco de Ferret cubre tres preguntas basadas en regiones para evaluar sus capacidades de referencia y localización en tareas de conversación multimodal. Los resultados se demuestran en la siguiente imagen.

Finalmente, el marco de Ferret se compara directamente con el marco de estado del arte GPT, y los resultados se demuestran a continuación.

Pensamientos Finales

En este artículo, hemos hablado sobre Ferret, un modelo de lenguaje multimodal grande que demuestra capacidades notables de localización y referencia. El marco de Ferret puede referirse a regiones de la imagen independientemente de su forma y puede establecer la localización para el texto predicho por el modelo automáticamente. Ferret emplea un muestreador visual espacialmente consciente capaz de manejar la variabilidad en la densidad de las formas para extraer las características continuas de regiones versátiles. Como resultado, el marco de Ferret puede procesar diversas entradas de regiones, incluidas formas libres, cajas delimitadoras y puntos.

Un ingeniero por profesión, un escritor por corazón. Kunal es un escritor técnico con un profundo amor y comprensión de la IA y el ML, dedicado a simplificar conceptos complejos en estos campos a través de su documentación atractiva e informativa.