Modelos y plataformas de IA

Ver, pensar, explicar: El auge de los modelos de lenguaje de visión en la IA

mm
Añade Unite.AI a tus fuentes preferidas en Google

Hace aproximadamente una década, la inteligencia artificial se dividía entre el reconocimiento de imágenes y la comprensión del lenguaje. Los modelos de visión podían detectar objetos, pero no podían describirlos, y los modelos de lenguaje podían generar texto, pero no podían “ver”. Hoy en día, esa división está desapareciendo rápidamente. Los Modelos de Lenguaje de Visión (VLM) combinan habilidades visuales y lingüísticas, lo que les permite interpretar imágenes y explicarlas de manera que se siente casi humana. Lo que los hace verdaderamente destacados es su proceso de razonamiento paso a paso, conocido como Razonamiento en Cadena de Pensamiento, que ayuda a convertir estos modelos en herramientas poderosas y prácticas en diversas industrias, como la atención médica y la educación. En este artículo, exploraremos cómo funcionan los VLM, por qué su razonamiento es importante y cómo están transformando campos que van desde la medicina hasta los automóviles autónomos.

Entendiendo los Modelos de Lenguaje de Visión

Los Modelos de Lenguaje de Visión, o VLM, son un tipo de inteligencia artificial que puede entender tanto imágenes como texto al mismo tiempo. A diferencia de los sistemas de IA más antiguos que solo podían manejar texto o imágenes, los VLM combinan estas dos habilidades. Esto los hace increíblemente versátiles. Pueden mirar una imagen y describir lo que está sucediendo, responder preguntas sobre un video o incluso crear imágenes basadas en una descripción escrita.

Por ejemplo, si le pides a un VLM que describa una foto de un perro corriendo en un parque. Un VLM no solo dice: “Hay un perro”. Puede decirte: “El perro está persiguiendo una pelota cerca de un gran árbol de roble”. Está viendo la imagen y conectándola con palabras de manera que tiene sentido. Esta capacidad de combinar la comprensión visual y lingüística crea todo tipo de posibilidades, desde ayudarte a buscar fotos en línea hasta asistir en tareas más complejas como la imagen médica.

En su núcleo, los VLM funcionan combinando dos componentes clave: un sistema de visión que analiza imágenes y un sistema de lenguaje que procesa texto. La parte de visión se enfoca en detalles como formas y colores, mientras que la parte de lenguaje convierte esos detalles en oraciones. Los VLM se entrenan en conjuntos de datos masivos que contienen miles de millones de pares de imagen-texto, lo que les da una amplia experiencia para desarrollar una comprensión sólida y una alta precisión.

Qué significa el Razonamiento en Cadena de Pensamiento en los VLM

El Razonamiento en Cadena de Pensamiento, o CoT, es una forma de hacer que la IA piense paso a paso, similar a cómo nosotros abordamos un problema desglosándolo. En los VLM, significa que la IA no solo proporciona una respuesta cuando se le hace una pregunta sobre una imagen, sino que también explica cómo llegó a esa respuesta, explicando cada paso lógico en el camino.

Digamos que le muestras a un VLM una imagen de un pastel de cumpleaños con velas y le preguntas: “¿Cuántos años tiene la persona?” Sin CoT, podría simplemente adivinar un número. Con CoT, lo piensa: “Okay, veo un pastel con velas. Las velas suelen mostrar la edad de alguien. Vamos a contarlas, hay 10. Entonces, la persona probablemente tiene 10 años”. Puedes seguir el razonamiento a medida que se desarrolla, lo que hace que la respuesta sea mucho más confiable.

De manera similar, cuando se le muestra a un VLM una escena de tráfico y se le pregunta: “¿Es seguro cruzar?” El VLM podría razonar: “La luz peatonal está en rojo, así que no debes cruzar. También hay un coche girando cerca, y se está moviendo, no está detenido. Eso significa que no es seguro ahora”. Al pasar por estos pasos, la IA muestra exactamente a qué presta atención en la imagen y por qué decide lo que decide.

Por qué el Razonamiento en Cadena de Pensamiento es importante en los VLM

La integración del Razonamiento en Cadena de Pensamiento en los VLM aporta varias ventajas clave.

Primero, hace que la IA sea más fácil de confiar. Cuando explica sus pasos, obtienes una comprensión clara de cómo llegó a la respuesta. Esto es importante en áreas como la atención médica. Por ejemplo, cuando se examina una imagen de resonancia magnética, un VLM podría decir: “Veo una sombra en el lado izquierdo del cerebro. Esa área controla el habla, y el paciente tiene problemas para hablar, así que podría ser un tumor”. Un médico puede seguir esa lógica y sentirse seguro sobre la entrada de la IA.

Segundo, ayuda a la IA a abordar problemas complejos. Al desglosar las cosas, puede manejar preguntas que necesitan más que una mirada rápida. Por ejemplo, contar velas es simple, pero determinar la seguridad en una calle concurrida requiere múltiples pasos, incluyendo verificar las luces, identificar coches, juzgar la velocidad. El CoT permite que la IA maneje esa complejidad dividiéndola en pasos múltiples.

Finalmente, hace que la IA sea más adaptable. Cuando razona paso a paso, puede aplicar lo que sabe a nuevas situaciones. Si nunca ha visto un tipo específico de pastel antes, aún puede figurar la conexión entre las velas y la edad porque está pensando en ello, en lugar de confiar solo en patrones memorizados.

Cómo el Razonamiento en Cadena de Pensamiento y los VLM están redefiniendo industrias

La combinación de CoT y VLM está teniendo un impacto significativo en diversos campos:

  • Atención médica: En medicina, los VLM como Med-PaLM 2 de Google (GOOGL ) utilizan CoT para desglosar preguntas médicas complejas en pasos de diagnóstico más pequeños. Por ejemplo, cuando se le da una radiografía de tórax y síntomas como tos y dolor de cabeza, la IA podría pensar: “Estos síntomas podrían ser un resfriado, alergias o algo peor. No hay ganglios linfáticos inflamados, así que probablemente no sea una infección grave. Los pulmones parecen claros, así que probablemente no sea neumonía. Un resfriado común encaja mejor”. Camina por las opciones y llega a una respuesta, dándole a los médicos una explicación clara para trabajar.
  • Automóviles autónomos: Para vehículos autónomos, los VLM mejorados con CoT mejoran la seguridad y la toma de decisiones. Por ejemplo, un automóvil autónomo puede analizar una escena de tráfico paso a paso: verificando señales de peatones, identificando vehículos en movimiento y decidiendo si es seguro proceder. Sistemas como LINGO-1 de Wayve generan comentarios de lenguaje natural para explicar acciones como frenar para un ciclista. Esto ayuda a los ingenieros y pasajeros a entender el proceso de razonamiento del vehículo. La lógica paso a paso también permite un mejor manejo de condiciones de carretera inusuales combinando entradas visuales con conocimiento contextual.
  • Análisis geoespacial: El modelo Gemini de Google aplica el razonamiento en cadena de pensamiento a datos espaciales como mapas e imágenes de satélite. Por ejemplo, puede evaluar daños causados por un huracán integrando imágenes de satélite, pronósticos del clima y datos demográficos, y luego generar visualizaciones claras y respuestas a preguntas complejas. Esta capacidad acelera la respuesta a desastres al proporcionar a los responsables de la toma de decisiones información útil y oportuna sin requerir experiencia técnica.
  • Robótica: En robótica, la integración de CoT y VLM permite que los robots planifiquen y ejecuten tareas de múltiples pasos. Por ejemplo, cuando un robot se le asigna la tarea de recoger un objeto, el VLM habilitado con CoT le permite identificar la taza, determinar los mejores puntos de agarre, planificar una ruta libre de colisiones y realizar el movimiento, todo mientras “explica” cada paso de su proceso. Proyectos como RT-2 demuestran cómo el CoT permite que los robots se adapten mejor a nuevas tareas y respondan a comandos complejos con razonamiento claro.
  • Educación: En el aprendizaje, los tutores de IA como Khanmigo utilizan CoT para enseñar mejor. Para un problema de matemáticas, podría guiar a un estudiante: “Primero, escribe la ecuación. Luego, aísla la variable restando 5 de ambos lados. Ahora, divide entre 2”. En lugar de dar la respuesta, camina por el proceso, ayudando a los estudiantes a entender conceptos paso a paso.

En resumen

Los Modelos de Lenguaje de Visión (VLM) permiten que la IA interprete y explique datos visuales utilizando un razonamiento humano similar, paso a paso, a través de procesos de Razonamiento en Cadena de Pensamiento (CoT). Este enfoque aumenta la confianza, la adaptabilidad y la resolución de problemas en industrias como la atención médica, los automóviles autónomos, el análisis geoespacial, la robótica y la educación. Al transformar cómo la IA aborda tareas complejas y apoya la toma de decisiones, los VLM están estableciendo un nuevo estándar para la tecnología inteligente confiable y práctica.

El Dr. Tehseen Zia es un profesor asociado titular en la Universidad COMSATS de Islamabad, con un doctorado en Inteligencia Artificial de la Universidad Técnica de Viena, Austria. Especializado en Inteligencia Artificial, Aprendizaje Automático, Ciencia de Datos y Visión por Computadora, ha hecho contribuciones significativas con publicaciones en revistas científicas reputadas. El Dr. Tehseen también ha liderado varios proyectos industriales como investigador principal y ha servido como consultor de Inteligencia Artificial.