Modelos y plataformas de IA
La inteligencia artificial multimodal evoluciona con ChatGPT que gana visión con GPT-4V(ision)
En el esfuerzo continuo por hacer que la inteligencia artificial sea más similar a los humanos, los modelos GPT de OpenAI han seguido empujando los límites. GPT-4 ahora puede aceptar instrucciones de texto e imágenes.
La multimodalidad en la inteligencia artificial generativa denota la capacidad de un modelo para producir diversas salidas como texto, imágenes o audio basadas en la entrada. Estos modelos, entrenados en datos específicos, aprenden patrones subyacentes para generar nuevos datos similares, enriqueciendo las aplicaciones de la inteligencia artificial.
Avances recientes en la inteligencia artificial multimodal
Un salto notable reciente en este campo se ve con la integración de DALL-E 3 en ChatGPT, una mejora significativa en la tecnología de texto a imagen de OpenAI. Esta combinación permite una interacción más suave donde ChatGPT ayuda a crear instrucciones precisas para DALL-E 3, convirtiendo las ideas de los usuarios en arte vívido generado por la inteligencia artificial. Así, mientras los usuarios pueden interactuar directamente con DALL-E 3, tener a ChatGPT en la mezcla hace que el proceso de crear arte de inteligencia artificial sea mucho más amigable para el usuario.
Consulte más sobre DALL-E 3 y su integración con ChatGPT aquí. Esta colaboración no solo muestra el avance en la inteligencia artificial multimodal, sino que también hace que la creación de arte de inteligencia artificial sea fácil para los usuarios.
Google (GOOGL ), por otro lado, introdujo Med-PaLM M en junio de este año. Es un modelo generativo multimodal hábil para codificar e interpretar diversos datos biomédicos. Esto se logró mediante la fine-tuning de PaLM-E, un modelo de lenguaje, para adaptarse a dominios médicos utilizando un benchmark de código abierto, MultiMedBench. Este benchmark consta de más de 1 millón de muestras en 7 tipos de datos biomédicos y 14 tareas como la respuesta a preguntas médicas y la generación de informes de radiología.
Varías industrias están adoptando herramientas de inteligencia artificial multimodal innovadoras para impulsar la expansión empresarial, racionalizar las operaciones y elevar la participación del cliente. El progreso en las capacidades de voz, video y texto de la inteligencia artificial está impulsando el crecimiento de la inteligencia artificial multimodal.
Las empresas buscan aplicaciones de inteligencia artificial multimodal capaces de reformar modelos y procesos empresariales, abriendo vías de crecimiento en todo el ecosistema de la inteligencia artificial generativa, desde herramientas de datos hasta aplicaciones de inteligencia artificial emergentes.
Después del lanzamiento de GPT-4 en marzo, algunos usuarios observaron una disminución en la calidad de respuesta con el tiempo, una preocupación expresada por desarrolladores notables y en los foros de OpenAI. Inicialmente descartada por OpenAI, un estudio posterior confirmó el problema. Reveló una caída en la precisión de GPT-4 del 97,6% al 2,4% entre marzo y junio, lo que indica una disminución en la calidad de la respuesta con las actualizaciones posteriores del modelo.
La emoción alrededor de Open AI’s ChatGPT está de regreso. Ahora viene con una función de visión GPT-4V, que permite a los usuarios que GPT-4 analice imágenes proporcionadas por ellos. Esta es la función más nueva que se ha abierto a los usuarios.
Agregar análisis de imágenes a grandes modelos de lenguaje (LLM) como GPT-4 se considera por algunos como un gran paso adelante en la investigación y el desarrollo de la inteligencia artificial. Este tipo de LLM multimodal abre nuevas posibilidades, llevando a los modelos de lenguaje más allá del texto para ofrecer nuevas interfaces y resolver nuevos tipos de tareas, creando experiencias frescas para los usuarios.
El entrenamiento de GPT-4V se completó en 2022, con acceso anticipado lanzado en marzo de 2023. La función visual en GPT-4V está impulsada por la tecnología GPT-4. El proceso de entrenamiento permaneció igual. Inicialmente, el modelo se entrenó para predecir la próxima palabra en un texto utilizando un conjunto de datos masivo de texto e imágenes de diversas fuentes, incluyendo Internet.
Más tarde, se fine-tuneó con más datos, empleando un método llamado aprendizaje de refuerzo a partir de retroalimentación humana (RLHF), para generar salidas que los humanos prefirieran.
Mecánica de visión de GPT-4
Las notables capacidades de lenguaje y visión de GPT-4, aunque impresionantes, tienen métodos subyacentes que permanecen en la superficie.
Para explorar esta hipótesis, se introdujo un nuevo modelo de lenguaje y visión, MiniGPT-4, que utiliza un modelo de lenguaje avanzado llamado Vicuna. Este modelo utiliza un codificador de visión con componentes preentrenados para la percepción visual, alineando las características visuales codificadas con el modelo de lenguaje Vicuna a través de una sola capa de proyección. La arquitectura de MiniGPT-4 es simple pero efectiva, con un enfoque en alinear las características visuales y de lenguaje para mejorar las capacidades de conversación visual.

La arquitectura de MiniGPT-4 incluye un codificador de visión con ViT y Q-Former preentrenados, una capa de proyección lineal única y un modelo de lenguaje avanzado Vicuna.
La tendencia de los modelos de lenguaje autoregresivos en tareas de lenguaje y visión también ha crecido, aprovechando el traslado entre modalidades para compartir conocimientos entre dominios de lenguaje y multimodal.
MiniGPT-4 conecta los dominios visual y de lenguaje alineando la información visual de un codificador de visión preentrenado con un modelo de lenguaje avanzado. El modelo utiliza Vicuna como decodificador de lenguaje y sigue un enfoque de entrenamiento en dos etapas. Inicialmente, se entrena en un conjunto de datos grande de pares de imagen y texto para comprender el conocimiento de lenguaje y visión, seguido de una fine-tuning en un conjunto de datos más pequeño y de alta calidad para mejorar la confiabilidad y la usabilidad de la generación.
Para mejorar la naturalidad y la usabilidad del lenguaje generado en MiniGPT-4, los investigadores desarrollaron un proceso de alineación en dos etapas, abordando la falta de conjuntos de datos adecuados de alineación de lenguaje y visión. Crearon un conjunto de datos especializado para este propósito.
Inicialmente, el modelo generó descripciones detalladas de las imágenes de entrada, mejorando el detalle mediante el uso de una instrucción conversacional alineada con el formato del modelo de lenguaje Vicuna. Esta etapa tenía como objetivo generar descripciones de imágenes más completas.
Prompt de descripción de imagen inicial:
###Humano: <Img><Característica de la imagen></Img>Describe esta imagen con detalle. Proporciona tantos detalles como sea posible. Di todo lo que ves. ###Asistente:
Para el procesamiento de datos posteriores, cualquier inconsistencia o error en las descripciones generadas se corrigió utilizando ChatGPT, seguido de una verificación manual para garantizar la alta calidad.
Prompt de fine-tuning de la segunda etapa:
###Humano: <Img><Característica de la imagen></Img><Instrucción>###Asistente:
Esta exploración abre una ventana para comprender la mecánica de la inteligencia artificial generativa multimodal como GPT-4, arrojando luz sobre cómo las modalidades de visión y lenguaje pueden integrarse efectivamente para generar salidas coherentes y ricas en contexto.
Explorando la visión de GPT-4
Determinar los orígenes de las imágenes con ChatGPT
GPT-4 Vision mejora la capacidad de ChatGPT para analizar imágenes y determinar sus orígenes geográficos. Esta función transita las interacciones del usuario desde solo texto a una mezcla de texto y visuales, convirtiéndose en una herramienta útil para aquellos curiosos sobre diferentes lugares a través de datos de imágenes.
Conceptos matemáticos complejos
GPT-4 Vision sobresale en la exploración de ideas matemáticas complejas analizando expresiones gráficas o escritas a mano. Esta función actúa como una herramienta útil para individuos que buscan resolver problemas matemáticos intrincados, marcando a GPT-4 Vision como una ayuda notable en campos educativos y académicos.
Convertir entrada manuscrita en códigos LaTeX
Una de las capacidades notables de GPT-4V es su capacidad para traducir entradas manuscritas en códigos LaTeX. Esta función es un beneficio para investigadores, académicos y estudiantes que a menudo necesitan convertir expresiones matemáticas manuscritas o otra información técnica en un formato digital. La transformación de manuscrito a LaTeX amplía el horizonte de la digitalización de documentos y simplifica el proceso de escritura técnica.
Extraer detalles de tablas
GPT-4V muestra habilidad para extraer detalles de tablas y responder a preguntas relacionadas, un activo vital en el análisis de datos. Los usuarios pueden utilizar GPT-4V para buscar en tablas, recopilar información clave y resolver preguntas, convirtiéndolo en una herramienta robusta para analistas de datos y otros profesionales.
Comprender señalamientos visuales
La capacidad única de GPT-4V para comprender señalamientos visuales agrega una nueva dimensión a la interacción del usuario. Al entender señales visuales, GPT-4V puede responder a preguntas con una comprensión contextual más alta.
Crear sitios web de demostración simples utilizando un dibujo
Inspirado por este tuit, intenté crear un modelo para el sitio web de unite.ai.
Mientras que el resultado no coincidió exactamente con mi visión inicial, aquí está el resultado que logré.
Limitaciones y defectos de GPT-4V(ision)
Para analizar GPT-4V, el equipo de Open AI realizó evaluaciones cualitativas y cuantitativas. Las evaluaciones cualitativas incluyeron pruebas internas y revisiones de expertos externos, mientras que las cuantitativas midieron los rechazos del modelo y la precisión en varios escenarios, como la identificación de contenido dañino, el reconocimiento demográfico, las preocupaciones de privacidad, la geolocalización, la ciberseguridad y los jailbreaks multimodales.
Aún así, el modelo no es perfecto.
El documento destaca las limitaciones de GPT-4V, como inferencias incorrectas y texto o caracteres faltantes en las imágenes. Puede alucinar o inventar hechos. En particular, no es adecuado para identificar sustancias peligrosas en imágenes, a menudo malidentificándolas.
En la imagen médica, GPT-4V puede proporcionar respuestas inconsistentes y carece de conciencia de las prácticas estándar, lo que puede llevar a posibles diagnósticos incorrectos.

Rendimiento no confiable para fines médicos (Fuente)
También falla en comprender las sutilezas de ciertos símbolos de odio y puede generar contenido inapropiado basado en las entradas visuales. OpenAI aconseja en contra del uso de GPT-4V para interpretaciones críticas, especialmente en contextos médicos o sensibles.
Conclusión

Creado con Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl
La llegada de GPT-4 Vision (GPT-4V) trae consigo un montón de posibilidades interesantes y nuevos desafíos que superar. Antes de lanzarlo, se ha puesto mucho esfuerzo en asegurarse de que los riesgos, especialmente cuando se trata de imágenes de personas, se hayan examinado y reducido. Es impresionante ver cómo GPT-4V ha mejorado, mostrando mucho potencial en áreas complicadas como la medicina y la ciencia.
Ahora, hay algunas grandes preguntas sobre la mesa. Por ejemplo, ¿deberían estos modelos ser capaces de identificar a personas famosas en fotos? ¿Deberían adivinar el género, la raza o los sentimientos de una persona en una imagen? Y, ¿debería haber ajustes especiales para ayudar a las personas con discapacidad visual? Estas preguntas abren un conjunto de problemas sobre la privacidad, la equidad y cómo la inteligencia artificial debería encajar en nuestras vidas, algo en lo que todos deberían tener una opinión.




















