Modelos y plataformas de IA

Inteligencia Artificial Generativa: La Idea detrás de CHATGPT, DALL-E, Midjourney y más

mm
Añade Unite.AI a tus fuentes preferidas en Google

El mundo del arte, la comunicación y la forma en que percibimos la realidad está cambiando rápidamente. Si miramos hacia atrás en la historia de la innovación humana, podríamos considerar la invención de la rueda o el descubrimiento de la electricidad como saltos monumentales. Hoy en día, una nueva revolución está teniendo lugar, cerrando la brecha entre la creatividad humana y la computación de las máquinas. Eso es la Inteligencia Artificial Generativa.

Los modelos generativos han difuminado la línea entre humanos y máquinas. Con la llegada de modelos como GPT-4, que emplea módulos de transformadores, hemos avanzado hacia una generación de lenguaje natural y rica en contexto. Estos avances han impulsado aplicaciones en la creación de documentos, sistemas de diálogo de chatbots y even la composición de música sintética.

Las recientes decisiones de las grandes tecnológicas subrayan su importancia. Microsoft (MSFT ) está descontinuando su aplicación Cortana este mes para priorizar innovaciones de Inteligencia Artificial Generativa más nuevas, como Bing Chat. Apple (AAPL ) también ha dedicado una parte significativa de su $22.6 mil millones de presupuesto de I+D a la inteligencia artificial generativa, como indicó el CEO Tim Cook.

Una Nueva Era de Modelos: Generativa vs. Discriminativa

La historia de la Inteligencia Artificial Generativa no se trata solo de sus aplicaciones, sino fundamentalmente de su funcionamiento interno. En el ecosistema de la inteligencia artificial, existen dos modelos: discriminativos y generativos.

Los modelos discriminativos son los que la mayoría de las personas encuentran en la vida diaria. Estos algoritmos toman datos de entrada, como un texto o una imagen, y los emparejan con una salida objetivo, como una traducción de palabras o un diagnóstico médico. Se trata de mapear y predecir.

Los modelos generativos, por otro lado, son creadores. No solo interpretan o predicen; generan nuevas salidas complejas a partir de vectores de números que a menudo no están relacionados con valores del mundo real.

 

Tipos de Inteligencia Artificial Generativa: Texto a Texto, Texto a Imagen (GPT, DALL-E, Midjourney)

Las Tecnologías detrás de los Modelos Generativos

Los modelos generativos deben su existencia a las redes neuronales profundas, estructuras sofisticadas diseñadas para imitar la funcionalidad del cerebro humano. Al capturar y procesar variaciones multifacéticas en los datos, estas redes sirven como la columna vertebral de numerosos modelos generativos.

¿Cómo cobran vida estos modelos generativos? Por lo general, se construyen con redes neuronales profundas, optimizadas para capturar las variaciones multifacéticas en los datos. Un ejemplo destacado es la Red Generativa Adversaria (GAN), donde dos redes neuronales, el generador y el discriminador, compiten y aprenden entre sí en una relación única de maestro y estudiante. Desde pinturas hasta transferencia de estilo, desde composición musical hasta juegos, estos modelos están evolucionando y expandiéndose de maneras anteriormente inimaginables.

Esto no se detiene con las GAN. Las Autoencoders Variacionales (VAE), son otro jugador clave en el campo de los modelos generativos. Los VAE se destacan por su capacidad para crear imágenes fotorealistas a partir de números aparentemente aleatorios. ¿Cómo? Procesando estos números a través de un vector latente da lugar a arte que refleja las complejidades de la estética humana.

Tipos de Inteligencia Artificial Generativa: Texto a Texto, Texto a Imagen

Transformadores y LLM

El artículo “La Atención es Todo lo que Necesitas” de Google (GOOGL ) Brain marcó un cambio en la forma en que pensamos sobre el modelado de texto. En lugar de arquitecturas complejas y secuenciales como las Redes Neuronales Recurrentes (RNN) o las Redes Neuronales Convolucionales (CNN), el modelo Transformer introdujo el concepto de atención, que esencialmente significaba enfocarse en diferentes partes del texto de entrada dependiendo del contexto. Una de las principales ventajas de esto fue la facilidad de paralelización. A diferencia de las RNN, que procesan el texto secuencialmente, lo que las hace más difíciles de escalar, los Transformadores pueden procesar partes del texto simultáneamente, lo que hace que el entrenamiento sea más rápido y eficiente en grandes conjuntos de datos.

En un texto largo, no todas las palabras o frases que se leen tienen la misma importancia. Algunas partes requieren más atención basada en el contexto. Esta capacidad de cambiar nuestro enfoque según la relevancia es lo que el mecanismo de atención imita.

Para entender esto, piense en una oración: “Unite AI Publica Noticias de Inteligencia Artificial y Robótica”. Ahora, predecir la siguiente palabra requiere una comprensión de lo que es más importante en el contexto anterior. El término ‘Robótica’ podría sugerir que la siguiente palabra podría estar relacionada con un avance o evento específico en el campo de la robótica, mientras que ‘Publica’ podría indicar que el contexto siguiente podría profundizar en una publicación reciente o un artículo.

Ilustración del Mecanismo de Atención en una Oración de Demostración
Ilustración de Atención

Los mecanismos de atención en los Transformadores están diseñados para lograr este enfoque selectivo. Evalúan la importancia de diferentes partes del texto de entrada y deciden dónde “mirar” cuando generan una respuesta. Esto es un alejamiento de las arquitecturas más antiguas como las RNN, que intentaban capturar la esencia de todo el texto de entrada en un solo “estado” o “memoria”.

El funcionamiento de la atención se puede comparar con un sistema de recuperación de claves y valores. Al intentar predecir la siguiente palabra en una oración, cada palabra anterior ofrece una “clave” que sugiere su posible relevancia, y basándose en cómo bien estas claves coinciden con el contexto actual (o consulta), contribuyen un “valor” o peso a la predicción.

Estos modelos de aprendizaje profundo avanzados se han integrado sin problemas en diversas aplicaciones, desde las mejoras en el motor de búsqueda de Google con BERT hasta GitHub’s Copilot, que aprovecha la capacidad de los Modelos de Lenguaje Grande (LLM) para convertir fragmentos de código simples en códigos fuente completamente funcionales.

Los Modelos de Lenguaje Grande (LLM) como GPT-4, Bard y LLaMA, son constructos colosales diseñados para descifrar y generar lenguaje humano, código y más. Su tamaño enorme, que va desde miles de millones hasta billones de parámetros, es una de las características definitorias. Estos LLM se alimentan con cantidades copiosas de datos de texto, lo que les permite captar las complejidades del lenguaje humano. Una característica destacada de estos modelos es su aptitud para el “aprendizaje de pocos disparos”. A diferencia de los modelos convencionales que necesitan grandes cantidades de datos de entrenamiento específicos, los LLM pueden generalizar a partir de un número muy limitado de ejemplos (o “disparos”).

Estado de los Modelos de Lenguaje Grande (LLM) a mediados de 2023

Nombre del Modelo Desarrollador Parámetros Disponibilidad y Acceso Características Notables y Comentarios
GPT-4 OpenAI 1,5 billones No es de código abierto, solo acceso a la API Rendimiento impresionante en una variedad de tareas, puede procesar imágenes y texto, longitud máxima de entrada de 32.768 tokens
GPT-3 OpenAI 175 mil millones No es de código abierto, solo acceso a la API Demuestra capacidades de aprendizaje de pocos disparos y sin disparos. Realiza la finalización de texto en lenguaje natural.
BLOOM BigScience 176 mil millones Modelo descargable, API alojada disponible LLM multilingüe desarrollado por colaboración global. Soporta 13 lenguajes de programación.
LaMDA Google 173 mil millones No es de código abierto, sin API ni descarga Entrenado en diálogos, puede aprender a hablar sobre prácticamente cualquier tema.
MT-NLG Nvidia /Microsoft 530 mil millones Acceso a la API por solicitud Utiliza la arquitectura Megatron basada en transformadores para diversas tareas de NLP.
LLaMA Meta AI 7B a 65B) Descargable por solicitud Destinado a democratizar el AI, ofreciendo acceso a investigadores, gobiernos y académicos.

¿Cómo se Utilizan los LLM?

Los LLM se pueden utilizar de varias maneras, incluyendo:

  1. Uso Directo: Simplemente utilizando un LLM preentrenado para la generación de texto o el procesamiento. Por ejemplo, usar GPT-4 para escribir un artículo de blog sin ajuste adicional.
  2. Ajuste: Adaptando un LLM preentrenado para una tarea específica, un método conocido como aprendizaje de transferencia. Un ejemplo sería personalizar T5 para generar resúmenes para documentos de una industria específica.
  3. Recuperación de Información: Usando LLM como parte de arquitecturas más grandes para desarrollar sistemas que puedan recuperar y categorizar información.
Arquitectura de Ajuste de ChatGPT
Arquitectura de Ajuste de ChatGPT

Atención Multi-cabezal: ¿Por Qué Uno Cuando Puedes Tener Muchos?

Sin embargo, depender de un solo mecanismo de atención puede ser limitante. Diferentes palabras o secuencias en un texto pueden tener tipos variados de relevancia o asociaciones. Es aquí donde entra en juego la atención multi-cabezal. En lugar de un conjunto de pesos de atención, la atención multi-cabezal emplea múltiples conjuntos, lo que permite al modelo capturar una variedad más rica de relaciones en el texto de entrada. Cada “cabeza” de atención puede enfocarse en diferentes partes o aspectos del texto, y su conocimiento combinado se utiliza para la predicción final.

ChatGPT: La Herramienta de Inteligencia Artificial Generativa Más Popular

Comenzando con el nacimiento de GPT en 2018, el modelo se construyó fundamentalmente sobre una base de 12 capas, 12 cabezas de atención y 120 millones de parámetros, entrenado principalmente en un conjunto de datos llamado BookCorpus. Esto fue un comienzo impresionante, ofreciendo una visión del futuro de los modelos de lenguaje.

GPT-2, presentado en 2019, contaba con un aumento cuádruple en capas y cabezas de atención. Significativamente, su cuenta de parámetros se disparó a 1.500 millones. Esta versión mejorada se derivó de WebText, un conjunto de datos enriquecido con 40GB de texto de varios enlaces de Reddit.

GPT-3, lanzado en mayo de 2020, tenía 96 capas, 96 cabezas de atención y una cuenta de parámetros masiva de 175 mil millones. Lo que distinguió a GPT-3 fue su diverso conjunto de datos de entrenamiento, que incluía CommonCrawl, WebText, Wikipedia en inglés, corpus de libros y otros, combinando un total de 570 GB.

Las intrincaciones de cómo funciona ChatGPT permanecen como un secreto bien guardado. Sin embargo, un proceso llamado “aprendizaje por refuerzo con retroalimentación humana” (RLHF) es conocido como crucial. Originado de un proyecto anterior de ChatGPT, esta técnica fue instrumental en afinar el modelo GPT-3.5 para que se alineara más con las instrucciones escritas.

El entrenamiento de ChatGPT comprende un enfoque de tres niveles:

  1. Ajuste supervisado: Implica curar entradas y salidas conversacionales escritas por humanos para afinar el modelo subyacente GPT-3.5.
  2. Modelado de recompensa: Los humanos clasifican varias salidas del modelo según su calidad, ayudando a entrenar un modelo de recompensa que puntuación cada salida considerando el contexto de la conversación.
  3. Aprendizaje por refuerzo: El contexto conversacional sirve como telón de fondo donde el modelo subyacente propone una respuesta. Esta respuesta es evaluada por el modelo de recompensa, y el proceso se optimiza usando un algoritmo llamado optimización de política proximal (PPO).

Para aquellos que están empezando con ChatGPT, una guía de inicio integral se puede encontrar aquí. Si deseas profundizar en la ingeniería de prompts con ChatGPT, también tenemos una guía avanzada que arroja luz sobre las últimas y más avanzadas técnicas de prompts, disponible en ‘ChatGPT y Ingeniería Avanzada de Prompts: Impulsando la Evolución del AI‘.

Modelos de Difusión y Multimodales

Mientras que modelos como VAE y GAN generan sus salidas a través de una sola pasada, quedando así encerrados en lo que producen, los modelos de difusión han introducido el concepto de ‘refinamiento iterativo‘. A través de este método, regresan, refinan errores de pasos anteriores y gradualmente producen un resultado más pulido.

Central en los modelos de difusión está el arte de la “corrupción” y “refinamiento”. En su fase de entrenamiento, una imagen típica se corrompe progresivamente agregando diferentes niveles de ruido. Esta versión ruidosa se alimenta al modelo, que intenta “desruidar” o “des-corromper” la imagen. A través de múltiples rondas de esto, el modelo se vuelve hábil en restauración, comprendiendo tanto aberraciones sutiles como significativas.

Imagen Generada desde Midjourney
Imagen Generada desde Midjourney

El proceso de generar nuevas imágenes después del entrenamiento es intrigante. Comenzando con una entrada completamente aleatorizada, se refina continuamente usando las predicciones del modelo. El objetivo es alcanzar una imagen impecable con el mínimo número de pasos. El control del nivel de corrupción se logra a través de un “calendario de ruido”, un mecanismo que gobierna cuánto ruido se aplica en diferentes etapas. Un programador, como se ve en bibliotecas como “diffusers“, dicta la naturaleza de estas versiones ruidosas basadas en algoritmos establecidos.

Un componente arquitectónico esencial para muchos modelos de difusión es la UNet—una red neuronal convolucional diseñada para tareas que requieren salidas que reflejen las dimensiones espaciales de las entradas. Es una mezcla de capas de muestreo y aumentado, intricadamente conectadas para retener datos de alta resolución, cruciales para salidas relacionadas con imágenes.

Al profundizar en el reino de los modelos generativos, DALL-E 2 de OpenAI emerge como un ejemplo brillante de la fusión de capacidades de inteligencia artificial textual y visual. Emplea una estructura de tres niveles:

DALL-E 2 presenta una arquitectura de tres partes:

  1. Codificador de Texto: Transforma la promoción de texto en una incrustación conceptual dentro de un espacio latente. Este modelo no comienza desde cero. Se basa en el conjunto de datos de preentrenamiento de lenguaje e imagen de OpenAI (CLIP) como su fundamento. CLIP sirve como un puente entre datos visuales y textuales, aprendiendo conceptos visuales usando lenguaje natural. A través de un mecanismo conocido como aprendizaje contrastivo, identifica y empareja imágenes con sus descripciones textuales correspondientes.
  2. El Prior: La incrustación de texto derivada del codificador se convierte en una incrustación de imagen. DALL-E 2 probó tanto métodos autoregresivos como de difusión para esta tarea, con la difusión mostrando resultados superiores. Los modelos autoregresivos, como se ven en Transformadores y PixelCNN, generan salidas en secuencias. Por otro lado, los modelos de difusión, como el utilizado en DALL-E 2, transforman ruido aleatorio en incrustaciones de imagen predichas con la ayuda de incrustaciones de texto.
  3. El Decodificador: La culminación del proceso, esta parte genera la salida visual final basada en la promoción de texto y la incrustación de imagen de la fase previa. El decodificador de DALL-E 2 debe su arquitectura a otro modelo, GLIDE, que también puede producir imágenes realistas a partir de pistas textuales.
Arquitectura del Modelo DALL-E (modelo de difusión multimodal)
Arquitectura Simplificada del Modelo DALL-E

Los usuarios de Python interesados en Langchain deben consultar nuestro tutorial detallado que cubre desde los fundamentos hasta técnicas avanzadas.

Aplicaciones de la Inteligencia Artificial Generativa

Dominios Textuales

Comenzando con el texto, la Inteligencia Artificial Generativa ha sido fundamentalmente alterada por chatbots como ChatGPT. Dependiendo en gran medida del Procesamiento de Lenguaje Natural (NLP) y los modelos de lenguaje grande (LLM), estas entidades están capacitadas para realizar tareas que van desde la generación de código y la traducción de lenguaje hasta la resumen y el análisis de sentimiento. ChatGPT, por ejemplo, ha visto una adopción generalizada, convirtiéndose en una herramienta esencial para millones. Esto se ve aún más reforzado por plataformas de inteligencia conversacional, basadas en LLM como GPT-4, PaLM y BLOOM, que producen textos, asisten en la programación y ofrecen razonamiento matemático.

Desde una perspectiva comercial, estos modelos están volviéndose invaluables. Las empresas los emplean para una multitud de operaciones, incluyendo gestión de riesgos, optimización de inventario y predicción de demandas. Algunos ejemplos notables incluyen Bing AI, Google’s BARD y la API de ChatGPT.

Arte

El mundo de las imágenes ha experimentado transformaciones dramáticas con la Inteligencia Artificial Generativa, particularmente desde la introducción de DALL-E 2 en 2022. Esta tecnología, que puede generar imágenes a partir de promociones textuales, tiene implicaciones tanto artísticas como profesionales. Por ejemplo, midjourney ha aprovechado esta tecnología para producir imágenes realistas impresionantes. Esta publicación reciente desmitifica Midjourney en una guía detallada, explicando tanto la plataforma como las complejidades de la ingeniería de promociones. Además, plataformas como Alpaca AI y Photoroom AI utilizan la Inteligencia Artificial Generativa para funcionalidades avanzadas de edición de imágenes, como la eliminación de fondos, la eliminación de objetos y even la restauración de rostros.

Producción de Video

La producción de video, aunque aún en su etapa temprana en el reino de la Inteligencia Artificial Generativa, está mostrando avances prometedores. Plataformas como Imagen Video, Meta Make A Video y Runway Gen-2 están empujando los límites de lo posible, aunque los resultados verdaderamente realistas aún están en el horizonte. Estos modelos ofrecen una utilidad sustancial para la creación de videos digitales humanos, con aplicaciones como Synthesia y SuperCreator a la vanguardia. Notablemente, Tavus AI ofrece una propuesta de valor única al personalizar videos para miembros individuales de la audiencia, un beneficio para las empresas.

Creación de Código

La codificación, un aspecto indispensable de nuestro mundo digital, no ha quedado intacta por la Inteligencia Artificial Generativa. Aunque ChatGPT es una herramienta favorita, varias aplicaciones de AI han sido desarrolladas para propósitos de codificación. Estas plataformas, como GitHub Copilot, Alphacode y CodeComplete, sirven como asistentes de codificación y pueden incluso producir código a partir de promociones textuales. Lo intrigante es la adaptabilidad de estas herramientas. Codex, la fuerza impulsora detrás de GitHub Copilot, se puede personalizar para el estilo de codificación de un individuo, subrayando el potencial de personalización de la Inteligencia Artificial Generativa.

Conclusión

Combinando la creatividad humana con la computación de las máquinas, ha evolucionado hasta convertirse en una herramienta invaluable, con plataformas como ChatGPT y DALL-E 2 empujando los límites de lo concebible. Desde la creación de contenido textual hasta la escultura de obras maestras visuales, sus aplicaciones son vastas y variadas.

Como con cualquier tecnología, las implicaciones éticas son primordiales. Mientras que la Inteligencia Artificial Generativa promete una creatividad ilimitada, es crucial emplearla de manera responsable, siendo conscientes de posibles sesgos y el poder de la manipulación de datos.

Con herramientas como ChatGPT volviéndose más accesibles, ahora es el momento perfecto para probar el agua y experimentar. Ya sea que seas un artista, un codificador o un entusiasta de la tecnología, el reino de la Inteligencia Artificial Generativa está lleno de posibilidades esperando ser exploradas. La revolución no está en el horizonte; está aquí y ahora. Así que, ¡Sumérgete!

He dedicado los últimos cinco años sumergiéndome en el fascinante mundo de Machine Learning y Deep Learning. Mi pasión y experiencia me han llevado a contribuir a más de 50 proyectos de ingeniería de software diversos, con un enfoque particular en AI/ML. Mi curiosidad en curso también me ha llevado hacia el Procesamiento de Lenguaje Natural, un campo que estoy ansioso por explorar más a fondo.