Líderes de opinión

¿Acercará GPT-4 a una verdadera revolución de la IA?

mm
Añade Unite.AI a tus fuentes preferidas en Google

Han pasado casi tres años desde que se introdujo GPT-3, en mayo de 2020. Desde entonces, el modelo de generación de texto de IA ha generado mucho interés por su capacidad para crear textos que parecen y suenan como si hubieran sido escritos por un ser humano. Ahora parece que la próxima iteración del software, GPT-4, está a la vuelta de la esquina, con una fecha de lanzamiento estimada para principios de 2023.

A pesar de la gran expectación que rodea a esta noticia de IA, los detalles exactos sobre GPT-4 han sido bastante escasos. OpenAI, la empresa detrás de GPT-4, no ha divulgado públicamente mucha información sobre el nuevo modelo, como sus características o capacidades. Sin embargo, los recientes avances en el campo de la IA, particularmente en lo que respecta al Procesamiento de Lenguaje Natural (NLP), pueden ofrecer algunas pistas sobre lo que podemos esperar de GPT-4.

¿Qué es GPT?

Antes de entrar en los detalles, es útil establecer una base sobre qué es GPT. GPT significa Generative Pre-trained Transformer y se refiere a un modelo de red neuronal de aprendizaje profundo que se entrena con datos disponibles en Internet para crear grandes volúmenes de texto generado por máquina. GPT-3 es la tercera generación de esta tecnología y es uno de los modelos de generación de texto de IA más avanzados disponibles actualmente.

Imagina GPT-3 como una especie de asistente de voz, como Siri o Alexa, pero a una escala mucho mayor. En lugar de pedirle a Alexa que reproduzca tu canción favorita o que Siri escriba un mensaje de texto, puedes pedirle a GPT-3 que escriba un eBook completo en unos minutos o genere 100 ideas de publicaciones en redes sociales en menos de un minuto. Todo lo que el usuario necesita hacer es proporcionar una llamada, como “Escribe un artículo de 500 palabras sobre la importancia de la creatividad”. Siempre que la llamada sea clara y específica, GPT-3 puede escribir casi cualquier cosa que se le pida.

Desde su lanzamiento al público en general, GPT-3 ha encontrado muchas aplicaciones comerciales. Las empresas lo están utilizando para resumen de textos, traducción de lenguaje, generación de código y automatización a gran escala de casi cualquier tarea de escritura.

Dicho esto, aunque GPT-3 es sin duda muy impresionante en su capacidad para crear textos muy legibles y similares a los humanos, está lejos de ser perfecto. Los problemas tienden a surgir cuando se le pide que escriba piezas más largas, especialmente cuando se trata de temas complejos que requieren perspicacia. Por ejemplo, una llamada para generar código de computadora para un sitio web puede devolver código correcto pero subóptimo, por lo que un codificador humano todavía tiene que entrar y hacer mejoras. Es un problema similar con los documentos de texto grandes: cuanto mayor sea el volumen de texto, más probable es que aparezcan errores, a veces divertidos, que necesitan ser corregidos por un escritor humano.

En resumen, GPT-3 no es un reemplazo completo para los escritores o codificadores humanos, y no debería considerarse como tal. En cambio, GPT-3 debe considerarse como un asistente de escritura, uno que puede ahorrar a las personas mucho tiempo cuando necesitan generar ideas para publicaciones en blogs o bosquejos para copias publicitarias o comunicados de prensa.

¿Más parámetros = mejor?

Una cosa que hay que entender sobre los modelos de IA es cómo utilizan parámetros para hacer predicciones. Los parámetros de un modelo de IA definen el proceso de aprendizaje y proporcionan estructura para la salida. El número de parámetros en un modelo de IA se ha utilizado generalmente como una medida de rendimiento. Cuantos más parámetros, más poderoso, suave y predecible es el modelo, al menos según la hipótesis de escalado.

Por ejemplo, cuando se lanzó GPT-1 en 2018, tenía 117 millones de parámetros. GPT-2, lanzado un año después, tenía 1.200 millones de parámetros, mientras que GPT-3 elevó el número aún más alto a 175.000 millones de parámetros. Según una entrevista de agosto de 2021 con Wired, Andrew Feldman, fundador y director ejecutivo de Cerebras, una empresa que se asocia con OpenAI, mencionó que GPT-4 tendría alrededor de 100 billones de parámetros. Esto haría que GPT-4 sea 100 veces más poderoso que GPT-3, un salto cuántico en el tamaño de los parámetros que, comprensiblemente, ha generado mucha emoción.

Sin embargo, a pesar de la afirmación ambiciosa de Feldman, hay buenas razones para pensar que GPT-4 no tendrá en realidad 100 billones de parámetros. Cuanto mayor sea el número de parámetros, más caro se vuelve el modelo para entrenar y ajustar debido a las vastas cantidades de poder computacional requeridas.

Además, hay más factores que solo el número de parámetros que determinan la efectividad de un modelo. Por ejemplo, Megatron-Turing NLG, un modelo de generación de texto construido por Nvidia y Microsoft, tiene más de 500.000 millones de parámetros. A pesar de su tamaño, MT-NLG no se acerca a GPT-3 en términos de rendimiento. En resumen, más grande no necesariamente significa mejor.

Es probable que GPT-4 tenga más parámetros que GPT-3, pero aún no se sabe si ese número será un orden de magnitud mayor. En cambio, hay otras posibilidades intrigantes que OpenAI probablemente está persiguiendo, como un modelo más delgado que se centre en mejoras cualitativas en el diseño algorítmico y la alineación. El impacto exacto de tales mejoras es difícil de predecir, pero lo que se sabe es que un modelo disperso puede reducir los costos de cómputo a través de lo que se llama cálculo condicional, es decir, no todos los parámetros del modelo de IA estarán activos todo el tiempo, lo que es similar a cómo operan las neuronas en el cerebro humano.

¿Qué podrá hacer GPT-4?

Hasta que OpenAI emita una nueva declaración o incluso lance GPT-4, nos queda especular sobre cómo diferirá de GPT-3. Sin embargo, podemos hacer algunas predicciones

Aunque el futuro del desarrollo de aprendizaje profundo de IA es multimodal, GPT-4 probablemente seguirá siendo solo de texto. Como seres humanos, vivimos en un mundo multisensorial que está lleno de diferentes entradas de audio, visuales y textuales. Por lo tanto, es inevitable que el desarrollo de IA eventualmente produzca un modelo multimodal que pueda incorporar una variedad de entradas.

Sin embargo, un buen modelo multimodal es significativamente más difícil de diseñar que un modelo solo de texto. La tecnología simplemente no está allí todavía y, basándonos en lo que sabemos sobre los límites del tamaño de los parámetros, es probable que OpenAI se centre en expandir y mejorar un modelo solo de texto.

También es probable que GPT-4 sea menos dependiente de llamadas precisas. Una de las desventajas de GPT-3 es que las llamadas de texto necesitan ser escritas con cuidado para obtener el resultado deseado. Cuando las llamadas no están escritas con cuidado, puedes terminar con salidas que son falsas, tóxicas o incluso reflejan puntos de vista extremistas. Esto es parte de lo que se conoce como el “problema de alineación” y se refiere a los desafíos para crear un modelo de IA que comprenda completamente las intenciones del usuario. En otras palabras, el modelo de IA no está alineado con las metas o intenciones del usuario. Dado que los modelos de IA se entrenan utilizando conjuntos de datos de texto de Internet, es muy fácil que los sesgos humanos, falsedades y prejuicios se filtren en las salidas de texto.

Dicho esto, hay buenas razones para creer que los desarrolladores están haciendo progresos en el problema de alineación. Esta optimismo proviene de algunos avances en el desarrollo de InstructGPT, una versión más avanzada de GPT-3 que se entrena con retroalimentación humana para seguir instrucciones y intenciones del usuario más de cerca. Los jueces humanos encontraron que InstructGPT era mucho menos dependiente que GPT-3 de llamadas buenas.

Sin embargo, debe tenerse en cuenta que estas pruebas se llevaron a cabo solo con empleados de OpenAI, un grupo bastante homogéneo que puede no diferir mucho en género, religión o puntos de vista políticos. Es probable que GPT-4 sufra un entrenamiento más diverso que mejorará la alineación para diferentes grupos, aunque aún no se sabe hasta qué punto.

¿Reemplazará GPT-4 a los humanos?

A pesar de la promesa de GPT-4, es poco probable que reemplace completamente la necesidad de escritores y codificadores humanos. Todavía hay mucho trabajo por hacer en todo, desde la optimización de parámetros hasta la multimodalidad y la alineación. Puede que pasen muchos años antes de que veamos un generador de texto que pueda lograr una comprensión verdaderamente humana de las complejidades y matices de la experiencia real.

Aun así, hay buenas razones para estar emocionado con la llegada de GPT-4. La optimización de parámetros, en lugar de solo el crecimiento de parámetros, probablemente conducirá a un modelo de IA que tenga mucha más potencia de cómputo que su predecesor. Y una mejor alineación probablemente hará que GPT-4 sea mucho más amigable para el usuario.

Además, todavía estamos solo al comienzo del desarrollo y la adopción de herramientas de IA. Se están encontrando constantemente más casos de uso para la tecnología, y a medida que las personas ganan más confianza y comodidad al usar IA en el lugar de trabajo, es casi seguro que veremos una adopción generalizada de herramientas de IA en casi todos los sectores empresariales en los próximos años.

Dr. Danny Rittman, es el CTO de GBT Technologies, una solución diseñada para permitir el despliegue de IoT (Internet de las cosas), redes mesh globales, inteligencia artificial y para aplicaciones relacionadas con el diseño de circuitos integrados.