Líderes de opinión
¿Qué tan bien pueden razonar los LLM a través de problemas complicados?
La introducción y evolución de la inteligencia artificial generativa ha sido tan repentina e intensa que es difícil apreciar completamente cuánto ha cambiado esta tecnología nuestras vidas.
Si retrocedemos solo tres años. Sí, la IA se estaba volviendo más común, al menos en teoría. Más personas conocían algunas de las cosas que podía hacer, aunque incluso con eso había malentendidos masivos sobre las capacidades de la IA. De alguna manera, la tecnología recibió simultáneamente demasiado y muy poco crédito por lo que realmente podía lograr. Sin embargo, la persona promedio podía señalar al menos un par de áreas donde la IA estaba trabajando, realizando tareas altamente especializadas bastante bien, en entornos altamente controlados. Cualquier cosa más allá de eso estaba either en un laboratorio de investigación o simplemente no existía.
Compare eso con hoy en día. Con cero habilidades, aparte de la capacidad de escribir una oración o hacer una pregunta, el mundo está a nuestro alcance. Podemos generar imágenes, música e incluso películas que son verdaderamente únicas y asombrosas, y tienen la capacidad de disruptar industrias enteras. Podemos supercargar nuestro proceso de búsqueda, hacer una pregunta simple que, si se formula correctamente, puede generar páginas de contenido personalizado lo suficientemente bueno como para pasar por un académico universitario… o un estudiante de tercer grado promedio si especificamos la perspectiva. Aunque han pasado de ser consideradas imposibles a ser comunes en solo un año o dos, estas capacidades eran consideradas absolutamente imposibles hace solo unos pocos años. El campo de la inteligencia artificial generativa existía pero no había despegado de ninguna manera.
Hoy en día, muchas personas han experimentado con la inteligencia artificial generativa, como ChatGPT, Midjourney o otras herramientas. Otros ya las han incorporado a su vida diaria. La velocidad a la que han evolucionado es abrasadora, hasta el punto de ser casi alarmante. Y dado el ritmo de los últimos seis meses, sin duda nos sorprenderán una y otra vez en los próximos años.
Una herramienta específica en juego dentro de la inteligencia artificial generativa ha sido el rendimiento de los sistemas de generación mejorada con recuperación (RAG) y su capacidad para pensar a través de consultas especialmente complejas. La introducción del conjunto de datos FRAMES, explicado en detalle en un artículo sobre cómo funciona el conjunto de datos de evaluación, muestra tanto dónde está el estado actual del arte como hacia dónde se dirige. Incluso desde la introducción de FRAMES a finales de 2024, varias plataformas ya han roto récords en su capacidad para razonar a través de consultas difíciles y complejas.
Vamos a profundizar en lo que FRAMES está diseñado para evaluar y cómo están funcionando los diferentes modelos de inteligencia artificial generativa. Podemos ver cómo tanto la descentralización como las plataformas de código abierto no solo están manteniendo su terreno (notablemente Sentient Chat), sino que también permiten a los usuarios obtener una visión clara de la asombrosa capacidad de razonamiento que algunos modelos de IA son capaces de lograr.
FRAMES como una ventana al cerebro de la GenAI
El conjunto de datos FRAMES y su proceso de evaluación se centra en 824 preguntas “de varios saltos” diseñadas para requerir inferencia, conexión lógica de puntos, el uso de varias fuentes diferentes para recuperar información clave y la capacidad de unir lógicamente todas esas fuentes para responder a la pregunta. Las preguntas necesitan entre dos y 15 documentos para responderlas correctamente y también incluyen intencionalmente restricciones, cálculos matemáticos y deducciones, así como la capacidad de procesar lógica basada en el tiempo. En otras palabras, estas preguntas son extremadamente difíciles y representan muy bien los desafíos de investigación del mundo real que un humano podría emprender en Internet. Nos enfrentamos a estos desafíos todo el tiempo y debemos buscar las piezas clave de información dispersas en un mar de fuentes de Internet, uniendo la información basada en diferentes sitios, creando nueva información mediante cálculos y deducciones, y entendiendo cómo consolidar estos hechos en una respuesta correcta a la pregunta.
Lo que encontraron los investigadores cuando el conjunto de datos se lanzó y se probó por primera vez es que los mejores modelos de GenAI podían ser algo precisos (alrededor del 40%) cuando tenían que responder utilizando métodos de un solo paso, pero podían lograr una precisión del 73% si se les permitía recopilar todos los documentos necesarios para responder a la pregunta. Sí, el 73% puede no parecer una revolución. Pero si se entiende exactamente qué se tiene que responder, el número se vuelve mucho más impresionante.
Por ejemplo, una pregunta en particular es: “¿En qué año nació el líder de la banda que originalmente interpretó la canción que se samplea en la canción de Kanye West Power?” ¿Cómo abordaría un humano este problema? La persona podría ver que necesita recopilar varios elementos de información, como las letras de la canción de Kanye West llamada “Power”, y luego ser capaz de buscar en las letras e identificar el punto en la canción donde se samplea realmente otra canción. Podemos, como humanos, probablemente escuchar la canción (incluso si no estamos familiarizados con ella) y ser capaces de decir cuándo se samplea una canción diferente.
Pero piénsalo: ¿qué tendría que lograr un GenAI para detectar una canción diferente a la original mientras “escucha” la canción? Aquí es donde una pregunta básica se convierte en una excelente prueba de IA verdaderamente inteligente. Y si podemos encontrar la canción, escucharla e identificar las letras sampleadas, eso es solo el paso 1. Todavía necesitamos averiguar el nombre de la canción, la banda, quién es el líder de esa banda y luego en qué año nació esa persona.
FRAMES muestra que para responder preguntas realistas, se necesita una enorme cantidad de procesamiento de pensamiento. Dos cosas vienen a la mente aquí.
Primero, la capacidad de los modelos de GenAI descentralizados para no solo competir, sino potencialmente dominar los resultados, es increíble. Un número creciente de empresas están utilizando el método descentralizado para ampliar sus capacidades de procesamiento mientras aseguran que una gran comunidad posea el software, no una caja negra centralizada que no compartirá sus avances. Empresas como Perplexity y Sentient están liderando esta tendencia, cada una con modelos formidables que funcionan por encima de los primeros registros de precisión cuando se lanzó FRAMES.
El segundo elemento es que un número menor de estos modelos de IA no solo son descentralizados, sino también de código abierto. Por ejemplo, Sentient Chat es ambos, y las primeras pruebas muestran qué tan compleja puede ser su capacidad de razonamiento, gracias al acceso invaluable de código abierto. La pregunta de FRAMES anterior se responde utilizando más o menos el mismo proceso de pensamiento que un humano utilizaría, con los detalles de su razonamiento disponibles para revisión. Quizás incluso más interesante, su plataforma está estructurada como una serie de modelos que pueden afinar una perspectiva y rendimiento dados, incluso si el proceso de afinamiento en algunos modelos de GenAI resulta en una precisión disminuida. En el caso de Sentient Chat, se han desarrollado muchos modelos diferentes. Por ejemplo, un modelo reciente llamado “Dobby 8B” es capaz de superar la referencia de FRAMES, pero también desarrollar una actitud distintiva a favor de las criptomonedas y la libertad, lo que afecta la perspectiva del modelo a medida que procesa piezas de información y desarrolla una respuesta.
En el horizonte
La clave de todas estas innovaciones asombrosas es la velocidad rápida que nos trajo aquí. Tenemos que reconocer que, tan rápido como esta tecnología ha evolucionado, solo va a evolucionar aún más rápido en el futuro cercano. Podremos ver, especialmente con modelos de GenAI descentralizados y de código abierto, ese umbral crucial en el que la inteligencia del sistema comienza a superar cada vez más la nuestra, y qué significa eso para el futuro.












