Ingeniería de prompts

Prompting Analógico y de Retroceso: Una Inmersión en las Recientes Mejoras de Google DeepMind

mm
Añade Unite.AI a tus fuentes preferidas en Google
Google DeepMind Prompt Engineering new Research

Introducción

La ingeniería de prompts se centra en diseñar prompts efectivos para guiar a los Grandes Modelos de Lenguaje (LLM) como GPT-4 para generar respuestas deseables. Un prompt bien elaborado puede ser la diferencia entre una respuesta vaga o inexacta y una precisa e informativa.

En el ecosistema más amplio de la IA, la ingeniería de prompts es uno de los varios métodos utilizados para extraer información más precisa y contextualmente relevante de los modelos de lenguaje. Otros incluyen técnicas como el aprendizaje de pocos ejemplos, donde el modelo se le proporcionan algunos ejemplos para ayudarlo a entender la tarea, y el ajuste fino, donde el modelo se entrena más en un conjunto de datos más pequeño para especializar sus respuestas.

Google DeepMind (GOOGL ) ha publicado recientemente dos artículos que se adentran en la ingeniería de prompts y su potencial para mejorar las respuestas en múltiples situaciones.

Estos artículos son parte de la exploración en curso en la comunidad de la IA para refinar y optimizar cómo nos comunicamos con los modelos de lenguaje, y proporcionan nuevas perspectivas sobre cómo estructurar prompts para una mejor manipulación de consultas y interacción con bases de datos.

Este artículo se adentra en los detalles de estos artículos de investigación, explicando los conceptos, metodologías e implicaciones de las técnicas propuestas, haciéndolos accesibles incluso para lectores con conocimientos limitados en IA y NLP.

Artículo 1: Grandes Modelos de Lenguaje como Razonadores Analógicos

El primer artículo, titulado “Grandes Modelos de Lenguaje como Razonadores Analógicos”, introduce un nuevo enfoque de prompting llamado Prompting Analógico. Los autores, Michihiro Yasunaga, Xinyun Chen y otros, se inspiran en el razonamiento analógico, un proceso cognitivo en el que los humanos aprovechan experiencias pasadas para abordar nuevos problemas.

Conceptos clave y Metodología

El Prompting Analógico anima a los LLM a auto-generar ejemplos o conocimientos relevantes en contexto antes de proceder a resolver un problema determinado. Este enfoque elimina la necesidad de ejemplos etiquetados, ofreciendo generalidad y conveniencia, y adapta los ejemplos generados a cada problema específico, garantizando adaptabilidad.

Izquierda: Los métodos tradicionales de prompting de LLM confían en entradas genéricas (0-disparos CoT) o necesitan ejemplos etiquetados (pocos disparos CoT). Derecha: El enfoque novel prompt a los LLM para auto-crear ejemplos relevantes antes de resolver el problema, eliminando la necesidad de etiquetado mientras se personalizan los ejemplos para cada problema único

Izquierda: Los métodos tradicionales de prompting de LLM confían en entradas genéricas (0-disparos CoT) o necesitan ejemplos etiquetados (pocos disparos CoT). Derecha: El enfoque novel prompt a los LLM para auto-crear ejemplos relevantes antes de resolver el problema, eliminando la necesidad de etiquetado mientras se personalizan los ejemplos para cada problema único

Ejemplos Auto-Generados

La primera técnica presentada en el artículo es la de ejemplos auto-generados. La idea es aprovechar el conocimiento extenso que los LLM han adquirido durante su entrenamiento para ayudarlos a resolver nuevos problemas. El proceso implica aumentar un problema objetivo con instrucciones que prompt al modelo para recordar o generar problemas y soluciones relevantes.

Por ejemplo, dado un problema, el modelo se instruye para recordar tres problemas distintos y relevantes, describirlos y explicar sus soluciones. Este proceso está diseñado para llevarse a cabo en una sola pasada, permitiendo que el LLM genere ejemplos relevantes y resuelva el problema inicial de manera fluida. El uso de símbolos ‘#’ en los prompts ayuda en la estructuración de la respuesta, haciéndola más organizada y fácil de seguir para el modelo.

Las decisiones técnicas clave resaltadas en el artículo incluyen el énfasis en generar ejemplos relevantes y diversos, la adopción de un enfoque de una sola pasada para una mayor conveniencia, y el hallazgo de que generar tres a cinco ejemplos produce los mejores resultados.

Conocimiento Auto-Generado + Ejemplos

La segunda técnica, conocimiento auto-generado + ejemplos, se introduce para abordar desafíos en tareas más complejas, como la generación de código. En estos escenarios, los LLM pueden confiar demasiado en ejemplos de bajo nivel y luchar por generalizar al resolver el problema objetivo. Para mitigar esto, los autores proponen mejorar el prompt con una instrucción adicional que anima al modelo a identificar conceptos clave en el problema y proporcionar un tutorial o una idea de alto nivel.

Una consideración crítica es el orden en el que se generan el conocimiento y los ejemplos. Los autores encontraron que generar conocimiento antes de los ejemplos conduce a mejores resultados, ya que ayuda al LLM a centrarse en los enfoques fundamentales de resolución de problemas en lugar de solo similitudes de superficie.

Ventajas y Aplicaciones

El enfoque de prompting analógico ofrece varias ventajas. Proporciona ejemplos detallados de razonamiento sin la necesidad de etiquetado manual, abordando desafíos asociados con los métodos 0-disparos y pocos disparos de cadena de pensamiento (CoT). Además, los ejemplos generados están personalizados para problemas individuales, ofreciendo una guía más relevante que los métodos tradicionales de pocos disparos CoT, que utilizan ejemplos fijos.

El artículo demuestra la efectividad de este enfoque en various tareas de razonamiento, incluyendo la resolución de problemas matemáticos, la generación de código y otras tareas de razonamiento en BIG-Bench.

Las siguientes tablas presentan métricas de rendimiento de varios métodos de prompting en diferentes arquitecturas de modelos. Destacablemente, el método “Ejemplos Auto-Generados” supera consistentemente a otros métodos en términos de precisión. En la precisión de GSM8K, este método logra el mejor rendimiento en el modelo PaLM2 con un 81,7%. De manera similar, para la precisión en MATH, encabeza la lista en GPT3.5-turbo con un 37,3%.

Rendimiento en tareas matemáticas, GSM8K y MATH

Rendimiento en tareas matemáticas, GSM8K y MATH

En la segunda tabla, para los modelos GPT3.5-turbo-16k y GPT4, “Conocimiento Auto-Generado + Ejemplos” muestra el mejor rendimiento.

Rendimiento en la tarea de generación de código Codeforces

Rendimiento en la tarea de generación de código Codeforces

Artículo 2: Retrocede: Evocando Razonamiento a través de la Abstracción en Grandes Modelos de Lenguaje

Visión General

El segundo artículo, “Retrocede: Evocando Razonamiento a través de la Abstracción en Grandes Modelos de Lenguaje” presenta el Prompting de Retroceso, una técnica que anima a los LLM a abstraer conceptos de alto nivel y principios fundamentales de instancias detalladas. Los autores, Huaixiu Steven Zheng, Swaroop Mishra, y otros, apuntan a mejorar las capacidades de razonamiento de los LLM guiándolos para que sigan un camino de razonamiento correcto hacia la solución.

Ilustrando el PROMPTING DE RETROCESO a través de dos fases de Abstracción y Razonamiento, guiado por conceptos y principios clave.

Ilustrando el PROMPTING DE RETROCESO a través de dos fases de Abstracción y Razonamiento, guiado por conceptos y principios clave.

Vamos a crear un ejemplo más simple utilizando una pregunta matemática básica para demostrar la técnica de “Pregunta de Retroceso”:

Pregunta Original: Si un tren viaja a una velocidad de 60 km/h y cubre una distancia de 120 km, ¿cuánto tiempo tardará?

Opciones:

3 horas
2 horas
1 hora
4 horas
Respuesta Original [Incorrecta]: La respuesta correcta es 1).

Pregunta de Retroceso: ¿Cuál es la fórmula básica para calcular el tiempo dado la velocidad y la distancia?

Principios:
Para calcular el tiempo, se utiliza la fórmula:
Tiempo = Distancia / Velocidad

Respuesta Final:
Utilizando la fórmula, Tiempo = 120 km / 60 km/h = 2 horas.
La respuesta correcta es 2) 2 horas.

Aunque los LLM actuales pueden responder fácilmente a la pregunta anterior, este ejemplo solo demuestra cómo funcionaría la técnica de retroceso. Para escenarios más desafiantes, la misma técnica se puede aplicar para abordar y resolver el problema de manera sistemática. A continuación, se muestra un caso más complejo demostrado en el artículo:

PROMPTING DE RETROCESO en el conjunto de datos MMLU-Química

PROMPTING DE RETROCESO en el conjunto de datos MMLU-Química

Conceptos Clave y Metodología

La esencia del Prompting de Retroceso radica en su capacidad para hacer que los LLM den un paso atrás, animándolos a mirar el panorama general en lugar de perderse en los detalles. Esto se logra a través de una serie de prompts cuidadosamente elaborados que guían a los LLM para abstraer información, derivar conceptos de alto nivel y aplicarlos para resolver el problema dado.

El proceso comienza con el LLM siendo prompteado para abstraer detalles de las instancias dadas, animándolo a centrarse en los conceptos y principios subyacentes. Este paso es crucial ya que establece el escenario para que el LLM aborde el problema desde una perspectiva más informada y principled.

Una vez que se derivan los conceptos de alto nivel, se utilizan para guiar al LLM a través de los pasos de razonamiento hacia la solución. Esta guía asegura que el LLM permanezca en el camino correcto, siguiendo una ruta lógica y coherente que se basa en los conceptos y principios abstractados.

Los autores llevan a cabo una serie de experimentos para validar la efectividad del Prompting de Retroceso, utilizando modelos PaLM-2L en una variedad de tareas desafiantes que requieren razonamiento. Estas tareas incluyen problemas de STEM, preguntas de conocimiento y razonamiento de múltiples saltos, proporcionando una base de prueba integral para evaluar la técnica.

Mejoras Sustanciales en Todas las Tareas

Los resultados son impresionantes, con el Prompting de Retroceso que conduce a ganancias significativas de rendimiento en todas las tareas. Por ejemplo, la técnica mejora el rendimiento del modelo PaLM-2L en MMLU Física y Química en un 7% y un 11%, respectivamente. De manera similar, mejora el rendimiento en TimeQA en un 27% y en MuSiQue en un 7%.

Rendimiento del PROMPTING DE RETROCESO

Rendimiento del PROMPTING DE RETROCESO vs CoT

Estos resultados subrayan el potencial del Prompting de Retroceso para mejorar significativamente las capacidades de razonamiento de los LLM.

Conclusión

Ambos artículos de Google DeepMind presentan enfoques innovadores para la ingeniería de prompts, con el objetivo de mejorar las capacidades de razonamiento de los grandes modelos de lenguaje. El Prompting Analógico aprovecha el concepto de razonamiento analógico, animando a los modelos a generar sus propios ejemplos y conocimiento, lo que conduce a una resolución de problemas más adaptable y eficiente. Por otro lado, el Prompting de Retroceso se centra en la abstracción, guiando a los modelos para derivar conceptos de alto nivel y principios, lo que a su vez mejora sus capacidades de razonamiento.

Estos artículos de investigación proporcionan valiosas perspectivas y metodologías que se pueden aplicar en various dominios, lo que conduce a modelos de lenguaje más inteligentes y capaces. A medida que continuamos explorando y comprendiendo las complejidades de la ingeniería de prompts, estos enfoques sirven como piedras angulares cruciales hacia el logro de sistemas de IA más avanzados y sofisticados.

He dedicado los últimos cinco años sumergiéndome en el fascinante mundo de Machine Learning y Deep Learning. Mi pasión y experiencia me han llevado a contribuir a más de 50 proyectos de ingeniería de software diversos, con un enfoque particular en AI/ML. Mi curiosidad en curso también me ha llevado hacia el Procesamiento de Lenguaje Natural, un campo que estoy ansioso por explorar más a fondo.