Modelos y plataformas de IA
¿Por qué los grandes modelos de lenguaje saltan instrucciones y cómo abordar el problema

Los grandes modelos de lenguaje (LLM) se han convertido rápidamente en herramientas indispensables de Inteligencia Artificial (IA), impulsando aplicaciones desde chatbots y creación de contenido hasta asistencia para codificar. A pesar de sus impresionantes capacidades, un desafío común que enfrentan los usuarios es que estos modelos a veces saltan partes de las instrucciones que reciben, especialmente cuando esas instrucciones son largas o involucran múltiples pasos. Este salto conduce a resultados incompletos o inexactos, lo que puede causar confusión y erosionar la confianza en los sistemas de IA. Entender por qué los LLM saltan instrucciones y cómo abordar este problema es esencial para los usuarios que dependen de estos modelos para obtener resultados precisos y confiables.
¿Por qué los LLM saltan instrucciones?
Los LLM funcionan leyendo el texto de entrada como una secuencia de tokens. Los tokens son las pequeñas piezas en que se divide el texto. El modelo procesa estos tokens uno después de otro, desde el principio hasta el final. Esto significa que las instrucciones al comienzo de la entrada tienden a recibir más atención. Las instrucciones posteriores pueden recibir menos atención y pueden ser ignoradas.
Esto sucede porque los LLM tienen una capacidad de atención limitada. La atención es el mecanismo que los modelos utilizan para decidir qué partes de la entrada son esenciales al generar respuestas. Cuando la entrada es corta, la atención funciona bien. Pero la atención se debilita a medida que la entrada se vuelve más larga o las instrucciones se vuelven complejas. Esto debilita el enfoque en las partes posteriores, lo que causa el salto.
Además, muchas instrucciones al mismo tiempo aumentan la complejidad. Cuando las instrucciones se superponen o entran en conflicto, los modelos pueden confundirse. Pueden intentar responder a todo, pero producir respuestas vagas o contradictorias. Esto a menudo resulta en la omisión de algunas instrucciones.
Los LLM también comparten algunos límites similares a los humanos. Por ejemplo, los humanos pueden perder el enfoque al leer textos largos o repetitivos. De manera similar, los LLM pueden olvidar instrucciones posteriores a medida que procesan más tokens. Esta pérdida de enfoque es parte del diseño y los límites del modelo.
Otra razón es cómo se entrenan los LLM. Ven muchos ejemplos de instrucciones simples, pero menos instrucciones complejas y multi-paso. Debido a esto, los modelos tienden a preferir seguir instrucciones más simples que son más comunes en sus datos de entrenamiento. Este sesgo los lleva a saltar instrucciones complejas. Además, los límites de tokens restringen la cantidad de entrada que el modelo puede procesar. Cuando las entradas exceden estos límites, las instrucciones más allá del límite son ignoradas.
Ejemplo: Supongamos que le da a un LLM cinco instrucciones en una sola llamada. El modelo puede enfocarse principalmente en las dos primeras instrucciones y parcial o completamente ignorar las tres últimas. Esto afecta directamente cómo el modelo procesa tokens secuencialmente y sus limitaciones de atención.
¿Cómo manejan los LLM las instrucciones secuenciales según los hallazgos de SIFo 2024
Estudios recientes han examinado cuidadosamente cómo siguen los LLM varias instrucciones dadas una después de otra. Un estudio importante es el Benchmark de Seguimiento de Instrucciones Secuenciales (SIFo) 2024. Este benchmark prueba modelos en tareas que requieren la finalización secuencial de instrucciones, como la modificación de texto, la respuesta a preguntas, las matemáticas y el seguimiento de reglas de seguridad. Cada instrucción en la secuencia depende de la finalización correcta de la anterior. Este enfoque ayuda a verificar si el modelo ha seguido toda la secuencia adecuadamente.
Los resultados de SIFo muestran que incluso los mejores LLM, como GPT-4 y Claude-3, a menudo tienen dificultades para completar todas las instrucciones correctamente. Esto es especialmente cierto cuando las instrucciones son largas o complicadas. La investigación señala tres problemas principales que enfrentan los LLM al seguir instrucciones:
Comprensión: Comprender completamente lo que significa cada instrucción.
Razonamiento: Conectar varias instrucciones de manera lógica para mantener la respuesta clara.
Salida confiable: Producir respuestas completas y precisas, cubriendo todas las instrucciones dadas.
Técnicas como la ingeniería de prompt y el ajuste fino ayudan a mejorar cómo siguen los modelos las instrucciones. Sin embargo, estos métodos no ayudan completamente con el problema de saltar instrucciones. Utilizar Aprendizaje Reforzado con Retroalimentación Humana (RLHF) mejora aún más la capacidad del modelo para responder adecuadamente. Sin embargo, los modelos tienen dificultades cuando las instrucciones requieren muchos pasos o son muy complejas.
El estudio también muestra que los LLM funcionan mejor cuando las instrucciones son simples, claramente separadas y bien organizadas. Cuando las tareas requieren cadenas de razonamiento largas o muchos pasos, la precisión del modelo disminuye. Estos hallazgos ayudan a sugerir mejores formas de utilizar los LLM y muestran la necesidad de construir modelos más fuertes que puedan seguir instrucciones secuenciales.
¿Por qué los LLM saltan instrucciones: Desafíos técnicos y consideraciones prácticas
Los LLM pueden saltar instrucciones debido a varios factores técnicos y prácticos arraigados en cómo procesan y codifican el texto de entrada.
Capacidad de atención limitada y dilución de la información
Los LLM confían en mecanismos de atención para asignar importancia a diferentes partes de la entrada. Cuando las llamadas son concisas, la atención del modelo es enfocada y efectiva. Sin embargo, a medida que la llamada crece en longitud o se vuelve más repetitiva, la atención se diluye, y los tokens o instrucciones posteriores reciben menos atención, aumentando la probabilidad de que sean pasados por alto. Este fenómeno, conocido como dilución de la información, es especialmente problemático para instrucciones que aparecen al final de una llamada. Además, los modelos tienen límites de tokens fijos (por ejemplo, 2048 tokens); cualquier texto más allá de este umbral es truncado e ignorado, lo que causa que las instrucciones al final sean saltadas por completo.
Complejidad de la salida y ambigüedad
Los LLM pueden luchar con la generación de respuestas claras y completas cuando enfrentan múltiples o conflictivas instrucciones. El modelo puede generar respuestas parciales o vagas para evitar contradicciones o confusión, efectivamente omitiendo algunas instrucciones. La ambigüedad en cómo se formulan las instrucciones también plantea desafíos: las instrucciones poco claras o imprecisas hacen que sea difícil para el modelo determinar las acciones pretendidas, lo que aumenta el riesgo de saltar o malinterpretar partes de la entrada.
Diseño y sensibilidad de formato de la llamada
La estructura y redacción de las llamadas también juegan un papel crítico en el seguimiento de instrucciones. La investigación muestra que incluso pequeños cambios en cómo se escriben o formatean las instrucciones pueden impactar significativamente si el modelo se adhiere a ellas.
Las llamadas mal estructuradas, que carecen de separación clara, puntos o numeración, hacen que sea más difícil para el modelo distinguir entre pasos, lo que aumenta la probabilidad de fusionar o omitir instrucciones. La representación interna del modelo de la llamada es altamente sensible a estas variaciones, lo que explica por qué la ingeniería de llamadas (reformulación o reestructuración de llamadas) puede mejorar sustancialmente la adherencia a las instrucciones, incluso si el contenido subyacente permanece igual.
¿Cómo arreglar el salto de instrucciones en los LLM
Mejorar la capacidad de los LLM para seguir instrucciones con precisión es esencial para producir resultados confiables y precisos. Las siguientes mejores prácticas deben considerarse para minimizar el salto de instrucciones y mejorar la calidad de las respuestas generadas por IA:
Las tareas deben dividirse en partes más pequeñas
Las llamadas largas o multi-paso deben dividirse en segmentos más enfocados. Proporcionar una o dos instrucciones a la vez permite que el modelo mantenga una mejor atención y reduce la probabilidad de perder algún paso.
Ejemplo
En lugar de combinar todas las instrucciones en una sola llamada, como “Resumen del texto, lista de puntos principales, sugerencias de mejora y traducción al francés”, cada instrucción debe presentarse por separado o en grupos más pequeños.
Las instrucciones deben estar formateadas con listas numeradas o puntos
Organizar las instrucciones con un formato explícito, como listas numeradas o puntos, ayuda a indicar que cada elemento es una tarea individual. Esta claridad aumenta las posibilidades de que la respuesta aborde todas las instrucciones.
Ejemplo
- Resumen del texto siguiente.
- Lista de puntos principales.
- Sugerencias de mejora.
Este formato proporciona pistas visuales que ayudan al modelo a reconocer y separar tareas distintas dentro de una llamada.
Las instrucciones deben ser explícitas y no ambiguas
Es esencial que las instrucciones indiquen claramente la necesidad de completar cada paso. El lenguaje ambiguo o vago debe evitarse. La llamada debe indicar explícitamente que no se pueden saltar pasos.
Ejemplo
“Por favor, complete todas las tres tareas a continuación. Saltar cualquier paso no es aceptable.”
Declaraciones directas como esta reducen la confusión y animan al modelo a proporcionar respuestas completas.
Deben usarse llamadas separadas para tareas críticas o de alto riesgo
Cada instrucción debe presentarse como una llamada individual para tareas donde la precisión y la completitud son críticas. Aunque este enfoque puede aumentar el tiempo de interacción, mejora significativamente la probabilidad de obtener resultados completos y precisos. Este método garantiza que el modelo se centre completamente en una tarea a la vez, reduciendo el riesgo de instrucciones omitidas.
Estrategias avanzadas para equilibrar la completitud y la eficiencia
Esperar a que se complete una respuesta después de cada instrucción individual puede ser tiempo-consuming para los usuarios. Para mejorar la eficiencia mientras se mantiene la claridad y se reduce el salto de instrucciones, las siguientes técnicas de llamadas avanzadas pueden ser efectivas:
Llamadas en lote con formato claro y etiquetas explícitas
Se pueden combinar varias instrucciones relacionadas en una sola llamada, pero cada una debe separarse utilizando numeración o encabezados. La llamada también debe instruir al modelo a responder a todas las instrucciones completamente y en orden.
Ejemplo de llamada
Por favor, complete todas las siguientes tareas con cuidado sin saltar ninguna:
- Resumen del texto a continuación.
- Lista de puntos principales de su resumen.
- Sugerencias de mejora basadas en los puntos principales.
- Traducción del texto mejorado al francés.
Llamadas en estilo de cadena de pensamiento
Las llamadas en estilo de cadena de pensamiento guían al modelo para razonar a través de cada tarea paso a paso antes de proporcionar una respuesta. Animar al modelo a procesar instrucciones secuencialmente dentro de una sola respuesta ayuda a garantizar que no se omitan pasos, reduciendo la probabilidad de saltar instrucciones y mejorando la completitud.
Ejemplo de llamada
Lea el texto a continuación y realice las siguientes tareas en orden. Muestre su trabajo claramente:
- Resumen del texto.
- Identifique los puntos principales de su resumen.
- Sugerencias de mejora del texto.
- Traducción del texto mejorado al francés.
Por favor, responda todas las tareas completamente y por separado en una sola respuesta.
Agregar instrucciones de finalización y recordatorios
Recordar explícitamente al modelo que:
- “Responda cada tarea completamente.”
- “No salte ninguna instrucción.”
- “Separe sus respuestas claramente.”
Estos recordatorios ayudan al modelo a enfocarse en la completitud cuando se combinan múltiples instrucciones.
Deben probarse diferentes modelos y ajustes de parámetros
No todos los LLM funcionan igual al seguir múltiples instrucciones. Es aconsejable evaluar varios modelos para identificar aquellos que destacan en tareas multi-paso. Además, ajustar parámetros como la temperatura, el número máximo de tokens y las llamadas al sistema puede mejorar aún más el enfoque y la completitud de las respuestas. Probar estos ajustes ayuda a adaptar el comportamiento del modelo a los requisitos específicos de la tarea.
Deben considerarse el ajuste fino de modelos y la utilización de herramientas externas
Los modelos deben ajustarse en datasets que incluyan instrucciones multi-paso o secuenciales para mejorar su adherencia a llamadas complejas. Técnicas como RLHF pueden mejorar aún más el seguimiento de instrucciones.
Para casos de uso avanzados, la integración de herramientas externas como API, plugins específicos de tareas o Sistemas de Generación Aumentada de Recuperación (RAG) puede proporcionar contexto adicional y control, mejorando la confiabilidad y precisión de las salidas.
En resumen
Los LLM son herramientas poderosas, pero pueden saltar instrucciones cuando las llamadas son largas o complejas. Esto sucede debido a cómo leen la entrada y enfocan su atención. Las instrucciones deben ser claras, simples y bien organizadas para obtener mejores y más confiables resultados. Dividir las tareas en partes más pequeñas, utilizar listas y dar instrucciones directas ayudan a los modelos a seguir los pasos completamente.
Llamadas separadas pueden mejorar la precisión para tareas críticas, aunque toman más tiempo. Además, métodos de llamadas avanzados como la cadena de pensamiento y el formato claro ayudan a equilibrar la velocidad y la precisión. Además, probar diferentes modelos y ajustarlos puede mejorar los resultados. Estas ideas ayudarán a los usuarios a obtener respuestas consistentes y completas y harán que las herramientas de IA sean más útiles en el trabajo real.












