Ángulo de Anderson
La verbosidad disminuye la precisión en los grandes modelos de lenguaje

Una nueva investigación encuentra que forzar a los Grandes Modelos de Lenguaje a dar respuestas más cortas mejora notablemente la precisión y la calidad de sus respuestas.
Cualquiera que haya intentado detener a un chatbot para que no “se explaye” reconocerá las conclusiones de la nueva investigación: forzar a la IA a dar respuestas más cortas la hace más precisa.
Al investigar las razones por las que los chatbots de IA más grandes funcionan peor en este sentido que los más pequeños, en ciertos casos (conocidos como escalado inverso), la investigación encontró que forzar a 31 modelos de lenguaje populares a dar respuestas más cortas causó una mejora de hasta el 26,3% en la precisión de sus respuestas:
‘Los resultados proporcionan pruebas causales convincentes: las restricciones de brevedad mejoraron la precisión del modelo grande en 26,3 puntos porcentuales y redujeron la brecha de escalado inverso en un 67% (de 44,2% a 14,8%, prueba t emparejada: t = 7,80, p < 0,0001).'
La verbosidad excesiva es una queja frecuente entre los usuarios finales, no solo entre aquellos que utilizan modelos comerciales como ChatGPT, donde los foros de soporte presentan este tema con frecuencia.
El dominio más afectado por la eliminación de la verbosidad en las respuestas es las matemáticas, donde los modelos de IA probados se limitaron a responder en 50 palabras o menos. Para las tareas de comprensión lectora, se les restringió a una simple respuesta de 10 palabras.
El artículo define la tendencia de la IA hacia la verbosidad como pensamiento excesivo, en el que el mensaje central no solo se ve oscurecido por la verbiage, sino que a veces se ve afectado negativamente por ella. El modelo más pequeño, observa el artículo, es menos necesario, o funciona.
La investigación concluye que no hay nada arquitectónico que deba abordarse para aplicar esta solución de manera sistemática. Sin embargo, en una sesión de chat de un usuario, una directiva hacia la brevedad probablemente necesitaría repetirse, mientras que una llamada de sistema globalmente aplicada – que necesitaría implementarse como una configuración de ingeniería predeterminada en plataformas como ChatGPT – podría hacer que las respuestas más cortas sean el comportamiento predeterminado.
Vientos tempestuosos
Nada de esto explica exactamente por qué los modelos más grandes tienden hacia la verbosidad, ya que esto es algo que afecta a los modelos de código abierto también. El artículo sugiere que los protocolos y las prácticas comunes en las técnicas de Aprendizaje por Refuerzo de Retroalimentación Humana (RLHF) podrían ofrecer una explicación*:
‘Un origen plausible es el entrenamiento de alineación de RLHF, donde los anotadores humanos recompensan la exhaustividad de manera desproporcionada en modelos más grandes con mayor capacidad para actuar en señales de recompensa de longitud – consistente con las diferencias de verbosidad que son más grandes en variantes de modelo de base que en las de instrucción.’
‘El trabajo previo documenta el sesgo de longitud sistemático en recompensa modelos, donde los anotadores confunden la longitud con la calidad. ‘
‘Los modelos más grandes, con mayor capacidad para satisfacer las señales de recompensa de longitud, pueden internalizar la generación verbosa más profundamente que los modelos más pequeños, produciendo el pensamiento excesivo dependiente de la escala que observamos.’
En los humanos, la verbosidad puede ocurrir para llenar un silencio, o para ocultar sentimientos de incomodidad, debido a enfermedades mentales, o para ocultar la falta de conocimiento. En efecto, una IA solo podría verse influenciada por estos factores a través de la absorción de datos de entrenamiento que reflejan o manifiestan estos rasgos.
En los corpus de datos, existen otras motivaciones para respuestas prolijas, como el incentivo de SEO para producir contenido de texto más largo, por ejemplo en publicaciones de recetas, donde la longitud se asocia a menudo erróneamente con la autoridad.
Lo que no se puede descartar por completo es que las plataformas basadas en API, incentivadas a empujar a los usuarios hacia un nivel de suscripción más alto y más costoso, ya sea fomenten o no supervisen la verbosidad, ya que aumenta el uso de tokens de manera bastante barata, sin la necesidad de un razonamiento excesivo o llamadas a RAG†.
El nuevo artículo se titula Restricciones de brevedad invierten las jerarquías de rendimiento en los modelos de lenguaje, y proviene del Departamento de Ciencias de la Computación del Instituto Politécnico de Suecia en Chattogram, en Bangladesh.
Método
Para probar las teorías del artículo, se evaluaron 31 modelos de lenguaje – demasiados para enumerarlos en forma de texto aquí, pero representados en la imagen a continuación:

Los Grandes Modelos de Lenguaje (LLM) probados en varias partes de las pruebas para el nuevo artículo.
Los modelos se evaluaron contra cinco colecciones de referencia: GSM8K, para el razonamiento matemático; BoolQ, para la comprensión lectora; CommonsenseQA, para el razonamiento común; ARC-Easy, que cubre preguntas científicas; y MMLU-STEM, también para conocimientos científicos.
Las respuestas se generaron utilizando decodificación codiciosa para garantizar salidas determinísticas, y luego se extrajeron con reglas específicas de la tarea, con la precisión medida como la proporción de respuestas correctas frente a la verdad fundamental.
Los modelos se dividieron por tamaño, con aquellos que tenían 10 mil millones de parámetros o menos se consideraron “pequeños”, y aquellos que tenían más de 70 mil millones de parámetros se consideraron “grandes”, en función de las brechas de rendimiento observadas.
La escalada inversa se cuantificó comparando el rendimiento de estos grupos en cada problema, marcando los casos en los que los modelos más pequeños superaron a los más grandes; el tamaño del efecto estadístico se utilizó para confirmar que estas brechas reflejaban diferencias significativas y consistentes, y no ruido.
Descartar la recuperación
Para descartar la posibilidad de que los modelos simplemente recuerden los datos de entrenamiento, se realizaron tres controles separados, examinando cómo variaban las respuestas; cuánto fluctuaba su longitud; y cómo se cometían errores. Si los modelos confiaban en patrones memorizados, las respuestas tenderían a repetirse o seguir plantillas fijas; en cambio, las respuestas resultaron en su mayoría únicas en los modelos, con una variación notable en la longitud, de una respuesta a otra.
Los errores también se inspeccionaron directamente, y la mayoría de los fallos tomaron la forma de explicaciones incorrectas largas, en lugar de respuestas cortas y evasivas – lo que indica que los modelos estaban generando razonamiento real, en lugar de respuestas almacenadas.
Datos y pruebas
Al probar preguntas individuales en lugar de puntuaciones generales, una gran parte de las tareas de referencia resultaron no informativas, con un 27,1% que no lograron separar los modelos en absoluto porque todos los sistemas tuvieron éxito o todos fallaron, lo que no proporcionó ninguna señal de rendimiento relativo:

Desglose a nivel de problema en cinco benchmarks mostró que una parte sustancial de las tareas no logró distinguir entre los modelos, mientras que una parte menor pero consistente exhibió una escalada inversa, donde los modelos más pequeños superaron a los más grandes. La distribución general en 1.485 problemas indica que el 7,7% exhibe una escalada inversa. Fuente
Entre las preguntas que sí diferenciaron los modelos, la mayoría se comportó como se esperaba, con los sistemas más grandes funcionando mejor, pero un grupo más pequeño mostró el patrón opuesto, con los modelos más pequeños saliendo adelante. En todos los problemas, la escalada inversa apareció en el 7,7% de los casos, lo que indica que el efecto no es marginal.
Escalada inversa que emerge
En los cinco benchmarks, se encontraron 115 problemas en los que los modelos más pequeños superaron a los más grandes, lo que representa el 7,7% de las 1.485 tareas, lo que indica que la escalada inversa no es un fenómeno raro o marginal en este contexto.
De hecho, el efecto se manifestó en cada conjunto de datos: más fuerte en BoolQ, y más débil en CommonsenseQA, ARC-Easy, GSM8K y MMLU-STEM, lo que indica que es generalizado, pero varía según la tarea:

La escalada inversa se manifestó en todos los benchmarks, desde el 3,9% en MMLU-STEM hasta el 11,3% en BoolQ, con 115 problemas en total. Las brechas de rendimiento favorecieron a los modelos más pequeños en un promedio de 28,4 puntos porcentuales. La precisión disminuyó a medida que aumentaba el tamaño del modelo, con los modelos pequeños alcanzando el 66,1%, en comparación con el 41,5% de los modelos más grandes.
El tamaño de la brecha resultó sustancial, con los modelos más pequeños por delante en un promedio de 28,4 puntos porcentuales, y cada caso mostró la misma dirección de ventaja, lo que indica una disminución consistente en el rendimiento, en lugar de errores ocasionales o ad hoc.
El mismo patrón se mantuvo en diferentes familias de modelos, incluyendo Llama, Qwen, Gemma y Mistral, donde las versiones más grandes funcionaron peor que las más pequeñas, con la precisión tendiendo a disminuir a medida que aumentaba el tamaño del modelo en estos problemas.
La brecha entre los modelos pequeños y grandes fue lo suficientemente grande como para que la casualidad no pudiera explicarla; y dado que el mismo patrón se manifestó en diferentes benchmarks, tareas y familias de modelos, la escalada inversa emergió como un efecto consistente y no aleatorio.
Al examinar dentro de cada familia de modelos, las versiones más grandes funcionaron consistentemente peor que las más pequeñas en estos problemas, lo que sugiere que la disminución puede estar relacionada con la escala en sí, en lugar de con diferencias en el diseño.
Los resultados también apuntan a un límite para cada tarea, donde aumentar el tamaño del modelo comienza a perjudicar el rendimiento, lo que muestra que los modelos más grandes no siempre conducen a mejores resultados.
Examinando el pensamiento excesivo
Después de establecer que los modelos más grandes a veces funcionan peor en ciertos dominios, el análisis se centró en por qué sucede esto, proponiendo que el problema no es la falta de capacidad, sino demasiada explicación – es decir, casos en los que las respuestas más largas comienzan a oscurecer el razonamiento correcto.
En todo el conjunto de datos, las respuestas más largas se relacionaron con una menor precisión en estos problemas difíciles, aunque los modelos grandes y pequeños produjeron aproximadamente la misma cantidad de pasos de razonamiento, lo que sugiere que el problema no es cuánto razonamiento se hace, sino cómo se expresa:

Las respuestas más cortas mejoraron el rendimiento de los modelos grandes y redujeron la brecha con los modelos más pequeños, reduciendo la diferencia de 44,2 puntos porcentuales a 14,8 (y en algunos casos invirtiendo completamente), mientras que los formatos de respuesta directa redujeron aún más la brecha. Las ganancias más fuertes se observaron en GSM8K y MMLU-STEM, donde las clasificaciones se invirtieron a favor de los modelos más grandes, y las comprobaciones de longitud de respuesta confirmaron que la intervención funcionó, con salidas que disminuyeron de alrededor de 197 tokens a menos de 80, lo que relaciona la verbosidad reducida con una mayor precisión.
Cuando las respuestas se forzaron a ser más cortas, los modelos grandes mejoraron notablemente, reduciendo una brecha de rendimiento considerable, y en algunos casos, casi eliminándola. Por el contrario, los modelos pequeños cambiaron muy poco, lo que indica que la verbosidad estaba dañando activamente a los sistemas más grandes.
El efecto resultó variar según la tarea, con algunas pruebas beneficiándose en gran medida de respuestas más cortas, y otras requiriendo cierto grado de explicación; pero en varios casos, la clasificación entre los modelos pequeños y grandes se invirtió completamente una vez que se restringió la verbosidad, lo que revela que los modelos más grandes tenían una capacidad oculta que se veía oscurecida por la elaboración excesiva.
Un análisis adicional mostró que los modelos más grandes tendían a producir salidas más largas en general, a pesar de utilizar ligeramente menos pasos de razonamiento explícitos, lo que indica un estilo de razonamiento más difuso y menos estructurado.
Por el contrario, los modelos más pequeños dieron respuestas más cortas y directas, lo que sugiere que la forma en que se expresa el razonamiento, en lugar de la cantidad de razonamiento en sí, impulsa la disminución del rendimiento.
Los autores concluyen en general que las restricciones de brevedad traen beneficios de precisión, y consideran que esto podría convertirse en una característica fundamental en los modelos de lenguaje, en lugar de una restricción repetitiva y aplicada por el usuario que no sobrevive entre sesiones; y declaran:
‘Las restricciones de brevedad ayudan a los modelos grandes de manera dramática, mientras que apenas afectan a los modelos pequeños. ‘
‘Si la verbosidad fuera incidental en lugar de causal, se esperarían cambios de precisión uniformes en ambas categorías de tamaño. La respuesta diferencial confirma que el pensamiento excesivo es un modo de falla específico de la escala, y no un efecto de dificultad de la tarea.’
Conclusión
Más allá de las versiones de código abierto probadas por los investigadores, el problema de la verbosidad parece, anecdóticamente, con cierta frecuencia en muchos modelos importantes además de ChatGPT, incluyendo Claude, Gemini y Grok.
Ya sea que estas plataformas estén pasando por alto el problema de la verbosidad porque aumenta el uso de tokens y fomenta un gasto más alto†, no parece razonable que acepten la disminución de la precisión que acompaña a este ’empuje’.
Sería interesante ver si algún método empírico podría determinar con certeza de dónde proviene la tendencia a la verbosidad. Cualquiera que haya intentado hacer que un chatbot realmente converse, en lugar de dar respuestas verbosas y en varias etapas al usuario, habrá comprendido que el modelo ha sido grabado profundamente con ‘guías de usuario integrales’ y ‘soluciones aceptadas’ en sus datos de entrenamiento.
Sería muy interesante ver si un modelo entrenado específicamente en conversaciones paso a paso podría alejarse realmente de la tendencia a la verbosidad y a resumir. Sin embargo, parece probable que se necesitarían algunas restricciones o filtros para controlar el peso que el modelo se entrena para dar a la respuesta ‘decidida’, para que se entrene directamente también en el material previo – esencialmente, el razonamiento explícito en conversaciones basadas en turnos.
Dado que los datos pertinentes de este tipo parecen ser raros, quizás la única forma de avanzar en este enfoque sería a través de datos sintéticos, en los que las conclusiones finales ‘compuestas’ se desglosan conversacionalmente – de manera irónica, de la misma manera que los podcasts de IA que Google NotebookLM puede interpretar a partir de la entrada de texto plano.
* Mi conversión de las citas en línea de los autores a enlaces.
† Pero seamos honestos, la diferencia entre los costos reales de provisión de IA y los cargos de suscripción es actualmente tan grande que esto solo dañaría la reputación de la base de usuarios sin resolver la grave economía subyacente de esta fase de la ‘conversión’ y ‘convergencia’ de la fase de IA.
Publicado por primera vez el domingo 5 de abril de 2026












