Ãngulo de Anderson
Los modelos de chat de IA pueden generar costos mediante divagaciones interminables

Los populares modelos de chat de IA desperdician enormes cantidades de tokens pagados en verbiage inÚtil. Los modelos afectados realmente saben que estÃĄn haciendo esto, pero no pueden detenerse a sà mismos.
Â
Los grandes modelos de razonamiento (como ChatGPT-5 y Google Gemini) cobran mÃĄs por razonamiento â analizar un problema paso a paso, lo que utiliza significativamente mÃĄs potencia de cÃĄlculo que simplemente predecir la prÃģxima palabra. El proceso de razonamiento simulado tarda mÃĄs y cuesta mÃĄs en ejecutarse; en consecuencia, los usuarios terminan pagando por ese âtiempo de pensamiento extraâ.
Sin embargo, si ha utilizado un modelo de lenguaje de Última generaciÃģn recientemente, es posible que haya notado que su asignaciÃģn de tokens a menudo se gasta en verbiage y cruft, en lugar de centrarse en resolver los problemas que se plantean al modelo. Esto puede tomar la forma de excesiva adulaciÃģn, respuestas prolijas y/o redundantes â o incluso una especie de âdivagaciÃģnâ, como si la IA hubiera sido sorprendida y estuviera tratando de hablar su camino fuera de una situaciÃģn incÃģmoda.
Naturalmente, preferirÃamos que nuestros modelos de lenguaje admitieran la derrota, siguieran o ofrecieran caminos alternativos, o solicitaran aclaraciones. Pero incluso lograr que un modelo de IA de este tipo admita que no conoce una respuesta es un desafÃo considerable en sà mismo.
Mientras tanto, los usuarios en niveles mÃĄs bajos o gratuitos pueden encontrarse con que han agotado rÃĄpidamente sus tokens, independientemente de cuÃĄn dirigidos o econÃģmicos sean sus consultas y interacciones, porque la IA en sà misma ama hablar; y, en este caso, hablar no es barato.
Ensalada de palabras
En cuanto a la mencionada âdivagaciÃģnâ, una nueva colaboraciÃģn acadÃĐmica ofrece una razÃģn y una soluciÃģn, proponiendo que los modelos de lenguaje con capacidades de razonamiento tienden a agotar sus tokens cuando se atascan en un âbucle de ensalada de palabrasâ â un estado de confusiÃģn en el que el proceso de razonamiento se pierde en callejones sin salida recursivos â a costa del usuario*.
Los investigadores detrÃĄs del nuevo artÃculo han descubierto que una parte significativa de los tokens procesados en un modelo de lenguaje tÃpico consiste en repeticiones y redundancias â y que el modelo en sà parece entender que estÃĄ en problemas, aunque no puede detener el costoso bucle.
El artÃculo establece:
âDemostramos que una parte significativa de estos tokens son repeticiones inÚtiles â lo que llamamos âensalada de palabrasâ â que agotan el presupuesto de decodificaciÃģn sin agregar valor. Resulta interesante que observemos que los modelos de razonamiento son conscientes cuando estÃĄn atrapados en estos bucles: los estados ocultos de los tokens que siguen a cada fragmento de razonamiento exhiben patrones que nos permiten detectar el comportamiento de ensalada de palabras en tiempo real mediante un clasificador lineal de una capa.
âUna vez detectado, un corte simple seguido de una regeneraciÃģn directa produce ahorros sustanciales de longitud con una pÃĐrdida de calidad mÃnima.â
La soluciÃģn ofrecida por el nuevo trabajo es una intervenciÃģn que puede cortar el proceso espiral de un modelo de razonamiento errante de manera instantÃĄnea, sin necesidad de inclusiÃģn en los datos de entrenamiento o cualquier daÃąo que pueda resultar de ajustes finos. El marco, titulado Cortador de Ensalada de Palabras, ha sido publicado pÚblicamente en GitHub.
Aunque el trabajo inicial se centra en variantes de DeepSeek como las entradas en las series Qwen y Llama, el artÃculo afirma que el comportamiento no deseado es probablemente aplicable a una franja mucho mÃĄs amplia de modelos de razonamiento con arquitectura similar (incluidas las ofertas populares de solo API como ChatGPT y Google Gemini).
Como seÃąala el artÃculo, ofertas anteriores como Desmitificando el razonamiento en cadena de pensamiento en los modelos de lenguaje y Modelos pequeÃąos luchan por aprender de razonadores fuertes tambiÃĐn utilizan el pequeÃąo nÚmero de modelos de razonamiento en cadena de pensamiento (CoT) disponibles pÚblicamente para establecer un problema mÃĄs amplio en esta clase de modelosâ :
â[Los modelos de razonamiento] tienden a desperdiciar una cantidad enorme de presupuesto de decodificaciÃģn, simplemente repitiÃĐndose verbatim, con variaciones ligeras, o participando en una enumeraciÃģn interminable de casos hasta que se agote todo el presupuesto â a lo que nos referimos como ensalada de palabras, un tÃĐrmino a menudo utilizado para burlarse de los portavoces pÚblicos que dan respuestas largas y llenas de jerga que en Última instancia carecen de sustancia o significado claro.
âLa columna âOriginalâ en [la tabla a continuaciÃģn] muestra que al responder GPQA-Diamond, observamos que mÃĄs del 55% de los tokens generados por los modelos DeepSeek-R1-Distill son marcados como âtokens de ensalada de palabrasâ, donde no agregan valor desde un punto de vista semÃĄntico.â
![La participaciÃģn de tokens de salida identificados como redundantes semÃĄnticamente al responder GPQA-Diamond. WordSaladChopper reduce esta sobrecarga de mÃĄs del 55% a menos del 6% en todos los modelos DeepSeek-R1-Distill probados, segÚn afirman los autores. [ Fuente ] https://arxiv.org/pdf/2511.00536](https://www.unite.ai/wp-content/uploads/2025/11/table-1.jpg)
La participaciÃģn de tokens de salida identificados como redundantes semÃĄnticamente al responder GPQA-Diamond. WordSaladChopper reduce esta sobrecarga de mÃĄs del 55% a menos del 6% en todos los modelos DeepSeek-R1-Distill probados, segÚn afirman los autores. Fuente
Los autores observan que los intentos de acortar los procesos de razonamiento mientras se conserva la calidad de la respuesta se han convertido en una subrama fuerte en la literatura de investigaciÃģn, a saber, de largo a corto (L2S); y observan ademÃĄs que, aunque los objetivos de su proyecto son similares a los de algunas iniciativas anteriores, la suya es la primera en ofrecer una soluciÃģn ad hoc que no requiere intervenciÃģn en el proceso de entrenamiento, ediciÃģn del modelo o otras posibles imposiciones sobre la arquitectura base de un modelo de lenguaje; y en ese sentido, creen que su enfoque deberÃa generalizarse entre los sistemas aplicablesâ :
âDada su baja sobrecarga, ahorros sÃģlidos y la falta de valor semÃĄntico de los tokens de ensalada de palabras, creemos que no es demasiado atrevido argumentar que [WordSaladChopper] â o un componente similar â es una caracterÃstica imprescindible para todas las aplicaciones de modelos de razonamiento con experiencia del usuario en mente â
El nuevo artÃculo se titula WordSaladChopper: los modelos de razonamiento desperdician una gran cantidad de presupuesto de decodificaciÃģn en repeticiones inÚtiles, autoconscientes, y proviene de seis investigadores de la Universidad de Minnesota, la Universidad de Rice, el Instituto de TecnologÃa Stevens y Lambda, Inc.
Consideraciones previas
Para rastrear la tendencia de los modelos de razonamiento a repetirse, los autores dividieron la salida de los modelos en fragmentos dondequiera que hubiera saltos de lÃnea dobles, y luego comprobaron quÃĐ tan similares eran cada fragmento a los anteriores:

ParticipaciÃģn estimada de fragmentos de razonamiento marcados como ensalada de palabras bajo dos temperaturas de decodificaciÃģn (Ï = 0,0, 0,6). El clasificador marca un fragmento como âensalada de palabrasâ cuando se parece mucho a una parte anterior de la salida del modelo, lo que sugiere repeticiÃģn en lugar de progreso. Los resultados muestran que este comportamiento es generalizado en diferentes conjuntos de datos y tamaÃąos de modelo.
Si un fragmento era demasiado similar, se lo marcaba como âensalada de palabrasâ (efectivamente, una repeticiÃģn inÚtil).
Los investigadores observan que una vez que un modelo entra en el âmodo de ensalada de palabrasâ, es muy poco probable que escape de ÃĐl sin ayuda externa, y en su lugar permanece en el bucle costoso hasta que se agota el presupuesto de decodificaciÃģn del usuarioâ â :
âNo hace falta decir que esto presenta un problema catastrÃģfico para los usuarios, ya que una secciÃģn de pensamiento idealmente mucho mÃĄs corta ahora se maximiza con repeticiones inÚtiles. Asà que el usuario estÃĄ pagando el costo mÃĄximo por una respuesta (probablemente) incorrecta, mientras soporta la latencia de extremo a extremo mÃĄs larga.â

ParticipaciÃģn de fragmentos de ensalada de palabras que aparecen antes y despuÃĐs del punto de corte (es decir, el momento en que la salida repetitiva comienza a dominar). La mayorÃa de las repeticiones ocurren despuÃĐs de este punto, lo que muestra que una vez que un modelo entra en un bucle de ensalada de palabras, rara vez se recupera sin intervenciÃģn.
Los autores recuerdan su sorpresa cuando descubrieron que los modelos de razonamiento exhibÃan signos de ser conscientes de su estado de ensalada de palabras. Sin embargo, es esta conciencia, y la forma en que entra en el estado de razonamiento probable del modelo, lo que permite un sistema de intervenciÃģn:
âLa ligereza de este clasificador lineal abre la puerta a la detecciÃģn en tiempo real, donde podemos intervenir efectivamente con diferentes operaciones para abordar los modelos atrapados en bucles de ensalada de palabras.â
MÃĐtodo
Para detectar la presencia de ensalada de palabras durante la inferencia, los autores entrenaron un clasificador lineal simple que se ejecuta en el estado oculto de cada token de nueva lÃnea doble.
Cualquier fragmento que ocurriera despuÃĐs de que el modelo entrara en un bucle de repeticiÃģn se trataba como ensalada de palabras, con este corte (llamado punto de corte) utilizado para etiquetar los datos de entrenamiento. Se generaron mil trazas de razonamiento utilizando el benchmark S1, y cada traza se dividiÃģ en fragmentos separados por nuevas lÃneas.

Esquema conceptual para WordSaladChopper. Durante la generaciÃģn, el estado oculto en cada token de nueva lÃnea doble se analiza para detectar segmentos repetitivos. Una vez que se marcan dos fragmentos de ensalada de palabras seguidos, la generaciÃģn se detiene. Un prompt de regeneraciÃģn fijo se agrega, lo que permite que el modelo continÚe y termine su respuesta sin exceder el presupuesto.
Si un fragmento se encontraba muy similar a uno anterior, se lo marcaba como ensalada de palabras. Una vez que se identificara la repeticiÃģn sostenida mÃĄs temprana, todos los fragmentos posteriores tambiÃĐn se marcarÃan como ensalada de palabras para reflejar la persistencia de estos bucles.
El clasificador se implementÃģ como una sola capa completamente conectada y se entrenÃģ en los estados ocultos de los tokens de cola del bloque de transformador final. Se entrenÃģ un clasificador separado para cada modelo, utilizando estos datos, y no se realizÃģ ajuste fino durante la evaluaciÃģn.
Datos y pruebas
El entrenamiento y la inferencia utilizaron cuatro GPU NVIDIA A100 (80G VRAM), bajo el optimizador Adam, con una tasa de aprendizaje de 1Ã10-2, durante 50 ÃĐpocas.
Los conjuntos de datos de evaluaciÃģn fueron âMatemÃĄticas de escuela primariaâ 8000, tambiÃĐn conocido como GSM8K; MATH-500; GPQA-DIAMOND; y AIME25 (2025).
Los modelos probados fueron DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; y DeepSeek-R1-Distill-Llama-8B, todos bajo licencia MIT.
Las mÃĐtricas utilizadas fueron precisiÃģn y AUROC.

PrecisiÃģn y AUROC del clasificador de ensalada de palabras en Qwen-7B en cuatro benchmarks y dos temperaturas de decodificaciÃģn. Las puntuaciones altas confirman que el inicio de la repeticiÃģn se puede detectar de manera confiable a partir del estado oculto del token de nueva lÃnea de cola.
De los resultados que se muestran aquÃ, los autores comentan:
â[La tabla de resultados anterior] muestra que el clasificador lineal es extremadamente preciso al detectar los fragmentos de ensalada de palabras; sin embargo, [la tabla de resultados a continuaciÃģn] demuestra que el prompt de regeneraciÃģn ayuda a recuperar la precisiÃģn de la tarea perdida por el corte brusco.â

PrecisiÃģn de Qwen-7B en cada benchmark a Ï = 0,6, comparando el rendimiento antes de la ensalada de palabras (Original), despuÃĐs del corte (Cortado) y despuÃĐs de aplicar la regeneraciÃģn (Regenerado). Las ganancias de la regeneraciÃģn son modestas pero consistentes, recuperando el rendimiento previo al bucle en la mayorÃa de los casos.
En la tabla de resultados a continuaciÃģn, podemos ver que WordSaladChopper mejorÃģ o conservÃģ la precisiÃģn mientras reducÃa drÃĄsticamente la longitud de las salidas del modelo, hasta en un 57%:

Cuando se utiliza WordSaladChopper en la decodificaciÃģn codiciosa (Ï = 0), reduce la longitud de las salidas del modelo, a veces mÃĄs de la mitad, mientras mantiene la precisiÃģn igual o ligeramente mejor, un rendimiento que permanece consistente entre diferentes modelos y tareas (AIME25 se omite debido a resultados predeciblemente inestables en este ajuste).
Las mayores ganancias aparecieron en respuestas mÃĄs largas, especialmente en GPQA-Diamond, donde casi la mitad del texto se eliminÃģ sin afectar el rendimiento. A continuaciÃģn, podemos ver resultados similares cuando se agrega aleatoriedad durante la generaciÃģn:

A una temperatura mÃĄs alta (Ï = 0,6), WordSaladChopper continÚa acortando las salidas en un 10-30 por ciento, con una precisiÃģn que permanece estable o ligeramente mejorada en todos los modelos y benchmarks (los resultados de AIME25 se promedian para reducir la variabilidad).
AquÃ, la precisiÃģn se mantuvo estable, con salidas mÃĄs cortas logradas. En general, el sistema continuÃģ funcionando incluso cuando las respuestas del modelo se volvieron mÃĄs repetitivas; y los autores observan que, dado que el clasificador solo verifica un token por oraciÃģn, se ejecuta extremadamente rÃĄpido, incluso cuando se utiliza durante la generaciÃģn en vivo.
El artÃculo observa que estrategias adicionales en investigaciones futuras en esta lÃnea podrÃan beneficiarse de otorgar al modelo un pequeÃąo presupuesto de regeneraciÃģn despuÃĐs de la intervenciÃģn; la aplicaciÃģn continua de un sistema de estilo WordSaladChopper sobre regeneraciones; y forzar un token âfin de pensamientoâ en el modelo, para exigir su mejor respuesta actual.
Finalmente, los investigadores comentan sobre la calidad del estado actual de la evaluaciÃģn de los modelos de razonamiento, con un tono crÃticoâ :
âEs nuestra creencia honesta que muchos mÃĐtodos de razonamiento eficientes parecen efectivos en parte porque las actuales pruebas de evaluaciÃģn de razonamiento tienen mucho margen de mejora.
âSi desarrollamos suites de evaluaciÃģn mÃĄs comprehensivas de evaluaciÃģn suites â lo cual seguramente haremos en el futuro â esperamos ver que muchos mÃĐtodos de razonamiento eficientes fallen, o se comporten de manera muy diferente a sus contrapartes de modelo de lenguaje estÃĄndar.â
ConclusiÃģn
A la escala alcanzada por los sistemas lÃderes como ChatGPT, incluso pequeÃąos cambios en el consumo de recursos de los usuarios pueden tener importantes implicaciones de infraestructura, logÃstica y costo. Esto hace que la eficiencia sea una prioridad compartida tanto para los proveedores como para la comunidad de investigaciÃģn en general.
Si se implementa, el nuevo y ligero sistema propuesto en el artÃculo (que debe ser entrenado personalizado para cada arquitectura de modelo nueva) podrÃa prevenir la quema inÚtil de tokens â lo que puede dar a los clientes la impresiÃģn de que el proveedor estÃĄ âsangrandoâ su asignaciÃģn de manera derrochadora o engaÃąosa. En realidad, el proveedor se beneficia al proporcionar salida Útil en lugar de redundante, lo que cuesta lo mismo en tÃĐrminos de cÃĄlculo que una ensalada de palabras.
Â
* Aunque no lo explicaremos aquÃ, esto tambiÃĐn se aplica a los modelos alojados localmente, que pueden ser corporativos asà como de aficionados, y donde las pÃĐrdidas de electricidad y productividad de la ensalada de palabras pueden ser un factor digno de menciÃģn.
â Como de costumbre, todo el ÃĐnfasis es de los autores, y no mÃo. Donde corresponda, sus citas en lÃnea se han convertido en enlaces por mÃ.
â â Aquà debemos reconocer que los marcos y las API pueden asignar âsubpresupuestoâ a las consultas, de modo que una consulta no necesariamente puede agotar el presupuesto de tokens de un dÃa â pero esta no es una prÃĄctica comÚn, ni comÚnmente discutida entre los proveedores de solo API.
â â â No estoy generalmente dispuesto a adoptar el uso de los autores de âLRMsâ, ya que esta no es actualmente una abreviatura de uso comÚn, asà que utilizarÃĐ otra terminologÃa en este artÃculo, segÚn sea necesario.
Publicado por primera vez el jueves 6 de noviembre de 2025












