Angle d’Anderson
Les modèles de chat IA peuvent entraîner des coûts élevés en raison de leur verbiage excessif

Les modèles de chat IA populaires gaspillent secrètement d’énormes quantités de jetons payés en raison de leur verbiage inutile. Les modèles affectés savent qu’ils font cela, mais ne peuvent pas s’arrêter.
Les grands modèles de raisonnement (comme ChatGPT-5 et Google Gemini) facturent plus cher pour la raisonnement – en d’autres termes, en résolvant un problème étape par étape, ce qui utilise beaucoup plus de puissance de calcul que la simple prédiction du prochain mot. Le processus de raisonnement simulé prend plus de temps et coûte plus cher à exécuter; par conséquent, les utilisateurs se retrouvent à payer pour ce « temps de réflexion supplémentaire ».
Cependant, si vous avez utilisé un modèle de langage avancé récemment, vous avez peut-être remarqué que votre allocation de jetons est souvent dépensée en verbiage et en déchets, plutôt que de se concentrer sur la résolution des problèmes que vous posez au modèle. Cela peut prendre la forme d’un excès de flagornerie, de réponses prolixes et/ou redondantes – ou même d’un genre de « verbiage », comme si l’IA avait été prise au dépourvu et essayait de se sortir d’une situation embarrassante.
Naturellement, nous préférerions que nos modèles de langage avancés admettent leur défaite, suivent ou offrent des chemins alternatifs, ou demandent des éclaircissements. Mais même obtenir qu’un modèle de ce type admette qu’il ne connaît pas la réponse est un défi considérable en soi.
En attendant, les utilisateurs des niveaux inférieurs ou gratuits peuvent se retrouver à avoir brûlé leurs jetons à un rythme rapide, quelle que soit la cible ou l’économie de leurs requêtes et interactions, car l’IA elle-même aime parler; et, dans ce cas, parler n’est pas gratuit.
Salade de mots
En ce qui concerne le « verbiage » mentionné ci-dessus, une nouvelle collaboration universitaire propose une explication et une solution en suggérant que les modèles de langage avancés avec des capacités de raisonnement sont enclins à gaspiller vos jetons lorsqu’ils sont pris dans une « salade de mots » – un état de confusion où le processus de raisonnement se perd dans des culs-de-sac récursifs – à vos frais*.
Les chercheurs derrière le nouveau document ont constaté qu’une partie importante des jetons traités dans un modèle de langage avancé typique consiste en répétitions et redondances – et que le modèle lui-même semble comprendre qu’il est en difficulté, même s’il est incapable de stopper la boucle coûteuse.
Le document indique:
‘Nous montrons qu’une partie importante de ces jetons sont des répétitions inutiles – ce que nous appelons « salade de mots » – qui épuisent le budget de décodage sans ajouter de valeur. Intéressant, nous observons que les modèles de langage avancés sont conscients lorsqu’ils sont piégés dans ces boucles: les états cachés des jetons qui suivent chaque segment de raisonnement présentent des modèles qui nous permettent de détecter le comportement de « salade de mots » en temps réel via un classificateur linéaire à une couche.
‘Une fois détecté, une simple coupe suivie d’une prompt de régénération simple donne des économies de longueur substantielles avec une perte de qualité minimale.’
La solution proposée par le nouveau travail est une intervention qui peut interrompre le processus de raisonnement erroné d’un modèle de langage avancé de manière instantanée, sans inclusion dans les données d’entraînement, ni aucun des dommages qui peuvent résulter du rétuning. Le cadre, intitulé Coupeur de salade de mots, a été publié publiquement sur GitHub.
Bien que le travail initial se concentre sur les variantes DeepSeek telles que les entrées de la série Qwen et Llama, le document affirme que le comportement indésirable est susceptible de s’appliquer à une partie beaucoup plus large de modèles de raisonnement similaires (y compris les offres populaires d’API uniquement telles que ChatGPT et Google Gemini).
Comme le note le document, les offres antérieures telles que Demystifying Long Chain-of-Thought Reasoning in LLMs et Small Models Struggle to Learn from Strong Reasoners utilisent également le petit nombre de modèles de raisonnement de type Chaîne de pensée (CoT) disponibles publiquement pour établir un problème plus large dans cette classe de modèles†:
‘[Les modèles de langage avancés] ont tendance à gaspiller une énorme quantité de budget de décodage, simplement en se répétant verbatim, avec de légères variations, ou en engageant une énumération infinie de cas jusqu’à ce que tout le budget ait été [dépensé] – nous appelons ce comportement Salade de mots, un terme souvent utilisé pour se moquer des porte-parole publics qui donnent des réponses longues et verbeuses qui manquent finalement de substance ou de sens clair.
‘La colonne « Original » [dans le tableau ci-dessous] montre que lors de la réponse à GPQA-Diamond, nous observons que 55%+ des jetons générés par les modèles DeepSeek-R1-Distill sont marqués comme « jetons de salade de mots », où ils n’ajoutent pas de valeur d’un point de vue sémantique.’
![La part de jetons de sortie identifiés comme redondants sémantiquement lors de la réponse à GPQA-Diamond. WordSaladChopper réduit cette surcharge de plus de 55% à moins de 6% sur tous les modèles DeepSeek-R1-Distill testés, affirment les auteurs. [ Source ] https://arxiv.org/pdf/2511.00536](https://www.unite.ai/wp-content/uploads/2025/11/table-1.jpg)
La part de jetons de sortie identifiés comme redondants sémantiquement lors de la réponse à GPQA-Diamond. WordSaladChopper réduit cette surcharge de plus de 55% à moins de 6% sur tous les modèles DeepSeek-R1-Distill testés, affirment les auteurs. Source
Les auteurs notent que les tentatives pour raccourcir les processus de raisonnement tout en préservant la qualité des réponses sont devenues un sous-domaine de recherche important, notamment long-to-short (L2S); et notent en outre que même si les objectifs de leur projet sont similaires à ceux de plusieurs initiatives antérieures, la leur est la première à offrir une solution ad hoc qui ne nécessite pas d’intervention dans le processus d’entraînement, de modification du modèle ou d’autres impositions sur l’architecture de base d’un modèle de langage avancé; et à ce titre, ils estiment que leur approche devrait être largement adoptée parmi les systèmes applicables†:
‘Étant donné sa faible surcharge, ses économies importantes et le manque de valeur sémantique des jetons de salade de mots, nous croyons qu’il n’est pas trop osé de dire que [WordSaladChopper] – ou un composant similaire – est un must pour toutes les applications de modèles de langage avancés avec une expérience utilisateur à l’esprit ‘
Le nouveau document est intitulé WordSaladChopper: Les modèles de raisonnement gaspillent une tonne de budget de décodage sur des répétitions inutiles, en étant conscients, et provient de six chercheurs issus de l’Université du Minnesota, de l’Université Rice, de l’Institut de technologie Stevens et de Lambda, Inc.
Considérations antérieures
Pour suivre la tendance des modèles de raisonnement à se répéter, les auteurs ont divisé la sortie des modèles en segments chaque fois qu’il y avait des sauts de ligne doubles, puis vérifié à quel point chaque segment était similaire aux précédents:

Part estimée de segments de raisonnement marqués comme salade de mots sous deux températures de décodage (τ = 0,0, 0,6). Le classificateur marque un segment comme « salade de mots » lorsqu’il ressemble étroitement à une partie antérieure de la sortie du modèle, suggérant une répétition plutôt qu’une progression. Les résultats montrent que ce comportement est répandu dans les ensembles de données et les tailles de modèles.
Si un segment était trop similaire, il était marqué comme « salade de mots » (en fait, une répétition inutile).
Les chercheurs notent que dès qu’un modèle entre en mode « salade de mots », il est très peu probable qu’il s’en échappe sans aide extérieure, restant plutôt dans la boucle coûteuse jusqu’à ce que le budget de décodage de l’utilisateur soit épuis醆:
‘Inutile de dire que cela présente un problème catastrophique pour les utilisateurs, car une section de réflexion idéalement beaucoup plus courte est maintenant maximisée avec des répétitions inutiles. Ainsi, l’utilisateur paie le coût maximum pour une réponse (probablement) incorrecte, tout en subissant la latence de bout en bout la plus longue.’

Part de segments de salade de mots apparaissant avant et après le point de coupe (c’est-à-dire le moment où la sortie répétitive commence à dominer). La plupart des répétitions se produisent après ce point, montrant que lorsque le modèle entre dans une boucle de salade de mots, il se récupère rarement sans intervention.
Les auteurs racontent leur surprise lorsqu’ils ont découvert que les modèles de raisonnement présentent des signes de conscience de leur état de « salade de mots ». Cependant, c’est cette conscience, et la façon dont elle entre dans l’état de raisonnement probable du modèle, qui permet une intervention:
‘La légèreté de ce classificateur linéaire ouvre la porte à une détection en temps réel, où nous pouvons intervenir avec différentes opérations pour résoudre les modèles pris dans des boucles de salade de mots.’
Méthode
Pour détecter la présence de salade de mots pendant l’inférence, les auteurs ont formé un simple classificateur linéaire qui fonctionne sur l’état caché de chaque jeton de nouvelle ligne.
Tout segment se produisant après que le modèle est entré dans une boucle de répétition a été traité comme de la salade de mots, avec cette coupure (appelée point de coupe) utilisée pour étiqueter les données d’entraînement. Mille traces de raisonnement ont été générées à l’aide du benchmark S1, et chaque trace a été divisée en segments séparés par des nouvelles lignes.

Schéma conceptuel pour WordSaladChopper. Pendant la génération, l’état caché à chaque jeton de nouvelle ligne est analysé pour détecter les segments répétitifs. Une fois que deux segments de salade de mots sont marqués à la suite, la génération est arrêtée. Une prompt de régénération fixe est alors ajoutée, permettant au modèle de continuer et de terminer sa réponse sans dépasser le budget.
Si un segment était très similaire à un segment antérieur, il était étiqueté comme de la salade de mots. Une fois que la répétition la plus précoce a été identifiée, tous les segments suivants ont également été étiquetés comme de la salade de mots pour refléter la persistance de ces boucles.
Le classificateur a été implémenté comme une seule couche entièrement connectée et formé sur les états cachés des jetons de fin de bloc de transformation final. Un classificateur distinct a été formé pour chaque modèle, en utilisant ces données, et aucun affinage n’a été effectué pendant l’évaluation.
Données et tests
L’entraînement et l’inférence ont utilisé quatre GPU NVIDIA A100 (80G VRAM), sous l’optimiseur Adam, avec un taux d’apprentissage de 1×10-2, pendant 50 époques.
Les ensembles de données d’évaluation étaient ‘Mathématiques de l’école primaire’ 8000, alias GSM8K; MATH-500; GPQA-DIAMOND; et AIME25 (2025).
Les modèles testés étaient DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; et DeepSeek-R1-Distill-Llama-8B, tous sous licence MIT.
Les métriques utilisées étaient Précision et AUROC.

Précision et AUROC du classificateur de salade de mots sur Qwen-7B à travers quatre benchmarks et deux températures de décodage. Des scores élevés confirment que l’apparition de la répétition peut être détectée de manière fiable à partir de l’état caché du jeton de nouvelle ligne.
Parmi les résultats présentés ici, les auteurs commentent:
‘[Le tableau des résultats ci-dessus] montre que le classificateur linéaire est extrêmement précis dans la détection des segments de salade de mots; cependant [le tableau des résultats ci-dessous] démontre que la prompt de régénération aide à récupérer la précision de la tâche perdue due à la coupe brute.’

Précision de Qwen-7B sur chaque benchmark à τ = 0,6, en comparant les performances avant la salade de mots (Original), après la coupe (Coupé) et après l’application de la régénération (Régénéré). Les gains de la régénération sont modestes mais constants, récupérant les performances avant la boucle dans la plupart des cas.
Dans le tableau des résultats ci-dessous, nous pouvons voir que WordSaladChopper a amélioré ou préservé la précision tout en réduisant fortement la longueur des sorties du modèle, jusqu’à 57%:

Lorsque WordSaladChopper est utilisé à la décodage glouton (τ = 0), il réduit la longueur des sorties du modèle, parfois de plus de la moitié, tout en maintenant la précision identique ou légèrement meilleure, une performance qui reste constante parmi les différents modèles et tâches (AIME25 est omis en raison de résultats instables prévisibles dans ce paramètre).
Les plus grands gains sont apparus dans les réponses plus longues, en particulier sur GPQA-Diamond, où presque la moitié du texte a été supprimée sans affecter les performances. Ci-dessous, nous pouvons voir des résultats similaires lorsque de l’aléatoire a été ajouté pendant la génération:

À une température plus élevée (τ = 0,6), WordSaladChopper continue de raccourcir les sorties de 10 à 30 pour cent, avec une précision restant stable ou légèrement améliorée sur tous les modèles et benchmarks (les résultats d’AIME25 sont moyennés pour réduire la variance).
La précision est restée stable, avec des sorties plus courtes obtenues. Dans l’ensemble, le système a continué à fonctionner même lorsque les réponses du modèle sont devenues plus répétitives; et les auteurs notent que puisque le classificateur ne vérifie qu’un seul jeton par phrase, il s’exécute extrêmement rapidement, même lorsqu’il est utilisé pendant la génération en temps réel.
Le document observe que des stratégies supplémentaires dans la recherche future le long de ces lignes pourraient bénéficier de l’octroi au modèle d’un petit budget de régénération après l’intervention; l’application continue d’un système de type WordSaladChopper sur les régénérations; et la force d’un jeton de « fin de réflexion » sur le modèle, pour exiger sa meilleure réponse actuelle.
Enfin, les chercheurs commentent sur la qualité de l’état actuel de la recherche dans l’évaluation des modèles de raisonnement, avec un ton critique†:
‘Il est notre honnête conviction que de nombreuses méthodes de raisonnement efficaces semblent efficaces en partie parce que les benchmarks d’évaluation de raisonnement actuels ont beaucoup de place pour l’amélioration.
‘Si nous développons des suites d’évaluation plus complètes suites – ce que nous ferons certainement à l’avenir – nous nous attendons à voir de nombreuses méthodes de raisonnement efficaces échouer, ou se comporter beaucoup différemment que leurs homologues LRM standards.’
Conclusion
À l’échelle atteinte par les systèmes de pointe comme ChatGPT, même de petits changements dans la consommation de ressources des utilisateurs peuvent avoir des implications majeures en termes d’infrastructure, de logistique et de coûts. Cela rend l’efficacité une priorité partagée pour les fournisseurs et la communauté de recherche dans son ensemble.
Si elle est mise en œuvre, la nouvelle et légère solution proposée dans le document (qui doit être formée sur chaque nouvelle architecture de modèle) pourrait empêcher la combustion inutile de jetons – ce qui peut donner à l’utilisateur l’impression que le fournisseur « saigne » son allocation de manière prodigue ou trompeuse. En réalité, le fournisseur est mieux servi en fournissant des sorties utiles plutôt que redondantes, qui coûtent la même chose, en termes de calcul, qu’une salade de mots.
* Bien que nous n’allions pas nous étendre sur ce point ici, cela s’applique également aux modèles hébergés localement, qui peuvent être corporatifs ainsi que de loisirs, et où les pertes d’électricité et de productivité de la salade de mots peuvent être un facteur à prendre en compte.
† Comme d’habitude, toutes les emphases sont celles des auteurs, et non les miennes. Lorsque cela est applicable, leurs citations en ligne ont été converties en hyperliens par moi.
†† Nous devons reconnaître ici que les cadres et les API peuvent allouer un « sous-budget » aux requêtes, de sorte qu’une requête n’est pas nécessairement capable de brûler un jour d’allocation de jetons – mais cela n’est pas une pratique courante, ni couramment discutée parmi les fournisseurs d’API uniquement.
††† Je ne suis généralement pas prêt à adopter l’utilisation par les auteurs de « LRM », car ce n’est pas actuellement une abréviation mainstream, donc j’utiliserai une autre terminologie dans cet article, si nécessaire.
Publié pour la première fois jeudi 6 novembre 2025












