Angle d’Anderson
Les requêtes impolies pourraient augmenter les coûts d’entreprise de ChatGPT

même si les réponses sont les mêmes pour les requêtes polies et non polies. Les auteurs déclarent: ‘Le prix des jetons de sortie est de 12 $
Les réponses de ChatGPT consomment plus de jetons lorsque vous êtes grossier avec lui, ce qui augmente votre facture d’entreprise; mais dire « s’il vous plaît » peut réduire vos coûts. On dit que la politesse ne coûte rien; mais qu’est-ce que coûte l’impolitesse? En ce qui concerne le paiement de ChatGPT, beaucoup, selon une nouvelle étude américaine. Le nouveau document, de l’Université de l’Iowa, constate que être grossier avec ChatGPT augmente le coût des réponses –
par 1 million de jetons de sortie pour GPT4. Nous constatons que les invites non polies entraînent plus de 14 jetons supplémentaires, ce qui équivaut à un coût supplémentaire de 0,000168 $ par invite en moyenne. Le nombre moyen de requêtes quotidiennes à l’API d’OpenAI dépasse 2,2 milliards. Bien que le résultat soit intéressant en soi, les auteurs soulignent que
du syndrome, ils ont réécrit des invites réelles de ChatGPT, en alternant les valeurs de politesse, tout en conservant le sens. Les deux versions ont ensuite été soumises au modèle GPT-4-Turbo, et les différences ont été mesurées dans le nombre de jetons de sortie utilisés pour les réponses.
ce comportement inhabituel pourrait indiquer une variété de bizarreries inconnues dans la configuration humaine/IA, dont certaines ou toutes pourraient avoir des implications financières. En ce qui concerne la raison pour laquelle la grossièreté coûte aux clients des jetons supplémentaires, les auteurs ne spéculent pas. ‘Par rapport à un scénario dans lequel toutes les invites sont polies, lorsque les invites sont non polies, cela génère un revenu supplémentaire de 369 000 $ par jour, uniquement en raison de l’augmentation des jetons que les invites non polies génèrent dans le résultat.’ Pour établir la véracité Les conclusions tirées sonten contraste frappant avec les événements de l’année, où Sam Altman se plaignait que la politesse coûtait à OpenAI potentiellement ‘des dizaines de millions’ de dollars en termes de traitement de jetons liés à la politesse (tels que ). La recherche ‘s’il vous plaît’ publiée dans la même période a également indiqué que la politesse n’avait aucune valeur en d’obtentiontermes de meilleures réponses (bien qu’elle n’ait pas commenté les réponses ). moins chères Si les conclusions de la nouvelle étude sont correctes, les utilisateurs d’entreprise de ChatGPT qui ont suivi mises cette ligne de pensée auraient dépensé plus pour l’inférence de ChatGPT en 2025 que les utilisateurs offrant une civilité minimale dans les échanges de ChatGPT. Les auteurs suggèrent qu’une solution possible serait de fixer un plafond de jetons pour les réponses, bien que ce ne soit pas une approche que les systèmes LLM peuvent facilement mettre en œuvre. Ils observent que la sollicitation est un outil faible pour le contrôle des coûts, car les LLM En l’absence d’une solution exacte – bien qu’en suggérant que des approches de tarification plus transparentes soient en œuvre dans des cas de ce type– les auteurs concluent: ont du mal à obéir à des instructions de longueur explicites . Dans la plupart des cas, cette directive de « limitation » ne serait pas obéie; en outre, la réponse pourrait être tronquée, car les LLM de ce type sont fondamentalement en train de deviner le conventionnelle mot probable suivant dans une phrase/paragraphe, et, en tant que tel, ne savent pas comment l’histoire se termine – ou l’histoire se termine – jusqu’à ce que le traitement soit terminé. Ils ont donc une capacité limitée à « mettre fin » à toute machination en cours sur demande. où ‘La sagesse
suggère que la politesse des invites est inutile lors de l’interaction avec les LLM.
‘En revanche, notre travail démontre que les invites non polies augmentent les jetons de sortie, générant des coûts supplémentaires pour les adoptants de
Le l’IA d’entreprise.’ nouvel article est des coûts de l’adoption de l’IA d’entrepriseintitulé , et provient de trois chercheurs de l’Université de l’Iowa. Transparence
Méthode
Les données pour le système ont été tirées de l’ensemble de données WildChat , comprenant une collection de 1 million de conversations utilisateur-ChatGPT, et comportant plus de 2,5 millions de tours d’interaction:

Source Les auteurs notent que WildChat contient une plus grande quantité d’interactions naturelles que dans certains ensembles plus soigneusement curatés. Ils ont choisi 20 000 invites en anglais à partir des échanges GPT-4 de la collection, en éliminant la sortie dans chaque cas (puisqu’il était prévu de les soumettre à nouveau pour obtenir des réponses nouvelles). Seule la première interaction a été choisie, même à partir de conversations plus longues, L’ensemble résultant a été filtré en catégories polies ou clairs tels que , avec toutes les invites classées par GPT-4-Turbo. Les chercheurs ont utilisé le modèle lui-même pour décider si une invite était polie ou non, car la perception de la politesse du modèle était centrale dans l’expérience. non polies Les invites étiquetées comme pouvaient inclure des indices être le mot polies ‘s’il vous plaît’ , ou pouvaient poliesde manière plus indirecte. Tout ce qui n’était pas reconnu comme a été classé comme la poli , même si de laformulation était neutre plutôt qu’antagoniste. non poli Pour étudier comment le modèle répondait à la politesse, des méthodes standard (c’est-à-dire qui traitent le texte comme un ensemble de fonctionnalités mesurables) ne pouvaient pas être utilisées: puisque la politesse était intégrée dans les mots eux-mêmes, résumer une invite comme une liste de traits aurait perdu un contexte important. Au lieu de cela, chaque invite a été réécrite pour inverser son ton, tout en gardant les autres éléments aussi similaires que possible, permettant une comparaison entre des paires qui ne diffèrent que par la politesse: Exemples

Tests
Chaque invite originale a été appariée avec une version réécrite qui ne diffère que par son niveau de politesse, et les deux versions ont été soumises au même modèle GPT-4-Turbo par le biais d’appels API distincts. Le nombre de jetons produits en réponse à chaque version a été enregistré, et la différence entre eux a été traitée comme la mesure de la façon dont le ton a influencé (le coût des jetons).
Température a été maintenue constante pour empêcher la variation aléatoire, et les paires d’invites ont été conservées uniquement lorsque la réécriture a modifié l’entrée par pas plus de cinq jetons. Cela a garanti que l’effet étudié provenait de , plutôt que Statistiquesde tout changement plus large dans la formulation: ton

Les résultats principaux du premier tour de tests ont indiqué que l’utilisation d’une invite polie réduit la longueur de la sortie de 14,426 jetons: Résultats d’estimation détaillant l’effet

sur trois sous-ensembles d’invites polies pour tester la robustesse: invites utilisant des marqueurs explicites tels que ou ‘s’il vous plaît’ ; celles qui que n’utilisent avec ‘s’il vous‘merci’ ; et celles queplaît’ , telle : politesse implicite ou ‘pouvez-vous’ Résultats d’estimation basés ‘pourriez-vous’ les typessur

une classification secondaire de la politesse des invites a été effectuée à l’aide du cadre LIWC , qui fournit un score déterministe et reproductible pourles fonctionnalités linguistiques. Contrairement à la classification probabiliste de GPT, LIWC peut attribuer un score de politesse stable à chaque invite, permettant d’évaluer la cohérence à travers différentes méthodes. Dans cette partie des tests, les invites ont été étiquetées comme si leur score de politesse LIWC était supérieur à zéro, et comme été polies sinon. non polies Lorsque l’accord entre les classifications GPT et LIWC a soutien à mesuré, un taux de correspondance de 81 % a été observé. Bien qu’il ne s’agisse pas d’une mesure d’ exactitude , cet accord a fourni un lacohérence entre les systèmes. Lorsque seules les invites avec des étiquettes de politesse GPT et LIWC correspondantes ont été analysées, les invites polies ont toujours entraîné 14 jetons de sortie en moins; et lorsque la politesse a été mesurée sur une échelle glissante, chaque étape d’augmentation de la politesse a réduit la sortie de cinq jetons en moyenne: Économies de

Résilience
Pour évaluer si l’effet de la politesse variait en fonction des types d’invites, chaque invite a été attribuée à l’une des catégories de tâches prédéfinies: ; recherche d’informations ; de textegénération réécriture; ;édition et classification ; et résument. techniquestâches aChaque invite Transformers .été attribuée une étiquette de tâche en comparant son embedding à ceux de descriptions de tâches prédéfinies, à l’aide du modèle all-MiniLM-L6-v2 Sentence Scores de similarité cosinus ont été calculés entre
chaque invite et l’ensemble de définitions de tâches, et l’étiquette avec la similarité la plus élevée a été attribuée. Les types de tâches ont ensuite été réutilisés comme variables de contrôle dans la régression, pour tester si l’effet de la politesse variait en fonction de la catégorie d’invite, et des termes d’interaction entre la tâche et le traitement ont également été introduits, pour vérifier les effets différentiels. Dans les deux cas, les invites polies ont toujours produit des sorties plus courtes, et aucune variation significative n’a été trouvée entre les types de tâches: Résultats

d’interaction significatifs. Pour tester si les réponses plus courtes aux invites polies reflétaient une qualité réduite, les sorties des invites originales et contre-factuelles ont été comparées pour la similarité sémantique. En utilisant le modèle all-MiniLM-L6-v2, chaque réponse a été intégrée dans un espace vectoriel sémantique , etla similarité cosinus a été calculée entre chaque paire, donnant une similarité moyenne de 0,78, indiquant une forte alignement dans le sens, et suggérant que le contenu est resté cohérent même lorsque le ton a changé.
Mots d’arrêt
Pour comprendre quels types de contenu sont réduits dans les sorties plus courtes, les mots les plus fréquemment supprimés ont été examinés. Ceux-ci se sont révélés être des mots d’arrêt courants tels que , ,‘avoir’ , et‘plus’ ,‘où’ poliec’est-à-dire des termes qui servent des rôles grammaticaux plutôt que sémantiques. ‘dans’ Pour confirmer que la réduction des jetons n’était pas due à la perte de contenu significatif, les mots d’arrêt ont été supprimés, et les phrases de jusqu’à quatre mots ont été analysées pour des disparitions systématiques; cependant, aucun modèle cohérent ou sémantiquement important n’a été trouvé, suggérant que les réductions dues à la formulation n’étaient Ainsi, il semblait toujours que plus de jetons étaient dépensés en réponses aux requêtes impolies que polies – comme une sorte de « taxe » sur la grossièreté. pas en train de supprimer du contenu significatif ou utile.
Étude humaine
Pour tester si la qualité de la sortie était affectée par le ton de l’invite, une évaluation humaine a également été réalisée, à l’aide d’un échantillon aléatoire de vingt invites vingt et quatre conditions: ou polies . invites non polies Après avoir exclu les invites sur des sujets sensibles ou techniques, les réponses ont été notées par 401 participants sur une échelle de sept points. Chaque participant n’a vu qu’une seule réponse, tirée de l’une des , polie polie ouet soit non contre-factuelle originale . sortiesAucune différence significative n’a été trouvée dans la qualité perçue dans l’une de ces conditions. Les polies et non polies ont reçu des scores presque identiques, tout comme les versions originales et contre-factuelles . Les auteurs affirment que ces résultats indiquent que la réduction de la longueur de la sortie n’a pas été causée par une perte de qualité, mais plutôt par une reformulation, ou par des changements structurels qui ont néanmoins préservé le sens. La différence de coût observée dans les invites d’entreprise est donc peu susceptible de refléter des changements dans l’utilité ou la clarté, et la « taxe » est toujours en vigueur.
Conclusion
Bien que le nouveau travail se concentre sur l’utilisation d’entreprise de ChatGPT, les utilisateurs de niveau inférieur sont également affectés par ce syndrome, puisque même les deux niveaux d’entrée ont des limites d’utilisation; et – probablement – traiter ChatGPT de manière grossière fera accélérer l’utilisateur moyen vers l’épuisement de l’allocation quotidienne de jetons. La nouvelle étude se concentre sur une question ouverte qui a fait l’objet d’une large couverture médiatique et qui a été beaucoup étudiée dans les interactions humaines/IA; mais les auteurs soulignent que les questions de politesse devraient être considérées comme des indicateurs d’un éventail plus profond de bizarreries linguistiques, encore inconnues, qui pourraient avoir un impact sur les frais d’inférence. Publié pour la
première fois le mercredi 19 novembre 2025












