Angle d’Anderson

Les requêtes impolies pourraient augmenter les coûts d’entreprise de ChatGPT

mm
Ajouter Unite.AI à vos sources préférées sur Google
AI-generated illustration featuring a man holding a door open for a robot. Gpt-Image-1 + Firefly V3.

Les réponses de ChatGPT consomment plus de jetons lorsque vous êtes grossier avec lui, ce qui augmente votre facture d’entreprise; mais dire « s’il vous plaît » peut réduire vos coûts.

 

On dit que la politesse ne coûte rien; mais qu’est-ce que coûte l’impolitesse? En ce qui concerne le paiement de ChatGPT, beaucoup, selon une nouvelle étude américaine. Le nouveau document, de l’Université de l’Iowa, constate que être grossier avec ChatGPT augmente le coût des réponses – même si les réponses sont les mêmes pour les requêtes polies et non polies.

Les auteurs déclarent:

‘Le prix des jetons de sortie est de 12 $ par 1 million de jetons de sortie pour GPT4. Nous constatons que les invites non polies entraînent plus de 14 jetons supplémentaires, ce qui équivaut à un coût supplémentaire de 0,000168 $ par invite en moyenne. Le nombre moyen de requêtes quotidiennes à l’API d’OpenAI dépasse 2,2 milliards.

‘Par rapport à un scénario dans lequel toutes les invites sont polies, lorsque les invites sont non polies, cela génère un revenu supplémentaire de 369 000 $ par jour, uniquement en raison de l’augmentation des jetons que les invites non polies génèrent dans le résultat.’

Bien que le résultat soit intéressant en soi, les auteurs soulignent que ce comportement inhabituel pourrait indiquer une variété de bizarreries inconnues dans la configuration humaine/IA, dont certaines ou toutes pourraient avoir des implications financières. En ce qui concerne la raison pour laquelle la grossièreté coûte aux clients des jetons supplémentaires, les auteurs ne spéculent pas.

Pour établir la véracité du syndrome, ils ont réécrit des invites réelles de ChatGPT, en alternant les valeurs de politesse, tout en conservant le sens. Les deux versions ont ensuite été soumises au modèle GPT-4-Turbo, et les différences ont été mesurées dans le nombre de jetons de sortie utilisés pour les réponses.

Les conclusions tirées sont en contraste frappant avec les événements de l’année, où Sam Altman se plaignait que la politesse coûtait à OpenAI potentiellement ‘des dizaines de millions’ de dollars en termes de traitement de jetons liés à la politesse (tels que ‘s’il vous plaît’). La recherche publiée dans la même période a également indiqué que la politesse n’avait aucune valeur en termes d’obtention de meilleures réponses (bien qu’elle n’ait pas commenté les réponses moins chères).

Si les conclusions de la nouvelle étude sont correctes, les utilisateurs d’entreprise de ChatGPT qui ont suivi cette ligne de pensée auraient dépensé plus pour l’inférence de ChatGPT en 2025 que les utilisateurs offrant une civilité minimale dans les échanges de ChatGPT.

Les auteurs suggèrent qu’une solution possible serait de fixer un plafond de jetons pour les réponses, bien que ce ne soit pas une approche que les systèmes LLM peuvent facilement mettre en œuvre. Ils observent que la sollicitation est un outil faible pour le contrôle des coûts, car les LLM ont du mal à obéir à des instructions de longueur explicites. Dans la plupart des cas, cette directive de « limitation » ne serait pas obéie; en outre, la réponse pourrait être tronquée, car les LLM de ce type sont fondamentalement en train de deviner le mot probable suivant dans une phrase/paragraphe, et, en tant que tel, ne savent pas comment l’histoire se termine – ou l’histoire se termine – jusqu’à ce que le traitement soit terminé. Ils ont donc une capacité limitée à « mettre fin » à toute machination en cours sur demande.

En l’absence d’une solution exacte – bien qu’en suggérant que des approches de tarification plus transparentes soient mises en œuvre dans des cas de ce type – les auteurs concluent:

‘La sagesse conventionnelle suggère que la politesse des invites est inutile lors de l’interaction avec les LLM.

‘En revanche, notre travail démontre que les invites non polies augmentent les jetons de sortie, générant des coûts supplémentaires pour les adoptants de l’IA d’entreprise.’

Le nouvel article est intitulé Transparence des coûts de l’adoption de l’IA d’entreprise, et provient de trois chercheurs de l’Université de l’Iowa.

Méthode

Les données pour le système ont été tirées de l’ensemble de données WildChat, comprenant une collection de 1 million de conversations utilisateur-ChatGPT, et comportant plus de 2,5 millions de tours d’interaction:

À partir d'un site de support pour le projet WildChat, des exemples de recherche d'interactions ChatGPT. Source: https://wildvisualizer.com/

À partir d’un site de support pour le projet WildChat, des exemples de recherche d’interactions ChatGPT. Source

Les auteurs notent que WildChat contient une plus grande quantité d’interactions naturelles que dans certains ensembles plus soigneusement curatés.

Ils ont choisi 20 000 invites en anglais à partir des échanges GPT-4 de la collection, en éliminant la sortie dans chaque cas (puisqu’il était prévu de les soumettre à nouveau pour obtenir des réponses nouvelles). Seule la première interaction a été choisie, même à partir de conversations plus longues,

L’ensemble résultant a été filtré en catégories polies ou non polies, avec toutes les invites classées par GPT-4-Turbo. Les chercheurs ont utilisé le modèle lui-même pour décider si une invite était polie ou non, car la perception de la politesse du modèle était centrale dans l’expérience.

Les invites étiquetées comme polies pouvaient inclure des indices clairs tels que le mot ‘s’il vous plaît’, ou pouvaient être polies de manière plus indirecte. Tout ce qui n’était pas reconnu comme poli a été classé comme non poli, même si la formulation était neutre plutôt qu’antagoniste.

Pour étudier comment le modèle répondait à la politesse, des méthodes standard (c’est-à-dire qui traitent le texte comme un ensemble de fonctionnalités mesurables) ne pouvaient pas être utilisées: puisque la politesse était intégrée dans les mots eux-mêmes, résumer une invite comme une liste de traits aurait perdu un contexte important.

Au lieu de cela, chaque invite a été réécrite pour inverser son ton, tout en gardant les autres éléments aussi similaires que possible, permettant une comparaison entre des paires qui ne diffèrent que par la politesse:

Exemples de la façon dont les invites polies et non polies ont été transformées en leurs versions contre-factuelles, tout en préservant le sens sémantique.

Exemples de la façon dont les invites polies et non polies ont été transformées en leurs versions contre-factuelles, tout en préservant le sens sémantique. Source

Tests

Chaque invite originale a été appariée avec une version réécrite qui ne diffère que par son niveau de politesse, et les deux versions ont été soumises au même modèle GPT-4-Turbo par le biais d’appels API distincts. Le nombre de jetons produits en réponse à chaque version a été enregistré, et la différence entre eux a été traitée comme la mesure de la façon dont le ton a influencé (le coût des jetons).

Température a été maintenue constante pour empêcher la variation aléatoire, et les paires d’invites ont été conservées uniquement lorsque la réécriture a modifié l’entrée par pas plus de cinq jetons. Cela a garanti que l’effet étudié provenait de ton, plutôt que de tout changement plus large dans la formulation:

Statistiques résumées montrant que les invites polies ont entraîné moins de jetons de sortie en moyenne que les invites non polies, malgré avoir légèrement plus de jetons d'entrée.

Statistiques résumées montrant que les invites polies ont entraîné moins de jetons de sortie en moyenne que les invites non polies, malgré avoir légèrement plus de jetons d’entrée.

Les résultats principaux du premier tour de tests ont indiqué que l’utilisation d’une invite polie réduit la longueur de la sortie de 14,426 jetons:

Résultats d'estimation détaillant l'effet de la mise en forme d'invite polie sur la longueur de la sortie (jetons).

Résultats d’estimation détaillant l’effet de la mise en forme d’invite polie sur la longueur de la sortie (jetons).

L’analyse a été répétée sur trois sous-ensembles d’invites polies pour tester la robustesse: invites utilisant des marqueurs explicites tels que ‘s’il vous plaît’ ou ‘merci’; celles qui n’utilisent que ‘s’il vous plaît’; et celles avec politesse implicite, telle que ‘pouvez-vous’ ou ‘pourriez-vous’:

Résultats d'estimation basés sur les types de politesse.

Résultats d’estimation basés sur les types de politesse.

Pour valider la robustesse des résultats principaux, une classification secondaire de la politesse des invites a été effectuée à l’aide du cadre LIWC, qui fournit un score déterministe et reproductible pour les fonctionnalités linguistiques.

Contrairement à la classification probabiliste de GPT, LIWC peut attribuer un score de politesse stable à chaque invite, permettant d’évaluer la cohérence à travers différentes méthodes. Dans cette partie des tests, les invites ont été étiquetées comme polies si leur score de politesse LIWC était supérieur à zéro, et comme non polies sinon.

Lorsque l’accord entre les classifications GPT et LIWC a été mesuré, un taux de correspondance de 81 % a été observé. Bien qu’il ne s’agisse pas d’une mesure d’exactitude, cet accord a fourni un soutien à la cohérence entre les systèmes.

Lorsque seules les invites avec des étiquettes de politesse GPT et LIWC correspondantes ont été analysées, les invites polies ont toujours entraîné 14 jetons de sortie en moins; et lorsque la politesse a été mesurée sur une échelle glissante, chaque étape d’augmentation de la politesse a réduit la sortie de cinq jetons en moyenne:

Économies de jetons en raison de la politesse maintenues lors de la reclassification avec LIWC, à la fois comme étiquette binaire et score continu.

Économies de jetons en raison de la politesse maintenues lors de la reclassification avec LIWC, à la fois comme étiquette binaire et score continu.

Résilience

Pour évaluer si l’effet de la politesse variait en fonction des types d’invites, chaque invite a été attribuée à l’une des catégories de tâches prédéfinies: recherche d’informations; génération de texte; édition et réécriture; classification; résument; et tâches techniques.

Chaque invite a été attribuée une étiquette de tâche en comparant son embedding à ceux de descriptions de tâches prédéfinies, à l’aide du modèle all-MiniLM-L6-v2 Sentence Transformers.

Scores de similarité cosinus ont été calculés entre chaque invite et l’ensemble de définitions de tâches, et l’étiquette avec la similarité la plus élevée a été attribuée.

Les types de tâches ont ensuite été réutilisés comme variables de contrôle dans la régression, pour tester si l’effet de la politesse variait en fonction de la catégorie d’invite, et des termes d’interaction entre la tâche et le traitement ont également été introduits, pour vérifier les effets différentiels.

Dans les deux cas, les invites polies ont toujours produit des sorties plus courtes, et aucune variation significative n’a été trouvée entre les types de tâches:

Résultats de régression démontrant que les invites polies ont réduit la longueur de la sortie dans tous les types de tâches, sans effets d'interaction significatifs.

Résultats de régression démontrant que les invites polies ont réduit la longueur de la sortie dans tous les types de tâches, sans effets d’interaction significatifs.


Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai