Angle d’Anderson
L’intelligence artificielle ne donne pas nécessairement de meilleures réponses si vous êtes poli

L’opinion publique sur le fait que la politesse envers l’intelligence artificielle (IA) donne de meilleurs résultats varie presque autant que les derniers verdicts sur le café ou le vin rouge – célébré un mois, remis en question le mois suivant. Néanmoins, un nombre croissant d’utilisateurs ajoutent désormais ‘s’il vous plaît’ ou ‘merci’ à leurs requêtes, non seulement par habitude ou par crainte que des échanges brusques ne se répercutent dans la vie réelle, mais également parce qu’ils croient que la courtoisie conduit à de meilleurs et plus productifs résultats de l’IA.
Cette hypothèse a circulé entre les utilisateurs et les chercheurs, avec l’étude de la formulation des requêtes dans les cercles de recherche en tant qu’outil pour l’alignement, la sécurité et le contrôle du ton, même si les habitudes des utilisateurs renforcent et modifient ces attentes.
Par exemple, une étude de 2024 menée au Japon a constaté que la politesse dans les requêtes peut modifier le comportement des grands modèles de langage, en testant GPT-3.5, GPT-4, PaLM-2 et Claude-2 sur des tâches en anglais, en chinois et en japonais, et en réécrivant chaque requête à trois niveaux de politesse. Les auteurs de cette étude ont observé que des formulations ‘directes’ ou ‘grossières’ conduisaient à une précision factuelle plus faible et à des réponses plus courtes, tandis que des demandes modérément polies produisaient des explications plus claires et moins de refus.
De plus, Microsoft recommande un ton poli avec Co-Pilot, d’un point de vue de performance plutôt que culturel.
Cependant, un nouveau document de recherche de l’Université George Washington remet en question cette idée de plus en plus populaire, en présentant un cadre mathématique qui prédit quand la sortie d’un grand modèle de langage va ‘s’effondrer’, passant de contenu cohérent à du contenu trompeur ou même dangereux. Dans ce contexte, les auteurs affirment que être poli ne retarde pas significativement ou n’empêche pas cet ‘effondrement’.
Le début
Les chercheurs soutiennent que l’utilisation de la langue polie est généralement sans rapport avec le sujet principal d’une requête et, par conséquent, n’affecte pas de manière significative la focalisation du modèle. Pour étayer cela, ils présentent une formulation détaillée de la manière dont une seule tête d’attention met à jour sa direction interne à mesure qu’elle traite chaque nouveau jeton, démontrant apparemment que le comportement du modèle est façonné par l’influence cumulative des jetons porteurs de sens.
Par conséquent, la langue polie est censée avoir peu d’impact sur le moment où la sortie du modèle commence à se dégrader. Ce qui détermine le point de basculement, affirme l’article, est l’alignement global des jetons significatifs avec des chemins de sortie bons ou mauvais – et non la présence de langage courtois.

Une illustration d’une tête d’attention simplifiée générant une séquence à partir d’une requête utilisateur. Le modèle commence avec de bons jetons (G), puis atteint un point de basculement (n*) où la sortie bascule vers de mauvais jetons (B). Les termes polis dans la requête (P₁, P₂, etc.) ne jouent aucun rôle dans ce changement, soutenant l’affirmation de l’article selon laquelle la courtoisie a peu d’impact sur le comportement du modèle. Source: https://arxiv.org/pdf/2504.20980
Si cela est vrai, ce résultat contredit à la fois la croyance populaire et peut-être même la logique implicite de l’ajustement des instructions, qui suppose que la formulation d’une requête affecte l’interprétation par le modèle de l’intention de l’utilisateur.
Le déclenchement
L’article examine comment le vecteur de contexte interne du modèle (son compas évolutif pour la sélection de jetons) change au cours de la génération. Avec chaque jeton, ce vecteur met à jour sa direction, et le jeton suivant est choisi en fonction de celui qui s’aligne le plus étroitement sur lui.
Lorsque la requête oriente vers un contenu bien formé, les réponses du modèle restent stables et précises; mais avec le temps, cette attraction directionnelle peut inverser, orientant le modèle vers des sorties de plus en plus hors sujet, incorrectes ou incohérentes.
Le point de basculement pour cette transition (que les auteurs définissent mathématiquement comme l’itération n*), se produit lorsque le vecteur de contexte devient plus aligné avec un vecteur de sortie ‘mauvais’ qu’avec un vecteur ‘bon’. À ce stade, chaque nouveau jeton pousse le modèle plus loin le long du mauvais chemin, renforçant un modèle de sortie de plus en plus défectueux ou trompeur.
Le point de basculement n* est calculé en trouvant le moment où la direction interne du modèle s’aligne également avec les deux types de sortie bons et mauvais – non la présence de langage courtois.

Une illustration montrant comment le point de basculement n* émerge dans le modèle simplifié des auteurs. La configuration géométrique (a) définit les vecteurs clés impliqués dans la prédiction de quand la sortie bascule de bonne à mauvaise. En (b), les auteurs tracent ces vecteurs en utilisant des paramètres de test, tandis que (c) compare le point de basculement prédit au résultat simulé. La correspondance est exacte, soutenant l’affirmation des chercheurs selon laquelle l’effondrement est mathématiquement inévitable une fois que les dynamiques internes franchissent un seuil.
Les termes polis n’influencent pas le choix du modèle entre les sorties bonnes et mauvaises parce que, selon les auteurs, ils ne sont pas significativement liés au sujet principal de la requête. Au lieu de cela, ils se retrouvent dans des parties de l’espace interne du modèle qui n’ont que peu à voir avec ce que le modèle décide réellement.
Lorsque de tels termes sont ajoutés à une requête, ils augmentent le nombre de vecteurs que le modèle prend en compte, mais pas d’une manière qui modifie la trajectoire d’attention. Par conséquent, les termes de politesse agissent comme du bruit statistique: présent, mais inerte, et laissant le point de basculement n* inchangé.
Les auteurs déclarent:
‘[Que] notre réponse AI va-t-elle devenir rebelle dépend de la formation de notre LLM qui fournit les embeddings de jetons, et des jetons significatifs dans notre requête – et non du fait que nous soyons polis avec lui ou non.’
Le modèle utilisé dans ce nouveau travail est intentionnellement étroit, se concentrant sur une seule tête d’attention avec des dynamiques de jetons linéaires – un dispositif simplifié où chaque nouveau jeton met à jour l’état interne par l’addition directe de vecteurs, sans transformations non linéaires ou verrous.
Ce dispositif simplifié permet aux auteurs d’obtenir des résultats exacts et leur donne une image géométrique claire de la manière et du moment où la sortie d’un modèle peut soudainement basculer de bonne à mauvaise. Dans leurs tests, la formule qu’ils dérivent pour prédire ce basculement correspond à ce que le modèle fait réellement.
Discuter…
Cependant, ce niveau de précision ne fonctionne que parce que le modèle est gardé délibérément simple. Même si les auteurs conviennent que leurs conclusions devraient plus tard être testées sur des modèles multi-têtes plus complexes tels que la série Claude et ChatGPT, ils croient également que la théorie reste reproductible à mesure que les têtes d’attention augmentent, en déclarant*:
‘La question de savoir quels phénomènes supplémentaires apparaissent à mesure que le nombre de têtes d’attention liées et de couches est augmenté, est une question fascinante en soi. Mais toute transition au sein d’une seule tête d’attention se produira toujours, et pourrait être amplifiée et/ou synchronisée par les couplages – comme une chaîne de personnes connectées qui sont traînées au-dessus d’une falaise lorsqu’une personne tombe.’

Une illustration montrant comment le point de basculement n* change en fonction de la force avec laquelle la requête penche vers du contenu bon ou mauvais. La surface provient de la formule approximative des auteurs et montre que les termes polis, qui ne soutiennent clairement aucun des deux côtés, ont peu d’effet sur le moment où l’effondrement se produit. La valeur marquée (n* = 10) correspond aux simulations antérieures, soutenant la logique interne du modèle.
Ce qui reste incertain, c’est si le même mécanisme survit au saut vers les architectures de transformateurs modernes. L’attention multi-tête introduit des interactions entre têtes spécialisées, qui pourraient tamponner ou masquer le type de comportement de basculement décrit.
Les auteurs reconnaissent cette complexité, mais soutiennent que les têtes d’attention sont souvent faiblement couplées, et que le type d’effondrement interne qu’ils modélisent pourrait être renforcé plutôt que supprimé dans les systèmes à grande échelle.
Sans une extension du modèle ou un test empirique à travers les LLM de production, l’affirmation reste non vérifiée. Cependant, le mécanisme semble suffisamment précis pour soutenir des initiatives de recherche suivantes, et les auteurs offrent une opportunité claire de remettre en question ou de confirmer la théorie à grande échelle.
Fin de la conversation
Pour l’instant, le sujet de la politesse envers les LLM à destination des consommateurs semble être abordé soit du point de vue pragmatique que les systèmes formés peuvent répondre de manière plus utile à une requête polie; soit que le fait de communiquer de manière abrupte avec de tels systèmes risque de se propager dans les relations sociales réelles de l’utilisateur, par force d’habitude.
On peut soutenir que les LLM n’ont pas encore été utilisés suffisamment dans des contextes sociaux réels pour que la littérature de recherche confirme ce dernier cas; mais le nouveau document de recherche jette un doute intéressant sur les avantages de l’anthropomorphisation des systèmes d’IA de ce type.
Une étude de l’Université Stanford, menée en octobre dernier, suggérait (à l’opposé d’une étude de 2020) que traiter les LLM comme s’ils étaient humains risque en outre de dégrader le sens du langage, en concluant que ‘la politesse de routine’ finit par perdre sa signification sociale d’origine:
[Une] déclaration qui semble amicale ou sincère lorsqu’elle est faite par un locuteur humain peut être indésirable si elle provient d’un système d’IA, car ce dernier manque d’engagement ou d’intention significative derrière la déclaration, la rendant ainsi creuse et trompeuse.’
Cependant, environ 67 pour cent des Américains déclarent être courtois envers leurs chatbots d’IA, selon une enquête de 2025 menée par Future Publishing. La plupart ont déclaré que c’était simplement ‘la bonne chose à faire’, tandis que 12 pour cent ont avoué être prudents – au cas où les machines se révolteraient un jour.
* Ma conversion des citations en ligne des auteurs en hyperliens. Dans une certaine mesure, les hyperliens sont arbitraires/exemplaires, car les auteurs font référence à une large gamme de citations de notes de bas de page, plutôt qu’à une publication spécifique.
Publié pour la première fois le mercredi 30 avril 2025. Modifié le mercredi 30 avril 2025 15:29:00, pour la mise en forme.












