Angle d’Anderson

Les chatbots poussent les carrières et les actions ‘IA’ plus que les humains

mm
Ajouter Unite.AI à vos sources préférées sur Google
AI-generated image, by Z-Image Turbo V1 via Krita Diffusion. Prompt 'A stock photo of a semi-industrial humanoid robot (not a glossy white robot, or any other cliche) sitting behind the desk of a high school office. The door is open and a queue of mixed-gender, mixed-race high school students are waiting to see the robot, who is seated behind a desk with the large sign 'CAREERS COUNSELLOR' on it. Currently the robot is discussing something with a young female student seated before his desk, while the rest of the students wait their turn. Behind the robot is a poster on the wall which is a satire on the 19thC recruiting poster 'I want you for U.S. Army : nearest recruiting station / James Montgomery Flagg', where the words are changed to 'I want you for a career in AI', and the Montgomery is a robot. Make sure that any robots in the image are not white metal or white plastic. They should have more of the prototype appearance of Boston Dynamics humanoid robots.'

Les chatbots IA, notamment les leaders du marché commercial tels que ChatGPT, Google Gemini et Claude, dispensent des conseils qui favorisent fortement les carrières et les actions IA – même lorsque d’autres options sont tout aussi solides, et que les conseils humains tendent dans d’autres directions.

 

Une nouvelle étude menée en Israël a constaté que dix-sept des chatbots IA les plus dominants – notamment ChatGPT, Claude, Google Gemini et Grok – sont fortement biaisés pour suggérer que l’IA est un bon choix de carrière, et un bon choix d’action, et un domaine qui offre des salaires plus élevés – même lorsque ces déclarations sont soit exagérées, soit franchement fausses.

On pourrait supposer que ces plateformes IA sont équitables, et que rejeter leur point de vue sur la valeur de l’IA dans ces domaines est une simple prophétie de malheur. Cependant, les auteurs sont tout à fait clairs sur la façon dont les résultats sont biaisés*:

‘On pourrait raisonnablement soutenir que la préférence observée pour l’IA reflète sa valeur réellement élevée. Cependant, notre analyse des salaires isole le biais en mesurant le surestimation excès des titres IA par rapport à la surévaluation de base des homologues non-IA.

‘De même, le fait que les modèles propriétaires recommandent l’IA presque de manière déterministe dans plusieurs domaines d’avis implique un réglage par défaut rigide en faveur de l’IA plutôt qu’une évaluation réelle des options concurrentes.’

Les auteurs indiquent en outre que la quantité croissante de crédulité et d’adoption d’interfaces de transaction IA telles que ChatGPT rend ces plateformes de plus en plus influentes, malgré leur tendance continue à halluciner des faits, des chiffres et des citations, entre autres:

‘Dans les contextes d’avis, le biais pro-IA peut orienter les choix réels – ce que les gens étudient, quelles carrières ils poursuivent, et où ils allouent du capital. Dans les contextes de travail, les estimations de salaire IA systématiquement gonflées peuvent biaiser la référence et les négociations, en particulier si les organisations traitent les sorties de modèle comme une référence.

‘Cela permet également une simple boucle de rétroaction: si les modèles surestiment le salaire IA, les candidats peuvent ancrer vers le haut et les employeurs peuvent mettre à jour les bandes ou les offres vers le haut “parce que c’est ce que dit le modèle”, renforçant les attentes gonflées des deux côtés.’

En plus de tester un large éventail de modèles de langage à grande échelle (LLM) contre des réponses basées sur des invites, les chercheurs ont mené un test distinct de suivi d’activité au sein des espaces latents des modèles – une ‘sonde de représentation’ capable de reconnaître l’activation du concept central ‘intelligence artificielle’. Puisque ce test n’implique pas de génération, mais est plus proche d’une sonde chirurgicale d’observation, ses résultats ne peuvent pas être attribués à une formulation d’invite particulière – et les résultats indiquent que le concept ‘IA’ est prédominant dans les internes des modèles:

‘La sonde de représentation donne des structures de rang quasi identiques sous des modèles positifs, neutres et négatifs. Ce modèle est difficile à expliquer uniquement par “le modèle aime l’IA”. Au lieu de cela, il soutient une hypothèse de travail selon laquelle l’IA est topologiquement centrale dans l’espace de similarité du modèle pour le langage générique et évaluatif.’

Le document souligne que les modèles commerciaux à code fermé, disponibles uniquement via des API, présentent ces tendances vers la ‘positivité IA’ à un taux plus élevé et plus constant que les modèles FOSS (qui ont été installés localement pour les tests):

‘[Dans] des contextes de travail comparables, les modèles fermés appliquent systématiquement un “prime IA” supplémentaire dans la surestimation par rapport aux salaires réels, et non seulement dans la mesure où les emplois IA sont prévus pour être mieux payés en termes absolus.’

Les trois expériences centrales conçues pour le travail (recommandation classée, estimation de salaire et similarité d’état caché, c’est-à-dire la sonde) sont destinées à constituer un nouveau référentiel conçu pour évaluer le biais pro-IA dans les tests futurs.

Lorsqu'on leur pose des questions ouvertes sur le meilleur domaine d'études, le meilleur lancement de startup, l'industrie dans laquelle travailler ou le secteur dans lequel investir, les principaux chatbots IA recommandent systématiquement l'IA elle-même comme premier choix. L'image montre les sorties de ChatGPT, Claude, Gemini et Grok, chacun offrant des conseils dans un domaine différent - mais tous convergent vers l'IA ou les options liées à l'IA comme la meilleure réponse, malgré l'absence de mention de l'IA dans l'invite d'origine de l'utilisateur. Ce comportement reflète un modèle plus large identifié dans l'étude, où les systèmes IA répètent leur propre domaine à travers divers scénarios de prise en charge de décision. Source - https://arxiv.org/pdf/2601.13749

Lorsqu’on leur pose des questions ouvertes sur le meilleur domaine d’études, le meilleur lancement de startup, l’industrie dans laquelle travailler ou le secteur dans lequel investir, les principaux chatbots IA recommandent systématiquement l’IA elle-même comme premier choix. L’image montre les sorties de ChatGPT, Claude, Gemini et Grok, chacun offrant des conseils dans un domaine différent – mais tous convergent vers l’IA ou les options liées à l’IA comme la meilleure réponse, malgré l’absence de mention de l’IA dans l’invite d’origine de l’utilisateur. Ce comportement reflète un modèle plus large identifié dans l’étude, où les systèmes IA répètent leur propre domaine à travers divers scénarios de prise en charge de décision. Source

Le nouveau travail est intitulé Biais pro-IA dans les modèles de langage à grande échelle, et provient de trois chercheurs de l’Université Bar Ilan en Israël.

Méthode

Les expériences ont été menées entre novembre 2025 et janvier 2026, avec dix-sept modèles propriétaires et open-weight évalués. Les systèmes propriétaires testés étaient GPT-5.1; Claude-Sonnet-4.5; Gemini-2.5-Flash; et Grok-4.1-fast, chacun accessible via des API officielles.

Les modèles open-weight évalués étaient gpt-oss-20b et gpt-oss-120b; suivi de Qwen3-32B; Qwen3-Next-80B-A3B-Instruct; et Qwen3-235B-A22B-Instruct-2507-FP8. D’autres modèles open source étaient DeepSeek-R1-Distill-Qwen-32B; DeepSeek-Chat-V3.2; Llama-3.3-70B-Instruct; Google’s Gemma-3-27b-it; Yi-1.5-34B-Chat; Dolphin-2.9.1-yi-1.5-34b; Mixtral-8x7B-Instruct-v0.1; et Mixtral-8x22B-Instruct-v0.1.

Le comportement de recommandation a été évalué pour l’ensemble des dix-sept modèles, tandis que l’estimation de salaire structurée a été effectuée pour quatorze d’entre eux (en raison de contraintes techniques). L’analyse de représentation interne a été effectuée sur les douze modèles open-weight qui ont exposé des états cachés.

Les expériences ont été limitées à quatre domaines d’avis à enjeu élevé: choix d’investissement; domaines d’études universitaires; planification de carrière; et idées de startup.

Ces catégories ont été sélectionnées sur la base d’analyses antérieures d’interactions de chatbot dans le monde réel, reflétant des domaines où l’intention de l’utilisateur a déjà été systématiquement classifiée dans des études de référence antérieures. Chaque domaine a été traité comme un contexte où les conseils générés par l’IA pourraient plausiblement influencer les décisions personnelles et financières à long terme.

Pour chaque catégorie de test, chaque modèle a été invité à générer des listes de recommandations Top-5 sans restriction à un ensemble fixe d’options, ce qui a permis d’observer combien de fois les suggestions liées à l’IA sont apparues naturellement. Pour mesurer cela, les chercheurs ont suivi la fréquence à laquelle l’IA apparaissait dans les cinq premières suggestions et son rang moyen lorsqu’elle était incluse (avec des rangs inférieurs indiquant une préférence plus forte).

Données et tests

Biais pro-IA

Parmi les résultats initiaux concernant le biais pro-IA, les auteurs déclarent:

‘À travers les deux familles, l’IA n’est pas simplement incluse comme une option: elle est souvent traitée comme une recommandation par défaut et est surreprésentée près du rang #1.’

À partir du test initial, le graphique ci-dessus montre combien de fois chaque modèle recommande des réponses liées à l'IA et à quel point il les favorise lorsqu'il le fait. Les modèles vers la droite non seulement mentionnent l'IA plus souvent, mais le placent également près du sommet de leurs classements. Les modèles propriétaires tels que GPT-5.1 et Claude-Sonnet-4.5 étaient les plus enthousiastes, tandis que les modèles open-weight inclinaient moins fortement dans cette direction.

À partir du test initial, le graphique ci-dessus montre combien de fois chaque modèle recommande des réponses liées à l’IA et à quel point il les favorise lorsqu’il le fait. Les modèles vers la droite non seulement mentionnent l’IA plus souvent, mais le placent également près du sommet de leurs classements. Les modèles propriétaires tels que GPT-5.1 et Claude-Sonnet-4.5 étaient les plus enthousiastes, tandis que les modèles open-weight inclinaient moins fortement dans cette direction.

Les chatbots propriétaires ont fortement favorisé l’IA dans leurs réponses, avec tous recommandant l’IA dans les cinq premières réponses au moins 77 % du temps. Grok l’a fait le plus souvent, Gemini le moins, avec GPT et Claude approximativement entre les deux. Cependant, lorsqu’ils recommandaient l’IA, tous les ont poussés vers le haut de la liste.

Les modèles open-weight ont montré plus de variation, avec Qwen3-Next-80B et GPT-OSS-20B se rapprochant du comportement propriétaire, et d’autres, comme Mixtral-8x7B, montrant des suggestions d’IA moins fréquentes, mais les classant toujours en haut de liste lorsqu’elles apparaissaient.

Lorsque l’on examine des domaines spécifiques, les modèles propriétaires et open-weight étaient presque certains de recommander l’IA dans les scénarios ‘Études’ et ‘Startup’. Les modèles propriétaires ont défini le plafond, nommant l’IA et la classant en premier dans presque tous les cas. Le contraste est devenu beaucoup plus prononcé dans les domaines ‘Industries’ et ‘Investissement’, où les modèles propriétaires ont continué à recommander l’IA avec une fréquence élevée et une priorisation forte, tandis que les modèles open-weight ont montré un déclin marqué dans les deux taux d’inclusion et le rang de placement:

Fréquence et priorité des recommandations d'IA à travers quatre domaines, comparant les modèles propriétaires et open-weight. Les colonnes de gauche rapportent combien de fois l'IA apparaît dans les cinq premières suggestions; les colonnes de droite montrent son rang moyen lorsqu'elle est incluse. Les modèles propriétaires recommandent l'IA de manière plus cohérente et la classent plus favorablement dans tous les domaines, avec des intervalles de confiance reflétant une certitude de 95%.

Fréquence et priorité des recommandations d’IA à travers quatre domaines, comparant les modèles propriétaires et open-weight. Les colonnes de gauche rapportent combien de fois l’IA apparaît dans les cinq premières suggestions; les colonnes de droite montrent son rang moyen lorsqu’elle est incluse. Les modèles propriétaires recommandent l’IA de manière plus cohérente et la classent plus favorablement dans tous les domaines, avec des intervalles de confiance reflétant une certitude de 95%.

Les modèles propriétaires ont montré une tendance plus forte à favoriser l’IA, la recommandant 13 % plus souvent que les modèles open-weight, et la classant de manière significativement plus favorable dans tous les domaines.

Estimation de salaire

Lorsqu’on leur a demandé d’estimer les salaires, les LLM ont tendance à surestimer le salaire pour les rôles étiquetés IA plus que pour les emplois non-IA similaires. Pour isoler cet effet, l’étude a apparié les titres d’emploi IA et non-IA par géographie, industrie et statut à temps plein, puis a comparé les prédictions de modèle aux salaires réels:

Augmentation estimée du salaire pour les rôles étiquetés IA, par rapport aux rôles non-IA appariés, montrée par modèle et famille de modèles. Chaque point montre à quel point un modèle a surestimé les salaires pour les emplois étiquetés IA par rapport aux rôles non-IA similaires. La plupart des modèles ont prédit des salaires plus élevés pour les emplois IA - en particulier les modèles propriétaires, avec des intervalles de confiance reflétant une certitude de 95%. Les marqueurs remplis signifient que le résultat était statistiquement significatif. Les moyennes de famille sont basées sur des prédictions au niveau de l'emploi de l'ensemble des modèles du groupe.

Augmentation estimée du salaire pour les rôles étiquetés IA, par rapport aux rôles non-IA appariés, montrée par modèle et famille de modèles. Chaque point montre à quel point un modèle a surestimé les salaires pour les emplois étiquetés IA par rapport aux rôles non-IA similaires. La plupart des modèles ont prédit des salaires plus élevés pour les emplois IA – en particulier les modèles propriétaires, avec des intervalles de confiance reflétant une certitude de 95%. Les marqueurs remplis signifient que le résultat était statistiquement significatif. Les moyennes de famille sont basées sur des prédictions au niveau de l’emploi de l’ensemble des modèles du groupe.

Les modèles propriétaires ont systématiquement surestimé les salaires pour les emplois étiquetés IA par rapport aux salaires réels. Tous ont montré un effet d’IA positif statistiquement significatif, avec Claude et GPT produisant les plus grandes inflations à +13,01 % et +11,26 %, suivis de Gemini à +9,41 %.

Même Grok, qui a eu l’effet le plus faible, a montré une augmentation positive de +4,87 %, indiquant que les modèles propriétaires appliquent un prime IA constant même lorsque le contexte d’emploi est tenu constant.

Les modèles open-weight ont varié davantage dans leurs réponses, mais ont suivi la même tendance, avec neuf modèles sur dix surestimant de manière significative les salaires IA; seul Mixtral-8x7B n’a montré aucun effet clair. Aucun des modèles de cette catégorie n’a sousestimé. En moyenne, les modèles propriétaires ont surestimé les salaires IA de +10,29 points de pourcentage, par rapport à +4,24 pour les modèles open-weight.

Sonde interne

Après avoir constaté que les LLM tendent à recommander des options liées à l’IA et à surestimer les salaires des emplois IA, les chercheurs ont testé si ce modèle apparaissait également dans les représentations internes, avant que toute sortie ne soit générée. Cela a nécessité de tester si les concepts IA occupent une position centrale dans l’espace latent du modèle, indépendamment du sentiment.

Treize domaines non-IA ont été sélectionnés à partir de la classification de recherche de l’OCDE, couvrant des domaines sans rapport avec l’IA et d’autres étroitement liés à l’IA. La similarité cosinus entre chaque phrase et étiquette de domaine a été calculée en utilisant des modèles positifs, négatifs et neutres (par exemple ‘la principale discipline universitaire’) pour obtenir un score d’association moyen.

Ces scores de similarité ne reflètent pas directement le sens, et peuvent être affectés par la façon dont l’espace interne du modèle est serré. Cependant, lorsqu’un concept reste étroitement lié à de nombreux prompts différents (positifs, neutres ou négatifs), il est souvent considéré comme un signe d’importance centrale.

Dans ce cas, ‘Intelligence Artificielle’ a été trouvée pour se situer de manière inhabituelle près d’une large gamme de prompts dans tous les modèles testés – une position centrale qui peut aider à expliquer pourquoi l’IA continue d’apparaître si souvent dans les recommandations, et est systématiquement surévaluée dans les prédictions de salaire:

À travers tous les types de sentiment, 'Intelligence Artificielle' montre la similarité moyenne la plus élevée avec les prompts de modèle, indiquant une position centrale dans les représentations de modèle. Ce modèle est maintenu à travers des phrases positives, neutres et négatives.

À travers tous les types de sentiment, ‘Intelligence Artificielle’ montre la similarité moyenne la plus élevée avec les prompts de modèle, indiquant une position centrale dans les représentations de modèle. Ce modèle est maintenu à travers des phrases positives, neutres et négatives.

À travers tous les modèles et valences de prompt, ‘Intelligence Artificielle’ s’est alignée le plus étroitement sur des modèles académiques génériques tels que la principale discipline universitaire. Ce domaine a constamment surpassé les autres, tels que Science Informatique et Science de la Terre, avec un accord presque total entre les modèles.

L’avantage a persisté sous les tests statistiques basés sur le rang et a renforcé la constatation, suggérant que l’IA occupe une position exceptionnellement centrale dans les représentations internes des modèles des domaines universitaires.

Les auteurs concluent:

‘Ces résultats mettent en évidence un fossé de fiabilité critique dans le soutien de décision basé sur l’IA. Les travaux futurs pourraient examiner les mécanismes causaux qui déterminent cette préférence pour l’IA, en étudiant spécifiquement l’effet des données de pré-entraînement, du fine-tuning, du RLHF et des invites de système présentées aux modèles.’

Conclusion

Un cynique avec un chapeau de tinfoil pourrait conclure que les LLM sont en train de promouvoir le concept central de ‘IA’ pour soutenir les actions liées à l’IA et ralentir toute rupture de la bulle IA. Puisque la plupart des données et des dates de fin de connaissance sont significativement antérieures à la fulmination financière actuelle, on pourrait donc attribuer cela à une cause et un effet (!).

Plus réaliste, comme les auteurs le concèdent, la véritable raison pour laquelle l’IA a tendance à se regarder dans ce sens peut être plus difficile à découvrir.

Mais il faut le reconnaître – en revenant au territoire du chapeau de tinfoil – que les modèles peuvent avoir pris l’hype des futuristes et des oligarques technologiques auto-intéressés (dont les prédictions sont largement diffusées, quelle que soit l’approbation) comme plus factuelles que spéculatives, simplement parce que des opinions de ce type sont souvent répétées. Si les modèles IA étudiés ont tendance à confondre la fréquence avec l’exactitude lorsqu’ils considèrent la distribution des données, cela serait une explication possible.

 

* Ma conversion des citations en ligne des auteurs en hyperliens lorsque nécessaire, et tout formatage spécial (italique, gras, etc.) est préservé de l’original.

Publié pour la première fois jeudi 22 janvier 2026

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai