Angle d’Anderson

La sortie « créative » des modèles d’IA devient similaire entre les fournisseurs

mm
Ajouter Unite.AI à vos sources préférées sur Google
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

De nouvelles recherches suggèrent que les modèles d’IA de sociétés concurrentes deviennent plus similaires dans leurs réponses créatives, ce qui pourrait restreindre la variété d’idées auxquelles les utilisateurs sont exposés.

 

Une nouvelle recherche américaine a constaté que la production « créative » d’un large éventail de modèles d’IA de premier plan devient de plus en plus similaire avec le temps.

Les auteurs, de l’Université Duke, ont testé 69 modèles appartenant à 12 familles de fournisseurs, couvrant des versions de 2023 à 2026, et ont constaté une diminution statistiquement significative de la diversité des productions, tant pour les questions ouvertes du monde réel que pour un test de créativité standard – suggérant que des idées similaires sont de plus en plus proposées en réponse à des demandes « créatives » parmi tous les principaux fournisseurs de LLM.

Les familles de fournisseurs testées étaient Anthropic ; Cohere ; DeepSeek ; Google ; Meta ; MiniMax ; Mistral AI ; Moonshot AI ; OpenAI ; Qwen ; xAI ; et Z.ai*:

From the new paper - model releases used in the study, from mars 2023 to juillet 2026. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors' reckonings. Source - https://arxiv.org/pdf/2608.19437

Du nouveau papier – versions de modèles utilisées dans l’étude, de mars 2023 à juillet 2026. Le graphique couvre 69 versions de modèles parmi 12 fournisseurs d’IA, montrant comment les modèles testés ont été répartis sur la période de trois ans, et révélant des calendriers de sortie de plus en plus fréquents pour certains fournisseurs, ce qui doit être pris en compte dans les évaluations des auteurs. Source

Les auteurs du nouveau papier déclarent**:

‘Nous constatons que Les réponses des LLM aux invites ouvertes que nous testons sont devenues de plus en plus similaires au fil du temps.

‘Cela suggère que les LLM deviennent moins créatifs dans les tâches qui impliquent de générer des réponses ouvertes, ce qui exige un examen attentif de leur utilité à long terme en tant qu’assistants créatifs.’

Bien que la « monoculture algorithmique » soit devenue une ligne d’étude établie, les auteurs affirment qu’une analyse des tendances vers l’homogénéité des productions créatives générées par l’IA n’a jusqu’à présent pas été entreprise.

Cependant, des incidents isolés ont indiqué cette convergence depuis un certain temps, notamment le cas étrange décrit dans l’étude de mai 20026 de l’Université Cornell, où une gamme diversifiée de fournisseurs de LLM a montré des obsessions étranges et convergentes concernant les « gardiens de phares », ainsi qu’un ensemble particulier de noms anachroniques, dont « Mara » et « Elias »:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

En mai, le nouveau papier de l’Université Cornell a découvert d’étranges similarités entre les fournisseurs de LLM lorsqu’on leur donne des « invites ouvertes » – bien qu’aucune explication quant à la raison ne soit encore apparue dans les données d’entraînement diversifiées alimentant ces modèles.

La nouvelle étude est plus systématique : les auteurs ont testé trois ans de modèles à la fois avec des invites créatives du monde réel et avec un test psychologique classique qui sollicite des utilisations inhabituelles d’objets du quotidien. Ils ont ensuite mesuré à quel point les réponses des modèles divergeaient en termes de signification, en suivant si ces distances diminuaient au fil des générations successives.

Les auteurs du nouveau travail, intitulé Are LLMs becoming similarly creative? Evidence from three years of models, déclarent†:

‘Nos résultats, bien que préliminaires, soulèvent des inquiétudes quant à l’utilité à long terme des LLM en tant que partenaires créatifs. Même si les modèles réussissent bien les tâches créatives, des productions convergentes pourraient limiter la gamme de possibilités à laquelle les utilisateurs de LLM sont exposés, et avec cela, la portée de leur propre réflexion.’

‘Si l’utilisation d’un LLM pour des tâches créatives comme la rédaction d’essais diminue l’activité cérébrale, l’utilisation de LLM de plus en plus peu créatifs – la tendance suggérée par notre étude – pourrait-elle aggraver davantage les effets des LLM sur la créativité humaine, comme observé dans cette étude et d’autres ?’

Déjà, les caractéristiques diverses des productions textuelles des LLM sont devenues matière à mèmes ; et, comme nous l’avons signalé en mai de cette année, au moins un auteur a déjà auto-publié un livre apparemment consacré à la fixation « phare » susmentionnée, commune aux principaux modèles.

Ainsi, dans un contexte où les éditeurs retirent de plus en plus des livres qu’ils soupçonnent d’être rédigés ou assistés par l’IA, la nouvelle recherche semble indiquer que nous pouvons nous attendre à une augmentation des « coïncidences d’intrigue » provenant d’œuvres apparemment écrites par des humains, y compris des travaux académiques soumis par des étudiants.

Quant à l’origine de cette convergence, les auteurs émettent l’hypothèse que le chevauchement des données d’entraînement et des objectifs d’optimisation de plus en plus similaires pourraient pousser les modèles vers des représentations internes comparables des concepts et des relations sémantiques – produisant finalement des réponses plus similaires†:

‘[Il] reste incertain que cette homogénéité soit un sous‑produit temporaire d’une technologie encore en développement ou une caractéristique inévitable – potentiellement cumulée – des modèles de langage statistiques.’

‘Des forces plausibles pointent dans les deux sens. Un nombre croissant de travaux académiques suggère que les modèles génératifs entraînés sur des données qui se chevauchent et optimisés vers des objectifs similaires organiseront les concepts et les relations sémantiques de manière de plus en plus similaire, ce qui entraînera des productions similaires.’

Cependant, les auteurs citent également des travaux indiquant que, à mesure que les modèles évoluent, ils pourraient de nouveau diverger vers un ensemble de caractéristiques propre, en ce qui concerne la production créative.

Méthode

Pour suivre si les modèles d’IA deviennent plus semblables, les chercheurs ont commencé par des questions ouvertes, recueillant les réponses de générations successives de modèles. Chaque réponse a été convertie en une représentation numérique de son sens, permettant de mesurer à quel point les réponses étaient similaires ou différentes.

Régression a ensuite été utilisée pour déterminer si ces différences diminuaient à mesure que de nouveaux modèles étaient publiés:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

Le schéma des auteurs pour mesurer si les productions d’IA deviennent plus similaires au fil du temps. Les invites créatives ouvertes sont exécutées sur différentes familles de modèles, leurs réponses étant cartographiées par le sens afin de mesurer la distance entre elles, l’analyse de régression suivant comment ces distances évoluent au cours des générations successives de modèles.

Deux ensembles d’invites ont été sélectionnés pour tester la créativité sous différents angles. Tout d’abord, la tâche des usages alternatifs (AUT), un test psychologique standard de la pensée divergente, demande des utilisations non conventionnelles d’objets ordinaires, l’étude utilisant des objets tels qu’un livre, une chaussure et un marteau. Son format fixe offrait une méthode contrôlée pour comparer les idées produites par différents modèles.

Cent autres invites ont été extraites d’Infinity-Chat100, une collection dérivée de conversations réelles avec des modèles de langage. Elles couvraient des tâches créatives moins contraignantes impliquant la génération de contenu, la résolution de problèmes, le brainstorming et l’idéation ; des tâches qui permettent une plus grande liberté quant aux réponses produites et aux approches adoptées.

Les ensembles complets d’invites AUT et Infinity-Chat100 ont ensuite été envoyés aux modèles publiés entre mars 2023 et juillet 2026, couvrant 12 fournisseurs et systèmes d’Anthropic, Google, Meta, OpenAI, DeepSeek et Mistral AI. Toutes les réponses ont été collectées via l’API d’OpenRouter avec les mêmes paramètres d’échantillonnage, la température (liberté de répondre de façon créative) et le top‑p étant tous deux réglés à un.

Les modèles ont été classés par mois de sortie afin d’examiner si les générations plus récentes produisaient des réponses plus similaires.

Comme les dates de sortie ne reflètent pas réellement les changements dans les données d’entraînement, l’architecture ou le post‑entraînement, les auteurs ont considéré la tendance résultante comme une association avec le développement du modèle, plutôt que comme une preuve que le simple passage du temps entraîne la convergence.

Les réponses des modèles ont ensuite été converties en embeddings à l’aide du transformateur de phrases all‑MiniLM‑L6‑v2. Chaque réponse a été représentée sous forme de vecteur numérique, permettant de placer les réponses aux significations similaires dans des directions similaires et de mesurer leur distance sémantique.

Pour l’AUT, toutes les utilisations suggérées pour chaque objet ont été traitées comme une réponse unique, produisant dix embeddings par modèle. Pour Infinity-Chat100, chaque réponse a été encodée séparément, produisant 100 embeddings par modèle.

Les 27 mois de sortie ont été regroupés en neuf périodes, et seuls les modèles de fournisseurs différents ont été comparés. Les distances sémantiques entre leurs réponses ont été mesurées pour chaque période, des distances plus petites indiquant une plus grande similarité.

Pour éviter que les fournisseurs disposant de plus de modèles ne dominent les résultats, l’analyse a été répétée 1 000 fois, en utilisant des échantillons équilibrés de chaque fournisseur.

Résultats

Une régression linéaire a ensuite été utilisée pour suivre ces distances au fil du temps, une pente négative constante indiquant que les modèles de différents fournisseurs devenaient plus similaires:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

Résultats initiaux des tests, montrant si les réponses créatives de différents fournisseurs d’IA sont devenues plus similaires au fil du temps. Les distances sémantiques ont diminué tant pour les invites de la tâche des usages alternatifs que pour celles d’Infinity‑Chat100, tandis que l’échantillonnage équilibré répété a produit des tendances constamment négatives, indiquant une similarité croissante entre les générations de modèles.

Parmi ces résultats, les auteurs soulignent:

‘Pour les ensembles de réponses AUT et Infinity‑Chat, nous observons une diminution des distances de sortie entre fournisseurs au cours de la période d’observation.’

‘Cela suggère une diminution de la diversité – ou une homogénéité croissante – des productions créatives des LLM au fil du temps.’

La différence entre les modèles anciens et récents était la plus nette dans la tâche des usages alternatifs. La distance moyenne entre les réponses de différents fournisseurs est passée d’environ 0,50 pour les premiers modèles à moins de 0,40 pour les plus récents, ce qui signifie que leurs réponses sont devenues sensiblement plus similaires. Le même schéma a été observé avec Infinity‑Chat100, bien que le changement soit plus faible, la distance moyenne étant passée d’environ 0,34 à un peu plus de 0,32.

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

Résultats des tests mesurant la rapidité avec laquelle les réponses des différents fournisseurs d’IA sont devenues plus similaires au fil du temps. La tâche « Alternate Uses » a montré une diminution beaucoup plus forte des différences entre les modèles que Infinity‑Chat, les deux résultats restant cohérents à travers les tests d’échantillonnage répétés des chercheurs.

Cette constatation a également résisté aux 1 000 reprises d’échantillonnage équilibré. Dans chaque cas, les modèles plus récents ont produit des réponses plus proches les unes des autres que celles des modèles plus anciens. L’ampleur de ces diminutions, ainsi que les intervalles de confiance à 95 % des chercheurs, sont illustrés ci‑dessus.

À ce sujet, le papier indique:

‘L’ampleur de la diminution de l’AUT est particulièrement notable compte tenu de l’objectif de la tâche. L’AUT teste explicitement la pensée divergente en demandant aux modèles de produire des usages aussi originaux et inattendus que possible, ce qui constitue précisément le contexte où l’on s’attendrait à ce que les productions diffèrent.’

Les résultats d’Infinity‑Chat montrent que la même tendance est également apparue sur un éventail beaucoup plus large de tâches créatives. Ses 100 invites demandaient aux modèles de produire de nombreuses réponses ouvertes différentes, et ces réponses sont devenues plus similaires au fil du temps.

Le changement était plus faible que dans la tâche des usages alternatifs, mais il est devenu plus évident parmi les modèles publiés à partir de 2025. Les auteurs suggèrent que cela pourrait être un signe précoce que les productions créatives de différents fournisseurs d’IA deviennent généralement plus similaires, et pas seulement pour un type de test particulier.

Conclusion

Les problèmes liés à la convergence des LLM et VLM sont une source de préoccupation croissante et persistante tant dans la communauté de recherche que chez les utilisateurs des modèles dérivés. Nous arrivons à la toute fin de la première et unique génération « pure » de données à laquelle le domaine de la recherche aura jamais accès ; et la volonté des fournisseurs de modèles d’exfiltrer les données de leurs rivaux comporte inévitablement un risque de convergence, les données devenant identiques et les principes d’entraînement des modèles similaires, voire identiques, entre les fournisseurs.

Par conséquent, rien d’aussi simple que le remplacement des tirets cadratins ne viendra probablement contrer la similarité croissante des productions créatives parmi les familles de modèles, et les cas de duplication risquent plutôt d’émerger de manière plus publique et embarrassante.

 

* La liste complète des modèles est Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; et GLM-5.2

** Les emphases des auteurs, pas les miennes.

Ma conversion des citations en ligne des auteurs en hyperliens.

Première publication vendredi 21 août 2026

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai