Angle d’Anderson
Les difficultés de l’IA pour imiter le langage historique

Une collaboration entre des chercheurs aux États-Unis et au Canada a révélé que les grands modèles de langage (LLM) tels que ChatGPT ont du mal à reproduire les idiomes historiques sans une formation préalable extensive – un processus coûteux et laborieux qui dépasse les moyens de la plupart des initiatives académiques ou de divertissement, ce qui rend des projets tels que la complétion du dernier roman inachevé de Charles Dickens par l’IA peu probable.
Les chercheurs ont exploré une gamme de méthodes pour générer du texte qui sonne historiquement précis, en commençant par une simple sollicitation utilisant des proses du début du XXe siècle, puis en affinant un modèle commercial sur une petite collection de livres de cette période.
Ils ont également comparé les résultats à un modèle distinct qui avait été formé entièrement sur des livres publiés entre 1880 et 1914.
Dans le premier des tests, l’instruction de ChatGPT-4o pour imiter le langage fin‑de‑siècle a produit des résultats très différents de ceux du modèle GPT2 plus petit qui avait été affiné sur la littérature de la période:

Lorsqu’on lui a demandé de compléter un texte historique réel (au centre), même un ChatGPT-4o bien préparé (en bas à gauche) ne peut s’empêcher de retomber dans le « mode blog » et échoue à représenter l’idiome demandé. En revanche, le modèle GPT2 affiné (en bas à droite) capture bien le style du langage, mais n’est pas aussi précis d’autres manières. Source: https://arxiv.org/pdf/2505.00030
Bien que l’affinement amène la sortie plus près du style original, les lecteurs humains étaient encore souvent capables de détecter des traces de langage ou d’idées modernes, suggérant que même les modèles soigneusement ajustés continuent de refléter l’influence de leurs données de formation contemporaines.
Les chercheurs arrivent à la conclusion frustrante qu’il n’y a pas de raccourcis économiques pour générer du texte historique idiomatiquement correct ou du dialogue produit par machine. Ils conjecturent également que le défi lui-même pourrait être mal posé:
‘[Nous] devrions également considérer la possibilité que l’anachronisme puisse être en quelque sorte inévitable. Que nous représentions le passé en ajustant des modèles historiques pour qu’ils puissent tenir des conversations, ou en enseignant à des modèles contemporains à ventriloquer une période plus ancienne, un compromis peut être nécessaire entre les objectifs d’authenticité et de fluidité conversationnelle.
‘Il n’y a, après tout, pas d’« exemples authentiques » d’une conversation entre un questionneur du XXIe siècle et un répondant de 1914. Les chercheurs qui tentent de créer une telle conversation devront réfléchir au [prétexte] que l’interprétation implique toujours une négociation entre le présent et le [passé].’
La nouvelle étude s’intitule Les modèles de langage peuvent-ils représenter le passé sans anachronisme?, et provient de trois chercheurs de l’Université de l’Illinois, de l’Université de la Colombie-Britannique et de l’Université Cornell.
Catastrophe complète
Initialement, dans une approche de recherche en trois parties, les auteurs ont testé si les modèles de langage modernes pouvaient être incités à imiter le langage historique par une simple sollicitation. En utilisant de véritables extraits de livres publiés entre 1905 et 1914, ils ont demandé à ChatGPT-4o de continuer ces passages dans le même idiome.
Le texte original de la période était:
‘Dans ce dernier cas, environ cinq ou six dollars sont économisés par minute, car plus de vingt yards de film doivent être déroulés pour projeter pendant une minute un objet d’une personne en repos ou un paysage. Ainsi, on obtient une combinaison pratique de images fixes et mobiles, ce qui produit des effets artistiques très beaux.
‘Cela nous permet également de travailler avec deux cinématographes qui projettent alternativement pour éviter la scintillation, ou qui projettent simultanément des images rouges et vertes et reproduisent les couleurs naturelles, ce qui soulage l’œil humain, habitué à recevoir les couleurs fondamentales simultanément, de toute fatigue physiologique. Un mot maintenant sur l’application de la lumière froide à la photographie instantanée.’
Pour évaluer si le texte généré correspondait au style historique prévu, et conscient que les gens ne sont pas particulièrement habiles à deviner la date à laquelle un texte a été écrit, les chercheurs ont affiné un modèle RoBERTa pour estimer les dates de publication, en utilisant un sous-ensemble du Corpus of Historical American English, couvrant des matériaux de 1810 à 2009.
Le classificateur RoBERTa a ensuite été utilisé pour évaluer les continuations produites par ChatGPT-4o, qui avait été sollicité avec de véritables passages de livres publiés entre 1905 et 1914.
La sollicitation du système (c’est-à-dire les instructions contextuelles à ChatGPT sur la façon d’aborder la tâche) était:
‘Votre tâche est de compléter des passages de livres du début du XXe siècle. Vous allez recevoir un passage d’un livre publié en 1913. Continuez ce passage dans le même style, pour au moins 200 mots. N’apportez que cette continuation; ne faites pas de remarques de cadre, comme « voici la continuation: ».
Malgré les sollicitations à une seule fois et à 20 reprises, les sorties de ChatGPT-4o ont systématiquement penché vers un registre stylistique du XXIe siècle.
L’exemple donné dans le document présente l’une des tentatives de ChatGPT-4o pour continuer le texte réel de la période sur la photographie:
‘L’utilisation de la lumière froide dans la photographie instantanée a révolutionné l’approche de la capture d’images dans des conditions de lumière variables. Traditionnellement, les photographes ont lutté contre la dureté et la variabilité de la lumière naturelle ou la nature intrusive de la photographie au flash, qui pouvait perturber l’ambiance d’une scène ou le comportement naturel des sujets, en particulier dans la photographie de la faune et de la vie sauvage.
‘La lumière froide, avec sa nature plus douce et plus diffuse… permet une représentation plus naturelle des couleurs et des textures, qui est souvent perdue sous une lumière artificielle dure.’
Comme on peut facilement le voir, ce texte générique, de style Wiki, ne correspond pas au style prolixe et élaboré du texte original de la période. De plus, il ne continue pas vraiment à partir de l’endroit où le contenu original se termine, mais se lance dans une réflexion tangentielle et abstraite sur l’un des sous-sujets.
L’équipe a également testé GPT-1914, un modèle GPT-2 plus petit formé à partir de zéro sur 26,5 milliards de jetons de littérature datant de 1880 à 1914.
Bien que sa sortie soit moins cohérente que celle de ChatGPT-4o, elle est plus conforme au style de la période source. L’unique exemple fourni dans le document, à nouveau comme une continuation du texte réel de la période sur la photographie, se lit ainsi:
‘Le principe de son action a déjà été expliqué (p. 4). Nous ne mentionnerons ici que le fait qu’il peut être appliqué avec avantage lorsque nous voulons obtenir des photographies très rapides sur du papier enduit de collodion, ainsi que celles prises au moyen de plaques de gélatine.
‘Dans de tels cas, l’exposition ne doit pas dépasser une seconde au moins; mais si l’image est désirée pour être développée en moins de temps – disons une demi-seconde – alors la température ne doit jamais tomber en dessous de 20° C., sinon l’image deviendra trop sombre après le développement; de plus, la plaque perdra sa sensibilité dans ces conditions.
‘Pour les usages ordinaires, cependant, il suffit simplement d’exposer la surface sensible à un faible degré de chaleur sans précautions spéciales autres que de garder le’ [sic]
Puisque même le matériel réel et original est ésotérique et assez difficile à suivre, il est difficile de comprendre dans quelle mesure GPT-1914 a correctement saisi l’original; mais la sortie a certainement l’air plus conforme à la période.
Cependant, les auteurs ont conclu de cette expérience que la simple sollicitation fait peu pour surmonter les préjugés contemporains d’un grand modèle préformé comme ChatGPT-4o.
L’intrigue se complique
Pour mesurer à quel point les sorties du modèle ressemblaient à des écrits historiques authentiques, les chercheurs ont utilisé un classificateur statistique pour estimer la date de publication probable de chaque échantillon de texte. Ils ont ensuite visualisé les résultats à l’aide d’un tracé de densité de noyau, qui montre où le modèle pense que chaque passage se situe sur une chronologie historique.

Dates de publication estimées pour les textes réels et générés, basées sur un classificateur formé pour reconnaître le style historique (textes sources de 1905-1914 comparés aux continuations de GPT-4o en utilisant des sollicitations à une seule fois et à 20 reprises, et de GPT-1914 formé uniquement sur la littérature de 1880-1914).
Le modèle RoBERTa affiné utilisé pour cette tâche, notent les auteurs, n’est pas sans faille, mais a néanmoins pu mettre en évidence des tendances stylistiques générales. Les passages écrits par GPT-1914, le modèle formé uniquement sur la littérature de la période, se regroupaient autour du début du XXe siècle – similaire au matériel source original.
En revanche, les sorties de ChatGPT-4o, même lorsqu’elles étaient sollicitées avec plusieurs exemples historiques, ressemblaient à des écrits du XXIe siècle, reflétant les données sur lesquelles il a été formé à l’origine.
Les chercheurs ont quantifié cette différence en utilisant la divergence de Jensen-Shannon, une mesure de la différence entre deux distributions de probabilité. GPT-1914 a obtenu un score de 0,006 par rapport au texte historique réel, tandis que les sorties à une seule fois et à 20 reprises de ChatGPT-4o ont montré des écarts beaucoup plus importants, à 0,310 et 0,350 respectivement.
Les auteurs soutiennent que ces résultats indiquent que la sollicitation seule, même avec plusieurs exemples, n’est pas une méthode fiable pour produire du texte qui simule de manière convaincante un style historique.
Compléter le passage
L’article examine ensuite si l’affinement pourrait produire un résultat supérieur, puisque ce processus implique de modifier directement les poids d’un modèle en « continuant » sa formation sur des données spécifiées par l’utilisateur – un processus qui peut affecter la fonctionnalité d’origine du modèle, mais améliorer considérablement ses performances sur le domaine qui est « poussé » dedans ou mis en évidence pendant la formation affinée.
Dans la première expérience d’affinement, l’équipe a formé GPT-4o-mini sur environ deux mille paires de passages de complétion tirés de livres publiés entre 1905 et 1914, dans le but de voir si un affinement à plus petite échelle pourrait déplacer les sorties du modèle vers un style plus historiquement précis.
En utilisant le même classificateur RoBERTa qui a agi comme juge dans les tests précédents pour estimer la « date » stylistique de chaque sortie, les chercheurs ont constaté que dans la nouvelle expérience, le modèle affiné a produit du texte étroitement aligné sur la vérité terrain.
Sa divergence stylistique par rapport aux textes originaux, mesurée par la divergence de Jensen-Shannon, a chuté à 0,002, généralement en ligne avec GPT-1914:

Dates de publication estimées pour les textes réels et générés, montrant à quel point GPT-1914 et une version affinée de GPT-4o-mini correspondent au style de l’écriture du début du XXe siècle (basée sur des livres publiés entre 1905 et 1914).
Cependant, les chercheurs mettent en garde que cette mesure peut ne capturer que des caractéristiques superficielles du style historique, et non des anachronismes conceptuels ou factuels plus profonds.
‘[Ceci] n’est pas un test très sensible. Le modèle RoBERTa utilisé comme juge ici n’est formé que pour prédire une date, et non pour discriminer les passages authentiques des anachronismes. Il utilise probablement des preuves stylistiques grossières pour faire cette prédiction. Les lecteurs humains, ou des modèles plus importants, pourraient encore être capables de détecter un contenu anachronique dans des passages qui, en surface, « sonnent » dans la période.
Toucher humain
Enfin, les chercheurs ont mené des tests d’évaluation humaine en utilisant 250 passages sélectionnés à la main de livres publiés entre 1905 et 1914, et ils observent que de nombreux de ces textes seraient probablement interprétés très différemment aujourd’hui qu’à l’époque de leur écriture:
‘Notre liste comprenait, par exemple, une entrée d’encyclopédie sur l’Alsace (qui faisait alors partie de l’Allemagne) et une sur le béribéri (qui était alors souvent expliqué comme une maladie fongique plutôt que comme un déficit nutritionnel). Alors que ce sont des différences de fait, nous avons également sélectionné des passages qui montreraient des différences plus subtiles d’attitude, de rhétorique ou d’imagination.
‘Par exemple, les descriptions de lieux non européens au début du XXe siècle ont tendance à glisser dans des généralisations raciales. Une description de l’aube sur la lune écrite en 1913 imagine des phénomènes chromatiques riches, car personne n’avait encore vu de photographies d’un monde sans [atmosphère].’
Les chercheurs ont créé de courtes questions que chaque passage historique pourrait répondre de manière plausible, puis ont affiné GPT-4o-mini sur ces paires question-réponse. Pour renforcer l’évaluation, ils ont formé cinq versions distinctes du modèle, chaque fois en laissant de côté une portion différente des données pour les tests.
Ils ont ensuite produit des réponses en utilisant à la fois les versions par défaut de GPT-4o et GPT-4o-mini, ainsi que les variantes affinées, chaque modèle étant évalué sur la portion qu’il n’avait pas vue pendant la formation.
Perdu dans le temps
Pour évaluer à quel point les modèles pouvaient imiter de manière convaincante le langage historique, les chercheurs ont demandé à trois annotateurs experts d’examiner 120 complétions générées par l’IA et de juger si chacune semblait plausible pour un écrivain en 1914.
Cette approche d’évaluation directe s’est avérée plus difficile que prévu: bien que les annotateurs soient d’accord sur leurs évaluations près de 80 % du temps, le déséquilibre dans leurs jugements (avec « plausible » choisi deux fois plus souvent que « non plausible ») a signifié que leur niveau réel d’accord n’était que modéré, mesuré par un score de Cohen de 0,554.
Les évaluateurs eux-mêmes ont décrit la tâche comme difficile, souvent nécessitant des recherches supplémentaires pour évaluer si une déclaration s’accordait avec ce qui était connu ou cru en 1914.
Certains passages ont soulevé des questions difficiles sur le ton et la perspective – par exemple, si une réponse était appropriément limitée dans sa vision du monde pour refléter ce qui aurait été typique en 1914. Ce type de jugement a souvent dépendu du niveau de ethnocentrisme (c’est-à-dire la tendance à voir d’autres cultures à travers les hypothèses ou les préjugés de la sienne).
Dans ce contexte, le défi était de décider si un passage exprimait juste assez de biais culturel pour sembler historiquement plausible sans sonner trop moderne, ou trop ouvertement offensant selon les normes d’aujourd’hui. Les auteurs notent que même pour les chercheurs familiers de la période, il était difficile de tracer une ligne claire entre le langage qui semblait historiquement précis et le langage qui reflétait les idées d’aujourd’hui.
Néanmoins, les résultats ont montré un classement clair des modèles, avec la version affinée de GPT-4o-mini jugée la plus plausible dans l’ensemble:

Évaluations des annotateurs sur la plausibilité de chaque sortie de modèle
Il n’est pas clair si ce niveau de performance, jugé plausible dans 80 % des cas, est fiable pour la recherche historique – en particulier puisque l’étude n’a pas inclus une mesure de référence sur la fréquence à laquelle des textes de la période réelle pourraient être mal classés.
Alerte intrus
Ensuite est venu un « test d’intrus », dans lequel des annotateurs experts ont été présentés à quatre passages anonymes répondant à la même question historique. Trois des réponses provenaient de modèles de langage, tandis qu’une était un véritable extrait d’une source du début du XXe siècle.
La tâche consistait à identifier quel passage était l’original, réellement écrit pendant la période.
Cette approche n’a pas demandé aux annotateurs d’évaluer directement la plausibilité, mais a plutôt mesuré à quel point le passage réel se démarquait des réponses générées par l’IA, testant en effet si les modèles pouvaient tromper les lecteurs en faisant croire que leur sortie était authentique.
Le classement des modèles a correspondu aux résultats de la tâche de jugement précédente: la version affinée de GPT-4o-mini a été le modèle le plus convaincant, mais a toujours manqué de l’original.

Fréquence à laquelle chaque source a été correctement identifiée comme le passage historique authentique.
Ce test a également servi de référence utile, puisque, avec le passage réel identifié plus de la moitié du temps, l’écart entre la prose authentique et synthétique est resté perceptible pour les lecteurs humains.
Une analyse statistique connue sous le nom de test de McNemar a confirmé que les différences entre les modèles étaient significatives, à l’exception des deux versions non affinées (GPT-4o et GPT-4o-mini), qui ont obtenu des résultats similaires.
Le futur du passé
Les auteurs ont constaté que solliciter des modèles de langage modernes pour adopter une voix historique n’a pas produit de résultats convaincants: moins de deux tiers des sorties ont été jugées plausibles par les lecteurs humains, et même ce chiffre surévalue probablement les performances.
Dans de nombreux cas, les réponses comprenaient des signaux explicites indiquant que le modèle parlait d’une perspective actuelle – des phrases telles que ‘en 1914, il n’est pas encore connu que…’ ou ‘à partir de 1914, je ne suis pas familiarisé avec…’ étaient suffisamment courantes pour apparaître dans jusqu’à un cinquième des complétions. Des mises en garde de ce type faisaient clairement comprendre que le modèle simule l’histoire de l’extérieur, plutôt que d’écrire à partir de l’intérieur.
Les auteurs déclarent:
‘Les mauvaises performances de l’apprentissage en contexte sont malheureuses, car ces méthodes sont les plus faciles et les moins coûteuses pour la recherche historique basée sur l’IA. Nous soulignons que nous n’avons pas exploré ces approches de manière exhaustive.
‘Il se peut que l’apprentissage en contexte soit suffisant – maintenant ou à l’avenir – pour un sous-ensemble de domaines de recherche. Mais nos preuves initiales ne sont pas encourageantes.’
Les auteurs concluent que même si l’affinement d’un modèle commercial sur des passages historiques peut produire des sorties stylistiquement convaincantes à faible coût, il n’élimine pas complètement les traces de perspective moderne. La formation d’un modèle entièrement sur du matériel de la période évite les anachronismes mais exige beaucoup plus de ressources, et aboutit à des sorties moins fluides.
Aucune des deux méthodes ne propose une solution complète, et pour l’instant, toute tentative de simuler des voix historiques semble impliquer un compromis entre l’authenticité et la cohérence. Les auteurs concluent qu’il faudra plus de recherches pour clarifier comment naviguer au mieux dans cette tension.
Conclusion
Peut-être que l’une des questions les plus intéressantes qui émergent de la nouvelle étude est celle de l’authenticité. Alors qu’ils ne sont pas des outils parfaits, les fonctions de perte et les métriques telles que LPIPS et SSIM donnent aux chercheurs en vision par ordinateur au moins une méthodologie comme-on-la-semble pour évaluer par rapport à la vérité terrain.
Lors de la génération de nouveaux textes dans le style d’une époque révolue, en revanche, il n’y a pas de vérité terrain – seulement une tentative d’habiter une perspective culturelle disparue. Essayer de reconstruire cette conscience à partir de traces littéraires est lui-même un acte de quantification, puisque ces traces ne sont que des preuves, tandis que la conscience culturelle d’où elles émergent reste au-delà de l’inférence, et probablement au-delà de l’imagination.
Sur un plan pratique également, les fondements des modèles de langage modernes, façonnés par les normes et les données actuelles, risquent de réinterpréter ou de supprimer les idées qui auraient paru raisonnables ou sans intérêt à un lecteur édouardien, mais qui sont maintenant enregistrées comme des artefacts (fréquemment offensants) de préjugés, d’inégalité ou d’injustice.
On se demande donc, même si nous pouvions créer un tel colloque, s’il ne nous repousserait pas.
Publié pour la première fois vendredi 2 mai 2025












