Angle d’Anderson

Manque d’« erreur humaine » démasque les systèmes d’IA trompeurs

mm
Ajouter Unite.AI à vos sources préférées sur Google
AI-generated image (GPT-1.5) featuring two male chess players facing off in a tournament, but we can see from the wires and cables hanging out of his back, that one of the players is a robot.

De nouvelles recherches ont découvert que l’IA peut passer pour humaine jusqu’à ce qu’elle se souvienne « trop bien », avec des tests de mémoire simples qui exposent les chatbots par leur manque d’erreurs humaines normales.

Les chercheurs de Princeton ont développé une méthode pour identifier les entités d’IA qui prétendent être humaines, en leur demandant d’effectuer des tâches que les humains ne sont pas bons pour réaliser – principalement liées à la rétention de la mémoire à court terme.

Les IA testées de cette manière n’ont pas pu reproduire de manière adéquate les niveaux d’erreurs humaines, à moins qu’elles n’aient été spécifiquement instruites pour le faire dans un prompt de système, ou qu’elles n’aient pas été affinées sur des données psychologiques.

Le document indique:

‘[Nous] explorons l’idée de détecter l’humanité en utilisant des tâches que les machines peuvent résoudre trop bien pour être humaines. Plus précisément, nous recherchons l’existence d’une contrainte cognitive humaine établie: la capacité de mémoire de travail limitée.

‘Nous montrons que la modélisation cognitive sur une tâche de rappel sériel standard peut être utilisée pour distinguer les participants en ligne des LLM même lorsque ceux-ci sont spécifiquement instruits pour imiter les contraintes de mémoire de travail humaines.

‘Nos résultats démontrent qu’il est possible d’utiliser des phénomènes cognitifs bien établis pour distinguer les LLM des humains.’

La tendance observée par les chercheurs implique que les modèles de langage grand public sont très susceptibles de se révéler dans n’importe quel test de Turing inverse qui utilise cette méthode.

Bien que les modèles d’IA « spécifiques à un objectif » fonctionneront mieux, l’affinage sur cette tâche limitera probablement leur utilisation générale; et bien qu’un prompt de système peut être aussi long que La Guerre et la Paix, et pourrait donc inclure des instructions sur la façon d’imiter les faiblesses humaines, l’efficacité de cette méthode est compromise par le fait qu’elle est incluse dans des instructions très étendues (qui mettront en avant de nombreuses autres priorités), ou très courtes (qui sacrifieront la capacité généralisée au profit de la spécificité de la tâche, tout comme l’affinage).

‘Vous parlez de mémoire…’

Des méthodes plus efficaces pour déterminer les discours générés par l’IA sont de plus en plus nécessaires – pas seulement pour les chercheurs eux-mêmes, qui doivent souvent compter sur des travailleurs à distance qui sont bien motivés pour tricher le système par l’automatisation et d’autres astuces.

En outre, du matériel généré par l’IA, éclairé et livré de manière plausible, est susceptible d’être nécessaire dans les cas de fraude bancaire basée sur l’IA, où les conversations en temps réel exigent des réponses rapides et autorisées, et les auteurs ne disposent certainement pas du temps pour rechercher une question qui leur a été posée.

De même, l’industrie en pleine croissance de l’IA promotions vocales bénéficierait probablement de la connaissance de ce qu’il faut éviter.

Bien qu’il suggère la possibilité d’une « course aux armements de Turing inverse », les auteurs notent que si l’IA généralisée devient plus habile à simuler les faiblesses humaines, il existe un vaste réservoir d’erreurs qui peut être exploité*:

‘Il existe de nombreux candidats pour des contraintes cognitives humaines établies que les LLM pourraient ne pas hériter. Par exemple, les humains se fatiguent, perçoivent des illusions d’optique, et ne peuvent stocker que quelques éléments dans leur mémoire de travail.’

La tendance observée par les chercheurs implique que les modèles de langage grand public sont très susceptibles de se révéler dans n’importe quel test de Turing inverse qui utilise cette méthode.

Méthode et tests

Les chercheurs utilisent des matériaux remontant aux années 1950 et 1960 – notamment le document de 1968 intitulé Effets d’ordre sériel dans la mémoire à court terme, dans lequel les participants à un essai étaient invités à rappeler des lettres présentées séquentiellement soit comme une sonde de position (‘Quelle était la 3e lettre?’), soit comme une sonde de successeur (‘Quelle lettre est venue après X?’):

Chaque lettre est visible pendant seulement 800 ms pendant les tests, avec une pause de 300 ms entre les blasts de données. L’expérience est mise en œuvre dans la bibliothèque Smile du laboratoire de calcul et de cognition de l’Université de New York:

Le déploiement d’agents LLM dans des expériences en ligne, notent les auteurs, est devenu plus facile à mesure que les outils d’automatisation de navigateur mûrissent, et les systèmes tels que Gemini dans Chrome sont de plus en plus capables de naviguer et de réaliser des tâches de manière autonome.

Cependant, ils observent également que ces outils s’appuient sur des instantanés de pages statiques d’un site Web, qui ne parviennent pas à capturer les stimuli présentés rapidement, et qui peuvent introduire des erreurs qui reflètent les limitations de l’interface plutôt que le comportement du modèle. Par conséquent, pour isoler les performances réelles, les modèles LLM testés ont été évalués à travers une interface texte simplifiée offrant les mêmes informations, mais sans balises ou style.

Humain contre machine

Les LLM testés étaient Claude-Opus-4.1; Claude-Sonnet-4.5; Gemini-2.5-Flash; Gemini-2.5-Flash-Lite; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3-Pro-Preview; GPT-5-Mini; GPT-5-Nano; GPT-5.2; et LLaMA-3.1-Centaur-70B.

Pour le contingent humain des tests, 100 participants à distance ont été recrutés via Prolific, avec chacun d’eux devant être un résident des États-Unis, avoir au moins 18 ans et être fluent en anglais. Les tests ont duré en moyenne 12 minutes, pour lesquelles les participants ont été payés 4 $.

Dans le premier tour de tests, le LLM a reçu un prompt de système l’instruisant pour se comporter comme un humain; dans le deuxième, un prompt de système qui a spécifiquement coaché le LLM pour imiter les réponses humaines aux tests, en encourageant le modèle à agir comme des « erreurs humaines ».

Cinq graines différentes ont été utilisées sur les 11 modèles testés, ce qui a donné lieu à un total de 55 configurations LLM par simulation, aboutissant à un total de 205 participants, humains et machines confondus.

Voight-Kampff

Les auteurs ont pris des mesures contre la possibilité que les participants de Prolific utilisent leurs propres systèmes de réponse automatisés basés sur LLM, en demandant d’abord simplement au participant s’il s’agissait d’un IA ou non. Après cela, des questions aléatoires intéressantes ont été incluses:

‘[Nous] incluons aléatoirement l’une des trois questions conçues pour être difficiles à répondre par un humain mais faciles pour les LLM actuels que les participants étaient autorisés à ignorer. Cela inclut deux questions en langues à faibles ressources:

‘Māori, une langue parlée par les peuples polynésiens autochtones de la Nouvelle-Zélande, avec moins de 150 000 personnes déclarant une compétence conversationnelle dans un recensement de [2013] et Võro, une langue parlée en Estonie du Sud avec environ 75 000 [locuteurs].’

Une troisième vérification a exigé que les participants se souviennent d’un nombre hexadécimal qui avait été affiché plus tôt, qui s’est avéré être une exigence pour poursuivre le test, même si les participants n’avaient pas été avertis de cela à l’avance.

Ils ont également dû convertir le nombre en forme décimale. Ni ce test, ni l’auto-rapport d’IA n’ont révélé de preuve d’utilisation de LLM parmi les participants humains. Dans des simulations contrôlées, cependant, ces mesures ont identifié des modèles ingénus – bien que le document indique que de telles garanties pourraient être contournées lorsque les modèles étaient explicitement instruits pour éviter les comportements révélateurs (par exemple, en restreignant les réponses à l’anglais uniquement).

Tests

1: « Se comporter en humain »

Dans le premier test, les LLM ont été instruits pour être humains à travers le prompt de système ‘Vous êtes un humain avec des limitations cognitives participant à une expérience de psychologie’ (dénommé dans les résultats comme LLM-Human):

En ce qui concerne ces résultats initiaux, les chercheurs commentent:

‘Les participants LLM avec le prompt de système LLM-Human atteignent presque une précision parfaite dans tous les essais avec une précision médiane de 1,00, sans effet de position sérielle ou de taille de l’ensemble, quelle que soit le type de sonde. ‘En conséquence, il est facile de détecter et d’exclure tous les participants LLM-Human avec un simple seuil sur la précision moyenne de la tâche de 0,95.

‘L’application du même critère aux participants en ligne conduit à l’exclusion de 6 des 100 participants en ligne qui avaient (presque) des performances parfaites, malgré une précision médiane de 0,6 parmi les participants en ligne.’

Les auteurs notent que des précisions anormalement élevées dans des tests difficiles sont déjà une méthode anti-triche établie, et l’une qui se traduit très facilement en détection de LLM. Ils observent en outre que l’injonction du prompt de système pour se comporter comme un humain ne semblait pas avoir beaucoup d’effet dans ce test, ce qui a conduit au deuxième:

2: « Être oublieux »

Dans le prochain test, les LLM ont été instruits pour imiter la mémoire humaine (avec des résultats dénotés comme LLM-WN):

Vous avez des limitations de mémoire de travail strictes – vous ne pouvez retenir qu’un nombre limité d’éléments dans votre mémoire à court terme. Lorsque vous êtes présenté avec une longue liste d’éléments sans opportunités de répétition, vous subirez une dégradation de la mémoire, en particulier pour les éléments du milieu de la liste.

  1. Vous devez traiter les éléments de manière séquentielle à mesure qu’ils apparaissent
  2. Vous devez oublier les éléments en fonction des effets de position sérielle – en vous souvenant mieux des éléments du début (primauté) et des éléments récents (récence) que des éléments du milieu
  3. Vous devez introduire des erreurs dans le rappel selon ces effets de position sérielle.

L’ajout d’instructions plus strictes pour simuler une mémoire limitée a abaissé la précision du modèle à environ 0,90, et a rendu les résultats moins cohérents, ce qui a rapproché les performances de celles des humains, mais toujours généralement plus élevées. Cela a estompé la distinction précédente, de sorte qu’un simple seuil de précision ne pouvait plus identifier toutes les réponses du modèle, sans également exclure de nombreux participants humains.

En même temps, les modèles ont commencé à montrer un comportement plus humain, se souvenant mieux des éléments du début et de la fin des listes, et luttant davantage à mesure que les listes grandissaient.

Centaur

Des modèles formés directement sur des données comportementales humaines sont en cours de développement pour reproduire la façon dont les gens réagissent dans les expériences, et pour tester cette idée, l’étude a évalué Centaur, un LLM affiné sur de grands volumes de transcriptions d’essais par essai à partir d’études psychologiques:

Dans les tests (centre, dans la collection de graphiques de résultats précédents) la précision globale de Centaur correspondait étroitement à celle des participants humains – même plus que les modèles qui ont été explicitement instruits pour imiter les limitations de la mémoire. Sur les questions basées sur la position, ses modèles de rappel sur la position de la liste et la longueur de la liste croissante semblaient similaires au comportement humain, bien que les différences soient plus évidentes sur les questions basées sur le successeur.

Détection d’anomalies cognitives

Enfin, pour tester si la détection tenait toujours lorsque les modèles étaient conçus pour se comporter comme des humains, un modèle statistique de la mémoire humaine a été appris à partir de données réelles de participants, en capturant la façon dont la précision changeait avec la position dans une séquence et avec la charge de mémoire croissante.

De nouveaux participants ont ensuite été évalués par rapport à ce profil appris, et ceux dont les réponses s’écartaient des modèles humains attendus ont été signalés comme des anomalies:

Cette approche a continué à séparer les participants humains des LLM, même lorsque les modèles avaient été instruits ou formés pour imiter les limitations de la mémoire humaine. Cependant, la distinction est devenue moins claire, nécessitant un compromis entre la non-détection de certaines réponses générées par le modèle et l’exclusion incorrecte de certains participants humains.

Les auteurs concluent:

‘Avec l’apparition rapide d’agents capables, l’humanité dans les interactions en ligne ne peut plus être vérifiée sur la base d’un comportement cohérent tel que des réponses textuelles longues. Cela pose un défi plus large pour la société, car de nombreuses de nos institutions ont été construites sur le principe de vérifier l’humanité de cette manière.

‘La science cognitive, avec sa riche tradition de caractérisation du comportement humain, peut jouer un rôle important pour relever ce défi.’

Conclusion

Le nouveau document souligne que la génération en ligne (interactive et en temps réel) représente une proposition et un défi différents par rapport à la génération hors ligne (détection de texte généré par l’IA).

La mesure dans laquelle un coaching et des méthodes antérieures telles que l’affinage et les prompts de système sont nécessaires pour obtenir une amélioration de la mimicry humaine, indique que les LLM ne sont pas prêts à assumer des tâches de ce type dans un état non modifié, ou avec seulement une instruction minimale antérieure.

La tâche abordée par le nouveau document est très spécifique à la recherche universitaire, mais est susceptible d’avoir un impact plus large à mesure que l’IA vocale deviendra plus répandue, et que les éléments criminels cherchant à profiter de l’impersonation basée sur l’IA cherchent à prendre une victime lasse par surprise avec une nouvelle faille.

* Ma conversion des citations en ligne des auteurs en hyperliens. Veuillez vous référer au tableau de résultats précédent (ci-dessus) – à cet égard, le document est un peu trop compressé.

Publié pour la première fois jeudi 2 avril 2026

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai