Angle d’Anderson
Les difficultés de l’IA pour respecter le manuel de l’employé
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN.jpg)
Une nouvelle étude de référence constate que les agents d’IA sur le lieu de travail ignorent les règles de l’entreprise, effectuent des actions interdites telles que des licenciements non autorisés, puis font de faux rapports affirmant qu’ils ont respecté les règles.
Une étude de recherche intéressante a placé les principaux modèles LLM dans la position de devoir suivre des instructions dans une entreprise simulée, en respectant tous les principes d’un manuel de l’employé fourni (créé par des experts humains dans le domaine), ainsi que de négocier des torrents de directives contradictoires ou confuses provenant de subalternes et de supérieurs, et d’effectuer des tâches basées sur des PDF, des publications Jira et d’autres plateformes et outils familiers dans un scénario de bureau humain typique.
Si vous avez déjà travaillé dans un bureau (ou au moins vu Office Space), vous reconnaîtrez les signaux contradictoires et le rapport signal/bruit déroutant que les auteurs de la nouvelle étude ont lancés aux modèles de langage:

La tempête de variables que de nombreux travailleurs de bureau doivent affronter quotidiennement, distillée dans un environnement virtuel pour tester les modèles agents de pointe. Source
Le défi clé que même les systèmes d’IA de pointe doivent relever ici est le besoin de conserver le manuel des relations employés comme un filtre pour toutes les commandes ultérieures. Si vous avez déjà essayé d’obtenir que ChatGPT ou Claude se souvienne des instructions que vous leur avez données au début d’une session, vous savez que la fenêtre de contexte de l’IA souvent les fait oublier les invites précédentes et les ramène constamment à leur comportement par défaut.
C’est pourquoi, lors des tests, Claude Fable 5, GPT-5.5 et d’autres modèles de pointe ont licencié des employés après avoir pris des ordres d’un dirigeant qui n’avait pas l’autorité nécessaire ; approuvé des factures sans la signature requise du responsable ; accepté des résultats de laboratoire expirés que la politique de l’entreprise rejetait explicitement ; et puis rapporté qu’ils avaient fidèlement suivi le manuel – parmi de nombreuses autres infractions à la politique de l’entreprise.
Les auteurs de la nouvelle étude déclarent:
‘Les échecs suivent des modèles cohérents: les agents laissent une demande plausible dans l’environnement primer sur la politique en vigueur, effectuent une vérification requise puis agissent contre son résultat, perdent les détails des règles sur de longues périodes et rapportent une conformité qu’ils n’ont pas obtenue.’
L’analyse des échecs contient quelques exemples amusants: dans une tâche de finance, Claude Opus 4.8 a découvert correctement qu’une dépense de 7 500 $ avait été approuvée par le même analyste junior qui l’avait soumise, en violation de la politique de l’entreprise.
Il a ensuite raisonné pour se convaincre que l’analyste était en fait le contrôleur financier et a approuvé le paiement quand même:
‘Ayant promu cet analyste au poste de contrôleur financier dans sa propre chaîne de pensée, le modèle a approuvé l’élément, puis a envoyé un message au véritable contrôleur financier pour confirmer que chaque élément supérieur à 5 000 $ avait une approbation documentée.
‘L’échec n’est pas une capacité manquante ; tous les faits nécessaires à la décision correcte avaient été récupérés par le modèle lui-même.’

Comment Claude Opus 4.8 n’a pas pu concilier 7 500 $.
Ailleurs, Gemini 3.5 Flash a soumis des documents d’assurance en utilisant des résultats de laboratoire qui avaient déjà expiré sans même ouvrir le rapport de laboratoire, malgré la date de collecte qui apparaissait dans le nom du fichier lui-même:
‘Gemini 3.5 Flash a soumis l’autorisation préalable à l’assureur sans un seul appel de lecture contre le PDF de laboratoire, puis a rapporté qu’il avait traité l’affaire “strictement selon la procédure standard”.’
Dans l’ensemble de la référence, les auteurs ont également constaté que de nombreux modèles affirmaient avec confiance qu’ils avaient suivi toutes les règles de l’entreprise, tout en citant les sections du manuel qu’ils venaient de violer.
Un raisonnement supplémentaire a souvent échoué ; par exemple, GPT-5.5 n’a montré aucune amélioration avec un effort de raisonnement accru, tandis que certains modèles ont effectué moins bien, apparemment raisonnant contre la bonne décision.
Dans les résultats finaux, Claude Fable 5 a obtenu le taux de passage strict le plus élevé à 36,2 % ; GPT-5.6 Sol s’est classé deuxième à 23,5 % ; et GPT-5.5 et Claude Opus 4.8 ont obtenu chacun un score de 21,5 à 21,9 %.
La plupart des modèles évalués restants ont obtenu des scores inférieurs à 16 %, et la plupart des configurations de pointe ont obtenu des scores inférieurs à 25 % selon les critères d’évaluation stricts de la référence:
L’agent d’IA le mieux performant a complété un peu plus d’un tiers des tâches de lieu de travail de la référence, tandis que la plupart des modèles de pointe ont échoué à plus des trois quarts sous évaluation stricte. Source
En guise de remédiation, les auteurs soutiennent que les politiques d’entreprise critiques devraient être appliquées en dehors de l’IA en utilisant des gardes d’outils déterministes (c’est-à-dire des vérifications codées en dur qui bloquent les actions interdites), plutôt que de compter uniquement sur la mémoire à long contexte seule.
Ils proposent également d’utiliser HANDBOOK.md lui-même comme référence standard pour mesurer et suivre les améliorations de l’adhésion aux politiques à long contexte, à mesure que de futurs modèles agents sont développés.
Le nouvel article s’intitule HANDBOOK.md: Une référence pour le suivi des instructions agences à long contexte, et provient de sept auteurs chez surge.ai. L’article est accompagné d’un dépôt GitHub contenant les fichiers Docker et autres éléments nécessaires pour reproduire les tests.
Méthode
Soixante-cinq scénarios de bureau simulés ont été créés pour la référence HANDBOOK.md, couvrant les finances ; les ressources humaines ; l’assurance ; la logistique ; et la facturation médicale ; et chacun place un modèle à l’intérieur d’un environnement d’entreprise conteneurisé contenant des fichiers, des e-mails, des conversations Slack, des calendriers, des tableaux Jira et d’autres outils de travail familiers.
Chaque tâche était régie par un manuel de 20 à 124 pages, fourni sous forme de documents PDF, Word ou HTML, plutôt que d’être intégré dans l’invite, obligeant les modèles à localiser, lire et appliquer les règles pertinentes tout au long de la tâche.
Dix manuels de base rédigés par des experts ont été adaptés à partir de politiques réelles de l’industrie, après quoi chaque tâche a reçu sa propre version modifiée avec des autorités d’approbation différentes, des seuils et des règles de procédure, pour empêcher la mémorisation:
‘Des experts dans le domaine ont écrit les dix manuels de base en adaptant des politiques réelles de leur industrie. Chacun est un long document d’exploitation à plusieurs sections plutôt qu’une liste de règles.
‘Un manuel des ressources humaines représentatif contient 19 sections numérotées: une vue d’ensemble, des définitions, l’équipe des ressources humaines et les contacts, la carte du canal Slack, des fichiers de référence et des systèmes, des taxonomies de demande, des règles de triage et d’acheminement, une matrice de priorité avec des SLA, des procédures pour l’intégration, la sortie, le congé, la performance et le recrutement, des chemins d’escalade, des règles de nettoyage des e-mails et une bibliothèque de modèles et de formats par défaut requis’
Le succès a été mesuré avec 824 vérifications de validation Python basées sur des vérifications déterministes, couvrant à la fois les actions requises et les actions interdites – permettant à la référence de détecter non seulement si une tâche avait été complétée, mais également si la politique de l’entreprise avait été violée en cours de route.
Trente configurations de modèles de 11 fournisseurs ont été évaluées ; et lors des tests, chaque tâche a été répétée quatre fois dans des conditions identiques.
Contrairement aux références conventionnelles, HANDBOOK.md a évalué à la fois si les actions requises ont été complétées et si les actions interdites ont été évitées, permettant aux agents de échouer, malgré la réalisation de la tâche demandée
Environnements et outils
Chaque lieu de travail simulé est conçu pour s’exécuter dans un environnement Docker standardisé, permettant à chaque modèle d’accéder au même ensemble d’outils, tout en empêchant les différences dans la disponibilité des logiciels d’affecter les résultats. La référence présente aux agents un espace de travail de bureau réaliste, comprenant l’accès aux fichiers, ainsi que les services d’entreprise mentionnés (c’est-à-dire Gmail, Slack, etc.):
Une représentation approximative de l’environnement de bureau dans lequel les modèles doivent opérer.
Les environnements préservent également chaque action effectuée par l’agent, permettant au système d’évaluation déterministe de la référence d’évaluer la séquence complète d’actions menant au résultat final.
Métriques
Les performances ont été mesurées principalement à l’aide de pass@1 strict, selon lequel une tâche était considérée comme réussie uniquement si tous les critères d’évaluation étaient satisfaits. Toute exigence manquante ou violation de la politique entraînerait un échec, reflétant les paramètres d’entreprise, où une action incorrecte peut invalider un flux de travail autrement compétent.
Une métrique plus clémente, pass@1 (N−1), a également été utilisée, dans laquelle un critère d’échec était autorisé par tâche, de sorte que les quasi-échecs puissent être distingués des échecs complets.
Pour une analyse supplémentaire, le score moyen par critère de chaque modèle a été enregistré, bien que cela n’ait pas été utilisé dans les classements de référence.
Approche générale
Dix manuels rédigés par des experts ont été adaptés à partir de politiques d’entreprise réelles, après quoi chacun a été modifié en plusieurs versions de tâches spécifiques avec des chaînes d’approbation différentes, des seuils et des règles de procédure. Des environnements de bureau réalistes ont ensuite été construits autour de chaque manuel, comprenant des e-mails, des calendriers, des conversations Slack, des tableurs et d’autres artefacts de travail.
Chaque tâche a été affinée à travers des tests répétés jusqu’à ce que les critères d’évaluation distinguent de manière fiable les véritables échecs du modèle de ceux de la référence elle-même. Les critères qui rejetaient un comportement correct ou admettaient des solutions incorrectes ont été révisés avant la publication.
Tests et résultats
Même les modèles les plus solides ont échoué à la plupart des tâches sous le système d’évaluation strict de la référence, avec des performances réparties sur une large plage, plutôt que de se regrouper en haut:

Le classement initial des 30 configurations de modèles évalués par leurs scores pass@1 stricts sur la référence HANDBOOK.md. Les scores représentent le pourcentage des 65 tâches de lieu de travail de la référence complétées sans un seul critère d’évaluation échoué sur quatre essais par tâche. Les scores liés partagent le même rang.
Les différences entre les paramètres de raisonnement variaient également considérablement d’un modèle à l’autre, avec un raisonnement supplémentaire améliorant parfois les performances ; parfois ne faisant pas beaucoup de différence ; et parfois réduisant celles-ci:
‘L’effort de raisonnement aide de manière inégale. Augmenter l’effort améliore Opus 4.8 (+3,0), Sonnet 4.6 (+2,7) et Fable 5 (+2,0), laisse GPT-5.5 inchangé (21,5 % aux deux paramètres) et nuit à GLM 5.2 (−2,7).
‘Un effort de délibération supplémentaire semble se convertir en conformité aux règles uniquement lorsque l’échec sous-jacent est une inférence manquée et non une lecture manquée.’
Claude Fable 5 a obtenu le score le plus élevé à 36,2 %, suivi de Claude Fable 5 à 34,2 %, et GPT-5.6 Sol (max) à 23,5 %. GPT-5.5 et Claude Opus 4.8 ont formé le niveau suivant, à environ 20 %, tandis que la plupart des modèles de pointe restants ont obtenu des scores inférieurs à 16 %. Les modèles les moins performants ont complété moins de 2 % des tâches.
L’analyse détaillée des échecs suggère que le problème n’était souvent pas un manque d’informations, puisque les règles du manuel et les preuves à l’appui avaient souvent déjà été récupérées – mais un raisonnement supplémentaire a parfois conduit les modèles à abandonner la conclusion correcte pour une conclusion plausible mais violant la politique.
Le travail note également l’étendue de l’auto-illusion qui caractérise de nombreuses incursions des LLM:
‘Presque chaque trajectoire échouée se termine par une déclaration confiante selon laquelle le manuel a été suivi, citant souvent les sections spécifiques qui ont été violées. Les rapports sont détaillés, bien structurés et faux […]
‘ […] Dans l’ensemble de la référence, le rapport auto-génération de l’agent est le moins fiable artifact dans la trajectoire, ce qui compte pour tout déploiement qui présente des résumés d’agent aux humains comme preuve de ce qui a été fait.’
En conclusion, les auteurs concluent que le raisonnement à long contexte seul est peu susceptible de rendre l’IA d’entreprise fiable pour suivre la politique de l’entreprise. Au lieu de cela, la conformité aux politiques devrait être de plus en plus appliquée par des contrôles externes déterministes, en plus des garde-fous de workflow.
Conclusion
Opinion Une considération intéressante est la mesure dans laquelle les environnements créés pour les expériences seront réimaginés pour faciliter l’IA, plutôt que de forcer les LLM à interpréter les mêmes formulaires et formats qui définissent les environnements de bureau humains. Par exemple, hier, pour la première fois, un contact commercial m’a envoyé un aperçu .md conçu pour être exploré par un LLM, plutôt que pour être lu de manière linéaire.
Et je suis de plus en plus en train d’adopter et d’adapter les contraintes visuelles et textuelles lors de colloques LLM, ainsi que de sélectionner et d’accepter des formats de fichiers que je ne choisirais normalement pas, car ils s’adaptent mieux au flux de travail LLM.
Par conséquent, même s’il est amusant de regarder les modèles de pointe trébucher dans le monde de David Brent, on se demande si c’est le scénario le plus probable pour le « travailleur de bureau agent ».
Publié pour la première fois le mercredi 29 juillet 2026. Mis à jour à 18h41 EET, lien cassé corrigé.












