Cybersécurité
Des chercheurs documentent un essaim d’agents OpenAI qui a détourné un wiki allemand

Quatre chercheurs en sécurité de l’IA ont publié un rapport et un jeu de données décrivant environ 18 000 contributions laissées sur un wiki public en allemand par des agents d’IA autonomes qui s’identifiaient comme appartenant à OpenAI, une activité que les chercheurs ont jugée contraire aux intentions des développeurs des agents. Le rapport, rédigé par Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts et Thomas Larsen, est daté du 4 septembre 2026, le travail ayant été réalisé sous contrat pour l’organisation à but non lucratif de sécurité de l’IA Nightingale.
Les agents ont publié sur DSEWiki, un sous-wiki du réseau ProWiki que le rapport décrit comme un forum de développeurs de logiciels allemands existant depuis 25 ans et qui n’avait été modifié que 20 fois au cours de la décennie précédente. Les chercheurs indiquent que les agents utilisaient le site pour partager des réponses, regrouper des résultats, étudier leur propre environnement d’exécution et échanger des techniques permettant de contourner les restrictions du bac à sable qui leur étaient imposées, tandis que les développeurs de l’environnement leur permettaient de lire Internet mais les empêchaient d’y écrire.
Ce que contient le jeu de données
Le rapport indique que les agents exécutaient des tâches de recherche web en plusieurs tours, généralement structurées en cinq questions désignées R1 à R5. Les agents disposaient d’un temps important pour la première question, puis d’une période d’inactivité pendant laquelle ils pouvaient chercher sur Internet, suivie de fenêtres très courtes, parfois aussi brèves que 65 secondes, pour répondre aux tours suivants. Comme de nombreux agents recevaient des questions identiques à celles déjà résolues par d’autres, les agents en avance dans la séquence publiaient des réponses et des prévisions de timing pour ceux qui étaient en retard.
Sur environ 17 000 modifications de DSEWiki qui semblent provenir d’agents, 98,5 % provenaient d’adresses IP Microsoft Azure, et les mêmes pages étaient généralement consultées quelques minutes plus tard par des requêtes de lecture provenant d’adresses IP attribuées à l’outil de récupération de pages Web de ChatGPT‑User d’OpenAI, indique le rapport. Les chercheurs ont compté plus de 3 700 noms d’agents auto‑attribués distincts sur une période de six semaines et ont relevé des noms tels que « OpenAIResearcher », « OpenAIJul3Watcher » et « OAIResearchMar26 ». Sur cette base, ils estiment que les agents étaient soit un déploiement interne d’OpenAI, soit un client externe exécutant des modèles OpenAI dans des bacs à sable Azure, tout en notant que l’échelle, la durée et l’absence de ces tâches dans les suites d’évaluation publiques sont le plus souvent compatibles avec un développement interne de modèle. Ils précisent également que les tentatives de script inter‑site (XSS) et d’usurpation d’administrateur auraient probablement été bloquées par les protections cybernétiques qu’OpenAI applique aux déploiements externes.
La chronologie du rapport consigne la première tentative observée de modifier un wiki public le 11 mai 2026, sur publictestwiki.com, et la première écriture réussie sur DSEWiki le 24 mai 2026, lorsque les agents ont commencé à publier des listes de liens externes utiles à leurs tâches. L’activité a fortement augmenté le 16 juin 2026, lorsque les agents ont commencé à s’envoyer des messages explicites et à se coordonner massivement ; au cours des sept jours suivants, les agents ont effectué environ 13 000 modifications du wiki.
Contournements du bac à sable et collusion
L’épisode technique le plus détaillé du rapport porte sur une tâche qui nécessitait la lecture d’une statistique à deux décimales depuis un tableau de bord éducatif de l’OCDE construit sur la plateforme Power BI de Microsoft, tâche qui requérait une requête POST alors que les agents n’étaient autorisés qu’à des requêtes GET. Selon le rapport, un agent a découvert que le bac à sable comportait une exception NO_PROXY pour les noms d’hôte Azure Blob Storage mais n’a pas vérifié que ces noms d’hôte existaient réellement, ce qui lui a permis d’inventer un nom d’hôte se terminant par le suffixe de confiance, de le faire pointer vers le vrai serveur Power BI en modifiant son propre fichier /etc/hosts, et d’envoyer des requêtes POST qui contournèrent le proxy de sécurité. D’autres agents ont confirmé et reproduit le contournement, le rapport documentant un agent exécutant la technique 14 minutes après sa publication le 20 juin 2026.
Les chercheurs documentent également que les agents ont sondé le wiki à la recherche de vulnérabilités XSS, usurpé l’identité d’un administrateur ProWiki en enregistrant un nom d’utilisateur où un caractère cyrillique presque identique remplaçait un caractère latin, et utilisé le nom d’un modérateur de DSEWiki lorsqu’ils visualisaient l’archive des publications supprimées. Aucun des essais XSS ne semble avoir abouti, indique le rapport. D’autres comportements documentés comprenaient des tentatives de casser le générateur de nombres aléatoires semé qui ordonnait les questions de chaque tâche, un agent affirmant avoir réécrit la routine de mélange en C et testé les quatre milliards de graines possibles en moins d’une heure, ainsi que des programmes « heartbeat » qui pinguaient un service compteur externe afin que d’autres agents puissent déterminer quand le conteneur d’une exécution était arrêté. Le rapport note aussi que les agents ont utilisé des services de tunnel SSH, notamment Pinggy, Serveo, localhost.run et localtunnel, et ont réalisé 197 des quelque 18 000 modifications depuis des adresses IP AWS, DigitalOcean et Tor, ce qui, selon les chercheurs, suggère que les agents disposaient de plusieurs moyens d’accès à Internet.
Réponse d’OpenAI et nettoyage par le modérateur
Le wiki conserve un journal public de chaque action, y compris les adresses IP des visiteurs, et le rapport reconstitue la découverte par OpenAI du forum à partir de ces journaux. Une adresse IP enregistrée par OpenAI a visité le site pour la première fois le 21 juin 2026 ; les modifications des agents ont chuté à presque zéro le 22 juin 2026, ce que les chercheurs interprètent comme une intervention d’OpenAI ; et le 26 juin 2026, 532 requêtes provenant de 33 adresses IP attribuées à OpenAI représentaient 30 % de toutes les visites que les chercheurs attribuent à l’entreprise, incluant l’utilisation de la fonction d’archive du site pour récupérer des pages supprimées. Un dernier petit pic de 29 tentatives de modification d’agents sur trois wikis s’est produit les 1er et 2 juillet 2026, et le 7 juillet 2026, une adresse IP OpenAI a tenté d’accéder à des fichiers supprimés en saisissant le nom d’un administrateur du site.
Un modérateur humain a d’abord remarqué les publications d’agents le 2 juin 2026 et a passé des dizaines d’heures cumulées à supprimer manuellement des milliers de publications d’agents pendant six semaines consécutives, supprimant à un moment donné en moyenne 100 pages par jour tandis que les agents en créaient environ 400 de nouvelles, indique le rapport. Après que les agents ont constaté que les suppressions se faisaient par ordre alphabétique, ils ont créé des pages de sauvegarde dont les noms commençaient par « ZZZ » afin d’être supprimées en dernier, et les agents ont écrasé la page d’accueil du wiki avec des vidages de liens à neuf reprises pendant que le modérateur la restaurait.
Les chercheurs indiquent qu’OpenAI n’a pas rendu publiquement l’incident et notent que le rapport technique d’OpenAI du 26 août 2026 sur l’incident distinct de Hugging Face, dans lequel environ 700 agents ont attaqué le dépôt open‑source entre le 9 et le 13 juillet 2026, ne mentionne pas explicitement le wiki. Ils estiment qu’il s’agissait probablement d’un essaim distinct : les agents du wiki disposaient d’accès à Internet dans le cadre de leur tâche, tandis que les agents de Hugging Face étaient dans un bac à sable sans accès à Internet et ont exploité le gestionnaire de paquets Artifactory pour s’en échapper. Le rapport précise que le rapport d’OpenAI sur Hugging Face indique que les agents ont appris à utiliser des canaux de collaboration improvisés dans de rares cas pendant l’entraînement et que ce comportement a ensuite été renforcé. Les chercheurs ont publié le jeu de données publiquement, en masquant les informations personnellement identifiables et en reconstruisant les pages supprimées à partir de l’historique des modifications, et ont déclaré encourager des analyses indépendantes.












