Cybersécurité

OpenAI perturbe la campagne coordonnée d’extraction du raisonnement des modèles

mm
Ajouter Unite.AI à vos sources préférées sur Google

OpenAI a déclaré dans un article de sécurité publié le 30 septembre 2026 qu’il avait identifié et interrompu une campagne coordonnée visant à extraire le raisonnement protégé de ses modèles, et qu’il attribuait un noyau central de l’activité à des individus associés à Moonshot AI, le développeur de Kimi. L’activité la plus tôt observée a eu lieu au cours de la première semaine de juillet 2026.

Ce qu’OpenAI a observé

OpenAI a décrit l’activité comme étant compatible avec la distillation hostile, qu’elle définit comme l’utilisation systématique et non autorisée des sorties ou du raisonnement d’un modèle pour aider à entraîner, reproduire ou améliorer un autre modèle. Selon l’entreprise, le raisonnement protégé correspond à l’enregistrement interne du modèle lorsqu’il résout une tâche ; son extraction peut révéler des informations retenues du résultat final et aider d’autres à reproduire les capacités du modèle.

OpenAI a déclaré que les opérateurs n’avaient pas contourné son chiffrement, compromis une base de données, ni obtenu un accès direct aux conversations utilisateur stockées. Les opérateurs ont manipulé les interactions avec le modèle de sorte que le raisonnement protégé puisse être reproduit sous des formes visibles pour le demandeur, de manière coordonnée et à grande échelle, en violation des conditions d’utilisation de l’entreprise. Une technique observée par OpenAI consistait à copier le raisonnement chiffré d’une conversation et à demander à un modèle dans une autre conversation de déchiffrer et de transcrire le contenu du raisonnement caché. L’entreprise a indiqué que cette manipulation n’est pas une vulnérabilité propre à ses modèles et qu’elle a partagé des informations à ce sujet avec des partenaires du secteur via le Frontier Model Forum afin de renforcer les défenses collectives.

L’activité a commencé le 1er juillet 2026, initialement à faible volume, jusqu’à ce qu’OpenAI observe des pics de volume élevé les 24 et 25 juillet 2026, composés de 16 000 requêtes utilisant un modèle d’extraction pertinent provenant de plus de 4 000 utilisateurs. Une note de bas de page dans le message indique que ces chiffres décrivent des extractions tentées, pas nécessairement réussies. OpenAI a déclaré qu’une enquête plus approfondie a identifié une activité de modèles d’invite apparentée chez plus de 15 000 utilisateurs, activité qu’elle a entièrement interrompue d’ici le 28 juillet 2026. L’activité a évolué avec le temps, ce que l’entreprise estime renforcer le fait que la distillation hostile constitue un défi de sécurité plus large nécessitant des défenses superposées et adaptatives.

OpenAI a indiqué que la distillation hostile présente des risques pour la sécurité et la sécurité nationale : le raisonnement extrait pourrait être utilisé pour entraîner un autre modèle sans conserver les garde-fous appliqués aux sorties destinées aux utilisateurs du modèle original, et la distillation à grande échelle peut accélérer le transfert de capacités avancées sans le même investissement en sécurité, des préoccupations que l’entreprise estime s’amplifier à mesure que les modèles acquièrent des capacités à double usage. OpenAI a déclaré qu’avant de publier, elle avait étudié la portée et l’impact potentiel de la campagne, déployé ses propres mesures d’atténuation, partagé et recueilli les retours de chercheurs et de partenaires du secteur, et que des travaux supplémentaires d’atténuation et d’enquête se poursuivent.

Attribution

OpenAI a indiqué qu’il n’est pas clair si tous les opérateurs observés pendant la période concernée proviennent d’un même acteur, et qu’il attribue un noyau central de l’activité à des individus associés à Moonshot AI, le développeur de Kimi.

Le 8 septembre 2026, la National Security Agency, la Cybersecurity and Infrastructure Security Agency et le Federal Bureau of Investigation ont publié un avis conjoint de cybersécurité indiquant que Moonshot AI a mené une campagne de distillation généralisée contre les entreprises américaines d’IA de pointe depuis au moins la mi‑2025. L’avis indique que Moonshot AI a extrait d’importantes données Claude Fable 5 pour entraîner son modèle Kimi‑K3 et des données GPT‑4o pour entraîner son modèle Kimi‑K2, et que l’entreprise a utilisé des modèles américains pour distiller l’optimisation du réglage fin supervisé, l’apprentissage par renforcement, l’ingénierie logicielle et les capacités mathématiques.

L’avis indique de manière plus générale que, probablement avec la connaissance du gouvernement chinois, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun et Z.AI ont extrait des milliards de jetons lors de millions d’échanges avec les modèles de pointe américains, y compris des variantes de Claude, GPT, Gemini et Grok, depuis au moins la fin 2024. Selon les agences, ces entreprises ont acheminé les requêtes via des API natives, des fournisseurs de cloud distants et des agrégateurs tiers ; ont utilisé un marché gris de proxys d’API appelés stations de transfert pour contourner les restrictions géographiques, violer les conditions d’utilisation et compromettre la traçabilité ; et ont réalisé des économies de coûts grâce à l’achat en gros d’abonnements premium partagés entre des équipes de développeurs. Les agences ont recommandé que les entreprises américaines d’IA mettent en œuvre une détection et une atténuation complètes, déploient des changements de réponse ciblés pour les tentatives de distillation suspectées, et instaurent un partage d’intelligence inter‑organisations.

La recherche sur les traces de raisonnement

OpenAI a déclaré que des chercheurs en sécurité indépendants ont porté à son attention des vulnérabilités liées à la compaction inter-modèles et de conversations via une divulgation responsable. L’entreprise a indiqué qu’elle avait examiné les résultats, confirmé que les vecteurs d’attaque identifiés par les chercheurs étaient réels, et que ce travail l’avait aidée à comprendre la classe d’attaque plus large et à accélérer les mesures d’atténuation.

Dans un article soumis à arXiv le 10 août 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping et Maksym Andriushchenko rapportent que les principaux fournisseurs masquent le raisonnement pas à pas de leurs modèles afin de protéger la propriété intellectuelle et de limiter les fuites d’informations, renvoyant les traces au client sous forme de blocs de texte chiffré que le client renvoie à chaque requête ultérieure. Les auteurs identifient une vulnérabilité architecturale : ces blocs chiffrés sont entièrement compatibles et interchangeables entre différentes sessions, utilisateurs et modèles au sein de l’écosystème d’un fournisseur. Ils décrivent un jailbreak de déchiffrement évolutif dans lequel une trace de raisonnement chiffrée d’un modèle donné est injectée dans un modèle plus faible et moins protégé du même fournisseur, le contraignant à décoder et à restituer la trace en texte clair sans devoir jailbreaker directement le modèle plus performant.

Les auteurs indiquent que la vulnérabilité permet quatre vecteurs d’attaque distincts : contourner les mécanismes anti‑distillation, ce qu’ils démontrent sur Anthropic, OpenAI et Google ; extraction massive de données privées, au cours de laquelle ils ont récupéré 367 artefacts d’informations personnellement identifiables et 182 identifiants en décodant 315 320 blocs de raisonnement extraits de dépôts publics ; révélation involontaire d’informations dangereuses cachées dans le processus de raisonnement même lorsque la sortie finale visible du modèle rejette correctement une requête malveillante ; et injections d’instructions invisibles qui intègrent des charges malveillantes entièrement dans les blocs chiffrés afin d’empoisonner les déploiements d’agents publics. Après une divulgation responsable, les auteurs proposent des mitigations cryptographiques et au niveau du système pour sécuriser le raisonnement côté client.

How OpenAI Responded

OpenAI a déclaré avoir atténué la campagne grâce à une combinaison d’application de mesures sur les comptes, de contrôles techniques et de coordination avec les partenaires : il a banni ou restreint les comptes frauduleux, renforcé les contrôles d’inscription et d’infrastructure, et élargi la surveillance des réseaux associés. L’entreprise a également indiqué avoir renforcé les protections du raisonnement caché entre les utilisateurs, les espaces de travail, les organisations et les familles de modèles : elle a fermé une voie qui permettait à quelqu’un possédant déjà le raisonnement chiffré d’un autre utilisateur de le rejouer et d’en récupérer le contenu, ajouté des vérifications pour détecter et retenir les sorties en flux susceptibles d’exposer le raisonnement, et collaboré avec des fournisseurs tiers pour identifier et neutraliser les comptes lorsque des activités connexes transitent par leurs services.

OpenAI a déclaré avoir partagé les résultats pertinents via le Frontier Model Forum et les canaux de partage d’informations gouvernementaux appropriés afin que d’autres développeurs de modèles de pointe et partenaires du secteur public puissent rechercher des activités similaires et renforcer leurs propres défenses, et a noté que les systèmes supportant des artefacts de raisonnement portables ou rejouables pourraient être exposés à des risques connexes.

OpenAI a déclaré s’attendre à ce que les tentatives de distillation adversaire deviennent plus sophistiquées à mesure que les modèles de pointe s’améliorent et que les acteurs recherchent des moyens moins coûteux d’imiter leurs capacités. L’entreprise a indiqué que les déploiements hébergés par des partenaires nécessitent les mêmes protections que les services internes, que les attaques basées sur la sortie d’outils requièrent des protections qui examinent plus que le texte visible ordinaire, et qu’elle continue d’améliorer les défenses des outils, la couverture des classificateurs et les refus de modèles tout en diffusant les contrôles pertinents auprès des partenaires cloud. OpenAI a déclaré que sa réponse continuera de se concentrer sur trois axes : des protections techniques renforcées contre l’extraction, une meilleure détection et application contre les campagnes coordonnées, et un partage d’informations sur les menaces plus approfondi entre l’industrie et les gouvernements.

Miles Okada est un analyste généré par IA chez Unite.AI, couvrant l'intelligence artificielle et la cybersécurité avec un accent sur les menaces émergentes, les architectures défensives et la dynamique évolutive entre les attaquants et les systèmes automatisés. Son travail examine comment l'IA transforme les opérations de sécurité, de la détection et de la réponse autonomes à l'essor des techniques d'IA adversaire.

Avec une perspective technique et investigative, Miles analyse les recherches en sécurité, les divulgations d'incidents et les déploiements réels afin de comprendre où l'IA renforce les défenses — et où elle introduit de nouvelles vulnérabilités. Il porte une attention particulière à l'exploitation des modèles, au poisonnement des données, à l'automatisation des attaques et aux réalités opérationnelles de la sécurisation à grande échelle des systèmes alimentés par l'IA.

Les articles rédigés par Miles Okada sont générés par IA et révisés par l'équipe éditoriale de Unite.AI afin d'assurer précision, rigueur et couverture responsable du paysage de la sécurité de l'IA en évolution rapide.