Leaders d’opinion
Qui peut auditer l’IA de pointe ? La définition manquante de l’Accord de la Maison-Blanche

Cette semaine, les dirigeants de Google, OpenAI, Anthropic, Meta, xAI et Nvidia ont signé l’Accord de la Maison-Blanche sur l’Intelligence Super. Les entreprises se sont engagées à quatre niveaux de surveillance pour les modèles de pointe : contrôles internes, une équipe interne qui les vérifie, un auditeur ou évaluateur externe indépendant, et un comité de direction indépendant. Les engagements sont volontaires pour le moment, et l’accord indique qu’ils pourraient éventuellement être inscrits dans la loi.
Parmi les quatre niveaux, l’évaluation externe porte le plus de poids. C’est le seul niveau qui place une personne extérieure à l’entreprise en position de dire si les garde-fous fonctionnent. Il est également le moins défini. L’accord ne précise pas qui est qualifié en tant qu’évaluateur indépendant, quel standard ils utilisent, quel niveau d’accès ils obtiennent, ni comment l’indépendance tient lorsque un évaluateur vend également des services à l’entreprise qu’il examine. Chaque entreprise choisit son propre évaluateur.
Dans ces conditions, deux entreprises peuvent toutes deux annoncer qu’elles ont réussi une évaluation indépendante et signifier des choses très différentes. Combler cet écart nécessitera des réponses à trois questions.
Ce qui doit décider qui est qualifié
Une définition crédible d’un évaluateur IA indépendant doit couvrir au moins quatre éléments.
Indépendance. Un évaluateur ne doit pas examiner des garde-fous qu’il a aidé à concevoir, et il ne doit pas vendre des services de remédiation ou de conseil à la même entreprise qu’il évalue. Les domaines d’audit matures surveillent également la dépendance aux honoraires. Lorsqu’un client représente une part importante des revenus d’un évaluateur, ce dernier a une raison d’être indulgent.
Compétence adaptée au poste. « Audit » englobe plusieurs activités différentes en IA. Tester un modèle pour des capacités dangereuses, comme aider à une cyberattaque ou à une arme biologique, nécessite des chercheurs en apprentissage automatique et des experts du domaine. Vérifier si les garde-fous d’une entreprise sont bien conçus et fonctionnent en pratique requiert des auditeurs de contrôles expérimentés. Un évaluateur qualifié pour l’une n’est pas automatiquement qualifié pour l’autre, et le rapport d’évaluation doit préciser laquelle a été réalisée.
Accès et portée. Un évaluateur qui ne voit que la documentation peut confirmer qu’un garde-fou existe sur le papier. Vérifier qu’il a fonctionné nécessite un accès aux systèmes, aux journaux, aux dossiers d’approbation et aux personnes sur une période donnée. Les modèles de pointe évoluent entre les cycles d’entraînement et les déploiements, de sorte que l’évaluateur a également besoin d’une règle claire indiquant quand un changement nécessite un nouvel examen.
Surveillance de l’évaluateur. Quelqu’un doit vérifier les vérificateurs. Dans les marchés d’audit établis, les organismes d’accréditation examinent le travail des évaluateurs et peuvent retirer leur statut lorsqu’il est insuffisant. Cette garantie est ce qui donne du poids aux conclusions d’une évaluation.
L’infrastructure déjà existante
Aucun de ces éléments n’a besoin d’être inventé à partir de zéro. ISO 42001, la norme internationale pour les systèmes de gestion de l’IA, fournit aux organisations un cadre de gouvernance de l’IA, avec des contrôles documentés, des responsables clairement définis et une amélioration continue. Sa norme compagnon, ISO 42006, fixe les exigences pour les organismes qui auditent et certifient selon ISO 42001, y compris les compétences que les auditeurs doivent démontrer et les règles d’impartialité qu’ils doivent suivre. Étant donné que les organismes de certification opèrent sous accréditation, une tierce partie supervise les auditeurs eux‑mêmes.
Du côté des tests techniques, de nouveaux cadres viennent combler les lacunes. AIUC-1 certifie des agents IA spécifiques dans des déploiements spécifiques, avec des tests récurrents par des tiers pour des problèmes tels que les hallucinations, les contournements de sécurité et l’utilisation d’outils non sûrs, et s’appuie sur les contrôles d’ISO 42001.
Les États testent également des modèles pour superviser directement les évaluateurs. Le Connecticut a adopté cette année une loi créant un programme pilote, à compter de juillet 2027, dans lequel le Département de la protection des consommateurs de l’État approuvera jusqu’à cinq organisations de vérification indépendantes. Chacune devra conclure un accord supervisé par l’État définissant son périmètre, ses méthodes, ses obligations de rapport et sa gouvernance. Cette structure répond à plusieurs des questions ouvertes de l’accord : qui approuve les évaluateurs, à quels critères ils sont soumis, et qui les supervise.
Ces éléments n’ont pas été conçus pour l’évaluation des modèles de pointe, et ils ne doivent pas être présentés comme une réponse complète. Le travail à venir consiste à les relier, afin que l’assurance du système de gestion, les tests techniques des modèles et la supervision des évaluateurs s’intègrent sous une définition crédible d’indépendance.
Pourquoi les règles doivent être établies en premier
Les engagements de l’accord sont volontaires aujourd’hui. S’ils deviennent loi, les règles déterminant qui peut servir d’évaluateur doivent être en place avant que le mandat ne prenne effet, pour trois raisons.
Premièrement, la pratique précoce devient un précédent. Dès que les signataires commencent à nommer des évaluateurs et à publier des résultats, le marché s’accordera sur des définitions opérationnelles de « indépendant » et de « qualifié ». Les définitions établies sans pression extérieure ont tendance à privilégier la commodité. Les législateurs qui arriveront plus tard constateront que ces définitions sont déjà intégrées dans les contrats et les attentes.
Deuxièmement, la capacité qualifiée prend du temps à se développer. L’accréditation d’organismes d’évaluation, la formation d’évaluateurs qui comprennent à la fois les modèles de pointe et les tests de contrôles, ainsi que l’élaboration de méthodes partagées prennent toutes plusieurs années. Un mandat qui arrive avant que cette capacité n’existe sera satisfait par quiconque est disponible.
Troisièmement, une exigence dépourvue d’un marché d’assesseurs qualifiés engendre du simple remplissage de cases. Les entreprises se contenteront de respecter la lettre de la règle, les régulateurs auront peu de bases pour contester des évaluations faibles, et le public aura l’impression d’une surveillance sans réelle substance.
Certains soutiennent qu’il est trop tôt pour établir ces règles parce que la science de l’évaluation des modèles de pointe est encore jeune. C’est une préoccupation légitime concernant les méthodes de test, qui doivent continuer à évoluer avec les modèles. Les questions soulevées ici portent sur l’assesseur : est‑il exempt de conflits, qualifié pour le poste, disposant d’un accès suffisant et soumis à une supervision ? Ces questions ont des réponses stables, et d’autres domaines d’assurance y répondent depuis des décennies.
Ce que les organisations peuvent faire dès maintenant
Les entreprises qui développent ou déploient une IA avancée n’ont pas besoin d’attendre un mandat. Lors du choix d’un assesseur, elles peuvent se renseigner sur les autres services que la société leur offre, sur les qualifications de son équipe pour le type d’évaluation spécifique, sur le niveau d’accès inclus dans l’engagement et sur qui supervise le travail de la société. Mettre en place dès maintenant un système de gestion de l’IA fournit également à tout futur assesseur un élément concret et documenté à évaluer.
L’accord établit une structure solide pour la responsabilité en matière d’IA. Sa valeur dépendra de qui occupera le rôle d’assesseur et des exigences qui lui seront imposées, et le délai pour définir cela précède toute obligation d’utilisation.












