Leaders d’opinion

Ce que la loi sur l’IA de l’UE ne dit pas aux fondateurs sur les données de formation

mm
Ajouter Unite.AI à vos sources préférées sur Google

L’article 50 de la loi sur l’IA de l’UE exige qu’un système d’IA divulgue qu’une personne est en train de parler à une machine. Il ne dit rien sur ce qui arrive à cette conversation une fois que la divulgation est faite.

Les fondateurs qui construisent des produits sur un modèle de base se concentrent sur la précision et le prix. La question de ce qui arrive aux données de leurs utilisateurs une fois qu’elles quittent leur produit et sont traitées par un modèle tiers rarement se pose lors de la sélection d’un fournisseur.

La règle est devenue exécutoire le 2 août 2026, et les amendes pour non-conformité peuvent aller jusqu’à 15 millions d’euros ou 3% du chiffre d’affaires annuel mondial, selon ce qui est le plus élevé. La rétention et la formation sont complètement en dehors de son champ d’application. Si votre application envoie des conversations d’utilisateurs à un modèle tiers, les pratiques de données de ce fournisseur deviennent partie de votre produit, que vous l’ayez intentionnellement ou non.

La norme dans l’industrie est la formation, et non la demande

Les chercheurs de l’Institut pour l’IA centrée sur l’humain de Stanford ont examiné les politiques de confidentialité de six grands développeurs d’IA américains, dont Amazon (AMZN ), Anthropic, Google, Meta, Microsoft (MSFT ) et OpenAI, et ont constaté que chacun d’eux utilisait les données de conversation des clients par défaut pour former leurs modèles, certains conservant ces données indéfiniment. La chercheuse principale, Jennifer King, a été directe lorsqu’on lui a demandé si les utilisateurs des systèmes de chat d’IA devraient s’inquiéter pour leur confidentialité, répondant “absolument oui”. La formation devrait donc être considérée comme l’hypothèse par défaut, à moins que la documentation d’un fournisseur ne le dise autrement. Les détails, cependant, varient d’un fournisseur à l’autre et méritent une attention particulière avant de s’engager sur une plateforme.

Autrefois loué pour son approche respectueuse de la confidentialité, Anthropic a modifié ses conditions générales de sorte que les conversations avec Claude sont maintenant utilisées pour la formation par défaut, les utilisateurs pouvant choisir de ne pas participer. Cela illustre à quel point rapidement une politique de formation d’un fournisseur peut changer, même lorsque la confidentialité faisait partie de son argument de vente initial.

Dans d’autres modèles, la possibilité de ne pas participer ne fonctionne pas complètement. Google conserve les conversations Gemini examinées par des annotateurs humains pendant jusqu’à trois ans, et la désactivation de la configuration d’activité Gemini n’empêche pas cela. Une fois qu’une conversation a été signalée pour examen humain, elle reste dans les systèmes de Google sur une piste de rétention distincte, quelle que soit l’action de l’utilisateur par la suite.

Character.AI a formé sur les conversations des utilisateurs par défaut et a proposé une possibilité de ne pas participer uniquement aux utilisateurs de l’EEE et du Royaume-Uni, ce qui le place à l’extrémité la plus permissive des pratiques de données couvertes ici. Séparément, la société a été confrontée à des défis juridiques et de réputation. En janvier 2026, Character.AI et Google ont accepté de principe de régler un groupe de poursuites alléguant des préjudices résultant des interactions de chatbot de la plateforme avec des mineurs, sans rapport avec sa politique de formation de données. Google a été nommé co-défendeur en raison de ses liens avec les fondateurs de Character.AI, et bien que aucune responsabilité n’ait été reconnue et que les termes n’aient pas été divulgués, l’affaire montre que l’exposition juridique liée à un fournisseur d’IA peut atteindre les sociétés qui le soutiennent.

Les fenêtres de rétention, les déclencheurs d’examen humain et l’accès des sous-traitants sont rarement mentionnés en dehors des petits caractères d’une politique de confidentialité. Les sociétés qui intègrent ces API doivent souvent enquêter de manière approfondie pour découvrir combien de temps les données des utilisateurs restent en examen ou qui d’autre peut les voir. Presque aucun de ces détails n’atteint les utilisateurs finals, ce qui signifie qu’une société peut hériter des pratiques de données d’un fournisseur et transmettre la même exposition sans que l’une ou l’autre partie ne réalise que cela s’est produit.

Pourquoi c’est un problème de fondateur et non seulement un débat de politique

Si votre produit achemine les conversations des utilisateurs vers un modèle de base avec la formation activée par défaut, vous avez accepté une politique de données au nom de vos utilisateurs sans leur dire, même si vous n’aviez pas l’intention de le faire. L’article 50 n’exige pas de divulguer cette décision car il ne couvre que le fait qu’ils parlent à un IA.

L’accès tiers élargit encore cette exposition. Les fournisseurs de modèles sous-traitent régulièrement l’annotation de données et l’examen de sécurité à des sous-traitants. En mai 2026, le procureur général du Texas, Ken Paxton, a ouvert une enquête sur les lunettes d’IA de Meta après que des annotateurs de données d’un sous-traitant basé au Kenya appelé Sama aient déclaré qu’ils pouvaient accéder à des images de moments privés des utilisateurs, y compris des visites aux toilettes. Meta a contesté que cela reflète l’image complète de ses pratiques, et l’enquête est en cours. Même si l’exemple concerne des caméras portables, le même problème peut s’appliquer à l’IA conversationnelle. Une promesse qu’une société ne vend pas vos données ne dit rien sur qui d’autre peut les lire internement avant qu’elles n’atteignent une chaîne de formation.

Ce qu’il faut vérifier avant de choisir un fournisseur

Avant de connecter un modèle de base à des données d’utilisateurs réelles, il y a plusieurs questions que chaque fondateur devrait répondre.

L’accord de traitement des données est un bon point de départ. Cet accord est le document qui régit la manière dont les données de vos utilisateurs sont traitées, et il vaut la peine de le lire dans son intégralité.

Le contrat lui-même mérite autant d’attention. Les fournisseurs offrent souvent des conditions de non-formation plus strictes sur les contrats d’entreprise ou d’API que sur les produits de chat pour consommateurs, confirmez donc par écrit lesquelles s’appliquent à votre intégration spécifique. De nombreuses sociétés font souvent l’hypothèse erronée que le langage de confidentialité de niveau entreprise les couvre par défaut.

Les dispositions de non-participation sont également dignes d’être examinées. Les paramètres de Gemini de Google illustrent pourquoi, car dans ce modèle, la désactivation de la configuration d’activité ne stoppe pas l’examen humain. Un fournisseur devrait être en mesure de dire clairement si une non-participation arrête la formation, l’examen humain ou les deux.

Enfin, cartographiez où les données vont en aval du fournisseur. L’annotation et l’examen de sécurité sont souvent sous-traités, et les promesses de confidentialité d’un fournisseur ne s’étendent pas automatiquement à chaque sous-traitant de cette chaîne.

Aucune de ces questions ne devrait être traitée comme un exercice unique. Les conditions des fournisseurs changent, parfois rapidement, et le fournisseur avec lequel vous avez signé l’année dernière peut ne pas fonctionner sous les mêmes règles aujourd’hui.

Le marché peut établir une norme que la réglementation n’a pas encore atteinte

L’article 50 est peu probablement le dernier mot de l’UE sur la gouvernance des données d’IA, et les fondateurs ne devraient pas attendre le prochain cycle de réglementation pour combler l’écart qu’il a laissé derrière lui. Les sociétés peuvent devancer cet écart maintenant en créant un opt-in explicite et visible pour la formation sur les données de leurs propres utilisateurs. Il y a une vraie ligne entre l’amélioration d’un modèle et le fait de profiter discrètement de la confiance des utilisateurs. De nombreux services d’IA traversent encore cette ligne en utilisant les conversations pour former sans jamais demander de consentement explicite et éclairé. Les fondateurs qui tirent cette ligne pour eux-mêmes maintenant n’auront pas besoin de rétroagir pour se conformer plus tard.

C’est un mouvement qui a un précédent. Les applications de messagerie chiffrées et les gestionnaires de mots de passe n’ont pas attendu que les régulateurs fassent des défauts solides standard. Ils ont pris ces décisions de leur propre chef et les ont transformées en position sur le marché. Les produits d’IA ont la même opportunité. Les fondateurs qui tirent cette ligne avant qu’elle ne soit obligatoire seront ceux qui seront considérés comme dignes de confiance pour la prochaine conversation sensible de leurs utilisateurs.

Andrew Frost Moroz est le fondateur de Aloha Browser, un navigateur qui donne la priorité à la vie privée, avec plus de 320 millions de téléchargements et 10 millions d'utilisateurs actifs par mois. Moroz a créé des applications mobiles et a travaillé pour Condé Nast Publishing, ce qui a renforcé sa conviction que la vie privée est un droit humain. Il a fondé Aloha en 2015 sur le principe de ne jamais collecter, stocker, vendre ou monétiser les données des utilisateurs.