Leaders d’opinion

Lorsque les « connaissances » de l’IA ont 50 ans : le risque de conformité que vous ne pouvez pas ignorer

mm
Ajouter Unite.AI à vos sources préférées sur Google

La question des fausses informations de l’IA est un défi urgent alors que les entreprises augmentent leur utilisation d’outils génératifs. Malgré l’enthousiasme généralisé pour l’adoption de l’IA, il existe également un courant critique important. Les commentateurs critiques soulignent souvent les inexactitudes apparemment aléatoires et imprévisibles dans les sorties de l’IA, qui sapent sa valeur – et peuvent même causer un préjudice réel aux humains, en particulier dans des secteurs comme les soins de santé et les transports, où les sorties fausses pourraient théoriquement conduire à tout, des mauvaises prescriptions aux trains sur une trajectoire de collision.

Souvent, ces inexactitudes ont été attribuées aux « hallucinations » de l’IA – des cas dans lesquels l’IA génère une réponse de « meilleure supposition », présentée avec la même confiance qu’une réponse « authentique », plutôt que d’informer l’utilisateur d’une lacune dans ses connaissances ou sa capacité. Les hallucinations peuvent être difficiles à détecter au premier abord – mais il existe un problème plus silencieux, tout aussi grave, qui est encore plus difficile à détecter.

La dette de qualité des données : l’talonnement d’Achille de l’IA

Lorsque les systèmes d’IA puisent dans des données obsolètes, incomplètes ou inexactes, des sorties fausses se produisent, mais sont moins immédiatement discernables. Par exemple, vous pourriez demander à un IA d’identifier les symptômes d’une affection médicale et recevoir une réponse basée sur un article de 50 ans plutôt que sur des recherches actuelles. Le résultat est peu probable pour apparaître évidemment, ridiculement faux – mais cette première apparence de plausibilité pose un risque réel pour le patient en question et le fournisseur de soins de santé.

La même chose est vraie pour toutes les industries – si les données alimentant le modèle d’IA incluent des informations anciennes, obsolètes ou partielles, il existe un risque élevé de sorties fausses. Et à mesure que davantage d’entreprises intègrent l’IA dans des processus critiques pour l’entreprise, le risque de tirer des conclusions fausses à partir de données mal gérées augmente.

Précision pour le régulateur

Ce n’est pas seulement un problème pour les opérations quotidiennes – c’est également un défi de conformité important. Les exigences réglementaires évoluent rapidement pour répondre aux préoccupations concernant l’IA inexacte. Par exemple, un certain nombre d’actions réglementaires précoces sur l’IA ont eu lieu ; notamment lorsque l’Italie a temporairement interdit ChatGPT en raison de préoccupations en matière de confidentialité, et que le Conseil de protection des données de l’UE a lancé une task force dédiée pour coordonner les actions d’application potentielles contre ChatGPT.

Un des changements réglementaires les plus révélateurs a été l’adoption du Règlement de l’UE sur l’IA, le premier cadre juridique complet pour l’IA. Le Règlement établit des obligations en fonction du niveau de risque des systèmes d’IA, des systèmes à « risque inacceptable », qui sont interdits, aux systèmes à « risque élevé », qui font face à des exigences strictes en matière de transparence, de qualité des données, de gouvernance et de surveillance humaine.

L’importance du Règlement de l’UE sur l’IA ne réside pas dans son ampleur ambitieuse, mais dans le précédent qu’il établit. Les régulateurs font clairement savoir que l’IA sera soumise à des règles contraignantes et que les organisations doivent traiter la conformité et la transparence autour de l’utilisation de l’IA comme faisant partie intégrante de l’adoption de l’IA, plutôt que comme une afterthought.

Le Règlement a un large champ d’application, avec le potentiel d’affecter une grande proportion des développements d’IA. Son cœur est de rendre l’IA sûre tout en respectant les droits et les valeurs fondamentaux. Dans ce nouvel écosystème fondé sur des principes, la diagnose des sources potentielles d’inexactitudes de l’IA, y compris les données et les ensembles de données qui alimentent les modèles, l’opacité et l’accès au modèle, ainsi que la conception et l’utilisation du système, est essentielle. Les solutions d’IA sont une construction de ces trois éléments – les problèmes avec l’un de ces éléments peuvent avoir un résultat négatif. Non seulement cela, mais les données qui entrent dans la conception, le développement, le déploiement et l’exploitation de l’IA sont susceptibles d’être principalement constituées de dossiers commerciaux qui sont eux-mêmes soumis à diverses exigences de conformité.

En d’autres termes, l’environnement réglementaire entourant l’IA devient de plus en plus strict – et cela est tout aussi vrai pour les données d’entrée que pour les données de sortie, même si ces dernières font l’objet de davantage de titres.

Cinq étapes pour alimenter l’IA avec des données conformes, actuelles et pertinentes

Pour résoudre ce double défi – assurer à la fois la conformité des données et la qualité des données d’entrée qui permettent une sortie de haute qualité – les entreprises ont besoin d’un contrôle sur les données de formation et d’inférence. Malheureusement, c’est quelque chose que de nombreuses entreprises manquent encore.

Au minimum, les organisations devraient appliquer leurs programmes de conformité et de gouvernance plus larges aux initiatives d’IA. Ils doivent commencer à capturer et à maintenir des dossiers appropriés sur les données qu’ils alimentent les modèles d’IA, sur la façon dont les modèles et les systèmes sont conçus, ainsi que sur les décisions et le contenu générés via l’IA.

Cependant, il est également devenu critique pour les organisations d’aller au-delà de cela et de s’assurer qu’elles ont un contrôle total sur toutes les données qui pourraient être utilisées dans les déploiements d’IA, que ce soit pour la formation initiale ou le travail « en direct ». Cela nécessite une stratégie de gestion et de stockage de données de haute qualité, garantissant que toutes les données pertinentes sont recueillies de manière intelligente, nettoyées, stockées, classées et habilitées. Pour atteindre cela, les organisations doivent considérer quatre étapes clés :

1. Lignée et provenance des données

Cela inclut le maintien d’un enregistrement de la source des données, de son origine, de sa propriété et de tout changement dans les métadonnées (si autorisé) tout au long de son cycle de vie. Cela signifie également maintenir des métadonnées riches et tous les documents ou artefacts sous-jacents dont il est dérivé.

2. Authenticité des données

Cela nécessite le maintien d’une chaîne de garde claire pour toutes les données, le stockage d’objets dans leurs formes natives et le hachage d’objets reçus pour démontrer que les données restent inchangées. En outre, les organisations doivent maintenir une historique d’audit complet pour chaque objet et pour toutes les actions et les événements liés à tout changement.

3. Classification des données

Établir la nature d’un ensemble ou d’un type de données est important. Les organisations doivent être capables de gérer les données structurées, les données semi-structurées et les ensembles de données structurées. Attribuer un schéma unique à chaque classe peut permettre aux organisations de gérer des ensembles de données diversifiés sans une ontologie fixe universelle – en évitant que les données soient inutilement manipulées pour les forcer dans une structure de données inflexible.

4. Normalisation des données

Établir des définitions et des formats de métadonnées communs est important pour leur utilisation dans les solutions d’analyse et d’IA. Des schémas clairement définis sont un élément important, ainsi que des outils qui peuvent transformer ou mapper les données pour maintenir des vues normalisées et cohérentes des données liées.

5. Droits d’accès aux données

Les entreprises ont besoin de contrôles d’accès granulaires, y compris au niveau de l’objet ou du champ, en fonction des profils d’utilisateur ou de système. Cela signifie que les bonnes données sont disponibles pour les utilisateurs et les systèmes qui y sont autorisés, tout en restreignant ou en limitant l’accès à ceux qui ne le sont pas.

Avec ces éléments essentiels en place, les entreprises seront les mieux placées pour garantir que les données fournies aux modèles d’IA sont à la fois de haute qualité et conformes. L’IA entraînera des améliorations et des efficacités dans les industries – mais pour que cela se produise, une fondation de données solide est essentielle.

George Tziahanas est le vice-président de la conformité et avocat général adjoint chez Archive360. George est un dirigeant expérimenté avec une compréhension approfondie de la technologie complexe, des réglementations bancaires, de la gouvernance des données et de la gestion des risques. Et, travaille en étroite collaboration avec les clients actuels et potentiels pour garantir que les exigences de gouvernance des données et de conformité complexes soient satisfaites, en alignement avec les solutions Archive360.