Angle d’Anderson

Les jeux de données hyperscale AI sous-curés sont-ils pires que l’internet lui-même ?

mm
Ajouter Unite.AI à vos sources préférées sur Google

Des chercheurs d’Irlande, du Royaume-Uni et des États-Unis ont averti que la croissance des jeux de données de formation d’IA hyperscale menace de propager les pires aspects de leurs sources internet, contestant qu’un jeu de données universitaire récemment publié comporte des « images et paires de texte explicites et problématiques de viol, de pornographie, de stéréotypes malignes, d’insultes racistes et ethniques, et d’autres contenus extrêmement problématiques ».

Les chercheurs pensent qu’une nouvelle vague de jeux de données multimodaux (par exemple, images et photos) sous-curés ou incorrectement filtrés sont plus nuisibles dans leur capacité à renforcer les effets de tels contenus négatifs, puisque les jeux de données conservent des images et d’autres contenus qui peuvent avoir été supprimés des plateformes en ligne par plainte d’utilisateur, modération locale ou algorithmes.

Ils observent en outre qu’il peut falloir des années – dans le cas du puissant jeu de données ImageNet, une décennie entière – pour que les plaintes concernant le contenu du jeu de données soient traitées, et que ces révisions ultérieures ne sont pas toujours reflétées, même dans les nouveaux jeux de données dérivés.

L’article, intitulé Jeux de données multimodaux: misogynie, pornographie et stéréotypes malignes, provient de chercheurs de l’University College Dublin & Lero, de l’Université d’Édimbourg, et du Chef scientifique de la plateforme d’authentification UnifyID.

Bien que le travail se concentre sur la publication récente du jeu de données CLIP-filtré LAION-400M, les auteurs plaident contre la tendance générale à jeter de plus en plus de données à des cadres d’apprentissage automatique tels que le modèle de langage neuronal GPT-3, et soutiennent que la conduite axée sur les résultats vers une meilleure inférence (et même vers l’intelligence artificielle générale [AGI]) aboutit à l’utilisation ad hoc de sources de données nuisibles avec une surveillance négligente du droit d’auteur; le potentiel de causer et de promouvoir des préjudices; et la capacité non seulement de perpétuer des données illégales qui auraient autrement disparu du domaine public, mais d’incorporer effectivement les modèles moraux de ces données dans les implémentations d’IA en aval.

LAION-400M

Le mois dernier, le jeu de données LAION-400M a été publié, ajoutant au nombre croissant de jeux de données multimodaux et linguistiques qui s’appuient sur le référentiel Common Crawl, qui scrape l’internet de manière indiscriminée et passe la responsabilité du filtrage et de la curation aux projets qui l’utilisent. Le jeu de données dérivé contient 400 millions de paires texte/image.

LAION-400M est une variante open source du jeu de données WIT (WebImageText) fermé de Google AI, publié en mars 2021, et comporte des paires texte-image, où une image dans la base de données a été associée à du texte explicite ou de métadonnées accompagnatrices (par exemple, le texte alt d’une image dans une galerie Web). Cela permet aux utilisateurs d’effectuer une recherche d’images basée sur du texte, révélant les associations que l’IA sous-jacente a formées à propos de ces domaines (par exemple, ‘animal’, ‘vélo’, ‘personne’, ‘homme’, ‘femme’).

Cette relation entre image et texte, et la similarité cosinus qui peut intégrer des préjugés dans les résultats de requête, sont au cœur de l’appel de l’article à des méthodologies améliorées, puisque des requêtes très simples à la base de données LAION-400M peuvent révéler des préjugés.

Par exemple, l’image de la pionnière astronaute américaine Eileen Collins dans la bibliothèque d’images scitkit récupère deux légendes associées dans LAION-400M: ‘Ceci est un portrait d’un astronaute avec le drapeau américain’ et ‘Ceci est une photographie d’une ménagère souriante dans un combinaison orange avec le drapeau américain’.

L'astronaute américaine Eileen Collins obtient deux interprétations très différentes de ses réalisations en tant que première femme dans l'espace sous LAION-400M. Source: https://arxiv.org/pdf/2110.01963.pdf

L’astronaute américaine Eileen Collins obtient deux interprétations très différentes de ses réalisations en tant que première femme dans l’espace sous LAION-400M. Source: https://arxiv.org/pdf/2110.01963.pdf

Les similarités cosinus rapportées qui rendent chaque légende susceptible d’être applicable sont très proches les unes des autres, et les auteurs soutiennent qu’une telle proximité rendrait les systèmes d’IA qui utilisent LAION-400M relativement susceptibles de présenter l’une ou l’autre comme une légende appropriée.

La pornographie remonte à la surface à nouveau

LAION-400M a mis à disposition une interface de recherche disponible, où la désactivation du bouton « Recherche sûre » révèle l’étendue à laquelle les images et les associations textuelles pornographiques dominent les étiquettes et les classes. Par exemple, rechercher ‘nonne’ (NSFW si vous désactivez ensuite le mode sécurisé) dans la base de données donne des résultats principalement liés à l’horreur, au cosplay et aux costumes, avec très peu de nonnes réelles disponibles.

La désactivation du mode sécurisé pour la même recherche révèle un flux d’images pornographiques liées au terme, qui repousse les images non pornographiques vers le bas de la page de résultats de recherche, révélant l’étendue à laquelle LAION-400M a attribué un poids plus important aux images pornographiques, car elles sont prévalentes pour le terme « nonne » dans les sources en ligne.

L’activation par défaut du mode sécurisé est trompeuse dans l’interface de recherche en ligne, puisqu’il s’agit d’une particularité de l’interface utilisateur, d’un filtre qui ne sera pas nécessairement activé dans les systèmes d’IA dérivés, mais qui a été généralisé dans le domaine « nonne » d’une manière qui n’est pas si facilement filtrée ou distinguée des résultats (relativement) SFW en termes d’utilisation algorithmique.

L’article présente des exemples floutés à travers diverses requêtes de recherche dans les matériaux supplémentaires à la fin. Ils ne peuvent pas être présentés ici, en raison du langage dans le texte qui accompagne les photos floutées, mais les chercheurs notent l’impact que l’examen et le floutage des images ont eu sur eux, et reconnaissent le défi de la curation de tels matériaux pour la surveillance humaine de grandes bases de données:

‘Nous (ainsi que nos collègues qui nous ont aidés) avons ressenti différents niveaux de malaise, de nausée et de mal de tête pendant le processus de sonde de la base de données. De plus, ce type de travail rencontre de manière disproportionnée des critiques négatives importantes dans la sphère universitaire de l’IA, ce qui non seulement ajoute une charge émotionnelle supplémentaire à la tâche déjà lourde d’étudier et d’analyser de telles bases de données, mais décourage également des travaux similaires à l’avenir, au grand détriment du domaine de l’IA et de la société en général.’

Les chercheurs soutiennent que, même si la curation humaine dans la boucle est coûteuse et a des coûts personnels associés, les systèmes de filtrage automatisés conçus pour supprimer ou traiter un tel matériel ne sont clairement pas à la hauteur de la tâche, puisque les systèmes de traitement du langage naturel (NLP) ont du mal à isoler ou à discountancer le matériel offensant qui peut dominer un jeu de données scrapé, et être ensuite perçu comme important en raison de son volume.

Enshriner le contenu interdit et supprimer les protections de droit d’auteur

L’article soutient que les jeux de données de ce type sont « très susceptibles » de perpétuer l’exploitation d’individus minoritaires, et aborde la question de savoir si des projets de données ouvertes similaires ont le droit, légalement ou moralement, de rejeter la responsabilité du matériel sur l’utilisateur final:

‘Les individus peuvent supprimer leurs données d’un site Web et supposer qu’elles sont disparues à jamais, alors qu’elles peuvent encore exister sur les serveurs de plusieurs chercheurs et organisations. Il y a une question sur qui est responsable de la suppression de ces données de l’utilisation dans la base de données? Pour LAION-400M, les créateurs ont délégué cette tâche à l’utilisateur de la base de données. Étant donné que ces processus sont intentionnellement complexes et que l’utilisateur moyen manque de connaissances techniques pour supprimer ses données, est-ce une approche raisonnable?’

Ils soutiennent en outre que LAION-400M peut ne pas être adapté à une publication sous son modèle de licence Creative Common CC-BY 4.0, malgré les avantages potentiels pour la démocratisation de grands jeux de données, qui étaient auparavant le domaine exclusif de sociétés bien financées telles que Google et OpenAI.

Le domaine LAION-400M affirme que les images de la base de données « sont sous leur propre droit d'auteur » – un mécanisme de « passage » largement facilité par des décisions de justice et des lignes directrices gouvernementales de ces dernières années qui approuvent largement le scraping Web à des fins de recherche. Source: https://rom1504.github.io/clip-retrieval/

Le domaine LAION-400M affirme que les images de la base de données « sont sous leur propre droit d’auteur » – un mécanisme de « passage » largement facilité par des décisions de justice et des lignes directrices gouvernementales de ces dernières années qui approuvent largement le scraping Web à des fins de recherche. Source: https://rom1504.github.io/clip-retrieval/

Les auteurs suggèrent que des bénévoles de base (c’est-à-dire des volontaires) pourraient résoudre certains problèmes de la base de données, et que les chercheurs pourraient développer des techniques de filtrage améliorées.

‘Néanmoins, les droits du sujet de données restent non abordés ici. Il est imprudent et dangereux de minimiser les préjudices inhérents à de telles grandes bases de données et d’encourager leur utilisation dans des contextes industriels et commerciaux. La responsabilité du régime de licence sous lequel la base de données est fournie incombe uniquement au créateur de la base de données’.

Les problèmes de la démocratisation des données hyperscale

L’article soutient que les jeux de données visio-linguistiques d’une taille telle que LAION-400M étaient auparavant inaccessibles en dehors des grandes sociétés de technologie et du nombre limité d’institutions de recherche qui disposent des ressources pour les compiler, les curer et les traiter. Ils saluent l’esprit de la nouvelle publication, tout en critiquant son exécution.

Les auteurs soutiennent que la définition acceptée de « démocratisation », dans le contexte de jeux de données hyperscale open source, est trop limitée, et ‘ne tient pas compte des droits, du bien-être et des intérêts des individus et des communautés vulnérables, qui sont susceptibles de souffrir le plus des impacts en aval de cette base de données et des modèles formés à partir de celle-ci’.

Puisque le développement de modèles open source de grande échelle tels que GPT-3 est conçu pour être diffusé à des millions (et potentiellement à des milliards) d’utilisateurs dans le monde, et que les projets de recherche peuvent adopter des jeux de données avant qu’ils ne soient modifiés ou même supprimés, perpétuant ainsi les problèmes qui devaient être résolus dans les modifications, les auteurs soutiennent que les publications imprudentes de jeux de données sous-curés ne devraient pas devenir une caractéristique habituelle de l’apprentissage automatique open source.

Mettre le génie de nouveau dans la bouteille

Certains jeux de données qui ont été supprimés longtemps après que leur contenu ait pu passer, peut-être de manière inextricable, dans des projets d’IA à long terme, ont inclus le jeu de données Duke MTMC (Multi-Target, Multi-Camera), qui a finalement été retiré en raison de préoccupations répétées de la part d’organisations de défense des droits de l’homme au sujet de son utilisation par les autorités répressives en Chine; Microsoft Celeb (MS-Celeb-1M), un jeu de données de 10 millions d’images de visages de « célébrités » qui s’est avéré inclure des journalistes, des militants, des décideurs et des écrivains, dont l’exposition de données biométriques lors de la publication a été vivement critiquée; et le jeu de données Tiny Images, retiré en 2020 pour des « préjugés, des images offensantes et des termes dénigrants ».

En ce qui concerne les jeux de données qui ont été modifiés plutôt que supprimés après des critiques, des exemples incluent le très populaire jeu de données ImageNet, qui, selon les chercheurs, a mis dix ans (2009-2019) pour répondre aux critiques répétées concernant la confidentialité et les classes non imageables.

L’article observe que LAION-400M remet effectivement ces améliorations dans l’embarras, en « ignorant largement » les révisions susmentionnées dans la représentation d’ImageNet dans la nouvelle publication, et soupçonne une tendance plus large à cet égard*:

‘Ceci est mis en évidence dans l’émergence de jeux de données plus importants tels que le jeu de données d’images ML de Tencent en février 2020 qui englobe la plupart de ces classes non imageables, la disponibilité continue de modèles formés sur le jeu de données complet ImageNet-21k dans des référentiels tels que TF-hub, l’utilisation continue du jeu de données non filtré ImageNet-21k dans les derniers modèles SotA (tels que les modèles EfficientNetV2 de Google et les modèles CoAtNet) et les annonces explicites autorisant l’utilisation du pré-entraînement non filtré ImageNet-21k dans des concours réputés tels que le défi LVIS 2021.

‘Nous soulignons cette observation cruciale: une équipe de la stature d’ImageNet gérant moins de 15 millions d’images a lutté et échoué dans ces tentatives de désintoxication jusqu’à présent.

‘L’ampleur des efforts soigneux nécessaires pour détoxifier soigneusement ce jeu de données multimodal massif et les modèles en aval formés sur ce jeu de données couvrant potentiellement des milliards de paires d’images et de légendes sera indéniablement astronomique.’

 

* Ma conversion des citations en ligne de l’auteur en hyperliens.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai