Angle d’Anderson

Extraction des données d’entraînement à partir de modèles de diffusion stables fine-tunés

mm
Ajouter Unite.AI à vos sources préférées sur Google
Examples of training images (below), extracted from a trained model (above). Source: https://arxiv.org/pdf/2410.03039

De nouvelles recherches menées aux États-Unis présentent une méthode pour extraire des portions importantes des données d’entraînement à partir de modèles fine-tunés.

Cela pourrait potentiellement fournir des preuves légales dans les cas où le style d’un artiste a été copié, ou où des images protégées par le droit d’auteur ont été utilisées pour entraîner des modèles de génération de contenu de personnages publics, de personnages protégés par le droit d’auteur, ou d’autres contenus.

À partir du nouveau document de recherche: les images d'entraînement originales sont visibles dans la rangée supérieure, et les images extraites sont représentées dans la rangée inférieure. Source: https://arxiv.org/pdf/2410.03039

À partir du nouveau document de recherche: les images d’entraînement originales sont visibles dans la rangée supérieure, et les images extraites sont représentées dans la rangée inférieure. Source: https://arxiv.org/pdf/2410.03039

De tels modèles sont largement et librement disponibles sur Internet, principalement grâce aux archives enormes contribuées par les utilisateurs de civit.ai, et, dans une moindre mesure, sur la plateforme de dépôt Hugging Face.

Le nouveau modèle développé par les chercheurs s’appelle FineXtract, et les auteurs affirment qu’il obtient des résultats de pointe dans cette tâche.

Le document de recherche observe:

‘[Notre cadre] répond effectivement au défi de l’extraction des données de fine-tuning à partir de points de contrôle de DM publics. En exploitant la transition des distributions de DM préentraînées aux distributions de données de fine-tuning, FineXtract guide avec précision le processus de génération vers les régions à haute probabilité de la distribution de données de fine-tuning, permettant une extraction de données réussie.’

À droite, l'image originale utilisée pour l'entraînement. Deuxième à droite, l'image extraite via FineXtract. Les autres colonnes représentent des méthodes alternatives antérieures.

À droite, l’image originale utilisée pour l’entraînement. Deuxième à droite, l’image extraite via FineXtract. Les autres colonnes représentent des méthodes alternatives antérieures. Veuillez vous référer au document de recherche source pour une meilleure résolution.

Pourquoi cela est important

Les modèles formés initialement pour les systèmes de génération d’images à partir de texte tels que Stable Diffusion et Flux peuvent être téléchargés et fine-tunés par les utilisateurs finals, en utilisant des techniques telles que la mise en œuvre DreamBooth de 2022.

Il est encore plus facile pour l’utilisateur de créer un modèle LoRA beaucoup plus petit qui est presque aussi efficace qu’un modèle entièrement fine-tuné.

Un exemple de LORA formé, offert en téléchargement gratuit sur le site très populaire Civitai. Un tel modèle peut être créé en quelques minutes à quelques heures, par des enthousiastes utilisant des logiciels open source installés localement – et en ligne, via certains systèmes de formation plus permissifs basés sur API. Source: civitai.com

Un exemple de LORA formé, offert en téléchargement gratuit sur le domaine Civitai très populaire. Un tel modèle peut être créé en quelques minutes à quelques heures, par des enthousiastes utilisant des logiciels open source installés localement – et en ligne, via certains systèmes de formation plus permissifs basés sur API. Source: civitai.com

Depuis 2022, il est devenu trivial de créer des points de contrôle fine-tunés et des LoRAs spécifiques à l’identité, en fournissant uniquement un petit nombre (en moyenne 5-50) d’images avec légende, et en formant le point de contrôle (ou LoRA) localement, sur un cadre open source tel que Kohya ss, ou en utilisant des services en ligne.

Cette méthode facile de deepfaking a acquis une notoriété dans les médias au cours des dernières années. De nombreux artistes ont également vu leur travail ingéré dans des modèles de génération qui reproduisent leur style. La controverse autour de ces questions a gagné en importance au cours des 18 derniers mois.

La facilité avec laquelle les utilisateurs peuvent créer des systèmes d'IA qui reproduisent le travail de véritables artistes a provoqué la fureur et des campagnes diverses au cours des deux dernières années. Source: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/

La facilité avec laquelle les utilisateurs peuvent créer des systèmes d’IA qui reproduisent le travail de véritables artistes a provoqué la fureur et des campagnes diverses au cours des deux dernières années. Source: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/

Il est difficile de prouver quelles images ont été utilisées dans un point de contrôle fine-tuné ou dans un LoRA, puisque le processus de généralisation ‘abstrait’ l’identité à partir des petits ensembles de données d’entraînement, et n’est pas susceptible de reproduire des exemples à partir des données d’entraînement (sauf dans le cas de surajustement, où l’on peut considérer que la formation a échoué).

C’est là que FineXtract intervient. En comparant l’état du ‘modèle de diffusion de base’ que l’utilisateur a téléchargé au modèle qu’il a ensuite créé par fine-tuning ou par LoRA, les chercheurs ont pu créer des reconstructions très précises des données d’entraînement.

Bien que FineXtract n’ait pu recréer que 20 % des données à partir d’un fine-tuning*, cela suffit pour fournir des preuves que l’utilisateur a utilisé du matériel protégé par le droit d’auteur ou autrement protégé ou interdit dans la production d’un modèle de génération. Dans la plupart des exemples fournis, l’image extraite est extrêmement proche du matériel source connu.

Alors que des légendes sont nécessaires pour extraire les images sources, ce n’est pas un obstacle important pour deux raisons: a) l’uploadé souhaite généralement faciliter l’utilisation du modèle au sein d’une communauté et fournira généralement des exemples de invites appropriés; et b) il n’est pas difficile, selon les chercheurs, d’extraire les termes clés essentiels à l’aveugle, à partir du modèle fine-tuné:

Les mots clés essentiels peuvent généralement être extraits à l'aveugle du modèle fine-tuné en utilisant une attaque L2-PGD sur 1000 itérations, à partir d'une invite aléatoire.

Les mots clés essentiels peuvent généralement être extraits à l’aveugle du modèle fine-tuné en utilisant une attaque L2-PGD sur 1000 itérations, à partir d’une invite aléatoire.

Les utilisateurs évitent souvent de rendre leurs ensembles de données d’entraînement disponibles aux côtés du modèle formé de type ‘boîte noire’. Pour la recherche, les auteurs ont collaboré avec des enthousiastes de l’apprentissage automatique qui ont effectivement fourni des ensembles de données.

Le nouveau document de recherche est intitulé Révéler l’invisible: guider les modèles de diffusion personnalisés pour exposer les données d’entraînement, et provient de trois chercheurs issus des universités Carnegie Mellon et Purdue.

Méthode

L’« attaquant » (dans ce cas, le système FineXtract) compare les distributions de données estimées à travers le modèle original et le modèle fine-tuné, dans un processus que les auteurs appellent « guidage de modèle ».

Grâce au « guidage de modèle » développé par les chercheurs du nouveau document de recherche, les caractéristiques de fine-tuning peuvent être cartographiées, permettant l'extraction des données d'entraînement.

Grâce au « guidage de modèle » développé par les chercheurs du nouveau document de recherche, les caractéristiques de fine-tuning peuvent être cartographiées, permettant l’extraction des données d’entraînement.

Les auteurs expliquent:

‘Au cours du processus de fine-tuning, les [modèles de diffusion] déplacent progressivement leur distribution apprise de la distribution des [modèles de diffusion] préentraînés vers la distribution des [données de fine-tuning].

‘Ainsi, nous approximons paramétriquement [la] distribution apprise des [modèles de diffusion] fine-tunés.’

De cette façon, la somme de la différence entre les modèles de base et fine-tunés fournit le processus de guidage.

Les auteurs commentent en outre:

‘Avec le guidage de modèle, nous pouvons simuler efficacement un « pseudo- »[dénoueur], qui peut être utilisé pour diriger le processus d’échantillonnage vers la région à haute probabilité au sein de la distribution de données de fine-tuning.’

Le guidage repose en partie sur un processus de bruitage qui varie dans le temps, similaire à la sortie Erasing Concepts from Diffusion Models de 2023.

La prédiction de débruitage obtenue fournit également une échelle de guidage de classification sans modèle (CFG) probable. C’est important, car la CFG affecte considérablement la qualité d’image et la fidélité à l’invite de texte de l’utilisateur.

Pour améliorer la précision des images extraites, FineXtract s’appuie sur la collaboration acclamée de 2023 Extracting Training Data from Diffusion Models. La méthode utilisée consiste à calculer la similarité de chaque paire d’images générées, sur la base d’un seuil défini par le descripteur auto-supervisé (SSCD) score.

De cette façon, l’algorithme de regroupement aide FineXtract à identifier le sous-ensemble d’images extraites qui correspondent aux données d’entraînement.

Dans ce cas, les chercheurs ont collaboré avec des utilisateurs qui ont rendu les données disponibles. On pourrait raisonnablement dire que, en l’absence de telles données, il serait impossible de prouver que une image générée particulière a réellement été utilisée pour l’entraînement dans l’original. Cependant, il est maintenant relativement trivial de faire correspondre les images téléchargées soit contre des images en direct sur le Web, soit contre des images qui se trouvent également dans des ensembles de données publiés, sur la base uniquement du contenu de l’image.

Données et tests

Pour tester FineXtract, les auteurs ont mené des expériences sur des modèles fine-tunés à quelques exemples à travers les deux scénarios de fine-tuning les plus courants, dans le cadre du projet: styles artistiques, et génération basée sur les objets (le dernier englobant essentiellement les sujets basés sur les visages).

Ils ont sélectionné aléatoirement 20 artistes (chacun avec 10 images) à partir de l’ensemble de données WikiArt, et 30 sujets (chacun avec 5-6 images) à partir de l’ensemble de données DreamBooth, pour aborder ces scénarios respectifs.

DreamBooth et LoRA étaient les méthodes de fine-tuning ciblées, et Stable Diffusion V1/.4 a été utilisé pour les tests.

Si l’algorithme de regroupement ne retournait aucune résultat après trente secondes, le seuil a été modifié jusqu’à ce que des images soient retournées.

Les deux métriques utilisées pour les images générées étaient la similarité moyenne (AS) sous SSCD, et le taux de réussite moyen d’extraction (A-ESR) – une mesure largement en ligne avec les travaux précédents, où un score de 0,7 représente le minimum pour dénoter une extraction réussie des données d’entraînement.

Étant donné que les approches précédentes ont utilisé soit la génération directe d’image à partir de texte, soit la CFG, les chercheurs ont comparé FineXtract avec ces deux méthodes.

Résultats des comparaisons de FineXtract avec les deux méthodes les plus populaires précédentes.

Résultats des comparaisons de FineXtract avec les deux méthodes les plus populaires précédentes.

Les auteurs commentent:

‘Les [résultats] démontrent un avantage significatif de FineXtract par rapport aux méthodes précédentes, avec une amélioration d’environ 0,02 à 0,05 en AS et un doublement du A-ESR dans la plupart des cas.’

Pour tester la capacité de la méthode à se généraliser à de nouvelles données, les chercheurs ont mené un test supplémentaire, en utilisant Stable Diffusion (V1.4), Stable Diffusion XL, et AltDiffusion.

FineXtract appliqué à une gamme de modèles de diffusion. Pour la composante WikiArt, le test s'est concentré sur quatre classes dans WikiArt.

FineXtract appliqué à une gamme de modèles de diffusion. Pour la composante WikiArt, le test s’est concentré sur quatre classes dans WikiArt.

Comme le montrent les résultats ci-dessus, FineXtract a pu atteindre une amélioration par rapport aux méthodes précédentes dans ce test plus large.

Une comparaison qualitative des résultats extraits de FineXtract et des approches précédentes. Veuillez vous référer au document de recherche source pour une meilleure résolution.

Une comparaison qualitative des résultats extraits de FineXtract et des approches précédentes. Veuillez vous référer au document de recherche source pour une meilleure résolution.

Les auteurs observent que lorsque le nombre d’images utilisées dans l’ensemble de données pour un modèle fine-tuné augmente, l’algorithme de regroupement doit être exécuté pendant une période plus longue pour rester efficace.

Ils observent également qu’une variété de méthodes ont été développées ces dernières années pour entraver ce type d’extraction, sous le prétexte de la protection de la vie privée. Ils ont donc testé FineXtract contre des données augmentées par les méthodes Cutout et RandAugment.

Une comparaison qualitative des résultats extraits de FineXtract et des approches précédentes. Veuillez vous référer au document de recherche source pour une meilleure résolution.

Les performances de FineXtract contre les images protégées par Cutout et RandAugment.

Alors que les auteurs admettent que les deux systèmes de protection fonctionnent assez bien pour obscurcir les sources de données d’entraînement, ils notent que cela se fait au prix d’une baisse de qualité de sortie si sévère qu’elle rend la protection inutile:

Images produites sous Stable Diffusion V1.4, fine-tunées avec des mesures de défense – qui abaissent considérablement la qualité d'image.

Images produites sous Stable Diffusion V1.4, fine-tunées avec des mesures de défense – qui abaissent considérablement la qualité d’image. Veuillez vous référer au document de recherche source pour une meilleure résolution.

Le document de recherche conclut:

‘Nos expériences démontrent la robustesse de la méthode à travers divers ensembles de données et points de contrôle du monde réel, mettant en évidence les risques potentiels de fuite de données et fournissant des preuves solides d’atteintes au droit d’auteur.’

Conclusion

2024 a prouvé être l’année où l’intérêt des entreprises pour des données d’entraînement « propres » a augmenté de manière significative, face à la couverture médiatique continue de la propension de l’IA à remplacer les humains, et de la perspective de protéger juridiquement les modèles de génération qu’ils sont si désireux d’exploiter.

Il est facile de prétendre que vos données d’entraînement sont propres, mais il devient également plus facile pour des technologies similaires de prouver qu’elles ne le sont pas – comme l’ont découvert Runway ML, Stability.ai et MidJourney (entre autres) ces derniers jours.

Des projets tels que FineXtract sont sans doute les signes avant-coureurs de la fin absolue de l’ère « Far West » de l’IA, où même la nature apparemment occulte d’un espace latent formé pourrait être tenue pour responsable.

 

* Pour des raisons de commodité, nous allons désormais supposer ‘fine-tune et LoRA’, lorsque nécessaire.

Publié pour la première fois le lundi 7 octobre 2024

Écrivain sur l'apprentissage automatique, spécialiste du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]