Angle d’Anderson
Donner des « identités secrètes » aux personnages d’animation protégés par le droit d’auteur

De nouvelles recherches menées en Chine offrent une méthode non invasive pour protéger les personnages d’animation protégés par le droit d’auteur, en « injectant » des substituts génériques au moment de l’inférence. Mais cette méthode peut-elle vaincre l’ingéniosité des hackers de prompts ?
Compte tenu de la portée des matériaux protégés par le droit d’auteur présents dans les jeux de données hyperscale (en raison du coût élevé pour éliminer ces infractions), les modèles formés sur ces données sont capables de reproduire des personnages protégés par le droit d’auteur.
La modification directe du modèle formé, ou l’utilisation de filtres pour intercepter les mots clés lorsque le modèle est accédé via une API, peut souvent être contournée en décrivant l’élément protégé par le droit d’auteur de manière elliptique:
Un personnage protégé par le droit d’auteur produit par un chatbot AI populaire, apparemment sans invocation directe du nom du personnage. Source
Dans une forte et persistante tendance de recherche, les techniques de modification de modèle ont tenté de modifier les paramètres dans un modèle formé, avec des résultats variables:
À partir du papier de 2023 Ablating Concepts in Text-to-Image Diffusion Models, des représentations photoréalistes de l’actrice Brie Larson en tant que « Captain Marvel » – intégrées à un modèle de diffusion populaire – sont transformées en images de cartoon liées lorsque demandées par l’utilisateur. Source
Cependant, l’ablation est généralement un processus destructif et imprécis, et peut fréquemment affecter d’autres caractéristiques du modèle formé ; de plus, il existe plusieurs façons de contourner cela.
L’autre approche populaire est la « prompt négative », dans laquelle une « anti-prompt » supplémentaire est envoyée au modèle, conçue pour restreindre la sortie. Lorsque les modèles sont accédés via une API (comme c’est le cas pour les modèles de frontière, par exemple), une « prompt négative secrète » peut être envoyée avec la prompt utilisateur connue, comprenant un rubrique conçue pour empêcher le modèle de fournir du matériel interdit à l’utilisateur. Cette approche, bien qu’elle soit populaire comme vecteur de protection du droit d’auteur, ne fonctionne pas toujours non plus.
La plupart des travaux sur la censure post-facto sont occupés par la question plus large de s’assurer que les modèles ne produisent pas de CSAM, ou tout type de contenu NSFW, malgré la grande quantité de tels contenus susceptibles d’avoir été présents dans les données de formation d’un modèle majeur. De telles initiatives peuvent affecter des classes entières de contenu, plutôt que des instances spécifiques, et manquent généralement de la nuance nécessaire pour répondre aux préoccupations des détenteurs de droits d’auteur cherchant à supprimer des identités spécifiques.
Les doubles
Avec cela en tête, un nouveau papier de Chine propose de remplacer les personnages d’animation protégés par le droit d’auteur pendant la génération d’images par des substituts génériques appris – des « doubles » qui conservent suffisamment de la forme et de la structure du personnage pour préserver la scène environnante, tout en supprimant les détails distinctifs associés au personnage protégé:
« Anonymisation » des représentations de matériel protégé par le droit d’auteur autrement présent et accessible dans un modèle formé, réalisée par la nouvelle méthode d’incrustation. Source
Crucialement, cette intervention se produit pendant la génération sans modifier ou affiner le modèle de diffusion sous-jacent, et peut être ajustée pour déterminer dans quelle mesure le personnage original est effacé.
L’approche reconnaît implicitement que la modification du modèle est une mauvaise méthode pour cet objectif, et injecte plutôt des incrustations conçues dans le processus d’inférence – des incrustations conçues pour « réorganiser » plutôt que d’ablater (mettre à zéro, supprimer) l’actif protégé par le droit d’auteur. Le processus n’affecte pas directement ou ne modifie pas le modèle de base du tout, et peut donc être réutilisé ou adapté sur une variété de modèles.
Bien que la méthode ait été testée par les auteurs sur la gamme de modèles plus ancienne Stable Diffusion, elle a également été efficacement testée sur l’architecture Z-Image beaucoup plus récente, suggérant que le concept des auteurs est applicable sur une gamme d’architectures génératives.
Le papier indique:
‘[Nous] proposons une méthode contrôlable opérant sur la représentation textuelle continue du modèle pour effacer les personnages ciblés pendant la génération. Nous [optimisons] une incrustation d’ancrage via des contraintes structurelles et détaillées pour servir de substitut de personnage, puis [remplaçons] les incrustations liées à la cible avec l’ancrage via une stratégie adaptative sensible à la structure.
‘Les expériences montrent que notre méthode atteint une efficacité d’effacement de l’état de l’art et une préservation de la fidélité de l’image, tout en prenant en charge le degré d’effacement contrôlable, la suppression de plusieurs cibles et la transférabilité du modèle.
‘De plus, nos ancres optimisées sont prêtes à l’emploi avec les méthodes de modification de modèle actuelles pour améliorer leur performance d’effacement.’
La nouvelle méthode chevauche des architectures diverses et offre un contrôle granulaire, selon les auteurs.
Le nouveau papier est intitulé Effacer mais préserver: Suppression contrôlée de personnages d’animation protégés par le droit d’auteur via des ancres sémantiques optimisées, et provient de sept auteurs issus de l’Institut d’ingénierie de l’information de l’Académie chinoise des sciences, et de l’Université de l’Académie chinoise des sciences à Pékin.
Méthode
L’idée centrale derrière la nouvelle méthode, comme illustré ci-dessous, est de créer un substitut pour chaque personnage protégé par le droit d’auteur qui conserve sa forme et sa structure générales, tout en supprimant les détails visuels distinctifs qui rendent le personnage reconnaissable – puis d’utiliser ce substitut pendant la génération d’images chaque fois que le personnage protégé est demandé.
Schéma de la nouvelle approche.
Le substitut, que les auteurs appellent un ancrage, est conçu pour conserver suffisamment de la forme et de la structure du personnage original pour s’intégrer naturellement dans la même scène, tout en rejetant les détails qui font que le personnage est distinctif.
Pour ce faire, le système compare les informations structurelles grossières générées pour le personnage original avec celles générées pour l’ancrage en développement, en poussant les deux vers une forme générale similaire. Une image de référence du personnage protégé par le droit d’auteur est ensuite utilisée à des fins opposées, en éloignant l’ancrage des détails reconnaissables plus fins:
Méthode de construction d’un substitut non contrefaisant pour un personnage protégé par le droit d’auteur. La structure générale du personnage est conservée tandis que ses détails visuels distinctifs sont supprimés, produisant un « ancrage » optimisé pour utilisation pendant la génération.
L’ancrage résultant occupe donc un terrain intermédiaire délibérément conçu entre la préservation de la composition demandée et la suppression de l’identité protégée.
Éloigner l’ancrage
Une fois que ces propriétés ont été établies, l’ancrage doit être traduit en quelque chose que le modèle de diffusion peut comprendre. Le terme de remplacement Anchor* [sic] reçoit donc sa propre représentation apprenable à l’intérieur du encodeur de texte CLIP, créant effectivement un nouveau mot/artefact artificiel, dont le sens peut être façonné sans modifier le modèle de génération d’images sous-jacent.
Cette nouvelle représentation est ajustée à plusieurs reprises en fonction des objectifs structurels et de détail décrits ci-dessus, enseignant à Anchor* à signifier quelque chose de formé de manière générale comme le personnage protégé par le droit d’auteur, mais privé de son apparence distinctive.
Le reste de l’encodeur de texte reste gelé pendant ce processus, tandis que les jetons de début, de fin et de remplissage ordinaires entourant Anchor* fournissent le contexte nécessaire pour transformer ce pseudo-mot nouvellement appris en les incrustations finales utilisées pendant la génération.
Remplacement adaptatif
Pendant la génération (inférence), l’algorithme recherche les termes associés au personnage protégé par le droit d’auteur dans l’incrustation codée, et substitue les incrustations d’ancrage apprises à leur place, tout en ajustant les incrustations de fin et de remplissage qui portent des informations contextuelles.
Pour se préparer à cela, le système permet d’abord à la désbruitage d’établir la composition générale de l’image demandée, en surveillant les changements dans sa structure grossière pour déterminer quand cette disposition a commencé à se stabiliser:

Représentation de quand le remplacement d’ancrage se produit pendant la génération d’images. Les changements dans la structure grossière de l’image sont suivis tout au long du désbruitage, avec le remplacement déclenché autour du point où la disposition générale se stabilise, et les détails plus fins commencent à émerger.
Dans l’image ci-dessus, nous voyons cette transition se produire à environ le pas de temps 720, où le changement structurel mesuré atteint son pic, puis commence à diminuer. À ce stade, l’agencement général de l’image a largement pris forme, permettant à l’ancrage de remplacer le personnage protégé par le droit d’auteur, tout en réduisant le risque de perturber la composition établie.
Données et tests
Les auteurs ont comparé leur approche à cinq lignes de base basées sur des prompts: Diffusion latente sûre (SLD) ; STG ; SAFREE ; TraSCE ; et Prompt négatif (NP).
Les incrustations d’ancrage optimisées ont également été intégrées dans quatre méthodes de modification de modèle existantes: MACE ; UCE ; ESD-u ; et AC. Cela a été fait pour tester si ces méthodes pouvaient améliorer le modèle proposé en ce qui concerne la suppression de personnages.
Pour l’évaluation, un jeu de données de 80 personnages d’animation a été assemblé, comprenant 36 personnages anthropomorphes ; 23 personnages sous forme d’animaux ; et 21 de catégories diverses – avec tous les personnages sélectionnés parce qu’ils pouvaient être reproduits de manière fiable par les modèles de diffusion.
Cent images ont ensuite été générées pour chaque personnage, à l’aide de prompts produits par GPT-4o.
Stable Diffusion v1.4 a été utilisé pour les expériences principales, avec la transférabilité testée en outre sur d’autres versions de Stable Diffusion v1.5 ; V2 ; v2.1 ; XL base 1.0 ; et également l’architecture Z-Image basée sur DiT beaucoup plus récente. Aucun affinage de modèle n’a été effectué, laissant les paramètres de chaque modèle pré-formé inchangés.
Pour les métriques, LLaVA-1.5 et BLIP-3 ont mesuré si le personnage cible restait reconnaissable, avec des taux d’identification plus bas indiquant une suppression plus complète ; Index de similarité structurelle (SSIM) a mesuré la préservation structurelle ; Métriques de similarité perçue apprises (LPIPS) a mesuré la différence perçue ; et Prédicteur esthétique V2 Score a évalué la qualité visuelle de l’image modifiée.
Fréchet Inception Distance (FID) et CLIP Score ont également été calculés à partir de prompts non liés dans COCO-30K, pour mesurer si la génération d’images normale avait été affectée:
Résultats des tests comparant les méthodes de suppression de personnages sur 80 personnages d’animation. Les deux premières colonnes mesurent combien de fois le personnage supprimé pouvait encore être reconnu, donc des scores plus bas indiquent une suppression meilleure. Les colonnes restantes mesurent combien bien l’image originale et la génération non liée ont été préservées. Les flèches montrent si des scores plus élevés ou plus bas sont préférables ; le gras indique le meilleur résultat et le soulignement le deuxième meilleur.
Sur ces résultats initiaux de comparaison quantitative, les auteurs déclarent:
‘Par rapport à toutes les lignes de base, les images effacées à l’aide de notre méthode atteignent les taux d’identification les plus bas pour une identification réussie de la cible par LLaVA-1.5 (6,0 %) et BLIP-3 (4,0 %), avec des réductions de 3,5 % et 1,7 % par rapport à la deuxième plus basse, respectivement.
‘Cela démontre l’efficacité d’effacement de notre méthode, car elle trompe efficacement les grands modèles multimodaux.’
Pour la fidélité de l’image, la méthode des auteurs a produit le score SSIM le plus élevé, à 0,467, et le score LPIPS le plus bas à 0,505 – indiquant la préservation la plus forte du contenu non lié et de la structure de fond parmi les méthodes testées. Elle a également atteint le score Prédicteur esthétique V2 le plus élevé parmi les méthodes de suppression de personnages, à 5,18, suggérant que cette préservation ne se fait pas au détriment de la qualité visuelle globale.
Un test qualitatif a suivi:
Résultats des tests comparant la suppression de personnages sur cinq personnages d’animation. Chaque ligne montre les résultats d’une méthode différente, avec les générations originales de Stable Diffusion v1.4 en haut et la méthode proposée en bas. La méthode proposée remplace plus régulièrement les personnages cibles tout en préservant la scène environnante. Veuillez vous référer au PDF source original ou au site du projet pour une résolution légèrement meilleure.
Selon le papier, les exemples montrent des différences particulièrement nettes pour les personnages avec des formes et des attributs plus complexes, avec Donald Duck et Super Mario cités comme exemples:
‘[Notre] méthode atteint une suppression transparente des personnages d’animation via des ancres optimisées, tandis que les lignes de base basées sur des prompts échouent souvent—en particulier pour les personnages avec des formes et des attributs complexes (par exemple, Donald Duck et Super Mario).
‘De plus, notre méthode atteint une cohérence de fond sans les artefacts de flou ou de déformation, soutenant les flux de travail créatifs itératifs.’
Contrôle granulaire
Un espace d’incrustation continu permet également d’ajuster la force de suppression du personnage, plutôt que de traiter l’effacement comme une proposition tout ou rien. En interpolant entre l’ancrage optimisé et l’incrustation cible originale, la méthode peut progressivement restaurer plus du personnage, tout en conservant la structure d’image environnante:
Images de test montrant différents degrés de suppression de personnages. Les trois premières colonnes montrent le personnage original, la version effacée et les caractéristiques visuelles supprimées ; les colonnes restantes montrent des paramètres intermédiaires à α=0,25, 0,5 et 0,75. Des valeurs α plus élevées préservent progressivement plus du personnage original. Veuillez vous référer au PDF source original ou au site du projet pour une résolution légèrement meilleure.
Comme le montre ci-dessus, les auteurs ont également testé ce contrôle sur les personnages Winnie l’ourson ; Olaf ; Minnie Mouse ; et Stitch. La similarité structurelle est restée relativement stable à mesure que la force de restauration changeait, tandis que la reconnaissance par LLaVA-1.5 et BLIP-3 augmentait à mesure que plus de chaque personnage était restauré.
Winnie l’ourson et Stitch sont devenus reconnaissables sur des plages relativement étroites ; Olaf et Minnie Mouse ont changé plus progressivement ; et Minnie Mouse est devenue reconnaissable avec relativement peu de restauration, démontrant que la force d’effacement appropriée dépend du personnage ciblé.
D’autres expériences pour remplacer plusieurs cibles en une seule passe ont été menées avec succès, et nous renvoyons le lecteur au papier source pour plus de détails sur cela, ainsi que pour des résultats supplémentaires et du matériel.
Conclusion
Comme toujours, cette dernière touche sur les garde-fous du droit d’auteur équivaut à fermer la porte de l’écurie après que le cheval soit parti.
Dans ces rares cas où les chercheurs et les entreprises ont tenté de supprimer la capacité d’un modèle à produire de la nudité et/ou de la pornographie, en coupant réellement l’accès interne à du matériel « NSFW » dans le jeu de données (parce qu’il est encore trop coûteux pour le curer), il s’est avéré que le modèle ne pouvait plus comprendre l’anatomie humaine correctement.
La nouvelle approche proposée ici est, en soi, équivalente à exciser/génériquer une étoile du porno en particulier, dans un cas où un filtre NSFW était construit pour un modèle formé sur des tonnes de contenu Web scrapé de manière indiscriminée. Pour la nouvelle méthode, créer un « double générique » pour un personnage protégé par le droit d’auteur doit nécessairement laisser le domaine de super-héros intact dans l’espace latent du modèle ; et plus le personnage protégé par le droit d’auteur est important, plus il définit son domaine dans l’espace formé.
Par conséquent, le supprimer est comme essayer de retirer le sucre du café, une fois que le café a été mélangé.
Alors que cette approche peut connaître un succès limité si elle est ajoutée aux pare-feu API en constante expansion des modèles de frontière, la nature interconnectée d’un modèle de GenAI suggère, historiquement, que le matériel protégé par le droit d’auteur que cette méthode cible peut rester accessible grâce à l’ingéniosité habituelle des prompteurs.
Publié pour la première fois vendredi 14 août 2026












