Angle d’Anderson

Trois dÃĐfis à relever pour Stable Diffusion

mm
Ajouter Unite.AI à vos sources prÃĐfÃĐrÃĐes sur Google

La sortie du modÃĻle de synthÃĻse d’images de diffusion latente Stable Diffusion de stability.ai il y a quelques semaines peut Être l’une des divulgations technologiques les plus importantes depuis DeCSS en 1999; c’est certainement le plus grand ÃĐvÃĐnement dans l’histoire des images gÃĐnÃĐrÃĐes par l’IA depuis le code de deepfakes de 2017 qui a ÃĐtÃĐ copiÃĐ sur GitHub et forkÃĐ pour devenir DeepFaceLab et FaceSwap, ainsi que le logiciel de diffusion de deepfakes en temps rÃĐel DeepFaceLive.

En un seul coup, la frustration des utilisateurs face aux restrictions de contenu dans l’API de synthÃĻse d’images DALL-E 2 ont ÃĐtÃĐ balayÃĐes, car il s’est avÃĐrÃĐ que le filtre NSFW de Stable Diffusion pouvait Être dÃĐsactivÃĐ en modifiant une seule ligne de code. Les Reddit de Stable Diffusion axÃĐs sur la pornographie ont surgi presque immÃĐdiatement, et ont ÃĐtÃĐ rapidement supprimÃĐs, tandis que les dÃĐveloppeurs et les utilisateurs se sont divisÃĐs sur Discord en communautÃĐs officielles et NSFW, et que Twitter a commencÃĐ Ã  se remplir de crÃĐations fantastiques de Stable Diffusion.

Actuellement, chaque jour apporte une nouvelle innovation incroyable des dÃĐveloppeurs qui ont adoptÃĐ le systÃĻme, avec des plugins et des ajouts tiers ÃĐcrits à la hÃĒte pour Krita, Photoshop, Cinema4D, Blender, et de nombreuses autres plateformes d’applications.

Entre-temps, promptcraft – l’art professionnel de ÂŦ chuchotage à l’IA Âŧ, qui peut finir par Être la carriÃĻre la plus courte depuis ÂŦ relieur Filofax Âŧ – est dÃĐjà en train de devenir commercialisÃĐ, tandis que la premiÃĻre monÃĐtisation de Stable Diffusion a lieu au niveau Patreon, avec la certitude de propositions plus sophistiquÃĐes à venir, pour ceux qui ne veulent pas naviguer dans des installations basÃĐes sur Conda du code source, ou les filtres NSFW prescrits des implÃĐmentations basÃĐes sur le Web.

Le rythme de dÃĐveloppement et la libertÃĐ d’exploration des utilisateurs progressent à une vitesse si vertigineuse qu’il est difficile de voir trÃĻs loin à l’avance. Essentiellement, nous ne savons pas exactement à quoi nous avons affaire pour le moment, ou quels pourraient Être les limites ou les possibilitÃĐs.

NÃĐanmoins, examinons trois des dÃĐfis les plus intÃĐressants et les plus difficiles que la communautÃĐ Stable Diffusion, rapidement formÃĐe et en pleine croissance, devra relever et, espÃĐrons-le, surmonter.

1: Optimisation des pipelines basÃĐs sur des tuiles

PrÃĐsentÃĐ avec des ressources matÃĐrielles limitÃĐes et des limites strictes sur la rÃĐsolution des images d’entraÃŪnement, il est probable que les dÃĐveloppeurs trouveront des solutions pour amÃĐliorer à la fois la qualitÃĐ et la rÃĐsolution de la sortie de Stable Diffusion. Beaucoup de ces projets impliqueront l’exploitation des limites du systÃĻme, comme sa rÃĐsolution native de seulement 512×512 pixels.

Comme c’est toujours le cas avec les initiatives de vision par ordinateur et de synthÃĻse d’images, Stable Diffusion a ÃĐtÃĐ formÃĐ sur des images à ratio carrÃĐ, dans ce cas, rÃĐÃĐchantillonnÃĐes à 512×512, afin que les images sources puissent Être rÃĐgularisÃĐes et puissent rentrer dans les contraintes des GPU qui ont formÃĐ le modÃĻle.

Par consÃĐquent, Stable Diffusion ÂŦ pense Âŧ (si cela pense du tout) en termes de 512×512, et certainement en termes carrÃĐs. De nombreux utilisateurs qui testent actuellement les limites du systÃĻme rapportent que Stable Diffusion produit les rÃĐsultats les plus fiables et les moins de glitches à ce ratio d’aspect plutÃīt contraint (voir ÂŦ l’adressage des extrÃĐmitÃĐs Âŧ ci-dessous).

Bien que diverses implÃĐmentations prÃĐsentent une mise à l’ÃĐchelle via RealESRGAN (et peuvent corriger les visages mal rendus via GFPGAN) plusieurs utilisateurs dÃĐveloppent actuellement des mÃĐthodes pour diviser les images en sections de 512x512px et les coudre ensemble pour former des œuvres composites plus grandes.

Cette image 1024x576, une rÃĐsolution habituellement impossible dans un seul rendu de Stable Diffusion, a ÃĐtÃĐ crÃĐÃĐe en copiant et en collant le fichier attention.py Python à partir de la fourchette DoggettX de Stable Diffusion (une version qui met en œuvre la mise à l'ÃĐchelle basÃĐe sur des tuiles) dans une autre fourchette. Source: https://old.reddit.com/r/StableDiffusion/comments/x6yeam/1024x576_with_6gb_nice/

Cette image 1024×576, une rÃĐsolution habituellement impossible dans un seul rendu de Stable Diffusion, a ÃĐtÃĐ crÃĐÃĐe en copiant et en collant le fichier attention.py Python à partir de la fourchette DoggettX de Stable Diffusion (une version qui met en œuvre la mise à l’ÃĐchelle basÃĐe sur des tuiles) dans une autre fourchette. Source: https://old.reddit.com/r/StableDiffusion/comments/x6yeam/1024x576_with_6gb_nice/

Bien que certaines initiatives de ce type utilisent du code original ou d’autres bibliothÃĻques, la porte txt2imghd de GOBIG (un mode dans le ProgRockDiffusion gourmand en VRAM) est sur le point de fournir cette fonctionnalitÃĐ Ã  la branche principale bientÃīt. Alors que txt2imghd est une porte dÃĐdiÃĐe de GOBIG, d’autres efforts des dÃĐveloppeurs de la communautÃĐ impliquent diffÃĐrentes implÃĐmentations de GOBIG.

Une image abstraite pratique dans le rendu d'origine 512x512px (à gauche et deuxiÃĻme à gauche); mise à l'ÃĐchelle par ESGRAN, qui est maintenant plus ou moins native dans toutes les distributions de Stable Diffusion; et donnÃĐ une 'attention spÃĐciale' via une implÃĐmentation de GOBIG, produisant des dÃĐtails qui, au moins dans les limites de la section d'image, semblent mieux mis à l'ÃĐchelle. Source: https://old.reddit.com/r/StableDiffusion/comments/x72460/stable_diffusion_gobig_txt2imghd_easy_mode_colab/

Une image abstraite pratique dans le rendu d’origine 512x512px (à gauche et deuxiÃĻme à gauche); mise à l’ÃĐchelle par ESGRAN, qui est maintenant plus ou moins native dans toutes les distributions de Stable Diffusion; et donnÃĐ une ‘attention spÃĐciale’ via une implÃĐmentation de GOBIG, produisant des dÃĐtails qui, au moins dans les limites de la section d’image, semblent mieux mis à l’ÃĐchelle. Source: https://old.reddit.com/r/StableDiffusion/comments/x72460/stable_diffusion_gobig_txt2imghd_easy_mode_colab/

Le type d’exemple abstrait prÃĐsentÃĐ ci-dessus a de nombreux ÂŦ petits royaumes Âŧ de dÃĐtails qui conviennent à cette approche solipsiste de mise à l’ÃĐchelle, mais qui peuvent nÃĐcessiter des solutions de code plus complexes pour produire une mise à l’ÃĐchelle non rÃĐpÃĐtitive et cohÃĐrente qui ne ressemble pas à avoir ÃĐtÃĐ assemblÃĐe à partir de nombreuses parties. Pas moins, dans le cas des visages humains, oÃđ nous sommes inhabituellement sensibles aux aberrations ou aux ÂŦ artefacts choquants Âŧ.

Par consÃĐquent, les visages pourraient ÃĐventuellement nÃĐcessiter une solution dÃĐdiÃĐe.

Stable Diffusion n’a actuellement aucun mÃĐcanisme pour se concentrer sur le visage pendant un rendu de la mÊme maniÃĻre que les humains priorisent les informations faciales. Bien que certains dÃĐveloppeurs dans les communautÃĐs Discord envisagent des mÃĐthodes pour mettre en œuvre ce type d’ÂŦ attention amÃĐliorÃĐe Âŧ, il est actuellement beaucoup plus facile de renforcer manuellement (et, ÃĐventuellement, automatiquement) le visage aprÃĻs que le rendu initial ait eu lieu.

Un visage humain a une logique sÃĐmantique interne et complÃĻte qui ne sera pas trouvÃĐe dans une ÂŦ tuile Âŧ de l’angle infÃĐrieur d’un bÃĒtiment, par exemple, et il est donc actuellement possible de ÂŦ zoomer Âŧ et de rendre à nouveau un visage ÂŦ esquissÃĐ Âŧ dans la sortie de Stable Diffusion.

À gauche, la premiÃĻre tentative de Stable Diffusion avec la invite 'Photo en couleurs de Christina Hendricks entrant dans un endroit bondÃĐ, portant un impermÃĐable; Canon50, contact visuel, dÃĐtails ÃĐlevÃĐs, dÃĐtails faciaux ÃĐlevÃĐs'. À droite, un visage amÃĐliorÃĐ obtenu en alimentant le visage flou et esquissÃĐ du premier rendu dans l'attention complÃĻte de Stable Diffusion à l'aide d'Img2Img (voir les images animÃĐes ci-dessous).

À gauche, la premiÃĻre tentative de Stable Diffusion avec la invite ‘Photo en couleurs de Christina Hendricks entrant dans un endroit bondÃĐ, portant un impermÃĐable; Canon50, contact visuel, dÃĐtails ÃĐlevÃĐs, dÃĐtails faciaux ÃĐlevÃĐs’. À droite, un visage amÃĐliorÃĐ obtenu en alimentant le visage flou et esquissÃĐ du premier rendu dans l’attention complÃĻte de Stable Diffusion à l’aide d’Img2Img (voir les images animÃĐes ci-dessous).

Dans l’absence d’une solution de renversement textuel dÃĐdiÃĐe (voir ci-dessous), cela ne fonctionnera que pour les images de cÃĐlÃĐbritÃĐs oÃđ la personne en question est dÃĐjà bien reprÃĐsentÃĐe dans les sous-ensembles de donnÃĐes LAION qui ont formÃĐ Stable Diffusion. Par consÃĐquent, cela fonctionnera pour des personnes comme Tom Cruise, Brad Pitt, Jennifer Lawrence, et une gamme limitÃĐe de vÃĐritables cÃĐlÃĐbritÃĐs mÃĐdiatiques prÃĐsentes en grand nombre dans les donnÃĐes sources.

GÃĐnÃĐration d'une photo de presse plausible avec la invite 'Photo en couleurs de Christina Hendricks entrant dans un endroit bondÃĐ, portant un impermÃĐable; Canon50, contact visuel, dÃĐtails ÃĐlevÃĐs, dÃĐtails faciaux ÃĐlevÃĐs'.

GÃĐnÃĐration d’une photo de presse plausible avec la invite ‘Photo en couleurs de Christina Hendricks entrant dans un endroit bondÃĐ, portant un impermÃĐable; Canon50, contact visuel, dÃĐtails ÃĐlevÃĐs, dÃĐtails faciaux ÃĐlevÃĐs’.

Pour les cÃĐlÃĐbritÃĐs ayant des carriÃĻres longues et durables, Stable Diffusion gÃĐnÃĐrera gÃĐnÃĐralement une image de la personne à un ÃĒge rÃĐcent (c’est-à-dire plus ÃĒgÃĐ), et il sera nÃĐcessaire d’ajouter des invites annexes telles que ‘jeune’ ou ‘dans l’annÃĐe [YEAR]’ pour produire des images plus jeunes.

Avec une carriÃĻre importante et constante s'ÃĐtalant sur prÃĻs de 40 ans, l'actrice Jennifer Connelly est l'une des rares cÃĐlÃĐbritÃĐs de LAION qui permettent à Stable Diffusion de reprÃĐsenter une gamme d'ÃĒges. Source: prÃĐpack Stable Diffusion, local, point de contrÃīle v1.4; invites liÃĐes à l'ÃĒge.

Avec une carriÃĻre importante et constante s’ÃĐtalant sur prÃĻs de 40 ans, l’actrice Jennifer Connelly est l’une des rares cÃĐlÃĐbritÃĐs de LAION qui permettent à Stable Diffusion de reprÃĐsenter une gamme d’ÃĒges. Source: prÃĐpack Stable Diffusion, local, point de contrÃīle v1.4; invites liÃĐes à l’ÃĒge.

Ceci est largement dÃŧ à la prolifÃĐration de la photographie de presse numÃĐrique (plutÃīt qu’à base d’ÃĐmulsion) à partir du milieu des annÃĐes 2000, et à la croissance ultÃĐrieure du volume de sortie d’images due à l’augmentation des vitesses de bande passante.

L'image rendue est passÃĐe à Img2Img dans Stable Diffusion, oÃđ une 'zone de concentration' est sÃĐlectionnÃĐe, et un nouveau rendu de taille maximale est rÃĐalisÃĐ uniquement pour cette zone, permettant à Stable Diffusion de concentrer toutes les ressources disponibles sur la recrÃĐation du visage.

L’image rendue est passÃĐe à Img2Img dans Stable Diffusion, oÃđ une ‘zone de concentration’ est sÃĐlectionnÃĐe, et un nouveau rendu de taille maximale est rÃĐalisÃĐ uniquement pour cette zone, permettant à Stable Diffusion de concentrer toutes les ressources disponibles sur la recrÃĐation du visage.

Composition du visage à 'haute attention' dans le rendu d'origine. Outre les visages, ce processus ne fonctionnera qu'avec des entitÃĐs qui ont une apparence cohÃĐrente et intÃĐgrale potentielle, telle qu'une partie de la photo d'origine qui a un objet distinct, tel qu'une montre ou une voiture. La mise à l'ÃĐchelle d'une section d'un mur, par exemple, entraÃŪnera un mur rÃĐassemblÃĐ ayant une apparence trÃĻs ÃĐtrange, car les rendus de tuiles n'avaient pas de contexte plus large pour cette 'piÃĻce de puzzle' lorsqu'ils ÃĐtaient en cours de rendu.

Composition du visage à ‘haute attention’ dans le rendu d’origine. Outre les visages, ce processus ne fonctionnera qu’avec des entitÃĐs qui ont une apparence cohÃĐrente et intÃĐgrale potentielle, telle qu’une partie de la photo d’origine qui a un objet distinct, tel qu’une montre ou une voiture. La mise à l’ÃĐchelle d’une section d’un mur, par exemple, entraÃŪnera un mur rÃĐassemblÃĐ ayant une apparence trÃĻs ÃĐtrange, car les rendus de tuiles n’avaient pas de contexte plus large pour cette ‘piÃĻce de puzzle’ lorsqu’ils ÃĐtaient en cours de rendu.

Certaines cÃĐlÃĐbritÃĐs de la base de donnÃĐes sont ‘prÃĐ-congelÃĐes’ dans le temps, soit parce qu’elles sont dÃĐcÃĐdÃĐes tÃīt (comme Marilyn Monroe), soit parce qu’elles ont connu une popularitÃĐ ÃĐphÃĐmÃĻre, produisant un grand volume d’images pendant une pÃĐriode limitÃĐe. L’interrogation de Stable Diffusion fournit probablement un indice de popularitÃР‘actuel’ pour les stars modernes et anciennes. Pour certaines cÃĐlÃĐbritÃĐs plus ÃĒgÃĐes ou actuelles, il n’y a pas suffisamment d’images dans les donnÃĐes sources pour obtenir une ressemblance trÃĻs bonne, tandis que la popularitÃĐ durable de certaines stars dÃĐcÃĐdÃĐes ou ÃĐclipsÃĐes garantit que leur ressemblance raisonnable peut Être obtenue à partir du systÃĻme.

Les rendus de Stable Diffusion rÃĐvÃĻlent rapidement quels visages cÃĐlÃĻbres sont bien reprÃĐsentÃĐs dans les donnÃĐes d'entraÃŪnement. MalgrÃĐ sa popularitÃĐ ÃĐnorme en tant qu'adolescente plus ÃĒgÃĐe au moment de l'ÃĐcriture, Millie Bobby Brown ÃĐtait plus jeune et moins connue lorsque les jeux de donnÃĐes sources LAION ont ÃĐtÃĐ rÃĐcupÃĐrÃĐs sur le Web, ce qui rend difficile l'obtention d'une ressemblance de haute qualitÃĐ avec Stable Diffusion pour le moment.

Les rendus de Stable Diffusion rÃĐvÃĻlent rapidement quels visages cÃĐlÃĻbres sont bien reprÃĐsentÃĐs dans les donnÃĐes d’entraÃŪnement. MalgrÃĐ sa popularitÃĐ ÃĐnorme en tant qu’adolescente plus ÃĒgÃĐe au moment de l’ÃĐcriture, Millie Bobby Brown ÃĐtait plus jeune et moins connue lorsque les jeux de donnÃĐes sources LAION ont ÃĐtÃĐ rÃĐcupÃĐrÃĐs sur le Web, ce qui rend difficile l’obtention d’une ressemblance de haute qualitÃĐ avec Stable Diffusion pour le moment.

Lorsque les donnÃĐes sont disponibles, les solutions de mise à l’ÃĐchelle basÃĐes sur des tuiles dans Stable Diffusion pourraient aller plus loin que la concentration sur le visage: elles pourraient potentiellement permettre des visages plus prÃĐcis et plus dÃĐtaillÃĐs en dÃĐcomposant les caractÃĐristiques faciales et en faisant appel à l’ensemble des ressources locales de GPU sur les caractÃĐristiques saillantes individuellement, avant de les rÃĐassembler – un processus qui est actuellement, à nouveau, manuel.

Ceci n’est pas limitÃĐ aux visages, mais est limitÃĐ aux parties d’objets qui sont au moins aussi bien placÃĐes dans le contexte plus large de l’objet hÃīte, et qui sont conformes à des embeddings de haut niveau que l’on pourrait raisonnablement s’attendre à trouver dans un jeu de donnÃĐes à grande ÃĐchelle.

La vÃĐritable limite est la quantitÃĐ de donnÃĐes de rÃĐfÃĐrence disponibles dans le jeu de donnÃĐes, car, ÃĐventuellement, des dÃĐtails fortement itÃĐrÃĐs deviendront complÃĻtement ÂŦ hallucinÃĐs Âŧ (c’est-à-dire fictifs) et moins authentiques.

Une telle mise à l’ÃĐchelle granulaire fonctionne dans le cas de Jennifer Connelly, car elle est bien reprÃĐsentÃĐe à travers une gamme d’ÃĒges dans LAION-aesthetics (le sous-ensemble principal de LAION 5B que Stable Diffusion utilise); dans de nombreux autres cas, la prÃĐcision souffrirait d’un manque de donnÃĐes, nÃĐcessitant soit une fine-tuning (une formation supplÃĐmentaire, voir ÂŦ Customisation Âŧ ci-dessous), soit une inversion textuelle (voir ci-dessous).

Les tuiles sont un moyen puissant et relativement peu coÃŧteux pour que Stable Diffusion puisse produire des sorties haute rÃĐsolution, mais la mise à l’ÃĐchelle algorithmique des tuiles de cette maniÃĻre, si elle manque d’un mÃĐcanisme d’attention plus large et de niveau supÃĐrieur, peut ne pas atteindre les normes espÃĐrÃĐes sur une gamme de types de contenu.

2: RÃĐsolution des problÃĻmes avec les membres humains

Stable Diffusion ne correspond pas à son nom lorsqu’il s’agit de dÃĐpeindre la complexitÃĐ des extrÃĐmitÃĐs humaines. Les mains peuvent se multiplier alÃĐatoirement, les doigts se confondent, un troisiÃĻme membre apparaÃŪt sans prÃĐvenir, et les membres existants disparaissent sans laisser de trace. Pour sa dÃĐfense, Stable Diffusion partage le problÃĻme avec ses compagnons de route, et probablement avec DALL-E 2.

RÃĐsultats non ÃĐditÃĐs de DALL-E 2 et Stable Diffusion (1.4) à la fin aoÃŧt 2022, montrant tous deux des problÃĻmes avec les membres. Invite est 'Une femme embrassant un homme'

RÃĐsultats non ÃĐditÃĐs de DALL-E 2 et Stable Diffusion (1.4) à la fin aoÃŧt 2022, montrant tous deux des problÃĻmes avec les membres. Invite est ‘Une femme embrassant un homme’

Les fans de Stable Diffusion qui espÃĻrent que le point de contrÃīle 1.5 à venir (une version plus intensivement formÃĐe du modÃĻle, avec des paramÃĻtres amÃĐliorÃĐs) rÃĐsoudra le problÃĻme des membres sont susceptibles d’Être dÃĐçus. Le nouveau modÃĻle, qui sera publiÃĐ dans environ deux semaines, est actuellement prÃĐsentÃĐ sur le portail commercial stability.ai DreamStudio, qui utilise 1.5 par dÃĐfaut, et oÃđ les utilisateurs peuvent comparer la nouvelle sortie avec des rendus de leurs systÃĻmes locaux ou d’autres systÃĻmes 1.4:

Source: PrÃĐpack local 1.4 et https://beta.dreamstudio.ai/

Source: PrÃĐpack local 1.4 et https://beta.dreamstudio.ai/

Source: PrÃĐpack local 1.4 et https://beta.dreamstudio.ai/

Source: PrÃĐpack local 1.4 et https://beta.dreamstudio.ai/

Source: PrÃĐpack local 1.4 et https://beta.dreamstudio.ai/

Source: PrÃĐpack local 1.4 et https://beta.dreamstudio.ai/

Comme c’est souvent le cas, la qualitÃĐ des donnÃĐes pourrait bien Être la cause principale.

Les bases de donnÃĐes open source qui alimentent les systÃĻmes de synthÃĻse d’images tels que Stable Diffusion et DALL-E 2 sont capables de fournir de nombreuses ÃĐtiquettes pour les humains individuels et les actions inter-humaines. Ces ÃĐtiquettes sont formÃĐes de maniÃĻre symbiotique avec les images associÃĐes, ou des segments d’images.

Les utilisateurs de Stable Diffusion peuvent explorer les concepts formÃĐs dans le modÃĻle en interrogeant le jeu de donnÃĐes LAION-aesthetics, un sous-ensemble du jeu de donnÃĐes LAION 5B plus large, qui alimente le systÃĻme. Les images sont classÃĐes non par leurs ÃĐtiquettes alphabÃĐtiques, mais par leur 'score esthÃĐtique'. Source: https://rom1504.github.io/clip-retrieval/

Les utilisateurs de Stable Diffusion peuvent explorer les concepts formÃĐs dans le modÃĻle en interrogeant le jeu de donnÃĐes LAION-aesthetics, un sous-ensemble du jeu de donnÃĐes LAION 5B plus large, qui alimente le systÃĻme. Les images sont classÃĐes non par leurs ÃĐtiquettes alphabÃĐtiques, mais par leur ‘score esthÃĐtique’. Source: https://rom1504.github.io/clip-retrieval/

Une bonne hiÃĐrarchie d’ÃĐtiquettes individuelles et de classes contribuant à la reprÃĐsentation d’un bras humain serait quelque chose comme corps>bras>main>doigts>[sous-doigts + pouce]> [segments de doigts]>Ongles.

Segmentation sÃĐmantique granulaire des parties d'une main. MÊme cette dÃĐconstruction inhabituellement dÃĐtaillÃĐe laisse chaque 'doigt' comme une entitÃĐ unique, sans tenir compte des trois sections d'un doigt et des deux sections d'un pouce Source: https://athitsos.utasites.cloud/publications/rezaei_petra2021.pdf

Segmentation sÃĐmantique granulaire des parties d’une main. MÊme cette dÃĐconstruction inhabituellement dÃĐtaillÃĐe laisse chaque ‘doigt’ comme une entitÃĐ unique, sans tenir compte des trois sections d’un doigt et des deux sections d’un pouce. Source: https://athitsos.utasites.cloud/publications/rezaei_petra2021.pdf

Dans la rÃĐalitÃĐ, les images sources sont peu susceptibles d’Être ÃĐtiquetÃĐes de maniÃĻre aussi cohÃĐrente dans l’ensemble du jeu de donnÃĐes, et les algorithmes d’ÃĐtiquetage non supervisÃĐs s’arrÊteront probablement au niveau supÃĐrieur de – par exemple – ‘main’, et laisseront les pixels intÃĐrieurs (qui contiennent techniquement des informations sur les doigts) comme une masse non ÃĐtiquetÃĐe de pixels à partir de laquelle des fonctionnalitÃĐs seront arbitrairement dÃĐrivÃĐes, et qui peuvent se manifester dans les rendus ultÃĐrieurs comme un ÃĐlÃĐment choquant.

Ce que cela devrait Être (en haut à droite, si ce n'est en haut de coupe), et ce que cela tend à Être (en bas à droite), en raison de ressources limitÃĐes pour l'ÃĐtiquetage, ou d'exploitation architecturale de ces ÃĐtiquettes si elles existent dans le jeu de donnÃĐes.

Ce que cela devrait Être (en haut à droite, si ce n’est en haut de coupe), et ce que cela tend à Être (en bas à droite), en raison de ressources limitÃĐes pour l’ÃĐtiquetage, ou d’exploitation architecturale de ces ÃĐtiquettes si elles existent dans le jeu de donnÃĐes.

Ainsi, si un modÃĻle de diffusion latente parvient à rendre un bras, il est presque certain qu’il essayera de rendre une main à l’extrÃĐmitÃĐ de ce bras, car bras>main est la hiÃĐrarchie minimale requise, assez haut dans ce que l’architecture sait sur l’ÂŦ anatomie humaine Âŧ.

AprÃĻs cela, les ‘doigts’ peuvent Être le plus petit regroupement, mÊme s’il y a 14 sous-parties de doigts/pouces supplÃĐmentaires à considÃĐrer lors de la reprÃĐsentation des mains humaines.

Si cette thÃĐorie tient, il n’y a pas de vÃĐritable remÃĻde, en raison du manque de budget sectoriel pour l’ÃĐtiquetage manuel, et du manque d’algorithmes suffisamment efficaces qui pourraient automatiser l’ÃĐtiquetage tout en produisant des taux d’erreur faibles. En effet, le modÃĻle peut actuellement s’appuyer sur la cohÃĐrence anatomique humaine pour masquer les lacunes du jeu de donnÃĐes sur lequel il a ÃĐtÃĐ formÃĐ.

Une raison possible pour laquelle il ne peut pas s’appuyer sur cela, rÃĐcemment proposÃĐe sur le Discord de Stable Diffusion, est que le modÃĻle pourrait Être confus quant au nombre correct de doigts qu’une main humaine (rÃĐaliste) devrait avoir, car la base de donnÃĐes dÃĐrivÃĐe de LAION qui alimente le modÃĻle prÃĐsente des personnages de dessin animÃĐ qui peuvent avoir moins de doigts (ce qui est en soi une astuce pour gagner du temps).

Deux des coupables potentiels du 'syndrome des doigts manquants' dans Stable Diffusion et des modÃĻles similaires. En bas, des exemples de mains de dessin animÃĐ Ã  partir du jeu de donnÃĐes LAION-aesthetics qui alimente Stable Diffusion. Source: https://www.youtube.com/watch?v=0QZFQ3gbd6I

Deux des coupables potentiels du ‘syndrome des doigts manquants’ dans Stable Diffusion et des modÃĻles similaires. En bas, des exemples de mains de dessin animÃĐ Ã  partir du jeu de donnÃĐes LAION-aesthetics qui alimente Stable Diffusion. Source: https://www.youtube.com/watch?v=0QZFQ3gbd6I

Si cela est vrai, alors la seule solution ÃĐvidente est de reformer le modÃĻle, en excluant le contenu humain non rÃĐaliste – en s’assurant que les cas rÃĐels d’omission (c’est-à-dire les amputÃĐs) sont ÃĐtiquetÃĐs comme des exceptions. D’un point de vue de curation de donnÃĐes, cela serait un dÃĐfi considÃĐrable, en particulier pour les efforts communautaires à ressources limitÃĐes.

La deuxiÃĻme approche consisterait à appliquer des filtres qui excluent un tel contenu (c’est-à-dire ‘main avec trois/cinq doigts’) de se manifester au moment du rendu, de la mÊme maniÃĻre que OpenAI a, dans une certaine mesure, filtrÃĐ GPT-3 et DALL-E 2, afin que leur sortie puisse Être rÃĐglementÃĐe sans avoir besoin de reformer les modÃĻles sources.

Pour Stable Diffusion, la distinction sÃĐmantique entre les doigts et mÊme les membres peut devenir horriblement floue, ÃĐvoquant le courant 'body horror' des films d'horreur des annÃĐes 80 de la part de rÃĐalisateurs comme David Cronenberg. Source: https://old.reddit.com/r/StableDiffusion/comments/x6htf6/a_study_of_stable_diffusions_strange_relationship/

Pour Stable Diffusion, la distinction sÃĐmantique entre les doigts et mÊme les membres peut devenir horriblement floue, ÃĐvoquant le courant ‘body horror’ des films d’horreur des annÃĐes 80 de la part de rÃĐalisateurs comme David Cronenberg. Source: https://old.reddit.com/r/StableDiffusion/comments/x6htf6/a_study_of_stable_diffusions_strange_relationship/

Cependant, à nouveau, cela nÃĐcessiterait des ÃĐtiquettes qui n’existent peut-Être pas sur toutes les images affectÃĐes, laissant nous avec le mÊme dÃĐfi logistique et budgÃĐtaire.

Il pourrait Être argumentÃĐ qu’il existe deux routes à suivre: jeter plus de donnÃĐes dans le problÃĻme, et appliquer des systÃĻmes interprÃĐtatifs tiers qui peuvent intervenir lorsque des erreurs physiques de ce type sont prÃĐsentÃĐes à l’utilisateur final (au moins, cela donnerait à OpenAI un moyen de fournir des remboursements pour des rendus ‘d’horreur corporelle’, si l’entreprise ÃĐtait motivÃĐe pour le faire).

3: Personnalisation

L’une des possibilitÃĐs les plus excitantes pour l’avenir de Stable Diffusion est la perspective de dÃĐvelopper des systÃĻmes rÃĐvisÃĐs; des modifications qui permettent d’intÃĐgrer du contenu en dehors de la sphÃĻre LAION prÃĐformÃĐe dans le systÃĻme – idÃĐalement sans l’expense ingÃĐrable de former à nouveau l’ensemble du modÃĻle, ou le risque encouru lors de la formation d’un grand volume d’images nouvelles à un modÃĻle existant, mature et capable.

Par analogie: si deux ÃĐlÃĻves moins douÃĐs rejoignent une classe avancÃĐe de trente ÃĐlÃĻves, ils s’assimileront et rattraperont, ou ÃĐchoueront en tant qu’exceptions; dans les deux cas, la performance moyenne de la classe ne sera probablement pas affectÃĐe. Si 15 ÃĐlÃĻves moins douÃĐs rejoignent, cependant, la courbe de notation de l’ensemble de la classe est susceptible de souffrir.

De mÊme, le rÃĐseau synergique et relativement dÃĐlicat de relations qui se construisent au fil d’une formation de modÃĻle prolongÃĐe et coÃŧteuse peut Être compromis, voire dÃĐtruit, par de nouvelles donnÃĐes excessives, ce qui abaisse la qualitÃĐ de sortie du modÃĻle dans l’ensemble.

L’argument en faveur de cela est principalement là oÃđ votre intÃĐrÊt rÃĐside dans le dÃĐtournement complet de la comprÃĐhension conceptuelle du modÃĻle de relations et de choses, et dans l’exploitation de celle-ci pour la production exclusive de contenu similaire au matÃĐriel supplÃĐmentaire que vous avez ajoutÃĐ.

Ainsi, former 500 000 cadres de The Simpsons dans un point de contrÃīle Stable Diffusion existant est susceptible, ÃĐventuellement, de vous donner un meilleur simulateur de The Simpsons que le modÃĻle d’origine n’aurait pu offrir, en supposant que suffisamment de relations sÃĐmantiques gÃĐnÃĐrales survivent au processus (c’est-à-dire Homer Simpson mangeant un hot-dog, qui peut nÃĐcessiter du matÃĐriel sur les hot-dogs qui n’ÃĐtait pas dans votre matÃĐriel supplÃĐmentaire, mais qui existait dÃĐjà dans le point de contrÃīle), et en supposant que vous ne voulez pas soudainement passer du contenu The Simpsons à la crÃĐation de paysage fabuleux par Greg Rutkowski – car votre modÃĻle post-formÃĐ a vu son attention massivement dÃĐtournÃĐe, et ne sera pas aussi bon pour faire ce type de chose qu’il l’ÃĐtait auparavant.

Un exemple notable de ceci est waifu-diffusion, qui a rÃĐussi à former à posteriori 56 000 images d’anime dans un point de contrÃīle Stable Diffusion formÃĐ et complet. C’est une perspective difficile pour un amateur, cependant, puisque le modÃĻle nÃĐcessite un minimum de 30 Go de VRAM, loin de ce qui est susceptible d’Être disponible au niveau consommateur dans les prochaines sorties de la sÃĐrie 40XX de NVIDIA.

La formation de contenu personnalisÃĐ dans Stable Diffusion: le modÃĻle a pris deux semaines de post-formation pour produire ce niveau d'illustration. Les six images à gauche montrent la progression du modÃĻle dans la production de sortie cohÃĐrente basÃĐe sur les nouvelles donnÃĐes de formation. Source: https://gigazine.net/gsc_news/en/20220121-how-waifu-labs-create/

La formation de contenu personnalisÃĐ dans Stable Diffusion via waifu-diffusion: le modÃĻle a pris deux semaines de post-formation pour produire ce niveau d’illustration. Les six images à gauche montrent la progression du modÃĻle, à mesure que la formation se poursuit, dans la production de sortie cohÃĐrente basÃĐe sur les nouvelles donnÃĐes de formation. Source: https://gigazine.net/gsc_news/en/20220121-how-waifu-labs-create/

Un grand effort pourrait Être dÃĐpensÃĐ sur ces ÂŦ fourches Âŧ de points de contrÃīle Stable Diffusion, seulement pour Être entravÃĐ par la dette technique. Les dÃĐveloppeurs du Discord officiel ont dÃĐjà indiquÃĐ que les versions de point de contrÃīle ultÃĐrieures ne seront pas nÃĐcessairement compatibles descendantes, mÊme avec la logique d’invite qui a pu fonctionner avec une version prÃĐcÃĐdente, puisque leur intÃĐrÊt principal est d’obtenir le meilleur modÃĻle possible, plutÃīt que de supporter les applications et les processus hÃĐritÃĐs.

Par consÃĐquent, une entreprise ou un individu qui dÃĐcide de crÃĐer une fourche d’un point de contrÃīle dans un produit commercial s’engage effectivement sans retour en arriÃĻre; leur version du modÃĻle est, à ce stade, une ÂŦ fourche dure Âŧ, et ne pourra pas tirer parti des avantages en amont des versions ultÃĐrieures de stability.ai – ce qui est un engagement considÃĐrable.

L’espoir actuel, et plus grand, pour la personnalisation de Stable Diffusion est l’inversion textuelle, oÃđ l’utilisateur forme une poignÃĐe d’images CLIP alignÃĐes.

Une collaboration entre l'UniversitÃĐ de Tel Aviv et NVIDIA, l'inversion textuelle permet la formation de entitÃĐs discrÃĻtes et nouvelles, sans dÃĐtruire les capacitÃĐs du modÃĻle source. Source: https://textual-inversion.github.io/

Une collaboration entre l’UniversitÃĐ de Tel Aviv et NVIDIA, l’inversion textuelle permet la formation de entitÃĐs discrÃĻtes et nouvelles, sans dÃĐtruire les capacitÃĐs du modÃĻle source. Source: https://textual-inversion.github.io/

La principale limitation apparente de l’inversion textuelle est qu’un trÃĻs petit nombre d’images est recommandÃР– autant que cinq. Cela produit essentiellement une entitÃĐ limitÃĐe qui peut Être plus utile pour les tÃĒches de transfert de style que pour l’insertion d’objets photorÃĐalistes.

Cependant, des expÃĐriences sont actuellement en cours dans les divers Discords de Stable Diffusion qui utilisent un nombre beaucoup plus ÃĐlevÃĐ d’images de formation, et il reste à voir combien cette mÃĐthode peut Être productive. À nouveau, la technique nÃĐcessite une grande quantitÃĐ de VRAM, de temps et de patience.

En raison de ces facteurs limitants, nous devrons peut-Être attendre un certain temps pour voir certains des expÃĐriences d’inversion textuelle les plus sophistiquÃĐes de la part des enthousiastes de Stable Diffusion – et pour savoir si cette approche peut ÂŦ vous mettre dans l’image Âŧ d’une maniÃĻre qui ressemble plus à une meilleure mise à l’ÃĐchelle qu’une copie-collage Photoshop, tout en conservant la fonctionnalitÃĐ ÃĐtonnante des points de contrÃīle officiels.

 

PubliÃĐ pour la premiÃĻre fois le 6 septembre 2022.

Écrivain sur l'apprentissage automatique, spÃĐcialiste du domaine de la synthÃĻse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]