Angle dâAnderson
Trois dÃĐfis à relever pour Stable Diffusion

La sortie du modÃĻle de synthÃĻse dâimages de diffusion latente Stable Diffusion de stability.ai il y a quelques semaines peut Être lâune des divulgations technologiques les plus importantes depuis DeCSS en 1999; câest certainement le plus grand ÃĐvÃĐnement dans lâhistoire des images gÃĐnÃĐrÃĐes par lâIA depuis le code de deepfakes de 2017 qui a ÃĐtÃĐ copiÃĐ sur GitHub et forkÃĐ pour devenir DeepFaceLab et FaceSwap, ainsi que le logiciel de diffusion de deepfakes en temps rÃĐel DeepFaceLive.
En un seul coup, la frustration des utilisateurs face aux restrictions de contenu dans lâAPI de synthÃĻse dâimages DALL-E 2 ont ÃĐtÃĐ balayÃĐes, car il sâest avÃĐrÃĐ que le filtre NSFW de Stable Diffusion pouvait Être dÃĐsactivÃĐ en modifiant une seule ligne de code. Les Reddit de Stable Diffusion axÃĐs sur la pornographie ont surgi presque immÃĐdiatement, et ont ÃĐtÃĐ rapidement supprimÃĐs, tandis que les dÃĐveloppeurs et les utilisateurs se sont divisÃĐs sur Discord en communautÃĐs officielles et NSFW, et que Twitter a commencÃĐ Ã se remplir de crÃĐations fantastiques de Stable Diffusion.
Actuellement, chaque jour apporte une nouvelle innovation incroyable des dÃĐveloppeurs qui ont adoptÃĐ le systÃĻme, avec des plugins et des ajouts tiers ÃĐcrits à la hÃĒte pour Krita, Photoshop, Cinema4D, Blender, et de nombreuses autres plateformes dâapplications.
Entre-temps, promptcraft â lâart professionnel de ÂŦ chuchotage à lâIA Âŧ, qui peut finir par Être la carriÃĻre la plus courte depuis ÂŦ relieur Filofax Âŧ â est dÃĐjà en train de devenir commercialisÃĐ, tandis que la premiÃĻre monÃĐtisation de Stable Diffusion a lieu au niveau Patreon, avec la certitude de propositions plus sophistiquÃĐes à venir, pour ceux qui ne veulent pas naviguer dans des installations basÃĐes sur Conda du code source, ou les filtres NSFW prescrits des implÃĐmentations basÃĐes sur le Web.
Le rythme de dÃĐveloppement et la libertÃĐ dâexploration des utilisateurs progressent à une vitesse si vertigineuse quâil est difficile de voir trÃĻs loin à lâavance. Essentiellement, nous ne savons pas exactement à quoi nous avons affaire pour le moment, ou quels pourraient Être les limites ou les possibilitÃĐs.
NÃĐanmoins, examinons trois des dÃĐfis les plus intÃĐressants et les plus difficiles que la communautÃĐ Stable Diffusion, rapidement formÃĐe et en pleine croissance, devra relever et, espÃĐrons-le, surmonter.
1: Optimisation des pipelines basÃĐs sur des tuiles
PrÃĐsentÃĐ avec des ressources matÃĐrielles limitÃĐes et des limites strictes sur la rÃĐsolution des images dâentraÃŪnement, il est probable que les dÃĐveloppeurs trouveront des solutions pour amÃĐliorer à la fois la qualitÃĐ et la rÃĐsolution de la sortie de Stable Diffusion. Beaucoup de ces projets impliqueront lâexploitation des limites du systÃĻme, comme sa rÃĐsolution native de seulement 512Ã512 pixels.
Comme câest toujours le cas avec les initiatives de vision par ordinateur et de synthÃĻse dâimages, Stable Diffusion a ÃĐtÃĐ formÃĐ sur des images à ratio carrÃĐ, dans ce cas, rÃĐÃĐchantillonnÃĐes à 512Ã512, afin que les images sources puissent Être rÃĐgularisÃĐes et puissent rentrer dans les contraintes des GPU qui ont formÃĐ le modÃĻle.
Par consÃĐquent, Stable Diffusion ÂŦ pense Âŧ (si cela pense du tout) en termes de 512Ã512, et certainement en termes carrÃĐs. De nombreux utilisateurs qui testent actuellement les limites du systÃĻme rapportent que Stable Diffusion produit les rÃĐsultats les plus fiables et les moins de glitches à ce ratio dâaspect plutÃīt contraint (voir ÂŦ lâadressage des extrÃĐmitÃĐs Âŧ ci-dessous).
Bien que diverses implÃĐmentations prÃĐsentent une mise à lâÃĐchelle via RealESRGAN (et peuvent corriger les visages mal rendus via GFPGAN) plusieurs utilisateurs dÃĐveloppent actuellement des mÃĐthodes pour diviser les images en sections de 512x512px et les coudre ensemble pour former des Åuvres composites plus grandes.

Cette image 1024Ã576, une rÃĐsolution habituellement impossible dans un seul rendu de Stable Diffusion, a ÃĐtÃĐ crÃĐÃĐe en copiant et en collant le fichier attention.py Python à partir de la fourchette DoggettX de Stable Diffusion (une version qui met en Åuvre la mise à lâÃĐchelle basÃĐe sur des tuiles) dans une autre fourchette. Source: https://old.reddit.com/r/StableDiffusion/comments/x6yeam/1024x576_with_6gb_nice/
Bien que certaines initiatives de ce type utilisent du code original ou dâautres bibliothÃĻques, la porte txt2imghd de GOBIG (un mode dans le ProgRockDiffusion gourmand en VRAM) est sur le point de fournir cette fonctionnalitÃĐ Ã la branche principale bientÃīt. Alors que txt2imghd est une porte dÃĐdiÃĐe de GOBIG, dâautres efforts des dÃĐveloppeurs de la communautÃĐ impliquent diffÃĐrentes implÃĐmentations de GOBIG.

Une image abstraite pratique dans le rendu dâorigine 512x512px (à gauche et deuxiÃĻme à gauche); mise à lâÃĐchelle par ESGRAN, qui est maintenant plus ou moins native dans toutes les distributions de Stable Diffusion; et donnÃĐ une âattention spÃĐcialeâ via une implÃĐmentation de GOBIG, produisant des dÃĐtails qui, au moins dans les limites de la section dâimage, semblent mieux mis à lâÃĐchelle. Source: https://old.reddit.com/r/StableDiffusion/comments/x72460/stable_diffusion_gobig_txt2imghd_easy_mode_colab/
Le type dâexemple abstrait prÃĐsentÃĐ ci-dessus a de nombreux ÂŦ petits royaumes Âŧ de dÃĐtails qui conviennent à cette approche solipsiste de mise à lâÃĐchelle, mais qui peuvent nÃĐcessiter des solutions de code plus complexes pour produire une mise à lâÃĐchelle non rÃĐpÃĐtitive et cohÃĐrente qui ne ressemble pas à avoir ÃĐtÃĐ assemblÃĐe à partir de nombreuses parties. Pas moins, dans le cas des visages humains, oÃđ nous sommes inhabituellement sensibles aux aberrations ou aux ÂŦ artefacts choquants Âŧ.
Par consÃĐquent, les visages pourraient ÃĐventuellement nÃĐcessiter une solution dÃĐdiÃĐe.
Stable Diffusion nâa actuellement aucun mÃĐcanisme pour se concentrer sur le visage pendant un rendu de la mÊme maniÃĻre que les humains priorisent les informations faciales. Bien que certains dÃĐveloppeurs dans les communautÃĐs Discord envisagent des mÃĐthodes pour mettre en Åuvre ce type dâÂŦ attention amÃĐliorÃĐe Âŧ, il est actuellement beaucoup plus facile de renforcer manuellement (et, ÃĐventuellement, automatiquement) le visage aprÃĻs que le rendu initial ait eu lieu.
Un visage humain a une logique sÃĐmantique interne et complÃĻte qui ne sera pas trouvÃĐe dans une ÂŦ tuile Âŧ de lâangle infÃĐrieur dâun bÃĒtiment, par exemple, et il est donc actuellement possible de ÂŦ zoomer Âŧ et de rendre à nouveau un visage ÂŦ esquissÃĐ Âŧ dans la sortie de Stable Diffusion.

à gauche, la premiÃĻre tentative de Stable Diffusion avec la invite âPhoto en couleurs de Christina Hendricks entrant dans un endroit bondÃĐ, portant un impermÃĐable; Canon50, contact visuel, dÃĐtails ÃĐlevÃĐs, dÃĐtails faciaux ÃĐlevÃĐsâ. à droite, un visage amÃĐliorÃĐ obtenu en alimentant le visage flou et esquissÃĐ du premier rendu dans lâattention complÃĻte de Stable Diffusion à lâaide dâImg2Img (voir les images animÃĐes ci-dessous).
Dans lâabsence dâune solution de renversement textuel dÃĐdiÃĐe (voir ci-dessous), cela ne fonctionnera que pour les images de cÃĐlÃĐbritÃĐs oÃđ la personne en question est dÃĐjà bien reprÃĐsentÃĐe dans les sous-ensembles de donnÃĐes LAION qui ont formÃĐ Stable Diffusion. Par consÃĐquent, cela fonctionnera pour des personnes comme Tom Cruise, Brad Pitt, Jennifer Lawrence, et une gamme limitÃĐe de vÃĐritables cÃĐlÃĐbritÃĐs mÃĐdiatiques prÃĐsentes en grand nombre dans les donnÃĐes sources.

GÃĐnÃĐration dâune photo de presse plausible avec la invite âPhoto en couleurs de Christina Hendricks entrant dans un endroit bondÃĐ, portant un impermÃĐable; Canon50, contact visuel, dÃĐtails ÃĐlevÃĐs, dÃĐtails faciaux ÃĐlevÃĐsâ.
Pour les cÃĐlÃĐbritÃĐs ayant des carriÃĻres longues et durables, Stable Diffusion gÃĐnÃĐrera gÃĐnÃĐralement une image de la personne à un ÃĒge rÃĐcent (câest-à -dire plus ÃĒgÃĐ), et il sera nÃĐcessaire dâajouter des invites annexes telles que âjeuneâ ou âdans lâannÃĐe [YEAR]â pour produire des images plus jeunes.

Avec une carriÃĻre importante et constante sâÃĐtalant sur prÃĻs de 40 ans, lâactrice Jennifer Connelly est lâune des rares cÃĐlÃĐbritÃĐs de LAION qui permettent à Stable Diffusion de reprÃĐsenter une gamme dâÃĒges. Source: prÃĐpack Stable Diffusion, local, point de contrÃīle v1.4; invites liÃĐes à lâÃĒge.
Ceci est largement dÃŧ à la prolifÃĐration de la photographie de presse numÃĐrique (plutÃīt quâà base dâÃĐmulsion) à partir du milieu des annÃĐes 2000, et à la croissance ultÃĐrieure du volume de sortie dâimages due à lâaugmentation des vitesses de bande passante.

Lâimage rendue est passÃĐe à Img2Img dans Stable Diffusion, oÃđ une âzone de concentrationâ est sÃĐlectionnÃĐe, et un nouveau rendu de taille maximale est rÃĐalisÃĐ uniquement pour cette zone, permettant à Stable Diffusion de concentrer toutes les ressources disponibles sur la recrÃĐation du visage.

Composition du visage à âhaute attentionâ dans le rendu dâorigine. Outre les visages, ce processus ne fonctionnera quâavec des entitÃĐs qui ont une apparence cohÃĐrente et intÃĐgrale potentielle, telle quâune partie de la photo dâorigine qui a un objet distinct, tel quâune montre ou une voiture. La mise à lâÃĐchelle dâune section dâun mur, par exemple, entraÃŪnera un mur rÃĐassemblÃĐ ayant une apparence trÃĻs ÃĐtrange, car les rendus de tuiles nâavaient pas de contexte plus large pour cette âpiÃĻce de puzzleâ lorsquâils ÃĐtaient en cours de rendu.
Certaines cÃĐlÃĐbritÃĐs de la base de donnÃĐes sont âprÃĐ-congelÃĐesâ dans le temps, soit parce quâelles sont dÃĐcÃĐdÃĐes tÃīt (comme Marilyn Monroe), soit parce quâelles ont connu une popularitÃĐ ÃĐphÃĐmÃĻre, produisant un grand volume dâimages pendant une pÃĐriode limitÃĐe. Lâinterrogation de Stable Diffusion fournit probablement un indice de popularitÃĐ âactuelâ pour les stars modernes et anciennes. Pour certaines cÃĐlÃĐbritÃĐs plus ÃĒgÃĐes ou actuelles, il nây a pas suffisamment dâimages dans les donnÃĐes sources pour obtenir une ressemblance trÃĻs bonne, tandis que la popularitÃĐ durable de certaines stars dÃĐcÃĐdÃĐes ou ÃĐclipsÃĐes garantit que leur ressemblance raisonnable peut Être obtenue à partir du systÃĻme.

Les rendus de Stable Diffusion rÃĐvÃĻlent rapidement quels visages cÃĐlÃĻbres sont bien reprÃĐsentÃĐs dans les donnÃĐes dâentraÃŪnement. MalgrÃĐ sa popularitÃĐ ÃĐnorme en tant quâadolescente plus ÃĒgÃĐe au moment de lâÃĐcriture, Millie Bobby Brown ÃĐtait plus jeune et moins connue lorsque les jeux de donnÃĐes sources LAION ont ÃĐtÃĐ rÃĐcupÃĐrÃĐs sur le Web, ce qui rend difficile lâobtention dâune ressemblance de haute qualitÃĐ avec Stable Diffusion pour le moment.
Lorsque les donnÃĐes sont disponibles, les solutions de mise à lâÃĐchelle basÃĐes sur des tuiles dans Stable Diffusion pourraient aller plus loin que la concentration sur le visage: elles pourraient potentiellement permettre des visages plus prÃĐcis et plus dÃĐtaillÃĐs en dÃĐcomposant les caractÃĐristiques faciales et en faisant appel à lâensemble des ressources locales de GPU sur les caractÃĐristiques saillantes individuellement, avant de les rÃĐassembler â un processus qui est actuellement, à nouveau, manuel.
Ceci nâest pas limitÃĐ aux visages, mais est limitÃĐ aux parties dâobjets qui sont au moins aussi bien placÃĐes dans le contexte plus large de lâobjet hÃīte, et qui sont conformes à des embeddings de haut niveau que lâon pourrait raisonnablement sâattendre à trouver dans un jeu de donnÃĐes à grande ÃĐchelle.
La vÃĐritable limite est la quantitÃĐ de donnÃĐes de rÃĐfÃĐrence disponibles dans le jeu de donnÃĐes, car, ÃĐventuellement, des dÃĐtails fortement itÃĐrÃĐs deviendront complÃĻtement ÂŦ hallucinÃĐs Âŧ (câest-Ã -dire fictifs) et moins authentiques.
Une telle mise à lâÃĐchelle granulaire fonctionne dans le cas de Jennifer Connelly, car elle est bien reprÃĐsentÃĐe à travers une gamme dâÃĒges dans LAION-aesthetics (le sous-ensemble principal de LAION 5B que Stable Diffusion utilise); dans de nombreux autres cas, la prÃĐcision souffrirait dâun manque de donnÃĐes, nÃĐcessitant soit une fine-tuning (une formation supplÃĐmentaire, voir ÂŦ Customisation Âŧ ci-dessous), soit une inversion textuelle (voir ci-dessous).
Les tuiles sont un moyen puissant et relativement peu coÃŧteux pour que Stable Diffusion puisse produire des sorties haute rÃĐsolution, mais la mise à lâÃĐchelle algorithmique des tuiles de cette maniÃĻre, si elle manque dâun mÃĐcanisme dâattention plus large et de niveau supÃĐrieur, peut ne pas atteindre les normes espÃĐrÃĐes sur une gamme de types de contenu.
2: RÃĐsolution des problÃĻmes avec les membres humains
Stable Diffusion ne correspond pas à son nom lorsquâil sâagit de dÃĐpeindre la complexitÃĐ des extrÃĐmitÃĐs humaines. Les mains peuvent se multiplier alÃĐatoirement, les doigts se confondent, un troisiÃĻme membre apparaÃŪt sans prÃĐvenir, et les membres existants disparaissent sans laisser de trace. Pour sa dÃĐfense, Stable Diffusion partage le problÃĻme avec ses compagnons de route, et probablement avec DALL-E 2.

RÃĐsultats non ÃĐditÃĐs de DALL-E 2 et Stable Diffusion (1.4) Ã la fin aoÃŧt 2022, montrant tous deux des problÃĻmes avec les membres. Invite est âUne femme embrassant un hommeâ
Les fans de Stable Diffusion qui espÃĻrent que le point de contrÃīle 1.5 à venir (une version plus intensivement formÃĐe du modÃĻle, avec des paramÃĻtres amÃĐliorÃĐs) rÃĐsoudra le problÃĻme des membres sont susceptibles dâÊtre dÃĐçus. Le nouveau modÃĻle, qui sera publiÃĐ dans environ deux semaines, est actuellement prÃĐsentÃĐ sur le portail commercial stability.ai DreamStudio, qui utilise 1.5 par dÃĐfaut, et oÃđ les utilisateurs peuvent comparer la nouvelle sortie avec des rendus de leurs systÃĻmes locaux ou dâautres systÃĻmes 1.4:

Source: PrÃĐpack local 1.4 et https://beta.dreamstudio.ai/

Source: PrÃĐpack local 1.4 et https://beta.dreamstudio.ai/

Source: PrÃĐpack local 1.4 et https://beta.dreamstudio.ai/
Comme câest souvent le cas, la qualitÃĐ des donnÃĐes pourrait bien Être la cause principale.
Les bases de donnÃĐes open source qui alimentent les systÃĻmes de synthÃĻse dâimages tels que Stable Diffusion et DALL-E 2 sont capables de fournir de nombreuses ÃĐtiquettes pour les humains individuels et les actions inter-humaines. Ces ÃĐtiquettes sont formÃĐes de maniÃĻre symbiotique avec les images associÃĐes, ou des segments dâimages.

Les utilisateurs de Stable Diffusion peuvent explorer les concepts formÃĐs dans le modÃĻle en interrogeant le jeu de donnÃĐes LAION-aesthetics, un sous-ensemble du jeu de donnÃĐes LAION 5B plus large, qui alimente le systÃĻme. Les images sont classÃĐes non par leurs ÃĐtiquettes alphabÃĐtiques, mais par leur âscore esthÃĐtiqueâ. Source: https://rom1504.github.io/clip-retrieval/
Une bonne hiÃĐrarchie dâÃĐtiquettes individuelles et de classes contribuant à la reprÃĐsentation dâun bras humain serait quelque chose comme corps>bras>main>doigts>[sous-doigts + pouce]> [segments de doigts]>Ongles.

Segmentation sÃĐmantique granulaire des parties dâune main. MÊme cette dÃĐconstruction inhabituellement dÃĐtaillÃĐe laisse chaque âdoigtâ comme une entitÃĐ unique, sans tenir compte des trois sections dâun doigt et des deux sections dâun pouce. Source: https://athitsos.utasites.cloud/publications/rezaei_petra2021.pdf
Dans la rÃĐalitÃĐ, les images sources sont peu susceptibles dâÊtre ÃĐtiquetÃĐes de maniÃĻre aussi cohÃĐrente dans lâensemble du jeu de donnÃĐes, et les algorithmes dâÃĐtiquetage non supervisÃĐs sâarrÊteront probablement au niveau supÃĐrieur de â par exemple â âmainâ, et laisseront les pixels intÃĐrieurs (qui contiennent techniquement des informations sur les doigts) comme une masse non ÃĐtiquetÃĐe de pixels à partir de laquelle des fonctionnalitÃĐs seront arbitrairement dÃĐrivÃĐes, et qui peuvent se manifester dans les rendus ultÃĐrieurs comme un ÃĐlÃĐment choquant.

Ce que cela devrait Être (en haut à droite, si ce nâest en haut de coupe), et ce que cela tend à Être (en bas à droite), en raison de ressources limitÃĐes pour lâÃĐtiquetage, ou dâexploitation architecturale de ces ÃĐtiquettes si elles existent dans le jeu de donnÃĐes.
Ainsi, si un modÃĻle de diffusion latente parvient à rendre un bras, il est presque certain quâil essayera de rendre une main à lâextrÃĐmitÃĐ de ce bras, car bras>main est la hiÃĐrarchie minimale requise, assez haut dans ce que lâarchitecture sait sur lâÂŦ anatomie humaine Âŧ.
AprÃĻs cela, les âdoigtsâ peuvent Être le plus petit regroupement, mÊme sâil y a 14 sous-parties de doigts/pouces supplÃĐmentaires à considÃĐrer lors de la reprÃĐsentation des mains humaines.
Si cette thÃĐorie tient, il nây a pas de vÃĐritable remÃĻde, en raison du manque de budget sectoriel pour lâÃĐtiquetage manuel, et du manque dâalgorithmes suffisamment efficaces qui pourraient automatiser lâÃĐtiquetage tout en produisant des taux dâerreur faibles. En effet, le modÃĻle peut actuellement sâappuyer sur la cohÃĐrence anatomique humaine pour masquer les lacunes du jeu de donnÃĐes sur lequel il a ÃĐtÃĐ formÃĐ.
Une raison possible pour laquelle il ne peut pas sâappuyer sur cela, rÃĐcemment proposÃĐe sur le Discord de Stable Diffusion, est que le modÃĻle pourrait Être confus quant au nombre correct de doigts quâune main humaine (rÃĐaliste) devrait avoir, car la base de donnÃĐes dÃĐrivÃĐe de LAION qui alimente le modÃĻle prÃĐsente des personnages de dessin animÃĐ qui peuvent avoir moins de doigts (ce qui est en soi une astuce pour gagner du temps).

Deux des coupables potentiels du âsyndrome des doigts manquantsâ dans Stable Diffusion et des modÃĻles similaires. En bas, des exemples de mains de dessin animÃĐ Ã partir du jeu de donnÃĐes LAION-aesthetics qui alimente Stable Diffusion. Source: https://www.youtube.com/watch?v=0QZFQ3gbd6I
Si cela est vrai, alors la seule solution ÃĐvidente est de reformer le modÃĻle, en excluant le contenu humain non rÃĐaliste â en sâassurant que les cas rÃĐels dâomission (câest-à -dire les amputÃĐs) sont ÃĐtiquetÃĐs comme des exceptions. Dâun point de vue de curation de donnÃĐes, cela serait un dÃĐfi considÃĐrable, en particulier pour les efforts communautaires à ressources limitÃĐes.
La deuxiÃĻme approche consisterait à appliquer des filtres qui excluent un tel contenu (câest-à -dire âmain avec trois/cinq doigtsâ) de se manifester au moment du rendu, de la mÊme maniÃĻre que OpenAI a, dans une certaine mesure, filtrÃĐ GPT-3 et DALL-E 2, afin que leur sortie puisse Être rÃĐglementÃĐe sans avoir besoin de reformer les modÃĻles sources.

Pour Stable Diffusion, la distinction sÃĐmantique entre les doigts et mÊme les membres peut devenir horriblement floue, ÃĐvoquant le courant âbody horrorâ des films dâhorreur des annÃĐes 80 de la part de rÃĐalisateurs comme David Cronenberg. Source: https://old.reddit.com/r/StableDiffusion/comments/x6htf6/a_study_of_stable_diffusions_strange_relationship/
Cependant, à nouveau, cela nÃĐcessiterait des ÃĐtiquettes qui nâexistent peut-Être pas sur toutes les images affectÃĐes, laissant nous avec le mÊme dÃĐfi logistique et budgÃĐtaire.
Il pourrait Être argumentÃĐ quâil existe deux routes à suivre: jeter plus de donnÃĐes dans le problÃĻme, et appliquer des systÃĻmes interprÃĐtatifs tiers qui peuvent intervenir lorsque des erreurs physiques de ce type sont prÃĐsentÃĐes à lâutilisateur final (au moins, cela donnerait à OpenAI un moyen de fournir des remboursements pour des rendus âdâhorreur corporelleâ, si lâentreprise ÃĐtait motivÃĐe pour le faire).
3: Personnalisation
Lâune des possibilitÃĐs les plus excitantes pour lâavenir de Stable Diffusion est la perspective de dÃĐvelopper des systÃĻmes rÃĐvisÃĐs; des modifications qui permettent dâintÃĐgrer du contenu en dehors de la sphÃĻre LAION prÃĐformÃĐe dans le systÃĻme â idÃĐalement sans lâexpense ingÃĐrable de former à nouveau lâensemble du modÃĻle, ou le risque encouru lors de la formation dâun grand volume dâimages nouvelles à un modÃĻle existant, mature et capable.
Par analogie: si deux ÃĐlÃĻves moins douÃĐs rejoignent une classe avancÃĐe de trente ÃĐlÃĻves, ils sâassimileront et rattraperont, ou ÃĐchoueront en tant quâexceptions; dans les deux cas, la performance moyenne de la classe ne sera probablement pas affectÃĐe. Si 15 ÃĐlÃĻves moins douÃĐs rejoignent, cependant, la courbe de notation de lâensemble de la classe est susceptible de souffrir.
De mÊme, le rÃĐseau synergique et relativement dÃĐlicat de relations qui se construisent au fil dâune formation de modÃĻle prolongÃĐe et coÃŧteuse peut Être compromis, voire dÃĐtruit, par de nouvelles donnÃĐes excessives, ce qui abaisse la qualitÃĐ de sortie du modÃĻle dans lâensemble.
Lâargument en faveur de cela est principalement là oÃđ votre intÃĐrÊt rÃĐside dans le dÃĐtournement complet de la comprÃĐhension conceptuelle du modÃĻle de relations et de choses, et dans lâexploitation de celle-ci pour la production exclusive de contenu similaire au matÃĐriel supplÃĐmentaire que vous avez ajoutÃĐ.
Ainsi, former 500 000 cadres de The Simpsons dans un point de contrÃīle Stable Diffusion existant est susceptible, ÃĐventuellement, de vous donner un meilleur simulateur de The Simpsons que le modÃĻle dâorigine nâaurait pu offrir, en supposant que suffisamment de relations sÃĐmantiques gÃĐnÃĐrales survivent au processus (câest-à -dire Homer Simpson mangeant un hot-dog, qui peut nÃĐcessiter du matÃĐriel sur les hot-dogs qui nâÃĐtait pas dans votre matÃĐriel supplÃĐmentaire, mais qui existait dÃĐjà dans le point de contrÃīle), et en supposant que vous ne voulez pas soudainement passer du contenu The Simpsons à la crÃĐation de paysage fabuleux par Greg Rutkowski â car votre modÃĻle post-formÃĐ a vu son attention massivement dÃĐtournÃĐe, et ne sera pas aussi bon pour faire ce type de chose quâil lâÃĐtait auparavant.
Un exemple notable de ceci est waifu-diffusion, qui a rÃĐussi à former à posteriori 56 000 images dâanime dans un point de contrÃīle Stable Diffusion formÃĐ et complet. Câest une perspective difficile pour un amateur, cependant, puisque le modÃĻle nÃĐcessite un minimum de 30 Go de VRAM, loin de ce qui est susceptible dâÊtre disponible au niveau consommateur dans les prochaines sorties de la sÃĐrie 40XX de NVIDIA.

La formation de contenu personnalisÃĐ dans Stable Diffusion via waifu-diffusion: le modÃĻle a pris deux semaines de post-formation pour produire ce niveau dâillustration. Les six images à gauche montrent la progression du modÃĻle, à mesure que la formation se poursuit, dans la production de sortie cohÃĐrente basÃĐe sur les nouvelles donnÃĐes de formation. Source: https://gigazine.net/gsc_news/en/20220121-how-waifu-labs-create/
Un grand effort pourrait Être dÃĐpensÃĐ sur ces ÂŦ fourches Âŧ de points de contrÃīle Stable Diffusion, seulement pour Être entravÃĐ par la dette technique. Les dÃĐveloppeurs du Discord officiel ont dÃĐjà indiquÃĐ que les versions de point de contrÃīle ultÃĐrieures ne seront pas nÃĐcessairement compatibles descendantes, mÊme avec la logique dâinvite qui a pu fonctionner avec une version prÃĐcÃĐdente, puisque leur intÃĐrÊt principal est dâobtenir le meilleur modÃĻle possible, plutÃīt que de supporter les applications et les processus hÃĐritÃĐs.
Par consÃĐquent, une entreprise ou un individu qui dÃĐcide de crÃĐer une fourche dâun point de contrÃīle dans un produit commercial sâengage effectivement sans retour en arriÃĻre; leur version du modÃĻle est, Ã ce stade, une ÂŦ fourche dure Âŧ, et ne pourra pas tirer parti des avantages en amont des versions ultÃĐrieures de stability.ai â ce qui est un engagement considÃĐrable.
Lâespoir actuel, et plus grand, pour la personnalisation de Stable Diffusion est lâinversion textuelle, oÃđ lâutilisateur forme une poignÃĐe dâimages CLIP alignÃĐes.

Une collaboration entre lâUniversitÃĐ de Tel Aviv et NVIDIA, lâinversion textuelle permet la formation de entitÃĐs discrÃĻtes et nouvelles, sans dÃĐtruire les capacitÃĐs du modÃĻle source. Source: https://textual-inversion.github.io/
La principale limitation apparente de lâinversion textuelle est quâun trÃĻs petit nombre dâimages est recommandÃĐ â autant que cinq. Cela produit essentiellement une entitÃĐ limitÃĐe qui peut Être plus utile pour les tÃĒches de transfert de style que pour lâinsertion dâobjets photorÃĐalistes.
Cependant, des expÃĐriences sont actuellement en cours dans les divers Discords de Stable Diffusion qui utilisent un nombre beaucoup plus ÃĐlevÃĐ dâimages de formation, et il reste à voir combien cette mÃĐthode peut Être productive. à nouveau, la technique nÃĐcessite une grande quantitÃĐ de VRAM, de temps et de patience.
En raison de ces facteurs limitants, nous devrons peut-Être attendre un certain temps pour voir certains des expÃĐriences dâinversion textuelle les plus sophistiquÃĐes de la part des enthousiastes de Stable Diffusion â et pour savoir si cette approche peut ÂŦ vous mettre dans lâimage Âŧ dâune maniÃĻre qui ressemble plus à une meilleure mise à lâÃĐchelle quâune copie-collage Photoshop, tout en conservant la fonctionnalitÃĐ ÃĐtonnante des points de contrÃīle officiels.
Â
PubliÃĐ pour la premiÃĻre fois le 6 septembre 2022.













