Ángulo de Anderson

Tres desafíos para Stable Diffusion

mm
Añade Unite.AI a tus fuentes preferidas en Google

El lanzamiento de la versión de Stable Diffusion de stability.ai, un modelo de síntesis de imágenes de difusión latente, hace un par de semanas, puede ser uno de los avances tecnológicos más significativos desde DeCSS en 1999; sin duda, es el evento más importante en la generación de imágenes con inteligencia artificial desde que el código de deepfakes se copió en GitHub en 2017 y se bifurcó en lo que se convertiría en DeepFaceLab y FaceSwap, así como en el software de transmisión de deepfakes en tiempo real DeepFaceLive.

De un golpe, la frustración de los usuarios con las restricciones de contenido en la API de síntesis de imágenes de DALL-E 2 se desvaneció, ya que resultó que el filtro NSFW de Stable Diffusion se podía deshabilitar cambiando una sola línea de código. Los subreddits de Stable Diffusion centrados en pornografía surgieron casi de inmediato y fueron eliminados rápidamente, mientras que los desarrolladores y los usuarios se dividieron en comunidades oficiales y NSFW en Discord, y Twitter comenzó a llenarse de creaciones fantásticas de Stable Diffusion.

En este momento, cada día parece traer alguna innovación asombrosa de los desarrolladores que han adoptado el sistema, con plugins y complementos de terceros escritos apresuradamente para Krita, Photoshop, Cinema4D, Blender y muchas otras plataformas de aplicaciones.

Mientras tanto, el “promptcraft” – el arte profesional de “susurrar” a la inteligencia artificial, que puede convertirse en la opción de carrera más corta desde “Filofax binder” – ya se está comercializando, mientras que la monetización temprana de Stable Diffusion está teniendo lugar en el nivel de Patreon, con la certeza de que habrá ofertas más sofisticadas por venir, para aquellos que no están dispuestos a navegar por instalaciones basadas en Conda del código fuente o los filtros NSFW de las implementaciones web.

El ritmo de desarrollo y la sensación de exploración libre de los usuarios está avanzando a un ritmo vertiginoso, lo que hace que sea difícil ver muy lejos. Esencialmente, no sabemos exactamente con qué estamos tratando todavía, o cuáles son las limitaciones o posibilidades.

Aun así, veamos tres de lo que podría ser los desafíos más interesantes y difíciles para la comunidad de Stable Diffusion, que se ha formado y está creciendo rápidamente, para enfrentar y, con suerte, superar.

1: Optimizando tuberías basadas en mosaicos

Presentados con recursos de hardware limitados y límites estrictos en la resolución de las imágenes de entrenamiento, es probable que los desarrolladores encuentren soluciones para mejorar tanto la calidad como la resolución de la salida de Stable Diffusion. Muchos de estos proyectos están destinados a explotar las limitaciones del sistema, como su resolución nativa de solo 512×512 píxeles.

Como siempre es el caso con las iniciativas de visión por computadora y síntesis de imágenes, Stable Diffusion se entrenó en imágenes con una relación de aspecto cuadrada, en este caso, muestreadas a 512×512, para que las imágenes de origen pudieran regularizarse y caber en las limitaciones de las GPU que entrenaron el modelo.

Por lo tanto, Stable Diffusion “piensa” (si es que piensa) en términos de 512×512, y ciertamente en términos cuadrados. Muchos usuarios que actualmente están explorando los límites del sistema informan que Stable Diffusion produce los resultados más confiables y menos defectuosos en esta relación de aspecto bastante restringida (ver “abordar extremidades” a continuación).

Aunque varias implementaciones presentan escalado mediante RealESRGAN (y pueden arreglar caras mal renderizadas mediante GFPGAN), varios usuarios están desarrollando métodos para dividir las imágenes en secciones de 512×512 píxeles y unirlas para formar obras compuestas más grandes.

Esta renderización de 1024x576, una resolución que normalmente es imposible en una sola renderización de Stable Diffusion, se creó copiando y pegando el archivo attention.py de Python desde el fork de DoggettX de Stable Diffusion (una versión que implementa el escalado basado en mosaicos) en otro fork. Fuente: https://old.reddit.com/r/StableDiffusion/comments/x6yeam/1024x576_with_6gb_nice/

Esta renderización de 1024×576, una resolución que normalmente es imposible en una sola renderización de Stable Diffusion, se creó copiando y pegando el archivo attention.py de Python desde el fork de DoggettX de Stable Diffusion (una versión que implementa el escalado basado en mosaicos) en otro fork. Fuente: https://old.reddit.com/r/StableDiffusion/comments/x6yeam/1024x576_with_6gb_nice/

Aunque algunas iniciativas de este tipo utilizan código original o otras bibliotecas, el puerto txt2imghd de GOBIG (un modo en ProgRockDiffusion, que consume mucha memoria de video) está destinado a proporcionar esta funcionalidad a la rama principal pronto. Mientras que txt2imghd es un puerto dedicado de GOBIG, otros esfuerzos de los desarrolladores de la comunidad implican diferentes implementaciones de GOBIG.

Una imagen abstracta conveniente en la renderización original de 512x512 píxeles (izquierda y segunda desde la izquierda); escalada por ESGRAN, que ahora es más o menos nativa en todas las distribuciones de Stable Diffusion; y dado 'atención especial' a través de una implementación de GOBIG, produciendo detalles que, al menos dentro de los confines de la sección de la imagen, parecen mejor escalados. Fuente: https://old.reddit.com/r/StableDiffusion/comments/x72460/stable_diffusion_gobig_txt2imghd_easy_mode_colab/

Una imagen abstracta conveniente en la renderización original de 512×512 píxeles (izquierda y segunda desde la izquierda); escalada por ESGRAN, que ahora es más o menos nativa en todas las distribuciones de Stable Diffusion; y dado ‘atención especial’ a través de una implementación de GOBIG, produciendo detalles que, al menos dentro de los confines de la sección de la imagen, parecen mejor escalados. Fuente: https://old.reddit.com/r/StableDiffusion/comments/x72460/stable_diffusion_gobig_txt2imghd_easy_mode_colab/

El tipo de ejemplo abstracto presentado anteriormente tiene muchos ‘pequeños reinos’ de detalles que se adaptan a este enfoque solipsístico de escalado, pero que pueden requerir soluciones de código más desafiantes para producir un escalado cohesivo que no parezca ensamblado a partir de muchas partes. No menos, en el caso de las caras humanas, donde estamos inusualmente atentos a aberraciones o artefactos ‘desconcertantes’. Por lo tanto, las caras pueden necesitar eventualmente una solución dedicada.

Stable Diffusion actualmente no tiene un mecanismo para enfocar la atención en la cara durante una renderización de la misma manera que los humanos priorizan la información facial. Aunque algunos desarrolladores en las comunidades de Discord están considerando métodos para implementar este tipo de ‘atención mejorada’, actualmente es mucho más fácil mejorar la cara manualmente (y, eventualmente, automáticamente) después de que la renderización inicial haya tenido lugar.

Una cara humana tiene una lógica semántica interna y completa que no se encontrará en un ‘mosaico’ del rincón inferior de (por ejemplo) un edificio, y por lo tanto es posible ‘zoom in’ y volver a renderizar una cara ‘esbozada’ en la salida de Stable Diffusion de manera muy efectiva.

Izquierda, el esfuerzo inicial de Stable Diffusion con el prompt 'Foto a todo color de Christina Hendricks entrando en un lugar concurrido, llevando un abrigo de lluvia; Canon50, contacto con los ojos, alto detalle, alto detalle facial'. Derecha, una cara mejorada obtenida al alimentar la cara borrosa y esbozada de la primera renderización de nuevo en la atención completa de Stable Diffusion utilizando Img2Img (ver imágenes animadas a continuación).

Izquierda, el esfuerzo inicial de Stable Diffusion con el prompt ‘Foto a todo color de Christina Hendricks entrando en un lugar concurrido, llevando un abrigo de lluvia; Canon50, contacto con los ojos, alto detalle, alto detalle facial’. Derecha, una cara mejorada obtenida al alimentar la cara borrosa y esbozada de la primera renderización de nuevo en la atención completa de Stable Diffusion utilizando Img2Img (ver imágenes animadas a continuación).

En ausencia de una solución de inversión textual dedicada (ver a continuación), esto solo funcionará para imágenes de celebridades donde la persona en cuestión ya está bien representada en los subconjuntos de datos LAION que entrenaron a Stable Diffusion. Por lo tanto, funcionará con personas como Tom Cruise, Brad Pitt, Jennifer Lawrence y un rango limitado de luminarias de los medios genuinos que están presentes en gran número de imágenes en los datos de origen.

Generando una foto de prensa plausible con el prompt 'Foto a todo color de Christina Hendricks entrando en un lugar concurrido, llevando un abrigo de lluvia; Canon50, contacto con los ojos, alto detalle, alto detalle facial'.

Generando una foto de prensa plausible con el prompt ‘Foto a todo color de Christina Hendricks entrando en un lugar concurrido, llevando un abrigo de lluvia; Canon50, contacto con los ojos, alto detalle, alto detalle facial’.

Para celebridades con carreras largas y duraderas, Stable Diffusion generalmente generará una imagen de la persona a una edad reciente (es decir, mayor), y será necesario agregar adjuntos de prompt como ‘joven’ o ‘en el año [AÑO]’ para producir imágenes con aspecto más joven.

Con una carrera prominente y fotografiada consistentemente durante casi 40 años, la actriz Jennifer Connelly es una de las pocas celebridades en LAION que permiten a Stable Diffusion representar una gama de edades. Fuente: prepack Stable Diffusion, local, v1.4 checkpoint; prompts relacionados con la edad.

Con una carrera prominente y fotografiada consistentemente durante casi 40 años, la actriz Jennifer Connelly es una de las pocas celebridades en LAION que permiten a Stable Diffusion representar una gama de edades. Fuente: prepack Stable Diffusion, local, v1.4 checkpoint; prompts relacionados con la edad.

Esto se debe en gran parte a la proliferación de la fotografía de prensa digital (en lugar de la fotografía de emulsión basada en película) a partir de la mitad de la década de 2000, y el crecimiento posterior en volumen de producción de imágenes debido al aumento de las velocidades de banda ancha.

La imagen renderizada se pasa a Img2Img en Stable Diffusion, donde se selecciona un 'área de enfoque' y se crea una nueva renderización de tamaño máximo solo de esa área, lo que permite a Stable Diffusion concentrar todos los recursos disponibles en recrear la cara.

La imagen renderizada se pasa a Img2Img en Stable Diffusion, donde se selecciona un ‘área de enfoque’ y se crea una nueva renderización de tamaño máximo solo de esa área, lo que permite a Stable Diffusion concentrar todos los recursos disponibles en recrear la cara.

Componiendo la cara de 'alta atención' de nuevo en la renderización original. Además de las caras, este proceso solo funcionará con entidades que tengan una apariencia coherente e integral potencial, como una porción de la foto original que tenga un objeto distintivo, como un reloj o un coche. Escalar una sección de, por ejemplo, una pared llevará a una pared reensamblada con un aspecto muy extraño, porque los renderizados de mosaicos no tenían un contexto más amplio para esta 'pieza de rompecabezas' mientras la renderizaban.

Componiendo la cara de ‘alta atención’ de nuevo en la renderización original. Además de las caras, este proceso solo funcionará con entidades que tengan una apariencia coherente e integral potencial, como una porción de la foto original que tenga un objeto distintivo, como un reloj o un coche. Escalar una sección de, por ejemplo, una pared llevará a una pared reensamblada con un aspecto muy extraño, porque los renderizados de mosaicos no tenían un contexto más amplio para esta ‘pieza de rompecabezas’ mientras la renderizaban.

Algunas celebridades en la base de datos vienen ‘congeladas’ en el tiempo, ya sea porque murieron temprano (como Marilyn Monroe), o porque alcanzaron una prominencia mainstream solo fugaz, produciendo un gran volumen de imágenes en un período de tiempo limitado. Sondear a Stable Diffusion puede proporcionar una especie de ‘índice de popularidad actual’ para estrellas modernas y más antiguas. Para algunas celebridades más antiguas y actuales, no hay suficientes imágenes en los datos de origen para obtener un parecido muy bueno, mientras que la popularidad duradera de ciertas estrellas fallecidas o desvanecidas garantiza que se puede obtener un parecido razonable de ellas del sistema.

Las renderizaciones de Stable Diffusion revelan rápidamente qué caras famosas están bien representadas en los datos de entrenamiento. A pesar de su enorme popularidad como adolescente mayor en el momento de escribir, Millie Bobby Brown era más joven y menos conocida cuando se extrajeron los conjuntos de datos de origen de LAION de la web, lo que hace que sea problemático obtener un parecido de alta calidad con Stable Diffusion en este momento.

Las renderizaciones de Stable Diffusion revelan rápidamente qué caras famosas están bien representadas en los datos de entrenamiento. A pesar de su enorme popularidad como adolescente mayor en el momento de escribir, Millie Bobby Brown era más joven y menos conocida cuando se extrajeron los conjuntos de datos de origen de LAION de la web, lo que hace que sea problemático obtener un parecido de alta calidad con Stable Diffusion en este momento.

Donde los datos están disponibles, las soluciones de escalado basadas en mosaicos en Stable Diffusion podrían ir más allá de centrarse en la cara: podrían permitir caras incluso más precisas y detalladas al descomponer las características faciales y aplicar todos los recursos de GPU locales en características individuales, antes de volver a ensamblarlas – un proceso que actualmente es manual.

Esto no se limita a las caras, pero se limita a partes de objetos que son al menos tan predeciblemente colocadas en el contexto más amplio del objeto anfitrión, y que se ajustan a incrustaciones de alto nivel que podríamos razonablemente esperar encontrar en un conjunto de datos de hipercala.

El límite real es la cantidad de datos de referencia disponibles en el conjunto de datos, porque, eventualmente, los detalles profundamente iterados se volverán completamente ‘alucinados’ (es decir, ficticios) y menos auténticos.

Estos aumentos granulares de alto nivel funcionan en el caso de Jennifer Connelly, porque ella está bien representada en una gama de edades en LAION-aesthetics (el subconjunto principal de LAION 5B que utiliza Stable Diffusion), y en general en LAION; en muchos otros casos, la precisión sufriría por la falta de datos, lo que necesitaría una afinación adicional (entrenamiento adicional, ver ‘Personalización’ a continuación) o una inversión textual (ver a continuación).

Los mosaicos son una forma poderosa y relativamente barata para que Stable Diffusion pueda producir salida de alta resolución, pero el escalado algorítmico de mosaicos de este tipo, si carece de algún tipo de mecanismo de atención de más alto nivel, puede no alcanzar los estándares deseados en una gama de tipos de contenido.

2: Abordar problemas con extremidades humanas

Stable Diffusion no cumple con su nombre cuando se trata de representar la complejidad de las extremidades humanas. Las manos pueden multiplicarse aleatoriamente, los dedos pueden fusionarse, pueden aparecer piernas adicionales sin previo aviso y las extremidades existentes pueden desaparecer sin dejar rastro. En su defensa, Stable Diffusion comparte el problema con sus compañeros estables, y sin duda con DALL-E 2.

Resultados no editados de DALL-E 2 y Stable Diffusion (1.4) a fines de agosto de 2022, ambos mostrando problemas con las extremidades. Prompt es 'Una mujer abrazando a un hombre'

Resultados no editados de DALL-E 2 y Stable Diffusion (1.4) a fines de agosto de 2022, ambos mostrando problemas con las extremidades. Prompt es ‘Una mujer abrazando a un hombre’

Los fanáticos de Stable Diffusion que esperan que el próximo punto de control 1.5 (una versión más intensamente entrenada del modelo, con parámetros mejorados) resuelva la confusión de las extremidades probablemente se decepcionarán. El nuevo modelo, que se lanzará en aproximadamente dos semanas, se está estrenando actualmente en el portal comercial stability.ai DreamStudio, que utiliza 1.5 por defecto, y donde los usuarios pueden comparar la nueva salida con renderizaciones de sus sistemas locales o de otros sistemas 1.4:

Fuente: prepack local 1.4 y https://beta.dreamstudio.ai/

Fuente: prepack local 1.4 y https://beta.dreamstudio.ai/

Fuente: prepack local 1.4 y https://beta.dreamstudio.ai/

Fuente: prepack local 1.4 y https://beta.dreamstudio.ai/

Fuente: prepack local 1.4 y https://beta.dreamstudio.ai/

Fuente: prepack local 1.4 y https://beta.dreamstudio.ai/

Como suele ser el caso, la calidad de los datos podría ser la causa principal contribuyente.

Las bases de datos de código abierto que alimentan sistemas de síntesis de imágenes como Stable Diffusion y DALL-E 2 pueden proporcionar muchas etiquetas para humanos individuales y acciones interhumanas. Estas etiquetas se entrenan junto con sus imágenes asociadas o segmentos de imágenes.

Los usuarios de Stable Diffusion pueden explorar los conceptos entrenados en el modelo consultando el conjunto de datos LAION-aesthetics, un subconjunto del conjunto de datos LAION 5B más grande, que impulsa el sistema. Las imágenes están ordenadas no por sus etiquetas alfabéticas, sino por su 'puntuación estética'. Fuente: https://rom1504.github.io/clip-retrieval/

Los usuarios de Stable Diffusion pueden explorar los conceptos entrenados en el modelo consultando el conjunto de datos LAION-aesthetics, un subconjunto del conjunto de datos LAION 5B más grande, que impulsa el sistema. Las imágenes están ordenadas no por sus etiquetas alfabéticas, sino por su ‘puntuación estética’. Fuente: https://rom1504.github.io/clip-retrieval/

Una jerarquía ‘buena’ de etiquetas individuales y clases que contribuyen a la representación de un brazo humano sería algo como cuerpo>brazo>mano>dedos>[subdedos + pulgar]>[segmentos de dedos]>uñas.

Segmentación semántica granular de las partes de una mano. Incluso esta descomposición inusualmente detallada deja cada 'dedo' como una entidad única, sin tener en cuenta los tres segmentos de un dedo y los dos segmentos de un pulgar. Fuente: https://athitsos.utasites.cloud/publications/rezaei_petra2021.pdf

Segmentación semántica granular de las partes de una mano. Incluso esta descomposición inusualmente detallada deja cada ‘dedo’ como una entidad única, sin tener en cuenta los tres segmentos de un dedo y los dos segmentos de un pulgar. Fuente: https://athitsos.utasites.cloud/publications/rezaei_petra2021.pdf

En la realidad, las imágenes de origen no están etiquetadas de manera consistente en todo el conjunto de datos, y los algoritmos de etiquetado no supervisados probablemente se detendrán en el nivel ‘más alto’ de, por ejemplo, ‘mano’, y dejarán los píxeles interiores (que técnicamente contienen información de ‘dedos’) como una masa no etiquetada de píxeles, de la cual se derivarán características de manera arbitraria, y que pueden manifestarse en renderizaciones posteriores como un elemento desconcertante.

Cómo debería ser (arriba a la derecha, si no es un corte superior), y cómo tiende a ser (abajo a la derecha), debido a la falta de recursos para etiquetar, o la explotación arquitectónica de tales etiquetas si existen en el conjunto de datos.

Cómo debería ser (arriba a la derecha, si no es un corte superior), y cómo tiende a ser (abajo a la derecha), debido a la falta de recursos para etiquetar, o la explotación arquitectónica de tales etiquetas si existen en el conjunto de datos.

Así, si un modelo de difusión latente llega a renderizar un brazo, es casi seguro que al menos intentará renderizar una mano al final de ese brazo, porque brazo>mano es la jerarquía mínima requerida, bastante alta en lo que la arquitectura sabe sobre ‘anatomía humana’.

Después de eso, ‘dedos’ pueden ser el grupo más pequeño, aunque hay 14 partes subsecuentes de dedos/pulgar para considerar al representar manos humanas.

Si esta teoría se mantiene, no hay remedio real, debido a la falta de presupuesto sectorial para la anotación manual, y la falta de algoritmos lo suficientemente efectivos que puedan automatizar la etiquetado mientras producen tasas de error bajas. En efecto, el modelo puede estar confiando actualmente en la consistencia anatómica humana para cubrir las deficiencias del conjunto de datos en el que se entrenó.

Una posible razón por la que no puede confiar en esto, recientemente propuesta en el Discord de Stable Diffusion, es que el modelo podría confundirse sobre la cantidad correcta de dedos que una mano humana realista debería tener porque la base de datos derivada de LAION que impulsa el modelo presenta personajes de dibujos animados que pueden tener menos dedos (lo que en sí mismo es un atajo para ahorrar mano de obra).

Dos de los posibles culpables del 'síndrome de dedos perdidos' en Stable Diffusion y modelos similares. Abajo, ejemplos de manos de dibujos animados del conjunto de datos LAION-aesthetics que impulsa a Stable Diffusion. Fuente: https://www.youtube.com/watch?v=0QZFQ3gbd6I

Dos de los posibles culpables del ‘síndrome de dedos perdidos’ en Stable Diffusion y modelos similares. Abajo, ejemplos de manos de dibujos animados del conjunto de datos LAION-aesthetics que impulsa a Stable Diffusion. Fuente: https://www.youtube.com/watch?v=0QZFQ3gbd6I

Si esto es cierto, entonces la única solución obvia es volver a entrenar el modelo, excluyendo contenido no realista basado en humanos, asegurando que los casos genuinos de omisión (es decir, amputados) estén etiquetados como excepciones. Desde un punto de vista de curación de datos, esto sería un desafío bastante grande, particularmente para esfuerzos comunitarios con recursos limitados.

El segundo enfoque sería aplicar filtros que excluyan este tipo de contenido (es decir, ‘mano con tres/cinco dedos’) de manifestarse en el momento de la renderización, de la misma manera que OpenAI ha filtrado, hasta cierto punto, GPT-3 y DALL-E 2, para que su salida pueda regularse sin necesidad de volver a entrenar los modelos de origen.

Para Stable Diffusion, la distinción semántica entre dígitos y even extremidades puede volverse horriblemente borrosa, recordando a la rama de 'terror corporal' de las películas de terror de la década de 1980 de David Cronenberg. Fuente: https://old.reddit.com/r/StableDiffusion/comments/x6htf6/a_study_of_stable_diffusions_strange_relationship/

Para Stable Diffusion, la distinción semántica entre dígitos y even extremidades puede volverse horriblemente borrosa, recordando a la rama de ‘terror corporal’ de las películas de terror de la década de 1980 de David Cronenberg. Fuente: https://old.reddit.com/r/StableDiffusion/comments/x6htf6/a_study_of_stable_diffusions_strange_relationship/

Podría argumentarse que quedan dos caminos adelante: lanzar más datos al problema y aplicar sistemas interpretativos de terceros que puedan intervenir cuando se presentan errores físicos de este tipo al usuario final (al menos, esto último daría a OpenAI un método para proporcionar reembolsos por renderizaciones de ‘terror corporal’, si la empresa estuviera motivada para hacerlo).

3: Personalización

Una de las posibilidades más emocionantes para el futuro de Stable Diffusion es la perspectiva de que los usuarios u organizaciones desarrollen sistemas revisados; modificaciones que permitan integrar contenido fuera de la esfera preentrenada de LAION en el sistema – idealmente sin el gasto descontrolado de volver a entrenar todo el modelo, o el riesgo involucrado al entrenar en un gran volumen de imágenes nuevas a un modelo existente maduro y capaz.

Por analogía: si dos estudiantes menos dotados se unen a una clase avanzada de treinta estudiantes, o bien se asimilarán y alcanzarán el nivel, o fallarán como outsiders; en cualquier caso, el rendimiento promedio de la clase probablemente no se verá afectado. Si 15 estudiantes menos dotados se unen, sin embargo, la curva de calificaciones para toda la clase probablemente sufrirá.

De manera similar, la red de relaciones sinérgicas y bastante delicadas que se construyen durante un entrenamiento de modelo sostenido y costoso puede verse comprometida, en algunos casos destruida efectivamente, por datos nuevos excesivos, lo que reduce la calidad de salida del modelo en general.

El caso para hacer esto es principalmente donde su interés radica en apoderarse completamente de la comprensión conceptual del modelo de relaciones y cosas, y apropiarse de ella para la producción exclusiva de contenido que se asemeja al material adicional que agregó.

Así, entrenar 500,000 cuadros de Los Simpson en un punto de control de Stable Diffusion existente probablemente obtendrá un mejor simulador de Los Simpson de lo que podría haber ofrecido la versión original, suponiendo que suficientes relaciones semánticas amplias sobrevivan al proceso (es decir, Homer Simpson comiendo un hot dog, lo que puede requerir material sobre hot dogs que no estaba en el material adicional, pero que ya existía en el punto de control), y suponiendo que no quiera cambiar repentinamente de contenido de Los Simpson a crear paisajes fabulosos de Greg Rutkowski – porque su modelo postentrenado ha tenido su atención masivamente desviada, y no será tan bueno para hacer ese tipo de cosas como solía ser.

Un ejemplo notable de esto es waifu-diffusion, que ha postentrenado con éxito 56,000 imágenes de anime en un punto de control de Stable Diffusion completado y entrenado. Es un prospecto difícil para un aficionado, sin embargo, ya que el modelo requiere un mínimo de 30 GB de VRAM, mucho más de lo que probablemente esté disponible en el nivel de consumo en las próximas versiones de la serie 40XX de NVIDIA.

El entrenamiento de contenido personalizado en Stable Diffusion: el modelo tardó dos semanas de postentrenamiento para producir este nivel de ilustración. Las seis imágenes de la izquierda muestran el progreso del modelo en la producción de salida coherente con el tema basada en los nuevos datos de entrenamiento. Fuente: https://gigazine.net/gsc_news/en/20220121-how-waifu-labs-create/

El entrenamiento de contenido personalizado en Stable Diffusion a través de waifu-diffusion: el modelo tardó dos semanas de postentrenamiento para producir este nivel de ilustración. Las seis imágenes de la izquierda muestran el progreso del modelo, a medida que avanzaba el entrenamiento, en la producción de salida coherente con el tema basada en los nuevos datos de entrenamiento. Fuente: https://gigazine.net/gsc_news/en/20220121-how-waifu-labs-create/

Un gran esfuerzo podría gastarse en este tipo de ‘bifurcaciones’ de puntos de control de Stable Diffusion, solo para ser obstaculizado por deuda técnica. Los desarrolladores en el Discord oficial ya han indicado que las versiones posteriores de los puntos de control no necesariamente serán compatibles con versiones anteriores, incluso con la lógica de prompts que podría haber funcionado con una versión anterior, ya que su interés principal es obtener el mejor modelo posible, en lugar de respaldar aplicaciones y procesos heredados.

Por lo tanto, una empresa o individuo que decide bifurcar un punto de control en un producto comercial efectivamente no tiene forma de regresar; su versión del modelo es, en ese punto, una ‘bifurcación dura’, y no podrá aprovechar los beneficios de las versiones posteriores de stability.ai – lo que es un compromiso bastante grande.

La esperanza actual y mayor para la personalización de Stable Diffusion es la inversión textual, donde el usuario entrena una pequeña cantidad de imágenes alineadas con CLIP.

Una colaboración entre la Universidad de Tel Aviv y NVIDIA, la inversión textual permite el entrenamiento de entidades discretas y novedosas, sin destruir las capacidades del modelo de origen. Fuente: https://textual-inversion.github.io/

Una colaboración entre la Universidad de Tel Aviv y NVIDIA, la inversión textual permite el entrenamiento de entidades discretas y novedosas, sin destruir las capacidades del modelo de origen. Fuente: https://textual-inversion.github.io/

La limitación aparente de la inversión textual es que se recomiendan un número muy bajo de imágenes – tan pocas como cinco. Esto efectivamente produce una entidad limitada que puede ser más útil para tareas de transferencia de estilo que para la inserción de objetos fotorealistas.

Aun así, los experimentos están teniendo lugar actualmente dentro de los varios Discord de Stable Diffusion que utilizan un número mucho mayor de imágenes de entrenamiento, y queda por ver cuán productivo podría ser el método. De nuevo, la técnica requiere una gran cantidad de VRAM, tiempo y paciencia.

Debido a estos factores limitantes, podemos tener que esperar un poco para ver algunos de los experimentos de inversión textual más sofisticados de los entusiastas de Stable Diffusion – y para ver si este enfoque puede ‘ponerlo en la imagen’ de una manera que se vea mejor que un corte y pegado de Photoshop, mientras retiene la funcionalidad asombrosa de los puntos de control oficiales.

 

Publicado por primera vez el 6 de septiembre de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]