Modelos y plataformas de IA
Stability AI lanza el modelo de texto a imagen DeepFloyd IF

Stability AI y su laboratorio de investigación de inteligencia artificial multimodal, DeepFloyd, han anunciado la liberación de investigación de DeepFloyd IF, un modelo de difusión de píxeles en cascada de texto a imagen de vanguardia. El modelo se libera inicialmente bajo una licencia de investigación no comercial, pero se planea una liberación de código abierto para el futuro.
DeepFloyd IF cuenta con varias características notables, incluyendo:
- Comprensión profunda de los textos de los prompts: El modelo utiliza T5-XXL-1.1 como codificador de texto, con numerosas capas de atención cruzada entre texto e imagen, lo que garantiza una mejor alineación entre los prompts y las imágenes.
- Texto coherente y claro junto con imágenes generadas: DeepFloyd IF puede generar imágenes que contienen objetos con propiedades y relaciones espaciales variables.
- Alto grado de realismo fotográfico: El modelo ha logrado una impresionante puntuación FID de cero disparos de 6.66 en el conjunto de datos COCO.
- Cambio de relación de aspecto: El modelo puede generar imágenes con relaciones de aspecto no estándar, incluyendo verticales, horizontales y la relación de aspecto cuadrada estándar.
- Traducciones de imagen a imagen de cero disparos: El modelo puede modificar el estilo, los patrones y los detalles de una imagen mientras mantiene su forma básica.
A continuación, se presentan algunos de los conceptos de ejemplo creados por DeepFloyd IF:




El diseño de difusión de píxeles en cascada y modular de DeepFloyd IF consiste en varios módulos neuronales que interactúan sinérgicamente. El modelo funciona en el espacio de píxeles, procesando datos de alta resolución de manera en cascada utilizando modelos entrenados individualmente a diferentes resoluciones. Esto implica un modelo base que genera muestras de baja resolución y modelos de super-resolución sucesivos que producen imágenes de alta resolución.
El modelo se entrenó en un conjunto de datos personalizado de alta calidad LAION-A que contiene 1.000 millones de pares (imagen, texto), un subconjunto de la parte en inglés del conjunto de datos LAION-5B. Se utilizaron filtros personalizados de DeepFloyd para eliminar contenido con marcas de agua, NSFW y otro contenido inapropiado.

Proceso de DeepFloyd IF
Inicialmente, DeepFloyd IF se libera bajo una licencia de investigación. Los investigadores pretenden fomentar el desarrollo de aplicaciones novedosas en dominios como el arte, el diseño, la narración de historias, la realidad virtual y la accesibilidad. Para inspirar posibles investigaciones, han propuesto varias preguntas de investigación técnicas, académicas y éticas.
Preguntas de investigación técnica incluyen:
- Optimizar el modelo IF para mejorar el rendimiento, la escalabilidad y la eficiencia.
- Mejorar la calidad de la salida mediante la refinación de la muestra, la orientación o la afinación del modelo.
- Aplicar técnicas utilizadas para modificar la salida de Stable Diffusion a DeepFloyd IF.
Preguntas de investigación académica incluyen:
- Explorar el papel de la preentrenación para el aprendizaje de transferencia.
- Mejorar el control del modelo sobre la generación de imágenes.
- Ampliar las capacidades del modelo más allá de la síntesis de texto a imagen mediante la integración de múltiples modalidades.
- Evaluar la interpretación del modelo para mejorar la comprensión de las características visuales de las imágenes generadas.
Preguntas de investigación ética incluyen:
- Identificar y mitigar los sesgos en DeepFloyd IF.
- Evaluar el impacto del modelo en las redes sociales y la generación de contenido.
- Desarrollar un detector de imágenes falsas efectivo que utilice el modelo.
Para acceder a los pesos del modelo, los usuarios deben aceptar la licencia en el espacio de Hugging Face de DeepFloyd. Para obtener más información, puede visitar el sitio web del modelo, el repositorio de GitHub, la demo de Gradio o unirse a discusiones públicas a través del Linktree de DeepFloyd.












