Modèles et plateformes d’IA
Stability AI lance le modèle d’image à texte DeepFloyd IF

Stability AI et son laboratoire de recherche en intelligence artificielle multimodale, DeepFloyd, ont annoncé la sortie de recherche de DeepFloyd IF, un modèle de diffusion de pixels en cascade d’avant-garde pour l’image à texte. Le modèle est initialement publié sous une licence de recherche non commerciale, mais une sortie en open source est prévue pour l’avenir.
DeepFloyd IF se distingue par plusieurs fonctionnalités remarquables, notamment:
- Compréhension approfondie des invites de texte: Le modèle utilise T5-XXL-1.1 comme encodeur de texte, avec de nombreuses couches d’attention croisée entre le texte et les images, garantissant une meilleure correspondance entre les invites et les images.
- Texte cohérent et clair avec des images générées: DeepFloyd IF peut générer des images contenant des objets avec des propriétés et des relations spatiales variées.
- Degré élevé de photoréalisme: Le modèle a obtenu un score FID impressionnant de 6,66 sur le jeu de données COCO.
- Changement de ratio d’aspect: Le modèle peut générer des images avec des ratios d’aspect non standard, y compris les formats verticaux, horizontaux et carrés standard.
- Traductions d’image à image sans entraînement préalable: Le modèle peut modifier le style, les motifs et les détails d’une image tout en préservant sa forme de base.
Voici quelques-uns des concepts d’exemple créés par DeepFloyd IF:




La conception modulaire, en cascade, de diffusion de pixels de DeepFloyd IF se compose de plusieurs modules neuronaux qui interagissent de manière synergique. Le modèle fonctionne dans l’espace des pixels, traitant des données à haute résolution de manière cascade en utilisant des modèles formés individuellement à différentes résolutions. Cela implique un modèle de base qui génère des échantillons à basse résolution et des modèles de sur-résolution successifs qui produisent des images à haute résolution.
Le modèle a été formé sur un jeu de données LAION-A personnalisé de haute qualité contenant 1 milliard de paires (image, texte), un sous-ensemble de la partie anglaise du jeu de données LAION-5B. Les filtres personnalisés de DeepFloyd ont été utilisés pour supprimer le contenu marqué d’eau, NSFW et d’autres contenus inappropriés.

Processus de DeepFloyd IF
Initialement, DeepFloyd IF est publié sous une licence de recherche. Les chercheurs visent à encourager le développement de nouvelles applications dans des domaines tels que l’art, la conception, la narration, la réalité virtuelle et l’accessibilité. Pour inspirer les recherches potentielles, ils ont proposé plusieurs questions de recherche techniques, académiques et éthiques.
Les questions de recherche techniques incluent:
- Optimiser le modèle IF pour améliorer les performances, la scalabilité et l’efficacité.
- Améliorer la qualité de sortie en affinant l’échantillonnage, la guidage ou la fine-tuning du modèle.
- Appliquer les techniques utilisées pour modifier la sortie de Stable Diffusion à DeepFloyd IF.
Les questions de recherche académiques incluent:
- Explorer le rôle de la pré-formation pour l’apprentissage de transfert.
- Améliorer le contrôle du modèle sur la génération d’images.
- Étendre les capacités du modèle au-delà de la synthèse d’images à texte en intégrant plusieurs modalités.
- Évaluer l’interprétabilité du modèle pour améliorer la compréhension des caractéristiques visuelles des images générées.
Les questions de recherche éthiques incluent:
- Identifier et atténuer les biais de DeepFloyd IF.
- Évaluer l’impact du modèle sur les médias sociaux et la génération de contenu.
- Élaborer un détecteur d’images factices efficace qui utilise le modèle.
Pour accéder aux poids du modèle, les utilisateurs doivent accepter la licence sur l’espace Hugging Face de DeepFloyd. Pour plus d’informations, vous pouvez visiter le site Web du modèle, le référentiel GitHub, la démo Gradio ou rejoindre les discussions publiques via le Linktree de DeepFloyd.












