AI 模型与平台
Stability AI 发布基于文本的图像模型 DeepFloyd IF

Stability AI 及其多模态 AI 研究实验室 DeepFloyd 已宣布发布 DeepFloyd IF,这是一种最先进的基于文本的图像级联像素扩散模型。该模型最初以非商业、研究许可证的形式发布,但计划在未来发布开源版本。
DeepFloyd IF 拥有多个显著的功能,包括:
- 深度文本提示理解: 该模型使用 T5-XXL-1.1 作为文本编码器,并具有多个文本图像交叉注意力层,以确保提示和图像之间的更好对齐。
- 生成图像中的连贯和清晰文本: DeepFloyd IF 可以生成包含具有不同属性和空间关系的对象的图像。
- 高程度的照片现实主义: 该模型在 COCO 数据集上实现了令人印象深刻的零次 FID 得分 6.66。
- 长宽比转换: 该模型可以生成具有非标准长宽比的图像,包括垂直、水平和标准正方形长宽比。
- 零次图像到图像翻译: 该模型可以修改图像的风格、图案和细节,同时保留其基本形式。
以下是 DeepFloyd IF 创建的一些示例概念:




DeepFloyd IF 的模块化、级联、像素扩散设计由多个神经模块协同工作。该模型在像素空间中工作,使用级联方式处理高分辨率数据,并使用在不同分辨率下单独训练的模型。这种方法涉及一个基模型,用于生成低分辨率样本,并且后续的超分辨率模型用于生成高分辨率图像。
该模型是在一个包含 10 亿个(图像、文本)对的自定义高质量 LAION-A 数据集上训练的,该数据集是 LAION-5B 数据集的英语部分子集。DeepFloyd 的自定义过滤器用于删除水印、NSFW 和其他不适合的内容。

DeepFloyd IF 的过程
最初,DeepFloyd IF 以研究许可证的形式发布。研究人员旨在鼓励各个领域(如艺术、设计、讲故事、虚拟现实和无障碍)中开发新的应用。为了激发潜在的研究,他们提出了几个技术、学术和伦理研究问题。
技术研究问题包括:
- 优化 IF 模型以提高性能、可扩展性和效率。
- 通过改进采样、引导或微调模型来提高输出质量。
- 将 Stable Diffusion 输出修改技术应用于 DeepFloyd IF。
学术研究问题包括:
- 探索预训练对于迁移学习的作用。
- 提高模型对图像生成的控制能力。
- 通过集成多个模态来扩展模型的能力,超越基于文本的图像合成。
- 评估模型的可解释性,以提高对生成图像的视觉特征的理解。
伦理研究问题包括:
- 识别和减轻 DeepFloyd IF 中的偏见。
- 评估模型对社交媒体和内容生成的影响。
- 开发一个有效的假图像检测器,利用该模型。
要访问模型的权重,用户必须在 DeepFloyd 的 Hugging Face 空间 上接受许可证。有关更多信息,您可以访问模型的网站、GitHub 存储库、Gradio 演示 或通过 DeepFloyd 的 Linktree 加入公共讨论。












