AI 模型与平台

Stability AI 发布基于文本的图像模型 DeepFloyd IF

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Stability AI 及其多模态 AI 研究实验室 DeepFloyd 已宣布发布 DeepFloyd IF,这是一种最先进的基于文本的图像级联像素扩散模型。该模型最初以非商业、研究许可证的形式发布,但计划在未来发布开源版本。

DeepFloyd IF 拥有多个显著的功能,包括:

  1. 深度文本提示理解: 该模型使用 T5-XXL-1.1 作为文本编码器,并具有多个文本图像交叉注意力层,以确保提示和图像之间的更好对齐。
  2. 生成图像中的连贯和清晰文本: DeepFloyd IF 可以生成包含具有不同属性和空间关系的对象的图像。
  3. 高程度的照片现实主义: 该模型在 COCO 数据集上实现了令人印象深刻的零次 FID 得分 6.66。
  4. 长宽比转换: 该模型可以生成具有非标准长宽比的图像,包括垂直、水平和标准正方形长宽比。
  5. 零次图像到图像翻译: 该模型可以修改图像的风格、图案和细节,同时保留其基本形式。

以下是 DeepFloyd IF 创建的一些示例概念:

DeepFloyd IF 的模块化、级联、像素扩散设计由多个神经模块协同工作。该模型在像素空间中工作,使用级联方式处理高分辨率数据,并使用在不同分辨率下单独训练的模型。这种方法涉及一个基模型,用于生成低分辨率样本,并且后续的超分辨率模型用于生成高分辨率图像。

该模型是在一个包含 10 亿个(图像、文本)对的自定义高质量 LAION-A 数据集上训练的,该数据集是 LAION-5B 数据集的英语部分子集。DeepFloyd 的自定义过滤器用于删除水印、NSFW 和其他不适合的内容。

DeepFloyd IF 的过程

最初,DeepFloyd IF 以研究许可证的形式发布。研究人员旨在鼓励各个领域(如艺术、设计、讲故事、虚拟现实和无障碍)中开发新的应用。为了激发潜在的研究,他们提出了几个技术、学术和伦理研究问题。

技术研究问题包括:

  • 优化 IF 模型以提高性能、可扩展性和效率。
  • 通过改进采样、引导或微调模型来提高输出质量。
  • 将 Stable Diffusion 输出修改技术应用于 DeepFloyd IF。

学术研究问题包括:

  • 探索预训练对于迁移学习的作用。
  • 提高模型对图像生成的控制能力。
  • 通过集成多个模态来扩展模型的能力,超越基于文本的图像合成。
  • 评估模型的可解释性,以提高对生成图像的视觉特征的理解。

伦理研究问题包括:

  • 识别和减轻 DeepFloyd IF 中的偏见。
  • 评估模型对社交媒体和内容生成的影响。
  • 开发一个有效的假图像检测器,利用该模型。

要访问模型的权重,用户必须在 DeepFloyd 的 Hugging Face 空间 上接受许可证。有关更多信息,您可以访问模型的网站、GitHub 存储库Gradio 演示 或通过 DeepFloyd 的 Linktree 加入公共讨论。

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。