DeepFloyd 页面截图
产品页面 点击查看大图

DeepFloyd

DeepFloyd IF 是由 DeepFloyd Lab at StabilityAI 提出的开源文本生成图像模型,具有高度照片真实感和语言理解能力,采用级联扩散架构。

绘画高分辨率风格迁移
平台
Python、Jupyter Notebook
语言
Python
价格
DeepFloyd IF 以开源形式发布;代码仓库使用自定义许可证,模型权重通过 Hugging Face 提供并具有独立许可证(初始版本为受限研究用途许可)。
01

Overview

产品概述

DeepFloyd IF 由冻结的文本编码器和三个级联像素扩散模块组成:基础模型根据文本提示生成 64x64 像素图像,两个超分辨率模型分别将图像分辨率提升至 256x256 像素和 1024x1024 像素。所有阶段使用基于 T5 transformer 的冻结文本编码器提取文本嵌入,并输入到带有交叉注意力和注意力池化的 UNet 架构中。该模型在 COCO 数据集上取得零样本 FID 6.66,表现优于当前最先进的模型。
02

Capabilities

核心能力

01

高真实感文本生成图像

DeepFloyd IF 是一个开源文本生成图像模型,具有高度的照片真实感和语言理解能力,并在 COCO 数据集上取得零样本 FID 6.66 的成绩。

02

级联扩散架构

模型由冻结的文本编码器和三个级联像素扩散模块组成:基础模型生成 64x64 图像,两个超分辨率模型分别提升至 256x256 和 1024x1024。

03

T5 文本编码器与 UNet 架构

所有阶段使用基于 T5 transformer 的冻结文本编码器提取文本嵌入,并输入到带有交叉注意力和注意力池化的 UNet 架构中。

04

多模式图像生成

支持 Dream(文本生成图像)、风格迁移、超分辨率与 Inpainting 等多种模式,可通过本地 Jupyter Notebook 使用。

03

Use Cases

适用场景

  1. 01

    创意文本生成图像

    使用 Dream 模式,从文本提示生成高度逼真的图像,例如“一只长着鹿角的彩虹猫头鹰在森林中的超近距彩色照片”。

  2. 02

    图像风格迁移

    使用 Style Transfer 模式,将输入图像转换为折纸、油画、乐高积木或 1990 年代经典动漫等风格。

  3. 03

    图像超分辨率

    使用 Super Resolution 模式,通过 IF-II 和 IF-III(或 Stable x4)级联将图像放大并提升细节。

  4. 04

    零样本图像修复

    使用 Inpainting 模式,在给定遮罩区域中生成新内容,例如在图像中修复“戴帽子的男人”的油画效果。

04

Integrations

集成能力

01

Hugging Face Diffusers

DeepFloyd IF 已集成到 Hugging Face Diffusers 库,支持分阶段运行图像生成流程、CPU offload 以降低显存占用,并支持通过 Diffusers 脚本进行微调。