Imagen 页面截图
产品页面 点击查看大图

Imagen

Imagen 是 Google Research 推出的文本到图像扩散模型,能够根据输入文本生成具有高度真实感和深层语言理解的图像。

文字转图像AI绘画图像生成
01

Overview

产品概述

Imagen 是 Google Research 发布的文本到图像扩散模型,结合大型预训练语言模型的深层文本理解与扩散模型的高保真图像生成能力。其核心发现是通用大型语言模型(如 T5)在文本编码方面非常有效,扩大语言模型规模比扩大扩散模型规模更能提升样本保真度和图文对齐效果。生成过程中,Imagen 使用大型冻结 T5-XXL 编码器将输入文本编码为嵌入,由条件扩散模型映射为 64×64 图像,再通过文本条件超分辨率扩散模型逐步上采样至 1024×1024。在 COCO 数据集上,Imagen 无需在 COCO 上训练即取得 FID 7.27 的新最优成绩;其引入的 DrawBench 基准也被用于与其他文本到图像模型进行人类偏好对比。
02

Capabilities

核心能力

01

高保真文本到图像生成

Imagen 是一个文本到图像扩散模型,能够根据输入文本生成具有高度照片真实感的图像。

02

深层语言理解

通过大型预训练语言模型(如 T5-XXL)编码输入文本,增强图像生成中文本与图像的语义对齐,扩大语言模型规模比扩大扩散模型规模更能提升效果。

03

级联超分辨率扩散模型

利用文本条件超分辨率扩散模型,将条件扩散模型生成的 64×64 图像逐步上采样至 256×256 和 1024×1024。

04

先进基准性能

在无需于 COCO 数据集上训练的情况下,Imagen 在 COCO 数据集上取得了 FID 7.27 的最先进成绩。

03

Use Cases

适用场景

  1. 01

    创意图像生成

    用户可输入描述性文本,生成如“戴着牛仔帽的熊猫”等新颖场景的照片级图像。

  2. 02

    文本到图像模型评估

    引入 DrawBench 基准,系统测试组合性、数量、空间关系、长文本、罕见词和挑战性提示,并用于与现有文本到图像模型进行人类偏好对比。