Overview
产品概述
Capabilities
核心能力
高保真文本到图像生成
Imagen 是一个文本到图像扩散模型,能够根据输入文本生成具有高度照片真实感的图像。
深层语言理解
通过大型预训练语言模型(如 T5-XXL)编码输入文本,增强图像生成中文本与图像的语义对齐,扩大语言模型规模比扩大扩散模型规模更能提升效果。
级联超分辨率扩散模型
利用文本条件超分辨率扩散模型,将条件扩散模型生成的 64×64 图像逐步上采样至 256×256 和 1024×1024。
先进基准性能
在无需于 COCO 数据集上训练的情况下,Imagen 在 COCO 数据集上取得了 FID 7.27 的最先进成绩。
Use Cases
适用场景
-
01
创意图像生成
用户可输入描述性文本,生成如“戴着牛仔帽的熊猫”等新颖场景的照片级图像。
-
02
文本到图像模型评估
引入 DrawBench 基准,系统测试组合性、数量、空间关系、长文本、罕见词和挑战性提示,并用于与现有文本到图像模型进行人类偏好对比。