Overview
产品概述
Capabilities
核心能力
视频扩散模型架构
提出一种自然扩展标准图像架构的视频扩散模型架构,可灵活处理可变序列长度,并支持联合图像与视频数据的训练。
梯度条件化采样方法
提出一种新的条件生成方法,通过在采样过程中对去噪数据改进条件损失来进行梯度优化,相比已有方法能更好地保证生成样本与条件信息的一致性,并用于自回归扩展生成更长、更高分辨率的视频。
联合图像-视频训练
其分解式时空 UNet 可在可变序列长度上运行,因此可以同时进行图像和视频建模目标的训练,这种联合训练对视频样本质量很重要。
Use Cases
适用场景
-
01
文本条件视频生成
模型以文本字符串为条件生成视频样本,例如以“fireworks”等字符串进行条件生成,并展示了多种文本条件下的采样结果。
-
02
无条件视频生成
在无条件视频生成基准上进行了测试并取得了先进的样本质量评分,验证了扩散模型在视频生成中的有效性。
-
03
长视频与高分辨率生成
通过块自回归方式将训练好的模型扩展为在帧维度上自回归,并采用梯度方法实现更高分辨率与更长视频的生成,时间一致性优于基线方法。