video-diffusion 页面截图
产品页面 点击查看大图

video-diffusion

Video Diffusion Models 是一个用于视频生成的扩散模型研究项目,提出将标准图像扩散架构自然扩展为视频扩散架构,并在无条件和有条件视频生成任务上取得进展。

视频生成扩散模型时间连贯性
01

Overview

产品概述

该项目介绍了基于扩散模型的视频生成方法。与以往使用 GAN、VAE 等方法不同,它采用高斯扩散模型的标准形式,并通过对架构的调整在深度学习加速器内存约束下处理视频数据。其核心贡献包括:将图像架构扩展为视频架构、联合图像-视频训练、新的梯度条件化采样方法,以及将模型用于块自回归扩展以生成更长、更高分辨率的视频。实验在无条件视频生成基准上取得先进结果,并展示了文本条件视频生成的潜力。
02

Capabilities

核心能力

01

视频扩散模型架构

提出一种自然扩展标准图像架构的视频扩散模型架构,可灵活处理可变序列长度,并支持联合图像与视频数据的训练。

02

梯度条件化采样方法

提出一种新的条件生成方法,通过在采样过程中对去噪数据改进条件损失来进行梯度优化,相比已有方法能更好地保证生成样本与条件信息的一致性,并用于自回归扩展生成更长、更高分辨率的视频。

03

联合图像-视频训练

其分解式时空 UNet 可在可变序列长度上运行,因此可以同时进行图像和视频建模目标的训练,这种联合训练对视频样本质量很重要。

03

Use Cases

适用场景

  1. 01

    文本条件视频生成

    模型以文本字符串为条件生成视频样本,例如以“fireworks”等字符串进行条件生成,并展示了多种文本条件下的采样结果。

  2. 02

    无条件视频生成

    在无条件视频生成基准上进行了测试并取得了先进的样本质量评分,验证了扩散模型在视频生成中的有效性。

  3. 03

    长视频与高分辨率生成

    通过块自回归方式将训练好的模型扩展为在帧维度上自回归,并采用梯度方法实现更高分辨率与更长视频的生成,时间一致性优于基线方法。