Overview
产品概述
Capabilities
核心能力
普通话数字人视频生成
面向普通话音频驱动的视频生成进行优化,使用中文 wav2vec2 模型进行音频特征嵌入,并基于包含 29 小时普通话语音视频的 jdh-Hallo 数据集训练。
半解耦结构提升推理效率
采用半解耦结构捕捉唇形、表情与姿态特征之间的相互关系,提升信息利用效率,并将推理速度提升 14.3%。
跨语言生成能力
在优化普通话视频生成的同时,保持较强的英语视频生成能力,展现良好的跨语言生成性能。
Use Cases
适用场景
-
01
普通话数字人内容制作
可应用于普通话及英语语音、歌曲驱动的数字人视频生成场景。
-
02
医疗健康领域数字人
训练数据涵盖日常对话与专业医疗话题,可支持医疗健康相关数字人视频内容的生成。