JoyHallo 页面截图
产品页面 点击查看大图

JoyHallo

JoyHallo 是京东健康推出的面向普通话的数字人视频生成模型,使用自建 29 小时普通话数据集 jdh-Hallo 和中文 wav2vec2 音频嵌入,通过半解耦结构提升数字人视频生成效率,并保留英语生成能力。

视频生成音频驱动数字人模型
语言
多语言
01

Overview

产品概述

JoyHallo 是京东健康国际有限公司提出的普通话数字人模型。研究团队收集了 29 小时来自员工的普通话语音视频,构建 jdh-Hallo 数据集,内容涵盖不同年龄、说话风格,以及日常对话和医疗专业话题。模型采用中文 wav2vec2 进行音频特征嵌入,并设计半解耦结构以捕捉唇形、表情和姿态特征间的关系,在提高信息利用效率的同时将推理速度提升 14.3%。JoyHallo 在专注普通话生成的同时,仍保持良好的英语视频生成能力。
02

Capabilities

核心能力

01

普通话数字人视频生成

面向普通话音频驱动的视频生成进行优化,使用中文 wav2vec2 模型进行音频特征嵌入,并基于包含 29 小时普通话语音视频的 jdh-Hallo 数据集训练。

02

半解耦结构提升推理效率

采用半解耦结构捕捉唇形、表情与姿态特征之间的相互关系,提升信息利用效率,并将推理速度提升 14.3%。

03

跨语言生成能力

在优化普通话视频生成的同时,保持较强的英语视频生成能力,展现良好的跨语言生成性能。

03

Use Cases

适用场景

  1. 01

    普通话数字人内容制作

    可应用于普通话及英语语音、歌曲驱动的数字人视频生成场景。

  2. 02

    医疗健康领域数字人

    训练数据涵盖日常对话与专业医疗话题,可支持医疗健康相关数字人视频内容的生成。