Overview
产品概述
Capabilities
核心能力
多语言语音合成
Voicebox 支持在六种语言(英语、法语、德语、西班牙语、波兰语和葡萄牙语)中合成语音。
非自回归流匹配模型
Voicebox 是 Meta 的非自回归流匹配模型,可基于音频上下文和文本进行语音填充,并能在过去和未来上下文中进行条件生成。
语音编辑与去噪
Voicebox 能纠正说错的词而无需重新录制,也能像橡皮擦一样重新生成被噪声污染的语音,去除瞬时噪声。
跨语言风格迁移
Voicebox 可以将一种语言的语音风格迁移到另一种语言,例如用法语提示生成英语语音,并保留原始说话人的风格。
多样化语音生成
Voicebox 可以在不依赖任何音频条件的情况下,通过采样生成独特且富有表现力的语音风格。
高速语音生成
Voicebox 生成语音的速度可比最先进的自回归模型快 20 倍。
Use Cases
适用场景
-
01
零样本语音合成
通过输入参考音频和文本,Voicebox 可以按参考音频的声音、背景噪声和说话风格合成语音。
-
02
跨语言配音转换
Voicebox 能保持文本与语音间的时间对齐,可把配音语音转换为原说话人的声音。
-
03
内容编辑
Voicebox 可以修正发音错误,无需说话人重新录制音频。
-
04
瞬时噪声去除
对于被门铃、狗叫等瞬时噪声干扰的录音,Voicebox 可重新生成被噪声破坏的语音,避免重录。