Voicebox 页面截图
产品页面 点击查看大图

Voicebox

Voicebox 是 Meta AI 推出的文本引导多语言通用语音生成模型,支持六种语言的语音合成、瞬时噪声去除、内容编辑、跨语言风格迁移以及多样化语音样本生成。

语音生成音频编辑多语言
语言
多语言
01

Overview

产品概述

Voicebox 基于 Meta 的非自回归流匹配(flow matching)模型构建,通过大规模文本引导语音填充任务进行训练,能够利用上下文学习执行多种语音任务。它可在英语、法语、德语、西班牙语、波兰语和葡萄牙语六种语言中生成语音,支持单语与跨语言零样本语音合成、风格转换、瞬时噪声去除、内容编辑和多样化样本生成,并且其生成速度可比最先进的自回归模型快 20 倍。由于存在被滥用的潜在风险,Meta 暂不公开 Voicebox 模型或代码。
02

Capabilities

核心能力

01

多语言语音合成

Voicebox 支持在六种语言(英语、法语、德语、西班牙语、波兰语和葡萄牙语)中合成语音。

02

非自回归流匹配模型

Voicebox 是 Meta 的非自回归流匹配模型,可基于音频上下文和文本进行语音填充,并能在过去和未来上下文中进行条件生成。

03

语音编辑与去噪

Voicebox 能纠正说错的词而无需重新录制,也能像橡皮擦一样重新生成被噪声污染的语音,去除瞬时噪声。

04

跨语言风格迁移

Voicebox 可以将一种语言的语音风格迁移到另一种语言,例如用法语提示生成英语语音,并保留原始说话人的风格。

05

多样化语音生成

Voicebox 可以在不依赖任何音频条件的情况下,通过采样生成独特且富有表现力的语音风格。

06

高速语音生成

Voicebox 生成语音的速度可比最先进的自回归模型快 20 倍。

03

Use Cases

适用场景

  1. 01

    零样本语音合成

    通过输入参考音频和文本,Voicebox 可以按参考音频的声音、背景噪声和说话风格合成语音。

  2. 02

    跨语言配音转换

    Voicebox 能保持文本与语音间的时间对齐,可把配音语音转换为原说话人的声音。

  3. 03

    内容编辑

    Voicebox 可以修正发音错误,无需说话人重新录制音频。

  4. 04

    瞬时噪声去除

    对于被门铃、狗叫等瞬时噪声干扰的录音,Voicebox 可重新生成被噪声破坏的语音,避免重录。