OpenVoice 页面截图
产品页面 点击查看大图

OpenVoice

即时语音克隆与音频基础模型,由 MIT 和 MyShell 开发,支持多语言、多口音和灵活声音风格控制。

语音克隆音色克隆跨语言
语言
多语言
价格
OpenVoice V1 和 V2 均以 MIT 许可证发布,可免费用于商业和研究用途。
01

Overview

产品概述

OpenVoice 是 MIT 和 MyShell 开发的音频基础模型,主打即时语音克隆。它能够准确克隆参考音色,并生成多语言、多口音的语音;支持对情感、口音、节奏、停顿和语调等声音风格参数进行细粒度控制;还具备零样本跨语言语音克隆能力,生成语音和参考语音的语言无需出现在大规模多说话人多语言训练数据集中。2024 年 4 月发布的 V2 在保留全部 V1 功能的基础上,采用不同训练策略提升了音频质量,并原生支持英语、西班牙语、法语、中文、日语和韩语。
02

Capabilities

核心能力

01

精准音色克隆

OpenVoice 能准确克隆参考音色,并生成多语言、多口音的语音。

02

灵活的声音风格控制

支持对情感、口音、节奏、停顿和语调等声音风格参数进行细粒度控制。

03

零样本跨语言语音克隆

生成语音和参考语音的语言均无需出现在大规模多说话人多语言训练数据集中。

04

更好的音频质量

OpenVoice V2 采用不同训练策略,带来更好的音频质量。

05

原生多语言支持

OpenVoice V2 原生支持英语、西班牙语、法语、中文、日语和韩语。

03

Use Cases

适用场景

  1. 01

    即时语音克隆

    OpenVoice 自 2023 年 5 月起为 myshell.ai 提供即时语音克隆能力。

  2. 02

    文本转语音与零样本 TTS

    项目主题包含文本转语音、语音克隆和零样本 TTS,可应用于相关语音生成场景。

04

Integrations

集成能力

01

myshell.ai

OpenVoice 为 myshell.ai 平台提供即时语音克隆能力。