GPT-SoVITS 页面截图
产品页面 点击查看大图

GPT-SoVITS

少样本语音克隆与文本转语音工具,支持零样本/少样本 TTS、跨语言合成,并集成 WebUI 工作流。

声音克隆文本转语音开源
平台
Windows、Linux、macOS、Docker
语言
多语言
价格
开源项目(MIT 许可证),可免费使用。
01

Overview

产品概述

GPT-SoVITS 是一个开源的少样本语音克隆与文本转语音 WebUI,只需 1 分钟语音数据即可训练出效果良好的 TTS 模型(5 秒语音样本可用于零样本转换)。它支持中、英、日、韩、粤语的跨语言合成,并内置伴奏分离、训练集自动切分、多语言 ASR 与文本标注等工具,帮助用户构建训练数据集与 GPT/SoVITS 模型。
02

Capabilities

核心能力

01

零样本与少样本语音克隆 TTS

输入 5 秒语音样本即可进行零样本文本转语音;仅需 1 分钟训练数据微调即可提升声音相似度与真实感。

02

跨语言合成支持

支持英语、日语、韩语、粤语和中文,可在与训练集不同的语言间进行推理与跨语言合成。

03

WebUI 数据处理工具链

集成伴奏/人声分离、自动训练集切分、多语言 ASR(Fun-ASR-Nano、SenseVoice、经典 FunASR)及文本标注等功能,便于创建数据集和训练 GPT/SoVITS 模型。

03

Use Cases

适用场景

  1. 01

    个人声音克隆

    使用 1 分钟语音数据微调模型,获得高相似度的个人音色 TTS 效果。

  2. 02

    低音质参考音频的 TTS 合成

    对来自网络等高频缺失、听感沉闷的低质量参考音频,v2 版本可提升合成音质。

  3. 03

    跨语言内容创作

    允许训练集、参考音频与合成语言不同,在五种语言间互相合成,适合多语言配音等场景。

04

Integrations

集成能力

01

Docker

提供 Docker 镜像与 docker-compose 配置,可在容器中运行 GPT-SoVITS 服务。

02

Google Colab

提供 Colab 推理与 WebUI 笔记本,可在云端快速体验。

03

Hugging Face Demo

提供 Hugging Face 在线演示,可体验高速推理。

04

AutoDL 云 Docker

面向中国用户提供 AutoDL 云端 Docker,可在线体验完整功能。