Overview
产品概述
Capabilities
核心能力
零样本与少样本语音克隆 TTS
输入 5 秒语音样本即可进行零样本文本转语音;仅需 1 分钟训练数据微调即可提升声音相似度与真实感。
跨语言合成支持
支持英语、日语、韩语、粤语和中文,可在与训练集不同的语言间进行推理与跨语言合成。
WebUI 数据处理工具链
集成伴奏/人声分离、自动训练集切分、多语言 ASR(Fun-ASR-Nano、SenseVoice、经典 FunASR)及文本标注等功能,便于创建数据集和训练 GPT/SoVITS 模型。
Use Cases
适用场景
-
01
个人声音克隆
使用 1 分钟语音数据微调模型,获得高相似度的个人音色 TTS 效果。
-
02
低音质参考音频的 TTS 合成
对来自网络等高频缺失、听感沉闷的低质量参考音频,v2 版本可提升合成音质。
-
03
跨语言内容创作
允许训练集、参考音频与合成语言不同,在五种语言间互相合成,适合多语言配音等场景。
Integrations
集成能力
Docker
提供 Docker 镜像与 docker-compose 配置,可在容器中运行 GPT-SoVITS 服务。
Google Colab
提供 Colab 推理与 WebUI 笔记本,可在云端快速体验。
Hugging Face Demo
提供 Hugging Face 在线演示,可体验高速推理。
AutoDL 云 Docker
面向中国用户提供 AutoDL 云端 Docker,可在线体验完整功能。