Overview
产品概述
Capabilities
核心能力
SenseVoice 语音理解
SenseVoice 提供高精度多语言语音识别、情感识别和音频事件检测,支持超过50种语言且延迟极低。
CosyVoice 语音生成
CosyVoice 支持多语言、音色和情感控制的自然语音生成,具备零样本语音生成、跨语言音色克隆和指令跟随能力。
开源模型与代码
SenseVoice 和 CosyVoice 相关模型已在 ModelScope 和 HuggingFace 开源,训练、推理和微调代码在 GitHub 上发布。
Use Cases
适用场景
-
01
语音到语音翻译
通过集成 SenseVoice、LLM 和 CosyVoice,实现语音到语音翻译(S2ST)。
-
02
情感语音聊天
通过集成 SenseVoice、LLM 和 CosyVoice,开发情感语音聊天应用。
-
03
交互式播客
结合 SenseVoice、基于 LLM 的多智能体系统(具备实时世界知识)和 CosyVoice,创建交互式播客。
-
04
富有表现力的有声书朗读
支持富有表现力的有声书朗读等语音交互应用。