FunAudioLLM 页面截图
产品页面 点击查看大图

FunAudioLLM

FunAudioLLM 是阿里通义语音团队提出的语音理解与生成基础模型框架,包含 SenseVoice 语音理解模型和 CosyVoice 语音生成模型,旨在增强人类与大语言模型之间的自然语音交互。

音频语音交互人工智能
平台
GitHub、ModelScope、Hugging Face
语言
多语言
01

Overview

产品概述

FunAudioLLM 是用于增强人类与 LLM 自然语音交互的框架,核心包含两个模型:SenseVoice 负责高精度多语言语音识别、情感识别与音频事件检测;CosyVoice 负责多语言、音色和情感控制的自然语音生成,并支持零样本语音生成、跨语言音色克隆与指令跟随。相关模型已在 ModelScope 和 HuggingFace 开源,代码在 GitHub 发布。将模型与 LLM 集成后,可实现语音翻译、情感语音聊天、交互式播客和富有表现力的有声书朗读等应用。
02

Capabilities

核心能力

01

SenseVoice 语音理解

SenseVoice 提供高精度多语言语音识别、情感识别和音频事件检测,支持超过50种语言且延迟极低。

02

CosyVoice 语音生成

CosyVoice 支持多语言、音色和情感控制的自然语音生成,具备零样本语音生成、跨语言音色克隆和指令跟随能力。

03

开源模型与代码

SenseVoice 和 CosyVoice 相关模型已在 ModelScope 和 HuggingFace 开源,训练、推理和微调代码在 GitHub 上发布。

03

Use Cases

适用场景

  1. 01

    语音到语音翻译

    通过集成 SenseVoice、LLM 和 CosyVoice,实现语音到语音翻译(S2ST)。

  2. 02

    情感语音聊天

    通过集成 SenseVoice、LLM 和 CosyVoice,开发情感语音聊天应用。

  3. 03

    交互式播客

    结合 SenseVoice、基于 LLM 的多智能体系统(具备实时世界知识)和 CosyVoice,创建交互式播客。

  4. 04

    富有表现力的有声书朗读

    支持富有表现力的有声书朗读等语音交互应用。