FunAudioLLM

CosyVoice

FunAudioLLM

Multi-lingual large voice generation model, providing inference, training and deployment full-stack ability.

AI 简介

CosyVoice 是一个基于大语言模型的多语言语音合成系统,支持文本到语音(TTS)、零样本语音克隆与跨语言语音生成。其核心能力包括覆盖9种主流语言、18+中文方言/口音的细粒度发音控制,内置文本归一化与发音掩码(Pronunciation Inpainting)机制,支持指令式语音调控(如语速、情感、方言),并具备双向流式处理能力(端到端延迟低至150ms)。适用于智能客服、有声内容生成、多语种交互式语音助手及本地化语音合成等需要高自然度、强可控性与多语言适配能力的生产场景。

Python
Apache License 2.0
22.1k
Stars
2.5k
Forks
132
Watchers
738
Issues

Star 增长

今日0
近 7 天0
近 30 天+209
综合评分80
默认分支main