阿里通义实验室开源的多语言语音合成模型,支持情感控制与跨语言合成。
Project story
CosyVoice 是阿里通义实验室开源的语音合成模型,支持中英日粤等多语言,特色是零样本克隆只需几秒参考音频,且能通过文本指令控制情感与语速(如「带一点悲伤」)。
采用流式生成架构,延迟低,适合实时对话场景;提供 ModelScope 上的模型下载与 Python API,与 FunASR、SenseVoice 等阿里开源语音全家桶配合使用效果更佳。
适合场景:数字人口播、智能客服语音、多语言内容制作、实时语音交互。
上手方式:从 ModelScope 下载模型,pip 安装后调用 Python API 合成。