开源语音合成模型,用少量参考音频即可生成高自然度、可跨语言的多语种语音。
Project story
Fish Speech 基于 Fish Audio 团队自研架构,用约 15 秒参考音频即可零样本克隆音色,效果接近商业级语音合成;对中文和英文都支持良好,并具备跨语言合成能力。
相比同类工具,它的音质干净、训练成本低(单张消费级显卡可完成微调),社区提供在线体验与模型权重。
适合场景:视频配音、有声内容、数字人、个性化语音助手。
注意:克隆他人声音必须获得本人授权。
上手方式:按文档安装依赖并下载模型,加载后输入文本与参考音频即可合成。