少样本语音克隆与合成工具,5 秒音频即可克隆音色,1 分钟数据可训练出高相似度模型。
Project story
GPT-SoVITS 把语音克隆门槛降到极低:提供 5 秒参考音频即可进行零样本克隆,用 1 分钟原始数据微调即可获得高相似度音色。它在中文语料上的表现尤其出色,口音与情感还原度领先同类开源方案。
自带完整 Web 界面(训练、推理、数据处理一体化),支持 GPT 与 SoVITS 双阶段合成;还提供在线 Colab 快速体验。
适合场景:有声内容制作、短视频配音、游戏与直播角色音色定制。
注意:克隆他人声音必须获得本人授权。
上手方式:下载整合包启动 WebUI,录一段参考音频即可开始零样本克隆。