基于风格扩散的语音合成模型,用参考音频控制韵律,效果接近真人录音。
Project story
StyleTTS2 通过风格扩散模型建模说话人的韵律与情感:给定任意参考音频,生成的语音在停顿、重音、语速上高度贴近参考风格,人机感极弱,评测中自然度接近真人录音。
支持零样本风格迁移与多说话人合成,配合微调可获得更强的个性化效果,是当前自然度口碑最好的开源 TTS 之一。
适合场景:追求真人质感的有声内容、播客与口播、语音研究实验。
上手方式:按文档安装依赖与模型权重,加载后输入文本与风格参考音频即可合成。