从照片和音频生成会说话的头像视频,口型同步自然,是经典的数字人口播方案。
Project story
SadTalker 用 3D 人脸模型解耦「表情」与「口型」:给定一张照片与一段音频,生成头部自然摆动、口型与音频同步的说话视频,支持任意分辨率与表情增强。
提供 WebUI 与命令行、Python API,模型体积小、消费级显卡可跑;ComfyUI 也有对应节点。
适合场景:口播视频、新闻播报、教学讲解、虚拟形象内容制作。
注意:使用真实人物肖像必须获得本人授权。
上手方式:按文档安装依赖与模型,传入照片和音频即可生成说话视频。