图生视频(Image-to-Video)是基于单张或数张图片生成动态视频的技术,能让静态画面产生运动、镜头与叙事。它是 AI 视频生成的重要能力,与文生视频互为补充。
AI Glossary
图生视频(Image-to-Video)指基于一张或几张图片生成动态视频的技术:模型理解图片内容后,为画面补充运动、动作与镜头,让静态图像「动起来」。
直观理解:你给一张「奔跑的马」的图,模型判断马的姿态与场景,生成一段马在奔跑的动态画面。主体的身份、场景与风格继承自原图,这是它比纯文生视频更可控的原因。
图生视频的典型流程:
核心挑战在「一致性」与「物理合理」:主体不能变形、运动不能违和,这也是各模型持续优化的方向。
| 维度 | 图生视频 | 文生视频 |
|---|---|---|
| 输入 | 图片(+文字描述) | 纯文字描述 |
| 主体一致性 | 强(继承原图) | 弱(依赖描述与模型) |
| 可控性 | 高(画面已定,补充运动) | 中(画面由文字想象) |
| 适用场景 | 已有素材的动态化 | 从零构思动态场景 |
实际使用中两者常组合:文生图生成素材 → 图生视频让素材动起来,是内容创作者的主流工作流。
限制:
常见误区:
图生视频让静态画面获得运动与叙事,是 AI 视频生成里「可控性最好」的入口:继承原图的主体与场景,补充合理的动态。配合文生图形成「出图→动起来」的工作流,它是内容创作者当前最实用的 AI 视频玩法之一。