文生视频(Text-to-Video)是通过文字描述直接生成动态视频的技术,是 AI 视频生成的核心能力。理解它的原理、能力边界与使用技巧,是内容创作者用好 AI 视频的前提。
AI Glossary
文生视频(Text-to-Video)指通过文字描述直接生成动态视频的技术:输入一段文字,模型生成对应的画面、动作与镜头,输出可播放的视频片段。
直观理解:你写「一只猫在夕阳下的屋顶上伸懒腰,镜头缓缓拉近」,模型就生成这样一段动态画面。文字是「脚本」,模型是「导演 + 摄影 + 渲染」。
文生视频是生成式 AI 的前沿能力,技术路线仍在快速演进:
与文生图相比,文生视频额外要处理「时间维度」:物体怎么动、镜头怎么变、前后帧怎么连贯。
| 维度 | 文生视频 | 图生视频 |
|---|---|---|
| 输入 | 纯文字描述 | 图片(+文字) |
| 主体一致性 | 弱(依赖模型) | 强(继承原图) |
| 可控性 | 中 | 高 |
| 适合场景 | 从零构思 | 已有素材动态化 |
两者常组合:文生图定素材 → 图生视频让素材动起来,是创作者的主流工作流。
技巧:
限制:
文生视频把「想法 → 动态画面」的距离压缩到一段文字,是 AI 视频创作的核心能力。当前它更适合片段级、素材型创作,长叙事仍需人工编排;配合图生视频与剪辑工具,能形成完整的内容生产链路。
用通俗中文解释 AI 技术术语,帮助你看懂工具页面里的模型、协议和工作流。