视频扩散模型是一种基于扩散过程(diffusion)的生成模型,通过逐步去噪从随机噪声中生成连贯的视频帧序列,是当前文生视频(如 Sora、可灵、Runway Gen-3 等)的主流技术基础。
AI Glossary
视频扩散模型是一种基于扩散过程的生成式模型,专门用于生成视频内容。它的核心思想与图像扩散模型(如 Stable Diffusion)一脉相承:先学习从清晰视频逐步「加噪」到纯随机噪声的过程,再训练模型学会逆向「去噪」,从随机噪声一步步还原出连贯的视频帧序列。
当前主流的文生视频工具——Sora、可灵 AI、Runway Gen-3、Vidu 等——底层大多采用视频扩散模型或其衍生架构。相比早期的 GAN 与自回归方法,扩散模型在画面真实感、时序连贯性与内容可控性上有明显优势,是这一轮 AI 视频浪潮的技术基石。
视频扩散模型可以理解为「在图像扩散模型之上增加了时间维度」。
第一步是加噪过程(前向扩散):把一段真实视频逐帧加噪,直到变成纯随机噪声,模型学习的是这一过程中的概率规律。
第二步是去噪过程(反向扩散):给定一句文本描述(或一张起始图),模型从纯噪声出发,通过多步迭代逐步「还原」出符合描述的视频帧。每一步去噪既要保证单帧画面清晰,又要保证帧与帧之间在运动、光影、物体形变上连贯一致。
为了让视频「动得合理」,现代视频扩散模型还会引入运动建模(如 3D 时空注意力、光流约束、物理先验)与文本/图像条件控制(通过交叉注意力让画面跟随提示词)。Sora 这类大模型还采用「时空 Patch」把视频切成小块统一建模,从而支持更长的时长与更复杂的运镜。
按架构演进,视频扩散模型大致经历了几代:
第一代「图像扩散 + 时序拼接」:先生成关键帧,再用插值与短时扩散补全中间帧,长视频容易漂移、动作不自然。
第二代「时空联合扩散」:把空间(画面)与时间(帧序)统一放进同一个扩散过程建模,连贯性显著提升,Runway Gen-1/Gen-2 是代表。
第三代「大尺度视频扩散」:以 Sora 为代表,用大规模数据与时空 Patch 统一训练,支持更长时长、更复杂运镜与更强的物理一致性。
此外还有「图像 + 视频联合训练」的混合路线(如 Stable Video Diffusion),让模型既能生成静态图也能生成动态视频。
文生视频:输入一句话生成短视频,用于营销素材、创意内容与影视预演。
图生视频:让一张静态图片「动起来」,用于电商展示、动漫创作与特效合成。
视频编辑与补全:局部重绘、镜头延展、风格转换,辅助后期制作。
多模态生成:与音频扩散模型结合,实现画面与声音的同步生成。
视频扩散模型仍面临几个关键瓶颈:一是计算成本极高,长视频生成需要大量算力与时间;二是物理一致性还不够稳定,复杂运动(手部动作、流体、多物体交互)容易失真;三是时长受限,多数模型仍以数秒到数十秒的片段为主;四是内容可控性不足,精确控制镜头、角色与情节仍是难题。
视频扩散模型是当前 AI 视频生成的核心技术路线,它让「用文字生成电影级视频」从幻想走向可用。随着 Sora 等大模型的迭代与算力成本下降,它正在重塑影视、营销、内容创作的生产方式。理解它的「加噪—去噪」本质,有助于判断各类文生视频工具的能力边界与发展方向。
用通俗中文解释 AI 技术术语,帮助你看懂工具页面里的模型、协议和工作流。