扩散模型是当前 AI 图像与视频生成的主流技术路线,通过「逐步加噪再逐步去噪」的方式从随机噪声中生成图像,Stable Diffusion、Midjourney 等工具都基于该原理。
AI Glossary
扩散模型(Diffusion Model)是当前 AI 图像和视频生成领域的主流技术路线。Stable Diffusion、Midjourney、即梦、可灵等工具的底层都基于扩散模型(或其变体)。
它的名字来自「扩散」这个物理过程:把一点颜料滴进水里,颜料会逐渐扩散、均匀化。扩散模型反过来利用这个过程——从一片「噪声」(相当于颜料完全均匀后的状态)中,一步步恢复出清晰的图像。
扩散模型分两个阶段理解:
训练阶段(学会去噪):把真实图像逐步加入噪声,直到完全变成随机噪声;模型学习「每一步噪声加了多少」,从而学会「如何反着去掉噪声」。
生成阶段(从噪声还原):给定一个纯随机噪声(相当于一张全是雪花点的图),模型逐步执行去噪,每一步去掉一点噪声、恢复一点结构,经过几十到上百步,最终得到一张清晰图像。
文字怎么起作用:生成时,模型会接收一个文字描述(提示词),在每一步去噪中把「描述语义」作为引导条件,让最终生成的图像内容符合文字描述。这就是「文生图」(Text-to-Image)的原理。
局限:
常见误区:
除了扩散模型,生成式 AI 还有另一条主流路线:自回归模型(如 GPT 系列),它逐词/逐像素生成内容。对话模型的文本生成属于自回归;而主流 AI 绘画工具主要用扩散模型。两者各有所长,也正在走向融合(多模态模型同时具备两种能力)。
扩散模型通过「加噪-去噪」的学习过程,让 AI 能从随机噪声中一步步生成清晰图像,是当前 AI 绘画和视频生成的底层原理。理解它有助于:写提示词时知道为什么具体描述更有效、知道生成结果是「重新创造」而非「拼接」,以及理性看待 AI 生成内容的边界与伦理问题。