扩散模型是 Stable Diffusion、Midjourney 等绘画工具的底层技术。本文用通俗方式讲清它的原理。
学习内容
扩散模型(Diffusion Model)是当前主流 AI 绘画技术的底层原理。它的思路很反直觉:先学会"把清晰图像加噪变模糊",再反过来"从噪声逐步还原出图像"。
训练阶段:给图片不断加噪声,直到变成纯噪点,模型学习"如何加噪"。
生成阶段:从随机噪点出发,模型一步步"去噪",每一步都向真实图像靠近,最终还原出完整图像。
生成时模型不是盲目去噪:它同时接收文字描述(提示词),在去噪过程中把语义信息"引导"进图像,让最终结果符合描述——这就是"文生图"。
Stable Diffusion:开源的扩散模型实现。
LoRA:低成本微调,改变某个风格或角色。
ControlNet:用结构条件控制构图。
采样器:去噪步数的不同策略,影响速度与质量。
问:为什么画手总是崩?
答:高细节小结构对去噪过程更敏感,模型容易在细节上"糊"。
问:一次生成多张为什么各不相同?
答:起点随机噪点不同,结果天然不同;固定种子可复现。
扩散模型用"从噪声中还原图像"的方式实现了惊人的生成能力:先学会破坏,再学会重建,配合文字引导产出任意画面。理解这个原理,你就能明白为什么提示词、种子、采样器会影响出图效果。
继续学习
AGI(通用人工智能)是所有 AI 公司的终极目标。本文讲清 AGI 与当前 AI 的区别、发展阶段与争议。
微调让通用大模型适配特定业务。本文讲清微调原理、方法与 RAG 的取舍。
RAG(检索增强生成)解决大模型知识过时与幻觉问题。本文讲清原理、流程和适用场景。
AI 工具与传统软件的本质区别在哪里?本文从工作方式、结果可控性等维度给出判断框架。
大语言模型(LLM)是 ChatGPT 等 AI 助手背后的核心技术。本文用通俗语言讲清 LLM 是什么、怎么训练、能做什么、不能做什么。
智能体工作流是让 AI 自动化完成复杂任务的编排方式。本文讲清常见模式与落地场景。