Stable Diffusion WebUI 是基于 Gradio 构建的 Web 界面,为 AI 艺术创作者提供文生图、图生图及模型训练等功能。它降低了 Stable Diffusion 的使用门槛,支持 NVIDIA、AMD 等多种硬件环境,适合希望本地部署并深度定制生成流程的开发者与艺术家。
Project story
Stable Diffusion WebUI 是一个基于 Gradio 库实现的 Stable Diffusion Web 界面。该项目在 GitHub 上拥有约 164752 颗 Star,显示出较高的社区关注度。它由 AUTOMATIC1111 维护,旨在为用户提供一个功能丰富、易于操作的图形化界面,以替代复杂的命令行操作。项目持续更新,支持包括 Stable Diffusion 2.0、Alt-Diffusion 以及 Segmind Stable Diffusion 在内的多种模型版本。
在没有此类 Web 界面之前,用户通常需要通过命令行直接调用 Stable Diffusion 模型,这不仅要求用户具备较高的编程基础,还需要手动处理复杂的参数配置、依赖管理以及显存优化问题。对于非技术背景的艺术家或普通用户而言,调整采样器、设置注意力权重或进行图像修复等操作极为繁琐。Stable Diffusion WebUI 通过可视化的方式解决了这些痛点,将复杂的生成参数、模型合并、训练流程封装在直观的 UI 中,使得用户只需点击鼠标即可完成从文本到图像的生成、编辑及优化过程,极大地降低了使用门槛。
该工具提供了全面的图像生成与控制功能。基础方面,支持原始的 txt2img(文生图)和 img2img(图生图)模式,并包含 Outpainting(外绘)、Inpainting(内绘)及 Color Sketch(色彩草图)等高级编辑功能。用户可以通过 Prompt Matrix 组合提示词,或使用 Attention 机制指定模型对特定文本的关注度,例如通过括号语法调整权重。
在图像处理与增强方面,Extras 标签页集成了 GFPGAN 和 CodeFormer 用于面部修复,以及 RealESRGAN、ESRGAN、SwinIR、Swin2SR 和 LDSR 等多种神经网络超分辨率放大工具。此外,还支持 Highres Fix(高分辨率修复)以一键生成高质量大图,避免常见失真。
模型管理与训练也是其强项。支持 Textual Inversion、Hypernetworks 和 Loras 的训练与加载,允许用户在低显存环境下进行嵌入训练。Checkpoint Merger 功能允许合并多达三个检查点。同时,支持加载 safetensors 格式的检查点,并可选择不同的 VAE。
交互体验上,提供 X/Y/Z 绘图以可视化不同参数的影响,支持 Negative prompt(负向提示词)排除不想要的内容,以及 Prompt Editing 在生成中途改变提示词。生成参数会自动保存在图片元数据中,方便拖拽恢复。还支持批量处理、CLIP interrogator 反推提示词、DeepDanbooru 集成生成动漫标签等功能。
项目主要使用 Python 语言开发,底层依赖 PyTorch 深度学习框架。前端界面基于 Gradio 库构建,实现了快速的 Web 交互原型。为了提升性能,项目支持 xformers 加速库,可显著加快特定显卡的处理速度。架构上采用了模块化设计,允许通过 Custom scripts 扩展功能,并提供了 API 接口供外部调用。支持 Composable-Diffusion,允许使用多个提示词及其权重进行组合生成。
运行该 WebUI 需要预先安装 Python 和 Git。官方推荐 NVIDIA GPU,但也支持 AMD GPU、Intel CPU/GPU 以及 Ascend NPU。对于 Windows 用户,提供了自动安装脚本或预发布包,需确保 Python 版本兼容(如 3.10.6)。Linux 用户需安装 wget、git 及相关系统库。Apple Silicon 用户需参考专门的安装指南。此外,用户还需满足特定的依赖库要求,具体参见官方仓库文档。若显存有限,最低支持 4GB 显存,甚至有 2GB 显存运行的报告,但建议使用更高配置以获得更好体验。
该项目适合希望在本地环境中进行 AI 艺术创作、模型微调及实验的个人开发者、数字艺术家及研究人员。它特别适用于需要精细控制生成过程、尝试不同模型组合及进行图像后期处理的场景。然而,由于其功能繁多且更新频繁,界面选项复杂,初学者可能需要一定时间学习。此外,虽然支持低显存运行,但在生成高分辨率图像或使用大型模型时,对硬件资源仍有较高要求。部分高级功能如代码执行需额外开启权限,存在潜在安全风险,需谨慎使用。