
Stable Diffusion 是 Stability AI 的开放权重文本生成图像模型家族,2022 年首发,当前主力 SD 3.5 系列含 Large / Large Turbo / Medium 三变体。采用 MMDiT 架构,可在消费级硬件运行,社区许可下个人与年营收低于 100 万美元的组织可免费商用,是开源 AI 生图事实标准。
产品概述
Stable Diffusion 由英国公司 Stability AI 开发,2022 年 8 月首次公开发布。它与 Midjourney、DALL·E 的根本区别在于:SD 发布的是模型权重而非仅提供托管服务——任何人都可以下载权重在自己的硬件上运行,包括消费级 GPU。
当前主力版本 SD 3.5 于 2024 年 10 月发布,包含三个变体:
| 变体 | 参数量 | 推理步数 | 显存需求 | 最佳场景 |
|---|---|---|---|---|
| 3.5 Large | 8.1B | 28 步 | 16-20 GB | 最高质量、服务器部署 |
| 3.5 Large Turbo | 8.1B | 4 步 | 16-20 GB | 低延迟大规模生成 |
| 3.5 Medium | 2.5B | 30 步 | 8-10 GB | 消费级 GPU(RTX 3060+) |
采用 MMDiT(多模态扩散 Transformer) 架构,使用三个固定的预训练文本编码器(clip_g、clip_l、t5xxl),并通过 QK 归一化提升训练稳定性。
授权模式(Stability AI Community License):
- 非商业使用:免费
- 商业使用(年营收 < 100 万美元):免费
- 商业使用(年营收 ≥ 100 万美元):需联系 Stability AI 购买企业许可
- 输出所有权:归生成者所有
核心能力
- 文本生成图像(Text-to-Image):SD 3.5 原生支持 1024×1024 分辨率,Medium 支持 0.25-2 MP 动态分辨率
- 图生图(Image-to-Image):以现有图像为参考生成变体,控制风格迁移
- 局部重绘(Inpainting):修复或替换图像的部分区域
- 外扩(Outpainting):突破原图边界扩展画面
- LoRA 微调:通过低秩适配训练小文件,将基础模型调整至特定风格、角色或概念
- ControlNet 精准控制:SD 3.5 的官方 ControlNet 即将推出,社区已有大量第三方实现
- 多模态扩展:Stability AI 同步推出视频生成、Stable Fast 3D(单图秒级生成 3D 对象)、Stable Audio(自然语言作曲与音效)
优势亮点
- 开放权重:模型权重可免费下载,可本地运行、可微调、可集成进自有应用
- 商业友好授权:年营收 < 100 万美元的个人与组织可免费商用,远超 Midjourney 的纯订阅制门槛
- 零边际成本:本地部署后无限次生成,无按张计费
- 消费级硬件可跑:SD 3.5 Medium 专为消费级硬件优化
- 生态最丰富:全球最大 AI 绘画开源社区,数万 LoRA、Checkpoint、插件、工作流
- 技术可控性最高:支持 LoRA 微调、ControlNet 精准控制、自定义训练
- 数据隐私:本地部署意味着数据不出域,金融、医疗、政企场景的刚需
局限
- 开箱美学不如 Midjourney:SD 需要调参、选模型、配 LoRA 才能达到 MJ 的美学水准
- 技术门槛高:本地部署需要 Python 环境、GPU 驱动、ComfyUI/Automatic1111 配置
- Turbo 模型有使用陷阱:guidance_scale > 0 会产生过饱和与故障图像,必须设为 0.0
- 高分辨率退化:原生 1 MP(1024×1024),2K+ 分辨率图像保真度下降,需后期放大
- T5-XXL 文本编码器权重巨大:单文本编码器占 9 GB 显存,是 GPU 显存压力主要来源
- ControlNet 官方支持滞后:SD 3.5 的官方 ControlNet 仍在开发中
适用人群
- 想要创作自由、自部署与隐私控制的开发者、研究者
- 进阶创作者与专业艺术家
- 需要批量生成、定制化训练的企业用户
- 注重数据不出域的金融、医疗、政企场景
如果你是 casual 用户、只想开箱即用获得最美图像,Midjourney 可能更合适;但如果你需要完全掌控模型、无限免费生成、可微调可集成,Stable Diffusion 是当前最成熟的选择。
安装与部署(以 ComfyUI 为例)
1. 硬件要求
| 组件 | 最低配置 | 推荐配置 |
|---|---|---|
| GPU | NVIDIA RTX 3060 8GB(需启用低显存模式) | RTX 4070+ 12GB 以上 |
| 显存 | 8 GB | 10-20 GB |
| 内存 | 16 GB | 32 GB+ |
| 存储 | 50 GB SSD | 100 GB NVMe |
| 系统 | Windows 10/11 或 Linux | Windows 11 / Ubuntu 22.04 |
RTX 4060 Laptop(8GB 显存)可通过 --lowvram 参数运行,但速度会稍慢。
2. 安装 ComfyUI
Windows(便携版,最简单):
- 下载 ComfyUI 便携包:
https://github.com/comfyanonymous/ComfyUI/releases/latest/download/ComfyUI_windows_portable_nvidia.7z - 解压到纯英文路径
- 双击
run_nvidia_gpu.bat,浏览器自动打开http://127.0.0.1:8188
Mac / Linux:
git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI pip install -r requirements.txt python main.py # Mac 自动使用 MPS;显存紧张加 --lowvram
3. 下载模型权重
从 Hugging Face 的 stabilityai 仓库下载(需同意社区许可):
主模型(放入 ComfyUI/models/checkpoints/):
sd3.5_medium.safetensors(推荐新手)- 或
sd3.5_large_fp8.safetensors(低显存方案)
三路文本编码器 CLIP(放入 ComfyUI/models/clip/):
clip_g.safetensorsclip_l.safetensorst5xxl_fp8_e4m3fn.safetensors(内存 < 32GB 使用 FP8 版本;≥ 32GB 推荐t5xxl_fp16.safetensors)
新手第一报错来源:漏装 T5 文本编码器。SD 3.5 使用三路文本编码架构,三个 CLIP 文件必须全部就位。
4. 加载工作流
将 ComfyUI 官方示例工作流 JSON 文件拖入界面,自动载入节点图。
5. 参数配置
| 模型 | 步数 | Guidance Scale | 分辨率 |
|---|---|---|---|
| 3.5 Medium | 30 | 4.5 | 1024×1024 |
| 3.5 Large | 28 | 4.5 | 1024×1024 |
| 3.5 Large Turbo | 4 | 0.0 | 1024×1024 |
Turbo 模型必须将 guidance_scale 设为 0.0,否则产生过饱和与故障图像。
6. 替代界面
| 界面 | 特点 | 适合人群 |
|---|---|---|
| ComfyUI | 节点式工作流,功能最强、对新模型支持最快 | 进阶用户 |
| Automatic1111 WebUI | 最流行,功能全面 | 习惯传统 WebUI 用户 |
| InvokeAI | 专业创意界面,节点式编辑 | 创意专业人士 |
| Fooocus | 开箱即用但功能精简 | 只想快速出图 |
相关导航


DeepSeek

OLMo

WAN

GLM

MiniMax

Kimi

