Stable Diffusion翻译站点

3周前更新 24 0 0

Stability AI 推出的开放权重 AI 生图模型家族。

所在地:
美国
语言:
英文
收录时间:
2026-08-10
Stable DiffusionStable Diffusion

Stable Diffusion 是 Stability AI 的开放权重文本生成图像模型家族,2022 年首发,当前主力 SD 3.5 系列含 Large / Large Turbo / Medium 三变体。采用 MMDiT 架构,可在消费级硬件运行,社区许可下个人与年营收低于 100 万美元的组织可免费商用,是开源 AI 生图事实标准。

 

产品概述

Stable Diffusion 由英国公司 Stability AI 开发,2022 年 8 月首次公开发布。它与 Midjourney、DALL·E 的根本区别在于:SD 发布的是模型权重而非仅提供托管服务——任何人都可以下载权重在自己的硬件上运行,包括消费级 GPU。

当前主力版本 SD 3.5​ 于 2024 年 10 月发布,包含三个变体:

变体 参数量 推理步数 显存需求 最佳场景
3.5 Large 8.1B 28 步 16-20 GB 最高质量、服务器部署
3.5 Large Turbo 8.1B 4 步 16-20 GB 低延迟大规模生成
3.5 Medium 2.5B 30 步 8-10 GB 消费级 GPU(RTX 3060+)

采用 MMDiT(多模态扩散 Transformer)​ 架构,使用三个固定的预训练文本编码器(clip_g、clip_l、t5xxl),并通过 QK 归一化提升训练稳定性。

授权模式(Stability AI Community License)

  • 非商业使用:免费
  • 商业使用(年营收 < 100 万美元):免费
  • 商业使用(年营收 ≥ 100 万美元):需联系 Stability AI 购买企业许可
  • 输出所有权:归生成者所有

 

核心能力

  • 文本生成图像(Text-to-Image):SD 3.5 原生支持 1024×1024 分辨率,Medium 支持 0.25-2 MP 动态分辨率
  • 图生图(Image-to-Image):以现有图像为参考生成变体,控制风格迁移
  • 局部重绘(Inpainting):修复或替换图像的部分区域
  • 外扩(Outpainting):突破原图边界扩展画面
  • LoRA 微调:通过低秩适配训练小文件,将基础模型调整至特定风格、角色或概念
  • ControlNet 精准控制:SD 3.5 的官方 ControlNet 即将推出,社区已有大量第三方实现
  • 多模态扩展:Stability AI 同步推出视频生成、Stable Fast 3D(单图秒级生成 3D 对象)、Stable Audio(自然语言作曲与音效)

 

优势亮点

  • 开放权重:模型权重可免费下载,可本地运行、可微调、可集成进自有应用
  • 商业友好授权:年营收 < 100 万美元的个人与组织可免费商用,远超 Midjourney 的纯订阅制门槛
  • 零边际成本:本地部署后无限次生成,无按张计费
  • 消费级硬件可跑:SD 3.5 Medium 专为消费级硬件优化
  • 生态最丰富:全球最大 AI 绘画开源社区,数万 LoRA、Checkpoint、插件、工作流
  • 技术可控性最高:支持 LoRA 微调、ControlNet 精准控制、自定义训练
  • 数据隐私:本地部署意味着数据不出域,金融、医疗、政企场景的刚需

 

局限

  • 开箱美学不如 Midjourney:SD 需要调参、选模型、配 LoRA 才能达到 MJ 的美学水准
  • 技术门槛高:本地部署需要 Python 环境、GPU 驱动、ComfyUI/Automatic1111 配置
  • Turbo 模型有使用陷阱:guidance_scale > 0 会产生过饱和与故障图像,必须设为 0.0
  • 高分辨率退化:原生 1 MP(1024×1024),2K+ 分辨率图像保真度下降,需后期放大
  • T5-XXL 文本编码器权重巨大:单文本编码器占 9 GB 显存,是 GPU 显存压力主要来源
  • ControlNet 官方支持滞后:SD 3.5 的官方 ControlNet 仍在开发中

 

适用人群

  • 想要创作自由、自部署与隐私控制的开发者、研究者
  • 进阶创作者与专业艺术家
  • 需要批量生成、定制化训练的企业用户
  • 注重数据不出域的金融、医疗、政企场景

如果你是 casual 用户、只想开箱即用获得最美图像,Midjourney 可能更合适;但如果你需要完全掌控模型无限免费生成可微调可集成,Stable Diffusion 是当前最成熟的选择。

 

安装与部署(以 ComfyUI 为例)

 

1. 硬件要求

组件 最低配置 推荐配置
GPU NVIDIA RTX 3060 8GB(需启用低显存模式) RTX 4070+ 12GB 以上
显存 8 GB 10-20 GB
内存 16 GB 32 GB+
存储 50 GB SSD 100 GB NVMe
系统 Windows 10/11 或 Linux Windows 11 / Ubuntu 22.04

RTX 4060 Laptop(8GB 显存)可通过 --lowvram 参数运行,但速度会稍慢。

 

2. 安装 ComfyUI

Windows(便携版,最简单)

  1. 下载 ComfyUI 便携包:
    https://github.com/comfyanonymous/ComfyUI/releases/latest/download/ComfyUI_windows_portable_nvidia.7z
  2. 解压到纯英文路径
  3. 双击 run_nvidia_gpu.bat,浏览器自动打开 http://127.0.0.1:8188

Mac / Linux

git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt
python main.py  # Mac 自动使用 MPS;显存紧张加 --lowvram

 

3. 下载模型权重

从 Hugging Face 的 stabilityai 仓库下载(需同意社区许可):

主模型(放入 ComfyUI/models/checkpoints/):

  • sd3.5_medium.safetensors(推荐新手)
  • sd3.5_large_fp8.safetensors(低显存方案)

三路文本编码器 CLIP(放入 ComfyUI/models/clip/):

  • clip_g.safetensors
  • clip_l.safetensors
  • t5xxl_fp8_e4m3fn.safetensors(内存 < 32GB 使用 FP8 版本;≥ 32GB 推荐 t5xxl_fp16.safetensors

新手第一报错来源:漏装 T5 文本编码器。SD 3.5 使用三路文本编码架构,三个 CLIP 文件必须全部就位。

 

4. 加载工作流

将 ComfyUI 官方示例工作流 JSON 文件拖入界面,自动载入节点图。

 

5. 参数配置

模型 步数 Guidance Scale 分辨率
3.5 Medium 30 4.5 1024×1024
3.5 Large 28 4.5 1024×1024
3.5 Large Turbo 4 0.0 1024×1024

Turbo 模型必须将 guidance_scale 设为 0.0,否则产生过饱和与故障图像。

 

6. 替代界面

界面 特点 适合人群
ComfyUI 节点式工作流,功能最强、对新模型支持最快 进阶用户
Automatic1111 WebUI 最流行,功能全面 习惯传统 WebUI 用户
InvokeAI 专业创意界面,节点式编辑 创意专业人士
Fooocus 开箱即用但功能精简 只想快速出图

相关导航