Stable Diffusion 3.5 详解:开源权重图像模型家族
Stable Diffusion 是你真正能自己运行的开源权重图像模型家族——下载权重、在自己的 GPU 上本地生成,再用社区的 LoRA 和 ControlNet 把模型改造成你要的样子。Stable Diffusion 3.5 是当前这一代(Large、Large Turbo 和 Medium),但这个家族真正的护城河并不是某一项跑分——而是围绕 SDXL 和 SD 1.5 建立起来的庞大开放生态:成千上万的微调模型、适配器和控制模型,是任何闭源 API 都追不上的。下面讲清楚这个家族包含什么、开源权重与托管 API 有何不同,以及它相对 FLUX.2、Midjourney 和闭源托管模型的定位。
Stable Diffusion 3.5 是什么?
Stable Diffusion 是 Stability AI 的开源权重文生图模型系列——权重公开发布,所以你可以下载下来,在自己控制的硬件上做生成,而不必去调用别人的 API。Stable Diffusion 3.5 于 2024 年年底发布,是当前这一代。它有几个尺寸:SD 3.5 Large(旗舰,约 80 亿参数)、SD 3.5 Large Turbo(蒸馏版本,用远少得多的步数出图),以及 SD 3.5 Medium(约 25 亿参数,为在更普通的消费级 GPU 上运行而调)。
但实践中的「Stable Diffusion」不止 3.5 这些检查点。这个名字还承载着开源社区至今仍大量在其上搭建的两代模型:SDXL(2023 年的 base + refiner 模型)和更老的 SD 1.5。二者共同支撑起开源图像生成中迄今为止最庞大的社区微调、风格 LoRA 与 ControlNet 目录。正是这套生态——而非单条提示词的原始画质——让 Stable Diffusion 在你需要私有化运行、需要微调、或需要精确控制时仍是首选。本文是独立的模型介绍,不代表 ReelWand 内可使用 Stable Diffusion;ReelWand 当前的在线图像 Agent 使用 Seedream 渲染。
Stable Diffusion 家族:该跑哪个模型
| 模型 | 规模 / 速度 | 适合 |
|---|---|---|
| SD 3.5 Large | 约 8B,完整画质 | 3.5 系列里画质最好的成图 |
| SD 3.5 Large Turbo | 约 8B 蒸馏,少步数 | 接近 Large 画质的快速草图 |
| SD 3.5 Medium | 约 2.5B | 消费级 GPU 上更省显存的生成 |
| SDXL 1.0 | 约 3.5B base(+ refiner) | LoRA / ControlNet / 微调生态最深 |
| SD 1.5 | 轻量、老一代 | 虽老但社区巨大;几乎什么显卡都能跑 |
最容易绕晕的一点:新的不一定就是该跑的那个。 SD 3.5 Large 在 3.5 系列里开箱即用画质最好,Turbo 则是要速度时的选择。但如果你的工作流依赖某个特定的社区微调、某个小众风格 LoRA 或某个成熟的 ControlNet,SDXL 往往仍是更实际的选择——纯粹因为围绕它的生态大得多。按你需要的工具来选,而不是按版本号。
Stable Diffusion 3.5 在 Stability AI 的 Community License 下发布。截至 2026 年,该许可大体允许免费用于研究、非商业用途,以及较小型组织的商业用途,超过某个营收门槛后需付费的企业级授权。具体条款会变——在用它搭建商业管线前,请以 Stability 官网上的当前许可为准。
开源权重:本地 vs API
真正使用 Stable Diffusion 有两条路,而这道分岔正是人们选择它的全部理由。
- 本地运行。 因为权重开放,你可以用 ComfyUI、Automatic1111 或 Forge 这类前端在自己的 GPU 上生成,或者通过 Diffusers 库接入代码。什么都不离开你的机器——这正是隐私敏感工作、离线管线、以及零单张费用无限迭代的吸引力所在。
- 调用托管 API。 如果你不想自己管 GPU,同样的模型也通过 Stability AI Platform 和第三方托管提供。你用本地的控制力和隐私,换取零搭建的省心,改为按张付费。
- 微调与适配。 正是开源权重,才让训练你自己的 LoRA 或整套微调成为可能——这是在 Midjourney 这类闭源模型上根本做不到的事。
本地运行有实实在在的硬件门槛。SD 3.5 Medium 和 SDXL 对一块普通消费级 GPU 更友好;SD 3.5 Large 需要明显更多的显存。如果你的显卡一般,就从 Medium 或 SDXL 起步,或者先用托管 API,等确认本地搭建值回票价再说。
ControlNet + LoRA 生态
选择 Stable Diffusion 最大的单一理由,不是基础模型——而是嫁接在它之上的开放工具链。因为权重公开,社区建起了一套闭源模型都没有的控制层:
- ControlNet 让成图以你提供的结构为条件——姿态骨架、深度图、Canny 边缘、涂鸦、语义分割图——于是输出跟随一个版式,而不是靠运气掷出来。
- LoRA 适配器是小巧、可随插随换的文件,无需重训整个模型就能教会它一个特定的角色、风格或主体。公开分享的有成千上万个,你也能训练自己的。
- IP-Adapter 与图像提示把一张参考图的观感或主体注入新的生成,用于风格迁移与角色一致性。
- 局部重绘(inpainting)与外扩(outpainting) 让你重生成被遮罩的区域,或把画布延展到边缘之外——这是物体移除、改风格和扩图的基础。
- 完整微调。 当 LoRA 不够用时,开源权重让你能在自己的数据集上训练一个完整的定制模型。
怎么选一套 Stable Diffusion 方案
- 先决定本地还是托管。 如果隐私、离线使用或无限免费迭代重要,就打算本地运行;如果都不重要,托管 API 直接省掉 GPU。
- 按显存匹配模型。 普通消费级显卡选 SD 3.5 Medium 或 SDXL;显存有富余再上 SD 3.5 Large;宁可牺牲最后几个百分点的画质换速度就用 Turbo。
- 跟着生态走,而不是版本号。 如果某个特定 LoRA、微调或 ControlNet 是你观感的核心,就跑那套工具所面向的基础模型——常常是 SDXL。
- 先加控制,再加提示词。 对版式要害的工作,一个 ControlNet 或一张参考图几乎每次都胜过更长的提示词。
- 搭配一个放大器。 Stable Diffusion 的成图常常要过一道专门的放大处理来收尾——工作流参见 如何用 AI 放大图片。
Stable Diffusion 与同类模型对比
| 模型 | 强项 | 注意点 |
|---|---|---|
| Stable Diffusion 3.5 / SDXL | 开源权重、本地控制、LoRA + ControlNet 生态 | 直书文字较弱;需要实打实的搭建 |
| FLUX.2 [dev] | 提示遵循、排版、自托管 | 较新,生态比 SDXL 小 |
| Midjourney v7 | 标志性风格化美感 | 闭源;不可自托管、无 ControlNet |
| GPT Image | 对话式编辑、版式推理 | 闭源、仅托管;无 LoRA |
| Seedream | 写实细节、托管省心 | 闭源权重 |
经验法则:当你需要自己运行模型、微调它,或用最深的开放控制栈精确操控它时,选 Stable Diffusion。当你想要最强的开源权重提示遵循和可读文字时,选 FLUX.2;当标志性的绘画质感比控制更重要时,选 Midjourney v7;当对话式编辑才是重点时,选 GPT Image 这类托管模型。如果你来这里是在选型,按用途选择 Midjourney 替代品 这篇指南把整个格局都梳理了。
开放生态是把双刃剑。社区的微调和 LoRA 在质量、授权和安全上参差极大,早期 SD 3.x 检查点也曾因复杂人体姿态下的解剖结构受到批评。请审核你下载的具体模型,确认其许可是否允许商用,并把直书文字渲染当作弱项——那不是这个家族最强的地方。
Stable Diffusion 的优势从来不是单张最好的成图,而是有上万人能拿走权重,把它掰成一个你从任何闭源 API 都买不到的观感。
Agent 在这里的位置
裸模型给你的是引擎,Agent 给你的是手艺。一套自托管的 Stable Diffusion 之所以强大,恰恰因为它开放——但这也意味着节点图、模型文件,和一套要你自己拼起来的控制层。ReelWand 的 插画画布 走的是另一条路:一套固定的风格 DNA——媒介、色板、线条粗细、成品质感——在服务端拼进每一次请求,会话记忆让你的下一条提示词在两小时窗口内继续迭代上一张成图。它当前的在线图像生成使用 Seedream,而不是 Stable Diffusion,但道理和开放生态教给我们的是同一个——稳定的风格加被引导的迭代,胜过一次性的乱掷。
在一个能让风格跨每张成图保持一致的「导演化」插画 Agent 工作流里创作。
用插画画布来创作常见问题
Stable Diffusion 3.5 是免费开源的吗?
权重是开放的——你可以自己下载并运行。Stable Diffusion 3.5 在 Stability AI 的 Community License 下发布,截至 2026 年大体允许免费用于研究、非商业用途,以及较小型组织的商业用途,超过某个营收门槛后需付费的企业级授权。商用前请以当前许可为准。
SD 3.5 的 Large、Turbo 和 Medium 有什么区别?
Large 是旗舰(约 80 亿参数),画质最好;Large Turbo 是蒸馏版本,用远少得多的步数出图,主打速度;Medium(约 25 亿参数)为在更普通的消费级 GPU 上运行而调。要画质选 Large,要速度选 Turbo,显存吃紧就用 Medium。
我该用 Stable Diffusion 3.5 还是 SDXL?
取决于你的工具链,而不是版本号。SD 3.5 开箱即用画质更好,但 SDXL 拥有更深的社区微调、LoRA 和 ControlNet 生态。如果你的工作流依赖某个特定适配器或模型,SDXL 往往是更实际的基础。
我能在自己的电脑上跑 Stable Diffusion 吗?
可以——这正是开源权重的意义所在。你可以用 ComfyUI、Automatic1111、Forge 这类前端本地生成,或通过 Diffusers 库接入。你需要一块够用的 GPU:SD 3.5 Medium 和 SDXL 适合普通消费级显卡,而 SD 3.5 Large 需要明显更多的显存。
Stable Diffusion 里的 ControlNet 和 LoRA 是什么?
ControlNet 让成图以你提供的结构为条件——姿态、深度图或边缘图——于是输出跟随一个版式,而不是随机构图。LoRA 是一个小巧的适配器文件,无需完整重训就能教会模型某种特定风格、角色或主体。两者都是开放的社区工具,正是 Stable Diffusion 最大的优势。
把它变成作品
专业图像 Agent 内置了本文所讲的创作方法。挑选一个当前可用的 Agent,开始创作。
属于 ReelWand 的AI 艺术与插画工具 工具集。