REELWAND
模型资源对比
打开 ReelWand
资源/扩散模型是怎么工作的?一份大白话讲解

扩散模型是怎么工作的?一份大白话讲解

术语/作者 Gan Liu/2026年8月29日/9 分钟阅读

扩散模型生成一张图的方式,是从一片随机噪声出发,在你提示词的引导下一点点把噪声擦掉,直到剩下一张图像。 这一个念头,就撑起了 FLUX.2、Stable Diffusion 以及你用过的大多数工具。本文用大白话把它拆开:前向与反向两个过程、「隐空间」到底买来了什么、提示词怎么引导去噪,以及为什么换一个种子会得到「相关但不同」的图。它是 什么是文生图 的机制版;如果你不想碰这些管道,只想直接导演一个,插画画布 会替你把手艺握在手里。

术语

本页目录

  1. 什么是扩散模型?
  2. 它是怎么把噪声变成图的?
  3. 什么是隐空间,它为什么要紧?
  4. 种子和引导系数是什么?
  5. 所有 AI 图像模型都是扩散模型吗?
  6. 扩散模型到哪为止,Agent 从哪接手?
  7. 常见问题

什么是扩散模型?

扩散模型是一个被训练来「给图像去噪」的神经网络——而所谓生成,不过是把这项本事循环跑一遍。这个名字来自物理:想象一滴墨水在水里扩散,直到整杯水变成均匀的灰。训练教会模型把这个过程倒着走,从灰里把一张干净的图重新拉回来。一旦它能稳定做到这一点,你就可以递给它一片全新的雪花点,让它把这团静电「反扩散」成某种新东西。

这一点为什么重要:模型从不背下图片再回放。它学的是真实图像长什么样的统计形状——皮肤、天空、金属、排版通常怎样排布——朝这个形状去噪,才是它每次都生成一张全新图像的原因。想看「输入到输出」这层更高层的约定,文生图入门 讲的是提示词和模型;本文只钻底层。

它是怎么把噪声变成图的?

这里有两个过程,而且方向相反。前向过程只在训练时发生:拿一张真实图像,加一点高斯噪声,再加一点,如此反复,直到它和雪花点无法区分——并记录下每一步加了多少噪声。反向过程就是生成:从雪花点出发,一步步「预测再减掉」噪声,直到一张干净的图浮现。模型自始至终只被训练把一件小事做好——「给定这张略带噪声的图,加进去的是什么噪声?」——其余一切,都是把这一招重复无数遍。

前向过程(仅训练时)反向过程(生成时)
从一张真实图像开始从纯随机噪声开始
小步小步地加噪小步小步地减掉预测出的噪声
终点是一片没有特征的雪花点终点是一张干净、贴合提示词的图
教模型认识噪声长什么样用这项本事「雕」出一张图
不涉及提示词每一步都被你的提示词引导

让人一下子想通的心智模型:模型不是从空白画布往外画,而是从一整块静电里雕出一个形象。每一步都朝你提示词指的方向凿掉一点随机性。没有什么东西是「画」上去的,更像是被揭示出来——而你起手的那块静电,直接决定了最终的形状,这也正是种子为什么这么要紧。

别再想象模型在画一幅场景。想象一位雕塑家拿到一块大理石和一把凿子——你的提示词就是那把凿子,每一次去噪都凿掉一点石头,直到形象立在那里。

什么是隐空间,它为什么要紧?

几乎每一个现代系统都是隐空间(latent)扩散模型,意思是它在一个压缩过的空间里加噪和去噪,而不是在全分辨率像素上——正是这一招,让这项技术快到能落地。一个独立的小网络(变分自编码器,VAE)把图像压成一小格数字,保留有意义的结构、扔掉像素级细节。扩散在那个逼仄的空间里发生,每一步都很便宜,直到最后一刻,才由解码器把成品展开回一张全尺寸图像。

实际的好处是速度和显存:把一小格隐表示去噪几十次,远比在几百万像素上折腾便宜,这才让模型能跑在一张普通显卡上,而不是一整机柜。代价是 VAE 偶尔会把极细的细节抹糊——发丝、布料纹理、微小文字——因为这些细节在进去时就被部分丢掉了。这也是为什么生成后做一次轻度放大或细节补偿,往往立竿见影。

种子和引导系数是什么?

这是你真正会去拧的两个旋钮:种子(seed)决定你从哪一块噪声开始雕,引导系数(guidance scale)决定模型多听你的话、还是多按自己的性子来。提示词经由文本编码器变成数字,这些数字被注入每一步去噪(通过交叉注意力),模型才知道往哪个方向凿。无分类器引导(classifier-free guidance)是旋钮背后的机制:模型悄悄预测两次——一次带你的提示、一次不带——然后把两者的差放大。引导系数,就是放大多少。

设置控制什么推到极端会怎样
种子(seed)起始的那块噪声相同种子+提示+设置,每次都是同一张图
引导系数(CFG)多严格地照提示词办太低会无视你的话;太高会又糊又过饱和
采样步数去噪跑多少遍太少显得没熟;过了某点,再多只是烧时间
采样器(sampler)每一步迈多大的配方快采样器几步就能得到干净的图

四个里最被误解的是种子。它只是一个决定初始雪花点的整数,行为就像一块特定的大理石。提示词、设置、种子都保持一致,你会拿到逐字节一模一样的图——生成是确定性的。只改种子,你就得到同一份 brief 的一张全新构图,因为你递给雕塑家的是另一块石头。这就是「重掷一次」为什么给你新图,也是当你想「只改一处、别重画整张」时该锁住种子的原因。

一旦碰到一个满意的构图,就锁住种子,一次只改一个词。 种子既然固定,输出的任何差别就都来自你的改动,而不是运气——这把「生成然后祈祷」变成了你真能掌舵的东西。只有当你想要一个彻底不同的版本时,才把它解锁。

当一张图出错时,你该拧哪个旋钮,取决于它是怎么错的:

  1. 提示词被忽略 / 结果很平庸——把引导系数往上推一点,并把主体放到提示词最前面、写得更具体。
  2. 画面又糊又过曝、颜色刺眼——引导系数太高了,往回调。
  3. 思路对,但想要另一个版本——只改种子,其余原封不动。
  4. 构图对,只想修一处细节——保持种子不变,只改描述那处细节的词。
  5. 发软、没熟——加几步采样,或事后做一次轻度放大。
  6. 迭代太慢——用现代快采样器、少跑几步;你很少需要默认值那么多。

所有 AI 图像模型都是扩散模型吗?

不是——截至 2026 年 8 月,扩散是主流路线,但不是唯一一条。有些较新的系统自回归地生成图像,像语言模型逐 token 写字那样一块块预测,这往往有助于指令遵循和图内可读文字。另一些则是两者兼取的混合架构。你不必盯着某个工具用的是哪套管道也能拿到好结果——「输入提示、输出图像」的约定是一样的。变化的只是各自最强的地方。

路线怎么把图搭出来取舍
扩散在许多步里给雪花点去噪质感和风格路数丰富;迭代式,单张更慢
自回归按顺序、一块块地预测图像指令和文字更强;失败方式不同
混合把去噪和顺序预测揉在一起想两头都占;更新、也更没被打磨过

实际的前沿是一锅混合。像 GPT Image 死磕指令遵循,Ideogram 3 强在排版,FLUX.2 强在提示遵循度和照片级细节——底下的内部机理各不相同。按活儿选,别按架构选。

扩散模型到哪为止,Agent 从哪接手?

搞懂引擎怎么转,并不能免去你在每一句提示里重复输入同一套风格、打光和质量术语——这道缝,正是导演化 Agent 来填的。ReelWand 的 插画画布 坐在模型之上,带着一套固定的、服务端的风格 DNA——媒介、色板、线条粗细、成品质感——拼进每一次请求,于是你只写主体和构图,其余的堆叠由它接管。它当前的在线生成使用 Seedream。因为它保留大约两小时的会话记忆,你的下一句提示会在上一张成图的基础上迭代,而不是从一块冰冷的噪声重新开始——这正是前面那套「锁种子」的纪律,只不过由它替你做了。

描述你想要什么,让插画画布替你把风格、打光和一致性都握住。

去导演扩散模型,而不是跟它较劲

常见问题

一句话说,扩散模型是什么?+

扩散模型是一种靠去噪来生成图像的 AI。它被训练成拿一张带噪的图、预测其中的噪声;生成时它从纯随机雪花点出发,在你提示词的引导下一步步把噪声清干净,直到一张全新的图浮现。

扩散模型为什么要从噪声开始?+

因为它训练的正是「加噪」的逆过程。训练时模型看着真实图像变成雪花点,并学会把它撤销。生成从一片随机噪声起步,就给这项学到的「去噪」本事一块可雕的料,而起始噪声的随机性,正是每次结果都不一样的原因。

引导系数(CFG)是做什么的?+

引导系数控制模型多照字面听你的提示词。底层里它会带提示和不带提示各预测一次,再把两者的差放大。设得太低,模型会跑偏离你的话;设得太高,画面会过饱和、发糊发「炸」。一个中等的值通常最耐看。

为什么换个种子就换一张图?+

种子决定模型从哪一块随机噪声出发。保持种子、提示词和设置不变,你每次都得到同一张图——生成是确定性的。只改种子,就等于递给模型另一块起始料,于是它从同一份 brief 里雕出一张相关但不同的图。

扩散模型和 GAN 是一回事吗?+

不是。GAN 靠生成器和判别器对抗、一次前向就出一张图;扩散模型则在许多去噪步里把图逐渐搭出来。文生图之所以基本用扩散取代了 GAN,是因为它训练更稳定,覆盖的主体和风格也更广。

扩散模型需要跑多少步?+

看采样器。老一点的设置要跑几十步;现代快采样器几步就能得到干净的图。步数在某个点之前有帮助,之后就只是烧时间而不改善画面,所以最佳区间通常比默认值更低。

立即体验

把它变成作品

专业图像 Agent 内置了本文所讲的创作方法。挑选一个当前可用的 Agent,开始创作。

打开 Illustration Canvas

属于 ReelWand 的AI 艺术与插画工具 工具集。

继续阅读

  • 什么是 AI 视觉 Agent?→
  • FLUX.2 详解→
  • 2026 年最好的 AI 图像生成器→
REELWAND

一站式 AI 视觉创作工作室——电商产品图、证件照/头像、设计等数十个工具。

English·中文
ReelWand - Featured on AI Agents DirectoryFeatured on ToolhunterFeatured on MossAI ToolsFeatured on twelve.tools
产品模型对比价格摄影设计艺术人像
指南资源最佳 AI 产品摄影工具
© 2026 Jincove LLC·Terms of ServiceAcceptable UsePrivacy PolicyRefund PolicyContact

ReelWand is created and operated by Jincove LLC · 30 N Gould St Ste N, Sheridan, WY 82801, USA

Third-party AI model and provider names are trademarks of their respective owners. ReelWand is independent and is not affiliated with or endorsed by those providers.