
1. Stable Diffusion不是魔法潜空间扩散到底是怎么回事1.1 从一张纯噪点图开始的去噪过程几年前我第一次看到Stable Diffusion生成图片时说实话有点不以为然觉得跟以前那些自动生成图片的小工具差不多。直到我亲眼看到一个人输入赛博朋克风中国小城市夜景霓虹灯照在湿润的柏油路上十几秒后出来一张从构图到光影都很完整的图我才意识到这东西和以前那些工具根本不是一类东西。Stable Diffusion生成的底层逻辑用一句话概括就是从一张完全随机的噪声图开始一步一步去掉噪声直到最后浮现出你想要的画面。这有点像你在冲洗照片时看着影像在显影液里慢慢显现只不过这里显影的过程有几千步被压缩成了几十步。它每一步都在做一个动作猜一下当前这团模糊的噪声里应该有什么结构然后根据你的描述把它细化一点。反复做几十次之后一张清晰的图就出来了。这里有个关键概念叫潜空间Latent Space。SD并没有直接在像素层面做这个去噪过程而是在一个压缩后的低维空间里完成的。你可以把像素想象成一张巨大的高清照片直接在照片上做运算非常消耗计算资源而潜空间就是这张照片的压缩版草稿SD在这个草稿上做去噪最后再通过一个叫VAE的解码器把草稿放大还原成像素级图片。这一步压缩很聪明它让普通消费级显卡也能跑得动大模型这也是为什么SD能成为本地部署最普及的AI绘画方案。1.2 训练阶段它到底学了什么搞清楚SD生成图片的原理还得看它的训练过程。SD本质上是一个图文配对学习的产物训练时喂给它海量的图片以及对应的文字描述让它在潜空间里不断做给一幅图加噪声、再让模型尝试恢复的练习。大量重复之后模型内部就形成了一种从随机噪声恢复图像、且匹配文字描述的能力。我用一个画家带学徒的类比来帮你理解一个画家学徒每天看大量成品画作老师给他描述这是一片森林他就会记住森林的色调和纹理老师又说这是阴天下午的森林他又记住阴天的光线氛围。练得足够多以后你给他一句阴天下午的森林薄雾他就能凭记忆和想象力画出差不多的东西而不是每次都照抄某一幅画。SD做的事本质上类似只不过它记住的不是某一幅图而是隐藏在庞大训练数据里的统计规律。理解这一点有什么用很有用。当你写提示词时本质上你是在搜索模型记忆空间里最合适的那一团特征。如果模型训练数据里几乎没有东北大花袄配赛博朋克这种组合那你怎么写也很难出好图——不是你的问题是模型的训练覆盖范围确实有限。这也解释了为什么换一个底模Checkpoint模型画风会差很多不同底模用的训练数据分布不一样记忆里的绘画风格就不同。1.3 为什么在本地跑一个开源模型是值得的现在在线AI绘画工具不少注册就用、不费显卡听起来挺省事。但我想说说为什么我建议你本地跑一套SD。理由有三条个个都很实际。第一批量出图和迭代成本完全在自己手里。在线工具大多按张收费或者有每日次数上限而本地跑一次生成的成本只有电费。你在调提示词的时候经常要出几十上百张对比试错在线工具限制一多就会打断思路本地环境里随便试毫无压力。第二可控性。本地部署的WebUI界面里你可以更换任何社区发布的模型、LoRA、VAE可以装ControlNet精准控制人物姿势和构图可以读取任何一张图的生成参数。在线平台给不了这个级别的可玩性。第三隐私。有些图你不想上传到任何人的服务器本地环境从启动到出图全程不联网数据不经过第三方。如果你的电脑显卡是NVIDIA的GTX 1060以上、显存有4GB就已经满足最低运行要求了。如果连这个条件都没有也别灰心后面我会说怎么用CPU跑或者用云显卡但体验会差一些建议优先考虑升级硬件或者用整合包里的低显存模式。2. 入坑第一步秋叶整合包下载、安装与首次启动2.1 硬件门槛显存至少4GN卡优先坦白说Stable Diffusion本地跑起来最核心的硬件就是显卡。如果你是NVIDIA显卡基本就走上了平坦大道——CUDA生态让SD的兼容性非常好。AMD显卡和苹果M系列芯片也能跑但中间需要转译配置遇到问题排查起来麻烦不少。所以我的建议简单粗暴如果你有选择余地组一台NVIDIA显卡的机器显存越大越好。不同显存对应什么样的体验我用一张表给你列清楚显存大小体验评价建议4GB能跑但很吃力512x512勉强高分辨率会爆显存加 --medvram 参数用轻量模型6GB768x512左右比较稳可以尝试简单的高清修复日常够用建议开启自动显存优化8GB可以较舒服地跑512x512~768x768上少量插件大多数人甜点区间12GB以上可以跑大图、批量出图高清修复体验很好玩插件、训练LoRA都从容最低从4GB起步但如果你真想把它当工具来用8GB是预算充足的甜点。别觉得这个门槛高——现在很多轻薄本的集显跑不了但你花几百块弄一张二手显卡也能获得不错的体验。CPU硬跑也行但一张512x512的图可能要磨蹭好几分钟会浇灭你的探索热情我不推荐。2.2 整合包安装与目录结构本教程写作时社区里最普及的安装方案是秋叶整合包它把Python环境、Git、CUDA依赖、WebUI主程序全部打包好了。原版部署方式需要你手动安装Python、配置虚拟环境、再拉取WebUI仓库自学者很容易在依赖安装环节劝退。秋叶整合包解压即用这也是它成为国内最多人入坑的原因。安装流程分三步第一步先安装一个全英文路径。下载整合包后通常得到一个压缩文件建议解压到D:\SD或E:\StableDiffusion这种路径路径里不要出现中文和空格。这一步很多人忽略结果后面各种报错找不到原因最后才发现是路径问题。第二步解压完成后进入目录你会看到启动器.exe和一些配置文件。双击启动器它会自动进行首次启动前的环境检测缺什么它会提示你一键修复。如果你的电脑缺.NET运行库或显卡驱动版本太低先处理这些提示再继续。第三步启动器界面里可以更新WebUI版本、管理模型文件、配置启动参数。在高级选项里可以看到显存优化设置4GB显存建议勾选启用显存优化medvram或者直接加一行--lowvram参数。然后点一键启动等待黑窗口里的进度条跑完浏览器会自动打开http://127.0.0.1:7860WebUI网页版就在眼前了。2.3 首次启动常见问题这些坑我先替你踩了第一次启动大概率会遇到几个典型的坑我挨个说一下怎么处理。一个是显存不足CUDA out of memory。这个错误最常见原因很简单你生成的图尺寸太大或者后台开的东西太多显存被吃满了。对策有两个第一把生成尺寸从默认的512x512改成更小的512x384第二在启动器高级选项里开启--lowvram或--medvram参数。如果是在生成中途报错先重启WebUI释放显存再调低参数。另一个是页面能打开但出图一直卡在Loading状态。这类问题通常是首次启动时模型还没加载完或者在后台下载VAE文件。耐心等三五分钟看黑窗口的进度条如果进度条卡在某一步不动再重启一次。还有一类问题是出图全是黑图或者花屏。这个九成是VAE文件缺失或者选错后面第五章会专门说到模型文件的管理你先记住在设置里把VAE选为自动基本能解决大半问题。我也要说一句掏心窝的话第一次启动时碰到什么问题都别慌SD社区的踩坑资料非常丰富你遇到的问题大概率有几千个人都遇到过搜索引擎一搜就有答案。心态放平动手解决这也是用SD的必经之路。3. WebUI网页版实战从空白页面到第一张成图3.1 界面模块六个常用功能区一次分清浏览器打开127.0.0.1:7860之后你看到的就是Stable Diffusion WebUI网页版的操作界面。我第一次打开时其实有点懵顶上一排标签页不知道先点哪个。这里帮你梳理一下最常用的六个功能区以后你90%的时间都会在这几个界面之间切换。首先是txt2img文生图这是你之后使用频次最高的页面。上面一个大输入框写正向提示词下面一个大输入框写负面提示词再往下是各种参数面板出图按钮就在右上方。其次是img2img图生图它允许你上传一张底图SD会在原图基础上按你的提示词重新演绎比如把线稿上色、把照片转风格。第三个是Extras后期处理专门用来放大图片、修复画质很多时候出图效果不错但分辨率不够就靠它来补救。第四个是PNG Info图片信息把网上看到的人家生成的PNG图拖进去能看到它的完整参数这是学习别人思路的神器。第五个是Settings设置全局配置都在这里比如SD的默认采样器、默认参数、模型目录路径等。最后是模型切换下拉框它不在标签页里而在页面左上角可以快速切换当前使用的大模型和VAE。这些模块之间是什么关系用一个工作流来串在txt2img里想好描述、设置好参数点生成不满意就复制种子到图生图里微调出图的最终效果满意了但觉得分辨率不够丢到Extras里放大。一条完整的生产链路就是这样。3.2 写第一组提示词语法和结构在WebUI里生成图片最重要的输入就是提示词。我的建议是第一张图不要上来就想写出什么绝世好词先把流程跑通。打开txt2img页面在顶部第一个输入框里输入你想要的画面。这里的关键是使用英文因为SD的训练数据以英文为主中文理解能力相对弱很多。如果你英语不好可以借助翻译软件或者先把中文写在纸上理清思路再翻译成英文。我常对朋友说写提示词就像给一个懂英文但不懂专业术语的朋友描述画面要具体、要细节。一个基础提示词可以这样分四层来写我用一个例子说明主体a girl with silver hair, red eyes, wearing black hoodie环境in a cyberpunk street, neon signs, rainy night风格anime style, detailed background质量附加词masterpiece, best quality, highly detailed, 8k wallpaper合起来就是一个还不错的初稿a girl with silver hair, red eyes, wearing black hoodie, in a cyberpunk street, neon signs, rainy night, anime style, detailed background, masterpiece, best quality, highly detailed, 8k wallpaper同时千万不要忘记下面那个负面提示词框它是提高图片质量的隐藏武器。里面填你不想在画面中出现的东西比如lowres, bad anatomy, bad hands, extra fingers, blurry, watermark, signature, deformed, ugly负面提示词就是告诉SD什么不要出现在画面里。很多新手不懂这一点只在正向里堆词结果画面不是手指画崩了就是多出奇怪的东西。把常见的负面词先存成一个模板以后每次生成都用上。3.3 采样步数、CFG这些参数先别乱动第一次出图时面对满屏的参数很容易手忙脚乱。我的建议是第一张图只动三个地方其他全部保持默认。第一个是采样方法Sampling Method。默认通常是Euler a这个适合新手先体验跑得快、出图也稳定。第二个是采样步数Sampling steps默认20比较合理它表示去噪过程中细化多少步。太少比如10步图片还没显影完全太多比如80步并不会让图片更好只是白白增加等待时间。20到30是一个很舒服的范围。第三个是CFG Scale提示词相关性默认7基本适用大多数场景。CFG值越高SD越严格遵循你的提示词但过高的CFG会导致画面色彩过饱和、结构生硬值太低则画面可能跟你的描述关系不大。7左右是一个比较平衡的位置。其他如种子Seed、尺寸Width/Height、批量次数Batch count你先不用管。Seed留为-1表示随机尺寸保持512x512批量次数一次出1张就好。设置好之后点右上角的Generate按钮屏幕上会进度条滚动十几秒后一张图就会出现在右下角。第一张图出现时可能带着各种粗糙感但那其实是你正式入坑的时刻。调整提示词、换种子、加细节你会慢慢看到它从能出图变成出好图。4. 高质量出图的关键心法提示词、采样器和模型的三方配合4.1 提示词先想构图再堆词质量分水岭在这里从能出图到出高质量图分水岭首先在提示词。新手容易犯的毛病是堆词一口气写上一大串形容词实际出来的画面却乱七八糟。我后来摸索出的方法是先想构图再写描述。你在脑海中想象画面里有个什么主体、什么背景、什么光线、什么镜头视角然后顺着这个思路逐条写出来。这样出的图不会是一团随机元素的堆砌。下面给一套我常用的提示词结构模板你可以直接拿去套画质和风格定位masterpiece, best quality, ultra-detailed主体描述外观、衣着、表情、动作环境与背景地点、时间、天气、氛围光影与色调光照方向、光源颜色、整体色调镜头与构图close-up,full body,wide shot等细节补充材质、纹理、特殊质感词另外提示词里加权重很有用。SD里用(关键词:1.2)这种格式给关键词额外加权数字大于1表示更强调小于1表示减弱。比如我想让画面双马尾的特征更明显就写(twin tails:1.3)。这个功能在微调的时候几乎是必备技能。还有一个必须说透的认知提示词的风格词决定了画风的上限大模型本身才决定画风的底盘。你用二次元底模写什么词都偏二次元你用写实底模照片感会更强。提示词和模型是配合关系不是替代关系。4.2 采样器的性格差异不是所有采样器都一样你可能好奇采样方法那一大堆选项有什么区别。我试下来总结了一句大白话不同采样器就像性格不同的画家努力程度一样但风格和稳定性差异明显。常用的几个值得你认真理解Euler a速度快出图风格偏柔和适合初学和快速试错。其中a代表ancestral祖先采样它会带有一定随机性即使固定种子也可能有细微差异。DPM 2M Karras目前社区公认的均衡之王细节丰富、色彩扎实在20~30步时表现非常好。如果你只打算记住一个采样器记住这个就够了。DDIM比较克制出图确定性更强适合想要精准复现同样的画面时用。DPM SDE Karras质量很高但速度偏慢适合追求极致细节时使用。选定了采样器步数和CFG也要跟着调整。用DPM 2M Karras时步数推荐在22到30之间CFG在5到8之间比较舒服。但有一个坎要注意过高的CFG配合过高的步数不但不会让画面更精细反而容易出现颜色堆积、边缘发硬的问题。我在实践中基本坚持CFG 6~8、步数25~30这个保守组合绝大多数场景都不会翻车。给一个判断方法当你发现画面细节开始变得油腻、边缘出现一圈黑色线条时大概率是CFG太高了。这时候调低CFG到6以下马上清爽很多。4.3 从糊到高清高清修复与放大实操本地SD直接生成1024x1024以上的图很多显卡会喘不过气。但实际出图又需要高分辨率怎么办标准方案是先用低分辨率快速出图然后用高清修复Hires.Fix把图放大细化。在WebUI的txt2img页面勾选高清修复它会在你原有低分辨率出图的基础上对图片进一步细化放大。核心参数有这两个你需要理解缩放倍数Upscale一般设1.5到2倍。512x512设2倍就变成1024x1024。重绘幅度Denoising strength这个值控制在0.3到0.5之间较为合适。可以理解为放大时重新绘制图片的程度太高会改变原图内容太低则图片放大后还是软趴趴的。还有一个思路是先用文生图生成一张满意的512x512原始图把它拖到Extras页面选择放大算法比如ESRGAN_4x或Real-ESRGAN也可以得到一张更干净的放大图。两种方式对比下来高清修复因为是在放大过程中重新绘制细节效果通常比简单放大更自然但原生Extras放大速度更快。如果是精细构图的图我优先用高清修复如果是风景壁纸那类对细节要求不高的图Extras更快更稳。5. 模型文件管理决定画风的底层发动机5.1 checkpoint底模怎么选你的画风地基初学SD很容易忘记一件事默认自带的那个底模画出来并不好看真正决定画风的是你下载并切换的大模型Checkpoint。这个文件放在models/Stable-diffusion目录里体积通常在2GB到7GB之间。它就像相机的镜头提示词是拍摄参数——你用手机镜头和用长焦镜头拍出来的东西构图逻辑和成像质感完全不同。目前社区里几个知名度极高的底模方向我简单列一下供你选择时参考底模方向代表模型适合场景二次元动漫风Anything V5、Counterfeit动漫头像、插画、漫画风写实人像风ChilloutMix、majicMIX realistic人像摄影风、真人风格半写实半插画DreamShaper概念设计、混合风格3D渲染风revAnimated游戏CG、3D质感插画怎么找到这些模型可以先在模型托管社区如Civitai按名称搜索下载时注意看下面的版本说明和示例图确认是第一代还是改进版再看文件大小是否符合预期。下载好之后放进目录回到WebUI左上角切换并应用就可以用了。这里有一个非常关键的经验底模决定你出图的种族值提示词只是努力值。你用Anything V5再怎么加photo想生成写实照片效果依然偏向动漫反之用写实底模想画出纯二次元风也很难。所以先想清楚你要什么画风然后再选底模事半功倍。5.2 LoRA、VAE和Embedding让画面更精细的三个补充件把底模比作底锅那LoRA、VAE和Embedding就是各种调料。它们可以在不大改底模的前提下微妙地改变画面风格。LoRALow-Rank Adaptation一种轻量级微调模型体积很小只有几十到几百MB放在models/Lora目录里。它专门用来调整某一类特定对象或风格比如某个角色的服装机甲风格水墨画风格。使用方式是在提示词里写触发词然后设置LoRA权重如lora:starry_style:0.80.8就是它的影响强度。权重太高容易过拟合画面变得怪异0.5到0.9是一个常用的区间。VAE前面提到过它是把潜空间解码回像素的组件。一个合适的VAE能让图片色彩更饱和、对比度更舒服。如果你发现出图发灰、发白、像蒙了一层雾大概率是VAE设置不对。正常情况下你在设置里让VAE为自动或者选择vae-ft-mse-840000这类通用VAE文件即可。Embedding是一类极小的文本向量文件放在embeddings目录里。最实用的玩法是负面嵌入把常见崩坏元素训练成一个触发词写在负面提示词里一次性规避多种问题。比如bad-hands-5这个知名的负面嵌入可以在很大程度上减少手指画错的问题。5.3 一套标准的模型目录规划很多朋友下载了一堆模型之后目录乱作一团换模型靠猜。我建议从一开始就养成规划目录的习惯。进入WebUI的models目录结构是这样的models/ ├── Stable-diffusion/ # 大模型文件夹 ├── Lora/ # LoRA模型文件夹 ├── VAE/ # VAE文件夹 ├── embeddings/ # 文本向量文件夹 └── ControlNet/ # 新增的辅助控制模型文件夹下载好模型后对应放入文件夹不要放错位置。放错后WebUI界面中找不到文件不是文件丢失是路径放错了。每次下载模型后顺手重命名在前面加上类别前缀比如chilloutmix_Ni_pruned_fp32.safetensors重命名为realistic_chilloutmix_v1.safetensors方便自己识别。同时在图片管理上建议把每次满意的图连同生成的PNG参数文件一起保存——PNG文件里自带生成信息以后回看直接拖进PNG Info页面就能复原参数。模型文件后缀也要说一下。最常见的两种是.ckpt和.safetensors两者用法相似但.safetensors更安全因为它不会携带可执行的Python代码社区现在也推荐优先下载.safetensors格式。如果只看到.ckpt版本也问题不大但请务必从你信得过的来源下载。6. 从学到用学习路线和几个真实的应用场景6.1 我给新手的四阶段学习路径SD上手不难但要走得远需要一条有梯度的学习路径。我给朋友的建议是分成四个阶段每个阶段聚焦一个目标。第一阶段是跑通流程。目标是完成从安装、启动到出一张图的全过程。这个阶段只学三件事安装环境、写基础提示词、点生成按钮。不要急着追求画质先让能出图成为肌肉记忆。第二阶段是配方微调。目标是稳定输出不辣眼睛的图。学习和掌握提示词结构、采样步数、CFG、种子、高清修复这些核心参数学会反推别人的PNG参数。你开始理解哪些设置会影响画质。第三阶段是模型理解。目标是能够根据需求选择并搭配模型。你开始换底模、加LoRA、配置VAE懂得每种模型文件的用途和摆放位置。到这个阶段你算是出师了能独立完成一次从需求分析到成图的完整任务。第四阶段是工具链进阶。这时候可以涉猎ControlNet精准控制、批量出图、LoRA训练、ComfyUI工作流等高级玩法。你会逐渐发现SD已经不只是生成一张图的小工具而是一套可以融入工作流程的图像生成引擎。6.2 这些场景能真正用SD干活有人觉得SD就是用来生成壁纸和头像的娱乐玩具我不同意。在过去一年里我见过太多人和团队把它当成生产力工具实打实节省了大量成本和时间。最直接的是内容创作配图。自媒体作者、公众号小编可以用SD快速生成文章封面图、配图素材版权清晰风格统一。以前找人设计一张封面图要等几天现在几分钟能迭代十几版效率完全不是一个量级。其次是电商和广告素材。商品图、概念图、营销海报SD可以快速生成不同风格和背景的初稿给设计师做视觉参考。虽然不建议直接商用但作为灵感参考和快速提案工具价值非常大。还有游戏和动画的前期概念设计。游戏团队在立项阶段需要快速探索美术方向SD生成的概念草稿可以帮助团队在几小时内测试多种风格省下大笔外包比稿费用。小说和漫画创作者也会用它来做人设草图、场景氛围小样辅助创作流程。甚至室内设计和产品设计领域也能用它做方案预览。我认识一位设计师会把户型描述成提示词生成不同风格的软装效果图给客户看意图虽然精度不够最终落地但沟通效率提升了很多。6.3 一些务实的合规与避坑建议最后我必须认真跟你说几句关于实际使用中的分寸问题。第一注意不同平台的规则。很多素材网站和电商平台对AI生成内容的准入要求不一样有的需要主动声明有的禁止上架。在实际商用或公开发布前务必先确认目标平台的规则。第二尽量避免直接模仿特定在世艺术家的个人风格也要避开有明显版权争议的画风。SD社区目前对这个话题非常敏感尊重原创和版权不仅是法律问题也是社区共识。你可以把你的提示词和LOGO声明为个人学习用途但大规模商用就一定要谨慎。第三注意文件管理和备份。大模型文件动辄几个GB删错一个文件重新下载就很痛苦。建议定期整理模型目录不要一股脑堆在一起。第四也是我最想强调的SD生成图片的能力很强但很多场景下你依然需要基础的审美和设计能力。它本质上是放大你的创意而不是替代你的创意。会写提示词不代表会做设计审美这个东西才是真正的护城河。所以别把精力全部花在堆叠技术技巧上多看看好作品、多学习构图和色彩的基本知识你使用SD生成的内容质量和创意水平才会真正水涨船高。写到这儿我最深的体会是Stable Diffusion最大的魅力不在于它能把提示词变成图而在于它把视觉创意这件事的成本拉到了前所未有的低。你不需要会画素描不需要会用Photoshop只要你能想清楚自己想表达什么它就能帮你把想法渲染出来。这种能力迭代速度有多快我猜你自己跑几十张图之后就会深有体会。