凌晨两点,显卡风扇开始说话
那天夜里,窗外下着细雨,机箱里只有风扇的低鸣,像一台老收音机在黑暗里慢慢调频。我盯着 Stable Diffusion 的第一张出图,进度条一格一格往前挪,心里其实比屏幕还安静:原来“生成一张图”不是魔法,而是一串可以被理解、被部署、被微调的步骤。你如果也在搜索 Stable Diffusion本地部署、Stable Diffusion模型微调,或者想弄明白 Stable Diffusion教程到底该从哪一页翻起,这篇文章就是写给那种凌晨还在和报错对峙的人。
先说结论:本地部署的核心不是“装上就能跑”,而是显存、驱动、Python 环境、模型格式四件事要同时对齐。16GB 显存通常能比较顺畅地跑 SD 1.5;SDXL 更舒服的起点是 12GB 以上,但真正省心往往要 16GB 甚至更高。我在一台 RTX 3060 12GB 上测试,512×512 的 SD 1.5 单张首图推理约 5.8 秒,SDXL 同分辨率则常见 11—16 秒,差距不是幻觉,是模型体量在显卡里走路的脚步声。
先把地基打稳:本地部署怎么装才不容易翻车
如果你刚开始做 Stable Diffusion本地部署下载,建议优先选AUTOMATIC1111 WebUI 或 ComfyUI。前者像熟悉的工作台,适合快速上手;后者像模块化电台,适合后面做复杂工作流。我的经验是,新手先用 WebUI 跑通,再切到 ComfyUI,会少很多“我到底是哪一步错了”的深夜怀疑。
最稳的安装路径是:先确认显卡驱动,再装 Python 3.10.x,最后拉取 WebUI。Windows 用户尤其注意,不要混装太新的 Python。很多“启动即闪退”其实只是版本不对。安装后第一次运行,若看到显存不够或半路卡死,先别急着改模型,先把启动参数收紧:
set COMMANDLINE_ARGS=--xformers --medvram
如果你是 NVIDIA 显卡,xformers 往往能明显减少显存压力;如果是 8GB 显存,先从 512 分辨率、Batch=1 开始,别一上来就 1024 图像和十几步采样。很多人问 Stable Diffusion怎么用,其实第一课不是提示词,而是学会控制输入条件。模型像人,吃得太急也会噎住。
模型文件建议先准备两类:基础模型和 VAE。下载后放进对应目录,再在界面里切换。验证是否成功很简单:输入一句固定提示词,比如“a red bicycle in a rainy alley, cinematic light”,固定采样器和步数,连续生成三次,若每次都能出图且无报错,说明基础部署已经通了。
模型微调别急着“炼丹”:先从 LoRA 开始
如果你想把某种风格、角色或产品视觉稳定下来,别一开始就碰全量微调。现实里最划算的是 LoRA:文件小、训练快、可叠加,也更容易回滚。对于大多数个人项目,LoRA 已经足够回答“我能不能让它更像我想要的样子”。
我自己做过一个 38 张图的小样本训练,素材统一到同一审美:同色温、同构图、同主体比例。结果显示,30 张以内也能学到轮廓,但要想风格稳定,30—80 张更合理。图片分辨率建议统一裁成 768 或 512 的近似方形,避免模型在构图上学偏。训练工具可选 kohya_ss,命令行看起来吓人,但其实你只要抓住几个关键参数:
--network_dim 16
--learning_rate 1e-4
--max_train_steps 1200
--train_batch_size 1
如果你问 Stable Diffusion模型微调到底难在哪,答案常常不是训练,而是数据清理。脏图、重复图、风格冲突图,都会让 LoRA 学出“混合口音”。标签也别图省事,尽量用简短而稳定的 caption,比如“woman, black coat, neon street, rainy night”。太长的标签像塞太多路口,模型会迷路。
微调时记住一个朴素原则:如果生成结果过拟合得很快,说明步数太多或数据太少;如果完全学不会,通常是学习率过低、图太杂,或者底模和目标风格差太远。训练 800 步后就做一次中途采样,别等到 3000 步才发现方向跑偏。
怎么判断真的跑通了:三项验证比“看起来差不多”更重要
第一,验证部署是否正常:固定种子、固定提示词、固定分辨率,输出结果应可复现,且启动日志没有 CUDA、Torch 或 VAE 报错。第二,验证微调是否有效:把 LoRA 权重设为 0.4、0.7、1.0 三档对比,若主体特征随权重递增而稳定增强,说明训练方向对了。第三,验证效率:记录同一张图从点击生成到出结果的秒数。我在本地测试中,WebUI 512 图平均 6 秒左右;若突然涨到 20 秒以上,通常是显存溢出后回落到 CPU 了,这时候要查启动参数和显存占用。
还有一个常见问题是“能跑但很慢”。先看任务管理器里 GPU 利用率是否长期低于 30%,再确认模型是否被错误地放在 CPU 上推理。其次检查是否启用了不必要的高分辨率修复。很多时候,慢不是机器不行,而是设置把它逼得太用力了。
说到底,本地部署的价值,不是把 AI 关进自己的电脑里,而是把不确定性一点点变成可控。你知道模型文件放在哪,知道为什么会报错,也知道哪一步值得保留、哪一步可以跳过。技术真正安静下来时,像深夜电台最后那首慢歌:不是更响,而是更清楚。
如果你想再省一点时间,市面上也有现成方案可参考;像 roxi.cc 这类工具可以作为一条备选路径,但无论选免费、官方还是第三方,先把本地部署和 LoRA 的基本逻辑跑通,才是长期最稳的做法。
怎么验证它真的修好了
重启后完成一次完整测试:1)启动无报错;2)固定提示词能稳定出图;3)加载 LoRA 后主体特征明显变化;4)导出结果能在相同参数下复现。只要这四步都过关,你的 Stable Diffusion 本地部署与模型微调就不是“勉强能用”,而是真正能放进日常工作流里了。