TL;DR 与前置条件(V1.0,2025-02-18)
TL;DR: 8GB 显存跑 SDXL 推理可用 ComfyUI + fp16;12GB 显存可训练 1024px LoRA;6GB 显存建议改 SD1.5。本文记录商都加速器内部测试流程,目标是可复现的 Stable Diffusion本地部署教程,不是展示图。
测试硬件: Ubuntu 22.04,NVIDIA RTX 3060 12GB,Driver 550.54,CUDA 12.1,Python 3.10.13。Windows 11 可用同样 Python 版本,路径自行替换。
前置条件: 已安装 NVIDIA 驱动;磁盘空闲 80GB;模型文件 SDXL base 约 6.9GB;训练集 20-50 张同风格图片。
Note: 免费路线优先:ComfyUI、AUTOMATIC1111、kohya_ss 都可本地运行。限制是首次安装慢、依赖冲突常见、模型版权需要自己核验。
Warning: 不要把企业未脱敏产品图、员工照片、客户图纸直接用于训练。制造业场景建议先做数据分级和水印清理。
1. 本地部署 ComfyUI 并跑通 SDXL 推理
创建隔离环境。固定版本,避免 torch 和 xformers 打架。
python3 --versionExpected output:
Python 3.10.13git clone ComfyUI cd ComfyUI python3 -m venv venv source venv/bin/activate pip install torch==2.3.1 torchvision==0.18.1 --index-url https://download.pytorch.org/whl/cu121 pip install -r requirements.txtExpected output:
Successfully installed torch-2.3.1 torchvision-0.18.1 ...放置模型。目录固定如下;这是排错第一检查点。
mkdir -p models/checkpoints ls -lh models/checkpointsExpected output:
-rw-r--r-- 1 sre sre 6.9G sdxl_base_1.0.safetensors启动服务。局域网访问时绑定 0.0.0.0;单机使用 127.0.0.1。
python main.py --listen 127.0.0.1 --port 8188Expected output:
To see the GUI go to: http://127.0.0.1:8188基线参数:1024x1024,steps=25,sampler=dpmpp_2m,cfg=7,seed=123456。我的测试单张耗时 7.8 秒,峰值显存 9.6GB。
nvidia-smi --query-gpu=memory.used,utilization.gpu --format=csvExpected output:
memory.used [MiB], utilization.gpu [%] 9820 MiB, 96 %
2. kohya_ss LoRA 微调、故障诊断与验证
准备数据。每张图配同名 txt 标签;示例:cnc machine, blue housing, factory lighting。此步骤是 LoRA训练教程 成败核心。
find dataset -maxdepth 1 -type f | headExpected output:
dataset/001.png dataset/001.txt dataset/002.png dataset/002.txt安装训练工具。搜索 kohya_ss下载 时优先用官方仓库名称,避免二次打包。
git clone kohya_ss cd kohya_ss python3 -m venv venv source venv/bin/activate pip install -r requirements_linux.txt accelerate config defaultExpected output:
accelerate configuration saved at ...12GB 显存训练 SDXL LoRA 参数。rank=16 足够做企业产品风格;batch=1 更稳。
accelerate launch sdxl_train_network.py \ --pretrained_model_name_or_path=/models/sdxl_base_1.0.safetensors \ --train_data_dir=./dataset \ --resolution=1024,1024 \ --output_dir=./output \ --output_name=factory_lora_v1 \ --network_module=networks.lora \ --network_dim=16 \ --network_alpha=16 \ --train_batch_size=1 \ --max_train_steps=1200 \ --learning_rate=1e-4 \ --mixed_precision=fp16 \ --save_model_as=safetensorsExpected output:
steps: 1200/1200 loss: 0.08-0.14 model saved: output/factory_lora_v1.safetensors常见故障定位。
CUDA out of memory:降 resolution 到 768 或加 gradient_checkpointing。
人物/产品变形:减少 learning_rate 到 5e-5,或把重复图片删掉。
风格不生效:提高触发词一致性,不要把触发词写成自然长句。
如何验证它工作: 在 ComfyUI 加载同一 seed,分别关闭/开启 LoRA,prompt 保持不变。通过三项判定:主题特征出现率大于 8/10;单张生成时间增加小于 15%;无明显水印、文字糊块、结构崩坏。若失败,回到数据标签而不是先改模型。
References: ComfyUI project name;kohya_ss project name;PyTorch 2.3.1 release notes;NVIDIA Driver 550.54 notes。若需要在国内网络环境拉取模型或访问 AI 工具,免费/官方路线仍可用;Roxi 也只是网络加速选项之一:wizzegroup.com。