openclaw生态Nunchaku FLUX.1-dev:GPU利用率监控与性能瓶颈分析
ComfyUI 中 Nunchaku FLUX.1-dev 模型文生图使用手册
1. 环境准备
使用 Nunchaku FLUX.1-dev 模型前,需要确保系统满足以下基础环境要求:
硬件要求:
- NVIDIA 显卡(支持 CUDA)
- 推荐显存 24GB 以上(显存不足可选择 FP8 量化版模型)
软件要求:
- Python 3.10 或更高版本
- Git 环境
- PyTorch 对应版本(需匹配系统和显卡)
工具准备:
- 安装
huggingface_hub工具用于模型下载:pip install --upgrade huggingface_hub
- 安装
2. 插件安装与部署
2.1 安装 ComfyUI-nunchaku 插件
提供两种安装方法,可根据需求选择:
方法 A:使用 Comfy-CLI(推荐)
# 安装ComfyUI CLI工具 pip install comfy-cli # 安装ComfyUI(已安装可跳过) comfy install # 安装Nunchaku插件 comfy noderegistry-install ComfyUI-nunchaku # 移动插件到正确目录 mv ComfyUI-nunchaku ComfyUI/custom_nodes/nunchaku_nodes方法 B:手动安装
# 1. 安装ComfyUI git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI pip install -r requirements.txt # 2. 克隆Nunchaku插件 cd custom_nodes git clone https://github.com/mit-han-lab/ComfyUI-nunchaku nunchaku_nodes2.2 安装 Nunchaku 后端
从 v0.3.2 版本开始,可以通过install_wheel.json一键安装或更新后端 wheel 包。
3. 模型准备与配置
3.1 配置工作流
将示例工作流复制到 ComfyUI 指定目录:
# 进入ComfyUI根目录 cd ComfyUI # 创建工作流目录 mkdir -p user/default/example_workflows # 复制示例工作流 cp custom_nodes/nunchaku_nodes/example_workflows/* user/default/example_workflows/3.2 下载模型文件
需要下载基础 FLUX 模型和 Nunchaku FLUX.1-dev 专属模型:
基础 FLUX 模型(必装)
# 文本编码器模型 hf download comfyanonymous/flux_text_encoders clip_l.safetensors --local-dir models/text_encoders hf download comfyanonymous/flux_text_encoders t5xxl_fp16.safetensors --local-dir models/text_encoders # VAE模型 hf download black-forest-labs/FLUX.1-schnell ae.safetensors --local-dir models/vaeNunchaku FLUX.1-dev 模型
# INT4版本主模型 hf download nunchaku-tech/nunchaku-flux.1-dev svdq-int4_r32-flux.1-dev.safetensors --local-dir models/unet/ # 可选LoRA模型(如FLUX.1-Turbo-Alpha) # 存放至models/loras目录4. 运行文生图工作流
4.1 启动 ComfyUI
在 ComfyUI 根目录执行:
python main.py启动后,在浏览器打开本地地址进入 ComfyUI 网页端。
4.2 加载工作流
- 在网页端加载
nunchaku-flux.1-dev.json工作流 - 该工作流支持多 LoRA,文生图效果最佳
4.3 参数设置与生成
在提示词输入框输入英文描述(示例):
A beautiful landscape with mountains and lakes, ultra HD, realistic, 8K调整参数:
- 推理步数
- 分辨率
- LoRA 权重
- 采样器
点击"运行"按钮开始生成图片
5. 注意事项
模型目录:
- 主模型:
models/unet/ - LoRA:
models/loras - 文本编码器:
models/text_encoders - VAE:
models/vae
- 主模型:
显存适配:
- FP16 版:约 33GB 显存
- FP8 版:约 17GB 显存
- INT4/FP4 版:显存占用更低
显卡兼容:
- Blackwell 显卡仅支持 FP4 模型
- 其他 NVIDIA 显卡优先使用 INT4 模型
推理步数:
- 关闭
FLUX.1-Turbo-AlphaLoRA 时,步数不低于 20
- 关闭
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。
