NOTE / 2026-09-18

Mac 本機 ComfyUI 生圖入門

在 MacBook Pro M5 Pro 上用 ComfyUI 本機生圖:能做什麼、安裝方案、模型選擇、每張圖的實測等待時間,以及接回影片流程的素材規範。

產生時間
更新時間
來源
CodeLibrary/ComfyUI-Mac/docs/local-image-guide.html

MacBook Pro M5 Pro(18 核 CPU / 20 核 GPU、64 GB 統一記憶體、剩 505 GB)上的實測,成品接回 MiniMax H3 影片流程。資料日期 2026-09-17。

本機能做什麼、不能做什麼

適合本機 $0、不限次數

  • 生圖:角色、參考圖集、場景關鍵幀、首尾幀
  • 編輯:換角度、表情、服裝仍是同一人(Qwen-Image-Edit)
  • 合成參考圖、去背、放大
  • 寫 prompt、分鏡表、試 seed

64 GB 跑得動任何 20B 級模型、不會 OOM,只比 5090 慢 10–30 倍。

不要在本機做 交給 RunPod

  • H3 影片:33B 模型在 MPS 上 15 秒片段要 1–3 小時,許多 CUDA kernel 無 Mac 版。
  • LoRA 訓練:Mac 3–8 小時;5090 30–60 分鐘、$1。
  • 批量放大 4K 影片:慢且無 NVENC。

安裝(15 分鐘)

從 Mac 分出三種安裝方式:ComfyUI Desktop 與終端機 uv 都產出可帶去 RunPod 的 ComfyUI workflow,Draw Things 只留在本機
圖 1:三種安裝方式

方案 A:ComfyUI Desktop(推薦新手)

  1. comfy.org/download 下載 Apple Silicon dmg,拖進 Applications。

  2. 首次開啟選位置,如 ~/ComfyUI(模型在 ~/ComfyUI/models/);自動裝 Python 與 PyTorch(MPS)。

  3. Template Library 點官方 workflow,缺的模型可一鍵下載。

方案 B:終端機 + uv(自控版本)

brew install uv
git clone https://github.com/comfyanonymous/ComfyUI ~/ComfyUI && cd ~/ComfyUI
uv venv --python 3.12 .venv && source .venv/bin/activate   # 系統的 Python 3.14 太新,用 3.12
uv pip install torch torchvision torchaudio                # macOS 自帶 MPS 支援
uv pip install -r requirements.txt
python main.py --listen 127.0.0.1                          # 開 http://127.0.0.1:8188

缺節點用 ComfyUI-Manager(Desktop 內建):git clone https://github.com/Comfy-Org/ComfyUI-Manager custom_nodes/ComfyUI-Manager。

方案 C:Draw Things(App Store,最無腦)

原生 Metal,比 ComfyUI 快 20–40%,模型內建;但 workflow 帶不去 RunPod、進階節點少。適合先玩兩天。

模型選擇

2026-09 主流模型,ComfyUI 皆原生支援:

模型參數強項弱項檔案(Mac 建議)授權
Qwen-Image(含 Edit-2511)20B提示詞理解最強、中英文字渲染、多圖編輯保持同一人大、慢;人像偏「乾淨」fp8 20 GB;Edit 用 int8_convrot 20.5 GBApache-2.0
FLUX.1 Krea [dev] / FLUX.1-dev12B真人質感最自然(Krea 去 AI 味)、LoRA 生態最大文字弱、偏好英文GGUF Q8_0 12.7 GB(需 ComfyUI-GGUF)非商用(dev)
Z-Image-Turbo6B8 步出圖、最快,質感近 Flux複雜構圖弱、可控性普通bf16 12 GB / fp8 6 GBApache-2.0
SDXL(+ Juggernaut 等)3.5B超快、老牌、LoRA 海量手、文字、提示詞理解過時7 GB開放

精緻方案(首選)

主圖
FLUX.1 Krea dev,1024² 或 1344×768,28 步,CFG 3.5
參考圖集
Qwen-Image-Edit-2511,主圖 +「同一人、轉 3/4 側面、換白襯衫」
關鍵幀
Qwen-Image 1344×768,20 步,構圖與指令最準
放大
4x-UltraSharp(ESRGAN)到 2K 再縮回
產能
每張 2–5 分;一晚 3 小時 40–60 張定稿,夠一角色 + 10 場景

平衡方案(新手前兩週)

草稿
Z-Image-Turbo 8 步 1024²,30–60 秒,一晚 200 張
定稿
Flux Krea img2img(denoise 0.5)重繪
一致性
同精緻方案
產能
草稿 <1 分、定稿 3 分

每張圖要多久

實測 為本機 2026-09-18 數據,其餘由 M3 Max / M4 Pro / M1 Max 換算(M5 GPU 有 Neural Accelerator 與原生 FP8/BF16,估比 M4 Pro 快 1.3–1.8×),僅供數量級;Z-Image 實測比推估快約 1.5×。

模型解析度 / 步數時間記憶體參考
SDXL1024² / 2515–25 秒~8 GBM5 Max 20–35 秒
Z-Image-Turbo1344×768 / 822 秒 實測
首張 ~50 秒含載入
~14 GBM3 Max 60–80 秒
FLUX.1 Krea dev(GGUF Q8)1344×768 / 2085 秒 實測
首張 ~110 秒
~20 GB28 步約 2.3 分
Qwen-Image(fp8)1344×768 / 20~2.3 分~30 GB由 8 步實測換算
Qwen-Image + Lightning 8 步 LoRA1344×768 / 856 秒 實測
首張 279 秒含載入 30 GB
~30 GB
Qwen-Image-Edit-2511(int8 + 4 步 Lightning)1344×768 / 453 秒 實測
首張 ~100 秒
~30 GBM1 Max 2:33
放大 4x-UltraSharp1024→409620–40 秒小

整機記憶體:Z-Image 51 GB、Flux 46 GB、Qwen / Edit 61 GB(含 17.5 GB 基準),跑 Qwen 先關其他 app。紀錄與 MPS 相容表:ComfyUI-Mac/BENCHMARK.md。

RunPod 5090:Z-Image 2–3 秒、Flux 10 秒、Qwen-Image 20 秒,抽 500 張開一小時 $1;本機勝在零成本、隨時可用。

第一張圖:Z-Image-Turbo(10 分鐘)

  1. Template Library → Image → Z-Image Turbo(沒有就更新 ComfyUI)。

  2. 下載提示的三個檔:z_image_turbo_bf16.safetensors(diffusion_models)、qwen_3_4b.safetensors(text_encoders)、ae.safetensors(vae)。

  3. Prompt 貼角色聖經(見 主教學「步驟」第 1 步);1344×768(同 H3 畫布,免裁);steps 8、cfg 1.0、seed fixed。

  4. Queue,以第二張秒數校正第 4 節的表。

  5. 滿意的圖把 seed 寫進檔名(第 7 節),這是角色的「出生證明」。

再用 Flux Krea template 跑同一 prompt:兩者的「臉」不同,選定一個後不再換。

哪些素材值得在本機做

主參考圖與參考圖集接 R2V,場景關鍵幀與合成參考圖接 I2V,首尾幀對接 FL2V,上傳一次到 network volume,再由 RunPod 5090 生成影片
圖 2:素材對應的 H3 輸入與上雲路徑

依投報率排序:

素材值得?用進影片本機做法
角色主參考圖(正面半身、乾淨背景)必做R2V 參考圖 #1;所有 Edit 的來源Flux Krea,滿意就記 seed
角色參考圖集(3/4 側、側面、全身、5 表情、3 光線、每套服裝)必做R2V 參考圖 #2 依場景挑;也是 LoRA 資料集Qwen-Image-Edit-2511 多圖輸入,指令「same person, turn 45°…」
場景關鍵幀(每場景一張含角色的首幀)必做I2V 的 first_frame;每 5–8 段接龍後重新錨定Qwen-Image 生空景 → Edit 放進角色(或直接生)
首尾幀對(動作起點 / 終點)值得FL2V:給 first + last,H3 補中間,動作更可控Edit:以首幀改姿勢 / 位置
合成參考圖(左景右人)值得I2V 單張同時鎖場景與人Image Concatenate 節點,或 Preview → 修圖軟體拼
服裝 / 道具設定圖有幫助寫 prompt 的依據;R2V 第二張參考Edit:「same outfit on mannequin, front and back」
場景空景(無人)有幫助換角色 / 多角色的底圖;桌布Qwen-Image 1344×768
字幕 / UI 版型圖有幫助H3 生字幕靠運氣,後製疊字較穩透明 PNG 版型,ffmpeg / 剪輯軟體疊
放大後的 4K 靜態圖小幫助H3 輸入 768p,只供海報 / 縮圖4x-UltraSharp
大量風格探索圖不值得在本機—抽幾百張時開 5090 一小時較划算

資料夾與命名規範

~/AIVideo/
├── characters/
│   └── mei/                         # 一個角色一個資料夾
│       ├── bible.md                 # 角色聖經(貼進所有 prompt)
│       ├── master_seed123456.png    # 主參考圖
│       ├── ref_front.png  ref_34.png  ref_side.png  ref_full.png
│       ├── expr_smile.png expr_neutral.png …
│       └── outfit_A_stripe.png outfit_B_jk.png
├── scenes/
│   └── s01_sofa_desktop/
│       ├── empty.png                # 空景
│       ├── kf01_first.png           # 關鍵幀(首幀)
│       ├── kf01_last.png            # 尾幀(可選)
│       └── composite.png            # 左景右人合成圖
├── shots.csv                        # 分鏡表:shot, scene, first, last, refs, prompt, duration
└── workflows/                       # 本機用的 ComfyUI json(Z-Image / Flux / Qwen-Edit)

檔名帶 seed 與版本,不覆蓋舊檔(另存 v2)。shots.csv 是之後 RunPod 批次排隊的輸入。

常見問題

比表上慢 3 倍
首張在編譯、fp8 檔不相容(見第 4 節),或記憶體壓力變黃(app 太多)。
黑圖 / 全灰
VAE 精度:加 --fp16-vae 或換官方 ae.safetensors。
"MPS backend out of memory"
降解析度或設 PYTORCH_MPS_HIGH_WATERMARK_RATIO=0.0;64 GB 少見。
Template Library 缺模型
更新 ComfyUI(Desktop:設定 → 更新;終端機:git pull && uv pip install -r requirements.txt)。
下載很慢
HuggingFace 直連 20–50 MB/s,Qwen-Image 40 GB 約 20 分;先下 Z-Image(12 GB)。
想更快
mflux(MLX)或 Draw Things 跑 Flux / Qwen 快 20–40%,workflow 不通用。

參考資料