NOTE / 2026-09-18
Mac 本機 ComfyUI 生圖入門
在 MacBook Pro M5 Pro 上用 ComfyUI 本機生圖:能做什麼、安裝方案、模型選擇、每張圖的實測等待時間,以及接回影片流程的素材規範。
MacBook Pro M5 Pro(18 核 CPU / 20 核 GPU、64 GB 統一記憶體、剩 505 GB)上的實測,成品接回 MiniMax H3 影片流程。資料日期 2026-09-17。
本機能做什麼、不能做什麼
適合本機 $0、不限次數
- 生圖:角色、參考圖集、場景關鍵幀、首尾幀
- 編輯:換角度、表情、服裝仍是同一人(Qwen-Image-Edit)
- 合成參考圖、去背、放大
- 寫 prompt、分鏡表、試 seed
64 GB 跑得動任何 20B 級模型、不會 OOM,只比 5090 慢 10–30 倍。
不要在本機做 交給 RunPod
- H3 影片:33B 模型在 MPS 上 15 秒片段要 1–3 小時,許多 CUDA kernel 無 Mac 版。
- LoRA 訓練:Mac 3–8 小時;5090 30–60 分鐘、$1。
- 批量放大 4K 影片:慢且無 NVENC。
安裝(15 分鐘)
方案 A:ComfyUI Desktop(推薦新手)
comfy.org/download 下載 Apple Silicon dmg,拖進 Applications。
首次開啟選位置,如
~/ComfyUI(模型在~/ComfyUI/models/);自動裝 Python 與 PyTorch(MPS)。Template Library 點官方 workflow,缺的模型可一鍵下載。
方案 B:終端機 + uv(自控版本)
brew install uv
git clone https://github.com/comfyanonymous/ComfyUI ~/ComfyUI && cd ~/ComfyUI
uv venv --python 3.12 .venv && source .venv/bin/activate # 系統的 Python 3.14 太新,用 3.12
uv pip install torch torchvision torchaudio # macOS 自帶 MPS 支援
uv pip install -r requirements.txt
python main.py --listen 127.0.0.1 # 開 http://127.0.0.1:8188
缺節點用 ComfyUI-Manager(Desktop 內建):git clone https://github.com/Comfy-Org/ComfyUI-Manager custom_nodes/ComfyUI-Manager。
方案 C:Draw Things(App Store,最無腦)
原生 Metal,比 ComfyUI 快 20–40%,模型內建;但 workflow 帶不去 RunPod、進階節點少。適合先玩兩天。
模型選擇
2026-09 主流模型,ComfyUI 皆原生支援:
| 模型 | 參數 | 強項 | 弱項 | 檔案(Mac 建議) | 授權 |
|---|---|---|---|---|---|
| Qwen-Image(含 Edit-2511) | 20B | 提示詞理解最強、中英文字渲染、多圖編輯保持同一人 | 大、慢;人像偏「乾淨」 | fp8 20 GB;Edit 用 int8_convrot 20.5 GB | Apache-2.0 |
| FLUX.1 Krea [dev] / FLUX.1-dev | 12B | 真人質感最自然(Krea 去 AI 味)、LoRA 生態最大 | 文字弱、偏好英文 | GGUF Q8_0 12.7 GB(需 ComfyUI-GGUF) | 非商用(dev) |
| Z-Image-Turbo | 6B | 8 步出圖、最快,質感近 Flux | 複雜構圖弱、可控性普通 | bf16 12 GB / fp8 6 GB | Apache-2.0 |
| SDXL(+ Juggernaut 等) | 3.5B | 超快、老牌、LoRA 海量 | 手、文字、提示詞理解過時 | 7 GB | 開放 |
精緻方案(首選)
- 主圖
- FLUX.1 Krea dev,1024² 或 1344×768,28 步,CFG 3.5
- 參考圖集
- Qwen-Image-Edit-2511,主圖 +「同一人、轉 3/4 側面、換白襯衫」
- 關鍵幀
- Qwen-Image 1344×768,20 步,構圖與指令最準
- 放大
- 4x-UltraSharp(ESRGAN)到 2K 再縮回
- 產能
- 每張 2–5 分;一晚 3 小時 40–60 張定稿,夠一角色 + 10 場景
平衡方案(新手前兩週)
- 草稿
- Z-Image-Turbo 8 步 1024²,30–60 秒,一晚 200 張
- 定稿
- Flux Krea img2img(denoise 0.5)重繪
- 一致性
- 同精緻方案
- 產能
- 草稿 <1 分、定稿 3 分
每張圖要多久
實測 為本機 2026-09-18 數據,其餘由 M3 Max / M4 Pro / M1 Max 換算(M5 GPU 有 Neural Accelerator 與原生 FP8/BF16,估比 M4 Pro 快 1.3–1.8×),僅供數量級;Z-Image 實測比推估快約 1.5×。
| 模型 | 解析度 / 步數 | 時間 | 記憶體 | 參考 |
|---|---|---|---|---|
| SDXL | 1024² / 25 | 15–25 秒 | ~8 GB | M5 Max 20–35 秒 |
| Z-Image-Turbo | 1344×768 / 8 | 22 秒 實測 首張 ~50 秒含載入 | ~14 GB | M3 Max 60–80 秒 |
| FLUX.1 Krea dev(GGUF Q8) | 1344×768 / 20 | 85 秒 實測 首張 ~110 秒 | ~20 GB | 28 步約 2.3 分 |
| Qwen-Image(fp8) | 1344×768 / 20 | ~2.3 分 | ~30 GB | 由 8 步實測換算 |
| Qwen-Image + Lightning 8 步 LoRA | 1344×768 / 8 | 56 秒 實測 首張 279 秒含載入 30 GB | ~30 GB | |
| Qwen-Image-Edit-2511(int8 + 4 步 Lightning) | 1344×768 / 4 | 53 秒 實測 首張 ~100 秒 | ~30 GB | M1 Max 2:33 |
| 放大 4x-UltraSharp | 1024→4096 | 20–40 秒 | 小 |
整機記憶體:Z-Image 51 GB、Flux 46 GB、Qwen / Edit 61 GB(含 17.5 GB 基準),跑 Qwen 先關其他 app。紀錄與 MPS 相容表:ComfyUI-Mac/BENCHMARK.md。
RunPod 5090:Z-Image 2–3 秒、Flux 10 秒、Qwen-Image 20 秒,抽 500 張開一小時 $1;本機勝在零成本、隨時可用。
第一張圖:Z-Image-Turbo(10 分鐘)
Template Library → Image → Z-Image Turbo(沒有就更新 ComfyUI)。
下載提示的三個檔:
z_image_turbo_bf16.safetensors(diffusion_models)、qwen_3_4b.safetensors(text_encoders)、ae.safetensors(vae)。Prompt 貼角色聖經(見 主教學「步驟」第 1 步);1344×768(同 H3 畫布,免裁);steps 8、cfg 1.0、seed fixed。
Queue,以第二張秒數校正第 4 節的表。
滿意的圖把 seed 寫進檔名(第 7 節),這是角色的「出生證明」。
再用 Flux Krea template 跑同一 prompt:兩者的「臉」不同,選定一個後不再換。
哪些素材值得在本機做
依投報率排序:
| 素材 | 值得? | 用進影片 | 本機做法 |
|---|---|---|---|
| 角色主參考圖(正面半身、乾淨背景) | 必做 | R2V 參考圖 #1;所有 Edit 的來源 | Flux Krea,滿意就記 seed |
| 角色參考圖集(3/4 側、側面、全身、5 表情、3 光線、每套服裝) | 必做 | R2V 參考圖 #2 依場景挑;也是 LoRA 資料集 | Qwen-Image-Edit-2511 多圖輸入,指令「same person, turn 45°…」 |
| 場景關鍵幀(每場景一張含角色的首幀) | 必做 | I2V 的 first_frame;每 5–8 段接龍後重新錨定 | Qwen-Image 生空景 → Edit 放進角色(或直接生) |
| 首尾幀對(動作起點 / 終點) | 值得 | FL2V:給 first + last,H3 補中間,動作更可控 | Edit:以首幀改姿勢 / 位置 |
| 合成參考圖(左景右人) | 值得 | I2V 單張同時鎖場景與人 | Image Concatenate 節點,或 Preview → 修圖軟體拼 |
| 服裝 / 道具設定圖 | 有幫助 | 寫 prompt 的依據;R2V 第二張參考 | Edit:「same outfit on mannequin, front and back」 |
| 場景空景(無人) | 有幫助 | 換角色 / 多角色的底圖;桌布 | Qwen-Image 1344×768 |
| 字幕 / UI 版型圖 | 有幫助 | H3 生字幕靠運氣,後製疊字較穩 | 透明 PNG 版型,ffmpeg / 剪輯軟體疊 |
| 放大後的 4K 靜態圖 | 小幫助 | H3 輸入 768p,只供海報 / 縮圖 | 4x-UltraSharp |
| 大量風格探索圖 | 不值得在本機 | — | 抽幾百張時開 5090 一小時較划算 |
資料夾與命名規範
~/AIVideo/
├── characters/
│ └── mei/ # 一個角色一個資料夾
│ ├── bible.md # 角色聖經(貼進所有 prompt)
│ ├── master_seed123456.png # 主參考圖
│ ├── ref_front.png ref_34.png ref_side.png ref_full.png
│ ├── expr_smile.png expr_neutral.png …
│ └── outfit_A_stripe.png outfit_B_jk.png
├── scenes/
│ └── s01_sofa_desktop/
│ ├── empty.png # 空景
│ ├── kf01_first.png # 關鍵幀(首幀)
│ ├── kf01_last.png # 尾幀(可選)
│ └── composite.png # 左景右人合成圖
├── shots.csv # 分鏡表:shot, scene, first, last, refs, prompt, duration
└── workflows/ # 本機用的 ComfyUI json(Z-Image / Flux / Qwen-Edit)
檔名帶 seed 與版本,不覆蓋舊檔(另存 v2)。shots.csv 是之後 RunPod 批次排隊的輸入。
常見問題
- 比表上慢 3 倍
- 首張在編譯、fp8 檔不相容(見第 4 節),或記憶體壓力變黃(app 太多)。
- 黑圖 / 全灰
- VAE 精度:加
--fp16-vae或換官方ae.safetensors。 - "MPS backend out of memory"
- 降解析度或設
PYTORCH_MPS_HIGH_WATERMARK_RATIO=0.0;64 GB 少見。 - Template Library 缺模型
- 更新 ComfyUI(Desktop:設定 → 更新;終端機:
git pull && uv pip install -r requirements.txt)。 - 下載很慢
- HuggingFace 直連 20–50 MB/s,Qwen-Image 40 GB 約 20 分;先下 Z-Image(12 GB)。
- 想更快
- mflux(MLX)或 Draw Things 跑 Flux / Qwen 快 20–40%,workflow 不通用。