NOTE / 2026-09-18
MiniMax H3 × ComfyUI × RunPod:AI 影片生成入門
從零開始的 AI 影片流程:ComfyUI 與 MiniMax H3 的觀念、RunPod RTX 5090 實作步驟、20 分鐘長片流程與月費估算。
寫給完全新手:看懂名詞、拆解零度博客〈桌面 AI 女友〉、在 RunPod 租 RTX 5090 跑起來、串成 20 分鐘長片,再算每月花費。資料日期:2026-09-17。
名詞速成
ComfyUI
「積木式」生圖/生影片程式:方塊(node)接成 workflow,存成 .json 拖進畫面就能用。
Diffusion model(擴散模型)
從雜訊去噪「畫」出影片的主腦。H3 主腦 33B 參數,int8 版 21 GB。
Text encoder(文字編碼器)
把提示詞翻成主腦懂的數字。H3 用 Qwen3-VL 32B(也看得懂圖),15.7 GB。
VAE
把壓縮空間還原成像素與聲音:影片 VAE(5.2 GB)、音訊 VAE(0.6 GB)。
LoRA
幾百 MB 的外掛補丁。Turbo LoRA 把 20 步壓到 8 或 4 步,快 2–4 倍,品質略降。
Steps / Shift / CFG
去噪步數/噪聲排程偏移(Turbo LoRA 有指定值)/聽提示詞的程度,官方 workflow 已預設。
VRAM(顯示記憶體)
H3 pruned int8 尖峰約 20 GB,5090 的 32 GB 剛好;不夠會 offload 到 RAM,慢 10 倍以上。
T2V / I2V / FL2V / R2V
文生/圖生/首尾幀生/參考生影片(用角色照片、聲音鎖身份)。文章用 I2V(fl2va 模型)。
MiniMax H3 是什麼
- 發布
- MiniMax(海螺 Hailuo 的公司),2026-08-03 開放權重;ComfyUI Day-0 原生支援(需 ComfyUI ≥ 0.30,Turbo workflow 需 ≥ 0.31)
- 能力
- 影片+原生立體聲音訊(對白、音效、配樂一次生成,嘴型同步);24 fps;每段 4–15 秒;本地原生 1344×768(0.98 MP),2K 需雲端 Regenerate-2K
- 檔案
- 官方 ComfyUI 四件組共 42.5 GB;R2V 再加 21 GB
- VRAM
- 12 GB 勉強(大量 offload);24 GB 舒服;32 GB(5090)全放 VRAM,還可用 NVFP4 版(Blackwell 專屬,峰值 ~12 GB)
- 授權
- H3 Community License:非商用免費;年營收 < 2,000 萬美元可商用需標註;有文章指出授權排除美國/歐盟/英國/韓國,商用前看原文
- 5090 實測
- 5 秒 1344×768、14 步:~134 秒(全優化)/早期未優化約 5.5 分鐘;15 秒:~518 秒。Turbo 8 步再快約 1.7×,4 步約 3×(依步數推估)
文章解析:〈桌面 AI 女友〉用了什麼
來源:零度博客 2026-09-16、教學影片 YouTube JUu_J2NvoDA、成品示範 mp4。
模型清單(文章連結解析後的真實檔名)
| 類別 | 檔名 | 大小 | 放哪 |
|---|---|---|---|
| diffusion_models | minimax_h3_fl2va_pruned_int8_convrot.safetensors | 20.97 GB | models/diffusion_models/ |
| text_encoders | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 15.69 GB | models/text_encoders/ |
| vae ① | minimax_h3_video_vae_fp16.safetensors | 5.21 GB | models/vae/ |
| vae ② | minimax_h3_audio_vae_fp32.safetensors | 0.61 GB | models/vae/ |
| loras 8 步 | minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors(lightx2v) | ~1 GB | models/loras/ |
| loras 4 步 | minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16.safetensors | ~1 GB | models/loras/ |
四件組來自 Comfy-Org/MiniMax-H3,LoRA 來自 lightx2v/Minimax-h3-Turbo。文章的 cloudeop/夸克載點只是鏡像,在 RunPod 直接從 HuggingFace 抓最快。
方法拆解
- 拼接式參考圖:左半桌面截圖、右半去背人物,同時鎖場景與人。素材在
ai-girlfriend/assets/,合成圖是ai-girlfriend/assets/06_h3_composite_reference.png。 - I2V(fl2va)workflow:合成圖接
first_frame,即官方 I2V 模板+ Turbo LoRA(workflows/video_minimax_h3_i2v_lightx2v_turbo.json)。 - 四層 prompt:左右各鎖什麼、機位與字幕規格、服裝與換裝規則、逐秒時間軸(
00:00–00:03說什麼、00:06起身…)+音訊+ NEGATIVE。官方格式是integrated_multimodal_description/overall_soundscape/non_diegetic_music,對白寫成<d>[Chinese] 說吧……</d>;英文版效果較好。 - 30 秒靠分段生成(單段上限 ~15 秒),新手先用 5 秒 864×480 試跑。
- 放大到 4K:用 ComfyUI 的 Real-ESRGAN/RTX VSR 節點。
RunPod 實作
用 Pod(按小時計費,terminate 就停),不用 Serverless。模型放在獨立的 Network Volume,Pod 刪了模型還在。
建 Network Volume(100 GB)
Storage → New Network Volume。Volume 綁定機房,要選有 RTX 5090 的:
EU-RO-1、EUR-IS-1、EUR-NO-1(2026-09-17 皆 LOW 庫存)。$0.07/GB/月,100 GB ≈ $7/月,放得下 43 GB 模型。開 Pod
- GPU
- NVIDIA GeForce RTX 5090(32 GB):Secure $0.99/hr、Community $0.69/hr
- Template
- 官方「ComfyUI - CUDA 13.0」(id
wgd3p4n4o6,imagerunpod/comfyui:1.4.7-cuda13.0)。5090 是 Blackwell,一定要 CUDA 13 版,12.8 不支援 - Volume
- 掛到
/workspace - Ports
8188(ComfyUI)8080(FileBrowser)8888(Jupyter)22(SSH),模板已含- 其他
- Container disk 預設 150 GB 不用改;設「X 小時後自動 terminate」當保險
首次開機會把 ComfyUI 複製到 volume,
https://<pod-id>-8188.proxy.runpod.net會 404 → 502 → 200,約 4 分鐘。更新 ComfyUI 到 ≥ 0.31、下載模型
Pod → Connect → Web Terminal(或 8888 JupyterLab 的 Terminal):
cd /workspace/runpod-slim/ComfyUI git pull && pip install -r requirements.txt --break-system-packages # 把本資料夾的 scripts/download_models.sh 內容貼成 /workspace/download_models.sh 後: bash /workspace/download_models.sh # 約 43 GB,機房頻寬通常 10–20 分鐘 # 重啟 ComfyUI:主控台 Pod → Restart(或 kill main.py 讓 supervisor 拉起)檢查
/system_stats:comfyui_version≥ 0.31、vram_total≈ 32 GB。內建 ComfyUI-Manager 的「Missing models」鈕也能下載,但 40 GB 跑腳本較穩。載入 workflow、跑第一段
- 拖入
ai-girlfriend/workflow_i2v_turbo.json(或 Template Library → Video → MiniMax H3 I2V 再加 LoRA 節點),LoadImage 上傳 16:9 合成參考圖。 - 依下表設定 Turbo 子圖,四個參數一起改。
- Resolution Selector 先
16:9, 0.4 MP(864×480)、5 秒,成功再拉到0.98 MP(1344×768);別選 1.0 MP,超過上限。 - Queue Prompt,輸出在
output/video/MiniMax_H3/,用 8080 FileBrowser 下載。
lora_name steps shift_video shift_audio 適合解析度 fl2v_turbo_8step_v1.0 8(可 4) 12 3 544p 混合比例(workflow 預設) fl2v_turbo_4step_v1.0_768p 4 6 3 1344×768 - 拖入
收工
按 Terminate,不是 Stop:Stop 仍收 volume 磁碟費 $0.20/GB/月和 150 GB 容器磁碟。模型留在 volume,下次從第 2 步再開。
怎麼做出 20 分鐘的影片
H3 一段最多 15 秒,20 分鐘=至少 80 段,難點是角色和場景不飄。
分鏡與關鍵幀
劇本拆成每格 ≤ 15 秒的分鏡表(畫面、動作、對白、音效),每個場景用 Qwen-Image/Flux 或合成參考圖做一張首幀。
逐段生成
- 同場景 → FL2V 接龍:
stitch_clips.sh --last-frame抽上一段末幀當下一段first_frame。 - 換場景或角色再出現 → R2V(
ref2va模型+2 張角色參考圖+可選聲音樣本)重錨身份。 - 接龍不超過 5–8 段就用關鍵幀重錨(社群共識的漂移上限)。
- 同場景 → FL2V 接龍:
音訊
各段音色會微變:保留 H3 的腳步與環境音,對白改用一個 TTS(CosyVoice/Fish-Speech)統一配,最後用 ffmpeg 混。
串接與放大
stitch_clips.sh clips/ final.mp4(無損 concat,可加 0.2 秒 crossfade),最後才一次放大到 1080p/4K(Real-ESRGAN 或 RTX VSR,5090 有 NVENC)。
時間預算(5090、768p、8 步 Turbo)
| 項目 | 估計 |
|---|---|
| 每段 15 秒生成 | ~5 分鐘(14 步實測 8.6 分 × 8/14) |
| 80 段一次全過 | ~6.7 小時 GPU |
| 實務重生率 2–3×(角色跑掉、動作不對) | 13–20 小時 GPU |
| 每天 2 小時 | 約 1–2 週做完一支 20 分鐘 |
費用估算:RTX 5090,每天 2 小時
2026-09-17 RunPod 即時報價(list-gpu-types);1 USD ≈ 32 TWD。
一個月(60 小時)
| 項目 | Secure Cloud | Community Cloud | 說明 |
|---|---|---|---|
| GPU 時數 60 hr(2 hr × 30 天) | 60 × $0.99 = $59.40 | 60 × $0.69 = $41.40 | 刪除 Pod 就停止計費 |
| Network Volume 100 GB | $7.00 | $7.00 | $0.07/GB/月,模型常駐 |
| 開機/載模型的「熱身」耗損 | ~$3 | ~$2 | 每天多 5–6 分鐘 boot+載模型 |
| 首次下載模型 | ~$0.30 | ~$0.20 | 一次性,約 15–20 分鐘 |
Community 是個人提供的機器,便宜 30%,但可能中斷、頻寬較不穩:長片批次用 Secure,試玩用 Community。
產能換算:每天 2 小時 ≈ 每天 20–24 段 15 秒(768p、8 步)≈ 每天 5–6 分鐘成片(未計重生)。一個月 ≈ 一支 20 分鐘成品+大量草稿,總成本 ≈ $70。對比:買一張 5090 ≈ NT$8–9 萬,等於租 3 年多。
其他可考慮的 GPU(2026-09-17 報價,Secure)
| GPU | VRAM | $/hr | 月費(60 hr+volume) | 備註 |
|---|---|---|---|---|
| RTX 4090 | 24 GB | $0.74 | ≈ $51 | int8 模型剛好塞滿 24 GB,768p 15 秒可能 offload;不支援 NVFP4 |
| RTX 5090 | 32 GB | $0.99 | ≈ $70 | 推薦,CUDA 13 + FP4 kernel |
| RTX PRO 4500 Blackwell | 32 GB | $0.72 | ≈ $54 | 同 VRAM、較慢、同樣 Blackwell;EU-RO-1 有貨,想省錢可試 |
| L40S | 48 GB | $1.09 | ≈ $76 | VRAM 大但算力不如 5090 |
| RTX PRO 6000 | 96 GB | $2.09 | ≈ $136 | 可跑 bf16 全精度、2K,玩票太貴 |
試算:一支 30 分鐘影片
1,800 秒 ÷ 15 秒=120 段,每段約 5 分鐘;成本取決於重生比率(一段要生幾次才能用)。
| 重生比率 | 誰會遇到 | GPU 時數 | Secure $0.99 | Community $0.69 | 每天 2 hr 要幾天 |
|---|---|---|---|---|---|
| 1×(全過) | 理論值,不會發生 | 10 hr | $10 | $7 | 5 天 |
| 2× | prompt 已調熟、單一場景 | 20 hr | $20 | $14 | 10 天 |
| 3×(常見) | 多場景、有對白、要角色一致 | 30 hr | $30 | $21 | 15 天 |
| 4× | 新手第一支、劇情複雜 | 40 hr | $40 | $28 | 20 天 |
再加草稿(864×480/4 步、每段 ~45 秒 × 3 次)、~10% 開機損耗與 volume,就是上方的 ≈ $45(≈ NT$1,440,約三週);Community 約 $33。試算器預設值即此情境:
自己調參數算
- ×
段數 120 段
正片 GPU 30.0 hr(含 3× 重生)
草稿 GPU 4.5 hr
+10% 損耗 38.0 hr 合計
GPU 費用 $37.57
Volume $7.00(1 個月)
總計 $44.57 ≈ NT$1,426
工期 19 天(每天 2 hr)
為什麼 AI 角色都長得很像?怎麼做出自己的角色
模型學的是機率分布,prompt 越模糊(「beautiful girl, realistic」)越往「平均臉」走:對稱、光滑皮膚、大眼。加上大家用同幾個模型(H3、Wan、Flux、Qwen-Image)、互抄 prompt、出廠審美微調(RLHF/aesthetic tuning)、共用參考圖(文章人物圖檔名就是 ChatGPT-Image-2026年9月16日),輸出自然收斂。解法是給足離開平均值的具體資訊,並每次都帶同一套參考資料。
步驟(做到 4 就夠玩,5 是進階)
| 步驟 | 做什麼 | 工具 | 時間/費用 |
|---|---|---|---|
| 1. 角色設定書 | 80–150 字「角色聖經」:年齡、臉型、3 個不尋常的辨識特徵(眉尾痣、虎牙、M 型髮際線)、髮型、身材、2–3 套服裝、表情、聲音。避開 beautiful / perfect / idol,每個 prompt 都貼這段。 | 文字檔 | 30 分鐘/$0 |
| 2. 主參考圖 | 生正面半身照,抽到喜歡為止並記下 seed;要求素顏感、真實皮膚紋理、非攝影棚光。 | ComfyUI 內 Qwen-Image/Flux,或 ChatGPT Image/Midjourney | 1 小時/~$1 |
| 3. 參考圖集 | 用圖片編輯模型做同一人的多角度、5 種表情、3 種光線、每套服裝,共 10–30 張,放進 character/<name>/,之後只用這批。 | Qwen-Image-Edit/Flux Kontext | 1–2 小時/~$2 |
| 4. 用進影片 | H3 R2V:2 張參考圖(正面+3/4 側)+ 10 秒聲音樣本,鎖身份最強;I2V:用第 3 步的圖合成關鍵幀。prompt 都貼角色聖經。 | workflows/video_minimax_h3_ref2v_lightx2v_turbo.json、scripts/download_models.sh --r2v | 同一般生成 |
| 5. 角色 LoRA(進階) | 用 20–30 張圖訓練生圖模型(Flux/Qwen-Image)的角色 LoRA,5090 上 30–60 分鐘,之後任何場景都生得出同一張臉。H3 影片 LoRA 目前(2026-09)工具早期、33B 需 80 GB+ 顯卡,先不建議。 | ai-toolkit/kohya/musubi-tuner | 1 小時/~$1–2 |
| 6. 聲音 | 固定一段 10–20 秒聲音樣本當 R2V 音訊參考,或用 TTS 聲音複製統一配音。 | H3 R2V/Fish-Speech/CosyVoice | 30 分鐘 |
| 7. 一致性測試 | 生 5 段不同場景並排比臉,飄了就回第 3 步補參考圖。 | ComfyUI | 30 分鐘/~$0.5 |
讓角色「不像 AI」的 prompt 技巧
- 寫缺點(雀斑、碎髮、不對稱)和不常見的組合(「深棕短髮+淺色眼睛+方下巴」,而非「long black hair beautiful」)。
- 指定鏡頭與光(「35mm、自然窗光、些微過曝」,而非「cinematic lighting」)。
- 負面詞加
idol, doll-like, airbrushed skin, symmetrical face, instagram filter。 - 對白用
<d>[Chinese] …</d>,並在 soundscape 描述聲音特質(「略低、語速慢、鼻音」)。
參考連結
- 原文:零度博客〈桌面 AI 女友〉|影片 YouTube
- ComfyUI 官方:MiniMax H3 Day-0 支援公告|官方教學(T2V/I2V/R2V、prompting tips)
- 模型:Comfy-Org/MiniMax-H3|lightx2v Turbo LoRA|Turbo GitHub(設定表、workflow)
- VRAM/速度:awesome-minimax-h3|5090 實測 8.6 分鐘/15 秒|kingy.ai 安裝與除錯|NVIDIA Sol Engine 5090 加速
- RunPod:ComfyUI - CUDA 13.0 模板|API key|文件
- 本資料夾:local-image-guide.html(Mac 本機生圖教學)、
ai-girlfriend/assets/(文章素材)、workflows/(三個 Turbo workflow json)、scripts/download_models.sh、scripts/stitch_clips.sh
數字皆為 2026-09-17 查詢;GPU 價格與庫存每天變動,開機前再查一次。