NOTE / 2026-09-18

MiniMax H3 × ComfyUI × RunPod:AI 影片生成入門

從零開始的 AI 影片流程:ComfyUI 與 MiniMax H3 的觀念、RunPod RTX 5090 實作步驟、20 分鐘長片流程與月費估算。

產生時間
更新時間
來源
CodeLibrary/RunpodGenVideo/docs/guide.html

寫給完全新手:看懂名詞、拆解零度博客〈桌面 AI 女友〉、在 RunPod 租 RTX 5090 跑起來、串成 20 分鐘長片,再算每月花費。資料日期:2026-09-17。

名詞速成

ComfyUI

「積木式」生圖/生影片程式:方塊(node)接成 workflow,存成 .json 拖進畫面就能用。

Diffusion model(擴散模型)

從雜訊去噪「畫」出影片的主腦。H3 主腦 33B 參數,int8 版 21 GB。

Text encoder(文字編碼器)

把提示詞翻成主腦懂的數字。H3 用 Qwen3-VL 32B(也看得懂圖),15.7 GB。

VAE

把壓縮空間還原成像素與聲音:影片 VAE(5.2 GB)、音訊 VAE(0.6 GB)。

LoRA

幾百 MB 的外掛補丁。Turbo LoRA 把 20 步壓到 8 或 4 步,快 2–4 倍,品質略降。

Steps / Shift / CFG

去噪步數/噪聲排程偏移(Turbo LoRA 有指定值)/聽提示詞的程度,官方 workflow 已預設。

VRAM(顯示記憶體)

H3 pruned int8 尖峰約 20 GB,5090 的 32 GB 剛好;不夠會 offload 到 RAM,慢 10 倍以上。

T2V / I2V / FL2V / R2V

文生/圖生/首尾幀生/參考生影片(用角色照片、聲音鎖身份)。文章用 I2V(fl2va 模型)。

提示詞經 Qwen3-VL 文字編碼器送進 33B 擴散主腦,Turbo LoRA 掛在主腦上減少步數,主腦輸出再由影片 VAE 與音訊 VAE 還原成含音訊的 mp4
圖 1:H3 的四個模型檔與 Turbo LoRA 在一次生成裡各做什麼

MiniMax H3 是什麼

發布
MiniMax(海螺 Hailuo 的公司),2026-08-03 開放權重;ComfyUI Day-0 原生支援(需 ComfyUI ≥ 0.30,Turbo workflow 需 ≥ 0.31)
能力
影片+原生立體聲音訊(對白、音效、配樂一次生成,嘴型同步);24 fps;每段 4–15 秒;本地原生 1344×768(0.98 MP),2K 需雲端 Regenerate-2K
檔案
官方 ComfyUI 四件組共 42.5 GB;R2V 再加 21 GB
VRAM
12 GB 勉強(大量 offload);24 GB 舒服;32 GB(5090)全放 VRAM,還可用 NVFP4 版(Blackwell 專屬,峰值 ~12 GB)
授權
H3 Community License:非商用免費;年營收 < 2,000 萬美元可商用需標註;有文章指出授權排除美國/歐盟/英國/韓國,商用前看原文
5090 實測
5 秒 1344×768、14 步:~134 秒(全優化)/早期未優化約 5.5 分鐘;15 秒:~518 秒。Turbo 8 步再快約 1.7×,4 步約 3×(依步數推估)

文章解析:〈桌面 AI 女友〉用了什麼

來源:零度博客 2026-09-16、教學影片 YouTube JUu_J2NvoDA、成品示範 mp4。

模型清單(文章連結解析後的真實檔名)

類別檔名大小放哪
diffusion_modelsminimax_h3_fl2va_pruned_int8_convrot.safetensors20.97 GBmodels/diffusion_models/
text_encodersqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.69 GBmodels/text_encoders/
vae ①minimax_h3_video_vae_fp16.safetensors5.21 GBmodels/vae/
vae ②minimax_h3_audio_vae_fp32.safetensors0.61 GBmodels/vae/
loras 8 步minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors(lightx2v)~1 GBmodels/loras/
loras 4 步minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16.safetensors~1 GBmodels/loras/

四件組來自 Comfy-Org/MiniMax-H3,LoRA 來自 lightx2v/Minimax-h3-Turbo。文章的 cloudeop/夸克載點只是鏡像,在 RunPod 直接從 HuggingFace 抓最快。

方法拆解

  1. 拼接式參考圖:左半桌面截圖、右半去背人物,同時鎖場景與人。素材在 ai-girlfriend/assets/,合成圖是 ai-girlfriend/assets/06_h3_composite_reference.png。
  2. I2V(fl2va)workflow:合成圖接 first_frame,即官方 I2V 模板+ Turbo LoRA(workflows/video_minimax_h3_i2v_lightx2v_turbo.json)。
  3. 四層 prompt:左右各鎖什麼、機位與字幕規格、服裝與換裝規則、逐秒時間軸(00:00–00:03 說什麼、00:06 起身…)+音訊+ NEGATIVE。官方格式是 integrated_multimodal_description / overall_soundscape / non_diegetic_music,對白寫成 <d>[Chinese] 說吧……</d>;英文版效果較好。
  4. 30 秒靠分段生成(單段上限 ~15 秒),新手先用 5 秒 864×480 試跑。
  5. 放大到 4K:用 ComfyUI 的 Real-ESRGAN/RTX VSR 節點。

RunPod 實作

用 Pod(按小時計費,terminate 就停),不用 Serverless。模型放在獨立的 Network Volume,Pod 刪了模型還在。

Network Volume 掛到 5090 Pod 的 /workspace,首次更新 ComfyUI 並下載模型,載入 workflow 生成影片,收工 Terminate;Pod 刪除後模型仍留在 Volume,下次直接再開
圖 2:一輪 RunPod 作業怎麼走,哪些東西收工後還留著
  1. 建 Network Volume(100 GB)

    Storage → New Network Volume。Volume 綁定機房,要選有 RTX 5090 的:EU-RO-1、EUR-IS-1、EUR-NO-1(2026-09-17 皆 LOW 庫存)。$0.07/GB/月,100 GB ≈ $7/月,放得下 43 GB 模型。

  2. 開 Pod

    GPU
    NVIDIA GeForce RTX 5090(32 GB):Secure $0.99/hr、Community $0.69/hr
    Template
    官方「ComfyUI - CUDA 13.0」(id wgd3p4n4o6,image runpod/comfyui:1.4.7-cuda13.0)。5090 是 Blackwell,一定要 CUDA 13 版,12.8 不支援
    Volume
    掛到 /workspace
    Ports
    8188(ComfyUI)8080(FileBrowser)8888(Jupyter)22(SSH),模板已含
    其他
    Container disk 預設 150 GB 不用改;設「X 小時後自動 terminate」當保險

    首次開機會把 ComfyUI 複製到 volume,https://<pod-id>-8188.proxy.runpod.net 會 404 → 502 → 200,約 4 分鐘。

  3. 更新 ComfyUI 到 ≥ 0.31、下載模型

    Pod → Connect → Web Terminal(或 8888 JupyterLab 的 Terminal):

    cd /workspace/runpod-slim/ComfyUI
    git pull && pip install -r requirements.txt --break-system-packages
    # 把本資料夾的 scripts/download_models.sh 內容貼成 /workspace/download_models.sh 後:
    bash /workspace/download_models.sh        # 約 43 GB,機房頻寬通常 10–20 分鐘
    # 重啟 ComfyUI:主控台 Pod → Restart(或 kill main.py 讓 supervisor 拉起)

    檢查 /system_stats:comfyui_version ≥ 0.31、vram_total ≈ 32 GB。內建 ComfyUI-Manager 的「Missing models」鈕也能下載,但 40 GB 跑腳本較穩。

  4. 載入 workflow、跑第一段

    1. 拖入 ai-girlfriend/workflow_i2v_turbo.json(或 Template Library → Video → MiniMax H3 I2V 再加 LoRA 節點),LoadImage 上傳 16:9 合成參考圖。
    2. 依下表設定 Turbo 子圖,四個參數一起改。
    3. Resolution Selector 先 16:9, 0.4 MP(864×480)、5 秒,成功再拉到 0.98 MP(1344×768);別選 1.0 MP,超過上限。
    4. Queue Prompt,輸出在 output/video/MiniMax_H3/,用 8080 FileBrowser 下載。
    lora_namestepsshift_videoshift_audio適合解析度
    fl2v_turbo_8step_v1.08(可 4)123544p 混合比例(workflow 預設)
    fl2v_turbo_4step_v1.0_768p4631344×768
  5. 收工

    按 Terminate,不是 Stop:Stop 仍收 volume 磁碟費 $0.20/GB/月和 150 GB 容器磁碟。模型留在 volume,下次從第 2 步再開。

怎麼做出 20 分鐘的影片

H3 一段最多 15 秒,20 分鐘=至少 80 段,難點是角色和場景不飄。

劇本拆成分鏡表、生成關鍵幀,逐段生成時同場景走 FL2V 接龍、換場景走 R2V 重錨,片段與 TTS 配音一起串接,最後放大
圖 3:20 分鐘長片從劇本到成品的流程,以及兩條逐段生成路徑
  1. 分鏡與關鍵幀

    劇本拆成每格 ≤ 15 秒的分鏡表(畫面、動作、對白、音效),每個場景用 Qwen-Image/Flux 或合成參考圖做一張首幀。

  2. 逐段生成

    • 同場景 → FL2V 接龍:stitch_clips.sh --last-frame 抽上一段末幀當下一段 first_frame。
    • 換場景或角色再出現 → R2V(ref2va 模型+2 張角色參考圖+可選聲音樣本)重錨身份。
    • 接龍不超過 5–8 段就用關鍵幀重錨(社群共識的漂移上限)。
  3. 音訊

    各段音色會微變:保留 H3 的腳步與環境音,對白改用一個 TTS(CosyVoice/Fish-Speech)統一配,最後用 ffmpeg 混。

  4. 串接與放大

    stitch_clips.sh clips/ final.mp4(無損 concat,可加 0.2 秒 crossfade),最後才一次放大到 1080p/4K(Real-ESRGAN 或 RTX VSR,5090 有 NVENC)。

時間預算(5090、768p、8 步 Turbo)

項目估計
每段 15 秒生成~5 分鐘(14 步實測 8.6 分 × 8/14)
80 段一次全過~6.7 小時 GPU
實務重生率 2–3×(角色跑掉、動作不對)13–20 小時 GPU
每天 2 小時約 1–2 週做完一支 20 分鐘

費用估算:RTX 5090,每天 2 小時

2026-09-17 RunPod 即時報價(list-gpu-types);1 USD ≈ 32 TWD。

≈ $70Secure 月費(≈ NT$2,240)
≈ $51Community 月費(≈ NT$1,630)
≈ $45一支 30 分鐘片(3× 重生、Secure)

一個月(60 小時)

項目Secure CloudCommunity Cloud說明
GPU 時數 60 hr(2 hr × 30 天)60 × $0.99 = $59.4060 × $0.69 = $41.40刪除 Pod 就停止計費
Network Volume 100 GB$7.00$7.00$0.07/GB/月,模型常駐
開機/載模型的「熱身」耗損~$3~$2每天多 5–6 分鐘 boot+載模型
首次下載模型~$0.30~$0.20一次性,約 15–20 分鐘

Community 是個人提供的機器,便宜 30%,但可能中斷、頻寬較不穩:長片批次用 Secure,試玩用 Community。

產能換算:每天 2 小時 ≈ 每天 20–24 段 15 秒(768p、8 步)≈ 每天 5–6 分鐘成片(未計重生)。一個月 ≈ 一支 20 分鐘成品+大量草稿,總成本 ≈ $70。對比:買一張 5090 ≈ NT$8–9 萬,等於租 3 年多。

其他可考慮的 GPU(2026-09-17 報價,Secure)

GPUVRAM$/hr月費(60 hr+volume)備註
RTX 409024 GB$0.74≈ $51int8 模型剛好塞滿 24 GB,768p 15 秒可能 offload;不支援 NVFP4
RTX 509032 GB$0.99≈ $70推薦,CUDA 13 + FP4 kernel
RTX PRO 4500 Blackwell32 GB$0.72≈ $54同 VRAM、較慢、同樣 Blackwell;EU-RO-1 有貨,想省錢可試
L40S48 GB$1.09≈ $76VRAM 大但算力不如 5090
RTX PRO 600096 GB$2.09≈ $136可跑 bf16 全精度、2K,玩票太貴

試算:一支 30 分鐘影片

1,800 秒 ÷ 15 秒=120 段,每段約 5 分鐘;成本取決於重生比率(一段要生幾次才能用)。

重生比率誰會遇到GPU 時數Secure $0.99Community $0.69每天 2 hr 要幾天
1×(全過)理論值,不會發生10 hr$10$75 天
2×prompt 已調熟、單一場景20 hr$20$1410 天
3×(常見)多場景、有對白、要角色一致30 hr$30$2115 天
4×新手第一支、劇情複雜40 hr$40$2820 天

再加草稿(864×480/4 步、每段 ~45 秒 × 3 次)、~10% 開機損耗與 volume,就是上方的 ≈ $45(≈ NT$1,440,約三週);Community 約 $33。試算器預設值即此情境:

自己調參數算

×
段數        120 段
正片 GPU    30.0 hr(含 3× 重生)
草稿 GPU    4.5 hr
+10% 損耗   38.0 hr 合計
GPU 費用    $37.57
Volume      $7.00(1 個月)
總計        $44.57  ≈ NT$1,426
工期        19 天(每天 2 hr)

為什麼 AI 角色都長得很像?怎麼做出自己的角色

模型學的是機率分布,prompt 越模糊(「beautiful girl, realistic」)越往「平均臉」走:對稱、光滑皮膚、大眼。加上大家用同幾個模型(H3、Wan、Flux、Qwen-Image)、互抄 prompt、出廠審美微調(RLHF/aesthetic tuning)、共用參考圖(文章人物圖檔名就是 ChatGPT-Image-2026年9月16日),輸出自然收斂。解法是給足離開平均值的具體資訊,並每次都帶同一套參考資料。

步驟(做到 4 就夠玩,5 是進階)

步驟做什麼工具時間/費用
1. 角色設定書80–150 字「角色聖經」:年齡、臉型、3 個不尋常的辨識特徵(眉尾痣、虎牙、M 型髮際線)、髮型、身材、2–3 套服裝、表情、聲音。避開 beautiful / perfect / idol,每個 prompt 都貼這段。文字檔30 分鐘/$0
2. 主參考圖生正面半身照,抽到喜歡為止並記下 seed;要求素顏感、真實皮膚紋理、非攝影棚光。ComfyUI 內 Qwen-Image/Flux,或 ChatGPT Image/Midjourney1 小時/~$1
3. 參考圖集用圖片編輯模型做同一人的多角度、5 種表情、3 種光線、每套服裝,共 10–30 張,放進 character/<name>/,之後只用這批。Qwen-Image-Edit/Flux Kontext1–2 小時/~$2
4. 用進影片H3 R2V:2 張參考圖(正面+3/4 側)+ 10 秒聲音樣本,鎖身份最強;I2V:用第 3 步的圖合成關鍵幀。prompt 都貼角色聖經。workflows/video_minimax_h3_ref2v_lightx2v_turbo.json、scripts/download_models.sh --r2v同一般生成
5. 角色 LoRA(進階)用 20–30 張圖訓練生圖模型(Flux/Qwen-Image)的角色 LoRA,5090 上 30–60 分鐘,之後任何場景都生得出同一張臉。H3 影片 LoRA 目前(2026-09)工具早期、33B 需 80 GB+ 顯卡,先不建議。ai-toolkit/kohya/musubi-tuner1 小時/~$1–2
6. 聲音固定一段 10–20 秒聲音樣本當 R2V 音訊參考,或用 TTS 聲音複製統一配音。H3 R2V/Fish-Speech/CosyVoice30 分鐘
7. 一致性測試生 5 段不同場景並排比臉,飄了就回第 3 步補參考圖。ComfyUI30 分鐘/~$0.5

讓角色「不像 AI」的 prompt 技巧

  • 寫缺點(雀斑、碎髮、不對稱)和不常見的組合(「深棕短髮+淺色眼睛+方下巴」,而非「long black hair beautiful」)。
  • 指定鏡頭與光(「35mm、自然窗光、些微過曝」,而非「cinematic lighting」)。
  • 負面詞加 idol, doll-like, airbrushed skin, symmetrical face, instagram filter。
  • 對白用 <d>[Chinese] …</d>,並在 soundscape 描述聲音特質(「略低、語速慢、鼻音」)。

參考連結

數字皆為 2026-09-17 查詢;GPU 價格與庫存每天變動,開機前再查一次。