最近 AI 視頻這塊又熱鬧起來了。不過和前兩年不太一樣,以前效果好的視頻模型基本都在雲端,想玩就得充值、買積分,一次生成幾秒鐘,抽卡抽得心疼。現在MiniMax H3 開放權重之後,咱們這些有獨顯的臭打遊戲的有福了,終於可以正兒八經塞進自己電腦裏跑了。
而且更方便的是,ComfyUI已經原生支持MiniMax H3。也就是說,不需要自己折騰一大堆魔改插件,更新ComfyUI、下載模型、載入官方工作流,基本就能開跑。
這篇就從零開始聊一下,怎麼在Windows電腦上用ComfyUI + MiniMax H3本地生成AI視頻。
MiniMax H3到底是什麼?
MiniMax在2026年7月31日正式發佈H3。
和以前比較單純的文生視頻模型不同,H3更接近一個真正的多模態音視頻生成模型:它能同時理解文字、圖片、視頻和音頻,也能在生成畫面的同時直接生成聲音,記住這點:視頻和聲音一起生成,對白、環境音、音樂都可以直接寫進Prompt裏。非常牛X!
目前ComfyUI官方工作流主要提供三種玩法:
T2V:Text to Video
直接輸入文字生成視頻。
I2V:Image to Video
拿一張圖片生成動態視頻,也可以加入首幀、尾幀控制。
R2V:Reference to Video
這個就比較猛了,可以同時喂圖片、視頻甚至音頻,讓模型參考人物、畫風、動作、運鏡或者聲音來生成新視頻。
官方目前的R2V工作流最多支持9張參考圖片、3段參考視頻和3段獨立參考音頻。對於玩視頻內容的人來說,我覺得後面這個R2V反而是H3最值得玩的東西。
先看看你的電腦能不能跑
這塊其實我不太清楚,有的說是64G內存+12G顯存的電腦纔行,我這試了下32G內存+16G顯存也能跑出不錯的質量,速度也還能接受。網上別人說的8G顯存也能跑,只不過輸出分辨率得調低一些。
安裝ComfyUI真的非常傻瓜
H3這次我非常建議新手直接走官方工作流。
首先得去安裝ComfyUI:

最簡單的方法就是,去某g__hub上下載Windows Portable版本,N卡就下ComfyUI_windows_portable_nvidia。別像我一樣,自認爲我的CPU是intel的,就下了intel版本,結果打開後無法加載GPU……

另外,ComfyUI有desktop安裝版本,但裝好後部署comfyui我發現其內置的最新版是0.28的,在模板裏搜不到minimax H3 圖生視頻,所以就別用desktop安裝版了。
下載好後解壓,ComfyUI_windows_portable的目錄如下:

把它放到一個沒有中文的目錄下就行,建議放到硬盤的根目錄,可以減少文件路徑過長導致的錯誤。打開run_nvidia_gpu.bat批處理文件後,它會自動啓動terminal終端來完成各項部署,完成後就會啓動瀏覽器開啓web工作臺:

我們點擊模板。

在模板裏選擇生成類型》視頻,裏面就可以按照我們的需求去選擇模板了,選好之後,就會進入節點式工作流↓

第一次部署我建議先玩:MiniMax H3文生視頻(T2V)
因爲它變量最少。先確認模型能夠正常加載、採樣和輸出視頻,再折騰其他的。
下載哪些模型?
如果你用的是T2V或者I2V,官方推薦的本地組合主要是下面四個文件。

視頻擴散模型
minimax_h3_fl2va_pruned_int8_convrot.safetensors

放到ComfyUI解壓後目錄裏的:
ComfyUI/models/diffusion_models/
·
Qwen3-VL文本/多模態編碼器
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
放到:
ComfyUI/models/text_encoders/
·
Video VAE
minimax_h3_video_vae_fp16.safetensors
+
Audio VAE
minimax_h3_audio_vae_fp32.safetensors
兩個模型放到:
ComfyUI/models/vae/
如果你要玩R2V參考生視頻,則需要另外下載:
minimax_h3_ref2va_pruned_int8_convrot.safetensors
同樣放進:
ComfyUI/models/diffusion_models/
FL2VA和Ref2VA是兩套不同權重,別下錯了。
模型搞定後,就可以關掉comfyui並重新打開加載一遍,隨後就能正常用了。
試下!
文生視頻
我們先做一次最簡單的T2V,不要看到H3支持高分辨率、15秒,就直接把所有參數拉滿,先確認能跑。
我建議第一次直接:
16:9;832×480;5秒

duration就是時長,5.0就是5秒鐘;百萬像素0.4就是832×480。
然後寫一條簡單Prompt,比如:夜晚的東京街道,一名穿黑色夾克的年輕男子從便利店走出來,細雨落在路面上,霓虹燈倒映在積水中。鏡頭緩慢向人物推進,人物停下來抬頭看向天空。背景有輕微車輛行駛聲和雨聲,遠處傳來城市環境音,電影感,真實攝影。

大概2分半就能生成5秒的視頻,效率我覺得還挺不錯。
Prompt你不用只寫:人物、衣服、背景、鏡頭。
還可以直接把:
人物做什麼、鏡頭怎麼運動、環境裏有什麼聲音、人物說什麼、背景音樂是什麼
全寫在同一個Prompt裏面,如果不太會寫的話,可以用deepseek這類AI工具幫你潤色,擴展想象力。H3本身就是音視頻聯合生成,所以Prompt裏把畫面、運動和聲音一起描述清楚,一般更容易得到接近預期的結果。
接下來
圖生視頻
實際玩下來,我覺得很多人真正用得最多的應該還是I2V,純文生視頻隨機性還是比較高。而圖生視頻可以先把人物、產品或者場景確定下來,再讓H3負責“讓它動起來”。
在模板裏選擇生成類型》視頻》MiniMax H3圖生視頻

節點工作流載入完成後,點擊選擇文件上傳,把自己的圖片放進去。然後寫動作。
例如拿一張產品照片,可以寫:
保持產品外觀、材質、顏色和Logo不變。鏡頭緩慢從左向右環繞產品,背景燈光產生輕微移動,產品保持靜止。鏡頭最後緩慢推進至產品正面。環境安靜,伴隨輕微電子氛圍音樂。

如果有明確的結尾畫面,還可以複製一下加載圖像的節點,接First Frame+Last Frame——也就是我們經常說的首尾幀生成,H3會嘗試生成兩個畫面之間的運動過程。
對於產品動畫、轉場以及一些短片鏡頭,這個功能其實非常實用。
比如做數碼產品視頻的時候,我完全可以先拍好產品的起始畫面和結束畫面,再交給H3補中間過程。相比完全靠Prompt抽卡,可控性要高不少。
參考生視頻
H3比較有意思的是Reference to Video,比如可以給它:人物照片+喜歡的運鏡+參考聲音。然後告訴H3:人物外貌參考Picture 1,鏡頭運動參考Video 1,人物聲音參考Audio 1。模型會自己理解這些素材之間的關係。

官方工作流要求參考素材按照<Picture 1>、<Video 1>、<Audio 1>這樣的順序進行描述,而且最好明確告訴模型每一個素材到底負責什麼:人物身份、畫風、動作、鏡頭還是聲音。

比如:讓圖像1的女生做出圖像2的動作,鏡頭緩慢向人物推進,人物停下來抬頭看向天空。遠處傳來山谷環境音,電影感,真實攝影。
效果還不錯。
常見問題
找不到GPU 無法加載獨顯
重下一個適合你GPU品牌的版本,N卡下nvidia的,A卡下amd的,別像我一樣和CPU的品牌弄混。還有就是驅動下最新版本的,N卡儘量選擇studio。
工作流打開全是紅色報錯
先更新ComfyUI,如果是很久沒更新的版本,很可能壓根沒有H3相關的原生節點。如果是desktop版,建議刪了重新下一個portable的。
小顯存小內存能不能跑?
用固態硬盤虛擬內存,能跑,但真的慢。
最後
這次ComfyUI原生支持之後,本地部署門檻已經比想象中低很多,無論是內置工作流、支持中文這些都極大的降低了門檻。唯一的門檻就是一張顯存較大的獨立顯卡吧,但如果你有大顯存顯卡的話,我覺得還是值得玩一玩的。
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
