![]()
在教程正式開始之前依舊是前排提醒:
這個Minimax H3模型架構優秀,最低配置只需要8g顯存16g內存即可運行。
A卡I卡mac用戶最好使用github官網的版本,秋葉包對這些支持不太行。
·
視頻生成需要更大量的運算、生成耗時更長、可能遇到的報錯更多,所以務必保證你的基礎環境是cu130,torch版本≥2.10,如果不知道怎麼更新這些或者不知道自己是什麼版本的,請下載秋葉最新的v3.2版整合包。整合包也在合集中。
並且使用v3.2整合包時,也一定要在啓動器中更新comfyui版本到最新。新版本的comfyui解決了更多模型兼容問題、後端依賴問題,同時優化了生成速度、降低了峯值內存佔用。爲了保證生成不報錯,生成速度更快,一定要保證comfyui更新,切記。
![]()
還有這個流程中使用的導演臺節點,也一定要記得檢查更新。
![]()
老規矩:comfyui教程合集
再判違規限流我真沒法子了。
————————————
工作流介紹
![]()
進子圖調整模型的操作就不多贅述了。
·
——————————
多圖參考生成視頻
首先將這裏的模型改爲ref2va模型,或者使用上期教程提到的remix模型。
![]()
在導演臺中將模式改爲r2v。
![]()
設好之後,下方界面會變爲這樣。
![]()
中間左側的圖片加載位置默認顯示三張圖格,點擊下放的展開更多,可以添加更多圖片。
![]()
我這裏隨便放幾張人設圖。參考圖生成視頻的模式最好使用角色三視圖,就像圖中的後兩種圖片那種。一張圖片同時包含角色的正面側面和背面。
如果是真人短劇的風格,那麼人設圖最好是正面的面部特寫+無頭的三視圖,比如這樣:
![]()
這樣的人設圖包含的細節更多,同時減少了全身圖中的面部干擾,讓模型能夠更方便的記憶角色面部細節。
我提供了專門生成這種人設圖的提示詞模板。同樣丟給任意AI或者agent即可生成三視圖提示詞,然後在用這個提示詞去豆包,gpt,banana,mj,或者本地的krea2都可以生成。
![]()
生成圖片記得要使用21:9的比例,防止圖片錯位。
![]()
生成出來的圖片都是帶頭的,自己用windows畫板塗一下就行。
![]()
·
繼續回到流程。
這裏也可以輸入一張場景圖,如果沒有場景圖,單純用提示詞描述也可以。
要注意,如果顯存和內存比較小,那就別放太多參考圖,儘量拆分畫面段落,一個鏡頭只放入一個角色和一張背景。
![]()
下方的音頻,可以放入角色的語音,視頻的bgm等等。
![]()
例如我這裏放個女朋友的語音來當做菲比啾比的聲音()
![]()
不過目前H3的音頻參考有點問題,這個最好還是通過專門的TTS模型去做語音比較好。
至於這部分,以後的教程會專門講。
·
在參考生視頻的模式中,提示詞可以用艾特符號“@”來直接引用素材。
例如引用場景時,第五張圖是場景圖,那就在這裏寫 @圖片5 即可
![]()
然後簡單寫一下提示詞
![]()
這樣,一段10秒的提示詞就寫好了。這個提示詞編寫體驗已經和那些付費平臺的體驗基本一致,做短劇或者沙雕小動畫都非常好用。(至於畫質好壞就是另一回事了)
這裏也可以使用分段功能,將10秒的視頻拆分成兩段5秒,或者3段3秒之類的。
如果使用分段功能進行拆分,或者生成長達幾分鐘的長視頻,需要打開時間軸右上方的這個公共參數功能。
![]()
然後在這裏輸入主要角色的人設圖、角色音頻參考等等。
如果你的劇需要第一組鏡頭在一個場景,第二組鏡頭在另一個場景,那麼公共參數就只放人設圖,然後在分鏡裏放場景圖。或者後續鏡頭需要出現一些只出現一兩次的路人npc,也可以將路人圖放在分鏡圖庫裏。這樣可以始終保持主要角色的記憶,避免更多幹擾。
如果有一些整體要求,比如畫風保持什麼樣,角色必須保持什麼狀態,都可以寫在這個公共參數的提示詞裏。以及一些需要避免的特徵,比如不要出現雜音噪音,不要出現旁白之類的。
![]()
設置好之後,可以點擊 收起公共參數 將這個模塊摺疊起來。
這樣,左側仍然會顯示公共參數裏的素材,不影響後續調用。
![]()
·
這裏還是要說一下,H3使用的提示詞最好採用提示詞模板去生成,像我這樣簡單寫出的提示詞一定會遇到各種各樣的問題,比如人物關係混亂,音頻混亂等等。
這裏我也提供這個多參提示詞模板,用法和三視圖模板一樣,都是丟給AI就行。
![]()
·
這裏是兩段提示詞的效果對比
可以看出,自己寫的提示詞會出現角色混淆的情況,提示詞最後寫被踢飛的角色是菲比,但是生成出來是弗洛洛被踢飛了(我真沒欺負弗糯糯)
而官方提示詞模板做出來的就沒有出現角色混淆,而且動作更連貫一些。
·
——————————
視頻參考
將模式改爲 rv2v參考素材改視頻
![]()
下方會變成這樣。看起來和r2v差不多
![]()
點擊時間軸放入一段視頻,我這裏就拿坤哥跳舞爲例。
![]()
可以看到時間軸的時長有16秒多,對於小顯存用戶來說,一次處理這麼長的視頻肯定是喫不消的,這裏就可以使用分割功能。
![]()
均分就是將視頻自動切割成指定的段數,每段時間長度一樣。
智能分割則是自動分析視頻中的運鏡切鏡,將每一個鏡頭切割出來分段。
![]()
![]()
可以看到,這個智能分割的分析還是挺到位的。
不過由於這個節點擁有段間引導功能,直接簡單均分切割也是完全沒有問題的。
·
接下來的圖片素材我就使用了一張今汐的人設圖,以及一個服裝圖。
![]()
提示詞簡單寫一下
![]()
這樣,就能完成替換視頻中的人物了。
以前使用wan替換人物還需要額外使用專門的scail或者animate模型,還需要專門的人物檢測識別模型sam3之類的。而現在,minimax一個模型就能做到這些全部功能了。
如果想替換一些《讓子彈飛》的電影片段,把《貓和老鼠》改成菲比,或者一些跳舞視頻的動作遷移,都可以使用類似的方法來實現。
·
——————————
·
minimax H3這個模型、以及導演臺節點的基礎用法到這裏差不多就全部講完了。
接下來會查缺補漏,講一些相關的小技巧。
比如視頻模型經常會忘記角色的聲線,導致上一個鏡頭一個聲音,下一個鏡頭聲音就變了。
想要避免這種情況,可以使用TTS先生成語音,在進入r2v流程將語音放進去,雖然操作麻煩一些,但這是能確保聲線統一的最好方式了。
下一期教程會講在comfyui中如何使用TTS,搭配minimax H3生成視頻。
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
