教學:本地部署AI生成無審查內容(20)H3多元參考生成視頻

在教程正式開始之前依舊是前排提醒:

這個Minimax H3模型架構優秀,最低配置只需要8g顯存16g內存即可運行。

A卡I卡mac用戶最好使用github官網的版本,秋葉包對這些支持不太行。

·

視頻生成需要更大量的運算、生成耗時更長、可能遇到的報錯更多,所以務必保證你的基礎環境是cu130,torch版本≥2.10,如果不知道怎麼更新這些或者不知道自己是什麼版本的,請下載秋葉最新的v3.2版整合包。整合包也在合集中。

並且使用v3.2整合包時,也一定要在啓動器中更新comfyui版本到最新。新版本的comfyui解決了更多模型兼容問題、後端依賴問題,同時優化了生成速度、降低了峯值內存佔用。爲了保證生成不報錯,生成速度更快,一定要保證comfyui更新,切記

還有這個流程中使用的導演臺節點,也一定要記得檢查更新

老規矩:comfyui教程合集

再判違規限流我真沒法子了。

————————————

工作流介紹

進子圖調整模型的操作就不多贅述了。

·

——————————

多圖參考生成視頻

首先將這裏的模型改爲ref2va模型,或者使用上期教程提到的remix模型。

在導演臺中將模式改爲r2v。

設好之後,下方界面會變爲這樣。

中間左側的圖片加載位置默認顯示三張圖格,點擊下放的展開更多,可以添加更多圖片。

我這裏隨便放幾張人設圖。參考圖生成視頻的模式最好使用角色三視圖,就像圖中的後兩種圖片那種。一張圖片同時包含角色的正面側面和背面。

如果是真人短劇的風格,那麼人設圖最好是正面的面部特寫+無頭的三視圖,比如這樣:

這樣的人設圖包含的細節更多,同時減少了全身圖中的面部干擾,讓模型能夠更方便的記憶角色面部細節。

我提供了專門生成這種人設圖的提示詞模板。同樣丟給任意AI或者agent即可生成三視圖提示詞,然後在用這個提示詞去豆包,gpt,banana,mj,或者本地的krea2都可以生成。

生成圖片記得要使用21:9的比例,防止圖片錯位。

生成出來的圖片都是帶頭的,自己用windows畫板塗一下就行。

·

繼續回到流程。

這裏也可以輸入一張場景圖,如果沒有場景圖,單純用提示詞描述也可以。

要注意,如果顯存和內存比較小,那就別放太多參考圖,儘量拆分畫面段落,一個鏡頭只放入一個角色和一張背景。

下方的音頻,可以放入角色的語音,視頻的bgm等等。

例如我這裏放個女朋友的語音來當做菲比啾比的聲音()

不過目前H3的音頻參考有點問題,這個最好還是通過專門的TTS模型去做語音比較好。

至於這部分,以後的教程會專門講。

·

在參考生視頻的模式中,提示詞可以用艾特符號“@”來直接引用素材。

例如引用場景時,第五張圖是場景圖,那就在這裏寫 @圖片5 即可

然後簡單寫一下提示詞

這樣,一段10秒的提示詞就寫好了。這個提示詞編寫體驗已經和那些付費平臺的體驗基本一致,做短劇或者沙雕小動畫都非常好用。(至於畫質好壞就是另一回事了)

這裏也可以使用分段功能,將10秒的視頻拆分成兩段5秒,或者3段3秒之類的。

如果使用分段功能進行拆分,或者生成長達幾分鐘的長視頻,需要打開時間軸右上方的這個公共參數功能。

然後在這裏輸入主要角色的人設圖、角色音頻參考等等。

如果你的劇需要第一組鏡頭在一個場景,第二組鏡頭在另一個場景,那麼公共參數就只放人設圖,然後在分鏡裏放場景圖。或者後續鏡頭需要出現一些只出現一兩次的路人npc,也可以將路人圖放在分鏡圖庫裏。這樣可以始終保持主要角色的記憶,避免更多幹擾。

如果有一些整體要求,比如畫風保持什麼樣,角色必須保持什麼狀態,都可以寫在這個公共參數的提示詞裏。以及一些需要避免的特徵,比如不要出現雜音噪音,不要出現旁白之類的。

設置好之後,可以點擊 收起公共參數 將這個模塊摺疊起來。

這樣,左側仍然會顯示公共參數裏的素材,不影響後續調用。

·

這裏還是要說一下,H3使用的提示詞最好採用提示詞模板去生成,像我這樣簡單寫出的提示詞一定會遇到各種各樣的問題,比如人物關係混亂,音頻混亂等等。

這裏我也提供這個多參提示詞模板,用法和三視圖模板一樣,都是丟給AI就行。

·

這裏是兩段提示詞的效果對比

minimax H3 多參視頻(1)

minimax H3 多參視頻(2)

可以看出,自己寫的提示詞會出現角色混淆的情況,提示詞最後寫被踢飛的角色是菲比,但是生成出來是弗洛洛被踢飛了(我真沒欺負弗糯糯

而官方提示詞模板做出來的就沒有出現角色混淆,而且動作更連貫一些。

·

——————————

視頻參考

將模式改爲 rv2v參考素材改視頻

下方會變成這樣。看起來和r2v差不多

點擊時間軸放入一段視頻,我這裏就拿坤哥跳舞爲例。

可以看到時間軸的時長有16秒多,對於小顯存用戶來說,一次處理這麼長的視頻肯定是喫不消的,這裏就可以使用分割功能。

均分就是將視頻自動切割成指定的段數,每段時間長度一樣。

智能分割則是自動分析視頻中的運鏡切鏡,將每一個鏡頭切割出來分段。

可以看到,這個智能分割的分析還是挺到位的。

不過由於這個節點擁有段間引導功能,直接簡單均分切割也是完全沒有問題的。

·

接下來的圖片素材我就使用了一張今汐的人設圖,以及一個服裝圖。

提示詞簡單寫一下

這樣,就能完成替換視頻中的人物了。

以前使用wan替換人物還需要額外使用專門的scail或者animate模型,還需要專門的人物檢測識別模型sam3之類的。而現在,minimax一個模型就能做到這些全部功能了。

如果想替換一些《讓子彈飛》的電影片段,把《貓和老鼠》改成菲比,或者一些跳舞視頻的動作遷移,都可以使用類似的方法來實現。

·

——————————

·

minimax H3這個模型、以及導演臺節點的基礎用法到這裏差不多就全部講完了。

接下來會查缺補漏,講一些相關的小技巧。

比如視頻模型經常會忘記角色的聲線,導致上一個鏡頭一個聲音,下一個鏡頭聲音就變了。

想要避免這種情況,可以使用TTS先生成語音,在進入r2v流程將語音放進去,雖然操作麻煩一些,但這是能確保聲線統一的最好方式了。

下一期教程會講在comfyui中如何使用TTS,搭配minimax H3生成視頻。

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com