騰訊遊戲科隆曝光:這套AI管線已接入超90個項目,提效8倍

文 / 遊戲那點事 零

在本屆科隆國際遊戲展開發者大會上,AI相關議題明顯升溫。今年大會還專門設置了兩條AI專題賽道:AI in Gameplay(聚焦AI如何改變玩法)和 AI in Production(聚焦AI如何提升生產管線)。這種"玩法+生產"的雙線路徑,與騰訊遊戲此前提出的AI應用框架不謀而合。

值得注意的是,今年AI議題共計32場,其中涉及具體應用的議題數佔比超過50%,可以看到,AI與生產管線的結合正成爲行業趨勢。 騰訊、EA等海內外公司的開發者紛紛展示了各自在AI應用中的探索,從分享的內容來看,中國廠商在遊戲AI應用方面,正在引領全球。

其中,騰訊遊戲公共技術線Motus AI Team負責人曾子驕帶來了一場題爲《Breathing Life into Geometry 2.0: Advancing the Unified AI Pipeline for 3D Character Animation》的分享。

圖片

(騰訊遊戲統一AI角色動畫管線分享現場)

這場演講討論的並不是一個孤立的“文生動作”功能,而是一條覆蓋角色綁定、蒙皮、多模態動作生成與動作精修的統一AI管線。它試圖解決遊戲角色生產中最耗時的兩段工作:先讓靜態幾何模型擁有可驅動的骨骼與蒙皮,再把文本、視頻、關鍵幀和音頻等輸入變成能夠進入生產流程的動畫。

最直觀的變化體現在製作效率上:過去,一個相對簡單的角色服裝也需要約3個人日完成綁定與蒙皮,複雜服裝最多要約4天;接入Motus AI後,複雜服裝連同美術師後續修整在內,可以縮短到1—4個人時。目前,這套技術已經接入90多個內外部項目,騰訊稱效率提升超過8倍。

圖片


(Motus AI Team的主要研究方向)

這套管線追求的不是“看起來像動作”的研究演示,而是生產級動畫:腳不能滑、身體不能抖、角色不能漂浮或失去平衡,模型還要適配不同類型的角色,並把結果交還給動畫師繼續編輯。

最讓人印象深刻的是,本次分享,其發佈了業界首個多指令、任意長度的文生動作大模型,支持無限長動作序列生成,生成結果指令遵循度好,長時間一致性強,不漂移。

(Motus AI發佈業界首個多指令、任意長度文生動作大模型)

以下爲遊戲那點事整理的分享實錄,爲優化閱讀體驗有所調整:


01

 從幾天到幾小時 

 AI先接管綁定和蒙皮 

大家下午好,我是曾子驕,騰訊遊戲Motus AI Team負責人。

今天分享的是我們團隊最新的進展——《讓幾何模型煥發生命2.0:面向3D角色動畫的統一AI管線》。過去大家看到的可能是這條管線中的不同模塊,現在我們想把它們放在同一條端到端流程裏。

我畢業後加入騰訊遊戲,此後一直從事遊戲AI相關工作。早期我參與過鬥地主AI智能體的研發,它把深度學習與博弈樹搜索結合起來,並實現了規模化部署。

後來我帶領Motus AI Team,把工作重點轉向3D角色:一方面研發大規模角色綁定與蒙皮模型,另一方面研發多模態動作生成模型。相關工作也曾在GDC、SIGGRAPH等頂會上進行分享。

一款遊戲最先抓住玩家的,往往是視覺呈現,尤其是主角如何運動。高質量角色動畫既是遊戲生產的核心組成部分,也是玩家最直接看到的內容之一。

完整的3D角色生產通常從二維概念設計開始,接着進入建模、UV展開和貼圖製作,最後進入動畫流程。動畫流程又可以拆成兩個主要部分:第一是綁定和蒙皮,第二是骨骼動畫。我們今天的工作,主要圍繞這兩部分展開。

圖片


(3D角色從概念設計、建模到綁定蒙皮和骨骼動畫的完整流程)

綁定和蒙皮決定了角色服裝如何被骨骼驅動。網格上的每一個頂點會受到一根或多根骨骼影響,各骨骼權重之和必須爲1。綁定負責建立骨架,蒙皮負責把網格與骨骼之間的驅動關係寫進權重。它們的原理並不難理解,但手工處理非常耗時。

按照我們的生產經驗,一個簡單服裝大約需要3個人日,複雜服裝最多要4天。使用Motus AI後,一個複雜服裝連同美術師修整在內,可以從數天縮短到1-4個人時。

圖片


(傳統手工權重繪製與Motus AI端到端處理的流程對比)

要把自動綁定和蒙皮真正放進生產流程,我們首先需要面對三個問題。

第一個問題是建模與表示。3D資產的形狀和拓撲差異很大,系統必須找到一種有效方式,表示異構的3D數據,以及網格與骨骼之間的關係。

第二個問題是冷啓動。遊戲角色風格千差萬別,我們希望得到的是一個通用模型:它拿到新的角色後能夠零樣本工作,而不是每遇到一種項目風格,就重新做一次微調。

第三個問題是長尾案例。多層服裝很容易出現網格穿插和不均勻變形,這些問題在展示用樣例裏或許可以繞開,在真正的項目裏卻不能迴避。

圖片


(自動綁定與蒙皮要解決的三類難題:表示、冷啓動和長尾案例)

因此,我們把整套方案拆成三層。第一層是Skeleton Generation AI,根據任意角色網格生成對應骨架;第二層是General Skinning AI,根據網格和骨架自動生成全部頂點的蒙皮權重;第三層是一組後處理AI,專門修復前兩步中表現不夠好的區域。

從自動化率看,骨骼生成目前約爲50%—70%,通用蒙皮約爲70%—85%,在加入後處理後可以超過85%。這裏的思路是先用通用基礎模型覆蓋主體工作,再用專門工具收掉生產中的長尾問題。

圖片


(Skeleton Gen、General Skinning與後處理AI組成的三層框架)

Skeleton Generation AI提供了幾種不同的工作模式。用戶既可以上傳任意3D角色模型,全自動生成與角色貼合的完整骨架;也可以輸入一套參考主骨架,在保持模板拓撲的情況下適配新角色;如果角色已經有主骨架,還可以只爲裙襬、頭髮等部位補充物理輔助骨骼。

系統也支持多樣化採樣。美術師可以調整滑桿參數,爲同一個角色生成不同的骨骼拓撲。骨架生成後,用戶還可以選擇Maya Advanced Skeleton(ADV)或HumanIK,自動創建相應的控制綁定,用於後續擺姿勢和製作動畫。

這套骨骼生成模型採用類似GPT的自迴歸架構,參數量超過10億。它以完整角色網格爲輸入,通過網格表示理解局部幾何與拓撲,再逐步生成完整的骨骼層級,也可以在已有主骨架的條件下繼續生成物理輔助骨骼。

圖片


(超過10億參數的自迴歸骨骼生成模型)

現在的案例已經覆蓋人形、四足動物、怪物,甚至部分道具,也可以爲頭髮、裙襬和飾品生成複雜的物理骨骼。這些結果不是隻用於演示,而是已經進入實際美術管線,骨骼生成環節在真實項目中能夠減少約30%的耗時。

有了骨架之後,下一步是通用蒙皮。這裏是一個ACG風格遊戲中的典型角色,帶有複雜的裙裝和頭部飾品,大約有2.5萬個頂點、180根骨骼,其中包括多根物理骨骼和修正骨骼。選中所有網格及其對應骨骼後,就可以啓動自動蒙皮;根據網格和骨骼的複雜度,整個過程約需10秒到2分鐘。

完成後,頭髮和裙襬等區域已經能夠跟隨原有骨骼動畫變形,一鍵完成度超過80%,幾乎看不到明顯瑕疵。通用蒙皮模型採用四階段、由粗到細的框架,結合DGCNN與Transformer,逐步完成淺層表示、深層空間特徵提取、骨骼鏈分析和具體骨骼預測,最後爲每一組“頂點—骨骼”關係生成準確權重。

這個模型的參數量超過13億,使用大規模高質量數據集,在80張GPU上訓練了90天。

圖片


(通用蒙皮基礎模型的四階段架構與訓練規模)

大家可以看到,每段視頻的左側是美術師手工製作的蒙皮結果,右側是GoSkinning的輸出,測試時幾乎很難分辨二者。

這些案例來自各個不同風格的項目。我們的General Skinning AI不只處理人形角色,也能處理四足動物、武器等剛性物體,以及差異很大的服裝風格。

圖片


(GoSkinning在不同項目和服裝風格中的一鍵蒙皮結果)

但把模型做大,並不等於生產問題就全部解決了。一個模型能不能真正投入使用,取決於它能否補齊長尾案例。裙裝就是最典型的難點:當服裝由多層網格構成時,通用模型容易出現層與層之間相互穿插、變形不均勻等問題。而在我們的項目中,超過一半的角色都穿着這類服裝,它並不是罕見情況。

因此,我們沒有繼續讓通用模型獨自承擔全部任務,而是製作了一套專門的Skirt Skinning AI。它分成兩個階段:先爲輸入裙裝生成一層與原幾何形狀匹配、但拓撲更乾淨簡單的代理網格,再對代理網格運行通用蒙皮;隨後把權重遷回原始網格,並進行鍼對性的變形優化。

右側並排展示了三種結果,從左到右分別是手工蒙皮、通用蒙皮AI和我們的裙裝蒙皮AI。可以看到,專用流程明顯減少了網格穿插和不均勻變形,結果已經接近手工製作。不過我們也必須承認,自動綁定與蒙皮仍然不擅長處理擁有大量修正骨骼的極複雜角色,我們正在積極解決這個問題。

圖片


(利用代理網格、權重遷移和變形優化處理多層裙裝)


02

 動作生成真正難的 

 不是“能動起來” 

接下來進入動作生成部分。

傳統流程主要有兩種做法:手工製作關鍵幀,或者進行動作捕捉。一個10秒的手K動畫可能需要大約5天,也就是完整的一週;即使使用動捕,後續清理仍然需要2—4天。

我們據此開發了多種AI工具,今天重點介紹兩類:一類是文本生成動作和視頻生成動作,另一類是用於補幀與精修的Motion In-Betweening。它們共同覆蓋從動作生成到後續編輯的流程。

圖片


(傳統動作生產與AI原生動作管線的效率和控制方式對比)

過去幾年,學術界的動作生成大致經歷了三個階段:先是自迴歸方法,之後GPT類架構和擴散模型成爲主流,再到人物與物體、人物與人物、人物與場景之間的交互動作。論文數量持續增長,但學術結果與生產級要求之間依然存在距離。

圖片


(動作生成研究從自迴歸、擴散模型走向交互和部署)

原因在於,遊戲生產需要同時做到三件事。

第一是生產質量。腳滑、抖動、網格穿插、身體漂浮、平衡異常,任何一個問題都不可接受。目標不是得到一個“說得過去的動作”,而是得到可以繼續進入生產流程的動畫。

第二是通用性。同一個系統要覆蓋怪物、射擊、武術等完全不同的角色和動作類型,不能只在某一個類別上表現良好。

第三是美術師控制。動畫師需要修改、指導並繼續打磨模型輸出,而不是被迫接受黑箱一次性生成的結果。

因此,不僅要質量高、通用性強,而且可以讓用戶可控、編輯,得到美術師想要的結果。

圖片


(生產級動作生成必須同時滿足質量、通用性和美術師控制)

我們最早嘗試的是基於離散動作Token的自迴歸基礎模型,例如通過FSQ、RVQ等方式把動作壓縮成有限碼本,再像語言模型一樣生成序列。

問題在於,離散化本身存在一個硬上限:動作在進入碼本時損失的信息,後面再大的模型也無法恢復。

在我們的實驗中,即使有效碼字超過20萬個,重建動作仍然與真實動作出現明顯偏差,例如腳部位置漂移。也就是說,Token重建誤差會直接限制動作保真度。

圖片


(超過20萬個離散編碼仍無法消除動作重建誤差)

這促使我們轉向用Motion Diffusion Transformer,也就是Motion DiT,作爲基礎模型。這裏不再先把動作離散成有限Token,從源頭避免離散化造成的不可逆損失。

經過架構、動作表示和數據規模的共同優化,MPJPE降低33.8%,NPSS降低23.3%,Foot-Skating Error降低60.2%。隨着訓練數據上升,姿態誤差也從4.4352下降到4.0602、3.9034。

圖片


(Motion DiT的動作質量優化與數據擴展結果)

在優化後的Motion DiT主幹上,我們進一步加入多種輸入模態。每一種模態都有自己的Context Transformer,把不同條件編碼成共享表示,再送進同一個主幹Motion DiT。

它的輸入可以是文本、視頻、關鍵幀和音頻;輸出也不只是身體動作,還可以同時生成手勢、口型和麪部動畫。

我們的核心選擇是“一個主幹,多種輸入”:真正承擔生成能力的是統一的基礎模型,前端再針對輸入模態進行專門化。未來增加新的控制信號時,原則上只需要增加一個編碼器,而不是從頭訓練一個新模型。

圖片


(統一的15億參數Motion DiT及其多模態輸入輸出)

但只有生成模型還不夠。專業動畫師不只需要“一鍵生成一個動作”,他們還需要編輯、精修,並把結果放進真實的生產管線。

基於這個基礎模型,我們開發了一條貼合動畫師實際工作方式的AI動畫管線。左側是多模態動作生成,包括文本生成動作、視頻生成動作和音頻驅動動畫;右側是Motion Polish,爲美術師提供關鍵幀條件編輯、動作精修和更廣的生產場景覆蓋。

這正是Motus AI與研究演示的區別:它是按照遊戲美術師實際工作的方式來設計的,而不只是爲了跑分。

圖片


(Motus Motion將多模態生成與動作編輯、精修連接起來)


03

 文本、視頻與關鍵幀 

 開始進入同一套動作管線 

文本生成動作的推理流程有三個核心組件。第一是Prompt Rewrite Model。它先把用戶輸入的自然語言提示改寫成結構化描述。

第二是Duration Model。它讀取改寫後的提示,自動預測這段動作應該持續多長時間。第三才是動作生成模型。文本被編碼後,與時長等條件一起送入Motion DiT,最終輸出3D動作。

圖片

(Text-to-Motion全新版本V1.5版本發佈)

大家可以看到,生成的動作與提示詞高度一致。這裏的對比既有日常動作,也有戰鬥和移動動作;其他模型的結果在左側,我們的結果在右側,重點看模型能否準確理解描述,同時保持動作自然。

圖片


(文本生成動作在語義對齊和動作質量上的現場對比)

爲了生成更長的動作,我們還開發了Multi-Segment Joint Denoising。它讓模型同時接收多段文本提示,生成任意長度的動作序列,從而避免簡單拼接帶來的斷點。

第一段視頻是一段由7條文本提示生成的30秒動畫:角色先快速向前奔跑,隨後遭到攻擊、失去平衡、倒地,再從俯臥狀態起身,最後捂住腹部踉蹌前進。大家可以看到,模型不只要分別滿足每一段描述,還要讓段與段之間自然銜接。第二段則是一段由4條提示生成的31秒動畫,用來展示風格化動作和連續過渡。

目前,我們已經在騰訊遊戲內部把這項能力投入生產,用於動作概念設計、遊戲原型和演示,也用於擴充動作捕捉數據集。

圖片


(多段聯合去噪讓7條文本提示生成30秒連續動作)

視頻生成動作沿用同一套Motion DiT主幹。系統先從輸入畫面中提取人物框和跟蹤結果、二維關鍵點、相機姿態與三維姿態,再通過Context Transformer把視頻條件送入生成模型,輸出能夠直接驅動遊戲角色的完整3D動作。

其中,三維姿態表示由我們內部預訓練,數據來自大規模姿態合成流程。它爲我們提供了比現成姿態估計器更穩定、更魯棒的姿態先驗。

這項能力需要同時解決兩個問題。第一是細節保真,包括身體姿態、重心轉移和細微的上半身動作;第二是腳步穩定,落腳時要保持接觸,儘量減少腳滑。只有姿態大致相似、腳卻在地面上漂移的動作,很難直接投入製作。

圖片


(視頻生成動作對細節還原和穩定腳步的強調)

這是我們的Video-to-Motion V2預覽模型,主要有兩處變化。第一,輸入範圍擴大了:過去只能處理現實拍攝視頻,現在也能處理遊戲風格的虛擬畫面、風格化角色,以及帶真實相機運動和鏡頭切換的片段。

第二,全局軌跡更準確了。過去的版本在處理複雜3D軌跡時,容易把路徑壓平,甚至完全丟失;現在大家可以看到,生成的全局路徑能夠貼近參考視頻,不會在空間中漂移。對於遊戲製作來說,全局軌跡不是“錦上添花”:如果軌跡不對,無論局部姿勢看起來多好,整段動畫都會不穩定。

圖片


(Video-to-Motion 2.0預覽版對姿態、腳步、軌跡和遮擋的改進)

最後一個重點模塊是Motion In-Betweening,也就是MIB。它不是單純再生成一段動作,而是承擔“補間”和“精修”的角色。

它仍然使用同一個DiT主幹:輸入關鍵幀,輸出完整動作序列。MotionBlink MIB可以自動補全最長約1.5秒的關鍵幀間隔,質量接近光學動捕;在演示配置下,生成200幀動畫約需4秒。

圖片


(MIB根據部分關鍵幀合成完整動作序列)

我們最新的MIB Beta接近10億參數。大家可以看圖:綠色是真實動捕,透明藍色是輸入關鍵幀,灰色和淺藍色分別是Alpha與Beta版本的結果。即使面對舞蹈、體育和受傷後退等複雜案例,Beta版本也能保持準確和細節。

根據我們收到的用戶反饋,在寫實動作上,生成質量已經可以與動作捕捉相媲美。固定相同的關鍵幀、更換隨機種子,還能得到多種自然的動作結果。

圖片


(接近10億參數的MIB Beta與動捕、關鍵幀及Alpha版本對比)


04

 90多個項目之後 

 統一模型還要走向遊戲VLA 

回到整條管線,我們圍繞動畫生產的兩個階段形成了一套AI工具:自動綁定、自動蒙皮、後處理、多模態動作生成,以及連接生成結果與美術師編輯流程的Motion Polish。

綁定和蒙皮過去需要幾天,現在複雜服裝可以在幾個小時內完成;動作部分則先由模型生成基礎動畫,再交給美術師編輯和精修。效率提升並不意味着把美術師移出流程,相反,“可編輯、可控制”是生產級系統必須滿足的條件。

圖片


(從角色網格到動畫的端到端統一生成式AI管線)

我們的相關項目包括PUBG Mobile、LOL Mobile、Wuthering Waves、QQ Dancer、Moonton等;Motus Motion也已經在多個核心業務中使用。目前,這套技術已經接入90多個內外部項目。

圖片


(Motus AI已接入90多個內外部項目)

接下來,我們計劃繼續推進兩個方向。一個方向是大型統一多模態動作生成模型,把動作生成、理解和編輯能力放進同一個模型。另一個方向是遊戲中的Vision-Language-Action Model,讓模型理解場景與語言,再控制角色完成翻越、滾動等與環境互動的動作。

最後,所有這些工作都可以歸結爲一個想法:One Engine, Infinite Characters。用一個統一引擎支撐無限種角色,讓創作者把更多精力放回創意本身。

圖片


(Motus AI的下一步:統一多模態動作模型與遊戲VLA)

以下爲分享後的現場問答:

問:文本生成動作能否理解“優雅”“震驚”這種帶有表演意圖的描述?如果結果與導演想法有偏差,能不能像指導真人演員一樣繼續修改?

曾子驕:我們設計的工作流會盡量貼合動畫師原有的工作方式。首先可以通過視頻、文本等輸入生成完整動作序列;如果結果與想法不一致,美術師可以修改關鍵姿勢,再使用MIB工具重建和精修整段動作。

問:訓練數據是怎樣構建的?

曾子驕:我們有一條數據管線。通過專業的設備捕捉,建立視頻與動作之間的對應數據,然後用於模型訓練。

問:這些工具可以在哪些平臺使用?能否輸出到Godot、Unity或Unreal等引擎?

曾子驕:目前可以通過網站和DCC插件使用,例如3ds Max、Blender、Maya,以及Unreal Engine。文 / 遊戲那點事 零

在本屆科隆國際遊戲展開發者大會上,AI相關議題明顯升溫。今年大會還專門設置了兩條AI專題賽道:AI in Gameplay(聚焦AI如何改變玩法)和 AI in Production(聚焦AI如何提升生產管線)。這種"玩法+生產"的雙線路徑,與騰訊遊戲此前提出的AI應用框架不謀而合。

值得注意的是,今年AI議題共計32場,其中涉及具體應用的議題數佔比超過50%,可以看到,AI與生產管線的結合正成爲行業趨勢。 騰訊、EA等海內外公司的開發者紛紛展示了各自在AI應用中的探索,從分享的內容來看,中國廠商在遊戲AI應用方面,正在引領全球。

其中,騰訊遊戲公共技術線Motus AI Team負責人曾子驕帶來了一場題爲《Breathing Life into Geometry 2.0: Advancing the Unified AI Pipeline for 3D Character Animation》的分享。

圖片

(騰訊遊戲統一AI角色動畫管線分享現場)

這場演講討論的並不是一個孤立的“文生動作”功能,而是一條覆蓋角色綁定、蒙皮、多模態動作生成與動作精修的統一AI管線。它試圖解決遊戲角色生產中最耗時的兩段工作:先讓靜態幾何模型擁有可驅動的骨骼與蒙皮,再把文本、視頻、關鍵幀和音頻等輸入變成能夠進入生產流程的動畫。

最直觀的變化體現在製作效率上:過去,一個相對簡單的角色服裝也需要約3個人日完成綁定與蒙皮,複雜服裝最多要約4天;接入Motus AI後,複雜服裝連同美術師後續修整在內,可以縮短到1—4個人時。目前,這套技術已經接入90多個內外部項目,騰訊稱效率提升超過8倍。

圖片


(Motus AI Team的主要研究方向)

這套管線追求的不是“看起來像動作”的研究演示,而是生產級動畫:腳不能滑、身體不能抖、角色不能漂浮或失去平衡,模型還要適配不同類型的角色,並把結果交還給動畫師繼續編輯。

最讓人印象深刻的是,本次分享,其發佈了業界首個多指令、任意長度的文生動作大模型,支持無限長動作序列生成,生成結果指令遵循度好,長時間一致性強,不漂移。

(Motus AI發佈業界首個多指令、任意長度文生動作大模型)

以下爲遊戲那點事整理的分享實錄,爲優化閱讀體驗有所調整:


01

 從幾天到幾小時 

 AI先接管綁定和蒙皮 

大家下午好,我是曾子驕,騰訊遊戲Motus AI Team負責人。

今天分享的是我們團隊最新的進展——《讓幾何模型煥發生命2.0:面向3D角色動畫的統一AI管線》。過去大家看到的可能是這條管線中的不同模塊,現在我們想把它們放在同一條端到端流程裏。

我畢業後加入騰訊遊戲,此後一直從事遊戲AI相關工作。早期我參與過鬥地主AI智能體的研發,它把深度學習與博弈樹搜索結合起來,並實現了規模化部署。

後來我帶領Motus AI Team,把工作重點轉向3D角色:一方面研發大規模角色綁定與蒙皮模型,另一方面研發多模態動作生成模型。相關工作也曾在GDC、SIGGRAPH等頂會上進行分享。

一款遊戲最先抓住玩家的,往往是視覺呈現,尤其是主角如何運動。高質量角色動畫既是遊戲生產的核心組成部分,也是玩家最直接看到的內容之一。

完整的3D角色生產通常從二維概念設計開始,接着進入建模、UV展開和貼圖製作,最後進入動畫流程。動畫流程又可以拆成兩個主要部分:第一是綁定和蒙皮,第二是骨骼動畫。我們今天的工作,主要圍繞這兩部分展開。

圖片


(3D角色從概念設計、建模到綁定蒙皮和骨骼動畫的完整流程)

綁定和蒙皮決定了角色服裝如何被骨骼驅動。網格上的每一個頂點會受到一根或多根骨骼影響,各骨骼權重之和必須爲1。綁定負責建立骨架,蒙皮負責把網格與骨骼之間的驅動關係寫進權重。它們的原理並不難理解,但手工處理非常耗時。

按照我們的生產經驗,一個簡單服裝大約需要3個人日,複雜服裝最多要4天。使用Motus AI後,一個複雜服裝連同美術師修整在內,可以從數天縮短到1-4個人時。

圖片


(傳統手工權重繪製與Motus AI端到端處理的流程對比)

要把自動綁定和蒙皮真正放進生產流程,我們首先需要面對三個問題。

第一個問題是建模與表示。3D資產的形狀和拓撲差異很大,系統必須找到一種有效方式,表示異構的3D數據,以及網格與骨骼之間的關係。

第二個問題是冷啓動。遊戲角色風格千差萬別,我們希望得到的是一個通用模型:它拿到新的角色後能夠零樣本工作,而不是每遇到一種項目風格,就重新做一次微調。

第三個問題是長尾案例。多層服裝很容易出現網格穿插和不均勻變形,這些問題在展示用樣例裏或許可以繞開,在真正的項目裏卻不能迴避。

圖片


(自動綁定與蒙皮要解決的三類難題:表示、冷啓動和長尾案例)

因此,我們把整套方案拆成三層。第一層是Skeleton Generation AI,根據任意角色網格生成對應骨架;第二層是General Skinning AI,根據網格和骨架自動生成全部頂點的蒙皮權重;第三層是一組後處理AI,專門修復前兩步中表現不夠好的區域。

從自動化率看,骨骼生成目前約爲50%—70%,通用蒙皮約爲70%—85%,在加入後處理後可以超過85%。這裏的思路是先用通用基礎模型覆蓋主體工作,再用專門工具收掉生產中的長尾問題。

圖片


(Skeleton Gen、General Skinning與後處理AI組成的三層框架)

Skeleton Generation AI提供了幾種不同的工作模式。用戶既可以上傳任意3D角色模型,全自動生成與角色貼合的完整骨架;也可以輸入一套參考主骨架,在保持模板拓撲的情況下適配新角色;如果角色已經有主骨架,還可以只爲裙襬、頭髮等部位補充物理輔助骨骼。

系統也支持多樣化採樣。美術師可以調整滑桿參數,爲同一個角色生成不同的骨骼拓撲。骨架生成後,用戶還可以選擇Maya Advanced Skeleton(ADV)或HumanIK,自動創建相應的控制綁定,用於後續擺姿勢和製作動畫。

這套骨骼生成模型採用類似GPT的自迴歸架構,參數量超過10億。它以完整角色網格爲輸入,通過網格表示理解局部幾何與拓撲,再逐步生成完整的骨骼層級,也可以在已有主骨架的條件下繼續生成物理輔助骨骼。

圖片


(超過10億參數的自迴歸骨骼生成模型)

現在的案例已經覆蓋人形、四足動物、怪物,甚至部分道具,也可以爲頭髮、裙襬和飾品生成複雜的物理骨骼。這些結果不是隻用於演示,而是已經進入實際美術管線,骨骼生成環節在真實項目中能夠減少約30%的耗時。

有了骨架之後,下一步是通用蒙皮。這裏是一個ACG風格遊戲中的典型角色,帶有複雜的裙裝和頭部飾品,大約有2.5萬個頂點、180根骨骼,其中包括多根物理骨骼和修正骨骼。選中所有網格及其對應骨骼後,就可以啓動自動蒙皮;根據網格和骨骼的複雜度,整個過程約需10秒到2分鐘。

完成後,頭髮和裙襬等區域已經能夠跟隨原有骨骼動畫變形,一鍵完成度超過80%,幾乎看不到明顯瑕疵。通用蒙皮模型採用四階段、由粗到細的框架,結合DGCNN與Transformer,逐步完成淺層表示、深層空間特徵提取、骨骼鏈分析和具體骨骼預測,最後爲每一組“頂點—骨骼”關係生成準確權重。

這個模型的參數量超過13億,使用大規模高質量數據集,在80張GPU上訓練了90天。

圖片


(通用蒙皮基礎模型的四階段架構與訓練規模)

大家可以看到,每段視頻的左側是美術師手工製作的蒙皮結果,右側是GoSkinning的輸出,測試時幾乎很難分辨二者。

這些案例來自各個不同風格的項目。我們的General Skinning AI不只處理人形角色,也能處理四足動物、武器等剛性物體,以及差異很大的服裝風格。

圖片


(GoSkinning在不同項目和服裝風格中的一鍵蒙皮結果)

但把模型做大,並不等於生產問題就全部解決了。一個模型能不能真正投入使用,取決於它能否補齊長尾案例。裙裝就是最典型的難點:當服裝由多層網格構成時,通用模型容易出現層與層之間相互穿插、變形不均勻等問題。而在我們的項目中,超過一半的角色都穿着這類服裝,它並不是罕見情況。

因此,我們沒有繼續讓通用模型獨自承擔全部任務,而是製作了一套專門的Skirt Skinning AI。它分成兩個階段:先爲輸入裙裝生成一層與原幾何形狀匹配、但拓撲更乾淨簡單的代理網格,再對代理網格運行通用蒙皮;隨後把權重遷回原始網格,並進行鍼對性的變形優化。

右側並排展示了三種結果,從左到右分別是手工蒙皮、通用蒙皮AI和我們的裙裝蒙皮AI。可以看到,專用流程明顯減少了網格穿插和不均勻變形,結果已經接近手工製作。不過我們也必須承認,自動綁定與蒙皮仍然不擅長處理擁有大量修正骨骼的極複雜角色,我們正在積極解決這個問題。

圖片


(利用代理網格、權重遷移和變形優化處理多層裙裝)


02

 動作生成真正難的 

 不是“能動起來” 

接下來進入動作生成部分。

傳統流程主要有兩種做法:手工製作關鍵幀,或者進行動作捕捉。一個10秒的手K動畫可能需要大約5天,也就是完整的一週;即使使用動捕,後續清理仍然需要2—4天。

我們據此開發了多種AI工具,今天重點介紹兩類:一類是文本生成動作和視頻生成動作,另一類是用於補幀與精修的Motion In-Betweening。它們共同覆蓋從動作生成到後續編輯的流程。

圖片


(傳統動作生產與AI原生動作管線的效率和控制方式對比)

過去幾年,學術界的動作生成大致經歷了三個階段:先是自迴歸方法,之後GPT類架構和擴散模型成爲主流,再到人物與物體、人物與人物、人物與場景之間的交互動作。論文數量持續增長,但學術結果與生產級要求之間依然存在距離。

圖片


(動作生成研究從自迴歸、擴散模型走向交互和部署)

原因在於,遊戲生產需要同時做到三件事。

第一是生產質量。腳滑、抖動、網格穿插、身體漂浮、平衡異常,任何一個問題都不可接受。目標不是得到一個“說得過去的動作”,而是得到可以繼續進入生產流程的動畫。

第二是通用性。同一個系統要覆蓋怪物、射擊、武術等完全不同的角色和動作類型,不能只在某一個類別上表現良好。

第三是美術師控制。動畫師需要修改、指導並繼續打磨模型輸出,而不是被迫接受黑箱一次性生成的結果。

因此,不僅要質量高、通用性強,而且可以讓用戶可控、編輯,得到美術師想要的結果。

圖片


(生產級動作生成必須同時滿足質量、通用性和美術師控制)

我們最早嘗試的是基於離散動作Token的自迴歸基礎模型,例如通過FSQ、RVQ等方式把動作壓縮成有限碼本,再像語言模型一樣生成序列。

問題在於,離散化本身存在一個硬上限:動作在進入碼本時損失的信息,後面再大的模型也無法恢復。

在我們的實驗中,即使有效碼字超過20萬個,重建動作仍然與真實動作出現明顯偏差,例如腳部位置漂移。也就是說,Token重建誤差會直接限制動作保真度。

圖片


(超過20萬個離散編碼仍無法消除動作重建誤差)

這促使我們轉向用Motion Diffusion Transformer,也就是Motion DiT,作爲基礎模型。這裏不再先把動作離散成有限Token,從源頭避免離散化造成的不可逆損失。

經過架構、動作表示和數據規模的共同優化,MPJPE降低33.8%,NPSS降低23.3%,Foot-Skating Error降低60.2%。隨着訓練數據上升,姿態誤差也從4.4352下降到4.0602、3.9034。

圖片


(Motion DiT的動作質量優化與數據擴展結果)

在優化後的Motion DiT主幹上,我們進一步加入多種輸入模態。每一種模態都有自己的Context Transformer,把不同條件編碼成共享表示,再送進同一個主幹Motion DiT。

它的輸入可以是文本、視頻、關鍵幀和音頻;輸出也不只是身體動作,還可以同時生成手勢、口型和麪部動畫。

我們的核心選擇是“一個主幹,多種輸入”:真正承擔生成能力的是統一的基礎模型,前端再針對輸入模態進行專門化。未來增加新的控制信號時,原則上只需要增加一個編碼器,而不是從頭訓練一個新模型。

圖片


(統一的15億參數Motion DiT及其多模態輸入輸出)

但只有生成模型還不夠。專業動畫師不只需要“一鍵生成一個動作”,他們還需要編輯、精修,並把結果放進真實的生產管線。

基於這個基礎模型,我們開發了一條貼合動畫師實際工作方式的AI動畫管線。左側是多模態動作生成,包括文本生成動作、視頻生成動作和音頻驅動動畫;右側是Motion Polish,爲美術師提供關鍵幀條件編輯、動作精修和更廣的生產場景覆蓋。

這正是Motus AI與研究演示的區別:它是按照遊戲美術師實際工作的方式來設計的,而不只是爲了跑分。

圖片


(Motus Motion將多模態生成與動作編輯、精修連接起來)


03

 文本、視頻與關鍵幀 

 開始進入同一套動作管線 

文本生成動作的推理流程有三個核心組件。第一是Prompt Rewrite Model。它先把用戶輸入的自然語言提示改寫成結構化描述。

第二是Duration Model。它讀取改寫後的提示,自動預測這段動作應該持續多長時間。第三才是動作生成模型。文本被編碼後,與時長等條件一起送入Motion DiT,最終輸出3D動作。

圖片

(Text-to-Motion全新版本V1.5版本發佈)

大家可以看到,生成的動作與提示詞高度一致。這裏的對比既有日常動作,也有戰鬥和移動動作;其他模型的結果在左側,我們的結果在右側,重點看模型能否準確理解描述,同時保持動作自然。

圖片


(文本生成動作在語義對齊和動作質量上的現場對比)

爲了生成更長的動作,我們還開發了Multi-Segment Joint Denoising。它讓模型同時接收多段文本提示,生成任意長度的動作序列,從而避免簡單拼接帶來的斷點。

第一段視頻是一段由7條文本提示生成的30秒動畫:角色先快速向前奔跑,隨後遭到攻擊、失去平衡、倒地,再從俯臥狀態起身,最後捂住腹部踉蹌前進。大家可以看到,模型不只要分別滿足每一段描述,還要讓段與段之間自然銜接。第二段則是一段由4條提示生成的31秒動畫,用來展示風格化動作和連續過渡。

目前,我們已經在騰訊遊戲內部把這項能力投入生產,用於動作概念設計、遊戲原型和演示,也用於擴充動作捕捉數據集。

圖片


(多段聯合去噪讓7條文本提示生成30秒連續動作)

視頻生成動作沿用同一套Motion DiT主幹。系統先從輸入畫面中提取人物框和跟蹤結果、二維關鍵點、相機姿態與三維姿態,再通過Context Transformer把視頻條件送入生成模型,輸出能夠直接驅動遊戲角色的完整3D動作。

其中,三維姿態表示由我們內部預訓練,數據來自大規模姿態合成流程。它爲我們提供了比現成姿態估計器更穩定、更魯棒的姿態先驗。

這項能力需要同時解決兩個問題。第一是細節保真,包括身體姿態、重心轉移和細微的上半身動作;第二是腳步穩定,落腳時要保持接觸,儘量減少腳滑。只有姿態大致相似、腳卻在地面上漂移的動作,很難直接投入製作。

圖片


(視頻生成動作對細節還原和穩定腳步的強調)

這是我們的Video-to-Motion V2預覽模型,主要有兩處變化。第一,輸入範圍擴大了:過去只能處理現實拍攝視頻,現在也能處理遊戲風格的虛擬畫面、風格化角色,以及帶真實相機運動和鏡頭切換的片段。

第二,全局軌跡更準確了。過去的版本在處理複雜3D軌跡時,容易把路徑壓平,甚至完全丟失;現在大家可以看到,生成的全局路徑能夠貼近參考視頻,不會在空間中漂移。對於遊戲製作來說,全局軌跡不是“錦上添花”:如果軌跡不對,無論局部姿勢看起來多好,整段動畫都會不穩定。

圖片


(Video-to-Motion 2.0預覽版對姿態、腳步、軌跡和遮擋的改進)

最後一個重點模塊是Motion In-Betweening,也就是MIB。它不是單純再生成一段動作,而是承擔“補間”和“精修”的角色。

它仍然使用同一個DiT主幹:輸入關鍵幀,輸出完整動作序列。MotionBlink MIB可以自動補全最長約1.5秒的關鍵幀間隔,質量接近光學動捕;在演示配置下,生成200幀動畫約需4秒。

圖片


(MIB根據部分關鍵幀合成完整動作序列)

我們最新的MIB Beta接近10億參數。大家可以看圖:綠色是真實動捕,透明藍色是輸入關鍵幀,灰色和淺藍色分別是Alpha與Beta版本的結果。即使面對舞蹈、體育和受傷後退等複雜案例,Beta版本也能保持準確和細節。

根據我們收到的用戶反饋,在寫實動作上,生成質量已經可以與動作捕捉相媲美。固定相同的關鍵幀、更換隨機種子,還能得到多種自然的動作結果。

圖片


(接近10億參數的MIB Beta與動捕、關鍵幀及Alpha版本對比)


04

 90多個項目之後 

 統一模型還要走向遊戲VLA 

回到整條管線,我們圍繞動畫生產的兩個階段形成了一套AI工具:自動綁定、自動蒙皮、後處理、多模態動作生成,以及連接生成結果與美術師編輯流程的Motion Polish。

綁定和蒙皮過去需要幾天,現在複雜服裝可以在幾個小時內完成;動作部分則先由模型生成基礎動畫,再交給美術師編輯和精修。效率提升並不意味着把美術師移出流程,相反,“可編輯、可控制”是生產級系統必須滿足的條件。

圖片


(從角色網格到動畫的端到端統一生成式AI管線)

我們的相關項目包括PUBG Mobile、LOL Mobile、Wuthering Waves、QQ Dancer、Moonton等;Motus Motion也已經在多個核心業務中使用。目前,這套技術已經接入90多個內外部項目。

圖片


(Motus AI已接入90多個內外部項目)

接下來,我們計劃繼續推進兩個方向。一個方向是大型統一多模態動作生成模型,把動作生成、理解和編輯能力放進同一個模型。另一個方向是遊戲中的Vision-Language-Action Model,讓模型理解場景與語言,再控制角色完成翻越、滾動等與環境互動的動作。

最後,所有這些工作都可以歸結爲一個想法:One Engine, Infinite Characters。用一個統一引擎支撐無限種角色,讓創作者把更多精力放回創意本身。

圖片


(Motus AI的下一步:統一多模態動作模型與遊戲VLA)

以下爲分享後的現場問答:

問:文本生成動作能否理解“優雅”“震驚”這種帶有表演意圖的描述?如果結果與導演想法有偏差,能不能像指導真人演員一樣繼續修改?

曾子驕:我們設計的工作流會盡量貼合動畫師原有的工作方式。首先可以通過視頻、文本等輸入生成完整動作序列;如果結果與想法不一致,美術師可以修改關鍵姿勢,再使用MIB工具重建和精修整段動作。

問:訓練數據是怎樣構建的?

曾子驕:我們有一條數據管線。通過專業的設備捕捉,建立視頻與動作之間的對應數據,然後用於模型訓練。

問:這些工具可以在哪些平臺使用?能否輸出到Godot、Unity或Unreal等引擎?

曾子驕:目前可以通過網站和DCC插件使用,例如3ds Max、Blender、Maya,以及Unreal Engine。

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com