文 / 游戏那点事 零
在本届科隆国际游戏展开发者大会上,AI相关议题明显升温。今年大会还专门设置了两条AI专题赛道:AI in Gameplay(聚焦AI如何改变玩法)和 AI in Production(聚焦AI如何提升生产管线)。这种"玩法+生产"的双线路径,与腾讯游戏此前提出的AI应用框架不谋而合。
值得注意的是,今年AI议题共计32场,其中涉及具体应用的议题数占比超过50%,可以看到,AI与生产管线的结合正成为行业趋势。 腾讯、EA等海内外公司的开发者纷纷展示了各自在AI应用中的探索,从分享的内容来看,中国厂商在游戏AI应用方面,正在引领全球。
其中,腾讯游戏公共技术线Motus AI Team负责人曾子骄带来了一场题为《Breathing Life into Geometry 2.0: Advancing the Unified AI Pipeline for 3D Character Animation》的分享。
(腾讯游戏统一AI角色动画管线分享现场)
这场演讲讨论的并不是一个孤立的“文生动作”功能,而是一条覆盖角色绑定、蒙皮、多模态动作生成与动作精修的统一AI管线。它试图解决游戏角色生产中最耗时的两段工作:先让静态几何模型拥有可驱动的骨骼与蒙皮,再把文本、视频、关键帧和音频等输入变成能够进入生产流程的动画。
最直观的变化体现在制作效率上:过去,一个相对简单的角色服装也需要约3个人日完成绑定与蒙皮,复杂服装最多要约4天;接入Motus AI后,复杂服装连同美术师后续修整在内,可以缩短到1—4个人时。目前,这套技术已经接入90多个内外部项目,腾讯称效率提升超过8倍。
(Motus AI Team的主要研究方向)
这套管线追求的不是“看起来像动作”的研究演示,而是生产级动画:脚不能滑、身体不能抖、角色不能漂浮或失去平衡,模型还要适配不同类型的角色,并把结果交还给动画师继续编辑。
最让人印象深刻的是,本次分享,其发布了业界首个多指令、任意长度的文生动作大模型,支持无限长动作序列生成,生成结果指令遵循度好,长时间一致性强,不漂移。
(Motus AI发布业界首个多指令、任意长度文生动作大模型)
以下为游戏那点事整理的分享实录,为优化阅读体验有所调整:
01
从几天到几小时
AI先接管绑定和蒙皮
大家下午好,我是曾子骄,腾讯游戏Motus AI Team负责人。
今天分享的是我们团队最新的进展——《让几何模型焕发生命2.0:面向3D角色动画的统一AI管线》。过去大家看到的可能是这条管线中的不同模块,现在我们想把它们放在同一条端到端流程里。
我毕业后加入腾讯游戏,此后一直从事游戏AI相关工作。早期我参与过斗地主AI智能体的研发,它把深度学习与博弈树搜索结合起来,并实现了规模化部署。
后来我带领Motus AI Team,把工作重点转向3D角色:一方面研发大规模角色绑定与蒙皮模型,另一方面研发多模态动作生成模型。相关工作也曾在GDC、SIGGRAPH等顶会上进行分享。
一款游戏最先抓住玩家的,往往是视觉呈现,尤其是主角如何运动。高质量角色动画既是游戏生产的核心组成部分,也是玩家最直接看到的内容之一。
完整的3D角色生产通常从二维概念设计开始,接着进入建模、UV展开和贴图制作,最后进入动画流程。动画流程又可以拆成两个主要部分:第一是绑定和蒙皮,第二是骨骼动画。我们今天的工作,主要围绕这两部分展开。
(3D角色从概念设计、建模到绑定蒙皮和骨骼动画的完整流程)
绑定和蒙皮决定了角色服装如何被骨骼驱动。网格上的每一个顶点会受到一根或多根骨骼影响,各骨骼权重之和必须为1。绑定负责建立骨架,蒙皮负责把网格与骨骼之间的驱动关系写进权重。它们的原理并不难理解,但手工处理非常耗时。
按照我们的生产经验,一个简单服装大约需要3个人日,复杂服装最多要4天。使用Motus AI后,一个复杂服装连同美术师修整在内,可以从数天缩短到1-4个人时。

(传统手工权重绘制与Motus AI端到端处理的流程对比)
要把自动绑定和蒙皮真正放进生产流程,我们首先需要面对三个问题。
第一个问题是建模与表示。3D资产的形状和拓扑差异很大,系统必须找到一种有效方式,表示异构的3D数据,以及网格与骨骼之间的关系。
第二个问题是冷启动。游戏角色风格千差万别,我们希望得到的是一个通用模型:它拿到新的角色后能够零样本工作,而不是每遇到一种项目风格,就重新做一次微调。
第三个问题是长尾案例。多层服装很容易出现网格穿插和不均匀变形,这些问题在展示用样例里或许可以绕开,在真正的项目里却不能回避。

(自动绑定与蒙皮要解决的三类难题:表示、冷启动和长尾案例)
因此,我们把整套方案拆成三层。第一层是Skeleton Generation AI,根据任意角色网格生成对应骨架;第二层是General Skinning AI,根据网格和骨架自动生成全部顶点的蒙皮权重;第三层是一组后处理AI,专门修复前两步中表现不够好的区域。
从自动化率看,骨骼生成目前约为50%—70%,通用蒙皮约为70%—85%,在加入后处理后可以超过85%。这里的思路是先用通用基础模型覆盖主体工作,再用专门工具收掉生产中的长尾问题。

(Skeleton Gen、General Skinning与后处理AI组成的三层框架)
Skeleton Generation AI提供了几种不同的工作模式。用户既可以上传任意3D角色模型,全自动生成与角色贴合的完整骨架;也可以输入一套参考主骨架,在保持模板拓扑的情况下适配新角色;如果角色已经有主骨架,还可以只为裙摆、头发等部位补充物理辅助骨骼。
系统也支持多样化采样。美术师可以调整滑杆参数,为同一个角色生成不同的骨骼拓扑。骨架生成后,用户还可以选择Maya Advanced Skeleton(ADV)或HumanIK,自动创建相应的控制绑定,用于后续摆姿势和制作动画。
这套骨骼生成模型采用类似GPT的自回归架构,参数量超过10亿。它以完整角色网格为输入,通过网格表示理解局部几何与拓扑,再逐步生成完整的骨骼层级,也可以在已有主骨架的条件下继续生成物理辅助骨骼。

(超过10亿参数的自回归骨骼生成模型)
现在的案例已经覆盖人形、四足动物、怪物,甚至部分道具,也可以为头发、裙摆和饰品生成复杂的物理骨骼。这些结果不是只用于演示,而是已经进入实际美术管线,骨骼生成环节在真实项目中能够减少约30%的耗时。
有了骨架之后,下一步是通用蒙皮。这里是一个ACG风格游戏中的典型角色,带有复杂的裙装和头部饰品,大约有2.5万个顶点、180根骨骼,其中包括多根物理骨骼和修正骨骼。选中所有网格及其对应骨骼后,就可以启动自动蒙皮;根据网格和骨骼的复杂度,整个过程约需10秒到2分钟。
完成后,头发和裙摆等区域已经能够跟随原有骨骼动画变形,一键完成度超过80%,几乎看不到明显瑕疵。通用蒙皮模型采用四阶段、由粗到细的框架,结合DGCNN与Transformer,逐步完成浅层表示、深层空间特征提取、骨骼链分析和具体骨骼预测,最后为每一组“顶点—骨骼”关系生成准确权重。
这个模型的参数量超过13亿,使用大规模高质量数据集,在80张GPU上训练了90天。

(通用蒙皮基础模型的四阶段架构与训练规模)
大家可以看到,每段视频的左侧是美术师手工制作的蒙皮结果,右侧是GoSkinning的输出,测试时几乎很难分辨二者。
这些案例来自各个不同风格的项目。我们的General Skinning AI不只处理人形角色,也能处理四足动物、武器等刚性物体,以及差异很大的服装风格。

(GoSkinning在不同项目和服装风格中的一键蒙皮结果)
但把模型做大,并不等于生产问题就全部解决了。一个模型能不能真正投入使用,取决于它能否补齐长尾案例。裙装就是最典型的难点:当服装由多层网格构成时,通用模型容易出现层与层之间相互穿插、变形不均匀等问题。而在我们的项目中,超过一半的角色都穿着这类服装,它并不是罕见情况。
因此,我们没有继续让通用模型独自承担全部任务,而是制作了一套专门的Skirt Skinning AI。它分成两个阶段:先为输入裙装生成一层与原几何形状匹配、但拓扑更干净简单的代理网格,再对代理网格运行通用蒙皮;随后把权重迁回原始网格,并进行针对性的变形优化。
右侧并排展示了三种结果,从左到右分别是手工蒙皮、通用蒙皮AI和我们的裙装蒙皮AI。可以看到,专用流程明显减少了网格穿插和不均匀变形,结果已经接近手工制作。不过我们也必须承认,自动绑定与蒙皮仍然不擅长处理拥有大量修正骨骼的极复杂角色,我们正在积极解决这个问题。

(利用代理网格、权重迁移和变形优化处理多层裙装)
02
动作生成真正难的
不是“能动起来”
接下来进入动作生成部分。
传统流程主要有两种做法:手工制作关键帧,或者进行动作捕捉。一个10秒的手K动画可能需要大约5天,也就是完整的一周;即使使用动捕,后续清理仍然需要2—4天。
我们据此开发了多种AI工具,今天重点介绍两类:一类是文本生成动作和视频生成动作,另一类是用于补帧与精修的Motion In-Betweening。它们共同覆盖从动作生成到后续编辑的流程。

(传统动作生产与AI原生动作管线的效率和控制方式对比)
过去几年,学术界的动作生成大致经历了三个阶段:先是自回归方法,之后GPT类架构和扩散模型成为主流,再到人物与物体、人物与人物、人物与场景之间的交互动作。论文数量持续增长,但学术结果与生产级要求之间依然存在距离。

(动作生成研究从自回归、扩散模型走向交互和部署)
原因在于,游戏生产需要同时做到三件事。
第一是生产质量。脚滑、抖动、网格穿插、身体漂浮、平衡异常,任何一个问题都不可接受。目标不是得到一个“说得过去的动作”,而是得到可以继续进入生产流程的动画。
第二是通用性。同一个系统要覆盖怪物、射击、武术等完全不同的角色和动作类型,不能只在某一个类别上表现良好。
第三是美术师控制。动画师需要修改、指导并继续打磨模型输出,而不是被迫接受黑箱一次性生成的结果。
因此,不仅要质量高、通用性强,而且可以让用户可控、编辑,得到美术师想要的结果。

(生产级动作生成必须同时满足质量、通用性和美术师控制)
我们最早尝试的是基于离散动作Token的自回归基础模型,例如通过FSQ、RVQ等方式把动作压缩成有限码本,再像语言模型一样生成序列。
问题在于,离散化本身存在一个硬上限:动作在进入码本时损失的信息,后面再大的模型也无法恢复。
在我们的实验中,即使有效码字超过20万个,重建动作仍然与真实动作出现明显偏差,例如脚部位置漂移。也就是说,Token重建误差会直接限制动作保真度。

(超过20万个离散编码仍无法消除动作重建误差)
这促使我们转向用Motion Diffusion Transformer,也就是Motion DiT,作为基础模型。这里不再先把动作离散成有限Token,从源头避免离散化造成的不可逆损失。
经过架构、动作表示和数据规模的共同优化,MPJPE降低33.8%,NPSS降低23.3%,Foot-Skating Error降低60.2%。随着训练数据上升,姿态误差也从4.4352下降到4.0602、3.9034。
![]()
(Motion DiT的动作质量优化与数据扩展结果)
在优化后的Motion DiT主干上,我们进一步加入多种输入模态。每一种模态都有自己的Context Transformer,把不同条件编码成共享表示,再送进同一个主干Motion DiT。
它的输入可以是文本、视频、关键帧和音频;输出也不只是身体动作,还可以同时生成手势、口型和面部动画。
我们的核心选择是“一个主干,多种输入”:真正承担生成能力的是统一的基础模型,前端再针对输入模态进行专门化。未来增加新的控制信号时,原则上只需要增加一个编码器,而不是从头训练一个新模型。

(统一的15亿参数Motion DiT及其多模态输入输出)
但只有生成模型还不够。专业动画师不只需要“一键生成一个动作”,他们还需要编辑、精修,并把结果放进真实的生产管线。
基于这个基础模型,我们开发了一条贴合动画师实际工作方式的AI动画管线。左侧是多模态动作生成,包括文本生成动作、视频生成动作和音频驱动动画;右侧是Motion Polish,为美术师提供关键帧条件编辑、动作精修和更广的生产场景覆盖。
这正是Motus AI与研究演示的区别:它是按照游戏美术师实际工作的方式来设计的,而不只是为了跑分。

(Motus Motion将多模态生成与动作编辑、精修连接起来)
03
文本、视频与关键帧
开始进入同一套动作管线
文本生成动作的推理流程有三个核心组件。第一是Prompt Rewrite Model。它先把用户输入的自然语言提示改写成结构化描述。
第二是Duration Model。它读取改写后的提示,自动预测这段动作应该持续多长时间。第三才是动作生成模型。文本被编码后,与时长等条件一起送入Motion DiT,最终输出3D动作。
![]()
(Text-to-Motion全新版本V1.5版本发布)
大家可以看到,生成的动作与提示词高度一致。这里的对比既有日常动作,也有战斗和移动动作;其他模型的结果在左侧,我们的结果在右侧,重点看模型能否准确理解描述,同时保持动作自然。
![]()
(文本生成动作在语义对齐和动作质量上的现场对比)
为了生成更长的动作,我们还开发了Multi-Segment Joint Denoising。它让模型同时接收多段文本提示,生成任意长度的动作序列,从而避免简单拼接带来的断点。
第一段视频是一段由7条文本提示生成的30秒动画:角色先快速向前奔跑,随后遭到攻击、失去平衡、倒地,再从俯卧状态起身,最后捂住腹部踉跄前进。大家可以看到,模型不只要分别满足每一段描述,还要让段与段之间自然衔接。第二段则是一段由4条提示生成的31秒动画,用来展示风格化动作和连续过渡。
目前,我们已经在腾讯游戏内部把这项能力投入生产,用于动作概念设计、游戏原型和演示,也用于扩充动作捕捉数据集。

(多段联合去噪让7条文本提示生成30秒连续动作)
视频生成动作沿用同一套Motion DiT主干。系统先从输入画面中提取人物框和跟踪结果、二维关键点、相机姿态与三维姿态,再通过Context Transformer把视频条件送入生成模型,输出能够直接驱动游戏角色的完整3D动作。
其中,三维姿态表示由我们内部预训练,数据来自大规模姿态合成流程。它为我们提供了比现成姿态估计器更稳定、更鲁棒的姿态先验。
这项能力需要同时解决两个问题。第一是细节保真,包括身体姿态、重心转移和细微的上半身动作;第二是脚步稳定,落脚时要保持接触,尽量减少脚滑。只有姿态大致相似、脚却在地面上漂移的动作,很难直接投入制作。

(视频生成动作对细节还原和稳定脚步的强调)
这是我们的Video-to-Motion V2预览模型,主要有两处变化。第一,输入范围扩大了:过去只能处理现实拍摄视频,现在也能处理游戏风格的虚拟画面、风格化角色,以及带真实相机运动和镜头切换的片段。
第二,全局轨迹更准确了。过去的版本在处理复杂3D轨迹时,容易把路径压平,甚至完全丢失;现在大家可以看到,生成的全局路径能够贴近参考视频,不会在空间中漂移。对于游戏制作来说,全局轨迹不是“锦上添花”:如果轨迹不对,无论局部姿势看起来多好,整段动画都会不稳定。

(Video-to-Motion 2.0预览版对姿态、脚步、轨迹和遮挡的改进)
最后一个重点模块是Motion In-Betweening,也就是MIB。它不是单纯再生成一段动作,而是承担“补间”和“精修”的角色。
它仍然使用同一个DiT主干:输入关键帧,输出完整动作序列。MotionBlink MIB可以自动补全最长约1.5秒的关键帧间隔,质量接近光学动捕;在演示配置下,生成200帧动画约需4秒。
![]()
(MIB根据部分关键帧合成完整动作序列)
我们最新的MIB Beta接近10亿参数。大家可以看图:绿色是真实动捕,透明蓝色是输入关键帧,灰色和浅蓝色分别是Alpha与Beta版本的结果。即使面对舞蹈、体育和受伤后退等复杂案例,Beta版本也能保持准确和细节。
根据我们收到的用户反馈,在写实动作上,生成质量已经可以与动作捕捉相媲美。固定相同的关键帧、更换随机种子,还能得到多种自然的动作结果。

(接近10亿参数的MIB Beta与动捕、关键帧及Alpha版本对比)
04
90多个项目之后
统一模型还要走向游戏VLA
回到整条管线,我们围绕动画生产的两个阶段形成了一套AI工具:自动绑定、自动蒙皮、后处理、多模态动作生成,以及连接生成结果与美术师编辑流程的Motion Polish。
绑定和蒙皮过去需要几天,现在复杂服装可以在几个小时内完成;动作部分则先由模型生成基础动画,再交给美术师编辑和精修。效率提升并不意味着把美术师移出流程,相反,“可编辑、可控制”是生产级系统必须满足的条件。

(从角色网格到动画的端到端统一生成式AI管线)
我们的相关项目包括PUBG Mobile、LOL Mobile、Wuthering Waves、QQ Dancer、Moonton等;Motus Motion也已经在多个核心业务中使用。目前,这套技术已经接入90多个内外部项目。

(Motus AI已接入90多个内外部项目)
接下来,我们计划继续推进两个方向。一个方向是大型统一多模态动作生成模型,把动作生成、理解和编辑能力放进同一个模型。另一个方向是游戏中的Vision-Language-Action Model,让模型理解场景与语言,再控制角色完成翻越、滚动等与环境互动的动作。
最后,所有这些工作都可以归结为一个想法:One Engine, Infinite Characters。用一个统一引擎支撑无限种角色,让创作者把更多精力放回创意本身。

(Motus AI的下一步:统一多模态动作模型与游戏VLA)
以下为分享后的现场问答:
问:文本生成动作能否理解“优雅”“震惊”这种带有表演意图的描述?如果结果与导演想法有偏差,能不能像指导真人演员一样继续修改?
曾子骄:我们设计的工作流会尽量贴合动画师原有的工作方式。首先可以通过视频、文本等输入生成完整动作序列;如果结果与想法不一致,美术师可以修改关键姿势,再使用MIB工具重建和精修整段动作。
问:训练数据是怎样构建的?
曾子骄:我们有一条数据管线。通过专业的设备捕捉,建立视频与动作之间的对应数据,然后用于模型训练。
问:这些工具可以在哪些平台使用?能否输出到Godot、Unity或Unreal等引擎?
曾子骄:目前可以通过网站和DCC插件使用,例如3ds Max、Blender、Maya,以及Unreal Engine。文 / 游戏那点事 零
在本届科隆国际游戏展开发者大会上,AI相关议题明显升温。今年大会还专门设置了两条AI专题赛道:AI in Gameplay(聚焦AI如何改变玩法)和 AI in Production(聚焦AI如何提升生产管线)。这种"玩法+生产"的双线路径,与腾讯游戏此前提出的AI应用框架不谋而合。
值得注意的是,今年AI议题共计32场,其中涉及具体应用的议题数占比超过50%,可以看到,AI与生产管线的结合正成为行业趋势。 腾讯、EA等海内外公司的开发者纷纷展示了各自在AI应用中的探索,从分享的内容来看,中国厂商在游戏AI应用方面,正在引领全球。
其中,腾讯游戏公共技术线Motus AI Team负责人曾子骄带来了一场题为《Breathing Life into Geometry 2.0: Advancing the Unified AI Pipeline for 3D Character Animation》的分享。

(腾讯游戏统一AI角色动画管线分享现场)
这场演讲讨论的并不是一个孤立的“文生动作”功能,而是一条覆盖角色绑定、蒙皮、多模态动作生成与动作精修的统一AI管线。它试图解决游戏角色生产中最耗时的两段工作:先让静态几何模型拥有可驱动的骨骼与蒙皮,再把文本、视频、关键帧和音频等输入变成能够进入生产流程的动画。
最直观的变化体现在制作效率上:过去,一个相对简单的角色服装也需要约3个人日完成绑定与蒙皮,复杂服装最多要约4天;接入Motus AI后,复杂服装连同美术师后续修整在内,可以缩短到1—4个人时。目前,这套技术已经接入90多个内外部项目,腾讯称效率提升超过8倍。

(Motus AI Team的主要研究方向)
这套管线追求的不是“看起来像动作”的研究演示,而是生产级动画:脚不能滑、身体不能抖、角色不能漂浮或失去平衡,模型还要适配不同类型的角色,并把结果交还给动画师继续编辑。
最让人印象深刻的是,本次分享,其发布了业界首个多指令、任意长度的文生动作大模型,支持无限长动作序列生成,生成结果指令遵循度好,长时间一致性强,不漂移。
(Motus AI发布业界首个多指令、任意长度文生动作大模型)
以下为游戏那点事整理的分享实录,为优化阅读体验有所调整:
01
从几天到几小时
AI先接管绑定和蒙皮
大家下午好,我是曾子骄,腾讯游戏Motus AI Team负责人。
今天分享的是我们团队最新的进展——《让几何模型焕发生命2.0:面向3D角色动画的统一AI管线》。过去大家看到的可能是这条管线中的不同模块,现在我们想把它们放在同一条端到端流程里。
我毕业后加入腾讯游戏,此后一直从事游戏AI相关工作。早期我参与过斗地主AI智能体的研发,它把深度学习与博弈树搜索结合起来,并实现了规模化部署。
后来我带领Motus AI Team,把工作重点转向3D角色:一方面研发大规模角色绑定与蒙皮模型,另一方面研发多模态动作生成模型。相关工作也曾在GDC、SIGGRAPH等顶会上进行分享。
一款游戏最先抓住玩家的,往往是视觉呈现,尤其是主角如何运动。高质量角色动画既是游戏生产的核心组成部分,也是玩家最直接看到的内容之一。
完整的3D角色生产通常从二维概念设计开始,接着进入建模、UV展开和贴图制作,最后进入动画流程。动画流程又可以拆成两个主要部分:第一是绑定和蒙皮,第二是骨骼动画。我们今天的工作,主要围绕这两部分展开。

(3D角色从概念设计、建模到绑定蒙皮和骨骼动画的完整流程)
绑定和蒙皮决定了角色服装如何被骨骼驱动。网格上的每一个顶点会受到一根或多根骨骼影响,各骨骼权重之和必须为1。绑定负责建立骨架,蒙皮负责把网格与骨骼之间的驱动关系写进权重。它们的原理并不难理解,但手工处理非常耗时。
按照我们的生产经验,一个简单服装大约需要3个人日,复杂服装最多要4天。使用Motus AI后,一个复杂服装连同美术师修整在内,可以从数天缩短到1-4个人时。

(传统手工权重绘制与Motus AI端到端处理的流程对比)
要把自动绑定和蒙皮真正放进生产流程,我们首先需要面对三个问题。
第一个问题是建模与表示。3D资产的形状和拓扑差异很大,系统必须找到一种有效方式,表示异构的3D数据,以及网格与骨骼之间的关系。
第二个问题是冷启动。游戏角色风格千差万别,我们希望得到的是一个通用模型:它拿到新的角色后能够零样本工作,而不是每遇到一种项目风格,就重新做一次微调。
第三个问题是长尾案例。多层服装很容易出现网格穿插和不均匀变形,这些问题在展示用样例里或许可以绕开,在真正的项目里却不能回避。

(自动绑定与蒙皮要解决的三类难题:表示、冷启动和长尾案例)
因此,我们把整套方案拆成三层。第一层是Skeleton Generation AI,根据任意角色网格生成对应骨架;第二层是General Skinning AI,根据网格和骨架自动生成全部顶点的蒙皮权重;第三层是一组后处理AI,专门修复前两步中表现不够好的区域。
从自动化率看,骨骼生成目前约为50%—70%,通用蒙皮约为70%—85%,在加入后处理后可以超过85%。这里的思路是先用通用基础模型覆盖主体工作,再用专门工具收掉生产中的长尾问题。

(Skeleton Gen、General Skinning与后处理AI组成的三层框架)
Skeleton Generation AI提供了几种不同的工作模式。用户既可以上传任意3D角色模型,全自动生成与角色贴合的完整骨架;也可以输入一套参考主骨架,在保持模板拓扑的情况下适配新角色;如果角色已经有主骨架,还可以只为裙摆、头发等部位补充物理辅助骨骼。
系统也支持多样化采样。美术师可以调整滑杆参数,为同一个角色生成不同的骨骼拓扑。骨架生成后,用户还可以选择Maya Advanced Skeleton(ADV)或HumanIK,自动创建相应的控制绑定,用于后续摆姿势和制作动画。
这套骨骼生成模型采用类似GPT的自回归架构,参数量超过10亿。它以完整角色网格为输入,通过网格表示理解局部几何与拓扑,再逐步生成完整的骨骼层级,也可以在已有主骨架的条件下继续生成物理辅助骨骼。

(超过10亿参数的自回归骨骼生成模型)
现在的案例已经覆盖人形、四足动物、怪物,甚至部分道具,也可以为头发、裙摆和饰品生成复杂的物理骨骼。这些结果不是只用于演示,而是已经进入实际美术管线,骨骼生成环节在真实项目中能够减少约30%的耗时。
有了骨架之后,下一步是通用蒙皮。这里是一个ACG风格游戏中的典型角色,带有复杂的裙装和头部饰品,大约有2.5万个顶点、180根骨骼,其中包括多根物理骨骼和修正骨骼。选中所有网格及其对应骨骼后,就可以启动自动蒙皮;根据网格和骨骼的复杂度,整个过程约需10秒到2分钟。
完成后,头发和裙摆等区域已经能够跟随原有骨骼动画变形,一键完成度超过80%,几乎看不到明显瑕疵。通用蒙皮模型采用四阶段、由粗到细的框架,结合DGCNN与Transformer,逐步完成浅层表示、深层空间特征提取、骨骼链分析和具体骨骼预测,最后为每一组“顶点—骨骼”关系生成准确权重。
这个模型的参数量超过13亿,使用大规模高质量数据集,在80张GPU上训练了90天。

(通用蒙皮基础模型的四阶段架构与训练规模)
大家可以看到,每段视频的左侧是美术师手工制作的蒙皮结果,右侧是GoSkinning的输出,测试时几乎很难分辨二者。
这些案例来自各个不同风格的项目。我们的General Skinning AI不只处理人形角色,也能处理四足动物、武器等刚性物体,以及差异很大的服装风格。

(GoSkinning在不同项目和服装风格中的一键蒙皮结果)
但把模型做大,并不等于生产问题就全部解决了。一个模型能不能真正投入使用,取决于它能否补齐长尾案例。裙装就是最典型的难点:当服装由多层网格构成时,通用模型容易出现层与层之间相互穿插、变形不均匀等问题。而在我们的项目中,超过一半的角色都穿着这类服装,它并不是罕见情况。
因此,我们没有继续让通用模型独自承担全部任务,而是制作了一套专门的Skirt Skinning AI。它分成两个阶段:先为输入裙装生成一层与原几何形状匹配、但拓扑更干净简单的代理网格,再对代理网格运行通用蒙皮;随后把权重迁回原始网格,并进行针对性的变形优化。
右侧并排展示了三种结果,从左到右分别是手工蒙皮、通用蒙皮AI和我们的裙装蒙皮AI。可以看到,专用流程明显减少了网格穿插和不均匀变形,结果已经接近手工制作。不过我们也必须承认,自动绑定与蒙皮仍然不擅长处理拥有大量修正骨骼的极复杂角色,我们正在积极解决这个问题。

(利用代理网格、权重迁移和变形优化处理多层裙装)
02
动作生成真正难的
不是“能动起来”
接下来进入动作生成部分。
传统流程主要有两种做法:手工制作关键帧,或者进行动作捕捉。一个10秒的手K动画可能需要大约5天,也就是完整的一周;即使使用动捕,后续清理仍然需要2—4天。
我们据此开发了多种AI工具,今天重点介绍两类:一类是文本生成动作和视频生成动作,另一类是用于补帧与精修的Motion In-Betweening。它们共同覆盖从动作生成到后续编辑的流程。

(传统动作生产与AI原生动作管线的效率和控制方式对比)
过去几年,学术界的动作生成大致经历了三个阶段:先是自回归方法,之后GPT类架构和扩散模型成为主流,再到人物与物体、人物与人物、人物与场景之间的交互动作。论文数量持续增长,但学术结果与生产级要求之间依然存在距离。

(动作生成研究从自回归、扩散模型走向交互和部署)
原因在于,游戏生产需要同时做到三件事。
第一是生产质量。脚滑、抖动、网格穿插、身体漂浮、平衡异常,任何一个问题都不可接受。目标不是得到一个“说得过去的动作”,而是得到可以继续进入生产流程的动画。
第二是通用性。同一个系统要覆盖怪物、射击、武术等完全不同的角色和动作类型,不能只在某一个类别上表现良好。
第三是美术师控制。动画师需要修改、指导并继续打磨模型输出,而不是被迫接受黑箱一次性生成的结果。
因此,不仅要质量高、通用性强,而且可以让用户可控、编辑,得到美术师想要的结果。

(生产级动作生成必须同时满足质量、通用性和美术师控制)
我们最早尝试的是基于离散动作Token的自回归基础模型,例如通过FSQ、RVQ等方式把动作压缩成有限码本,再像语言模型一样生成序列。
问题在于,离散化本身存在一个硬上限:动作在进入码本时损失的信息,后面再大的模型也无法恢复。
在我们的实验中,即使有效码字超过20万个,重建动作仍然与真实动作出现明显偏差,例如脚部位置漂移。也就是说,Token重建误差会直接限制动作保真度。

(超过20万个离散编码仍无法消除动作重建误差)
这促使我们转向用Motion Diffusion Transformer,也就是Motion DiT,作为基础模型。这里不再先把动作离散成有限Token,从源头避免离散化造成的不可逆损失。
经过架构、动作表示和数据规模的共同优化,MPJPE降低33.8%,NPSS降低23.3%,Foot-Skating Error降低60.2%。随着训练数据上升,姿态误差也从4.4352下降到4.0602、3.9034。
![]()
(Motion DiT的动作质量优化与数据扩展结果)
在优化后的Motion DiT主干上,我们进一步加入多种输入模态。每一种模态都有自己的Context Transformer,把不同条件编码成共享表示,再送进同一个主干Motion DiT。
它的输入可以是文本、视频、关键帧和音频;输出也不只是身体动作,还可以同时生成手势、口型和面部动画。
我们的核心选择是“一个主干,多种输入”:真正承担生成能力的是统一的基础模型,前端再针对输入模态进行专门化。未来增加新的控制信号时,原则上只需要增加一个编码器,而不是从头训练一个新模型。

(统一的15亿参数Motion DiT及其多模态输入输出)
但只有生成模型还不够。专业动画师不只需要“一键生成一个动作”,他们还需要编辑、精修,并把结果放进真实的生产管线。
基于这个基础模型,我们开发了一条贴合动画师实际工作方式的AI动画管线。左侧是多模态动作生成,包括文本生成动作、视频生成动作和音频驱动动画;右侧是Motion Polish,为美术师提供关键帧条件编辑、动作精修和更广的生产场景覆盖。
这正是Motus AI与研究演示的区别:它是按照游戏美术师实际工作的方式来设计的,而不只是为了跑分。

(Motus Motion将多模态生成与动作编辑、精修连接起来)
03
文本、视频与关键帧
开始进入同一套动作管线
文本生成动作的推理流程有三个核心组件。第一是Prompt Rewrite Model。它先把用户输入的自然语言提示改写成结构化描述。
第二是Duration Model。它读取改写后的提示,自动预测这段动作应该持续多长时间。第三才是动作生成模型。文本被编码后,与时长等条件一起送入Motion DiT,最终输出3D动作。
![]()
(Text-to-Motion全新版本V1.5版本发布)
大家可以看到,生成的动作与提示词高度一致。这里的对比既有日常动作,也有战斗和移动动作;其他模型的结果在左侧,我们的结果在右侧,重点看模型能否准确理解描述,同时保持动作自然。
![]()
(文本生成动作在语义对齐和动作质量上的现场对比)
为了生成更长的动作,我们还开发了Multi-Segment Joint Denoising。它让模型同时接收多段文本提示,生成任意长度的动作序列,从而避免简单拼接带来的断点。
第一段视频是一段由7条文本提示生成的30秒动画:角色先快速向前奔跑,随后遭到攻击、失去平衡、倒地,再从俯卧状态起身,最后捂住腹部踉跄前进。大家可以看到,模型不只要分别满足每一段描述,还要让段与段之间自然衔接。第二段则是一段由4条提示生成的31秒动画,用来展示风格化动作和连续过渡。
目前,我们已经在腾讯游戏内部把这项能力投入生产,用于动作概念设计、游戏原型和演示,也用于扩充动作捕捉数据集。

(多段联合去噪让7条文本提示生成30秒连续动作)
视频生成动作沿用同一套Motion DiT主干。系统先从输入画面中提取人物框和跟踪结果、二维关键点、相机姿态与三维姿态,再通过Context Transformer把视频条件送入生成模型,输出能够直接驱动游戏角色的完整3D动作。
其中,三维姿态表示由我们内部预训练,数据来自大规模姿态合成流程。它为我们提供了比现成姿态估计器更稳定、更鲁棒的姿态先验。
这项能力需要同时解决两个问题。第一是细节保真,包括身体姿态、重心转移和细微的上半身动作;第二是脚步稳定,落脚时要保持接触,尽量减少脚滑。只有姿态大致相似、脚却在地面上漂移的动作,很难直接投入制作。

(视频生成动作对细节还原和稳定脚步的强调)
这是我们的Video-to-Motion V2预览模型,主要有两处变化。第一,输入范围扩大了:过去只能处理现实拍摄视频,现在也能处理游戏风格的虚拟画面、风格化角色,以及带真实相机运动和镜头切换的片段。
第二,全局轨迹更准确了。过去的版本在处理复杂3D轨迹时,容易把路径压平,甚至完全丢失;现在大家可以看到,生成的全局路径能够贴近参考视频,不会在空间中漂移。对于游戏制作来说,全局轨迹不是“锦上添花”:如果轨迹不对,无论局部姿势看起来多好,整段动画都会不稳定。

(Video-to-Motion 2.0预览版对姿态、脚步、轨迹和遮挡的改进)
最后一个重点模块是Motion In-Betweening,也就是MIB。它不是单纯再生成一段动作,而是承担“补间”和“精修”的角色。
它仍然使用同一个DiT主干:输入关键帧,输出完整动作序列。MotionBlink MIB可以自动补全最长约1.5秒的关键帧间隔,质量接近光学动捕;在演示配置下,生成200帧动画约需4秒。
![]()
(MIB根据部分关键帧合成完整动作序列)
我们最新的MIB Beta接近10亿参数。大家可以看图:绿色是真实动捕,透明蓝色是输入关键帧,灰色和浅蓝色分别是Alpha与Beta版本的结果。即使面对舞蹈、体育和受伤后退等复杂案例,Beta版本也能保持准确和细节。
根据我们收到的用户反馈,在写实动作上,生成质量已经可以与动作捕捉相媲美。固定相同的关键帧、更换随机种子,还能得到多种自然的动作结果。

(接近10亿参数的MIB Beta与动捕、关键帧及Alpha版本对比)
04
90多个项目之后
统一模型还要走向游戏VLA
回到整条管线,我们围绕动画生产的两个阶段形成了一套AI工具:自动绑定、自动蒙皮、后处理、多模态动作生成,以及连接生成结果与美术师编辑流程的Motion Polish。
绑定和蒙皮过去需要几天,现在复杂服装可以在几个小时内完成;动作部分则先由模型生成基础动画,再交给美术师编辑和精修。效率提升并不意味着把美术师移出流程,相反,“可编辑、可控制”是生产级系统必须满足的条件。

(从角色网格到动画的端到端统一生成式AI管线)
我们的相关项目包括PUBG Mobile、LOL Mobile、Wuthering Waves、QQ Dancer、Moonton等;Motus Motion也已经在多个核心业务中使用。目前,这套技术已经接入90多个内外部项目。

(Motus AI已接入90多个内外部项目)
接下来,我们计划继续推进两个方向。一个方向是大型统一多模态动作生成模型,把动作生成、理解和编辑能力放进同一个模型。另一个方向是游戏中的Vision-Language-Action Model,让模型理解场景与语言,再控制角色完成翻越、滚动等与环境互动的动作。
最后,所有这些工作都可以归结为一个想法:One Engine, Infinite Characters。用一个统一引擎支撑无限种角色,让创作者把更多精力放回创意本身。

(Motus AI的下一步:统一多模态动作模型与游戏VLA)
以下为分享后的现场问答:
问:文本生成动作能否理解“优雅”“震惊”这种带有表演意图的描述?如果结果与导演想法有偏差,能不能像指导真人演员一样继续修改?
曾子骄:我们设计的工作流会尽量贴合动画师原有的工作方式。首先可以通过视频、文本等输入生成完整动作序列;如果结果与想法不一致,美术师可以修改关键姿势,再使用MIB工具重建和精修整段动作。
问:训练数据是怎样构建的?
曾子骄:我们有一条数据管线。通过专业的设备捕捉,建立视频与动作之间的对应数据,然后用于模型训练。
问:这些工具可以在哪些平台使用?能否输出到Godot、Unity或Unreal等引擎?
曾子骄:目前可以通过网站和DCC插件使用,例如3ds Max、Blender、Maya,以及Unreal Engine。
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
