氪友MREt

数字人为什么“很假”?从动作生成机制谈起

在数字人讲解视频中,一个常见问题是: 画面越来越精细,但“真实感”仍然不足。即使面部建模、语音合成和口型同步已经较成熟,整体观感依然偏“机械”。 从工程角度看,问题往往不在视觉质量,而在: 👉 动作生成机制(motion generation) 一、问题本质:动作与语义脱钩 当前主流方案大致有两类。 模板驱动:预设动作片段,按时间或随机插入。优点是实现简单,但缺点明显——动作重复率高,与内容无关,容易产生“循环播放”的机械感。 规则驱动:根据句长、停顿等触发动作变化。相比模板有所优化,但仍无法理解语义,动作选择粗糙。 两者的共性问题是: 动作是附加的,而不是由表达驱动的。 二、YOCO方案:语义驱动动作 YOCO的核心思路是引入语义层,让动作由内容决定。 流程可以简化为三步: 1. 语义解析 将讲稿拆分为解释、强调、列举、过渡等类型。 2. 动作映射 不同语义对应不同动作策略,例如: explanation → 稳定动作 emphasis → 强化动作 3. 动作调度 在时间轴上统一控制: 避免重复动作 设置 cooldown 控制频率 无语义时保持自然静态 关键变化在于: 动作从“触发”变为“理解后生成”。 三、去重复是关键细节 “动作重复”是最容易暴露系统问题的点。 YOCO通过以下机制优化: 动作冷却(cooldown) 动作池轮换 语义强度控制 效果是: 👉 动作有变化但不过度频繁 👉 不需要时保持自然静态 更接近真实人的表达习惯。 四、范式变化 传统方案: 语音是主体,动作是附加 YOCO方案: 语音 + 语义为主体,动作用于表达增强 也就是说: 动作从“装饰层”升级为“表达层”。 总结 数字人的真实感,关键在于: 👉 动作是否与语义一致,是否参与表达。 从工程角度可以概括为一句话: 从 timeline-driven motion,走向 semantic-driven motion。
2026-04-08
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区

快来抢占第一条评论 ~

说真实观点...
有用有用
评论评论
转发转发