数字人面部实时肌肉模拟:不是渲染问题,是算力问题

2026年元旦刚过,抖音那场千万粉美妆主播的数字人首播,直接把行业底裤扒下来了。主播本人退网享清福,团队花了七位数做了超写实数字人替身,说好了“百分百还原主播神态”,结果一开口笑,全场尴尬。脸僵了。弹幕炸了。
2026抖音跨年数字人主播直播翻车面部截图
2026抖音跨年数字人主播直播翻车面部截图

跨年直播翻车炸出的行业遮羞布

跨年直播翻车炸出的行业遮羞布
跨年直播翻车炸出的行业遮羞布
所有人第一反应都是骂建模师,说纹理做的不对,骨骼绑定错了。没人愿意提数字人面部实时肌肉模拟这回事。说实话,这个领域的猫腻太多了。你看到的那些发布会、宣传片里动的自然的数字人,百分之九十都是离线渲染出来的。一帧帧算好,剪出来给你看。真要放到直播间,要实时跟观众互动,实时同步主播的动作捕捉,还要一秒钟出30帧,瞬间就露馅。 要还原真人面部,一共要动43块骨骼肌。传统的全物理模拟,离线渲染一帧就要12秒。直播要求一秒30帧,差了整整360倍。什么概念?就算你把H100堆成山,一张卡也就跑一个数字人,还不一定稳。一块H100租一天要800块,相当于一个三线城市腰部主播一天的纯利润还不够付算力钱。换你你做不做? 很多项目死就死在这,看起来技术很美,商业化根本走不通。大家都在卷多边形数量,卷纹理分辨率,把肌肉模拟那点事藏在背后,当成不能说的秘密。

国产厂商绕开GPU卡脖子的野路子

不过话说回来,中国厂商从来不会在一颗树上吊死。既然全肌肉模拟这条路算力卷不动,那为什么不能改改规则? 字节跳动抖音数字人团队去年底内部推的一套方案,我看完直呼太聪明了。他们把面部肌肉按优先级切了区,说话的时候只调动和发音、口型相关的12块核心肌肉,只有当表情发生大变化,比如从笑变哭,挑眉歪嘴的时候,才激活另外21块次要肌肉。完全静态的时候,只留2块肌肉维持基础表情,剩下的全部“休眠”。 这就像生物进化里的用进废退法则,没用的器官直接退化,省下能量给关键部位,哪里需要动哪里,绝不多浪费一克拉算力。
数字人面部核心肌肉分区调度示意图
数字人面部核心肌肉分区调度示意图
商汤科技今年也出了类似的轻量化模型,原来一张RTX 3090只能跑一个超写实数字人,现在能同时跑两个,延迟还降到了80毫秒以内,完全满足直播互动的要求。 这里头其实是赤裸裸的商业模式博弈。英伟达把高端GPU卖的死贵,就是吃定了你做实时超写实数字人必须用我的卡,算力卡脖子卡的死死的。你要全肌肉模拟,就得不停买更高端的卡,利润全被上游拿走了。国产厂商走的精简路线,直接把算力需求砍了七成,原来要十万块的卡才能干的活,现在两万块的卡就能干,成本直接打下来。 我见过太多创业公司盯着全肌肉模拟死磕,拿这个概念圈融资,说我技术比别人牛,能跑全部43块肌肉。那又怎么样?不能实时用,就是一堆废参数。这个方向我认为走偏了,用户要的是看起来自然,不是你给我数清楚一共动了几块肌肉,对吧?

普通从业者的上车窗口已经开了

技术落地最终还是要落到普通人头上。现在这个变化,对产业链的影响比你想的大的多。 三年前,做一个能实时互动的超写实数字人,从建模到肌肉绑定再到年度算力成本,一年没有二三十万下不来,只有头部MCN和大平台玩得起。现在呢?整体成本比2023年降了12倍,相当于从买一辆BBA变成了买一辆国产代步车,中小MCN甚至腰部主播自己都能掏的起这个钱。 不少杭州的MCN已经开始批量给主播做数字人替身了,主播播六个小时,数字人替播六个小时,一天卖十二小时货,成本比多雇一个全职主播还便宜。不想露脸的知识博主,怕熬夜的情感主播,都能用。 当然,现在的技术还是有瓶颈,那种细微到眉头一挑的私人情绪,那种不经意的嘴角抽搐的个人特征,还是做不到百分百还原。头部大主播还是得自己上,粉丝冲的是你这个人,不是你的数字替身。但是对于腰部以下的主播来说,能多开一个直播间,多赚一份稳稳的收入,还要什么自行车? 原来做数字人是赚甲方的钱,帮大品牌做虚拟代言人。现在不一样了,数字人开始变成普通内容创作者的日常生产工具。肌肉模拟的成本降下来,行业的门槛就彻底没了。 再过一年,618大促的时候,你刷十个腰部主播的直播间,三个跑的是带实时肌肉模拟的数字人。你能分得清吗?

作者|大讲堂

排版|大讲堂

审核|白杨

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:数字人面部实时肌肉模拟:不是渲染问题,是算力问题
文章链接:https://m.lfdjt.com/info_23_22163.html