强化学习不是算力问题,是适配问题

刚开年的那场内部爆料,把抖音推流的底裤都扒了。2026年开年,抖音直播新上线的强化学习推流模型,直接引爆了主播圈的矛盾。

抖音推流争议炸出的真问题

骂声很大。中小主播集体喊冤,说新模型硬生生把自己的自然流量砍了三成,头部大主播的用户留存却涨了整整8个百分点。舆论一边倒骂平台资本逐利,要吃掉中小主播的生存空间,只给头部顶流输血。

说实话,我去年跟字节一位负责这块的算法老友吃饭,他吐了一晚上苦水。原来项目立项的时候,所有人都盯着大模型+强化学习的热点,老板拍板要砸钱做行业第一个全链路强化学习推流,谁也没敢提反对意见。训练跑了三个多月,算力花费换算下来,相当于长三角一个常住人口120万的县级市一整月的居民生活用电量,钱烧了不少,结果上线就出问题。

2026抖音直播强化学习推流流量分布对比图
2026抖音直播强化学习推流流量分布对比图

所有人都把问题归在算力不够,说要再加一倍机器接着训。只有那个老友提了一句:是不是我们的奖励函数设错了?我们只把用户停留时长、GMV转化当成核心奖励,根本没给中小主播的流量曝光设权重啊。没人听。毕竟,全行业都在说强化学习的卡脖子问题是算力,堆够了钱就出效果,谁会跟你聊什么适配不对的问题?

大厂抢跑的隐形逻辑陷阱

不止抖音。国内头部互联网公司这两年都在抢着上马强化学习项目,从外卖调度到电商推荐,从自动驾驶到网约车派单,好像不做强化学习就跟不上技术浪潮了。

不过话说回来,你去问这些项目的投入产出,十有八九都不好意思说。我之前跟饿了么的一位资深技术专家聊过他们2024年上线的新一代强化学习调度系统,单均配送耗时只降了2.8%,研发投入却是上一代调度系统的3.7倍。钱花了,股价没涨,用户也没感觉,只有技术团队拿了个内部创新奖,完事。

国内互联网企业强化学习落地项目投入产出比统计图
国内互联网企业强化学习落地项目投入产出比统计图

为什么会这样?很多人觉得是技术不够,是算力不够,我反倒觉得,这个方向我认为走偏了。强化学习的本质,从来不是模型自己会学习,而是你给它什么奖励,它就给你长出什么结果。

这就像非洲草原上的原始狩猎部落,每次打猎都只抓跑最慢的角马,过个三五代,整个角马种群的奔跑速度都会越来越慢,最后整个草场都养了一群跑不动的废物——你要什么,就会得到什么,强化学习把这个逻辑放大了一万倍。这个跨行业的道理,放到科技行业一样成立。

国内很多本土企业做强化学习,犯的最大的错就是把它当万能膏药,不管什么业务都往上贴,为了做技术而做技术,根本没想清楚自己到底要什么,该把奖励信号放到哪里。字节的推流要GMV,那模型自然就把流量都给能出GMV的大主播;饿了么要降低超时率,模型自然就把近单都派给老骑手,新骑手根本拿不到好单,反而整个团队的流动性越来越差。这哪里是技术问题,明明是适配问题,是你自己没想清楚业务的长期目标,把短期数据当成了奖励函数,最后模型给你交出一个你根本不想要的结果。

普通人要抢的新位置在哪

普通人要抢的新位置在哪
普通人要抢的新位置在哪

说了半天大厂的问题,很多人会说,这跟我一个普通从业者有啥关系?我既不做算法,也不当老板,强化学习再热,轮得到我分蛋糕吗?

不对。你以为强化学习只是大厂研究员的游戏?早就渗透到你每天的工作里了。你是开外卖店的,平台的强化学习调度会给你估出餐时间,估错一分钟就罚你降流量,你得顺着模型的规则改自己的备菜流程;你是做直播运营的,原来你天天手动调推流参数,现在模型自动调,你要做的变成帮模型挑哪些数据是该奖励的,哪些是该忽略的;你是做网约车管理的,原来你定派单规则,现在规则是模型学出来的,你要做的就是帮模型调整奖励权重,避免好司机被挤走。

原来的行业逻辑是:人定规则,机器执行。现在变成:人定奖励,机器生规则。原来做规则的那些人,要么转去做奖励设计,要么被淘汰,这是实打实的变化,不是什么远在天边的技术概念。

卷算力那是大厂和英伟达的生意,跟普通人没关系。但是给各行各业做强化学习适配,帮企业写对适合自己业务的奖励函数,这才是普通人能摸到的新机会。很多小公司现在还在拿着十年前的规则跑业务,等大厂的强化学习模型杀进来的时候,他们根本反应不过来,你要是懂这个逻辑,提前帮他们调,这不就是你的机会?

你现在的工作,三年内会不会变成给强化学习写奖励函数?

作者|大讲堂

排版|大讲堂

审核|满满

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:强化学习不是算力问题,是适配问题
文章链接:https://m.lfdjt.com/info_23_20125.html