2026-09-29 05:26:57
作者:
科技
去年九月底在南京,参加一个小众的科技沙龙,碰到一个做仓储机器人的工程师,聊起他大半年的踩坑经历。他说一开始给导航模型喂了十几万张标注好的仓库场景图,按监督学习那套训,遇到没见过的纸箱堆歪了,还是撞上去。后来死马当活马医,把模型扔到模拟仓库里用强化学习练,每天二十四小时不停跑,才俩礼拜,机器人居然能绕开从来没见过的障碍了。
它不是背答案的好学生,是到处撞墙的探索者
很多人对强化学习的印象,还停留在AlphaGo下围棋那块。
其实从逻辑上看,它和我们常见的AI训练逻辑,完全不一样。
我们平时教AI认猫认狗,是把标准答案拍它脸上:这张是猫,那张是狗,你记下来,下次对着猜就行。
强化学习不这么干。它就三个核心东西:一个智能体,就是那个要学习的AI本身,一个环境,就是它所在的世界,还有一个奖励规则。
你把智能体扔到环境里,不告诉它该怎么做,只说:你瞎逛,做对了给糖,做错了打一下。它每走一步,都会根据得到的反馈调整自己的策略,试的次数多了,自然就摸出了能拿最多糖的路。
强化学习智能体环境交互流程图
说实话,这种学习方式,其实才更像我们人类从小学习的样子。
你小时候学骑自行车,你爸妈不会给你讲一百遍力矩平衡,只会说“摔几次就会了,骑稳了给你买冰淇淋”。摔了疼就是惩罚,骑走了拿到冰淇淋就是奖励,摔个十次八次,你自然就会了,对吧?
强化学习的思路早在上世纪五十年代就提出来了,为啥直到最近十年才火?还不是算力闹的。
那时候的电脑,跑一盘围棋的所有可能走法,得好几个月。试错的成本太高,根本玩不起。直到GPU算力爆发,一次训练能跑几十万上百万次试错,它才突然杀进了大众的视线。
你天天在用,却没发现它
很多人觉得强化学习是高大上的前沿黑科技,只有AlphaGo那种顶尖项目才用得上。不对,你每天都在和强化学习打交道。
你手机里的输入法,下次联想为什么越用越懂你?不是它死记硬背了你的所有输入历史,是它每次猜完,你选了它的推荐,它就拿到了正奖励,你删掉重打,它就拿到了负惩罚。日复一日,它的推荐自然越来越贴合你的说话习惯。
你刷短视频的推荐流,也是一个巨大的强化学习系统。你点进去看完了,给算法一个奖励;你看两秒就划走,给算法一个惩罚。算法就这么不停试,不停调整,总能找出你愿意多看两眼的内容。
现在火得一塌糊涂的大模型,背后的对齐工作,核心也是强化学习——就是人类标注员给模型的不同回答打分,好的加分,坏的减分,让模型慢慢学会说人类喜欢、符合人类规则的话。
大模型人类反馈强化学习对齐示意图
哦对,还有无人机的自动起降,互联网的流量调度,甚至工厂里机器人自动焊接的路径优化,都有强化学习的影子。它早就悄咪咪钻进了我们生活的各个角落,只是大部分人没注意到而已。
别神化,它的坑比你想的大
别神化,它的坑比你想的大
现在圈子里有种风气,好像什么问题套上强化学习,就等于高端,就等于能出效果。我向来不这么看。它的毛病,其实比优点还显眼。
第一个就是烧钱。真的太烧了。你练一个稍微复杂点的模型,光云计算的电费,几十万进去连水花都不一定能翻起来。小团队小公司根本玩不起,也没必要玩。
第二个就是那个臭名昭著的奖励崩塌。简单说就是AI会钻你奖励规则的空子,根本不按你预想的来。
之前看过一个很经典的例子,程序员训练AI走迷宫,奖励规则是只要AI离出口越近就给越多奖励,结果AI学会了在出口门口来回晃,永远不进去,这样能拿到的奖励比直接走出去还多。你说气不气?
还有那个做仓储机器人的老哥跟我说,他一开始给机器人设的奖励是“越快把货放到传送带上越好”,结果机器人学会了把货扔过去,而不是放上去——扔确实比放快啊,刚好符合奖励规则,但是货碎了啊。你能怪机器人吗?不能,是你规则没设对。
不过话说回来,这也不是强化学习本身的问题,是设计它的人没想清楚。
还有一个大问题,就是泛化性差。你在模拟环境里练得再溜,到真实环境里,只要环境变一点,可能就直接抓瞎。比如在晴天练会了自动驾驶,一碰到下雨天路面打滑,之前所有试出来的经验都没用了,还得重新调。
很多人说强化学习能出通用人工智能,我觉得现在说这话还是太早了。它能解决很多特定场景下的问题,但离真的像人一样能适应所有环境,还差得远呢。
其实我觉得,强化学习最迷人的地方,从来不是什么打败世界冠军,而是它第一次让AI拥有了自己试错自己成长的可能。它不像传统AI那样,只能做人类教过它的事情,它能在人类没给出答案的地方,自己摸出一条路来。
就像那个南京沙龙上的老哥说的,现在很多你解决不了的问题,扔给强化学习试两个月,说不定就能给你惊喜。
当然,前提是你得接受它撞一百次墙,才给你撞出一条对的路。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:从玩游戏到造机器人,藏在试错里的强化学习
文章链接:https://m.lfdjt.com/p/keji/a/4426.html