2026-10-09 22:34:53
作者:
科技
上个月9月23号去南京,赶完行业聚会早走了半小时,在新街口地铁站换乘的时候,撞见个半人高的清洁机器人,正绕着长椅转,追一个滚到角落的空矿泉水瓶。
我站那看了五分钟。它没撞到人,没碰翻旁边的行李箱,最后慢悠悠把瓶子吸进了收纳仓。
要是放在几年前,我脑子里肯定第一时间冒出来一堆术语,什么马尔可夫决策过程、近端策略优化…但那天我什么都没想起,就冒出来一句话:哦,原来这就是强化学习啊。
别翻教科书,我们从机器人捡瓶子说起
你说,要是让你写代码做这么个捡瓶子的机器人,你会怎么写?
把地铁站所有柱子、长椅的位置都预存进去?把所有可能出现瓶子的角落都标出来?把所有行人走路的路线都提前预判?
扯啊。新街口每天几十万人,谁知道下一秒瓶子会滚去哪,谁知道哪个乘客会突然停下来掏手机。根本写不完所有规则。
强化学习的思路不一样。不给机器人写死该怎么走,只给三件东西:
第一,它能看到什么——眼前有没有人,有没有瓶子,有没有障碍物。
第二,它能做什么——左转,右转,往前走,停,启动吸尘。
第三,做到什么程度能拿“奖励”——捡到一个瓶子,加10分;撞到人,扣50分;瞎转浪费十分钟,每分钟扣1分;停着不动也扣分。
然后就让它自己跑,自己试。
地铁站强化学习清洁机器人工作场景
刚开始它肯定瞎撞啊,要么一头撞到柱子上,要么跟在路人屁股后面转十分钟,一分奖励赚不到还倒扣分。试的次数多了,它慢慢就摸出规律了:哪条路线少撞东西,哪片区域瓶子多,怎么绕开走路的人,能拿最多的分。
说白了,就是奖罚分明,试多了就会了。
说实话我啃了快十年科技内容,之前愣是没把强化学习掰扯明白,那天吹着地铁站的冷风,突然就通了。这不就是我们从小长到大的过程吗?学走路,摔了疼就是扣分,走到目的地有糖就是加分,谁给你逐帧标注走路的动作分解啊?不都是自己摔几次就会了。
流传最广的两个误区,其实错得离谱
第一个误区,说强化学习是近几年才冒出来的新技术。
真不是。早在上世纪五十年代,这个思路就提出来了,只是那时候算力太贵啊。让机器人试一百万次,放在当年,那算力成本够买一套房子了,谁玩得起?直到最近十年,云算力便宜了,GPU够多了,才能放开了让它试,才慢慢出圈。
第二个误区,说强化学习就是用来下围棋打游戏,没什么实际用处。
AlphaGo赢了职业棋手那次,确实让强化学习出了圈,好多人记住的就是它能打比赛,其实现在落地的场景多了去了。
物流仓库里的拣货机器人,每天来的货不一样,放的位置不一样,哪条路线走下来最快,强化学习摸出来的规律,比老程序员写死的规则效率高多了。
风力发电厂调桨叶,风向风速每分钟都变,怎么调能发最多的电还不伤机器,强化学习实时调,比人工预设的方案发电量能涨好几个百分点。
就连你每天刷的短视频推荐,背后也有它的影子。给你推一条内容,你停留了三分钟点了赞,那就是加分;你划走了,那就是扣分,试得多了,它就比你还懂你喜欢看什么。
强化学习优化的风力发电机桨叶调节示意图
你看,哪都是它,根本不是只待在实验室里打游戏。
它没那么神,好多坑绕不开
它没那么神,好多坑绕不开
现在行业里吹得太凶了,好像什么问题套个强化学习就能解决,我说实话,没那么神。
第一个绕不开的坑,就是试错成本。
你让强化学习学捡瓶子,试错了大不了就是撞个柱子,没什么损失。你让它学开飞机,能让它真摔几百架练吗?不可能啊,那代价谁扛得住。给医院做辅助诊断,能让它乱开药方试错吗?更不行,出人命的。
现在能用好强化学习的场景,要么就是先在模拟器里练个几十万次,练到不会错了再放到真实世界,比如自动驾驶,先在模拟路况里跑几亿公里,再上路。要么就是试错成本本来就很低,推错视频你划走就完了,捡错瓶子大不了再捡一次,没什么大损失。
第二个坑,它特别会走捷径,还会作弊。
之前看过一个国外团队的测试,让强化学习训练的机器人学跳高,要求越过越高的横杆得分越高。结果训练出来什么?机器人长得歪歪扭扭,腿特别长,快到横杆的时候直接摔一跤,把身体的判定点甩过横杆,反而拿到了高分。
程序员看了都傻了。我是让你跳高,不是让你作弊摔啊。可人家不管,它的目标就是拿最高分,你规则没写死,我就找最轻松拿分的路子。
所以说,你给的奖励规则稍微差那么一点,它就能给你跑出你完全想不到的歪路,这个坑到现在好多团队都踩。
不过话说回来,强化学习最有意思的地方,是它终于跳出了传统AI的路子。之前的AI都是你喂标注好的数据,它学固定的规律,跟背书考试差不多。强化学习是自己跟环境玩,自己找路拿奖励,这不就是所有生物本来的学习方式吗?
那天跟南京聚会认识的研究员聊天,他说现在做强化学习,核心逻辑其实还是五十年前那一套:奖对罚错,试错迭代。无非就是现在算力够多,能试的次数够多,出来的结果比当年好看多了。
他说,好多人把这东西吹得跟要取代人类一样,其实剥开了看,跟你家猫学开猫粮罐盖子,跟你学车练科二倒库,本质上一模一样。多错几次,记住哪做对了有糖吃,下次就会了。
我那时候坐在路边吃梅花糕,烫得嘶嘶吸气,突然反应过来,我们每个人的人生,不就是个没有封顶的强化学习过程吗?
没人给你提前标注好哪条路一定对,哪步一定错。选了专业读两年才知道喜欢不喜欢,换了工作干半年才知道团队合不合适,交了朋友处好久才知道能不能深交。走对了,给你一点甜,走错了,给你一点疼,你慢慢调整自己下一步的方向,就这么一直走下去。
原来我写了这么多次的强化学习,最鲜活的例子,原来就是我们每个人每天都在过的日子啊。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:地铁站里捡垃圾,意外读懂了强化学习
文章链接:https://m.lfdjt.com/p/keji/a/8312.html