树阴底下摆个裂了边的木棋盘,边上压着一张纸:赢了拿走一瓶冰可乐,输了给十块茶水钱。
围了七八个人,没人能赢。
我蹲那看了半小时,看着老头连收五份十块,给自己冰可乐续了瓶新的,突然反应过来——这老头摆了大半年残局,不就是活生生训练了一个强化学习模型吗?
你天天在用,不是AI专属的黑科技
很多人一听到强化学习,第一反应就是AlphaGo,就是高大上的人工智能,离我们的生活远得很。不对。
你刚学骑车的时候,谁给你一步一步标好“这时候重心往左移两厘米,那时候龙头转五度”?没有啊。你跨上去,歪歪扭扭,摔两次屁股疼,慢慢就摸出来规律:怎么动不会倒,怎么拐能转过弯。摔疼了就是惩罚,顺利骑个几十米不摔就是奖励。你自己在那不断试错调整,就是最朴素的强化学习。
小时候玩红白机的超级马里奥,你死个几十次,自然就记住哪块砖顶了有蘑菇,哪个沟得早跳哪个得晚跳,哪只乌龟不能踩。玩得多了,通关越来越顺,这不也是强化学习?

说实话,最早研究这套思路的时候,研究者根本不是奔着造AI去的,就是想搞明白人和动物怎么通过试错来学东西。几十年过去了,这套思路安上了计算机的壳,就被吹成了什么划时代的黑科技,说白了就是换了个更快的试错机器而已,核心逻辑没变。
我见过最多的三个误区
第一个坑,把强化学习和深度学习绑死了。现在好多文章一写强化学习,开口就是深度强化学习,好像不带深度两个字就不算。AlphaGo用了深度强化学习,不代表所有强化学习都得堆神经网络。老头摆残局靠的是脑子记,你学骑车靠的是身体感觉,哪来的什么深度?说白了,强化学习是一种学习思路,深度学习是一种计算方法,俩不是一回事,凑一块能用,分开也各自好使。
第二个坑,觉得强化学习能试出所有问题的最优解。
你看老头赢得多,就觉得他能赢所有残局?换个他从来没见过的局,他照样走错。为什么?强化学习的结果,全看你给的场景对不对,试的次数够不够。换个新场景,之前试出来的经验全没用。你让AlphaGo去开无人车,它连红绿灯都认不出来,更别说躲外卖电动车了。
试错是要钱要时间的,很多问题根本给不起你试错的机会。航天发射的轨道调整,心脏手术的下刀位置,你敢让AI试错吗?错一次就是人命关天的事,试不起啊。
第三个坑,觉得奖励越多越好。
这个是真的很多人踩。之前有个挺有名的例子,研究人员训练AI捡球,给的奖励规则是“只要把球捡到指定区域就得奖”,结果AI练出来什么?它学会了把球往区域边上一推,球滚进去,得奖,再推出来,再滚进去,再得奖……无限刷奖励,根本不干你让它干的事。
奖励错了,模型一定会学歪。这个道理放在人身上也一样,公司考勤只打卡算全勤,那大家就都卡点来卡点走,没人真干活,本质就是奖励设定错了,和强化学习没关系,是设计规则的人脑子不清醒。

不过话说回来,这些误区也不能全怪听课的人,好多卖课的吹项目的,故意把这些藏着不说,就把强化学习吹得神乎其神,好割韭菜呗。
它真正能用在什么地方

原来做机器人,你得给它把每个动作的参数都写死,碰到不一样的地面,比如一块冰一块地毯,它就站不稳了。用强化学习就不一样,让机器人在不同的地面不断试,试个几千次,它自己就学会不同地面怎么调整重心,碰到没见过的地面也能调。波士顿动力那些能翻能跑的机器人,背后大半都有强化学习的功劳。
另一个挺有希望的方向,是药物分子设计。原来找一个能用于新药的分子,科学家得在实验室筛好几年,甚至十几年,成本天价。现在用强化学习,给模型设定好“能和目标靶点结合、毒性低”就是奖励,让模型自己在庞大的分子空间里试,筛分子的速度能快好几倍,已经有不少成功的案例了,这个是真的能缩短新药研发的时间,救人的。
至于好多人吹的通用人工智能,我就笑笑不说话。它本质就是个在给定规则里试错找最优的工具,脱离了具体场景,什么都不是。你让它造个新的文学流派,它连人类为什么喜欢读诗都搞不懂,试一万次也试不出来。
那天临走我也上去试了一把,输了十块,给老头买了瓶冰可乐。
走的时候我还在想,我们天天追着各种新科技名词跑,一会大模型一会AGI,把每个新词都吹得好像能改变世界,结果转了一圈,最核心的逻辑,其实和巷口老头摆了大半年棋局摸出来的经验,没什么两样。
都是试错,都是攒经验,都是拿奖励换长进。
没那么玄。
作者|科技
排版|科技
审核|柚子