下班绕路去取靴子,鞋底磨穿了半个月,一直抽不出时间补。巷口的修鞋铺开了快十五年,主人张叔去年冬天把角落那堆旧鞋楦腾出来,塞了台半人高的自动修鞋机。
我本来靠在门框上笑他,一把年纪了赶什么互联网潮流!补个鞋掌你的手比什么机器都稳,花这冤枉钱干什么。
张叔叼着半根烟卷,冲我抬抬下巴,让我看。刚好有个客人拿了双穿了三年的异形跟马丁靴,鞋跟磨得歪了一块,机器爪子夹住鞋跟,扫描仪扫了三秒,下磨头——第一次磨偏了两毫米。它自动退回去,重新定位,再磨,还是差一点,又退。
我数着,一共退了四次。

第一次看懂强化学习,是在修鞋机的试错里
我跟张叔说,你这钱铁定打水漂了,换你早修完了。张叔吐了个烟圈,说你懂个屁,它在学呢。不是提前输进去一万种鞋跟的尺寸让它对着比,这玩意儿靠强化学习逻辑跑,没人给它标准答案,只给了它一条规矩:磨对了尺寸,加分;磨错了,扣分。它试一次,涨一次记性,试得多了,比老鞋匠还准。
说实话,那瞬间我突然没话了。
我们以前聊AI,聊来聊去都是什么大数据、大模型,一堆听不懂的词,哪想到今天居然在修鞋铺里碰着活的了。你看它退回去那四次,不是傻,是它在自己拿奖励啊,错一次,就调整一次策略,下次就离正确更近一点。
张叔说,这机器来了三个月,已经修了快三百双鞋,现在常规鞋跟,半分钟出活,比我快十倍。
不过话说回来,它也有栽的时候。上个月有个姑娘拿了双穿了十年的vintage皮鞋,鞋跟因为走路姿势的原因,磨得一边高一边低,姑娘要求补完之后还保留原来的倾斜度,穿着才舒服。结果这机器磨了三次,每次都把歪的跟磨回标准的直跟,一次又一次扣分,它一次又一次试,就是不对。
张叔最后骂了一句脏话,按了关机,自己拿过镊子锉刀,十分钟就弄完了,分毫不差。

原来我们每个人,天生就会强化学习
那天坐在修鞋铺的小马扎上等靴子,我越想越觉得有意思。我们总说强化学习是多么高深的AI技术,可掰着手指头算,我们活一辈子,不就是一直在做强化学习吗?
哪有人一辈子所有事都有人给你标好正确答案?小时候读书是,老师给你标准答案,你背下来考满分,那是监督学习。长大之后呢?
刚毕业找工作,谁能告诉你哪个行业十年后吃香?你进了一家公司,干了两年觉得不对,辞职换赛道,那就是错了一次,扣了分,下次调整方向。追喜欢的人,第一次发消息说错了话,对方冷了三天,你下次就知道什么话该说什么话不该说,那也是扣分试错。就连张叔修鞋,年轻那会刚学手艺,粘牛皮不知道挤多少胶,多了溢出来脏鞋面,少了半个月就开胶,前前后后试坏了几十双鞋,才摸出不同皮质用不同量的分寸——这不是最朴素的强化学习,是什么?
对吧?我们从来都是这么活的。没有全量的正确答案,只能走一步看一步,错了改,对了攒经验,慢慢活成自己的样子。
那为什么那次修鞋机卡壳卡成那样?张叔说的对,它的奖励函数写死了。程序写的就是「磨到标准鞋跟尺寸就是对」,可客人要的是「保留我穿了十年磨出来的个人角度」,奖励函数错了,试一万次也不对。
当AI替我们试错,我们失去了什么

现在抬头看看身边,全是强化学习。你刷的短视频算法,你点一个赞,它就给你推更多同类,你一秒划走,它就知道你不喜欢,下次换方向,这不就是强化学习?网约车的派单逻辑,哪条路能让司机多跑两单,平台多抽成,它就优先推哪条,也是强化学习。现在你用大模型,生成完内容给你个「满意/不满意」的按钮,你点一下,它转头就改了自己的参数,还是强化学习。
这东西好用吗?太好用了。修鞋机干那些重复的试错活,比人快得多,张叔现在天天坐在门口晒太阳,一个月赚的钱比以前还多,没什么不好。可我有时候还是忍不住想,当越来越多的试错都交给AI了,我们剩下什么?
张叔说他孙子打游戏,现在都用强化学习AI挂机,AI自己打几千遍,把关卡过了,把装备拿到了,账号给孙子,孙子玩了十分钟就卸载了,说一点意思都没有。哦,你看,AI帮你拿了满分,可你要的根本不是那个结果啊。你卡关卡了半个月,查攻略,练操作,死了一百次最后过去那一下,浑身发麻的爽感,AI永远拿不到。它只知道过了关拿了分,可那个试错过程里的所有情绪,都是它的奖励函数里没有的东西。
现在我们的人生,也慢慢变成这样了。AI给你推荐工作,给你匹配对象,给你推荐你一定会喜欢的内容,帮你把所有错都提前避了,你走的每一步都是对的,都是拿高分的。可那些走错了路看到的风景,那些爱错了人留下的记性,那些试错试出来的属于你自己的歪鞋跟,还有吗?
张叔把补好的靴子递到我手里,鞋掌磨得刚好,是机器修的,比我以前找他手修的还平整。我掏钱给他,他指着机器笑,说这玩意儿现在就是我的徒弟,笨活累活都它干,我就管那些机器修不了的特殊鞋。
风卷着梧桐叶从巷口吹过去,落了一地。我踩着新补的鞋底走路,硬度刚好,贴合我走了三十年的走路姿势。突然就想,以后的世界,大概就是这样吧:AI替我们试那些重复的错,而我们,留着自己去试那些属于人的,错了也值得的错。
作者|大讲堂
排版|大讲堂
审核|满满
大讲堂