前几天去家楼下的智能奶茶店体验,那台号称全自动化的机器人,对着我点的少冰柠檬茶捣鼓了三分钟,最后把半杯冰倒在了台面上。
这事说起来好笑,其实戳中了当前AI最大的软肋。你看啊,它背后的大模型能写八千字的活动方案,能画三种不同风格的门店宣传海报,就是拿不稳台面上一杯加了冰的柠檬水。为什么?因为它没长对「身体和脑子配合的方式」。这就是今天要聊的,具身智能。
能写论文的AI很多,能弯腰捡垃圾的很少
现在满大街的AI,大多都活在屏幕里。你和大模型聊宇宙起源,它能给你扯俩小时不重样,你让它站起来开个门,它做不到。
原来我们见过的大多数实体机器人,都是预先编死程序的。流水线拧螺丝,位置固定死,偏差一毫米都不行,换个摆放位置直接罢工。
具身智能不一样。它把AI的认知能力,和实体身体的感知运动能力绑在了一起。眼睛能看,爪子能摸,走两步能感知地面平不平,遇到突然跑出来的猫能自己停下来绕开。甚至你说一句模糊的要求,它能自己理解自己调整。
就拿捡垃圾举例子,你说「把走廊上的矿泉水瓶捡起来扔垃圾桶」,传统机器人要提前告诉它矿泉水瓶长什么样,垃圾桶在哪个坐标,少一个信息都动不了。具身智能呢?它自己看,自己认,哪怕瓶子滚到了沙发底下,它也能蹲下去够,不用你额外教。

别被「人形颜值」骗了,核心从来不是脸
我刷短视频,经常刷到各种所谓的具身智能机器人,清一色做得跟真人似的,有鼻子有眼还能对着镜头wink,评论区全在喊颠覆,说马上就要取代人类了。
说实话。全是营销噱头。
具身智能从来不是做一张和人一模一样的脸,而是让AI学会在真实物理世界里学东西。之前大模型的学习材料,全是网上爬来的二手信息,都是别人整理好的文字、图片,没有真实世界的触感反馈。具身智能不一样,它是自己摸,自己碰,攒的全是一手经验。
就像你教小孩认识杯子,你不用背百科定义,你让他自己拿几次,摔两次,他自然就知道玻璃杯子凉,装了热水不能碰杯壁,空杯子轻满杯子重,拿的时候要握杯柄才稳。
具身智能干的就是这个事。我之前看一个高校实验室的公开测试,让机器人抓生鸡蛋,传统机器人写了几千行代码调力度,还是十次碎八次。换了具身智能的方案,第一次抓滑了,第二次力度不对捏裂了,第三次就稳稳拿起来了。这不就是人学东西的样子吗?

你品品这个逻辑。原来我们让AI适应我们给它设定好的规则,现在我们让AI自己出来,适应这个乱糟糟的真实世界。这才是具身智能最核心的改变。不是长得像人,是学习和思考的方式像人。
离我们的日常,到底还有多远

现在网上吹得凶,说再过十年,每家每户都会有一个机器人保姆,能做饭能拖地能陪你聊天。你信吗?我反正是不信。
实话实说,现在能落地赚钱的具身智能,大多都在封闭的工业场景里。比如仓库拣货,工厂搬箱子,这些地方环境简单,需求明确,机器出错了也不会出大问题,赚的钱能覆盖成本。真要进普通人的家,坑还多着呢。
你家地上一会儿放着孩子的玩具,一会儿铺了地毯晾着衣服,餐桌堆着半吃的外卖,沙发缝掉了几根耳机,这么乱糟糟的环境,机器人进去分分钟就懵。还有价格,现在一台能打一点的人形具身机器人,造价几百万,哪怕批量生产降到几十万,哪个普通家庭会掏这个钱买个回家拖地?还有电池,满电能跑三个小时就不错了,做顿饭做到一半没电关机了,你说闹心不闹心?
不过话说回来,也没必要一口否定说这是骗局。十年前谁能想到大模型能普及到今天这个程度?二十年前谁能想到我们出门买个菜都不用带钱包?技术迭代的速度,往往比我们预期的要快。
现在确实有很多资本炒概念,把十年前的旧机器人换个标签就叫具身智能,圈一波钱就跑,吃相真的难看。但去掉这些泡沫,方向是对的。AI活了几十年,一直困在屏幕里困在服务器里,现在终于要走出来,走到我们真实的物理世界里来了。
昨天我又路过那家奶茶店,进门就看见机器人在安安稳稳倒冰,半杯冰完完整整进了杯子,没撒出来一点。听说就是换了一套具身智能的算法调整抓取逻辑。我买了一杯,味道和之前没差,价格也没涨。
挺好的。技术改变生活,本来就是这样,悄无声息的,先从一杯不撒冰的柠檬茶开始。
作者|科技
排版|科技
审核|阿辰