搬得了砖也泡得了茶,具身智能到底是什么

前几天去家楼下的智能奶茶店体验,那台号称全自动化的机器人,对着我点的少冰柠檬茶捣鼓了三分钟,最后把半杯冰倒在了台面上。

这事说起来好笑,其实戳中了当前AI最大的软肋。你看啊,它背后的大模型能写八千字的活动方案,能画三种不同风格的门店宣传海报,就是拿不稳台面上一杯加了冰的柠檬水。为什么?因为它没长对「身体和脑子配合的方式」。这就是今天要聊的,具身智能。

能写论文的AI很多,能弯腰捡垃圾的很少

现在满大街的AI,大多都活在屏幕里。你和大模型聊宇宙起源,它能给你扯俩小时不重样,你让它站起来开个门,它做不到。

原来我们见过的大多数实体机器人,都是预先编死程序的。流水线拧螺丝,位置固定死,偏差一毫米都不行,换个摆放位置直接罢工。

具身智能不一样。它把AI的认知能力,和实体身体的感知运动能力绑在了一起。眼睛能看,爪子能摸,走两步能感知地面平不平,遇到突然跑出来的猫能自己停下来绕开。甚至你说一句模糊的要求,它能自己理解自己调整。

就拿捡垃圾举例子,你说「把走廊上的矿泉水瓶捡起来扔垃圾桶」,传统机器人要提前告诉它矿泉水瓶长什么样,垃圾桶在哪个坐标,少一个信息都动不了。具身智能呢?它自己看,自己认,哪怕瓶子滚到了沙发底下,它也能蹲下去够,不用你额外教。

具身智能人形机器人实验室抓取测试图
具身智能人形机器人实验室抓取测试图

别被「人形颜值」骗了,核心从来不是脸

我刷短视频,经常刷到各种所谓的具身智能机器人,清一色做得跟真人似的,有鼻子有眼还能对着镜头wink,评论区全在喊颠覆,说马上就要取代人类了。

说实话。全是营销噱头。

具身智能从来不是做一张和人一模一样的脸,而是让AI学会在真实物理世界里学东西。之前大模型的学习材料,全是网上爬来的二手信息,都是别人整理好的文字、图片,没有真实世界的触感反馈。具身智能不一样,它是自己摸,自己碰,攒的全是一手经验。

就像你教小孩认识杯子,你不用背百科定义,你让他自己拿几次,摔两次,他自然就知道玻璃杯子凉,装了热水不能碰杯壁,空杯子轻满杯子重,拿的时候要握杯柄才稳。

具身智能干的就是这个事。我之前看一个高校实验室的公开测试,让机器人抓生鸡蛋,传统机器人写了几千行代码调力度,还是十次碎八次。换了具身智能的方案,第一次抓滑了,第二次力度不对捏裂了,第三次就稳稳拿起来了。这不就是人学东西的样子吗?

具身智能机器人抓取生鸡蛋演示图
具身智能机器人抓取生鸡蛋演示图

你品品这个逻辑。原来我们让AI适应我们给它设定好的规则,现在我们让AI自己出来,适应这个乱糟糟的真实世界。这才是具身智能最核心的改变。不是长得像人,是学习和思考的方式像人。

离我们的日常,到底还有多远

离我们的日常,到底还有多远
离我们的日常,到底还有多远

现在网上吹得凶,说再过十年,每家每户都会有一个机器人保姆,能做饭能拖地能陪你聊天。你信吗?我反正是不信。

实话实说,现在能落地赚钱的具身智能,大多都在封闭的工业场景里。比如仓库拣货,工厂搬箱子,这些地方环境简单,需求明确,机器出错了也不会出大问题,赚的钱能覆盖成本。真要进普通人的家,坑还多着呢。

你家地上一会儿放着孩子的玩具,一会儿铺了地毯晾着衣服,餐桌堆着半吃的外卖,沙发缝掉了几根耳机,这么乱糟糟的环境,机器人进去分分钟就懵。还有价格,现在一台能打一点的人形具身机器人,造价几百万,哪怕批量生产降到几十万,哪个普通家庭会掏这个钱买个回家拖地?还有电池,满电能跑三个小时就不错了,做顿饭做到一半没电关机了,你说闹心不闹心?

不过话说回来,也没必要一口否定说这是骗局。十年前谁能想到大模型能普及到今天这个程度?二十年前谁能想到我们出门买个菜都不用带钱包?技术迭代的速度,往往比我们预期的要快。

现在确实有很多资本炒概念,把十年前的旧机器人换个标签就叫具身智能,圈一波钱就跑,吃相真的难看。但去掉这些泡沫,方向是对的。AI活了几十年,一直困在屏幕里困在服务器里,现在终于要走出来,走到我们真实的物理世界里来了。

昨天我又路过那家奶茶店,进门就看见机器人在安安稳稳倒冰,半杯冰完完整整进了杯子,没撒出来一点。听说就是换了一套具身智能的算法调整抓取逻辑。我买了一杯,味道和之前没差,价格也没涨。

挺好的。技术改变生活,本来就是这样,悄无声息的,先从一杯不撒冰的柠檬茶开始。

作者|科技

排版|科技

审核|阿辰

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:搬得了砖也泡得了茶,具身智能到底是什么
文章链接:https://m.lfdjt.com/p/keji/a/4419.html