2026年自动驾驶落地战,吵翻了的老技术
上周广州南沙交通局公示第二批全无人自动驾驶商业化运营试点资格,两家头部玩家递的材料里,对标注数据质量的互怼比核心技术参数的对比还热闹。
小马智行的人直接放话,百度萝卜快跑的第三方外包标注错标率超过8%,城市场景里一个行人框标歪了,高速行驶下就是人命关天的事。百度反过来怼,小马吹的半监督自标注,错标率能飙到15%,真放开全无人,出了事你担着?
吵到最后,核心矛盾绕不开一个所有人都不想明说的老东西:监督学习。
你没看错,现在打开任何AI论坛,所有人都在聊通用大模型、无监督预训练、端到端自动驾驶,仿佛监督学习是上个时代的过时产物,拿出来说都嫌掉价。可真到商业化落地真刀真枪拼的时候,所有人还是得跪在监督学习面前。
说实话,我去年跟一个L4级算法负责人吃火锅,他喝了两瓶冰啤酒拍桌子说,现在那帮吹无监督能取代监督学习的,全是没上过路的纸上谈兵,骗投资人钱的鬼话。城市核心区的路口,窜出来一个送外卖的电动车,你让无监督模型自己识别?错一次,牌照就没了。
一个全新的L4自动驾驶车型,一年要标注超过12亿帧的城市场景3D点云数据,整体标注成本超过12亿元。这个数字是什么概念?差不多够在江苏南通这种三线城市修一条10公里长的全高架快速路。
所有人都盯着算法模型的迭代,没人说破,现在监督学习的精度,全是拿钱堆出来的。堆得起,你就能拿牌照上路,堆不起,你就只能在郊区测试圈里打转。

成本博弈的底层:堆出来的精度,卷没了的利润
很多人说监督学习的原理很简单,不就是给训练数据贴好标准答案,让模型照着学吗?没错,本质就是这么回事。我之前跟资深算法工程师聊,他给了个很有意思的跨行业类比:监督学习就是古代的科举制度。朝廷给你划好考纲,给你标准范文,你背得越熟,答题越准,考中就能当官,就能直接用。而无监督就是乡举荐,听起来能选到真正的奇才,可不确定性太大,谁也不敢把整个江山押给你。
放在今天的中国AI产业,这个逻辑简直精准得可怕。国内最早做AI训练数据的龙头海天瑞声,2019年上市的时候毛利率超过55%,那时候所有人都知道做标注赚大钱,一堆小厂挤进去抢饭吃。到2025年,海天瑞声的毛利率已经掉到23%,为什么?卷的。
一开始,大模型公司、自动驾驶公司都把标注外包出去,现在头部公司全都自己养标注团队,要么就做众包,把一块钱的标注活压到三毛钱。你不接,有的是人接。
OpenAI去年泄露的内部成本表显示,GPT-4微调阶段的监督学习标注成本,比整个预训练阶段的算力采购成本高出2.7倍,最终换来的通用场景准确率提升不到11%。投入产出比越来越低,这个账,所有玩家都算得清。
字节跳动做豆包的早期,为了把对话能力拉到能用的水平,拉了超过十万名众包标注员,喂了超过三千万条标注好的监督数据,才把基础对话的正确率从60%拉到85%。这还只是基础,要做垂直领域的客服,还要再堆几百万条标注。
不过话说回来,现在国内AI产业的卡脖子,根本不是卡算法,也不是卡算力,是卡标注成本。你说你要做一个垂直领域的AI,不管是医疗影像还是工业质检,第一步要花几百万上千万买标注数据,这个门槛就把99%的创业公司挡在门外了。

落在普通人头上的真实影响

很多人觉得监督学习是大厂大佬玩的东西,跟普通从业者没关系?错。这个技术的成本变化,直接砸在每个产业链普通人的饭碗上。
前两年AI标注师还是缺口百万的香饽饽,一线城市一个熟手标注师一个月能拿一万多,现在呢?众包平台把价格压到一毛钱一个框,一天坐十二个小时,也就赚个三四千,还不如去工厂打螺丝。之前四川有个全国最大的标注基地,高峰期有两万多个标注师,现在走了三分之一,都转去做直播带货了,赚的都比标注多。
对刚入行的算法工程师来说,更有意思。现在校招面试,十个有九个都会问你无监督、大模型微调的问题,可真进去干活,你会发现,公司80%的需求,还是要你做监督学习的标注清洗和调参。你说你只会搞高大上的基础研究,不好意思,我们养不起,你去实验室吧。
去年我接触过一个做口腔AI影像的创业团队,五个医生出身的创始人,融了一千万启动资金,想着做能帮基层诊所判读牙周病灶的AI工具,结果光标注一万张病灶影像,就花了五百万——找普通标注员标不准,必须找牙医标,一个病灶收五百块。标完一万个,钱花了一半,模型准确率还只有82%,还需要再标两万张,融不到下一轮,直接解散了。
他们创始人最后跟我说,原来我们以为卡我们的是算法,结果卡我们的是买不起标注,原来这么成熟的监督学习,居然把我们小创业公司活活饿死了。
现在所有人都在喊通用AI要来了,无监督就能解决所有问题,可我见过的落地项目,十个里面有九个,最后还是要靠监督学习补漏,还是要拿钱堆标注。那些喊着监督学习过时的人,要么是没碰过落地,要么是想割不懂行的投资人的韭菜。
当所有人都在追通用AI的风口,还有人愿意沉下心,啃监督学习这块成本硬骨头吗?
作者|大讲堂
排版|大讲堂
审核|白杨
大讲堂