为什么是现在?地表数据被啃光了
真不是危言耸听。上个月某大厂的AI负责人私下说,他们现在为了搞到高质量文本数据,连学术论文的简写版都开始扒拉了。为啥?互联网上那些公开的、干净的数据——我管它叫“地表数据”——已经快要见底。不信你看,Reddit、Stack Overflow、新闻媒体都开始向AI公司伸手要钱,因为大家突然发现,自己过去二十年无意中沉积下来的内容,变成了新时代的石油。 可是地表数据够用吗?远远不够。GPT-5迟迟难产,原因之一就是公共数据池子里的营养快被抽干了。合成数据?用过的人都知道,那玩意儿就像是拿泡面调料兑水充高汤,短期对付一下还行,长此以往模型越训越傻。所以,真正的宝藏在哪里?在那些从来没有上过公网的私有沉积层里——医院的病历库、工厂的设备日志、律所的合同档案、金融机构的脱敏交易记录。这些黑暗中的数据沉积,才是决定下一轮AI军备竞赛输赢的关键。
巨头圈地,黑马掘金:一场数据沉积层的卡位战
看看最近的动作。Google有YouTube、Gmail的海量沉积数据,所以它敢叫板;Meta靠社交图谱的沉积层玩转了推荐算法;微软背地里偷笑,当初收购GitHub,没想到这玩意儿不仅是个代码仓库,更是全球开发者思考过程的数据沉积池。还有OpenAI,拼了命和新闻集团、美联社签协议,不就是想把人类几十年积累的专业文本沉积层据为己有吗? 但巨头们手伸得再长,也够不着那些深埋在企业内部的沉积层。这恰恰是黑马的机会。有一家叫Tempus的医疗AI公司,默默吃进了全美大量医院的分子诊断数据,现在估值飞涨。律所LexisNexis靠着沉积了数十年的判决书和法规解释,训练的法律大模型让很多年轻律师瑟瑟发抖。它们没有去卷千亿参数的通用大模型,而是死磕自己那亩三分地的数据沉积层,结果活得比谁都滋润。 未来12到18个月,这个赛道一定会发生点什么。我预测,大型传统企业会突然意识到自己那堆发霉的数据竟然值钱,于是或者自己干,或者被科技公司高价收购。并购交易会密集出现,尤其集中在医疗、金融、工业、教育这几个沉积层深厚的领域。另一种可能是出现数据联盟,几家互为竞争对手的公司捏着鼻子共享某些非核心数据沉积,合练一个行业底座模型。想想看,那些过去被当成成本中心的IT档案,一夜之间变成了资产负债表上的重磅资产,刺激不?
沉积的生意经:如何让沉没成本浮起来

行动指南:别等了
对于企业:马上组织一场数据沉积层勘探。搞清楚你手头究竟有哪些沉睡的数据——业务表格、客服录音、设备日志、设计图纸,统统算上。然后找业务部门和数据科学家一起评估,哪些能提炼成高价值训练集。哪怕现在还不会做,先做好存储和确权,否则等巨头来收购时你连价钱都喊不出。 对于投资者:盯紧那些持有稀缺沉积数据的公司,尤其是还没被AI概念宠幸的传统行业。比如拥有几十年航测地理信息的测绘局旗下公司,或者手握海量医学影像的连锁体检机构。它们的价值被严重低估,未来12个月内可能会有成倍的溢价。 沉积,不是静止的过期文件,而是时间淬炼出的战略核弹。就看你会不会引爆。