2026-09-04 06:03:05 分类:科技
今年开春,OpenAI内部那份GPT-5训练规划泄露,整个硅谷吵翻了。为了赶在2026年底出成品,OpenAI打算把训练数据拆到一万张A100上做全数据并行。谷歌那边直接发了篇博客阴阳怪气,说走纯数据并行堆卡的路,是把钱往水里扔。
圈子里吵翻天,没人真的把这当技术路线之争。说白了,都是利益。
一万张卡扯出的旧问题
很多人听数据并行觉得玄乎,说白了就是一句话:一张卡算不完,那就切好几份,多卡一起算。
最早做大数据训练的时候,卡少,百八十张撑死了,大家根本没觉得这是个问题。直到大模型参数炸到千亿万亿,单卡装下都难,更别说训了。万卡集群是现在头部玩家的标配,可真跑起来,坑比你想象的多太多。
说出来你不信。现在很多号称万卡级的智算中心,跑起全量数据并行,一半以上的卡在空等。等什么?等数据同步。一万张卡每张算自己的分片,算完要把梯度传到所有卡上更新,这个通信开销,能把你吓死。
万卡集群数据并行算力拓扑示意图
我给你算笔直观账:一万张A100卡互联,跨节点的通信延迟,相当于你在上海打实时语音电话到乌鲁木齐,延迟是本地机房卡间互联的120倍,有效带宽还不到十分之一。
也就是说,卡买回来花了好几个亿,一大半时间什么都不干,就在那等消息。
OpenAI不是不知道这个问题,他们为什么还要这么干?说实话,他们等不及了。谷歌攒了这么多年的MoE架构,改模型改了好几年,OpenAI不想等,他们堆钱堆卡,先把产品推出来再说。亏钱无所谓,占住市场就行。
这个争议丢到国内,行业瞬间就分裂了。一边是跟着喊万卡并行才有未来的国家队,一边是骂这种玩法透支行业的老玩家。没人说破的是,数据并行的坑,从来都不是技术够不够的问题。
分钱规则才是真瓶颈
不过话说回来,国内玩家早就趟出自己的路了。
字节跳动去年训练新一代大模型的时候,一开始抄硅谷的纯数据并行,1024卡跑下来,并行效率直接掉到28%——什么概念,四张卡才有一张在真干活。后来他们的工程团队改了架构,把数据并行和张量并行混排,把原来按样本切分改成按阶段动态切分,效率直接拉回75%以上。
同样训练1T参数的大模型,传统一刀切数据并行的总拥有成本,比动态混合分片并行贵2.7倍,最终收敛速度反而慢14%。这个账,算完谁都懂。
这就像古代十万人大规模会战,十万大军全归皇帝直接调度,传令兵把路都堵死了,军令都传不出去,仗还怎么打?数据并行的演进,本质就是重新分配指挥权,重新切分利益蛋糕,哪是单纯堆硬件就能解决的。
中国本土智算集群数据并行调度流程图
现在国内的商业模式博弈,其实绕不开这个分钱逻辑。做公有云的厂商,当然希望你多堆卡做数据并行,卡用的越多,赚的钱越多。做自研智算的厂商,就要抠并行效率,每一分钱都是自己的,当然要把每一张卡的算力榨干。
我接触过杭州一家做垂直大模型的创业公司,老板说他们原来租阿里云的卡,按传统数据并行跑,一个月租金一千二百万,后来找了个小团队调了并行架构,现在每个月不到五百万,效果还更好。钱省下来,能多招三个算法团队,对吧?
很多人说国内卡脖子卡的是GPU芯片,我看不对。卡脖子卡的是数据并行的调度和分块逻辑。同样的卡,不同的并行方案,成本能差出三倍,这个差距,比买不到高端卡还疼。
小人物的新机会
小人物的新机会
别觉得数据并行是头部大佬玩的东西,和普通从业者没关系。完全错了。
原来大模型训练,只有头部公司能玩,因为你要攒万卡,要调架构,门槛高到天上去。现在数据并行技术越来越成熟,动态分片、异构并行这些方案慢慢开源,中小团队甚至个人,都能攒一堆分散的消费级卡,拼起来做数据并行,训中等参数的垂直模型。
我上个月在深圳见了一个年轻人,原来就是腾讯云的一个运维,出来创业,帮中小公司调数据并行架构,给客户训垂直大模型,他手里没有一张自己的卡,都是调市面上的闲置算力,拼起来做并行,原来客户要花一千万训的模型,他两百万就能搞定,抽一成服务费,一年赚大几百万,活的比原来在大厂舒服多了。
现在市面上,懂大模型数据并行调优的工程师,起薪比普通大模型算法工程师高40%还挖不到人。很多人都去卷模型结构,卷prompt,没人愿意沉下来做这种脏活累活,缺口大的离谱。
原来大家都觉得,算力垄断是必然,大模型就是头部玩家的游戏。现在数据并行把这个规则打乱了。
当拼卡做数据并行的门槛,降到普通创业者也能碰的时候,算力垄断的围墙,真的还能立得住吗?
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:数据并行不是算力问题,是分钱问题
文章链接:https://m.lfdjt.com/info_23_16830.html