模型并行?听起来像某种高深的技术黑话,是吧。可你要是把它搁在全球供应链的棋盘上,这玩意儿就是决定产业链话语权的那把扳手。别急着反驳我——过去两年,大模型训练用百卡千卡还是新闻,现在呢?万卡集群成了标配,甚至有人喊出百万卡。没有模型并行,这些数字就是空中楼阁。为什么是现在?因为算力墙撞到南墙了。单卡性能边际收益越来越薄,摩尔定律的棺材板都快压不住了,倒逼着人们从堆硬件转向抠架构。模型并行不是选修课,是必修课。
算力墙下的全球供应链,正在重新排队
全球算力供应链,现在就像一张被重新洗过的牌桌。美国卡着高端GPU出口,中国砸钱买H800又停,反过来倒逼国产算力迭代。台积电CoWoS封装产能早被抢到明年了,英伟达也得排队。模型并行,就站在这个风暴眼上。它不是某个实验室里的论文,而是决定AI基础设施能否往下走的关键。没有它,你买再多的卡也就是个巨大的取暖器。
数据不会说谎:训练一个万亿参数的大模型,单卡要跑一百年,但用上三千多张卡,加上张量并行、流水线并行,可以缩短到一个月。这中间的数字鸿沟,就是商业逻辑的起点。而且,英伟达的NVLink和InfiniBand已经把机内互联变成了一个生态,后来者想绕过去?几乎不可能。

巨头与黑马:一场没有硝烟的卡位战
巨头们在干嘛?英伟达把DGX做成了整个机柜,直接卖给你算力模组。谷歌有TPU,靠的是自家定制,旁人学不来。AMD呢,拼命想用ROCm撬开CUDA的墙脚,但软件生态还差着火候。玩得最狠的可能是Cerebras——直接把芯片做到晶圆那么大,反其道而行之,把互联问题从板卡层面干掉了。
但真正要命的,是那些你觉得不起眼的“黑马”。比如国内的光模块公司,中际旭创、新易盛,它们靠800G光模块吃到了AI红利,股价飞起。这是模型并行带来的意外需求——因为卡一多,数据搬移就成了瓶颈,光模块就是管道。还有做交换机的、做液冷的,甚至做中间件的,都像鲨鱼闻到了血。
未来12到18个月,洗牌必然发生。我赌并购潮会在光互连和网络设备领域出现,因为巨头收编技术、封锁供应链,是拿手好戏。英伟达已经收购了Mellanox,下一个目标可能是某个光模块厂商?不然为什么它的Spectrum交换机体系要拼命向GPU靠拢。

商业闭环:成本为何能越摊越薄?

很多人以为模型并行只是技术优化,不值一提。错。它直接改变成本结构。想想看,同样的训练任务,没有模型并行,你可能需要4000张卡,有了它,三千张够了。硬件成本省25%,电费省30%,工程时间省一半。这不是边际成本是什么?
更妙的是,模型并行还能创造新需求。当训练成本降下来,以前玩不起的中小企业也能试试微调大模型了。这就像AWS当年用虚拟化把服务器成本打下来,结果整个云计算市场凭空暴涨——模型并行正在做同样的事。
盈利逻辑也简单到粗暴:要么卖工具,要么卖服务。卖工具的,把模型并行框架做成插件,像PyTorch里的FSDP,顺手。卖服务的,比如那种“按需万卡集群”的云平台,客户按小时付费,成本和收益清清楚楚。这就是算力界的“共享经济”,只不过这个齿轮咬合得更精密。
给你的三个行动点
别光看热闹。如果你是个搞技术决策的,先把模型并行相关的文档啃透,哪怕只懂一点,至少不会被供应商牵着鼻子走。如果你是搞投资的,紧盯那些做光模块和液冷的,但注意估值已经炒高了,别站岗。如果你只是想认知升级,那就记住:算力之后,互联就是王道。