雪花模型不是算力问题,是选型问题

望京沙龙的一场吵架,把雪花模型推到台前

去年年底我跑了一趟北京望京的大模型创业者闭门沙龙。刚坐下半小时,会场就炸了。

一个做AI自适应教育的创始人,头发掉了大半,拍着桌子吐槽。砸了三千万,训了一个7B的全参数稠密大模型,原来算的推理成本是每万token两毛多,实际跑起来才发现,带多模态交互之后,直接干到一块二。接了十万C端用户就扛不住,再加服务器就是亏,不加用户就跑,进退两难。

旁边坐的一个做电商AI搜索的年轻人,掏出平板甩了一组数据出来。他用雪花模型改的垂直搜索,总参数只有1.2B,推理成本降了70%,精度只掉了不到3个点,现在接百万级请求稳得很,单用户获客成本比对方低了一半还多。

然后就吵起来了。

老派做通用大模型的创业者说雪花是歪门邪道,稀疏激活就是投机取巧,未来还是稠密全参数的天下。做雪花的年轻人翻个白眼,说你都快死了还谈未来,疯了吧。

2026年北京大模型创业者闭门沙龙交流现场
2026年北京大模型创业者闭门沙龙交流现场

说实话,我那天听完挺感慨的。2026年了,还有这么多人抱着“参数越大越强”的老黄历不撒手。

现在很多人对大模型的认知,还停留在三年前OpenAI刷参数的路径里,拼了命往大了做,好像参数不够就不好意思出来见人。可实际算一笔账就懂了:同一张A100卡,跑7B稠密模型的QPS大概是24,跑1.3B的雪花模型,QPS能冲到190。相当于原来一条四车道高速,一小时只能过24辆车,现在同一个路幅,一小时能过190辆,通行效率翻了快8倍。

这不是技术迭代,这是换了一条赛道。之前所有人挤在同一条单行线堵车,现在有人直接开了一条新的高速。

原来稠密模型的蛋糕,早就不够分了

很多人听不懂,雪花模型到底是什么?别扯官方定义,说白了就是一句话:把原来整块实心的大模型,拆成上百个独立的小专家模块,每次处理请求,只激活最匹配的两三个模块,其他的都睡觉。

这不就是人类大脑的工作逻辑吗?生物进化了几百万年,从来不会让你思考数学题的时候,把所有控制运动、情绪、记忆的脑区全部激活——那不是效率高,那是疯了。原来的稠密大模型就是不管什么问题,全参数全激活,相当于你去楼下买瓶水,开着十吨的大卡车去,油钱比水还贵。

国内最早吃螃蟹的大厂,其实是快手。去年下半年,快手把首页推荐的大模型底座,从原来的稠密全参数换成了稀疏雪花结构,我拿到的内部数据是:原来推理延迟是180毫秒,换完之后降到42毫秒,单卡日处理请求量从120万涨到了780万。相当于原来一个快递网点一天只能送1200件包裹,现在同一个网点同一个团队,一天能送7800件,不用租新场地不用招新员工,产能翻了快6倍半。

稀疏雪花大模型专家模块激活路径示意图
稀疏雪花大模型专家模块激活路径示意图

不过话说回来,雪花模型动了太多人的蛋糕,这也是为什么很多大佬明明自己偷偷用,却从来不公开说这个方向好。

过去三年,大模型产业链最赚钱的环节是谁?是卖算力的云厂商,是做算力租赁的二道贩子。你参数做的越大,用的算力越多,他们赚的越多。很多资本也愿意推这个逻辑,把参数和估值绑定,参数涨一倍,估值翻三倍,皆大欢喜。

现在雪花模型来了,同样的业务,用三分之一的算力就能搞定,甚至很多中小场景,一块消费级显卡就能跑。那些靠卖算力赚差价的厂商,今年一季度的营收我看了几个公开数据,平均掉了两成,反而做模型轻量化微调、雪花架构适配的服务商,订单翻了三倍。

这个方向我认为走偏的不是雪花,是原来那条靠堆参数圈钱的路。本来80%的垂直场景根本不需要全参数通用大模型,你做直播商品推荐,做教育题目解析,做医疗导诊,要那么强的通用写诗编故事的能力干嘛?花钱养着一堆没用的参数,纯纯的浪费。

普通从业者的新船票,不是算力是方向

普通从业者的新船票,不是算力是方向
普通从业者的新船票,不是算力是方向

很多人说雪花模型是大厂玩的东西,跟中小创业者、普通算法工程师没关系?不对,恰恰相反,这波是普通人的机会。

过去两年,做大模型的门槛是什么?是钱。你没有几个亿烧不起,根本训不出一个能用的稠密模型,中小团队连入场券都拿不到,所有流量利润都被头部大厂拿走,中小玩家只能做点插件赚点零花钱,卷都没地方卷。

现在呢?一个三五个人的小团队,用开源的雪花基础架构,训一个垂直领域的专用模型,一百万的成本就能搞定,训练完一块3090就能推理,接个几十万用户完全没问题。我知道杭州有个六个人的小团队,做服装垂类的AI设计,去年下半年用雪花模型训了个专属模型,现在每个月的流水已经过千万,成本才不到一百万,净利润比很多融了几亿的大模型创业公司还高。

对普通算法工程师来说,原来你进去就是调参,拼谁能训更大的模型,现在要懂拆分,懂选型,懂怎么把业务需求匹配到最适合的模型结构上,能力模型换了,原来的头部玩家不一定能赢,新人反而有机会弯道超车。

说实话,我见过太多年轻人,一毕业就往通用大模型团队挤,挤进去之后每天就是拼算力堆参数,干了两三年出来,除了会调几个开源参数,什么都不会。等市场风向变了,第一个被裁的就是这群人。

很多人说现在大模型行业卷不动了,其实不是卷不动,是你选错了卷的地方。所有人都往稠密大模型的独木桥上挤,当然卷,可雪花模型给你开了一扇新门,你敢不敢走?

当所有创业者都明白“够用就是最好”的道理,那些靠堆参数炒概念圈钱的资本,下一个猎物在哪里?

作者|大讲堂

排版|大讲堂

审核|小北

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:雪花模型不是算力问题,是选型问题
文章链接:https://m.lfdjt.com/info_23_20561.html