2026年春,千亿模型赛道的暗雷炸了
四月的北京,大模型圈的饭局上全是骂声。一家没人听过的创业小团队,拿了不到两千万启动金,靠模型并行拆分出70B参数的垂直模型,公开榜单得分打平了某头部玩家三年前花一个亿训出来的千亿基座。
头部大佬跳出来说违规,说拆分后推理延迟高,不能商用,赢了榜单也没用。小团队反手放出来测试数据:给某车企做智能座舱对话,延迟比对方的千亿模型还低12毫秒。
没人说话了。
说白了,这就是掀桌子。去年国内训一个千亿参数基座模型,总成本大概1.2亿人民币,相当于东部三四线城市一个中型住宅小区的建安成本,只有拿着几十亿融资的大厂和头部创业公司玩得起。现在有人用十分之一的钱,打出了九成的效果,桌子直接被掀翻。
说实话,很多人到现在还觉得模型并行是十年前的老技术,没什么好聊的。放在2026年这个节点,它偏偏成了炸掉旧格局的暗雷。所有人都卷参数卷了三年,抢H100抢得头破血流,一张二手卡炒到十几万,还拿不到货,没想到临门一脚,被一个老技术思路破了局。

拆模型,拆的不止是技术,是生意
别扯什么官方定义,说白了就是两句话:原来大家玩的主流数据并行,是把整个模型塞进一张卡,要做大就堆一堆卡一起算同一份数据,相当于一群人一起搬同一袋一百斤的大米,要求每个人都能扛得动一百斤,门槛直接卡死一半人。
模型并行呢?把模型切成好几块,每个人扛自己那一块,你扛不动一百斤,扛二十斤总可以吧?最后拼起来就是完整的模型。
这就像生物进化里,从单细胞到多细胞的跃迁。单细胞所有功能都挤在一个细胞里,永远长不大,遇到点环境变化直接死。多细胞把功能拆分给不同器官,分工协作,才能长出大象蓝鲸这种大体型,适应更复杂的环境。太贴切了对吧?
放到国内产业里看,华为昇腾这两年能抢下来超过七成的国内大模型训练市场,根本不是只靠自主可控的情怀。核心是它从一开始就做了原生的模型并行软件栈,原来用NV卡的团队,模型并行都是自己凑补丁,兼容性差,速度掉三成,昇腾直接把接口做好,你拿十张中端昇腾310P拼起来,就能跑70B模型,总成本比两张H100还便宜三成,速度还快15%。
不过话说回来,技术没问题,生意就有问题。原来国内云厂商的AI算力赚钱逻辑,是卖整卡、卖整机柜的包年包月额度,你要训大模型,就得包下一整组高端卡,厂商赚全额的溢价。现在模型并行出来,你可以把各个客户闲置的中低端卡打散拼起来,成本直接降三成,云厂商原来的溢价直接没了。上个月阿里云推的模型并行算力拼团活动,直接动了整个行业的蛋糕,所以才有那么多人跳出来骂,说什么扰乱市场。
我帮一家创业团队算过一笔账:同样跑10万轮128k长上下文训练,模型并行拼出来的集群,比整卡数据并行省了420万,刚好够给一个二十人团队发整整一年的工资。省下来的钱,能招多三个算法工程师,多跑十个客户测试,这差距不是一点半点。

门槛砸烂之后,没人能独善其身

很多人聊技术,都只聊大厂的战略,没人聊普通从业者的日子。模型并行对普通人的影响,比你想的大太多。
去年我认识一个从百度出来的算法工程师,原来想出来创业做法律垂直大模型,找云厂商排算力额度,排了两个月,报价要三百万,直接把他吓回去了,差点就回大厂上班了。今年上半年他找了十几个朋友,凑了十六张二手RTX3090,一张才三千二百块,总共花了五万一千块,用开源的模型并行框架拼起来,不到一个月就训出了自己的7B垂直模型,现在已经接了三个律所的订单,每个月稳定进账二十多万。
这放在五年前,想都不敢想。原来大模型的门槛是钱,是人脉,是拿得到算力的关系,现在模型并行直接把门槛砸烂了,你只要懂技术,哪怕手里只有几万块,就能训自己的模型,做自己的生意。
当然,有红利就有冲击。原来头部大模型公司讲故事的核心,就是“我参数大,我壁垒高”,估值能喊到几百亿。现在小团队用十分之一的成本就能打出九成的效果,很多头部团队的融资直接黄了,估值砍半都没人接。我见过好几个拿了十几亿融资的团队,明明可以拆分模型降成本,硬要撑千亿参数的面子,烧钱烧速度,现在钱烧完了,死的悄无声息。这个方向从根上就走偏了。
现在国内二线AI芯片厂商都偷着乐,昆仑芯去年压在仓库卖不出去的一万多片二代芯片,今年上半年被小创业团队抢光了,海光的中低端芯片出货量翻了两倍,原来大家都喊高端卡卡脖子,现在模型并行直接把整个存量市场盘活了,原来没用的卡,现在都能用来训模型。
当模型并行把大模型的入场费从一个亿拉到五万块,那些靠算力垄断吃饭的玩家,还能靠什么守住自己的地盘?