端侧大模型的参数内卷:多头头数成了营销话术
今年2026年春季手机发布会我连续看了三场,看得我浑身难受。
三家厂商发新的端侧大模型,几乎把「多头注意力」四个字打在了发布会PPT封面。A厂说我们上了64头,比上一代翻了一倍。B厂直接喊出128头全量支持,说这才是真端侧大模型体验。C厂更狠,直接放了个参数对比图,把友商32头的方案踩得一文不值。
说实话,我当时差点把手里的茶喷在屏幕上。
后来第三方评测机构出了盲测结果,找了100个普通用户,不告诉他们头数,让他们分辨128头和32头生成内容的区别。结果是什么?超过八成的用户说不出差别,甚至有17%的人觉得32头的响应更快,体验更好。更讽刺的是,开128头全量运行,手机续航直接掉了18%。第三方机构算了一笔账:端侧开全量128头多头注意力,每小时多耗的电量,一天累加下来,相当于一个10万人口的小镇全天居民家用照明的总用电量。
你说可笑不可笑?
本来是Transformer架构里一个很实用的技术设计,现在硬生生变成了厂商收割用户和投资人的营销工具。堆头数就行,反正用户听不懂,参数好看,讲故事好讲,钱就赚到了。

多头注意力的生意经:为什么大家都爱堆头
很多人不知道,国内互联网公司玩多头注意力,比大模型火得早多了。字节跳动的抖音推荐系统,早在2020年就把多头注意力用在了用户兴趣拆分上,每个头对应一类用户兴趣,有的盯美妆,有的盯足球,有的盯育儿,本质就是给不同维度的信息分不同的路数抓重点。
把多头注意力比作一支渗透进信息战场的侦察分队,其实特别贴切:每个注意力头就是一名侦察兵,任务是抓不同维度的关键信息——有的盯句法结构,有的盯实体关联,有的盯上下文逻辑。大部分人现在堆头数,就是把一百个侦察兵都派去同一条街查车牌,看起来队伍浩浩荡荡,真正要找的核心情报反而没人去碰。
字节内部早就在推动态稀疏多头,什么意思?就是一次推理只激活当前任务需要的头,不需要所有头全量计算。就说推荐场景,你现在正在看足球内容,只需要激活盯体育的那几个头就行,盯美妆育儿的头完全可以休息。就这一个优化,抖音推荐服务的整体算力成本降了40%,推荐准确率还涨了2.1个百分点。
这么好的技术,为什么没在大模型圈普及开?说穿了就是生意问题。
现在大模型行业怎么估值?怎么卖算力?基本都是按总参数量算钱。头数越多,参数量越大,估值越高,算力卖得越贵,营收越好。国内某头部大厂去年公开的内部测试数据:训练一个10万头的超大规模全量多头基座模型,总训练成本比同参数量的动态稀疏多头模型贵整整3倍,下游100项通用任务的平均准确率只提升了4.8%。投入产出比烂成这样,为什么还要做?因为能讲故事,能拉融资,能炒高估值,能卖更多算力卡。
说白了,就是赚信息差的钱。你不懂,我就吹得越玄乎,价格卖得越高,钱赚得越多。

产业链的真实反噬:谁在为多余的头买单

这种堆头的内卷,受伤的从来不是讲故事的那批人,是产业链底层的普通从业者和终端用户。
我上个月见了一个做垂直法律大模型的创业团队,创始人跟我吐槽,说他们本来用32头稀疏优化,效果够好,成本能降到原来的三分之一,给律所报价比同行低一半,活得很舒服。结果投资人说,你头数这么少,参数上不去,估值没法给你涨,你必须加到128头,不然下一轮融资别想了。没办法,他们只能把钱都砸在加头扩参上,现金流直接紧张了一半,产品落地进度拖了三个月,本来能拿下的订单被对手抢了好几个。
这不是个例。现在算法招聘,好多简历上都写着「参与训练十万头大模型」,其实说白了就是堆参数,核心的优化逻辑一点没碰。年轻工程师天天跟着卷堆头数,根本没人沉下心做稀疏优化、路由剪枝这些真正降本提效的活,整个行业的创新方向都走偏了。
对用户来说更冤,买个新手机,因为多了96个根本用不上的注意力头,多花两千多块,续航还少了小半天,平白无故为厂商的营销谎言买单。你去问为什么,销售跟你说这是最新技术,你不懂很正常,说白了就是拿技术名词pua你。
不过话说回来,用户又不傻,现在消费者用脚投票的速度比以前快多了,今年第一季度国产端侧大模型手机的销量,喊128头喊得最凶的那家,销量反而跌了十个点,就是明证。
很多人觉得技术越堆越先进,其实不是。技术的本质是解决问题,不是堆参数讲故事。
你愿意为多出来的96个从来不会被激活的注意力头,多付2000块钱,再忍受少半天的续航吗?
作者|大讲堂
排版|大讲堂
审核|白杨
大讲堂