循环神经网络不是过时技术,是大模型漏算的底牌

端侧大模型内卷,挖出了坟里的RNN

今年ICLR放榜的时候,圈子里炸了个不大不小的雷。字节跳动端侧AI团队放了篇论文,说他们把循环神经网络和Transformer混剪之后,7B参数模型在手机端的推理功耗直接砍了六成。

太打脸了。

说实话,过去五年谁要说自己研究循环神经网络,出门都不好意思跟人打招呼。所有人都喊Transformer一统江湖,RNN是该进博物馆的过时货,训练慢、长序列效果差,一堆毛病列出来能写三页纸。结果呢?2026年卷端侧大模型卷到头破血流,大家突然发现,能帮你省电费省内存的,居然是这个被埋了好几年的老东西。

2026端侧大模型循环神经网络功耗对比图
2026端侧大模型循环神经网络功耗对比图

给你算笔明白账。纯Transformer的7B模型跑在骁龙8 Gen4上,每生成一个token就要花128毫瓦的电,满电状态连续推理撑死3小时。改完混合结构之后,这个数字直接掉到47毫瓦,连续推理能跑8小时以上。这个功耗降幅,相当于把三级能效的旧空调换成一级能效新空调,省下来的电比你换个大容量电池提升还多。

争议也跟着来。有人说这就是换汤不换药,蹭RNN的热度炒冷饭。有人说端侧本来就不需要全注意力,RNN本来就适合吃这碗饭。吵来吵去,没人否认一个事实:端侧大模型卷到今天,已经卷到了每个字节都要抠的地步,原来被扔掉的技术,现在都要捡回来筛一遍

为什么国内厂商敢偷偷押注被放弃的赛道

不过话说回来,RNN能杀回风口,根本不是什么技术回潮,是商业模式博弈的必然结果。

从底层逻辑说,Transformer赢在云端大模型,赢在训练并行效率,但是它天生带个死穴:KV缓存。现在大模型推理,KV缓存要占掉快40%的内存空间,这个占比是什么概念?相当于你买了128G的手机,系统直接占走50G,留给你用的只剩一半。对于端侧设备来说,内存就是命,功耗就是钱,多占一兆都不行。循环神经网络天生就是序列化推理,根本不需要存整段的KV缓存,内存占用直接砍掉七成,这个差距相当于紧凑型轿车和全尺寸SUV的占地面积差,正好塞进智能眼镜、智能手表那点可怜的内存空间。

循环神经网络Transformer混合端侧模型结构示意图
循环神经网络Transformer混合端侧模型结构示意图

国内厂商早就在偷偷用了。OPPO的安第斯大模型去年落地智能眼镜,做实时语音翻译,主干网络用的就是改良后的循环神经网络。那款智能眼镜电池只有120毫安时,纯Transformer方案撑不过1小时交互,RNN直接做到了连续6小时待机交互,这就是实打实的体验差距。平头哥去年更新的玄铁RISC-V指令集,专门加了针对循环神经网络推理的加速模块,说白了,人家早就看到这个需求了。

我一直觉得,技术圈的演化就像非洲草原的生态。Transformer是草原上的狮子,块头大力量足,占了捕猎大型猎物的顶级生态位,所有人都盯着狮子看,觉得狮子把所有活都干了,其他物种都死绝了。可循环神经网络就是躲在灌木丛里的薮猫,个子小吃小型猎物,不抢狮子的食物,但是在灌木丛这个生态里,谁也替代不了它。端侧AI就是那片从来没消失的灌木丛,只是之前大家都盯着狮子,没人愿意往灌木丛里看。

n

这个方向我认为走偏了很久了。资本推着所有人往千亿参数大模型挤,都往云端凑,因为讲故事好融资,显卡厂商也愿意推,越大的模型卖越多的卡,赚更多的钱。可终端厂商要卖产品给消费者,消费者要的是续航够、不卡,不是你参数有多大。供需两边的矛盾,攒到今天,终于把RNN给挤出来了。

普通从业者,能吃到这波红利吗

普通从业者,能吃到这波红利吗
普通从业者,能吃到这波红利吗

很多人说这就是技术圈的轮回,老技术翻红而已,跟普通工程师有什么关系?不对,这波翻红带来的机会,比你想的要实在得多。

我上个月跟一个互联网公司的端侧算法负责人吃饭,他说现在招懂循环神经网络优化的工程师,开价要比普通云侧大模型工程师高15%,还是招不到人。为什么?过去五年所有院校毕业生、转行的工程师,都去学Transformer,早就把RNN从技能树里删掉了,简历上都不好意思写自己研究过RNN,生怕别人觉得你落伍。现在缺口一下出来,供需错配,薪资直接被抬上去。我认识一个95后工程师,去年从阿里的云大模型部门跳去OPPO做RNN结构优化,总包直接涨了三十万,换了套大房子的首付。

对整个产业链来说,这个变化也足够有意思。原来所有人做AI芯片都往大显存堆,往高功耗走,现在端侧芯片开始往低功耗、小面积走,针对RNN的专用加速核会越来越多,可穿戴、车载、物联网这些原来跑不起大模型的场景,现在能落地了。你现在买的最新款智能手表,能实时转语音成文字,靠的说不定就是改良后的循环神经网络,只是厂家没说而已。

大多数场景根本不需要一万字的上下文全注意力。你跟智能手表说句话,让它定个闹钟,搜个天气,最多几十个token的序列,RNN的效果跟Transformer没差,成本还低一半,消费者用脚投票都会选续航更长的那个。

接下来两年,会有至少三家头部消费电子厂商靠混合RNN的端侧AI打出差异化,把堆参数的纯Transformer方案甩在身后。你觉得,下一个被从坟里挖出来的“过时技术”会是谁?

作者|大讲堂

排版|大讲堂

审核|安然

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:循环神经网络不是过时技术,是大模型漏算的底牌
文章链接:https://lfdjt.com/info_23_20156.html