
模型量化:把LLM塞进手机,我踩过的坑和捡到的宝
做模型推理那会儿,真是被延迟逼疯。几百兆的模型,跑一次几百毫秒,用户早就划走了。后来搞量化——嚯,发现新大陆!内存直接腰斩,速度快了三倍。但,别高兴太早。坑多得能填海。今天不整虚的,就聊聊这玩意儿到底怎么玩,怎么避开那些阴沟。 这玩意儿到底...

做模型推理那会儿,真是被延迟逼疯。几百兆的模型,跑一次几百毫秒,用户早就划走了。后来搞量化——嚯,发现新大陆!内存直接腰斩,速度快了三倍。但,别高兴太早。坑多得能填海。今天不整虚的,就聊聊这玩意儿到底怎么玩,怎么避开那些阴沟。 这玩意儿到底...

不是危言耸听。看看硅谷现在疯抢H100的样子,像极了2020年抢口罩。但这事儿比口罩绝望得多——算力需求的斜率已经彻底疯了。一季度英伟达数据中心营收同比暴增427%,而台积电的CoWoS封装产线还在喊疼。这就是梯度爆炸。它不是一个数学概念,...

你盯着TensorBoard上那几条几乎躺平的loss曲线,心里肯定在骂娘。对吧?层数一深,准确率反而像跳楼一样往下掉,反向传播回来的梯度,小到连浮点数都懒得表示——这就是梯度消失,训练深层网络时最恶心的幽灵。说实话,我第一次撞上它的时候,...

供应链的中间层,正在被抽干。就像神经网络里的残差块,跳跃连接直接打通了输入和输出——中间那些冗余的隐藏层,突然变得可有可无。说实话,这玩意儿在深度学习里火了快十年,可真正让实业界脊背发凉的,是它居然映射到了真实的商业世界。 为什么是现在?地...

退化,梯度,以及那个小箭头 头回见到残差连接,是在ResNet那篇论文里——说实话,第一反应是:就这?不就是在输出上硬加了个输入吗?也太粗暴了。但是,当我自己撸了个30多层的CNN,看着训练loss不降反升,再切到ResNet-34跑一遍,...

为什么是现在?一场静默的算力政变 你如果这两年盯着GPU的股价发呆,大概已经注意到了——H100被炒成期货,电费账单比研发费还烫手。所有人都在喊“大模型”,却没人愿意低头看一眼那堆矩阵乘法里的细枝末节。Layer Normalization...

那是半夜两点,训练日志里突然跳出NaN。我盯着屏幕,脑子里只有一个念头——又tm是归一化的问题。别笑,做大规模预训练,这种破事遇少了? 说实话,层归一化(Layer Normalization)这玩意儿,看着简单,就是减均值除方差,再搞两个...

你训过那种几十层的网络没?没有的话,恐怕很难理解那种眼睁睁看着 loss 上蹿下跳,就是不肯老实下降的抓狂。调学习率、换初始化、加正则…我那时候简直觉得自己在搞玄学,而不是工程。直到 2015 年——没错,和 ResNet 同年...

说实话,我最近重新翻出Hinton那篇Dropout论文时,后背有点发凉。 不是因为它多么深奥——这玩意都出来快十年了——而是因为,它现在正被嵌进一个完全不同的叙事里:算力短缺。对,那场让所有大模型玩家集体焦虑的算力饥荒。我甚至觉得,Dro...

很多人一提到L2正则化,脑子里蹦出来的就是“防止过拟合”。 然后?没了。 说实话,这就像说“汽车能跑是因为有发动机”——正确,但毫无用处。今天我们干脆把L2正则化的皮一层层扒开,看看到底是什么让它成为贯穿线性回归到Transformer的常...