科技 第40页

AdamW:训练千亿模型的隐形战场,为什么现在没人敢忽视它?-大讲堂

AdamW:训练千亿模型的隐形战场,为什么现在没人敢忽视它?

算力在燃烧。一笔一笔的美金在云端蒸发。你盯着那个训练loss曲线,它像条死蛇,趴着不动。换优化器?疯了吧,这都跑了一半了。但说实话,这种时候,你是不是在心底咒骂过那个默认的Adam? AdamW不是新东西。但2024年再谈它,味道全变了——...

Adam优化器的暗黑面:那些论文不会告诉你的坑与救赎-大讲堂

Adam优化器的暗黑面:那些论文不会告诉你的坑与救赎

你肯定用过Adam。真用过的话,应该也被它坑过。我不是在说它不好用——说实话,在某些任务上它简直是救世主,收敛速度让你流泪。但问题是,这玩意儿一旦你不顺着它的脾气调参,它就给你摆烂。今天不聊综述里的漂亮曲线,来拆开看看这个自适应优化器到底怎...

SGD:大模型军备竞赛背后的利润收割机-大讲堂

SGD:大模型军备竞赛背后的利润收割机

SGD。随机梯度下降。就这三个字母。搅动了整个AI供应链。为什么是现在?因为大模型的胃口太大。传统优化算法,比如全梯度下降,面对十亿参数、TB级数据,直接歇菜。SGD呢?它只需要一小撮样本就能算一步。省时。省内存。极端环境下也能跑。但这还不...

深度学习优化器深度解剖:从SGD到LION,踩坑实录-大讲堂

深度学习优化器深度解剖:从SGD到LION,踩坑实录

一、优化器不是魔法,是数学直觉 训练神经网络时,最让人崩溃的瞬间是什么?不是代码报错,而是 loss 曲线像一潭死水——不动。换了十几个种子,调了学习率,它就是不降。这时候你才意识到,优化器选错了,或者说,你根本没懂它。 优化器,说白了,就...

交叉熵的炼金术:从数学之美到工程之坑-大讲堂

交叉熵的炼金术:从数学之美到工程之坑

上个月被一个分类任务搞到半夜两点——准确率死死卡在73%,怎么调都没用。换优化器、加BN、warmup…毛用没有。最后发现,问题出在交叉熵的一个小细节:标签没有平滑。改了三行代码,直接冲到89%。当时我真的——又气又喜。气的是浪...

损失函数:这玩意到底怎么就成了供应链的命门?-大讲堂

损失函数:这玩意到底怎么就成了供应链的命门?

为什么突然都在谈损失函数? 可笑吧。几年前它还只是教科书里一个不起眼的公式,现在呢?全球供应链的每一次波动,背后都藏着一个被精心调校的损失函数。疫情、战争、港口拥堵…这些黑天鹅事件让预测变得像赌博——但赌场也有自己的数理模型,对...

Tanh:别指望线性,供应链的救赎藏在S曲线里-大讲堂

Tanh:别指望线性,供应链的救赎藏在S曲线里

为什么是现在:平面地图已经失效 说句实话,看了十年供应链报告,满篇都是线性预测、线性增长、线性风险。 扯淡。 现实世界根本不长那样。2020年之后,谁还信直线谁就是傻子。我们生活在陡坡与断崖之间,到处都是拐点——而Tanh,这个在神经网络里...

Sigmoid:被神化与被唾弃的S形曲线,以及它的工程救赎-大讲堂

Sigmoid:被神化与被唾弃的S形曲线,以及它的工程救赎

说真的,Sigmoid 这个函数,放在今天,简直就是教科书级的“出道即巅峰”案例。上世纪 90 年代,它几乎统治了所有神经网络的隐藏层,谁能想到二十年后,它会被 ReLU 按在地上摩擦?但细想,它真的毫无价值了吗?我看未必。就像磁带,虽然老...