
大语言模型:拆到骨头里,才看清它凭什么颠覆一切
Transformer:不只是“注意力”,是数学暴力美学 说实话,第一次看到Transformer的架构图,我笑了——这不就是把一堆全连接层叠起来,然后搞了个叫自注意力的玩意儿?能有多神?后来跑了个文本分类,准确率直接秒了LSTM将近8个点...

Transformer:不只是“注意力”,是数学暴力美学 说实话,第一次看到Transformer的架构图,我笑了——这不就是把一堆全连接层叠起来,然后搞了个叫自注意力的玩意儿?能有多神?后来跑了个文本分类,准确率直接秒了LSTM将近8个点...

大模型这玩意儿,现在火得离谱。但如果你仔细看,这简直就是一场豪赌。为什么是现在?因为再不赌,可能连上牌桌的机会都没了。然而,绝大部分玩家根本没想清楚怎么赢——或者说,他们以为把参数调大就能赢。天真! 过去两年,AI基础设施的投资翻了数倍。但...

还记得第一次用GPT-3生成一段像模像样的代码——我盯着屏幕,脊背发凉。那感觉,跟第一次看到AlphaGo赢了李世石差不多。但很快我就冷静下来了。毕竟,这玩意儿背后,不过是一堆矩阵乘法和概率分布。对吧?真是这样? 自注意力:一个眼神就够了 ...

为什么是现在?风口过了还是没来? 2018年,BERT横扫NLP榜单的时候,所有人都在喊要变天了。但四年多过去了,天变了吗?一部分变了,另一部分——尤其是商业落地那部分,卡住了。说实话,到2023年还聊BERT,有点像是在大家都在追GPT-...

有时候你真想回到那个天真的年代——觉得一个注意力头就够用了。我至今记得那个深夜,线上服务突然OOM,日志里满屏的 CUDA out of memory,就因为我把头数从 8 砍到了 1,企图节省显存。结果呢?模型直接退化成了词袋。那感觉就像...

昨天和某大厂供应链总监喝酒,他拍着桌子骂了一句:‘自注意力就是个妖孽,它把我们的预测模型全废了。’ 我笑了。不是幸灾乐祸——是因为他说对了。自注意力(Self-Attention)这东西,表面上是Transformer架构的心脏,本质上却是...

第一次把多头注意力的代码跑通时,我盯着那个热力图看了整整十分钟。不是震撼,是觉得可笑——就这么个加权求和的东西,居然把语言模型推到了今天的高度。而我们在学校学的那套信号处理,乍一看还以为早就被扫进故纸堆了,结果换个马甲,成了Transfor...

我刚从硅谷回来,满耳朵都是Transformer。不是孩之宝的变形金刚,是那个把整个AI供应链搅得天翻地覆的架构。英伟达的股价再创新高——可你知道吗?下游的服务器厂商利润率跌到不足5%了。撕裂,正在发生。 为什么是现在?因为算力饥荒,因为地...

数据并行?这玩意算是分布式训练里的老伙计了。但你以为把数据切碎喂给每张卡就完事了?天真。上个月我们A100集群跑GPT-2微调,800张卡同步拉满,梯度同步那一下……整个机柜的交换机指示灯瞬间全绿——不是健康,是过载。CLOSE_WAIT积...

去年跟一个做AI infra的朋友喝酒,他说了句让我至今后背发凉的话——“我们现在不是缺卡,是缺一种把卡当水一样用的能力。” 你知道最讽刺的是什么吗?就在OpenAI用2.5万张A100跑GPT-4的那几个月,硅谷无数创业公司还在为抢到8张...