预训练。这个词在圈内已经快被嚼烂了。可真正想明白的人,没几个。你问那些拿着PPT到处融资的创业者,他们要么跟你扯智能涌现,要么跟你谈Scaling Law。说白了吧,他们只是在赌,赌自己手里的算力卡能在烧光之前换成真金白银。
但我不这么看。预训练从来不是技术问题——它是一场全球性的资源重新分配。谁掌握了低成本算力的入口,谁就掌握了定义下一代应用的权力。为什么是现在?因为算力成本曲线刚好走到拐点。英伟达的H100霸权还没稳固,AMD的MI300X就在背后捅刀,国内还冒出一堆国产替代的变量。这种混乱,就是机会。
为什么是现在?算力账单已经付不起了
先看一组数字。训练一个1750亿参数的模型,电费就要烧掉几百万美元。这还没算上冷却、运维、人工调参。过去两年,行业几乎是在用真金白银给英伟达打工。但奇怪的是,大家依然在疯狂涌入。为什么?因为没人敢赌对手会突然停下。这就像冷战时期的核军备竞赛——明知道会拖垮经济,但你不敢先撤手。
但话说回来,这个拐点正在制造一道分水岭。一边是像OpenAI、谷歌这样的巨头,他们有自家算力集群,甚至开始自研芯片。另一边是那些靠租云GPU过日子的初创团队,每训练一次,就相当于给云厂商送一轮房租。**预训练的门槛已经从算法能力变成了资金耐力**。谁的融资能力强,谁就能多跑几个epoch。这不是技术活,这是金融游戏。

我预测,未来12到18个月,全球会有一波惨烈的洗牌。一些小模型公司会被并购,或者直接清盘。巨头们会开始吞并那些拥有独特数据或算法团队的黑马。你看微软和OpenAI的绑定,亚马逊和Anthropic的注资,都是冲着预训练的基础设施筑墙。真正的竞争不是模型参数的比拼,而是谁能在算力成本上压低20%,谁就能在定价权上碾压对手。这跟当年晶圆代工厂的博弈一模一样。
巨头与黑马:有人卡位,有人裸泳
现在赛道上的玩家分三类。第一类是手握现金的云巨头,他们不在乎模型本身能不能赚钱,更在乎能不能把库存的GPU消化掉。第二类是明星创业公司,为了融资不惜把benchmark刷到天上。第三类是那些低调的行业老兵,不声不响地拿自己的数据训练小模型,结果反倒在垂直场景里落地了。
你想哪类最危险?显然是第二类。他们的估值建立在虚幻的“智能”上,可商业逻辑一戳就破。预训练模型的边际成本确实在递减——一旦初始训练完成,新增推理的成本几乎可以忽略不计。但前提是你得先熬过那笔巨额的前置投入。很多公司根本活不到那一天。我见过不少团队,融资的钱90%付给算力服务商,最后连模型都来不及上线。这种局,看着都揪心。
相比之下,黑马往往来自意想不到的地方。比如那些拥有独占性数据的公司——医疗影像、工业仿真、甚至是法律文书。他们不需要训练通用大模型,只需要在预训练的基座上做领域适配。这事的妙处在于,数据壁垒让后来者根本无法复制。而且他们的成本结构低得多,因为基座模型已经开源了。**用开源的预训练权重做微调,本质上是在榨干开源社区的价值**——这话不好听,但真实。

商业闭环:预训练到底怎么赚钱?

说到赚钱,就绕不开边际成本。预训练模型一旦跑通,推理成本几乎线性下降。你想想,一个模型被100万用户调用和1000万用户调用,固定成本摊薄后每个请求的成本可以降到几厘钱。这时候,赚钱的路子就多了:按API调用收费、定制化模型服务、甚至是在模型生态里抽成。OpenAI的API定价已经打了三次降价,就是为了把对手逼到亏损线以下。
更狠的一招叫“模型即服务”。企业不需要自己训练,直接用现成的基座模型,然后塞进自己的业务流程。预训练方按次数收钱,或者按效果分成。这种模式把AI变成了像水电一样的公共事业。虽然听着不那么性感,但它才是真正能产生现金流的生意。那些整天喊“AGI”的公司,反而可能死在商业化的前夜。
但要小心,商业闭环最怕什么?怕的是算力成本的波动。一旦电力价格上涨,或者芯片被卡脖子,毛利率瞬间被吃掉。所以现在的预训练玩家,都拼命跟能源企业签长期协议,甚至自建数据中心。你看特斯拉做Dojo,表面上是为自动驾驶,其实也是为了锁定自己算力命脉。这背后有一个残酷的逻辑:**预训练的本质是用今天的资本开支换明天的垄断租金**。你要是没有足够的本钱,最好别上车。
行动建议:要么上桌,要么离场
最后给你三个非常具体的动作。第一,如果你是创业者,别硬着头皮和巨头拼通用模型。去找一个狭窄但极度垂直的场景,用开源基座+专属数据做预训练。第二,如果你是投资人,重点看那些在算力效率上有独特优化的公司,比如低精度训练、模型稀疏化。第三,如果你只是个体开发者,赶紧拥抱预训练API,把自己的技能栈焊在现有的模型生态上——未来会像当年围绕Windows开发的程序员一样吃香。
说白了,预训练是一场烧钱的马拉松。中途会有无数人倒下,但终点确实有黄金。问题是,你口袋里的钱,够不够跑完剩下的二十公里?