无监督学习不是算法问题,是数据问题

2026年开年第一瓜,不是互联网大厂的普通裁员,是大模型圈的。某头部国产大模型厂商,直接砍了整整三千人的人工标注团队
2026年国内大模型标注团队规模变化曲线图
2026年国内大模型标注团队规模变化曲线图

裁掉三千标注员之后的争议

裁掉三千标注员之后的争议
裁掉三千标注员之后的争议

之前大模型圈卷什么?卷标注量。你标一千万token,我就标一个亿,你找博士标专业语料,我就拉一万人的众包团队刷量。 所有人都默认一个规则:标注数据越多,模型效果越好,融资估值越高。

说实话,这个游戏玩到最后,已经变味了。我之前帮一家AI创业公司算过账,标注一块中文语料,行业均价是每千token三块钱。一个十亿token的微调数据集,总成本就是三百万。 三百万是什么概念?相当于武汉东湖高新区一套120平的核心地段大平层。够夸张吧?

更吓人的是,千亿参数大模型的整个项目里,标注成本能占到总投入的60%,比训练用的GPU电费还贵两倍。 堆成本堆到这个份上,谁都卷不动了。所以这次头部厂砍标注团队,说接下来全部预训练都转无监督学习,圈内直接炸了。

老派专家说这是瞎搞,没有标注数据模型能学到什么?年轻的算法工程师偷偷叫好,说终于有人敢捅破这层窗户纸了。 什么是无监督学习?说白了,就是不用人给数据贴标签、画框框,让模型自己从海量原始的、乱糟糟的未标注数据里找规律。 你给一堆猫和狗的照片,有监督学习要人先标好哪张是猫哪张是狗,无监督学习自己就能分出来。 就这么简单的事,之前没人敢大规模玩。为什么?

藏在参数卷不动背后的生意

说白了,无监督学习短期不讨好。 你堆标注数据,三个月就能把榜单分数涨两个点,给投资人汇报好看,拿融资顺。你搞无监督,可能熬大半年,分数才涨一个点,老板都不愿意等。

不过话说回来,最先熬出来的国内厂商,已经吃到甜头了。字节跳动从2023年开始,就把抖音平台每天新增的上亿条未标注视频、标题、评论,全部扔给无监督模型做预训练,没花一分钱人工标注。到2025年年底对外公布的测试结果,相同参数下,模型效果比全标注预训练高12%,训练成本直接降了47%。 这个账算下来,一年能省好几个亿的标注费。

我一直觉得,现在的大模型竞争,就像生物进化。有监督学习是人工选种,你要什么性状我就给你标出来,定向筛选,看起来高效,其实框死了演化的空间。无监督学习是自然进化,扔到海量原始环境里,自己摸规律找方向,就像寒武纪生命大爆发,你不知道哪个变异会成气候,最后活下来的,适应能力反而比人工选出来的强太多。 这就是跨行业的规律,对吧?

国内厂商之前一直跟着OpenAI的路径走,人家做有监督微调,我们就堆标注团队。但是没人想过,我们最大的优势,本来就是海量的未标注原生数据啊。 中国有超过10亿网民,每天在短视频、社交、电商平台产生的原始语料、图像、视频,加起来每天超过百亿token。这些数据之前大部分都躺在硬盘里落灰,因为没人花钱去标。现在无监督学习起来,这些废数据直接变成了黄金。

这就是商业模式的博弈。小厂要活下去,要融资,必须拼短期刷榜,只能接着堆标注,把自己拖死。大厂有资本熬,押注无监督,提前把赛道占了,未来十年的优势就出来了。 这个方向我认为,绝大多数跟风的小厂都走偏了。为了拿融资赚快钱,把所有钱砸在标注上,根本没有积累自己的无监督技术能力,最后只能被淘汰。

无监督预训练大模型训练成本对比图
无监督预训练大模型训练成本对比图

每个AI从业者都要面对的转向

每个AI从业者都要面对的转向
每个AI从业者都要面对的转向

无监督学习不是大厂的独享游戏,它的影响会渗透到产业链的每一个角落,砸到每个普通人的饭碗上。

先说最直接的标注行业。国内现在有超过两百万的标注从业者,大半在三四线城市,靠着给AI标数据每个月赚三四千块钱糊口。未来三年,至少80%的基础标注工作会被无监督模型自己搞定,不需要人工了。 你没看错,不是未来十年,是三年。很多厂已经在用无监督模型生成标注,给下游任务用,准确率比人工标还高5%,成本不到十分之一。

然后是算法工程师。之前找AI工作,你会调参,会整理标注数据就能拿高薪。现在不一样了,招聘网站上,无监督学习方向的算法岗,起薪比同级别有监督方向高35%,还抢不到人。整个行业的能力要求已经转了,你跟不上,就只能被挤出去。

当然也有新机会。之前很多垂直领域,比如医疗影像、工业质检,标注成本高到吓死人。一张肺癌CT片子,要副主任医师级别的人标,一张要五千块,训一个能用的模型要几百万标注费,中小创业公司根本玩不起。现在用无监督学习,拿几十万张未标注的片子就能训出达到临床要求的模型,成本降到原来的十分之一,很多小公司也能入场分蛋糕了。 说实话,我接触过很多垂直领域的创业者,之前都卡在标注成本上,现在眼睛都亮了,说终于等到这一天了。

当年移动互联网转型的时候,很多靠着PC流量吃饭的老玩家没转过来,直接没了。现在AI从有监督往无监督转,原来靠着标注生意吃饭的既得利益者,会第一个倒下吗?

作者|大讲堂

排版|大讲堂

审核|小准

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:无监督学习不是算法问题,是数据问题
文章链接:https://lfdjt.com/info_23_20124.html