机器学习不是技术问题,是数据投喂成本问题

2026年外卖调价争议里的尴尬真相

今年过完年,外卖圈炸了。某头部平台上线了新一代机器学习动态调价系统,说是能根据实时供需自动调配送费和商家抽成,号称能降本15%。结果上线半个月,骑手跑远单的积极性掉了两成,商家投诉量翻了三倍。 为什么?不是模型算法不对。是训练模型用的标注数据,全是平台三年前的老数据,新的路况、新的商家分布、甚至疫情之后骑手的接单偏好,全没喂进去。要更新全量数据?报价出来,整个技术部都傻了。 说实话,我当时听到这个数字也惊了。某头部外卖平台训练新一代配送定价模型,仅数据标注清洗一项就花掉了近8000万,相当于江浙地区一个中等县城全年公办高中的办学经费。就这,还只是训练一次的成本,每个季度更新一次数据,每次都要掏差不多一半的钱。
2026年国内外卖平台机器学习动态调价规则示意图
2026年国内外卖平台机器学习动态调价规则示意图
很多人聊机器学习,开口就是算法精度,就是参数规模,从来没人提喂数据的成本。你以为模型训练完就一劳永逸?错了。用户的行为在变,行业的规则在变,甚至路边的红绿灯位置变了,你的模型都得重新喂数据重新训。 这两年跑下来,很多行业所谓的机器学习落地,都是样子工程。放在展厅里演示能打100分,真拉到线下用,连60分都达不到。核心原因就是养不起持续的数据投喂。不是技术卡脖子,是成本卡脖子,对吧?

堆参数还是攒数据,中国式博弈的底层逻辑

不过话说回来,巨头们不是不知道这个问题。为什么还死命往千亿参数堆?其实是一场心照不宣的商业模式博弈。 通用大模型拼参数,拼的是融资故事,拼的是资本市场的估值。堆出来的参数就是壁垒,就是流量密码。但是真落到产业落地,这个逻辑完全走偏了。我接触过国内顺丰的分拣团队,他们用机器学习做网点中转调度,只用了不到十亿参数的垂直小模型,落地之后中转效率提了22%,单票成本降了一毛二,一年下来省出近十个亿的利润。 你知道这个模型训练加全年数据更新的总成本是多少?不到三千万。比OpenAI GPT-4一次训练成本的零头都不到。OpenAI的GPT-4训练一次成本约1亿美元,国内某头部通用大模型训练一次的成本相当于造3公里长的城市高架路,但是落地到零售网点调度场景的效率,只比顺丰这个十亿参数的垂直小模型高不到7%。
国内快递网点机器学习智能分拣调度系统实拍图
国内快递网点机器学习智能分拣调度系统实拍图
这个对比太有意思了。现在整个行业的发展,特别像寒武纪生命大爆发。一开始大家都往体型越大的方向卷,越大越能抢资源,越大越能吸引注意力。结果一次环境突变,食物不够,最先饿死的全是体重几十吨的巨型恐龙,留下来活的滋润的,都是躲在犄角旮旯,专门吃特定食物的小型哺乳动物。这个类比放到机器学习赛道太贴切了。 中国本土企业的优势从来不是堆全球最大的参数,我们的优势是离产业近,能攒到别人拿不到的干净垂直数据。字节跳动的推荐算法为什么能打全球?不是参数比别人大多少,是它拿到了十亿级用户每天刷短视频的实时行为数据,这个数据别人拿不到,花多少钱都拿不到。很多人说字节算法牛,其实本质是它的数据攒的好,喂得勤。 数据投喂才是真正的壁垒,参数不是。

普通从业者的隐秘机会

普通从业者的隐秘机会
普通从业者的隐秘机会
说了这么多,对普通人,对普通产业链上的从业者,到底有什么实际影响?别听那些培训机构喊什么“三个月学会大模型,年薪百万”,那都是割韭菜的。 现在整个产业链缺的,根本不是会调大模型参数的工程师,缺的是能给垂直行业做数据清洗、做标注的懂行的人。我认识一个原来在东莞纺织厂做了十年质检员的老哥,去年出来给做纺织AI质检的公司做数据标注,专门标各种普通人看不出来的纺织疵点,现在一个月拿三万五,比原来在厂里翻了快三倍。原来做通用数据标注,一条数据几毛钱,现在垂直领域的专业标注,一个复杂疵点标好能拿五十块,就因为懂行业的标注师太少了。 对中小创业者来说更是这样。你别去碰通用大模型,你碰不起,光一次训练的成本就能把你所有天使轮融资烧完。你去各个传统行业转一圈,比如陶瓷质检,比如家具下料,比如果蔬分拣,哪个不需要机器学习?哪个没有攒了五六年的脏数据、没整理的非标数据?你把这些数据整理干净,训一个小模型,卖给工厂,一单几十万,一年做个十单八单,比你盯着融资一轮一轮烧钱香多了。 很多人说机器学习是巨头的游戏,不对。巨头拿着钱堆参数,堆出来的都是通用能力,到具体产业,水土不服的多了去了。你攒了三年的某个细分领域的干净数据,比巨头的千亿参数值钱一万倍。 你手里,攒了多少别人拿不走的干净数据?
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:机器学习不是技术问题,是数据投喂成本问题
文章链接:https://lfdjt.com/info_23_16653.html