去年跟一位头部短视频平台的技术负责人喝茶,他拍着桌子说一句话:我们每年花在存储上的钱,三分之二都扔水里了。
为什么?90%的存储容量,放的是半年没人碰过的数据。却要跟热门新视频一样,存在昂贵的SSD集群里。
这不是个例。整个云计算产业,算下来平均算力利用率不到20%,存储浪费比计算更夸张。
冷热分离就是这么被逼出来的。
被浪费逼出来的重构思路
原来的IT架构,不管是物理机还是早年的云服务,基本都是计算存储耦合。一台服务器,自带CPU内存,也自带硬盘存储空间。业务跑在哪,数据就存在哪。
这种架构在小体量的时候没毛病。业务涨起来,问题就全暴露了。
计算不够用的时候,你得加服务器,顺便就带了一堆用不上的存储。存储不够用的时候,加服务器又多了了用不上的计算。
两边都浪费。后来行业搞出来存算分离,把计算和存储分成两个独立池,各自扩容。但还是没解决另一个问题:不是所有数据都需要一样的性能。

你手机里刚拍的照片,和三年前旅游的老照片,访问频率能差出上千倍。电商平台刚产生的订单,和三年前用户的历史订单,访问频率能差出上万倍。
要让所有数据都保持毫秒级的访问速度,成本堆出来吓死人。
冷热分离的逻辑非常简单:把对性能要求高、访问频繁的“热数据”放在低成本高速度的存储层,把访问少、对时延不敏感的“冷数据”挪去大容量低成本的低速存储层。
说白了,好钢用在刀刃上。
原理简单,落地为什么难

说起来轻巧,真做起来到处是坑。
第一个坑,就是冷热数据的边界谁来划?
划错了,把经常用的数据挪去冷层,用户查个东西等三五秒,直接走了。把不用的数据留在热层,钱一分没省着。
现在大多是按时间划,超过多少天自动转冷。但真实业务哪有这么标准。比如有的品牌的历史活动页面,突然因为某个热点被翻出来,流量一下子爆了,这时候所有数据都在冷层,调都调不出来,直接崩盘。
第二个坑,改造成本太高。
大部分企业的老应用,都是按照数据本地存取的逻辑写的。要改造成支持冷热分离的架构,代码改半年,人力成本砸进去,省下来的存储成本三五年都赚不回来。谁愿意动?
第三个坑,一致性和时延问题。
数据挪来挪去,会不会丢?访问的时候跨层调数据,延迟会不会涨?哪怕只多了几十毫秒,对toC的互联网产品来说,都是不能接受的损失。
说实话,我见过不少企业兴冲冲上马冷热分离项目,最后发现省了一百万存储成本,花了三百万改造成本。骑虎难下。
不过话说回来,最近两年情况变了。大模型带起来的海量数据,把存储成本直接顶到了企业受不了的程度,就算花改造成本,也比一直扛着存储费用划算。
产业链正在发生的变化与未来预判

现在整个科技产业链都在围着冷热分离转。
上游的云厂商,几乎都推出了现成的冷热分层存储服务。对象存储分热温冷冻四层,价格差出快十倍。你不用改架构,直接设置个规则,自动转层。对中小用户来说,门槛已经降了很多。
中游,专门做冷热数据智能调度的创业公司已经冒出来了。不用你改代码,一层代理帮你识别访问频率,自动挪数据,出了问题自动切回热层。相当于帮企业管好了这个“冷热转换器”。
下游的应用端,互联网企业是最先吃螃蟹的。
短视频和长视频平台,刚上线的内容放热层,上线三个月访问量掉90%,直接转冷,成本能降50%到70%。我接触到的一家腰部短视频平台,上线冷热分离之后,一年省了近两千万存储费用。这就是纯利润。
还有大模型企业。训练一次大模型产生的checkpoint、日志、中间数据,量能到PB级别。大部分训练完之后,除了排查问题根本不会碰,全存在热层根本扛不住。现在几乎所有头部大模型公司,都在用冷热分离存训练数据。
日志、备份数据、历史归档,这些都是冷热分离的核心场景。
当然,坑还是有的。最大的风险,就是厂商锁定。你用了某家云的冷热分层存储,数据挪出去成本特别高,以后想换服务商都换不了。还有冷数据的安全问题,很多冷数据存的是归档业务数据,需要保存多年,冷存储的可靠性会不会打折扣?之前出过冷数据硬盘老化找不到的案例,赔都赔不起。
还有,不是所有企业都适合。数据量不到几十TB,冷热分布不明显的,折腾这个真没必要。省的那点钱,不够给技术开加班费的。
未来三年,冷热分离会从可选方案变成中大型科技企业的标配。大模型带起来的海量数据需求,会把这个市场撑大好几倍。
会出来专门针对冷热分离的新硬件,比如高密度的冷数据存储硬盘,成本比现在再降一半,可靠性再提一倍。
中间的智能调度层会变成标准化产品,改造成本会降到原来的十分之一不到,中小企业也能用得起。
冷热分离本质是云计算下半场,从抢增量到挖存量的必然结果。之前行业跑的快,没人在乎那点浪费,现在增速降下来,每一分钱的成本都要抠。
省下来的,就是利润,就是竞争力。别觉得这是小技术,影响的是整个云计算产业的成本结构。
作者|大讲堂
排版|大讲堂
审核|阿辰
大讲堂