巷口诊所里的联邦学习:数据不出院也能优化诊疗方案

巷口的梧桐落了第三场雪的时候,张济民又翻开了李阿婆的血糖日志。李阿婆患二型糖尿病十五年,身子弱,基础病多,之前换了三种降糖药,空腹血糖还是忽上忽下。社区医院两百多个糖友,每个的情况都不一样,张济民从医三十年,靠经验开方,可有时候经验真的不够用。 之前市里想做一个区域性的糖友血糖预测模型,号召各个社区医院上传脱敏数据,结果没人敢动。政策卡得严,用户健康数据不能随便出医疗机构的安全域,出了问题谁担责? 真的难。

被锁住的数据,没法满足的需求

不止医疗领域是这样。你我手机里的购物记录、出行轨迹、支付信息,早就被切成一块一块锁在不同互联网公司的服务器里了。大厂尚且不敢越界拿数据,更别说小机构、小医院。大家手里都有一点点有用的数据,凑在一起能做很多惠及普通人的事,可就是凑不到一块儿。 这不就是当代数据领域的“罗生门”吗?
社区医院全科门诊冬日分诊场景
社区医院全科门诊冬日分诊场景
张济民那时候想,难道就只能这样?大家抱着自己那点数据挨饿,看着病人受罪?传统集中式机器学习的路走不通,所有人都在等另一个解法。

原来不用搬数据,也能一起训练模型

前年冬天,市卫健委的AI试点推到了他们社区诊所,张济民第一次听到这个词:联邦学习。一开始听不懂那些技术术语,后来对接的年轻工程师一句话给他讲明白了:数据不出域,模型共训练。 说白了,就是大家不用把自己的原始数据交给任何一个第三方中心,每家都在自己这里用本地数据训练模型,只把训练出来的模型参数更新传给协调方做聚合,聚合完得到一个更准的全局模型,再发回给每个机构更新本地模型。原始用户数据永远不会离开本地存储。
联邦学习横向联邦参数聚合流程示意图
联邦学习横向联邦参数聚合流程示意图
张济民一开始也犯嘀咕,只传参数,会不会被有心人反推出原始数据?说实话,没人敢拍胸脯说百分之百绝对安全,可现在配套的差分隐私、同态加密技术已经把风险压到了极低,对比把所有用户数据攒到一个中心存储的风险,简直不要安全太多。 试点跑了三个月,模型就出了第一版可用结果,给李阿婆推的药方,比张济民原来开的剂量少了五分之一,血糖反而稳了整整两个月。张济民那时候真觉得惊讶。原来那些躺在各个社区医院硬盘里、快落灰的老旧病历,居然还能发挥这么大的用处。

藏在日常里的安静革命

藏在日常里的安静革命
藏在日常里的安静革命
你以为联邦学习是很远的实验室技术?其实早就在你我身边悄悄跑了好几年了。你刷短视频的时候平台给你推的内容,电商给你推的商品,银行给你批贷款的时候算的信用分,很多场景都用上了联邦学习。 比如你只在A平台买过母婴用品,只在B平台找过租房信息,两个平台受隐私规则限制不能交换你的数据,但是用联邦学习,就能一起给你推家附近合适的带车位租房信息,你拿到了方便,没人拿到你的完整隐私。 说白了,这是一套完全不同于过去“数据垄断才能做AI”的新思路。过去我们总觉得,AI要做大,就必须抢数据、攥数据,把所有数据都攒到自己手里才能训出好模型。联邦学习把这个逻辑彻底反过来了:我不用拿你的数据,我只要和你一起训模型,大家各拿各的收益,谁也不用侵犯谁的边界。 张济民现在每个月都会给本地模型更新一次参数,每次更新只需要十分钟,诊所那台用了五年的旧服务器就能跑,不用买新设备,也不用找专人维护。现在诊所里六十多个血糖控制不好的老人,都用上了模型给出的个性化调整方案,有一大半都把血糖稳在了正常区间。 不过话说回来,也不是没有问题。现在联邦学习的通信开销还是大,很多偏远地区基层机构的网络带不动,不同机构的数据质量参差不齐,聚合出来的模型有时候也会走偏,还有人担心恶意参与者投毒污染模型怎么办。这些问题都还在慢慢解决,没人说联邦学习是包治百病的银弹。 但是你得承认,它给了我们另一种可能。一种不用牺牲普通人的隐私,也能让所有人用到AI好处的可能。 上个月雪停的时候,李阿婆提着自己腌的萝卜干来诊所,给张济民送过来,说现在跳一下午广场舞都不晕了。张济民把萝卜干放在办公桌抽屉里,抬头就看见电脑右下角那个小小的、几乎没人会注意到的模型运行图标。 那就是联邦学习,它不是什么震天响的商业概念,也不是大厂用来割韭菜的新名词,它就是藏在巷口诊所里,给老人调药方的一个小东西,它悄悄改变着一些普通人的生活,也悄悄改变了我们对AI和数据的固有理解。 未来会不会所有人都用这种模式?不好说。可至少现在,我们知道了,AI不一定非要把所有人的数据都扒得精光才能跑。这样,就够了。

作者|大讲堂

排版|大讲堂

审核|乐乐

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:巷口诊所里的联邦学习:数据不出院也能优化诊疗方案
文章链接:https://lfdjt.com/info_23_23518.html