音频大模型深度伪造语音鉴伪:不是技术问题,是成本问题

杭州直播翻车案里走不出来的死循环

2026年3月,杭州滨江区那家被查封的MCN机构,用深度伪造的顶流语音做了整整三天直播卖贴牌白酒,平台的鉴伪系统延迟了两个小时四十八分才触发封禁,那时候已经有两千三百多万货款进了公会账户,一千八百多单货发去了全国各地。

现在打开短视频平台搜,随便就能找到三五个顶着顶流名字的AI语音直播间,封了一个,又冒出来两个。

防不住。

公开数据显示,2025年全国电信诈骗案件里,AI语音伪造类案件占比冲到16.8%,比2023年的1.3%涨了11倍还多。这个涨幅,相当于2019到2022年国内新能源汽车的市场渗透率涨幅,一模一样。

2025年中国AI语音诈骗案发占比柱状图
2025年中国AI语音诈骗案发占比柱状图

很多人张口就说,是国内鉴伪技术不行,造不出能全拦的产品。我告诉你,错得离谱。实验室里早就有能识别99.9%深度伪造音频的技术了,问题是用不起

微信支付今年年初全量上线了转账前语音鉴伪功能,初衷是好的,就怕骗子冒充亲人喊你转钱。结果呢,每个月因为鉴伪等待延迟超过1秒,用户主动取消的转账交易超过12万笔。这个数字,差不多相当于山西阳泉整个市所有城商行一个月的个人转账交易总量。很多用户骂,转个账还要等半天,你是防骗子还是防我?

原来大家都陷入了一个死循环:要精度就得堆算力,堆算力就得涨成本,涨成本大家就用不起,用不起就只能砍精度,砍精度就防不住伪造。

病毒和抗生素永远追不完的竞赛

说实话,国内现在技术路线掰得很厉害,一派往云端大模型堆参数冲精度,一派往端侧小模型砍成本换规模。本质上,这场竞争就是一场病毒和抗生素的竞赛——深度伪造就是不断变异的病毒,鉴伪就是跟着升级的抗生素,永远追在屁股后面跑,永远不可能把所有病毒全杀光。

本土玩家科大讯飞去年推出的生成式鉴伪大模型,在公开测试集上准确率做到了99.3%,比五年前的传统方法高了12个点,看起来很漂亮对不对?但是,单路16k音频实时鉴伪的推理成本,是端侧小模型的6.8倍,差不多是你每识别一小时音频,就要花掉三块二毛钱。很多中小内容平台一天要处理几百万小时的用户上传音频,算下来一天就是上百万,一年三个多亿,哪个平台扛得住?

另一个本土玩家硅基智能,去年推出的轻量端侧鉴伪模型,把单小时成本压到了两毛五,看起来很美好对不对?但是准确率直接掉到了91%,遇到经过微信压缩传输的语音,准确率直接掉到84%。相当于每六段语音就错一段,骗子只要把伪造语音走一遍微信传输,就能直接绕开鉴伪,百试百灵。

国内主流音频鉴伪模型成本准确率对比折线图
国内主流音频鉴伪模型成本准确率对比折线图

这个方向我认为走偏了。所有人都在卷实验室测试集的准确率刷榜拿融资,没人愿意蹲下来啃实际场景的成本问题。大家都拿无压缩的高清语音测数据,转头到真实的互联网场景,一堆经过压缩、降噪、剪辑的语音进来,准确率直接跳水十个点都不止。

不过话说回来,怪创业者吗?资本就爱看榜上好数据,谁管你实际用起来贵不贵啊。客户也说我要最便宜的能用就行,真出了问题,我也只是要个“我已经做了鉴伪”的挡箭牌,真要花大价钱买高精度,没人愿意掏腰包。

产业链每个环节都在重新分钱

产业链每个环节都在重新分钱
产业链每个环节都在重新分钱

你别以为这个事只是大公司和骗子的博弈,普通从业者早就被波及了。

做反诈的基层民警,原来一天人工核查十来条语音诈骗线索,现在用自动鉴伪,一天能核查三百多条,工作量轻了不是一点半点。但是呢,每个月总有十多八个误判,把山区信号不好压缩变形的真人语音当成AI伪造,错过出警最佳时间,被群众投诉,锅还是民警自己背。

做内容审核的小编,原来要逐句听录音判断是不是AI伪造,现在系统自动标红,看起来省事儿。但是一旦系统标错,把真人小主播的内容误判成AI伪造下架,你就得加班给人申诉,错得多了,KPI直接扣没,连全勤奖都拿不到。

整个产业链的奶酪早就被重新切了。原来做语音数据采集的小公司,前两年还在亏房租,今年靠原生水印生意直接活过来了——就是在真人语音采集的时候,就嵌入人耳听不到的原生印记,AI生成的语音没有这个印记,一下子就能区分开。现在国内做语音AI训练的公司,一千条训练语音加水印收五十块,广州有家原来快倒闭的小数据公司,今年靠水印生意营收翻了四倍,老板都换了奔驰GLE。

反过来,原来做第三方语音真伪鉴定的机构,帮被人造谣的主播出鉴定报告,一份收三五万,现在平台自带免费鉴伪,生意直接砍了六成,很多小机构都关门跑路了。

对普通用户来说,哪怕你天天用带鉴伪的社交软件,接到朋友语音说要借钱,第一反应还是会犯嘀咕——这会不会是AI做的?信任感的缺口,不是砸多少技术就能填上的。

那些天天喊着要加大技术投入突破鉴伪瓶颈的人,你说,到底是真的想解决深度伪造的问题,还是想靠着这场永远追不完的竞赛,一直赚持续投入的钱呢?

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:音频大模型深度伪造语音鉴伪:不是技术问题,是成本问题
文章链接:https://lfdjt.com/info_23_15628.html