音频大模型深度伪造语音鉴伪:不是技术问题,是信任问题

开春那盆带AI味儿的泼天祸水

2026年开春,A股刚走出一波开门红,就爆了个大新闻。闽系那家刚谈妥千亿债务展期的房企,一段1分27秒的老板录音突然流出来,内容扎心:核心资产早就转去海外了,国内的债能拖就拖。

半天时间,股价直接封死跌停,32亿市值蒸发,很多刚抄底的散户哭都找不到地方。最后官方报警,三天才出结果:这声音是骗子拿最新开源音频大模型克隆的,连老板去年喉炎手术后留下的沙哑感都还原了,普通人根本听不出来。

2026年A股房企深度伪造语音事件股价走势图
2026年A股房企深度伪造语音事件股价走势图

这事不是孤例。去年国内反诈中心公开的数据里,利用音频大模型深度伪造作案的诈骗案,比2023年翻了11倍,单笔最高被骗了2000万,是一个上市公司CEO被克隆了董事长的声音,转走了项目款。

原来大家聊AI语音克隆,都是当猎奇新闻看,说什么以后可以替自己直播唱歌。现在刀架脖子上才发现,鉴伪根本不是实验室里的灌水课题,是整个社会都要补的课。

很多人说现在AI技术太牛了,鉴伪追不上。说实话,真不是技术追不上,是方向走错了。

赛道分叉,谁在卷错方向

现在国内做音频大模型深度伪造语音鉴伪的,分两派,打得不可开交。一派是互联网大厂的安全部门,比如腾讯安全,走的是「模型斗模型」路线,训练专门的鉴伪大模型,专门抓AI生成语音里的统计痕迹。另一派是语音原生玩家,比如思必驰,推的是原生水印路线,在生成语音的时候就嵌进去人耳听不到的数字水印,不管怎么转码压缩都能查出来。

这里头的商业模式博弈很有意思。模型斗模型是事后鉴伪,不用改现有的音频传输链路,平台接入快,拿融资讲故事也方便,毕竟能刷实验室准确率。原生水印要改生成、传输、存储全链路,动了很多人的蛋糕,推广慢,不讨资本喜欢。

音频大模型伪造与鉴伪对抗演进流程图
音频大模型伪造与鉴伪对抗演进流程图

给你两个真实的数据你就懂了。现在训练一次能对抗最新开源语音大模型的顶级鉴伪模型,单次训练成本超过1100万,相当于长三角一个一千户规模的中型小区一年的物业费总营收,烧钱速度远超一般创业公司能承受的范围。第二个数据,今年1月国内反诈联盟测了市面上17款主流公开鉴伪工具,对微信语音这类经过三次转码压缩的低码率音频,平均检出率不到63%,比银行十年前用的传统声纹核验准确率还低18个百分点。

这不就是生物学里说的红皇后效应么?你必须拼尽全力不停奔跑,才能留在原地。伪造技术每个月更一个新版本,今天你训练的模型能把昨天的伪造揪出来99%,明天人家新模型一出,你的准确率直接掉二十个点,又得重新烧钱训练,永远追在屁股后面吃灰。

现在整个赛道都在卷实验室的准确率榜,谁刷到99%谁就是老大,拿大钱。但真正落地需要解决的低码率压缩、对抗性微调伪造这些问题,没人愿意啃硬骨头。说白了,大家都选了容易走的路,把难的问题留给了下游买单的人。这个方向我认为走偏了。

每个普通人都要掏的隐形成本

每个普通人都要掏的隐形成本
每个普通人都要掏的隐形成本

别觉得这事离你远,现在产业链上每个环节都已经被倒逼了。

我上个月跟一个城商行科技部的老朋友吃饭,他说他们行年初已经全停了语音身份核验业务,原来靠声纹做电话改密码、远程开户,每年能省两千多万的人工成本,现在出了两起伪造骗贷的案子,直接全砍了,所有远程身份核验都改成人脸+人工复核,原来省的钱全吐回去不说,用户体验还崩了,投诉量涨了三倍。

还有做内容的声优、配音UP主,现在随便一个人花几十块钱就能克隆你的声音,拿去配色情广告、赌博引流,你维权都找不到头。去年B站有个百万粉的配音UP主,就遇到这事,自己账号被封,折腾了三个月才拿出鉴伪报告解封,人瘦了快十斤,流量掉了一半,根本补不回来。

现在已经有专门做第三方语音鉴伪的SaaS服务商,给金融、互联网平台按调用次数收费,一次一块二,比一条国际短信还贵,但是人家平台都愿意掏这个钱,因为出一次事就是几百万上千万的损失,掏一块二买平安,怎么算都值。说白了,原来不存在的鉴伪成本,现在已经变成了所有语音相关业务的固定隐形成本。

你用微信发语音,你打视频电话,你在直播间说话,未来每一段公开传播的语音,都要多这么一块成本。最后这笔钱会摊到谁头上?

当整个社会的语音信任都要靠付费鉴伪来维持,没有钱买单的中小机构和普通人,要拿什么保护自己?

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:音频大模型深度伪造语音鉴伪:不是技术问题,是信任问题
文章链接:https://m.lfdjt.com/info_23_18590.html