多模态大模型:风口之下,产业落地还差哪一步

去年OpenAI放出GPT-4V的时候,整个科技圈都炸了。 原来大模型只能在文字的世界里打转,写写文案答答题,现在突然能看能听能说,能读懂你拍的照片,能看懂复杂的工程图纸,还能对着你的手写草稿直接整理出正式报告。这不就是往通用人工智能走的那关键一步吗?

别被名词忽悠:真多模态和假多模态根本不是一回事

很多人一听多模态就觉得玄乎,说白了就是让大模型能同时处理不同格式的信息——文字、图像、音频、视频、3D点云,都能喂进去,输出统一逻辑的结果。 核心原理说穿了也不复杂,就是把不同类型的信息,都映射到同一个语义空间里对齐。说白了就是让模型知道,文字里写的“苹果”,和图片里的苹果,是人嘴里说出来的“píng guǒ”,是同一个东西。
多模态大模型语义空间对齐原理示意图
多模态大模型语义空间对齐原理示意图
但这里坑太多了。市面上百分之七八十号称多模态的模型,都是假多模态。说白了就是把几个单模态模型拼在一起:先拿图像识别模型把图转成文字,再把文字丢给文字大模型输出结果,本质还是单模态在干活,多模态只是个壳。 骗投资人钱的不在少数。 真多模态的核心难点,至今都没完全攻克。就是对齐精度。你让它数一张图里有几个散放的玻璃球,它大概率数错。你给它一张带密密麻麻标注的建筑施工图,它能给你看错好几个尺寸。现在能做到跨模态深度理解的,掰着手指头也就那么几家,绝大多数都还在凑数。

产业落地:已经跑通的真场景,和绕不开的真障碍

说实话,我接触下来,现在多模态大模型跑得最快的落地,根本不是大家天天说的To C聊天,是To B的垂直场景。 珠三角有家做消费电子PCB板的工厂,我去年年底跟他们聊过,原来每条产线要配8个熟手品检,一天盯十几个小时,眼睛都看花,漏检率还一直降不下去。现在他们用微调过的垂直多模态大模型,把过去十年的缺陷板图像、质检标准文本、不良品案例全部喂进去,模型直接看摄像头拍的板,识别缺陷的准确率比老工人还高5个点,每条线的人力直接砍了三分之二,漏检率降了快七成。 还有医疗领域,基层医院缺好的放射科医生,现在把多模态模型调好,对着CT影像、过往病例、临床数据一起分析,能给基层医生出初步的诊断提示,大大降低了漏诊误诊的概率。虽然不能直接当最终结论,但已经解决了大问题。 To C也有能用的,现在很多做短视频的小博主,直接把文字脚本丢给多模态工具,自动生成带画面、配音、字幕的粗剪视频,改改就能发,一天更三条都不累,原来要两三个人干的活,现在一个人搞定。
多模态大模型工业PCB缺陷质检场景图
多模态大模型工业PCB缺陷质检场景图
不过话说回来,落地的障碍比你想的多。 第一个是数据成本。要做一个能用的行业多模态模型,得攒几十万张标注好的跨模态数据,一张工业缺陷图的标注成本就要几十块,十万张就是几百万,中小厂根本掏不起这个钱。 第二个还是老问题:幻觉。文字大模型幻觉是说错知识点,多模态大模型幻觉是看错信息,把合格的零件看成缺陷,把CT上的结节看成肿瘤,放到真实产业里,那就是要出事故的。 现在很多场景,只能做辅助,不能做最终决策,这就限制了它的大规模替代。

野蛮生长之后,绕不开的治理考题

野蛮生长之后,绕不开的治理考题
野蛮生长之后,绕不开的治理考题
多模态大模型带来的风险,比单模态大太多了。 最直接的就是深度伪造。原来做一个以假乱真的假视频要花好几天,现在多模态模型几分钟就能做出来,声音、表情、动作全对,普通人根本分不出来。现在已经有诈骗分子用这个做假视频骗钱,拿受害者亲戚的朋友圈照片,拼出一个视频找你借钱,你防得住吗? 然后是版权问题。训练多模态大模型要吃多少网上的图片、音频、插画?这些内容的版权是谁的?现在已经有画师群体集体起诉AI训练侵权了,未来三五年,这类官司会打一大堆,规则怎么定,现在谁都说不准。 还有隐私问题。你给多模态大模型传你的身份证照片、体检报告、家庭住址,这些数据都会被模型学习,会不会泄露?会不会被拿去做别的用途?现在很多厂商都没说清楚。 现在全球都在摸索多模态的监管规则,它能处理的信息类型太多了,比单模态难管太多,这道题,没有现成答案。 最后说说未来三五年的判断。 通用多模态大模型只会掌握在少数几家头部科技公司手里,绝大多数玩家的机会,都在垂直行业多模态。拿基础大模型做行业微调,解决一个具体场景的问题,这才是能赚到钱的路子,乱挤通用大模型的风口,死的会很快。 其次,端侧多模态会起来。现在大模型都跑在云端,未来三五年,小尺寸的多模态大模型会跑在手机、汽车、工业设备上,你拍个路边的植物,不用传云端,手机直接就能识别,隐私性更好,速度也更快。 别信那些吹三五年就出通用人工智能的鬼话。但三五年内,多模态大模型会在至少三成的垂直行业里,真真正正替代掉一批重复性的劳动——初级品检、初级内容创作、初级客服,这些岗位会加速升级或者淘汰。 风口吹得再大,也得落地才能变成真的改变。多模态确实打开了AI走进真实世界的大门,这一步跨出去,就回不来了。只是谁能最后拿到票,还得走着瞧。

作者|大讲堂

排版|大讲堂

审核|知知

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:多模态大模型:风口之下,产业落地还差哪一步
文章链接:https://m.lfdjt.com/info_23_23627.html