2026-10-07 00:31:54
作者:
科技
上周路过设计师朋友的工作室,推门进去撞见他对着一张皱巴巴的手绘草稿发呆。不是改不出来方案,是刚跟AI说完要求,等输出呢。不到一分钟,三张不同风格的奶茶店门头图蹦出来,暖色调,加了桂花枝,连黄昏光影的感觉都对上了。放在五年前,这流程得手绘扫描→描线→找素材→调色彩,最少大半天。现在呢?一杯咖啡还没喝完,方案就能发给客户选。这就是多模态大模型最实在的改变,不是论文里的黑科技,是真的已经跑到你我身边干活了。
你早就用过它,只是没叫出这个名字
很多人一听到“多模态”四个字就犯晕,觉得是刚出来的高科技,跟自己没关系。其实你刷短视频的时候,平台自动给你配上的字幕,就是多模态的小应用呀。它得先听懂语音,再转成文字,还要对应上画面的时间轴,这就是把语音和文字两种模态结合起来了。你发一张路边拍的花给AI,问它这是什么品种,AI能说出来,这也是多模态。
原来的AI大多是偏科生。只会聊天的大模型,看不懂你发的图。只会修图的AI,听不懂你说的自然语言要求。要干个跨领域的活,你得倒好几个软件,导来导去折腾半天。
多模态大模型不一样,它从训练开始,就把文字、图片、音频、视频这些不同类型的信息混在一起学了。它能同时看懂你发的图,听懂你说的话,还能给你输出文字、图片甚至视频。说白了,原来AI是只能接一种货的加工厂,现在它能同时收不同原材料,还能出不同的成品。对吧?
单模态AI与多模态AI信息处理对比示意图
别被营销吹晕了,它现在还挺笨的
现在打开科技圈的内容,十篇有八篇说多模态大模型无所不能,好像明天就能取代所有人干活了。说实话,我玩过不下五款主流的多模态产品,它的笨,真的随处可见。
上个月我拿一道带几何图的初中数学题试手,题目里画的辅助线是虚线,它愣是把虚线当成了题目给的边长,算出来的结果错得离谱。你拿一张蹲在草地上的猫的照片,让它数清楚猫露出来的胡须有几根,十个有九个算不对。甚至你给它一张写了字的便签纸,字写得稍微潦草一点,它都能认错好几个。
很多人会觉得,AI不是看图吗?怎么连这个都错。它可不是真的像人一样“看见”了图哦。它是把整张图拆成了一堆像素信息,再跟自己训练过的文字知识拼在一起,拼对了就对,拼错了直接露馅。遇到空间关系复杂,或者细节多的内容,它就抓瞎。
我还试过拿一段两个人的合唱录音,让它把两个人的歌词分开整理,结果它把两个人的句子混得一塌糊涂,根本没法看。不过话说回来,这也正常,本来它就是个新生玩意,哪能一下子就完美。
多模态大模型识别几何题错误案例
真正的改变,从来不是AI变完美,是我们的干活方式变了
真正的改变,从来不是AI变完美,是我们的干活方式变了
虽然有一堆缺点,但它带来的变化已经实实在在了。我那个设计师朋友,原来每天一半的时间都在改客户的初稿需求,客户说”我要暖一点””我要活泼一点”,他得改完发过去不对再改,现在客户说要啥,他直接让AI出三五版初稿,客户选完他再细调,一天能多接两个活,剩下的时间还能去喝个茶。
做新媒体的朋友跟我说,现在找素材剪视频,原来得对着几个小时的原录像一点点拖进度条找高光,现在把原素材丢给多模态,说清楚要剪一个30秒的朋友圈版,要突出抽奖的高光片段,配轻快的BGM,字幕要大一点,十几分钟就出初稿,他只要微调就行。节省出来的时间,全部用来想内容创意了。
很多人说那设计师剪辑师会不会失业?我倒觉得不会。原来Photoshop出来的时候,一堆人说画家设计师要失业,现在呢?手绘的设计师照样吃香,PS只是把原来抠图填色的重复活干了,让人把时间花在更值钱的创意上。
多模态也是一样的。它解决的是”从无到有出初稿”的重复劳动,真正拍板的创意,贴合用户需求的调整,还是得人来。
现在还有一堆公司蹭概念,把原来几个单模态模型拼在一起,就敢叫自己多模态大模型割韭菜,你用的时候一塌糊涂,就觉得都是骗人的。其实真的多模态,和拼出来的假货区别很大,真的能读懂你话里和图里结合的要求,假货就只会各干各的,拼出来的结果驴唇不对马嘴。别交这个智商税就行。
你不用抱着一本厚书去啃多模态的原理,也不用记那些动辄几千亿的参数,对你我来说,找个正经的产品试一次就懂了。对着你随手画的草稿,说一句你想要的效果,等几十秒,你就会发现。这一次,AI真的不再是那个只会陪你聊天的工具了。它真的能帮你干活了。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:多模态大模型:它不是只会聊天的新玩具
文章链接:https://m.lfdjt.com/p/keji/a/7251.html