9月23日逛南京博物院,我重新认识了多模态大模型

9月23号,我在南京。赶了半个月的稿子,肩膀僵得抬不起来,索性逃出来逛南博。本来只想在民国馆吹吹空调看老物件,顺道试了下刚更新的多模态大模型。掏出手机,随手拍了展柜里一块蒙着薄玻璃的银怀表。本来没抱期望,觉得AI顶多给我念一遍说明牌上的字:‘民国银怀表,19XX年入藏’。 结果它对着怀表边缘那行模糊得几乎看不清的刻字识别了半秒,跟我说:‘刻字是“赠佩弦先生”,朱自清字佩弦,他抗战期间曾在南京任教,这大概率是当年友人赠给他的纪念品。’ 我当场鸡皮疙瘩起来了。

别背百科定义了,它核心是学会了跨信息联想

很多人聊起多模态大模型,第一反应就是“哦,不就是既能看图片又能听语音吗”。 不对。 很早之前的AI就能分别识别图片和语音了,但那是把不同类型的信息当成完全独立的任务处理。识别图片的模块只管说这是什么东西,识别文字的模块只管认上面写了什么,各干各的,互不交叉。 真的多模态大模型不一样。它能把图片里的纹理、文字、背景,甚至你提问里的语气,所有不同类型的信息揉到一块,读懂背后的关联。 就说这块怀表,它不是分开输出“这是银制怀表”“刻字内容是赠佩弦先生”两个结果就完了。它自动把刻字内容和人物字号、人物行迹这些文字信息串起来,给了你一个超出说明牌的答案。
多模态大模型跨信息关联推理示意图
多模态大模型跨信息关联推理示意图
说实话,我之前也觉得这就是厂商炒冷饭,把OCR加语音识别打包换个名字割韭菜。直到这次试了才懂差距。 你拿一张拍糊了的半张老照片,边上沾了半行手写批注,右下角还有一点模糊的日期印记。原来的AI会告诉你,OCR识别出什么字,图片里有几个人,就结束了。 多模态会把这些碎片全拼起来,告诉你这大概率是哪年哪所学校的毕业合影,背景里那半个模糊的招牌是当年上海哪条街上的照相馆。 这才是“多模态”这三个字真正的意思。它不是多会了一种功能,是整个思考方式变了。

普通人接触它,最容易掉进去的误区

最常见的一个误区,是觉得它什么都能看懂。 其实真不是。它能看懂,是因为训练的时候见过太多类似的信息,能串起来。你拍一张你奶奶五十年代织的老毛衣,领口有你奶奶自己绣的专属记号,它肯定说不出来这个记号代表什么,因为从来没人把这个信息放到它能学到的地方。它只能告诉你这是一件毛衣,材质是棉。 就这么简单。 还有一个误区,是默认它输出的内容全都是对的。它串信息串得越顺,错得越离谱你越容易信。 上个月我一个玩文玩的朋友,拿了块自己捡的清代瓷片拍给多模态大模型看。底款的字烧糊了一半,它认错了一个字,硬说这是雍正官窑出的青花,还顺带着串了一堆雍正官窑的特征,说得有鼻子有眼,差点把我朋友忽悠住,真以为捡了大漏,差点拿去给人估价。 你说坑不坑。
普通用户使用多模态大模型实拍场景
普通用户使用多模态大模型实拍场景
还有一个很多人跳不出来的误区,是想用它完全替代自己的创作和判断。 很多人现在做设计写文案,全扔给多模态,从找参考到出初稿全让AI干。出来的东西四平八稳,就是没一点自己的味道。你想做一本记录自己家故事的绘本,它能帮你搭框架出线稿,但你小时候爬树摔在麦田里沾的那个鞋印,你奶奶给你缝的书包上歪歪扭扭的扣子,这种只有你知道的细节,它根本出不来。

它未来不会取代谁,只会慢慢融进日常里

它未来不会取代谁,只会慢慢融进日常里
它未来不会取代谁,只会慢慢融进日常里
现在网上吵来吵去,说多模态会淘汰纯文本大模型,会取代设计师取代导游,我觉得都是瞎扯。 它真正的用处,根本不是抢谁的饭碗,是帮你把原来那些麻烦的事变简单,把原来拼不起来的细碎信息拼起来。 以后你带孩子逛动物园,孩子指着远处树上的鸟问你这是什么,你掏手机拍一下,它直接告诉你这是什么鸟,习性是什么,比你翻半小时百科快多了。你家里装修装衣柜,对着说明书看不懂零件位置,拍个照,它直接给你圈出来哪个零件装错了,比你打电话问客服效率高十倍。 我自己最期待的场景,是以后整理家里的旧箱子,翻出来几十张没落款没日期的老照片,不知道都是谁,在哪拍的。多模态能帮你把照片里的街景、服饰、背景里的报纸标题都认出来,帮你把那些断了的记忆一块一块拼起来。 这种小事,原来没人能帮你做,现在多模态能。 不过话说回来,发展太快也有麻烦。它能随便认人认地点,隐私边界在哪?博物馆里的未公开文物,拍一张传上去,信息安全谁来管?这些问题现在都还没答案。 但那天从南博出来,我在街口找了个小馆子吃鸭血粉丝汤,吹着风想起那块怀表,突然觉得,原来AI真的不是飘在天上的概念,不是厂商PPT里的参数,它真的能落到你生活里那些细碎的、没人帮你解决的小事上。 你不用赶着跟风吹它,也不用怕它会取代你。抽十分钟自己找个能用的版本试一次,你就知道它到底是什么了。对吧?

作者|科技

排版|科技

审核|乐乐

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:9月23日逛南京博物院,我重新认识了多模态大模型
文章链接:https://m.lfdjt.com/p/keji/a/6208.html