你刷的每一条推荐背后,大模型算法到底在想什么

上周在老门东喝咖啡,邻座两个学生聊AI,一口一个大模型,说到算法的时候,其中一个挥挥手说「不就是堆参数吗,有啥好说的」。 我一口拿铁差点喷出来。 合着现在大家都觉得大模型算法就是砸钱砸芯片,拼参数数量?

别扯参数,大模型算法本质是猜下一个字

你跟GPT说帮你写一封给导师的请假条,输入到「尊敬的张」,你猜它第一个蹦出来的字是什么? 大概率是「导」对吧?因为它见过几百万上千万封请假条,「尊敬的张」后面跟着「导」的概率最高。 大模型算法干的所有事儿,拆到最后就是这么一件事:根据你已经输入的内容,猜概率最高的下一个内容,可能是字,可能是词,也可能是图片的一块像素。
大模型自回归生成下一个字概率分布图
大模型自回归生成下一个字概率分布图
很多人说这是黑魔法,说它居然能写代码能讲题能编故事,核心逻辑居然简单到初中生都能听懂。 说实话,我第一次搞明白这个核心的时候,愣了好几分钟。原来折腾这么多年,把业界搅得天翻地覆的大模型,本质就是个特别会猜的「复读机」? 不对,不是复读机,是规律提炼器。 之前几十年做语言模型,都是工程师给规则,比如翻译要对应主谓宾,做摘要要抽关键词,还要雇一堆人标数据,一个模型改大半年效果还烂。 大模型不一样。它直接把互联网上能拿到的所有文字、图片、视频一股脑吞进去,自己算,自己摸,摸到的规律就藏在那上千亿的参数里,你要它输出,它就一个字一个字给你猜出来。 你看到的流畅对话,其实是几百几千次概率选择拼出来的结果。就像你搭乐高,一块一块拼,最后拼出一整栋房子,每一块单独看没什么,拼在一起就吓死人。

三个很多人都信的大模型算法误区

第一个误区:大模型把所有知识都背下来了。 不对,真不对。大模型从来不是存储了一本百科全书,它存的是文字和内容的规律。 你问它南京有多少家鸭子店,它能给你说的头头是道,但数字大概率是错的,因为它根本没存这个数字,它只是根据你说的话,猜出来下一个听起来合理的数字而已。 它甚至记不住自己上一秒说过什么,每说一个新字,都要重新把之前说的所有话再算一遍,你说扯不扯? 第二个误区:大模型算法就是拼钱堆参数,参数越大算法越好。 参数堆出来的不叫好的大模型算法,只会堆参数那叫拼土豪。 十几年前大家就想做大模型,那时候钱也不少,芯片也有,为什么做不出来?因为没有好的算法结构。之前用循环神经网络处理长文本,说一半前面的内容就忘了,根本没法生成长文章。 直到Transformer出来,搞了个注意力机制,让模型只关注当前有用的内容,一下子就把问题解决了,才有了后来这一波大模型热潮。
Transformer模型注意力机制权重热图
Transformer模型注意力机制权重热图
现在很多小参数模型,算法优化做的好,效果比大它好几倍的旧模型还好,不信你去试试那些开源的7B模型,好多日常用的场景,比之前的千亿模型还顺手。 钱是加分项,不是决定性的,算法设计才是。 第三个误区:大模型算法是大厂的游戏,普通人碰都碰不到。 放在五年前可能是这样,现在真不是。 现在开源的大模型一抓一大把,你只要有个带十几G显存的游戏显卡,就能下载一个跑起来,改改算法参数,就能做一个自己用的垂直小模型,比如专门整理你读书笔记的,专门帮你改毕业论文病句的。 哪有那么高的门槛?只不过大家被大厂的宣传吓住了而已。

大模型算法接下来会往哪儿走?

大模型算法接下来会往哪儿走?
大模型算法接下来会往哪儿走?
现在最火的方向肯定是多模态,就是不光猜字,还能猜图片猜视频猜音频,你给它一张图,它能顺着你的思路接着往下画,你给它半首歌,它能帮你把剩下的写完,这个其实就是把猜下一个字的逻辑,套到其他内容类型上而已,核心逻辑没变,只是算法适配了更多数据类型。 不过话说回来,现在大模型算法最大的痛点还是老问题:爱胡说八道。 为什么会这样?根源还是它本质是猜概率,不是讲逻辑。它只管下一个字对不对,不管整段话逻辑通不通,所以经常说出来前言不搭后语,甚至一本正经的编错数据。 现在很多研究都在往推理方向走,就是让大模型不光会猜字,还会一步一步想问题。我前阵子试了个刚出来的推理增强模型,让它解高中的几何题,居然能一步一步说清楚辅助线该怎么画,哪条边和哪条边相等,最后算出正确答案,当时真的惊到我了。 放在三年前,谁敢想一个模型能解几何题? 现在网上好多人喊大模型要取代人类,我就觉得特别扯。它就是一个把猜字做到极致的工具啊,你让它帮你写初稿,帮你搜信息,帮你整理思路,太好用了,但是真要做决定,真要搞创造,那还是得人来。 好多创业者一窝蜂挤着去做通用大模型,其实真没必要,沉下心到某个小领域,把大模型算法改一改,适配一下领域数据,解决点实际问题,比做个空架子的通用模型有用多了。 我上周见一个做汽修的朋友,他找了个开源大模型,喂了十几万页的修理厂维修手册和故障案例,改了改算法,现在修车师傅碰到疑难杂症,拍个照说两句故障,模型就能把可能的问题列出来,比找老师傅问方便太多,这不就是好的应用? 说起来也有意思,十几年前大家聊搜索引擎算法,都说那玩意儿太黑箱,普通人根本搞不懂,再过十年,说不定大模型算法也会变成像搜索引擎一样,大家天天用,但是没人会天天大惊小怪讨论它了。 未来能变成什么样? 谁知道呢,走着瞧呗。

作者|科技

排版|科技

审核|知知

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:你刷的每一条推荐背后,大模型算法到底在想什么
文章链接:https://m.lfdjt.com/p/keji/a/3607.html