BERT:改变NLP的底层基础设施,为何仍在等待杀手级应用

你每天用的搜索引擎、输入法推荐、内容推荐流,底层都跑着同一个模型。很多人追着GPT、Sora的热点跑,却忘了,2018年谷歌放出的那个叫BERT的模型,才真正把自然语言处理从“凑效果”拉到了“能用”的阶段。

打破单向枷锁:BERT的核心改变到底是什么

在BERT出来之前,NLP圈其实过得挺憋屈。预训练模型要么是从左往右读,像最早的GPT,要么是从右往左读,最多把两个方向的结果拼一拼,本质还是没搞懂完整的上下文。举个例子,“我把苹果放在桌子上”和“我买了苹果手机”,同一个词,不同意思,原来的模型很难靠上下文区分对不对? BERT改了规则。它用了一个叫Masked Language Model(掩码语言模型)的训练方式,说白了就是完形填空:训练的时候随机把句子里15%的词挡住,让模型根据挡住词左右两边的所有上下文去猜这个词是什么。逼得模型必须真的读懂整句话的语义,而不是只看半边。
BERT与传统NLP模型预训练原理对比图
BERT与传统NLP模型预训练原理对比图
它用的是Transformer的纯编码器架构,天生就能捕捉长文本里的长依赖关系,原来RNN处理几百词的文章就忘了开头讲了啥,BERT能轻轻松松搞定几千词的文档。刚放出来的时候,直接横扫了11项NLP通用基准任务,GLUE榜单得分直接涨了7个多百分点,整个学术界都被打懵了。说实话,那时候没人会怀疑,NLP的新时代真的来了。

从学术刷榜到产业渗透:BERT已经撑住了半个AI生态

五年过去了,BERT早就走出实验室了。现在全球头部搜索引擎的语义排序,全换了基于BERT的架构,原来搜索引擎只能匹配你输入的关键词,现在它能真的读懂你问的问题到底是什么意思。比如你搜“怎么关掉手机自动锁屏”,原来会给你一堆讲手机锁屏是什么的内容,现在能直接给你找到步骤,核心就是BERT的语义理解能力。 国内的互联网厂商也早用上了。微信公众号的内容标签分类、抖音的违规内容审核、电商平台的智能客服,背后全是微调过的BERT模型。原来客服机器人碰到你绕弯子的长问题,比如“我上个月买的鞋子没发货,我申请了退款之后它又发来了,我退回去还要我出运费吗”,直接傻掉答非所问,现在BERT能轻轻松松拆解你句子里的逻辑关系,给出准确的回答。
BERT在互联网产业落地场景分布图
BERT在互联网产业落地场景分布图
不过话说回来,原生BERT真的太贵了。base版本都有1.1亿参数,large版本更是到了3亿多,别说端侧部署,就算跑在服务器上,推理速度也慢得够你喝一壶。后来学术界和产业界一起搞了一堆轻量化改造,蒸馏、量化、剪枝,出来的DistilBERT参数砍一半,速度翻一倍,效果只掉了不到1%,才真的让BERT能跑到手机APP、智能音箱这些端侧设备里。现在随便一个小创业公司做AI产品,都能直接拿开源的轻量BERT权重微调,成本比五年前降了至少一个数量级。

看不见的瓶颈:BERT远不是完美的终点

看不见的瓶颈:BERT远不是完美的终点
看不见的瓶颈:BERT远不是完美的终点
现在很多公司不管什么场景,都要把BERT搬出来,好像不用BERT就是技术落后,其实挺扯的。BERT本身有一堆绕不开的问题。 首先,它还是太依赖数据了。就算是预训练好的通用BERT,要用到垂直领域,还是需要大量标注数据做微调。比如做医疗领域的病历分类,要训一个能用的医疗BERT,没个几十万标注好的病历根本出不来,中小医院根本玩不起。其次,BERT真的“懂”语言吗?其实它还是在统计上下文的词共现概率,根本没有建立真正的逻辑推理能力。你换个绕一点的问题,它立刻就错。比如“杯子放在盒子里,桌子在杯子下面,什么在杯子上面?”很多训练好的BERT都会答错,本质就是它只会匹配,不会推理。 还有偏见问题。BERT的预训练数据来自公开网络,网络上什么垃圾都有,性别偏见、职业偏见、地域歧视,BERT全都学进去了。之前有研究做过测试,BERT会默认“程序员”是男性,“保姆”是女性,把这种带偏见的模型用到招聘AI筛选简历里,就是实打实的歧视,这个问题到现在都没有完美的解决方案。

未来三年:BERT会变成看不见的基础设施

未来三年:BERT会变成看不见的基础设施
未来三年:BERT会变成看不见的基础设施
现在GPT火得一塌糊涂,很多人说BERT已经过时了,被生成式大模型替代了。我反而不这么看。BERT是天生的理解型模型,GPT是天生的生成型模型,很多场景根本不需要生成,只需要做语义理解、分类、排序,BERT比大模型便宜几十上百倍,效果还不见得差,怎么会被替代? 反而,现在的生成式大模型,其实也吸收了BERT双向预训练的思路,不是完全推翻重来。未来三到五年,BERT会慢慢变成像水电煤一样的底层基础设施,没人会天天拿它出来吹,但所有人都在用。它会进一步轻量化,越来越多适配端侧的小BERT会出来,满足隐私计算场景下数据不出本地的需求,手机输入法、本地AI助手这些场景,端侧小BERT的需求会爆涨。 垂直领域的定制BERT也会越来越成熟,医疗、法律、金融每个赛道都会有预训练好的通用领域BERT,小公司不用自己训,拿过来直接用,门槛会进一步降低。当然,治理也会跟上,未来针对预训练模型的偏见审核、合规要求出台,BERT这种通用基础模型肯定是第一个被规范的对象。 说白了,技术圈从来不缺追热点的人,今天吹GPT明天吹Sora,但是真正改变产业的技术,往往都是这样悄悄沉在底层,不声不响改了所有产品的体验。BERT就是这样的技术,它没有chatbot那样炫酷的演示效果,却真的把NLP拖进了新时代。

作者|大讲堂

排版|大讲堂

审核|小准

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:BERT:改变NLP的底层基础设施,为何仍在等待杀手级应用
文章链接:https://m.lfdjt.com/info_23_23534.html