Transformer:不只是“注意力”,是数学暴力美学
说实话,第一次看到Transformer的架构图,我笑了——这不就是把一堆全连接层叠起来,然后搞了个叫自注意力的玩意儿?能有多神?后来跑了个文本分类,准确率直接秒了LSTM将近8个点。 我闭嘴了。自注意力(Self-Attention)的本质其实非常粗暴:序列中每个词都要和其他所有词“算账”,算出它们之间的相关性权重。Q、K、V这三个矩阵,就是这场算账的主角。Q(Query):“我是谁,我要查什么?”;K(Key):“我是标签,你可以查我”;V(Value):“查到了?好,这是我的实际信息”。点积、缩放、Softmax,三部曲下来,每个词都形成一个全新的上下文感知表示。
Scaling Law:砸钱,砸出智能?这账算得我后背发凉
OpenAI那篇著名的Scaling Law论文丢出来的时候,我盯着曲线看了足足十分钟——模型性能与计算量、数据集大小、参数量呈现平滑的幂律关系。 这意味着什么?意味着只要足够有钱,智能就能被“制造”出来。GPT-2有15亿参数,在语言建模上已经挺惊艳;GPT-3飙到1750亿,突然就能做算术、翻译、甚至写代码了。这不是量变,是某种能力涌现。但代价呢?GPT-3一次训练的成本大概在460万美金左右,碳排放相当于一辆汽车跑70万公里。 我亲自测试过几个不同规模的模型,在SuperGLUE基准上,T5-Small(6000万参数)只有72.3分,T5-11B直接跳到了89.3——人类基准也就89.8。可是11B模型的显存需求,单卡V100根本塞不下,得切模型并行。更别提后来的PaLM、GPT-4了。
落地第一坑:推理延迟,每秒生成3个token?用户会砸键盘

落地第二坑:幻觉,一本正经地胡说八道,害死人不偿命
有次我们一个内部医疗咨询原型,问“糖尿病患者能不能吃葡萄”,模型煞有介事地引了一堆文献编号,说能,还给了份量。查了才知道,那些文献全是不存在的。这叫幻觉(Hallucination)。本质原因是模型被训练成最大化概率的文本生成器,而不是事实核查器。它在知识边界上选择“编”。解决办法:RAG(检索增强生成)。 把外部知识库向量化,提问时先召回相关段落,塞进提示里。但这又引发新问题:检索精度。我们最初用朴素FAISS,top-5召回率只有67%,源头就错了,模型再强也白搭。后来改进了切分策略,加入重排序模型,召回率升到92%,幻觉率从35%一下掉到5%。可是RAG的延迟增加了近一倍,于是又回到第一个坑……好吧,工程就是连环坑。落地第三坑:微调成本与灾难性遗忘,调参调崩了算谁的
我们想在一个小众法律文书数据上微调,标注数据只有500条。全量微调的话,4张A100跑两周,显存吃满,训练出来在目标任务上确实好,但突然不会写诗了,连常识推理都跌了十几个点。这就是灾难性遗忘(Catastrophic Forgetting)。解决手段:LoRA。 把权重增量分解成低秩矩阵,只训练这些小型矩阵,参数量减少上万个数量级——我们实际用下来,微调参数不到总参数的0.1%,显存从4卡直接降到单卡24G,速度还快了。最关键是,原始能力保留完好。在同样500条数据上,LoRA微调的法律文书抽取F1从78.2提到86.5,跟全量微调的87.1几乎没差,但没有遗忘,训练成本仅为全量微调的1/300。 这钱省得我做梦都笑醒。 也是,大语言模型这领域,每天醒来都有新论文,新工具。我们到底在逼近什么?昨夜盯着训练loss曲线发呆,它平滑下降,像在嘲笑我的焦虑。也许智能真的是算力的女儿。但至少今天,我们还困在落地的小黑屋里,修修补补。不过挺好——这种混乱而高速的演进,正好踩在我的兴奋点上。作者|大讲堂
排版|大讲堂
审核|白杨
大讲堂