
微调:你以为你会了,其实踩的全是坑
微调的本质:在参数空间中动刀子 别被那些 fancy 的词唬住。微调(fine-tuning)说到底,就是在一个已经训练好的模型上,用你自己的数据接着训练一小会儿。但是——这个小会儿,每一刀都要精准。全参数微调?那是用屠龙刀切豆腐。你看着 ...

微调的本质:在参数空间中动刀子 别被那些 fancy 的词唬住。微调(fine-tuning)说到底,就是在一个已经训练好的模型上,用你自己的数据接着训练一小会儿。但是——这个小会儿,每一刀都要精准。全参数微调?那是用屠龙刀切豆腐。你看着 ...

窗口正在焊死,光有心气没用 2024年过半,预训练这词儿已经被说烂了——但你越听越焦虑,不是不懂,是这玩意儿真的太烧钱,又看不到回头钱。对吧?现在窗口期最多12个月,过了这个村,别说店,连个茅草棚都没了。美国一纸禁令,H100进不来,B20...

Transformer:不只是“注意力”,是数学暴力美学 说实话,第一次看到Transformer的架构图,我笑了——这不就是把一堆全连接层叠起来,然后搞了个叫自注意力的玩意儿?能有多神?后来跑了个文本分类,准确率直接秒了LSTM将近8个点...

大模型这玩意儿,现在火得离谱。但如果你仔细看,这简直就是一场豪赌。为什么是现在?因为再不赌,可能连上牌桌的机会都没了。然而,绝大部分玩家根本没想清楚怎么赢——或者说,他们以为把参数调大就能赢。天真! 过去两年,AI基础设施的投资翻了数倍。但...

还记得第一次用GPT-3生成一段像模像样的代码——我盯着屏幕,脊背发凉。那感觉,跟第一次看到AlphaGo赢了李世石差不多。但很快我就冷静下来了。毕竟,这玩意儿背后,不过是一堆矩阵乘法和概率分布。对吧?真是这样? 自注意力:一个眼神就够了 ...

为什么是现在?风口过了还是没来? 2018年,BERT横扫NLP榜单的时候,所有人都在喊要变天了。但四年多过去了,天变了吗?一部分变了,另一部分——尤其是商业落地那部分,卡住了。说实话,到2023年还聊BERT,有点像是在大家都在追GPT-...

有时候你真想回到那个天真的年代——觉得一个注意力头就够用了。我至今记得那个深夜,线上服务突然OOM,日志里满屏的 CUDA out of memory,就因为我把头数从 8 砍到了 1,企图节省显存。结果呢?模型直接退化成了词袋。那感觉就像...

昨天和某大厂供应链总监喝酒,他拍着桌子骂了一句:‘自注意力就是个妖孽,它把我们的预测模型全废了。’ 我笑了。不是幸灾乐祸——是因为他说对了。自注意力(Self-Attention)这东西,表面上是Transformer架构的心脏,本质上却是...

第一次把多头注意力的代码跑通时,我盯着那个热力图看了整整十分钟。不是震撼,是觉得可笑——就这么个加权求和的东西,居然把语言模型推到了今天的高度。而我们在学校学的那套信号处理,乍一看还以为早就被扫进故纸堆了,结果换个马甲,成了Transfor...

我刚从硅谷回来,满耳朵都是Transformer。不是孩之宝的变形金刚,是那个把整个AI供应链搅得天翻地覆的架构。英伟达的股价再创新高——可你知道吗?下游的服务器厂商利润率跌到不足5%了。撕裂,正在发生。 为什么是现在?因为算力饥荒,因为地...