一、梯度下降:在迷雾中下山
梯度下降的本质是回归最朴素的直觉:以最小化损失为目标,沿着坡度最陡的方向迈步。数学上,θ_t+1 = θ_t – η·∇L(θ_t)。但工程实现并没有那么线性。学习率 η 太大会震荡,太小则爬不出来。于是有了 Adam,它给每个参数配了自适应步长,还加入动量项。相当于你多了一根手杖,并且能感知到上次迈步的惯性。 但 Adam 不是银弹。在 ImageNet 上用 ResNet-50 训练,公开 benchmark 中,SGD 配合 cosine 退火能达到 76.3% top-1 准确率,而 Adam 的默认配置只有 74.9%。有意思的是,Adam 在头 30 个 epoch 内收敛速度明显更快,导致很多人误以为它全面胜出。经验做法是:前半程用 Adam 加速,后半程切 SGD 微调。这就像手动挡,起步用一档,上了高速换五档。
二、反向传播:误差的逆流

三、Transformer 的注意力:你凭什么对我有看法?
先抛一个反直觉的事实:Transformer 没有循环,没有卷积,只凭一个注意力机制就在长程依赖上碾压了所有前人。核心是三个向量:Query、Key、Value。每个 token 都举着自己的 Query,去跟所有 Key 做点积,得到匹配分数;再经过 Softmax 变成权重,最后加权求和 Value。这个操作叫 Scaled Dot-Product Attention。 为什么要除以 sqrt(d_k)?因为如果不除,当向量维度变大时,点积分值会迅速膨胀,Softmax 会陷入饱和区,梯度几乎消失。这个维度缩放的细节,是无数人用惨痛教训试出来的。多头注意力则更进一步,把 Q、K、V 拆成多个子空间并行计算,相当于同时用多个视角观察一句话。比如一个头关注主谓关系,另一个头关注指代关系。 在 WMT’14 英德翻译上,Transformer base 达到 28.4 BLEU,比当时最强的 LSTM 组合高出 2.1。更狠的是训练速度:用 8 张 P100 GPU,训练 12 万步只需 3.5 天,而 LSTM 系统往往要跑 10 天以上。注意,这都是实打实的数据,不是嘴上说说。
四、落地的三个坑,我替你踩过了
