科技 第39页

Layer Normalization:被算力焦虑逼出来的印钞机?-大讲堂

Layer Normalization:被算力焦虑逼出来的印钞机?

为什么是现在?一场静默的算力政变 你如果这两年盯着GPU的股价发呆,大概已经注意到了——H100被炒成期货,电费账单比研发费还烫手。所有人都在喊“大模型”,却没人愿意低头看一眼那堆矩阵乘法里的细枝末节。Layer Normalization...

层归一化:你踩过多少坑?一个架构师的碎碎念-大讲堂

层归一化:你踩过多少坑?一个架构师的碎碎念

那是半夜两点,训练日志里突然跳出NaN。我盯着屏幕,脑子里只有一个念头——又tm是归一化的问题。别笑,做大规模预训练,这种破事遇少了? 说实话,层归一化(Layer Normalization)这玩意儿,看着简单,就是减均值除方差,再搞两个...

批归一化:这玩意儿真不是拍脑袋想出来的-大讲堂

批归一化:这玩意儿真不是拍脑袋想出来的

你训过那种几十层的网络没?没有的话,恐怕很难理解那种眼睁睁看着 loss 上蹿下跳,就是不肯老实下降的抓狂。调学习率、换初始化、加正则…我那时候简直觉得自己在搞玄学,而不是工程。直到 2015 年——没错,和 ResNet 同年...

Dropout:一场算力迷思的终结,还是新垄断的序章?-大讲堂

Dropout:一场算力迷思的终结,还是新垄断的序章?

说实话,我最近重新翻出Hinton那篇Dropout论文时,后背有点发凉。 不是因为它多么深奥——这玩意都出来快十年了——而是因为,它现在正被嵌进一个完全不同的叙事里:算力短缺。对,那场让所有大模型玩家集体焦虑的算力饥荒。我甚至觉得,Dro...

扒开L2正则化的外衣——从梯度惩罚到工程美学的深度解剖-大讲堂

扒开L2正则化的外衣——从梯度惩罚到工程美学的深度解剖

很多人一提到L2正则化,脑子里蹦出来的就是“防止过拟合”。 然后?没了。 说实话,这就像说“汽车能跑是因为有发动机”——正确,但毫无用处。今天我们干脆把L2正则化的皮一层层扒开,看看到底是什么让它成为贯穿线性回归到Transformer的常...

L1正则化:为什么现在每个供应链负责人都该睡不着觉-大讲堂

L1正则化:为什么现在每个供应链负责人都该睡不着觉

数据爆炸里的断舍离 供应链的数字化?早就不是新鲜事了。但过去三年,我看到的不是数据驱动,是数据淹没。每个节点都在吐数据:IoT传感器、ERP日志、天气接口……然后呢?然后一堆团队拿着这些高维特征去喂模型,结果过拟合得一塌糊涂。L1正则化,也...

正则化:深入拆解L1/L2的几何本质与落地血泪史-大讲堂

正则化:深入拆解L1/L2的几何本质与落地血泪史

正则化。这三个字,我敢打赌,你第一次见它肯定是在某个线性回归的loss function末尾——像个小尾巴,λ||w||_2。说实话,当初我以为是某种神秘仪式。后来才发现,这玩意儿本质是给模型戴紧箍咒,让那些想放飞自我的权重复归平静。不过话...

搞AI的别再乱抄学习率衰减了!这玩意能省几千万-大讲堂

搞AI的别再乱抄学习率衰减了!这玩意能省几千万

两周前,一个做训练平台的哥们跟我倒苦水:他们帮某独角兽部署的千卡集群,训同一个模型,就因为改了个学习率衰减策略,时间直接缩短19%。 19%是什么概念?在这个算力比黄金还贵的节点,相当于白捡了几百块H800。 可悲的是,90%的团队还在用着...

学习率:被低估的调参核弹,还在裸调的架构师该醒醒了-大讲堂

学习率:被低估的调参核弹,还在裸调的架构师该醒醒了

步长,一个被符号隐藏的物理直觉 说实话,第一次看梯度下降公式,眼睛里只有θ=θ-α·∇J——那个α,像句子的逗号一样不起眼。可就是这个标量,决定了你是优雅滑向最优解,还是把loss地表踩出一串陨石坑。打个比方:你蒙着眼睛站在山顶,目标是山脚...

别再迷信“动量”,它正在一口一口吞噬你的战略定力-大讲堂

别再迷信“动量”,它正在一口一口吞噬你的战略定力

动量这词儿,最近被包装成了商业救世主。说实话,听着就烦。可是烦归烦,你不能不看——因为全球供应链碎了一地,宏观经济的钟摆晃得人想吐,这个时候谈动量,不是追风口,是找解药。为什么是现在?因为旧地图找不到新大陆,而惯性就是死亡。 我见过太多老板...