一颗硅基心脏的全球律动
你可能会说,不就一截断线性函数嘛,至于这么吹?至于。ReLU的稀疏激活特性——负值直接压零——天然让网络中的神经元大规模“休眠”。这意味着计算时,大量乘法加法被直接跳过。在训练GPT-4这种万亿参数怪兽时,这能省掉多少电?NVidia的工程师私下透露,H100对ReLU的底层优化,使得稀疏计算单元利用率飙到90%以上。换作其他激活函数,可能连一半都不到。
巨头与黑马:隐形的激活争夺战

边际成本归零的艺术
ReLU最狠的一刀,在于它让边际计算成本无限逼近零。当神经元输出为负,梯度直接为零,反向传播时连更新都省了。这不是技巧,这是哲学。商业上,这意味着每增加一个用户,服务成本几乎不增。看看Midjourney,几千万人同时生成图像,如果每个卷积层都用Sigmoid那种重计算函数,服务器早烧穿了。
行动指南:扔掉教科书,看这三点
