大讲堂的文章

BERT 凭什么吃掉千亿 NLP 市场?残酷真相与最后窗口-大讲堂

BERT 凭什么吃掉千亿 NLP 市场?残酷真相与最后窗口

为什么是现在?风口过了还是没来? 2018年,BERT横扫NLP榜单的时候,所有人都在喊要变天了。但四年多过去了,天变了吗?一部分变了,另一部分——尤其是商业落地那部分,卡住了。说实话,到2023年还聊BERT,有点像是在大家都在追GPT-...

自注意力:一场正在撕裂旧产业链的算力海啸-大讲堂

自注意力:一场正在撕裂旧产业链的算力海啸

昨天和某大厂供应链总监喝酒,他拍着桌子骂了一句:‘自注意力就是个妖孽,它把我们的预测模型全废了。’ 我笑了。不是幸灾乐祸——是因为他说对了。自注意力(Self-Attention)这东西,表面上是Transformer架构的心脏,本质上却是...

注意力机制拆解:不是魔法,是矩阵运算和几个坑-大讲堂

注意力机制拆解:不是魔法,是矩阵运算和几个坑

第一次把多头注意力的代码跑通时,我盯着那个热力图看了整整十分钟。不是震撼,是觉得可笑——就这么个加权求和的东西,居然把语言模型推到了今天的高度。而我们在学校学的那套信号处理,乍一看还以为早就被扫进故纸堆了,结果换个马甲,成了Transfor...

Transformer撕裂供应链:谁在吃肉,谁在喝汤?-大讲堂

Transformer撕裂供应链:谁在吃肉,谁在喝汤?

我刚从硅谷回来,满耳朵都是Transformer。不是孩之宝的变形金刚,是那个把整个AI供应链搅得天翻地覆的架构。英伟达的股价再创新高——可你知道吗?下游的服务器厂商利润率跌到不足5%了。撕裂,正在发生。 为什么是现在?因为算力饥荒,因为地...

数据并行:别让你的GPU集群在等待中老去-大讲堂

数据并行:别让你的GPU集群在等待中老去

数据并行?这玩意算是分布式训练里的老伙计了。但你以为把数据切碎喂给每张卡就完事了?天真。上个月我们A100集群跑GPT-2微调,800张卡同步拉满,梯度同步那一下……整个机柜的交换机指示灯瞬间全绿——不是健康,是过载。CLOSE_WAIT积...

模型并行:一场算力军备竞赛的终局推演-大讲堂

模型并行:一场算力军备竞赛的终局推演

去年跟一个做AI infra的朋友喝酒,他说了句让我至今后背发凉的话——“我们现在不是缺卡,是缺一种把卡当水一样用的能力。” 你知道最讽刺的是什么吗?就在OpenAI用2.5万张A100跑GPT-4的那几个月,硅谷无数创业公司还在为抢到8张...

分布式训练:搞透算力交响里的工程之坑-大讲堂

分布式训练:搞透算力交响里的工程之坑

跑个 GPT-2 小模型,单卡显存直接爆掉——你怎么办? 加卡呗,可事情哪有这么简单。说实话,我第一次搞多卡训练时,天真地以为把数据分一分、模型拷一拷就完事了,结果性能掉成渣。那感觉,就像买了辆十二缸的跑车,却只敢在小区里用一档溜达。后来才...

汇编:别嘲笑它老,它正要你的命-大讲堂

汇编:别嘲笑它老,它正要你的命

芯片荒背后的真相 你以为缺芯只是台积电的事?天真。前阵子我去拜访一家做 IoT 模组的公司,他们的 CTO 愁眉苦脸,说 MCU 涨价 300% 也就算了,关键是买不到。为什么?因为那些不起眼的 8 位、32 位控制器,里面跑的代码,往往还...