Transformer
书
- 智力引擎:大型语言模型简史 · 李思特Think
本书以2017年Transformer架构的提出为起点,系统梳理了大型语言模型从学术突破演变为全球产业核心的波澜壮阔历程。全书围绕GPT、BERT、T5等关键模型,以及OpenAI、Google、Meta等主要参与者的竞争,深入剖析了技术范式确立、算力竞赛、商业野心与产业生态重组之间的复杂互动。
- 八人小组:一篇论文的诞生…程的芯片,被迫一个时间步一个时间步地串行处理,大部分计算单元在等待上一个词处理完成。谷歌于2016年将其翻译服务转换为神经机器翻译,但就像在Transformer架构出现之前的语言模型一样,它仍由seq2seq深度LSTM网络完成。 Shazeer不是Google Brain团队里第一个意识到这个问题…
- 预训练密码:从ELMo到ULMFiT的暗流…。一台显示器上的损失曲线正在缓慢下降,每隔几小时才移动一个像素。Matthew Peters盯着这条曲线已经看了三个月。 2017年夏天,当Transformer论文在arXiv上引发震动时,这间办公室里的计算机正在运行一种已经被那篇论文宣告过时的架构——双向LSTM。它们没有八头并行的矩阵乘法,没有…
- 算力即权力:GPU集群与隐性资本…来十二个月的计算资源需求预估。当OpenAI的首席财务官在旧金山福尔瑟姆街的办公室里打开这份文件时,他的目光停在了一行数字上:训练一个大规模Transformer模型所需的GPU集群预估成本,按当时的市场价格计算,大约相当于公司A轮融资总额的四分之三。 这不是一个技术问题。这是一个生存问题。把时间拨回…