智力引擎:大型语言模型简史 · 人物与地名表
《智力引擎:大型语言模型简史》涉及的人物、地点、事件与机构,及各自出现的章节。
人物
机构与主题
- 人工智能
- 八人小组:一篇论文的诞生…的部署需求,反过来又会推动架构的优化和改进。 外部响应来自一家名为OpenAI的小公司。当时OpenAI还是一家非营利研究机构,正在探索通用人工智能的可能性。他们的技术团队在论文发表后立即开始复现Transformer,并在内部邮件列表中展开了热烈讨论。一位名叫Alec Radford的…
- 预训练密码:从ELMo到ULMFiT的暗流西雅图,Allen人工智能研究所。一台显示器上的损失曲线正在缓慢下降,每隔几小时才移动一个像素。Matthew Peters盯着这条曲线已经看了三个月。 2017年夏…
- 算力即权力:GPU集群与隐性资本…大规模神经网络的能力取决于GPU集群的规模,那么GPU集群的规模就不仅仅是技术基础设施——它是战略资产。谁控制了GPU产能,谁就控制了下一波人工智能创新的准入资格。这个结论听起来像是夸大其词,直到你开始追踪GPU市场的实际动态。 NVIDIA总部位于圣克拉拉,一栋三角形的玻璃建筑,看起来…
- 大型语言模型
- 翻译之困:循环网络的最后堡垒…力的极限。 句子一长,翻译质量就下滑;句子再长,输出几乎不可用。这个问题在学术论文里有个名字,叫长距离依赖。工程团队私下里叫它“健忘症”。 大型语言模型的诞生并非源于对语言本身的顿悟,而是源于机器翻译这一具体而顽固的工程困境。这个判断放在今天回看,几乎像一句废话,因为大模型已经无处不在。但放…
- 算力即权力:GPU集群与隐性资本…他们的武器不是数学公式,而是采购订单。 要理解这场竞赛为何发生,需要先理解一个被算法史叙事长期遮蔽的事实:训练一个能够在现实世界中发挥作用的大型语言模型,从来就不只是算法问题。它是一个资本密集型的工业项目,其物理基础是成排的GPU、兆瓦级的电力消耗和七位数美元的设备折旧。这个事实在2014年…
- 论断:GPT系列的进化史…I Now研究所的一份报告指出,GPT-3的训练成本估计在1200万美元以上,这意味着只有极少数机构有能力训练类似规模的模型。报告特别指出,大型语言模型中的“大型”本质上是一个模糊的概念,因为没有明确的阈值来定义“大型”所需的参数数量。但有一点是明确的:进入门槛正在以指数级速度上升,这正在将…
- Transformer
- 八人小组:一篇论文的诞生…程的芯片,被迫一个时间步一个时间步地串行处理,大部分计算单元在等待上一个词处理完成。谷歌于2016年将其翻译服务转换为神经机器翻译,但就像在Transformer架构出现之前的语言模型一样,它仍由seq2seq深度LSTM网络完成。 Shazeer不是Google Brain团队里第一个意识到这个问题…
- 预训练密码:从ELMo到ULMFiT的暗流…。一台显示器上的损失曲线正在缓慢下降,每隔几小时才移动一个像素。Matthew Peters盯着这条曲线已经看了三个月。 2017年夏天,当Transformer论文在arXiv上引发震动时,这间办公室里的计算机正在运行一种已经被那篇论文宣告过时的架构——双向LSTM。它们没有八头并行的矩阵乘法,没有…
- 算力即权力:GPU集群与隐性资本…来十二个月的计算资源需求预估。当OpenAI的首席财务官在旧金山福尔瑟姆街的办公室里打开这份文件时,他的目光停在了一行数字上:训练一个大规模Transformer模型所需的GPU集群预估成本,按当时的市场价格计算,大约相当于公司A轮融资总额的四分之三。 这不是一个技术问题。这是一个生存问题。把时间拨回…
- 产业变革
- 八人小组:一篇论文的诞生…经开始新的项目,另一些人则留在Google继续改进架构。他们都知道自己做了一件重要的工作,但没有人预见到,这个架构将在五年内驱动数千亿美元的产业变革,重新定义人类与机器的交互方式,并引发一场关于智能本质的全球辩论。 在那个春天,Transformer还只是一个优秀的翻译模型架构。它安静地…
- 机器学习
- 八人小组:一篇论文的诞生…意力本身足以支撑整个序列建模架构。 2017年4月,论文初稿完成。团队通过内部渠道提交到了当年的神经信息处理系统大会(NeurIPS),这是机器学习领域最顶级的学术会议之一。审稿过程出奇地顺利。三位审稿人都给出了正面评价。一位审稿人写道:“这篇论文提出的方法极其简洁,但效果惊人。它有可能…
- 论断:GPT系列的进化史…知识和计算资源,但提示词工程只需要语言能力。这意味着,一个拥有GPT-3访问权限的人,可以通过简单的文本指令调用强大的语言能力,而不需要任何机器学习背景。 2020年初,当GPT-3的训练在微软的Azure集群上启动时,OpenAI已经不再是一个纯粹的研究机构。它在2019年引入的有限盈…
- 论断:BERT的诞生是Google对OpenAI…署NLP系统的技术门槛。此前,只有少数拥有足够研究人才和标注数据的大公司,才能为每个特定任务从零训练高性能模型。 BERT之后,任何拥有基本机器学习工程能力和少量标注数据的团队,都可以通过微调获得接近甚至达到此前最先进水平的性能。语言理解技术开始从少数科技巨头的实验室,扩散到银行、医院、…