大型语言模型
书
- 智力引擎:大型语言模型简史 · 李思特Think
本书以2017年Transformer架构的提出为起点,系统梳理了大型语言模型从学术突破演变为全球产业核心的波澜壮阔历程。全书围绕GPT、BERT、T5等关键模型,以及OpenAI、Google、Meta等主要参与者的竞争,深入剖析了技术范式确立、算力竞赛、商业野心与产业生态重组之间的复杂互动。
- 翻译之困:循环网络的最后堡垒…力的极限。 句子一长,翻译质量就下滑;句子再长,输出几乎不可用。这个问题在学术论文里有个名字,叫长距离依赖。工程团队私下里叫它“健忘症”。 大型语言模型的诞生并非源于对语言本身的顿悟,而是源于机器翻译这一具体而顽固的工程困境。这个判断放在今天回看,几乎像一句废话,因为大模型已经无处不在。但放…
- 算力即权力:GPU集群与隐性资本…他们的武器不是数学公式,而是采购订单。 要理解这场竞赛为何发生,需要先理解一个被算法史叙事长期遮蔽的事实:训练一个能够在现实世界中发挥作用的大型语言模型,从来就不只是算法问题。它是一个资本密集型的工业项目,其物理基础是成排的GPU、兆瓦级的电力消耗和七位数美元的设备折旧。这个事实在2014年…
- 论断:GPT系列的进化史…I Now研究所的一份报告指出,GPT-3的训练成本估计在1200万美元以上,这意味着只有极少数机构有能力训练类似规模的模型。报告特别指出,大型语言模型中的“大型”本质上是一个模糊的概念,因为没有明确的阈值来定义“大型”所需的参数数量。但有一点是明确的:进入门槛正在以指数级速度上升,这正在将…