机器学习
书
- 智力引擎:大型语言模型简史 · 李思特Think
本书以2017年Transformer架构的提出为起点,系统梳理了大型语言模型从学术突破演变为全球产业核心的波澜壮阔历程。全书围绕GPT、BERT、T5等关键模型,以及OpenAI、Google、Meta等主要参与者的竞争,深入剖析了技术范式确立、算力竞赛、商业野心与产业生态重组之间的复杂互动。
- 八人小组:一篇论文的诞生…意力本身足以支撑整个序列建模架构。 2017年4月,论文初稿完成。团队通过内部渠道提交到了当年的神经信息处理系统大会(NeurIPS),这是机器学习领域最顶级的学术会议之一。审稿过程出奇地顺利。三位审稿人都给出了正面评价。一位审稿人写道:“这篇论文提出的方法极其简洁,但效果惊人。它有可能…
- 论断:GPT系列的进化史…知识和计算资源,但提示词工程只需要语言能力。这意味着,一个拥有GPT-3访问权限的人,可以通过简单的文本指令调用强大的语言能力,而不需要任何机器学习背景。 2020年初,当GPT-3的训练在微软的Azure集群上启动时,OpenAI已经不再是一个纯粹的研究机构。它在2019年引入的有限盈…
- 论断:BERT的诞生是Google对OpenAI…署NLP系统的技术门槛。此前,只有少数拥有足够研究人才和标注数据的大公司,才能为每个特定任务从零训练高性能模型。 BERT之后,任何拥有基本机器学习工程能力和少量标注数据的团队,都可以通过微调获得接近甚至达到此前最先进水平的性能。语言理解技术开始从少数科技巨头的实验室,扩散到银行、医院、…