第 1 章:LLM 是什么——一台预测下一个词的机器

回到 学习主页 | 下一章:分词:把文字切成模型能吃的块

大语言模型(Large Language Model, LLM)这个名字拆开看:语言模型。三者都重要,但最反直觉的是——它从头到尾只做一件事:预测下一个 token(token 大致可以理解为「词的碎片」,下一章细说)。

先给直觉:一个超级厉害的「接话器」

想象你在键盘上打字,输入法不断猜你下一个字是什么。LLM 做的事情在结构上与此相同:给定一段文本,输出「下一个 token 最可能是什么」。区别在于:

  1. 它读过几乎整个互联网的文本;
  2. 它用来做判断的参数有几千亿个;
  3. 预测出的 token 会拼回输入里,再预测下一个——循环下去,就「长」出了一整段回答。

所以当你问 ChatGPT「解释一下相对论」,它并没有在「回答问题」这个行为上受过专门训练——它只是在续写一段以「解释一下相对论:」开头的、它认为最可能的文本。回答、写诗、写代码、推理,全部是这一个简单目标的涌现(emergence)。

Note

这种「一次生成一个 token,再喂回去继续」的方式叫自回归生成(autoregressive generation),是几乎所有现代 LLM 的工作方式。

为什么这个直觉值得反复确认

把 LLM 想成「接话器」而不是「知识库检索器」,能解释很多现象:

  • 幻觉(hallucination):它不是在查事实,而是在编「最像样的续写」。续得流畅和续得正确是两回事。
  • 提示词敏感:换一种说法开头,后续最可能的续写就完全不同。
  • 能力边界模糊:它有时会做算术、有时不会——因为它见过足够多相似的续写模式,但并没有真正「学会」算术规则。

历史脉络:这条路线走了七十年

在 Transformer 之前,让机器处理语言的主流尝试是:

  • N-gram 模型(20 世纪中叶起):统计连续 n 个词出现的频率来猜下一个词。简单,但「n」大一点,见过的组合就指数级稀疏,几乎全部没见过。
  • 循环神经网络 RNN / LSTM(1990s–2010s):把文本一个词一个词地「吃」进去,靠内部状态记住上文。问题在于串行处理慢,而且句子一长,记忆就衰减(长程依赖问题)。

转折点是 2017 年 Google 团队 Vaswani 等人发表的论文 Attention Is All You Need,提出 Transformer 架构(第 3 章细讲)。它的核心机制自注意力(self-attention)让每个词可以一步直达上文里任何位置,而且整段文本可以并行处理——这两点让模型规模得以爆炸式增长。

之后 OpenAI 沿着「把 Transformer 做大」这条路狂奔:

模型年份规模标志性意义
GPT-120181.17 亿参数证明「预训练 + 微调」范式有效
GPT-2201915 亿参数零样本(zero-shot)能力初现
GPT-320201750 亿参数规模涌现出上下文学习能力

为什么必须「大」:Scaling Laws

直觉上你会问:参数更多,不就是背得更熟吗?缩放定律(Scaling Laws,Scaling Laws)的发现让「大」从一个工程选择变成了理论依据:在相当大的范围内,模型在测试集上的损失(loss)与参数量、数据量、算力之间呈现平滑的幂律关系——规模越大,预测越准,而且这种改善可以事先预测。

「大」带来的是质的区别:当参数和数据都足够大时,模型开始表现出涌现能力(emergent abilities)——一些在小模型上完全不存在、跨过某个规模阈值后突然出现的能力,比如多步推理、上下文学习(in-context learning,给几个例子就学会任务格式,无需重新训练)。

一句话总结

LLM 是一台在人类全部文本上训练出来的「下一个 token 预测器」:从 2017 年的 Transformer 架构出发,靠 Scaling Laws 指引不断做大,最终从简单的续写任务里涌现出对话、写作、推理和写代码的能力。理解这一点,后面所有章节都是它的一层层展开。

来源

  • Transformer 由 Google 团队 Vaswani 等人于 2017 年提出:已核实(维基百科 GPT-1 条目)
  • GPT-1(2018,1.17 亿参数)、GPT-2(2019,15 亿参数)、GPT-3(2020,1750 亿参数):已核实(维基百科 GPT-3 条目)

相关笔记