第 1 章:LLM 是什么——一台预测下一个词的机器
回到 学习主页 | 下一章:分词:把文字切成模型能吃的块
大语言模型(Large Language Model, LLM)这个名字拆开看:大、语言、模型。三者都重要,但最反直觉的是——它从头到尾只做一件事:预测下一个 token(token 大致可以理解为「词的碎片」,下一章细说)。
先给直觉:一个超级厉害的「接话器」
想象你在键盘上打字,输入法不断猜你下一个字是什么。LLM 做的事情在结构上与此相同:给定一段文本,输出「下一个 token 最可能是什么」。区别在于:
- 它读过几乎整个互联网的文本;
- 它用来做判断的参数有几千亿个;
- 预测出的 token 会拼回输入里,再预测下一个——循环下去,就「长」出了一整段回答。
所以当你问 ChatGPT「解释一下相对论」,它并没有在「回答问题」这个行为上受过专门训练——它只是在续写一段以「解释一下相对论:」开头的、它认为最可能的文本。回答、写诗、写代码、推理,全部是这一个简单目标的涌现(emergence)。
Note
这种「一次生成一个 token,再喂回去继续」的方式叫自回归生成(autoregressive generation),是几乎所有现代 LLM 的工作方式。
为什么这个直觉值得反复确认
把 LLM 想成「接话器」而不是「知识库检索器」,能解释很多现象:
- 幻觉(hallucination):它不是在查事实,而是在编「最像样的续写」。续得流畅和续得正确是两回事。
- 提示词敏感:换一种说法开头,后续最可能的续写就完全不同。
- 能力边界模糊:它有时会做算术、有时不会——因为它见过足够多相似的续写模式,但并没有真正「学会」算术规则。
历史脉络:这条路线走了七十年
在 Transformer 之前,让机器处理语言的主流尝试是:
- N-gram 模型(20 世纪中叶起):统计连续 n 个词出现的频率来猜下一个词。简单,但「n」大一点,见过的组合就指数级稀疏,几乎全部没见过。
- 循环神经网络 RNN / LSTM(1990s–2010s):把文本一个词一个词地「吃」进去,靠内部状态记住上文。问题在于串行处理慢,而且句子一长,记忆就衰减(长程依赖问题)。
转折点是 2017 年 Google 团队 Vaswani 等人发表的论文 Attention Is All You Need,提出 Transformer 架构(第 3 章细讲)。它的核心机制自注意力(self-attention)让每个词可以一步直达上文里任何位置,而且整段文本可以并行处理——这两点让模型规模得以爆炸式增长。
之后 OpenAI 沿着「把 Transformer 做大」这条路狂奔:
| 模型 | 年份 | 规模 | 标志性意义 |
|---|---|---|---|
| GPT-1 | 2018 | 1.17 亿参数 | 证明「预训练 + 微调」范式有效 |
| GPT-2 | 2019 | 15 亿参数 | 零样本(zero-shot)能力初现 |
| GPT-3 | 2020 | 1750 亿参数 | 规模涌现出上下文学习能力 |
为什么必须「大」:Scaling Laws
直觉上你会问:参数更多,不就是背得更熟吗?缩放定律(Scaling Laws,Scaling Laws)的发现让「大」从一个工程选择变成了理论依据:在相当大的范围内,模型在测试集上的损失(loss)与参数量、数据量、算力之间呈现平滑的幂律关系——规模越大,预测越准,而且这种改善可以事先预测。
「大」带来的是质的区别:当参数和数据都足够大时,模型开始表现出涌现能力(emergent abilities)——一些在小模型上完全不存在、跨过某个规模阈值后突然出现的能力,比如多步推理、上下文学习(in-context learning,给几个例子就学会任务格式,无需重新训练)。
一句话总结
LLM 是一台在人类全部文本上训练出来的「下一个 token 预测器」:从 2017 年的 Transformer 架构出发,靠 Scaling Laws 指引不断做大,最终从简单的续写任务里涌现出对话、写作、推理和写代码的能力。理解这一点,后面所有章节都是它的一层层展开。
来源
- Transformer 由 Google 团队 Vaswani 等人于 2017 年提出:已核实(维基百科 GPT-1 条目)
- GPT-1(2018,1.17 亿参数)、GPT-2(2019,15 亿参数)、GPT-3(2020,1750 亿参数):已核实(维基百科 GPT-3 条目)
相关笔记
- Large Language Model — wiki 总览,覆盖架构与生命周期全图
- LLM 与 NLP 的区别 — 为什么说 LLM 是新范式而非 NLP 的延续
- Scaling Laws — 规模与能力的幂律关系
- Attention Is All You Need — Transformer 原始论文精读剪报