第 4 章:预训练——在文本海洋里学会预测
上一章:Transformer 如何读懂一句话 | 回到 学习主页 | 下一章:对齐:从补全机器到对话助手
上一章讲了模型怎么工作,这一章讲模型怎么「学会」工作。预训练(Pre-training)是 LLM 生命周期的第一阶段,也是最烧钱、最神秘的阶段。
一个几乎免费的学习信号
所有机器学习的核心都是「给出反馈,调整参数」。监督学习需要人工标注(这张图是猫);但预训练什么都不用标——训练数据自己带着答案:
输入: "猫喜欢吃"
答案: "鱼"
把文本切一刀,前半截是输入,后半截的下一个 token 就是答案。互联网上的所有文本(网页、百科、书籍、代码、论文)都是天然的习题集:预测下一个 token(next token prediction),猜错了就按误差反向调整参数,让下次猜得更准。这个循环要做几万亿次。这种「数据自带标签」的学习方式叫自监督学习(self-supervised learning)。
训练数据的量级:主流模型在万亿级(trillions)token上训练。对照第 2 章的比例,1 万亿 token 大约是 7500 亿个英文单词——人类一辈子也读不完的量。算力上,训练一个前沿模型需要数千张 GPU 连续运行数月,一次训练耗资数千万到上亿美元。
模型在这个过程中学到了什么
没人告诉模型「这是语法」「这是常识」,但预测下一个词的唯一途径就是学会语言的全部结构:
- 语法:要准确预测「猫喜欢吃」后面是「鱼」而不是「跑」,必须内化主谓宾结构;
- 世界知识:读过足够多百科,才知道「巴黎是法国的首都」——这类事实被编码进了参数;
- 推理模式:读过足够多数学题解和逻辑论证,模型开始模仿「因为……所以……」的推导步骤,尽管此时还很不可靠。
这正是第 1 章「接话器」比喻的根源:预训练只优化「续写更像人类文本」,而对话、推理、编程全是这个目标的副产物。
产物:基础模型(Base Model)
预训练的直接产物叫基础模型(base model)。它有惊人的知识和语言能力,但不是一个合格的助手:
Example
你问一个只预训练过的模型:「中国的首都是哪里?」 它很可能接着写:「……这个问题在历次考试中反复出现,请同学们认真复习。」——它见过太多以这句话开头的习题集文本,于是顺着统计惯性续写,而不是回答你。
它还会模仿网页里的骂人话、生成有害内容、把「问题」当成「要续写的文本」。基础模型是一台没有行为准则的概率机器,需要下一章的对齐工序把它「教成」助手。
缩放定律的工程含义
第 1 章提到 Scaling Laws:损失随规模平滑下降。这里补一个对训练成本影响深远的结论——2022 年 DeepMind 的 Chinchilla 论文发现,此前模型普遍「大而欠喂」:数据量应该与参数量同步放大(约 20 个 token 对应 1 个参数才是效率最优)。这直接改变了行业实践:从一味堆参数,转向「参数量与数据量平衡」。
一句话总结
预训练 = 在万亿级 token 上以「预测下一个词」为目标的自监督学习:数据自带答案,不需要标注;语法、知识、推理作为「学会预测」的副产物被编码进参数。产物是基础模型——能力惊人但行为不受约束,需要对齐工序把它变成助手。
来源
- Chinchilla 论文(DeepMind,2022)结论:参数量翻倍时训练 token 数也应翻倍,约 20 个 token 对应 1 个参数(Chinchilla 本身为 70B 参数配 1.4T token):已核实(维基百科 Chinchilla (language model) 条目)
- 主流模型在万亿级 token 上训练:已核实(DeepSeek-V3 预训练 14.8T token、Llama 3 15T token 等公开报告)
- 「训练成本数千万到上亿美元」:行业估算(如 GPT-3 单卡训练需 355 年的 Lambda Labs 估算),量级可信但非官方数字
相关笔记
- Pre-training — wiki 版笔记:训练目标、数据来源与「基础模型为什么只会接话」
- Scaling Laws — 规模、数据、算力之间的幂律关系
- LLM — 全生命周期概览