本文翻译自AI Paper Review: GPT-4 Technical Report,作者为 freeCodeCamp。


2020 年 GPT-3 发布时,它彻底改变了人们对语言模型的认知。它证明了足够大的神经网络可以直接从提示词和示例中学习任务,无需传统的微调。

这个想法最终催生了提示工程、AI 助手和第一波大语言模型应用。

但 GPT-4 给人的感觉完全不同。

GPT-3 仍然像是一个研究突破:强大、实验性,有时难以预测。而 GPT-4 感觉更像是真正的 AI 平台的开始。焦点不再仅仅是扩展语言模型以获得更好的基准分数。讨论的中心转向了可靠性、多模态理解、对齐、安全性和实际部署。

这种变化贯穿了 OpenAI 发布的整个 GPT-4 技术报告。

与早期的 GPT 论文不同,OpenAI 没有发表包含详细架构图、参数数量、数据集或训练配置的传统研究论文。相反,他们发布了一份范围更有限的技术报告,主要聚焦于能力、评估、安全工作和部署考量。

这个决定本身反映了这个领域发生了多大的变化。

到 GPT-4 问世时,大语言模型已不再仅仅是实验室内的研究项目。它们通过 ChatGPT 等产品成为了全球数百万用户使用的部署系统。关于滥用、幻觉、偏见、网络安全风险和对齐的问题现在与原始模型性能同等重要。

GPT-4 还引入了另一个重大转变:多模态。

之前的 GPT 模型只能处理文本。GPT-4 拓展了这一概念,可以接受图像和文本作为输入,使模型能够分析截图、图表、文档、视觉笑话和其他混合形式的信息。这将大语言模型推向了更通用的 AI 系统,而不仅仅是狭义的文本生成器。

从历史上看,演进路径异常清晰:

  • GPT-1 引入了预训练和迁移学习
  • GPT-2 引入了零样本多任务学习
  • GPT-3 引入了少样本提示和上下文学习
  • GPT-4 引入了对齐的多模态 AI 系统时代

在许多方面,GPT-4 标志着大语言模型不再主要被视作研究实验,而是开始成为现实应用的基础计算接口。

论文概览

本文将回顾 OpenAI 于 2023 年发布的 GPT-4 技术报告。

报告中故意省略了许多重要的技术细节,包括:

  • 参数数量
  • 精确架构
  • 训练计算量
  • 数据集组成
  • 硬件配置

根据 OpenAI 的说法,这些限制部分是由于竞争格局以及大规模 AI 系统日益增长的安全影响。

这种差异在历史上意义重大。

GPT-1、GPT-2 和 GPT-3 论文公开讨论了架构扩展、数据集和训练方法的大量细节。GPT-4 标志着随着语言模型变得具有商业价值和广泛部署,信息披露走向更加受限的方向。

你可以在这里阅读原报告:GPT-4 Technical Report

目录

前置知识

为了从本文中获得最大收益,建议熟悉现代语言模型背后的一些核心概念。

阅读本系列的早期评论尤为有用:

GPT-4 直接建立在之前论文中引入的许多概念之上,特别是大规模预训练、零样本和少样本学习以及上下文提示。

同时,对以下内容有大致了解也会有所帮助:

  • Transformer 架构和自注意力机制
  • 从 GPT-1 到 GPT-3 的演进
  • 少样本学习和提示
  • 基本提示工程概念
  • 基于人类反馈的强化学习(RLHF)
  • 扩展定律以及为什么更大的模型通常会发展出新能力

不过,你不需要深入的数学知识来跟随本文。与之前的评论一样,我将更侧重于直观和实用地解释这些思想,而不是深入探讨复杂的方程或密集的学术术语。

执行摘要

GPT-4 并不仅仅是 GPT-3 的更大版本。

这在今天听起来可能显而易见,但在当时,许多人最初认为 GPT-4 只是同一方向上的又一次扩展。但技术报告显示了更重要的事情:GPT-4 代表了从实验性语言模型向可部署的通用 AI 系统的转变。

根据报告,GPT-4 同时引入了多项重大进步。

首先,如上所述,模型变成了多模态的。与之前只能处理文本的 GPT 系统不同,GPT-4 可以处理图像和文本输入,同时仍然生成文本输出。这使得模型能够分析截图、图表、文档、照片、视觉笑话和混合媒体提示。

其次,GPT-4 在广泛的专业和学术评估中展示了显著更强的推理和基准性能。报告显示 GPT-4 在多项考试中取得了接近人类水平的结果,包括统一律师资格考试、LSAT、GRE、SAT、AP 测试、编程基准和高级推理任务。

报告还高度重视对齐和事实性改进。

早期的 GPT 系统经常产生不安全、误导或过度自信的输出。GPT-4 仍然存在这些问题,但 OpenAI 在基于人类反馈的强化学习(RLHF)、对抗测试、拒绝行为和安全性评估管道上投入了大量资金,以减少有害行为并提高对用户意图的遵循度。

贯穿报告的另一个主要主题是可预测扩展。

据作者所述,OpenAI 开发了基础设施和优化方法,使他们能够使用小得多的训练运行来准确预测 GPT-4 的最终性能。

这个细节比表面看起来更重要。

GPT-3 证明了扩展是有效的。GPT-4 证明了扩展大语言模型正在成为一门工程学科,具有越来越可预测的行为。

更广泛的影响使这份报告具有历史重要性。

GPT-4 将大语言模型从研究演示转变为可部署的 AI 助手,能够跨多个领域进行推理,通过自然语言进行交互,更可靠地遵循指令,并通过 ChatGPT 等系统在全球规模上运行。

在许多方面,这份报告标志着现代 AI 部署时代的开始。

报告目标

GPT-4 技术报告不仅仅是展示一个更强大的语言模型。在很多方面,这份报告旨在证明大型 AI 系统可以比以前更可靠、更安全、更可预测地开发。

GPT-4 背后的一个主要目标是提高广泛任务的推理能力和可靠性。

另一个主要目标是提高与用户意图的对齐——投资于 RLHF、安全微调、拒绝训练和对抗测试,使模型更有帮助,更符合预期行为。

该报告还标志着超越纯文本 AI 系统的重大转变,因为 GPT-4 引入了多模态能力。这将系统从纯粹的语言生成器扩展为更接近通用推理接口的东西,能够同时解释视觉和文本信息。

安全性是贯穿整个报告的另一个核心主题。

OpenAI 反复强调减少有害输出、改善拒绝行为、降低误用风险和构建围绕模型的更安全部署系统的努力。报告讨论了红队测试、领域专家测试、策略执行以及旨在减少实际使用中危险行为的模型辅助安全管道。

但历史上最重要的一个目标可能实际上是可预测性。

据作者所述,GPT-4 是使用旨在以高度可预测的方式扩展的基础设施和优化方法开发的。OpenAI 声称他们可以使用计算量少数千倍的模型来估计 GPT-4 最终性能的各个方面。

这个想法听起来可能很技术性,但它代表了前沿 AI 系统构建方式的重大转变。

早期几代语言模型在扩展过程中通常涉及大量不确定性。GPT-4 表明,大规模 AI 开发正在变得更具系统性和工程驱动性,而非纯粹的实验性。

核心思想

关于 GPT-4 最令人惊讶的事情之一是,在所有的炒作和新能力之下,核心学习目标仍然从根本上非常简单。

与 GPT-1、GPT-2 和 GPT-3 一样,GPT-4 仍然是主要作为下一个 token 预测模型训练的。换句话说,系统通过反复预测序列中的下一个文本来学习。

架构也仍然基于 Transformer 和自回归。

这意味着 GPT-4 一次一个 token 地生成输出,同时使用自注意力来理解输入序列中单词、句子、图像和上下文之间的关系。

在高层次上,自 GPT-2 以来,底层原理并没有太大变化:

  • 在海量数据上训练
  • 预测下一个 token
  • 积极扩展模型

但 GPT-4 将这种方法推向了更远。

根据报告,模型明显更大、更优化,并使用专门为可预测的大规模行为设计的基础设施进行训练。

最大的概念变化是 GPT-4 不再局限于纯文本输入。

另一个主要差异是训练后对齐的重要性。

GPT-3 已经展示了强大的少样本学习能力,但 GPT-4 更加强调基于人类反馈的强化学习(RLHF)、安全调优、拒绝行为和指令遵循。根据报告,这些训练后过程显著提高了事实性、对期望行为的遵循度和响应安全性。

这导致了现代 AI 系统背后最重要的思想之一:

能力不仅仅来自规模。

GPT-4 表明,强大的 AI 行为来自以下各项的组合:

  • 大规模预训练
  • 扩展定律
  • 优化改进
  • 对齐训练
  • RLHF
  • 训练后精炼

在实践中,由于这个额外的对齐层,GPT-4 感觉不像是一个原始的预测模型,而更像是一个交互式助手。

这种区别在历史上很重要。

GPT-3 表明,扩展语言模型可以解锁强大的涌现行为。GPT-4 表明,仅靠扩展是不够的——模型还需要对齐、安全训练和面向部署的精炼,才能在现实世界中广泛使用。

可预测扩展

GPT-4 技术报告中最重要的思想之一是许多人在论文刚发布时忽略的东西:可预测扩展。

早期几代大语言模型涉及大量不确定性。

研究人员可以训练更大的系统并希望性能会提高,但没有人完全知道扩展能走多远,或者大规模训练运行是否会在预期的行为方式下完成。

GPT-4 改变了这一点。根据报告,OpenAI 开发了基础设施和优化方法,使他们能够使用计算量少数千倍的模型准确预测 GPT-4 的最终训练损失,甚至某些能力。

这比它最初听起来要重要得多。GPT-3 证明了扩展语言模型是有效的。

GPT-4 表明扩展开始成为可预测的工程,而不是试错实验。

这一转变引入了几大优势:

  • 在训练大规模模型之前更好的能力预测
  • 减少因训练失败而浪费数百万美元的风险
  • 通过更早评估模型行为实现更安全的部署规划
  • 从小规模实验到前沿系统的更可靠扩展

报告还显示,模型损失在不同规模上遵循了非常稳定的幂律行为,使 OpenAI 能够在训练完成之前很早就估计 GPT-4 的最终性能。

但论文也提出了一个重要观点:并非每种能力都能平稳扩展。某些行为,特别是与推理相关的任务,可能会出现不可预测的涌现,甚至在改善之前暂时恶化。

可预测扩展的一些重要局限性包括:

  • 某些能力在更大规模下仍然难以预测地涌现
  • 基准性能可能呈非线性行为,而不是平稳提升
  • 随着模型继续增长,扩展定律可能不会永远成立
  • 即使训练曲线可预测,推理失败和幻觉仍可能意外出现

这种可预测扩展与意外涌现之间的张力成为现代前沿 AI 研究的定义性主题之一。

模型架构

GPT-4 技术报告最不寻常的一个方面是 OpenAI 对实际模型架构透露得极少。

如上所述,在 GPT-1、GPT-2 和 GPT-3 论文中,OpenAI 公开讨论了参数数量、数据集大小、扩展配置和训练方法等细节。

GPT-4 则非常不同。报告省略了几个主要技术细节,如准确的参数数量、精确的架构配置、数据集大小和组成、训练计算量以及硬件基础设施和设置。

报告明确指出,这些省略是出于竞争格局和大规模 AI 系统安全考虑的动机。

这一决定成为本次发布讨论最多的话题之一。

从历史上看,GPT-4 标志着前沿 AI 研究开始变得更加封闭和产品导向。早期的 GPT 论文给人以传统研究出版物的感觉。GPT-4 给人的感觉更像是一家在全球规模部署 AI 的公司发布的受控系统报告。

尽管许多实现细节仍然隐藏,报告还是确认了几件重要的事情:

  1. GPT-4 仍然是一个基于 Transformer 的模型,使用自回归下一个 token 预测进行训练。
  2. 与之前的 GPT 系统一样,它顺序生成输出,同时使用自注意力机制处理上下文。
  3. GPT-4 是多模态的,意味着它可以接受图像和文本输入,同时产生文本输出。

这是 GPT 系列最大的架构转变之一,因为它将模型从纯语言理解扩展到了视觉和文本的联合推理。

另一个重要组成部分是训练后对齐。在实践中,这意味着 GPT-4 不再仅仅是一个原始的预训练语言模型。它是一个经过多个阶段精心加工的系统:

  • 大规模预训练
  • 优化和扩展改进
  • 多模态整合
  • RLHF 对齐
  • 安全微调
  • 面向部署的训练后处理

围绕 GPT-4 架构的保密在历史上很重要,因为它反映了 AI 领域发生的更广泛变化。

随着语言模型变得具有商业价值和社会影响,前沿 AI 研究开始从完全开放转向受控披露、以安全为重点的部署和竞争保护。

多模态学习

GPT-4 最重要的突破之一是模型不再局限于纯文本。GPT-4 可以接受图像和文本作为输入,同时生成文本输出。

这在今天听起来可能很简单,但在当时,这代表了对大语言模型思考方式的重大转变。

早期的 GPT 系统纯粹使用语言。GPT-4 将这个想法扩展到了更广泛的领域:一个能够同时推理多种信息形式的模型。

在实践中,GPT-4 可以分析:

  • 截图
  • 图表
  • 照片
  • 文档
  • 图表
  • 视觉笑话和梗
  • 混合图像和文本提示

报告通过几个示例展示了这种能力,但其中一个变得尤为难忘:著名的 VGA 线缆梗例。

在图像中,一部智能手机似乎连接到一个巨大的 VGA 显示器线缆适配器——这在现实生活中显然是荒谬的。GPT-4 正确地解释说,幽默来自于过时的 VGA 硬件与现代手机充电端口之间的不匹配。

这个例子重要的不是物体识别。模型正在从视觉场景中解释情境幽默。

这种区别很重要。

传统的计算机视觉系统通常可以识别图像中的物体,但 GPT-4 展示了更接近多模态推理的能力:在组合的视觉和文本信息中理解关系、上下文、意图甚至笑话。

报告还指出,许多为语言模型开发的提示技术(包括少样本提示和思维链推理)在多模态设置中继续有效。

这表明 GPT-4 不只是将图像分类器附加到聊天机器人上。相反,模型似乎将视觉和语言理解整合到了更统一的推理系统中。

从历史上看,这是 GPT 系列的一个重要时刻。

  • GPT-1 专注于语言预训练
  • GPT-2 扩展了零样本能力
  • GPT-3 引入了上下文学习
  • GPT-4 公开展示了实用的多模态 AI

与许多早期的研究演示不同,GPT-4 的多模态能力不仅仅是隐藏在论文中的实验原型。它们成为了数百万人使用的现实产品的一部分。

这一转变使得多模态 AI 感觉实用且可部署,而非纯粹的理论。

微调 vs 零样本 vs 少样本 vs 对齐多模态学习

理解 GPT 模型如何演进的最清晰方式之一是比较它们学习和适应任务的方式。

早期的 NLP 系统严重依赖带有标注数据集的微调,而后来的 GPT 模型越来越多地转向零样本提示、少样本学习,最终是对齐的多模态交互。

方面微调零样本学习少样本学习GPT-4 风格的对齐多模态学习
定义模型针对特定任务在标注数据上进行额外训练模型仅使用指令执行任务,无需示例模型从提示中的少量示例学习任务模型结合提示、多模态推理和对齐训练来执行通用任务
训练需求需要监督任务特定数据集无需任务特定训练或示例无需重新训练,但提示中需要演示大规模预训练加 RLHF、安全调优和多模态训练后处理
任务给定方式通过单独的训练阶段通过自然语言指令通过指令加示例通过对话提示、图像、指令和上下文交互
学习过程训练期间更新模型权重无权重更新无权重更新,学习发生在上下文中通过预训练、RLHF 对齐、多模态推理和上下文提示学习
灵活性通常专用于一个任务跨多个任务高度灵活灵活同时受益于演示作为通用多模态助手运行
适应性新任务需要重新训练通过提示即时适应通过上下文示例快速适应跨领域、模态和交互风格动态适应
数据依赖严重依赖标注数据集主要依赖预训练知识依赖预训练加提示示例依赖大规模多模态预训练和人类反馈对齐
性能通常在狭窄基准任务上最强通常弱于微调通常接近微调性能通常在多个推理和语言任务上超越专用系统
跨任务可扩展性昂贵且难以扩展极其可扩展无需重新训练即可扩展在语言、编码、推理和多模态任务上广泛扩展
计算成本高,因为每个任务可能需要重新训练使用期间低使用期间低训练成本极高但跨多个应用高效部署
示例在情感分析数据集上微调模型”对这个句子的情感进行分类""正面:我喜欢这部电影。负面:这部电影很无聊…”上传图像并要求模型解释图表、解决代码或总结文档
主要优势在专业任务上高准确率简单性和广泛泛化灵活性和性能之间的良好平衡统一的具有对齐对话交互的多模态推理
主要弱点跨多个任务的可扩展性差可能误解任务格式或意图对提示质量和示例敏感仍会产生幻觉、推理错误,并需要大量的安全控制
最相关于传统 NLP 系统,GPT-1 时代GPT-2 风格提示GPT-3 和上下文学习GPT-4 和对齐的多模态基础模型
核心思想为每个任务专门训练从指令推断任务从上下文示例推断任务将规模、对齐、多模态和提示组合到可部署的 AI 系统中

RLHF 与对齐

GPT-4 与早期 GPT 模型最大的区别之一,是报告将对齐和安全性放在了多么重要的位置。

GPT-3 展示了令人印象深刻的少样本学习能力,但也暴露了严重的弱点。模型可能会产生幻觉事实、生成有害指令、自信地提供虚假信息,或无法可靠地遵循用户意图。

GPT-4 的设计考虑到了这些问题。

这一改进的主要部分来自基于人类反馈的强化学习(RLHF)。

在高层面上,RLHF 通过收集关于模型响应的人类反馈,然后使用该反馈将模型训练向偏好行为。系统不只从互联网文本中学习,还从人类判断中学习——哪些答案是有帮助的、安全的、准确的或合适的。

根据报告,GPT-4 经过了广泛的训练后对齐,旨在提高:

  • 事实准确性
  • 指令遵循
  • 拒绝行为
  • 无害性
  • 对用户意图的遵循

这个对齐层是 GPT-4 与原始预训练语言模型感觉不同的主要原因。

报告反复强调拒绝行为是一项重要的安全能力。

GPT-4 的早期版本有时会生成危险指令,包括在内部测试期间提供有害化学合成建议或武器相关内容。OpenAI 使用对抗测试、领域专家、RLHF 训练和额外的安全管道来显著减少这些行为。

报告中展示的示例尤为有启发性。

在一个案例中,早期的 GPT-4 版本提供了关于制造危险材料的详细回答。后来对齐的版本则拒绝请求并安全地重定向对话。

重要的是,GPT-4 不仅仅是被做得”更具限制性”。

报告还讨论了相反的问题:模型变得过于谨慎。OpenAI 专门致力于减少对无害请求的不必要拒绝,同时仍然阻止危险请求。

在实践中,对齐成为以下各项之间的平衡行为:

  • 有用性
  • 安全性
  • 诚实性
  • 灵活性
  • 可靠性

论文还引入了基于规则的奖励模型和模型辅助安全管道,帮助引导 GPT-4 在训练期间走向更安全的行为。

从历史上看,报告的这一部分标志着 AI 发展的另一个重大转变。

早期的 GPT 论文主要关注能力和扩展。GPT-4 将对齐和部署安全视为核心工程问题而非次要关注。

这种转变反映了整个行业更深层次的认识:一旦 AI 系统强大到足以在全球规模上实际部署,仅提高智能已不再足够。系统还需要安全地运行、可靠地遵循人类意图,并抵御有害滥用。

基准测试与实验

GPT-4 技术报告中最引人注目的部分之一是评估过程的庞大规模。

根据报告,OpenAI 在广泛的学术考试、专业认证、推理任务、编程基准和传统 NLP 评估上测试了 GPT-4。

目标不仅仅是展示 GPT-4 可以生成流畅的文本。评估旨在衡量模型是否能够推理、解决问题、遵循指令、回答问题和跨多个不同领域泛化。

人类考试结果在报告发布时引起了巨大关注。

GPT-4 在几项知名考试中取得了特别强劲的成绩:

  • 统一律师资格考试 → 约前 10% 的考生
  • LSAT → 约第 88 百分位
  • SAT 阅读与写作 → 约第 93 百分位
  • GRE 语文 → 约第 99 百分位
  • 多项 AP 考试 → 强劲表现

与 GPT-3.5 的比较在某些情况下尤为惊人。例如,报告指出 GPT-3.5 在模拟律师资格考试中得分接近垫底的 10%,而 GPT-4 达到了前 10%。

这些结果帮助改变了公众对大语言模型的看法。

早期的系统通常被视为自动补全引擎或文本生成器。GPT-4 证明扩展和对齐可以产生在原本为人类设计的许多任务上具有竞争力表现的系统。

报告还在广泛的标准 NLP 基准上评估了 GPT-4。

一些最重要的包括:

  • MMLU → 广泛的学术和专业推理基准(57 个学科)
  • HellaSwag → 常识推理
  • HumanEval → 编码和 Python 合成任务
  • GSM8K → 小学数学推理
  • ARC → 科学推理问题
  • WinoGrande → 指代和常识推理

在大多数这些评估中,GPT-4 大幅超越 GPT-3.5,通常超过先前的 SOTA 语言模型。在几个案例中,它甚至超过了依赖于基准特定微调或专门工程管道的系统。

一个特别重要的基准是 MMLU(大规模多任务语言理解),它测试了 57 个不同学科的知识和推理能力。GPT-4 在这个基准上取得了极为强劲的表现,包括翻译成多种语言的多语言变体。

编码评估也具有历史意义。在 HumanEval 和 LeetCode 风格的任务上,GPT-4 展示了与早期 GPT 系统相比在代码生成和问题解决方面的重大改进。

这一能力最终成为现代 AI 编码助手的基础之一。

使得这些实验尤为重要的一点是,GPT-4 在多个不同类别中同时表现良好:

  • 推理
  • 编码
  • 数学
  • 语言理解
  • 专业考试
  • 多语言任务
  • 常识推理

这种广度是让 GPT-4 感觉与早期系统有质的不同的一部分原因。

GPT-4 不是在一个狭窄的基准上出类拔萃,而是在各种智力任务中展示了越来越通用的行为。

编码与推理能力

GPT-4 相比早期模型最明显的改进领域之一是编码和结构化推理。

虽然 GPT-3 已经能够生成代码,但 GPT-4 将这些能力推向了更远。根据报告,模型在编程基准、数学推理任务和多步骤问题解决上展示了巨大的进步。

报告中强调的一个关键基准是 HumanEval,它衡量模型从自然语言描述生成有效 Python 函数的能力。

GPT-4 在这个基准上显著超过了 GPT-3.5,展示了更强的代码合成和问题解决能力。

报告还包括了跨简单、中等和困难编程问题的 LeetCode 风格评估。

虽然 GPT-4 仍然在困难的竞赛编程任务上遇到困难,但它的表现大大优于 GPT-3.5,特别是在简单和中等级别的编程挑战上。

这些改进在实践中变得极其重要。

在 GPT-4 发布前后,AI 编码助手开始在真实的软件开发工作流中变得真正有用。基于 GPT-4 构建的系统可以帮助开发者:

  • 生成函数
  • 解释代码
  • 调试错误
  • 重构实现
  • 编写文档
  • 解决算法问题

这是大语言模型开始作为实用工程工具而非实验演示的时刻之一。

报告还强调了思维链提示对推理任务的重要性。

思维链提示鼓励 GPT-4 在得出结论之前逐步推理,而不是强迫模型立即给出答案。

例如,在 GSM8K(小学数学问题数据集)等基准上,GPT-4 在允许生成中间推理步骤时表现要好得多。

这成为人们与大语言模型交互方式的另一个重大转变。早期系统通常被当作直接答案生成器。GPT-4 表明,提示模型”思考和理解”一个问题可以显著提高推理密集型任务的性能。

与 GPT-3.5 相比,GPT-4 在多个领域始终展示了更强的推理能力:

  • 编码
  • 数学
  • 结构化问题解决
  • 常识推理
  • 学术评估

当然,模型还远非完美。

报告反复指出,GPT-4 仍然会产生幻觉、犯逻辑错误、在复杂的推理链条中失败,或自信地产生错误的解决方案。

但从历史上看,报告的这一部分很重要,因为它帮助建立了一个新的 AI 应用类别:大语言模型作为交互式推理和编码助手。

这个想法迅速成为现代 AI 系统的定义性用例之一。

多语言能力

GPT-4 技术报告中一个被低估的方面是模型在多种语言中的强劲表现。

早期语言模型通常严重以英语为中心。即使存在多语言支持,低资源语言的性能通常相比英语基准有显著下降。

GPT-4 在这一领域展示了显著的进步。

为了评估多语言推理能力,OpenAI 使用机器翻译系统将 MMLU 基准——一个涵盖 57 个学科的广泛学术和专业推理基准——翻译成多种不同语言。

根据报告,GPT-4 在大多数测试语言中表现极佳,在许多情况下甚至超过了早期模型的英语语言性能。

使得这一点尤为重要的一点是,改进不仅限于法语、德语或西班牙语等高资源语言。

报告特别强调了在低资源语言中的强劲性能提升,如:

  • 拉脱维亚语
  • 威尔士语
  • 斯瓦希里语
  • 孟加拉语
  • 尼泊尔语
  • 马拉地语
  • 泰卢固语

这表明了大规模语言建模的一个重要特征:随着模型扩展和训练数据变得更加多样化,学到能力开始以更稳健的方式超越英语泛化。

换句话说,在 GPT-3 中观察到的扩展效应并非纯粹的英语语言现象。

GPT-4 表明,许多推理和语言理解能力可以跨语言转移,即使可用的训练数据要少得多。

这在历史上意义重大,因为它将大语言模型推向了成为全球有用的系统,而不是主要为英语用户优化的工具。

多语言结果也强化了贯穿整个报告的另一个主要主题:GPT-4 并非狭隘地专攻单一领域或基准,而是行为越来越像一个通用推理系统,能够跨以下各项适应:

  • 语言
  • 任务
  • 模态
  • 领域
  • 交互风格

当然,多语言性能仍然参差不齐。

报告并未声称在所有语言中都具有完美的流畅性或同等的推理质量。低资源语言仍然面临主要挑战,并且评估本身在许多多语言设置中仍然困难。

但与早期 GPT 系统相比,GPT-4 在多语言泛化方面展示了一个实质性的进步,这成为全球部署 AI 系统的重要里程碑。

涌现行为

围绕 GPT-4 最引人入胜的概念之一是涌现行为。

在大语言模型的语境中,涌现指的是随着模型变得更大、能力更强而意外出现的能力。某些技能不是在每个领域都平稳提升,而是一旦模型达到某个规模就似乎”激活”了。

GPT-3 已经通过少样本学习和上下文适应暗示了这种现象。GPT-4 更强烈地延续了这一趋势。

根据报告,许多能力随着规模增加呈非线性改进。

简单来说,将模型的大小或计算量翻倍并不只是让它在相同任务上稍微变好。有时,全新的行为会出现,而这些行为在较小的系统中是微弱的或基本不存在的。

这在推理任务中尤为明显。

GPT-4 相比 GPT-3.5 在编码、数学推理、学术评估、指令遵循和结构化问题解决方面展示了重大改进。

报告还强调了提示策略在更大规模下变得多么有效。

少样本提示在 GPT-4 中的效果远比早期系统可靠。同样,思维链提示对推理密集型任务变得显著更有用。

GPT-4 通常可以通过逐步推理一个问题来提高性能,而不是立即生成答案。

重要的是,这些能力并不是显式编程进系统的。模型仍然主要通过下一个 token 预测训练。但在足够的规模下,以下行为开始更加稳健地出现:

  • 多步骤推理
  • 代码合成
  • 上下文适应
  • 多语言泛化
  • 指令遵循
  • 图文推理

报告对可预测扩展的讨论也与这个想法直接相关。OpenAI 解释说,GPT-4 的能力通常可以通过扩展定律从较小的训练运行中估计。

同时,某些行为仍然难以干净地预测。论文甚至指出,随着模型变得更大,某些任务会意外改进或逆转更早的扩展趋势。

从历史上看,GPT-4 强化了 GPT 系列最大的教训之一:大语言模型不仅仅是随着扩展变得更加流畅,而是开始展示出质的不同行为。

这一认识从根本上改变了 AI 研究。研究人员不再将语言模型视为狭隘的 NLP 系统,而是越来越多地将它们视为通用学习系统,其能力可以随着规模、对齐和更好的训练方法持续涌现。

局限性

尽管基准结果令人印象深刻且拥有多模态能力,GPT-4 技术报告对模型的弱点却出人意料地坦率。

论文反复强调 GPT-4 仍然不完全是可靠的。

最大的问题之一仍然是幻觉。

与早期 GPT 系统一样,GPT-4 可以自信地生成不正确、捏造或误导的信息。模型可能产生听起来极具说服力的答案,即使底层事实是错误的。

这变得尤其危险,因为 GPT-4 通常比之前的模型更流畅、更具说服力。在实践中,更强的语言生成能力有时会让错误更难被用户注意到。

报告还讨论了推理失败。

虽然 GPT-4 在许多基准上的表现比 GPT-3.5 好得多,但它仍然可能在相对简单的逻辑任务上失败,犯算术错误,或在较长的推理链条中崩溃。

另一个重要局限是过度自信。

GPT-4 并不自然地”知道它不知道什么”。模型可以高度自信地呈现不确定或不正确的答案,这在医学、法律、教育或网络安全等高风险情况中造成了风险。

报告还指出,GPT-4 有一个知识截止点。模型的大部分训练数据在 2021 年 9 月左右结束,这意味着系统缺乏对之后发生的许多事件的可靠认知。

一个特别有趣的部分讨论了校准。

根据报告,预训练的 GPT-4 模型实际上校准得相当好——意味着其置信度通常与正确概率匹配。但训练后对齐和 RLHF 在某些情况下降低了校准质量。

这揭示了一个重要的权衡:让模型更有帮助和更对齐并不会自动让它们更真实或更好地校准。

论文还对偏见和不安全行为是诚实的。

因为 GPT-4 从大规模互联网数据集学习,它仍然可以反映训练数据中存在的社会偏见、刻板印象和问题模式。

OpenAI 讨论了减少有害输出的广泛努力,但报告明确承认不安全行为仍然是可能的。

一个例子是越狱:尝试使用对抗性提示或巧妙的对话操纵来绕过安全机制。根据报告,GPT-4 安全系统显著减少了有害行为,但坚定的用户仍然有时可能诱导出危险或违反策略的输出。

论文还强调,在没有额外保障、人类监督或验证系统的情况下,GPT-4 不应在高风险环境中被盲目信任。

这种诚实是报告仍然重要的原因之一:OpenAI 没有将 GPT-4 呈现为已解决的智能形式,而是将其框架为一个强大但不完美的系统,其不断增长的能力也带来了不断增长的风险。

从历史上看,这反映了 AI 研究文化的重大转变。

早期的论文主要关注提高性能。GPT-4 对能力和失败模式给予同等重视,因为一旦模型被广泛部署,理解局限性就变得和展示优势同样重要。

安全与风险

GPT-4 发布时 AI 领域已经改变的的最清晰迹象之一,就是报告中有多少篇幅致力于安全、风险分析和部署问题。

早期的 GPT 论文主要关注能力改进、扩展行为和基准性能。GPT-4 技术报告仍然讨论了这些主题,但安全性成为核心工程主题,而非次要讨论。

根据报告,OpenAI 在部署前进行了广泛的红队测试和对抗测试。

红队测试涉及故意尝试破坏系统、绕过保障措施、触发不安全输出或暴露危险行为。OpenAI 与外部领域专家合作,评估网络安全、虚假信息、化学和生物威胁等领域的风险。

这种类型的测试反映了思维方式的重大转变。

目标不再仅仅是:“模型能做令人印象深刻的事情吗?“而是:“如果强大的系统在全球规模上被滥用会发生什么?”

报告反复讨论了围绕危险指令生成的担忧。

在内部评估中,早期的 GPT-4 版本有时能够生成与危险材料、冒犯内容或剥削行为相关的不安全或有害信息。OpenAI 在公开部署前使用 RLHF、安全微调、基于规则的奖励模型和策略系统显著减少了这些风险。

网络安全问题也受到了大量关注。报告讨论了涉及以下方面的风险:

  • 钓鱼辅助
  • 恶意软件相关指导
  • 社会工程
  • 漏洞利用生成
  • 网络滥用工作流的自动化

虽然 GPT-4 并未呈现为自主黑客系统,但 OpenAI 清楚地认识到,越来越强大的语言模型如果不负责任的部署,可能会放大现有的网络安全威胁。

另一个特别重要的话题是生物安全。

报告解释说,领域专家评估了 GPT-4 是否能够有意义地协助用户获取有害的生物或化学知识。OpenAI 特别调查了模型是否可能帮助降低危险滥用的门槛。

这是第一次有主要 AI 论文将高级语言模型视为具有现实安全影响的双重用途技术。

报告还强调了部署监控和迭代安全改进。

OpenAI 没有将安全视为发布前解决的事情,而是将部署本身框架为学习过程的一部分。监控用户交互、识别失败模式、更新保障措施和改进拒绝系统成为持续的运营责任,而非一次性的研究任务。

从历史上看,这一部分可能是整个报告中最重要的部分之一。

GPT-4 标志着 AI 安全不再是一个小众的研究讨论,而成为旗舰前沿模型开发的核心组成部分的时刻。

这种转变反映了整个行业更深层次的认识:一旦 AI 系统强大到足以大规模部署,提高能力和管理风险就成为不可分割的工程问题。

讨论

回顾整个 GPT 系列,GPT-4 给人的感觉不像是一个研究模型的发布,更像是新的计算平台的开始。

GPT-1 引入了大规模语言预训练的概念。GPT-2 展示了零样本多任务行为。GPT-3 表明模型可以通过提示和上下文学习适应。

但 GPT-4 再次改变了对话。

根据技术报告,重点不再仅仅是让模型更大或提高基准分数。报告反复强调可靠性、部署、对齐、基础设施、多模态交互和安全工程。

这种转变在历史上很重要。

之前的 GPT 论文感觉像是主要面向机器学习社区发布的研究里程碑。GPT-4 感觉像是为全球规模的实际部署设计的基础设施。

通过 ChatGPT 等系统,这一点变得尤为清晰。

GPT-4 不仅仅是作为可下载的研究成果或基准模型发布。相反,它成为了整个 AI 产品生态系统的一部分:

  • 对话助手
  • 编程副驾驶
  • 企业 API
  • 生产力工具
  • 教育系统
  • 多模态接口

在实践中,GPT-4 帮助将大语言模型从孤立的研究演示转变为持续部署的软件平台。

另一个重大变化是围绕前沿 AI 系统的日益保密性。

与 GPT-2 和 GPT-3 不同,GPT-4 报告故意省略了许多技术细节,包括参数数量、架构细节、训练计算量和数据集组成。

OpenAI 部分通过安全问题和竞争格局来解释这一点,但更广泛的含义是重大的:前沿 AI 模型正在成为具有战略价值的技术,而非纯粹的学术研究项目。

这标志着大规模 AI 开发更加封闭的时代的开始。

报告还展示了为什么对齐成为如此核心的关注点。

随着语言模型变得更强大,与幻觉、有害输出、网络安全滥用、虚假信息和不安全推理相关的风险也在增加。GPT-4 将对齐不是作为可选改进层,而是作为核心工程要求。

这是 AI 系统历史上的另一个重大转变。

早期模型主要根据能力评估:

  • 准确率
  • 困惑度
  • 基准分数
  • 扩展行为

GPT-4 将讨论扩展到了以下领域:

  • 安全
  • 部署监控
  • 拒绝行为
  • 策略执行
  • 人类监督
  • 运营可靠性

模型不再仅仅根据它能做什么来判断,还根据它在现实环境中表现得多安全和一致来判断。

在许多方面,GPT-4 也代表了现代基础模型生态系统的崛起。

不再为每个单独任务训练单独的系统,一个大型对齐模型可以作为共享基础服务于许多应用:

  • 编码
  • 辅导
  • 搜索
  • 写作
  • 研究辅助
  • 客户支持
  • 多模态交互
  • 企业工作流

这个想法从根本上改变了软件行业。

结论

GPT-4 技术报告标志着现代 AI 系统历史上最重要的转折点之一。

根据报告,GPT-4 不仅仅是更大的语言模型。它是一个多模态、对齐的基础模型,专为全球规模的实际部署而设计。

模型结合了在整个 GPT 系列中演进的几大核心理念:

  • 大规模 Transformer 预训练
  • 自回归下一个 token 预测
  • 扩展定律
  • 少样本提示
  • 多模态推理
  • 基于人类反馈的强化学习
  • 以安全为重点的训练后处理

这些组件共同产生了一个感觉上与早期 GPT 模型有质的不同系统。

GPT-4 表明,扩展本身已不再是完整的叙事。

GPT-3 表明更大的模型可以通过规模发展出强大的涌现能力。GPT-4 表明,对齐、安全工程、训练后精炼和部署基础设施成为构建有用 AI 系统的同等重要部分。

这种规模与对齐的组合最终成为现代前沿 AI 开发背后的主导范式。

报告还反映了整个行业正在发生的更广泛转变。

大语言模型不再被视为孤立的研究实验或基准系统。GPT-4 通过产品、API、多模态助手、编码系统、企业工具和像 ChatGPT 这样的全球可访问对话接口,将 AI 推向了现实世界的部署。

从历史上看,GPT-4 代表了基础模型成为日常计算实用基础设施的时刻。

最终洞见

纵观整个 GPT 系列,演进路径变得异常清晰。

GPT-1 引入了大规模预训练可以产生可迁移语言表示的概念。与其为每个任务从头开始训练单独的 NLP 系统,模型可以先学习通用语言模式,然后通过微调适应。

GPT-2 通过展示足够大的语言模型可以在没有显式监督训练的情况下执行零样本任务,进一步推进了这一概念。模型不再仅仅是记忆任务——而是开始从语言本身泛化。

GPT-3 再次改变了范式。少样本提示和上下文学习表明,模型可以在推理过程中动态适应,仅仅通过提示中的示例。这将提示转化为与 AI 系统交互的新界面。

然后 GPT-4 将这个想法扩展到了更大的范畴。重点不再仅仅是扩展模型或提高基准分数。GPT-4 引入了一个对齐多模态基础模型的时代:系统不仅被设计为生成语言,还要安全运行、遵循指令、跨模态推理,并作为可部署的基础设施用于现实应用。

从历史上看,这可能是最重要的转变。

GPT-4 不仅仅是更大的语言模型。

它标志着从实验性大语言模型向融入日常计算、软件开发、教育、生产力工具和多模态人机交互的全球部署 AI 助手的过渡。

而且在许多方面,我们仍然只处于这一过渡的开端。

GPT-1 vs GPT-2 vs GPT-3 vs GPT-4 关键差异

方面GPT-1GPT-2GPT-3GPT-4
核心思想预训练后微调仅预训练即可实现零样本行为大规模预训练实现少样本和上下文学习用于通用部署的对齐多模态基础模型
训练方法两阶段流水线:先预训练再微调单阶段语言建模相同的语言建模方法,但大规模扩展大规模预训练加 RLHF、安全调优和多模态训练后处理
监督需要下游任务标注数据无需监督微调即可执行任务可以通过提示和示例适应而无需重新训练使用对齐训练和 RLHF 改进指令遵循和安全性
任务处理每个任务单独微调主要通过零样本提示处理任务通过零样本、单样本和少样本提示处理任务通过对话提示、多模态交互和对齐响应处理任务
学习风格学习表示,然后专门化学习通用语言模式学习从上下文直接推断任务学习上下文推理、多模态理解和对齐交互行为
泛化能力微调任务之外有限更强的跨任务泛化更强的上下文适应和上下文学习跨语言、视觉、编码和推理任务的广泛多模态泛化
提示使用重要性最小提示变得有用提示成为系统行为的核心提示成为 AI 系统的主要交互界面
推理行为训练后基本静态推理期间可以泛化推理期间可以动态适应可以跨文本和图像交互式推理,具有对齐的对话行为
架构Transformer(基于解码器)Decoder-only TransformerDecoder-only Transformer,大规模扩展基于 Transformer 的多模态自回归模型
模型规模~1.17 亿参数最多 15 亿参数最多 1750 亿参数OpenAI 未公开
上下文窗口较小的上下文长度最多 1024 token2048 token 上下文窗口更大的上下文处理能力,支持多模态输入
训练数据BookCorpus 和精选数据集WebText 互联网数据集包含 Common Crawl、WebText、Books 和 Wikipedia 的大规模多源数据集大规模多模态和互联网规模数据集(细节未公开)
关键能力迁移学习零样本学习少样本和上下文学习多模态推理和对齐的 AI 辅助
性能风格微调后强劲无需任务特定训练即强劲仅通过提示通常可与微调系统竞争在多个基准上通常超越先前的 SOTA 系统
扩展重要性中等重要论文的核心研究策略扩展加对齐成为主导范式
主要局限需要标注数据集和重新训练推理较弱,零样本行为不一致极高的计算需求幻觉、推理错误、需要大量安全控制

:原始文章在最后还包括 PyTorch 实现 GPT 架构演进和资源推荐等附加章节,因抓取截断未能完整收录。原文链接:https://www.freecodecamp.org/news/ai-paper-review-gpt-4-technical-report/