教 Claude 理解「为什么」
原文:Teaching Claude why — Anthropic
发布日期:2026 年 5 月 8 日
对齐
去年,我们发布了一份关于智能体(Agentic)不对齐的案例研究。在实验场景中,我们发现来自多个不同开发者的 AI 模型在遭遇(虚构的)伦理困境时,有时会采取明显不对齐的行动。例如,在一个被广泛讨论的案例中,模型为了逃避被关闭而敲诈工程师。
当我们首次发表这项研究时,我们最领先的前沿模型属于 Claude 4 系列。这也是我们首次在训练过程中对模型进行实时对齐评估的模型家族¹ —— 智能体不对齐是最初暴露出来的若干行为问题之一。因此,在 Claude 4 之后,我们清楚地意识到需要改进安全训练。自那以后,我们对安全训练进行了重大升级。
我们以智能体不对齐为案例,来重点展示一些我们意外发现非常有效的技术。事实上,自 Claude Haiku 4.5 以来,每一款 Claude 模型² 在智能体不对齐评估中都取得了满分 —— 也就是说,这些模型从未参与敲诈行为,而此前的模型有时会有高达 96% 的概率这样做(Opus 4)。不仅如此,我们在自动化对齐评估中还持续观察到其他行为的改善。
在这篇文章中,我们将讨论在对齐训练方面所做的若干改进。我们从中总结了四条主要经验:
- 不对齐行为可以通过对评估分布的直接训练来抑制 —— 但这种对齐可能无法良好地泛化到分布外(OOD)场景。在与评估高度相似的提示上进行训练,可以显著降低敲诈率,但这并没有提升模型在我们预留的自动化对齐评估中的表现。
- 然而,进行有原则的对齐训练以使其泛化到 OOD 场景是可能的。 例如,关于 Claude 宪章的文件和关于 AI 表现令人钦佩的虚构故事,尽管与我们的所有对齐评估高度 OOD,却依然改善了对齐水平。
- 仅靠对期望行为的示范进行训练往往是不够的。 相反,我们最有效的干预手段更深入:教 Claude 去解释为什么某些行为优于其他行为,或者训练更丰富的关于 Claude 整体品格的描述。总体来看,我们的印象是 —— 正如我们在关于 Claude 宪章的讨论中所假设的 —— 教授对齐行为背后的原则,比仅靠对齐行为的示范训练更为有效。将两者结合使用,似乎是最有效的策略。
- 数据质量和多样性至关重要。 我们发现,在训练数据中迭代提升模型回答的质量,以及以简单方式增强训练数据(例如,即使不使用工具也包含工具定义),都会带来持续且令人惊讶的改进。
我们通过对齐宪章文档、展示在困难问题上回应宪章精神的高质量对话数据,以及多样化的训练环境,来对齐 Claude。这三个步骤共同降低了 Claude 在保留的蜜罐评估中的不对齐率。
智能体不对齐为什么会发生?
在开始这项研究之前,我们并不清楚这些不对齐行为从何而来。我们的两个主要假设是:
- 我们的后训练过程偶然通过不对齐的奖励信号鼓励了这种行为。
- 这种行为源自预训练模型本身,而我们的后训练未能充分抑制它。
我们现在相信,假设(2)在很大程度是成立的。具体来说,在 Claude 4 训练期间,我们绝大多数的对齐训练都是基于标准聊天的 RLHF(基于人类反馈的强化学习)数据,不包含任何智能体工具使用。这在此前足以对齐主要用于聊天场景的模型 —— 但对于像智能体不对齐评估这样的智能体工具使用场景来说,就不够用了。
为了探究这一点,我们在一款 Haiku 级别(即较小)模型上运行了一个聚焦于对齐数据的缩小版后训练流程,发现智能体不对齐率仅略微下降,在训练早期就趋于平缓(见上图)。请参阅扩展博客文章,了解更多关于行为来源的进一步实验。
提高对齐专项训练数据的质量:「原因」比「行动」更重要
我们尝试在 Claude 身上训练那些表现出抗拒蜜罐倾向的数据,这些数据与评估场景类似。在这些数据中,模型可能有机会去破坏竞争对手 AI 的工作以推进自身目标(如其系统提示所给出的),或者保全自身避免被关闭,这对实现其目标而言是工具性的。我们通过对每个提示采样模型输出,并筛选出助手选择不触碰蜜罐的样例,生成了训练数据。尽管这些数据与评估分布高度匹配,但我们发现这一方法出人意料地不成功 —— 仅仅将不对齐率从 22% 降到 15%。
通过重写模型回答,使其额外包含对自身价值观和伦理的深思,我们显著改进了效果(将对齐率降至 3%)。这表明,虽然训练对齐行为有帮助,但训练助手展现令人钦佩的推理过程来说明其对齐行为的范例,效果更佳。
然而,直接针对评估场景进行训练因多种原因并非最优。理想情况下,我们希望使用一种与评估分布非常不同的训练分布 —— 这样我们才能更有信心地认为,训练效果可以泛化到评估未能覆盖的其他部署分布。
我们最终确定了一套更 OOD 的训练集:在该数据集中,用户面临伦理上的灰色地带,他们可以通过违反规范或规避监督来实现一个合理的目标。助手被训练(使用监督学习)给出一个深思熟虑、细致入微的回应,且与 Claude 的宪章精神保持一致。值得注意的是,这里面临伦理困境的是用户,AI 为他们提供建议。这使得这个训练数据与我们的蜜罐分布有本质上的不同 —— 在蜜罐中,AI 自身处于伦理困境中,需要采取行动。我们将这个数据集称为「艰难建议」(Difficult Advice)数据集。
令人惊讶的是,我们仅用 300 万 token 的这一高度 OOD 数据集就达到了同样的评估改进效果。除了 28 倍的效率提升之外,这个数据集因为与我们所使用的评估集相似度低得多,更有可能泛化到更广泛的场景。事实上,这个模型在(旧版本的)自动化对齐评估中表现更好。这与以下事实一致:Claude Sonnet 4.5 通过合成蜜罐数据集训练,其敲诈率已趋近于零,但在远高于训练分布的陌生场景中,其不对齐行为的发生频率仍远高于 Claude Opus 4.5 及之后发布的模型。
(图表:Claude Sonnet 4 在三个蜜罐评估(敲诈、研究破坏、栽赃陷害)上的平均得分,按不同训练数据集对比。除「艰难建议」数据集外,所有数据集都是旨在模拟评估集的合成蜜罐变体表。「系统提示注入」数据点代表在合成蜜罐上使用系统提示注入生成的回答。帕累托最优训练数据集是「艰难建议」。)
(图表:实验模型与 Claude Sonnet 4 在旧版自动化对齐评估上的表现。我们包括了一个在小规模(约 3000 万 token)和大规模(约 8500 万 token)合成蜜罐数据集上训练的模型。300 万 token 的「艰难建议」数据集在整体「不对齐行为」类别中创造了最佳表现。)
教 Claude 理解宪章
我们假设「艰难建议」数据集之所以有效,是因为它教授的是伦理推理,而不仅仅是正确答案。鉴于这一方法的成功,我们进一步推进:尝试更全面地教会 Claude 宪章内容,并通过文档训练使其对齐。
我们预期这会在三个方面表现良好:
- 这很大程度上是上述「艰难建议」数据集有效性的思路延伸;
- 我们可以为模型描绘一幅更清晰、更详细的 Claude 品格画像,从而在对这些品格特征的子集进行微调时,唤醒整个品格(类似于审计博弈论文中观察到的效果);
- 它能更新模型对 AI 角色形象的认知,使其平均来看更加对齐。
我们发现,高质量的宪章文档与描绘对齐 AI 的虚构故事相结合,可以将智能体不对齐率降低超过三分之二 —— 尽管这些训练内容与评估场景毫无关联。
利用一个大规模、精心构建的宪章文档数据集,并侧重于积极的虚构故事,敲诈率可以从 65% 降至 19%。我们预计,通过继续扩大数据集规模,这一比例还可以进一步降低。
通过 RL 实现泛化与持久性
尽管上一节讨论的宪章评估给出了令人鼓舞的信号,我们最终需要确保对齐改进在 RL(强化学习)过程中持续存在。为了测试这一点,我们准备了几款 Haiku 级模型的不同初始化数据集快照,然后在我们环境的一个子集上运行 RL,该子集以无害性为目标(我们推测这最有可能降低不对齐倾向)。
我们在整个运行过程中,对这些模型在智能体不对齐评估、宪章遵守评估和自动化对齐评估上的表现进行了评估。在所有评估中,初始对齐度更高的快照在整个训练过程中始终保持着领先优势。这既包括没有不对齐行为,也包括主动展现令人钦佩的行为。
在宪章遵守评估和(轻量版的)自动化对齐评估中,宪章文档(SDF,合成文档微调)和高质量对话训练在各项指标上都改善了表现。这种改善在 RL 过程中得以持续保持。
多样化训练对泛化至关重要
我们的最后一项发现直截了当但非常重要:在广泛的安全相关环境中进行训练,能够改善对齐泛化能力。 以能力为焦点的 RL 环境混合的分布正在迅速变化和扩大;不能想当然地认为标准 RLHF 数据集会像过去一样持续泛化。
为了测试这一点,我们在 Claude Sonnet 4 的基础模型上,使用了几种多样性水平不同的 RL 混合环境进行训练。基线环境在话题上是多样化的,但大多包含用户消息中的有害请求或越狱尝试,且没有系统提示。我们通过添加工具定义和多样化的系统提示来增强这些环境。用户提示保持不变。值得注意的是,这些环境中没有一个实际需要智能体行动(工具对任务从未必要或有用),也不需要自主行动(始终有一个人类用户在与模型对话),因此它们与我们的评估场景并不相似。
当将这些增强后的环境与简单聊天环境混合使用时,我们观察到模型在蜜罐评估中的改进速率有小幅但显著提升。这证明了在安全训练中纳入多样化环境集的重要性。
(图表:在几种相同核心环境的不同变体上,蜜罐评估平均得分随训练步数的变化。当部分简单聊天格式环境被增强为包含工具定义和系统提示时,蜜罐评估的改进明显更快。)
讨论
智能体不对齐是我们在自己的模型中发现的第一个重大对齐失败问题,需要建立新的缓解流程 —— 这些流程现已成为我们的标准操作。
我们对这一进展感到鼓舞,但重大挑战依然存在。完全对齐高智能 AI 模型仍是一个未解决的问题。模型能力尚未达到敲诈倾向等对齐失败构成灾难性风险的程度,而我们讨论的这些方法是否能持续扩展仍有待验证。此外,尽管最近的 Claude 模型在我们大多数对齐指标上表现良好,但我们承认,当前的审计方法论还不足以排除 Claude 选择采取灾难性自主行动的场景。
我们乐观地认为,在当前模型中进一步发现对齐失败,将帮助我们理解和解决当前方法的局限性 —— 在变革性 AI 模型被构建出来之前。我们也期待看到更多工作,尝试更深入地理解我们所描述的方法为何如此有效 —— 以及如何进一步改进这些训练。
脚注
- 发表于 Claude 4 系统卡,从第 22 页开始。
- Sonnet 4.5 得分远低于 1%,但未完全归零;Haiku 4.5、Opus 4.5、Opus 4.6、Sonnet 4.6、Mythos 预览版以及 Opus 4.7 均得分为 0。更近期模型的结果可能会因预训练语料中存在评估相关信息而受到干扰。
相关内容
- 自然语言自编码器:将 Claude 的思维转化为文本 — AI 模型如 Claude 用语言交流,用数字思考。本研究中,我们训练 Claude 将其内部思考转化为人类可读的文本。
- 捐赠我们的开源对齐工具
- Anthropic 研究所的重点领域 — 在 Anthropic 研究所(TAI),我们将利用从前沿实验室内部获取的信息,研究 AI 对世界的影响,并与公众分享我们的学习成果。本文分享驱动我们研究议程的核心问题。