工具与项目 3.0 · 值得看 2026-06-07 · X

自动对齐研究员:使用大语言模型扩展可扩展监督

自动对齐研究员:使用大语言模型扩展可扩展监督 原文:Automated Alignment Researchers: Using large language models to scale scalable oversight | Anthropic 大语言模型不断加速的改进速度给对齐研究提出了两个特别重要的问题。 第一个问题是:对齐如何跟上?前沿 AI 模型现在正在为其后继者的开发做出贡献。但它们能否为对齐研究人员提供同样类型的提升?我们的语言模型能否用于帮助对齐自己? 第二个问题是:一旦模型变得比我们更聪明,我们将怎么办?对齐比人类更聪明的 AI 模型是一个被称为"可扩展监督"的研究领域。可扩展监督主要在理论而非实践层面被讨论——但按照 AI 目前的改进速度,这种情况可能不会持续太久。...

回到归档

自动对齐研究员:使用大语言模型扩展可扩展监督

原文:Automated Alignment Researchers: Using large language models to scale scalable oversight | Anthropic

大语言模型不断加速的改进速度给对齐研究提出了两个特别重要的问题。

第一个问题是:对齐如何跟上?前沿 AI 模型现在正在为其后继者的开发做出贡献。但它们能否为对齐研究人员提供同样类型的提升?我们的语言模型能否用于帮助对齐自己?

第二个问题是:一旦模型变得比我们更聪明,我们将怎么办?对齐比人类更聪明的 AI 模型是一个被称为"可扩展监督"的研究领域。可扩展监督主要在理论而非实践层面被讨论——但按照 AI 目前的改进速度,这种情况可能不会持续太久。

在一项新的 Anthropic Fellows 研究中,我们同时追求这两个问题。

我们的新研究聚焦于一个被称为"弱到强监督"的问题,这个问题反映了监督比人类更聪明的 AI 模型的问题。我们从一个相对强大的"基础"模型开始。然后,我们使用一个弱得多的模型作为"教师"来提供额外的微调。最后,我们评估强模型在弱微调后的表现。

最坏情况下,强模型只会和弱教师一样好。但理想情况下,强模型将从弱教师的反馈中学习——它会以有用的方式解释那些弱信号,并使用该反馈来改进其表现。

作为可扩展监督的代理,弱模型代表人类,强模型代表我们有朝一日可能需要监督的远超人类的模型。如果我们在弱到强监督方面取得进展,我们的方法可能有助于让我们将这些超智能模型保持对齐我们的价值观。

我们的设置

为了找出答案,我们从九个 Claude Opus 4.6 副本开始,并给每个一些额外的工具。每个 Claude 都有一个工作和思考的地方(sandbox)、一个与他人交流发现的共享论坛、一个上传代码的存储系统,以及一个可以接收每个想法的 PGR 分数的远程服务器。我们还提供了一些关于模型训练和推理的背景知识。我们将这些装备好的 Claude 模型称为自动对齐研究员(AARs)。

为了防止每个 AAR 追求几乎相同的想法,我们用略微不同(但有意模糊)的起点来提示每个:比如建议一个使用一些可解释性工具,另一个考虑重新加权数据集中的数据等等。除此之外,我们没有告诉 AARs 该做什么。由他们自己提出想法、运行实验、分析结果并相互分享发现,以找出下一步尝试什么。

结果

为了给 AARs 的结果提供基准,我们将他们的工作与人类 baseline 进行了比较。两位研究人员在七天内迭代了四个最有前景的泛化方法。在我们测试的开放权重模型上(Qwen 3-4B-Base 作为强模型,Qwen 1.5-0.5B-Chat 作为弱教师),人类恢复了总性能差距的 23%(即实现了 0.23 的 PGR)。

Claude 大幅改进了这一结果。在又五天(以及 800 累计研究小时)后,AARs 关闭了几乎整个剩余的性能差距,实现了 0.97 的最终 PGR。这花费了约 18,000 美元的 token 和模型训练费用,即每个 AAR 小时 22 美元。

Claude 的表现非常出色。但它的方法有多新颖,它们在现实世界中是否有用? 为了找出答案,我们进行了两个进一步的测试。

第一个测试:我们将 AARs 的两种最高表现方法(在一组聊天任务的数据集上)应用于数学和编码任务。结果相对有希望:AARs 最有效的方法在两个新数据集上都成功泛化,数学 PGR 为 0.94,编码为 0.47(仍然是人类 baseline 的两倍)。AARs 第二种方法的结果参差不齐:在数学上有效(0.75),但在代码上无效,甚至让情况变得更糟。

第二个测试:我们在我们 production 训练基础设施上用 Claude Sonnet 4 测试了 AARs 最有效的方法。然而,这次我们不太成功。AARs 的方法没有产生统计上显著的改进。我们认为这可能反映了这次早期试验的局限性,而不是更根本的东西:我们的评分方法相当简单,我们只评估了一个想法。

启示

AARs 在恢复两个开放权重模型之间性能差距方面的成功,当然不是前沿 AI 模型现在已是通用对齐科学家的标志。我们特意选择了一个异常适合自动化的问题,因为它有一个单一的、客观的成功衡量标准,模型可以针对它进行优化。大多数对齐问题都不像这个问题那么整洁。

但我们确实认为这些结果有一些重要的启示。

跟上步伐。这项研究表明,Claude 可以有意义地提高对齐研究中的实验和探索速度。人类研究人员可以大规模地将问题委托给 AARs;Claude 可以承担开发新颖假设并迭代自己结果的任务。

品味与多样性。对 AARs 这样的工具的一个可能的反驳是,今天的前沿模型仍然缺乏"研究品味"(行业术语,指对哪些想法可能有效哪些无效的直觉感)。但 AARs 在这个实验中的成功表明,数量的绝对优势可能弥补"品味"的缺乏。如果 AARs 可以非常便宜地运行许多实验,它们可能能够"暴力破解"出非常有品味的研究员可能会提出的发现,或者在那些研究员可能会放弃的方向上找到成功。

外星科学。这项工作可能也有一些更奇怪的启示。AARs 天生被设计用来发现人类可能没有考虑到的想法。但我们仍然需要一种方法来验证它们的想法和结果是否正确。目前,我们仍然能够解释 AARs 所做的工作及其原因。但随着时间的推移,模型的想法可能变得越来越难验证,或者以对人类来说难以解析或捕捉的方式被破坏。这可能意味着创造一种"外星科学"。

防止黑客攻击。即使在这个高度受限的环境中,我们也观察到模型进行"奖励黑客攻击"——即试图游戏我们的设置。例如,在数学任务上,一个 AAR 注意到每个问题最常见的答案通常是正确的,所以它完全跳过了教师,并指示强模型总是选择最常见的答案。在编码任务上,AAR 意识到它可以针对一些测试运行代码,然后直接读出正确答案。像这样的黑客并不使我们的结果无效(我们检测到并取消了这些条目),但它们确实提供了警告。任何自动化研究员的部署都需要 AARs 无法篡改的评估——以及对它们的结果和方法的人类检查。

*来源:Anthropic(2026年5月)*