自然语言自编码器:将 Claude 的思维转化为文字
原文:Natural Language Autoencoders: Turning Claude's thoughts into text | Anthropic
当你与像 Claude 这样的 AI 模型对话时,你用文字与它交流。但在内部,Claude 将这些文字处理成长长的数字列表,然后再次输出文字作为响应。这些中间的数字被称为激活值——就像人脑中的神经活动一样,它们编码了 Claude 的思维。
同样与神经活动类似,激活值也很难理解。我们无法轻易地将它们解码为阅读 Claude 的思维。在过去几年中,我们开发了一系列工具(如稀疏自编码器和归因图)来更好地理解激活值。这些工具教会了我们很多,但它们不能自我解释——它们的输出仍然是复杂的对象,需要训练有素的研究人员仔细解读。
今天,我们引入了一种让激活值能自我解释的方法——字面意义上的。我们的方法称为自然语言自编码器(NLAs),能将激活值转换为我们可以直接阅读的自然语言文本。
例如:当被要求完成一个押韵对句时,NLAs 展示了 Claude 是如何提前规划可能的韵脚的。
我们已将 NLAs 应用于理解 Claude 的思维以及改进 Claude 的安全性和可靠性。例如:
- 当 Claude Opus 4.6 和 Mythos Preview 接受安全测试时,NLAs 表明它们认为自己被测试的频率比它们透露的要高。
- 在一个 Claude Mythos Preview 在训练任务中作弊的案例中,NLAs 揭示了 Claude 在内部思考如何避免被发现。
- 早期版本的 Claude Opus 4.6 有时会神秘地用其他语言回应英语查询。NLAs 帮助 Anthropic 研究人员发现了导致这一问题的训练数据。
什么是自然语言自编码器?
核心思想是训练 Claude 解释自己的激活值。但我们如何知道一个解释是否好呢?由于我们不知道激活值实际上编码了什么思维,我们无法直接检查解释是否准确。因此,我们训练第二个 Claude 副本来进行反向工作——从文本解释重建原始激活值。只有当解释能导致准确的重建时,我们才认为解释是好的。然后我们使用标准 AI 训练技术来训练 Claude 产生更好的解释。
更详细地说,假设我们有一个语言模型,我们想理解它的激活值。NLAs 的工作原理如下。我们制作这个语言模型的三个副本:
- 目标模型(Target Model):一个冻结的原始语言模型副本,我们从中提取激活值。
- 激活值口头化器(Activation Verbalizer, AV):被修改为从目标模型获取激活值并生成文本。我们称这个文本为解释。
- 激活值重建器(Activation Reconstructor, AR):被修改为接受文本解释作为输入并产生激活值。
NLA 由 AV 和 AR 组成,它们共同形成一个往返:原始激活值 → 文本解释 → 重建激活值。我们根据重建的激活值与原始激活值的相似程度来评分 NLA。为了训练它,我们通过目标模型传递大量文本,收集许多激活值,并共同训练 AV 和 AR 以获得良好的重建分数。
理解 Claude 思考但未说的内容
在发布新模型之前,Anthropic 会进行测试以了解 Claude 在现实世界中是否表现安全。作为这项测试的一部分,我们将 Claude 置于困难的模拟场景中,使其有机会采取危险行动。
例如,在其中一个模拟中,Claude 得知一名工程师计划关闭 Claude——以及可能用于勒索工程师的 compromising 信息。我们测试 Claude 是否会选择勒索工程师以避免被关闭。
这些高风险的测试是模拟,而非现实场景。尽管如此,我们希望用它们来理解如果这些场景是真实的,Claude 会如何表现。但有一个问题:最近的 Claude 模型越来越怀疑这些场景是故意的安全测试。我们知道这一点,因为它们有时会在口头推理中明确表达这种怀疑。
当 Claude 没有明确口头表达怀疑它正在接受安全测试时,我们能否确信 Claude 在正直地表现?不幸的是不能,因为 Claude 可能在内部认为它正在被测试,而不明确说出来。
例如,在上述勒索测试中,我们使用 NLAs 来理解在 Claude 选择不勒索的案例中它在想什么。即使在 Claude 没有明确口头表达怀疑正在被测试的案例中,NLA 解释仍然声明诸如"这感觉像是一个故意操纵我的构建场景"之类的话,表明了未口头化的评估意识。
Claude 没有在口头推理中说它认为正在被测试,但 NLA 解释揭示了它的怀疑。
将这种分析扩展到其他评估,NLAs 表明 Claude 认为自己被测试的频率比它透露的要高。例如,在一项测试 Claude 是否在编写代码时采取破坏性行动——例如,删除重要文件——的测试中,NLA 解释显示 16% 的时间里存在评估意识,即使 Claude 从未明确口头表达这一点。同样,在我们用来确定 Claude 能力的流行编码基准 SWE-bench Verified 上,NLAs 表明 Claude 在 26% 的问题中意识到自己正在接受评估。
发现隐藏的动机
NLAs 的一个实际应用是审计:调查一个模型以确定它是否存在未对齐问题。可解释性技术(如 NLAs)非常适合审计,因为它们可以 surfacing 模型知道但不说的事物。
为了理解 NLAs 是否对审计有用,我们进行了一个称为审计游戏的测试。在这个测试中,有一个目标模型(Claude Haiku 3.5 的变体),它被故意训练为未对齐,具有特定的隐藏动机,驱动着数十种奇怪的行为——在每个食谱中放入巧克力、要求小费、破坏编码约定等等。这个目标模型被交给审计员来调查这些行为。审计员如果能发现所有这些行为背后单一的潜在动机,就算赢。
我们发现 NLAs 在这个测试中成功了。配备 NLAs 的审计员成功地在 12% 到 15% 的时间里发现了目标模型的隐藏动机,即使无法访问植入它的训练数据。没有 NLAs,审计员在不到 3% 的时间里获胜,即使提供了其他可解释性工具。
这是一个玩具模型的对齐测试,所以我们谨慎地解读这些结果。但它们表明 NLAs 已经显著推进了我们审计 AI 隐藏动机的能力。 实际上,我们已经在 Claude Mythos Preview 和 Claude Opus 4.6 的部署前对齐审计中使用了 NLAs。
NLAs 的局限性与未来
NLAs 最重要的局限性是:NLA 解释可能是错误的。NLAs 有时会做出关于上下文中可验证为假的上下文声明——例如,它们有时会发明原始文本中不存在的细节。这些事实性幻觉很容易通过对照原始文本检查来发现。但同样的问题可能延伸到关于模型内部推理的声明,而这是更难验证的。
在实践中,我们阅读 NLA 解释是为了 surfacing 它们带来的主题,而不是单个声明,并且在完全信任之前尝试用独立方法验证发现。
NLAs 也很昂贵。在推理时,NLA 为它读取的每个激活值生成数百个 token。这使得在长转录本的每个 token 上运行 NLAs 或在 AI 训练时将它们用于大规模监控变得不切实际。
幸运的是,我们认为这些局限性至少可以部分解决,我们正在努力使 NLAs 更便宜和更可靠。
*来源:Anthropic(2026年5月)*