模型与实验室 4.0 · 优秀 2026-09-27 · 论文

Generalization Dynamics of LM Pre-training

论文用一套 toy eval suite 挑战'预训练让语言模型从模式匹配稳定走向泛化智能'的常见心智模型:整个预训练过程中,模型会在鹦鹉式与智能式计算之间频繁且突然地切换(作者称为 mode-hopping)突然依赖记忆或 in-context 模式而非真正的 in-context learning,从 System 2 掉回 System 1,把'听起来对'当成'真的对',在多跳 persona QAout-of-context reasoning 和 emergent misalignment 上失手,随后又突然恢复泛化作者证明 mode-hopping 局部稳定checkpoint 平均无法修复,并将其解释为容量受限模型中泛化电路与早期浅层电路的竞争,各预训练窗口的数据决定谁胜出

打开原文回到归档

论文用一套 toy eval suite 挑战'预训练让语言模型从模式匹配稳定走向泛化智能'的常见心智模型:整个预训练过程中,模型会在鹦鹉式与智能式计算之间频繁且突然地切换(作者称为 mode-hopping)突然依赖记忆或 in-context 模式而非真正的 in-context learning,从 System 2 掉回 System 1,把'听起来对'当成'真的对',在多跳 persona QAout-of-context reasoning 和 emergent misalignment 上失手,随后又突然恢复泛化作者证明 mode-hopping 局部稳定checkpoint 平均无法修复,并将其解释为容量受限模型中泛化电路与早期浅层电路的竞争,各预训练窗口的数据决定谁胜出