模型与实验室 4.0 · 优秀 2026-09-24 · 论文

Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs (arXiv:...

提出叠加线性假设:把来自不同文本流的输入线性组合后,LLM 输出各流独立 next-token 分布的叠加证据显示叠加是 Transformer 架构的内在属性而非训练涌现它随预训练推进而减弱;轻量微调可大幅恢复线性;作者还给出引导解码流程,单次前向传播即可同时生成两段连贯续写对可解释性与解码策略方向有直接参考价值

打开原文回到归档

Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs

Source: <https://arxiv.org/abs/2609.29845&gt;
Authors: Pavel Tikhonov, Anton Korznikov, Matvey Mikhalchuk, Nikita Dragunov, Temurbek Rahmatullaev, Polina Druzhinina, Anton Razzhigaev, Ivan Oseledets, Elena Tutubalina
Published: 2026-09-24 · cs.CL, cs.AI · arXiv:2609.29845

摘要(基于论文摘要)

LLM 的组件高度非线性,但这篇论文展示了一个基础线性现象:把来自不同文本流的输入线性组合后,模型输出的是各个流独立 next-token 分布的叠加。作者称之为"叠加线性假设"(Superposition Linearity Hypothesis)。

三个发现(均来自摘要):第一,叠加是 Transformer 架构的内在属性,不是训练涌现的产物——事实上它随预训练推进而减弱;第二,轻量微调可以大幅恢复线性,显著缩小"预测分布"与"各流独立分布平均"之间的散度;第三,作者提出一个引导解码(guided decoding)流程,可以把叠加输出解耦,实现单次前向传播同时生成两段连贯的续写。

Field note

"架构性质、训练中减弱、微调可恢复"这个三段式是全文最有信息量的部分——它把线性叠加从"训练副产品"重新定位为架构基座性质。单次前向同时生成两段连贯文本的演示很直观。对可解释性和 speculative decoding 方向的人值得读原文的方法细节。