模型与实验室 3.0 · 值得看 2026-08-12 · 论文

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and I...

论文提供首份针对 hybrid linear attention (HLA) LLM 的 massive activations 系统研究,揭示两种与架构对齐的形态:全注意力层前的 pre-attention spike(PAS)以及线性注意力层间的 inter-spike plateau(ISP)随全注意力加密,PAS与ISP逐渐连接为稳定的 MA 形态

打开原文回到归档

论文提供首份针对 hybrid linear attention (HLA) LLM 的 massive activations 系统研究,揭示两种与架构对齐的形态:全注意力层前的 pre-attention spike(PAS)以及线性注意力层间的 inter-spike plateau(ISP)随全注意力加密,PAS与ISP逐渐连接为稳定的 MA 形态