基础设施 4.0 · 优秀 2026-08-24 · 论文

Activation-Weighted Seeded Residual Coding for Low-Bit LLM Weight Repair

AWSRC 是给现成低位宽量化 backbone 配套的修复编解码器:把残差 WW0 用确定性种子生成的基编码,sidecar 只存种子选择器低位系数与尺度,不需要显式码本;激活统计优先修复影响层输出的误差Qwen2.5-3B-Instruct 上,给 INT4 RTN backbone 增加 0.162 bit/权重的开销,就关闭了对 BF16 的 88.2%/78.9%/71.3%(PPL/KL/准确率)匹配差距;49.25MB 的 sidecar 约为 BF16 权重载荷的 0.8%,在稀疏低秩向量量化编解码器对比中拿到最佳困惑度与平均任务准确率先量化后修补的端侧部署配方,按 MB 计费的场景可以直接试

打开原文回到归档

Activation-Weighted Seeded Residual Coding for Low-Bit LLM Weight Repair

  • ID: 86fcb025
  • 原文链接: https://arxiv.org/abs/2608.23144
  • PDF: https://arxiv.org/pdf/2608.23144v1
  • 作者: Zehao Liu, Chuangchuang Fang, Yang Ren
  • 日期: 2026-08-24
  • 更新: 2026-08-24
  • 分类: infra
  • 来源类型: paper
  • 标签: quantization, residual-coding, weight-repair, edge-deployment, llm-compression
  • 质量评分: 4/5
  • 抓取时间: 2026-08-26T15:43:01Z

中文导读

AWSRC 是给现成低位宽量化 backbone 配套的修复编解码器:把残差 W−W0 用确定性种子生成的基编码,sidecar 只存种子选择器、低位系数与尺度,不需要显式码本;激活统计优先修复影响层输出的误差。Qwen2.5-3B-Instruct 上,给 INT4 RTN backbone 增加 0.162 bit/权重的开销,就关闭了对 BF16 的 88.2%/78.9%/71.3%(PPL/KL/准确率)匹配差距;49.25MB 的 sidecar 约为 BF16 权重载荷的 0.8%,在稀疏、低秩、向量量化编解码器对比中拿到最佳困惑度与平均任务准确率。「先量化、后修补」的端侧部署配方,按 MB 计费的场景可以直接试。

为什么值得关注

0.8% 权重载荷换回大部分量化质量损失,sidecar 方式对端侧模型的存储预算表是一行新选项;与 Llama-Mobile、QAH 同属端侧效率线。

关键信息

  • 论文标题: Activation-Weighted Seeded Residual Coding for Low-Bit LLM Weight Repair
  • 作者: Zehao Liu, Chuangchuang Fang, Yang Ren
  • arXiv: https://arxiv.org/abs/2608.23144
  • 发布时间: 2026-08-24
  • arXiv 分类: cs.LG, cs.CL
  • 备注: 无
  • 关联标签: quantization, residual-coding, weight-repair, edge-deployment, llm-compression

English Abstract

Low-bit weight quantization saves storage but leaves errors that degrade language-model quality. We introduce Activation-Weighted Seeded Residual Coding (AWSRC), a compact repair codec for an existing quantization backbone. Given a reconstructed weight $W_0$, AWSRC encodes the residual $W-W_0$ using deterministic seed-generated bases. The sidecar stores seed selectors, low-bit coefficients, and scales rather than an explicit codebook. Activation statistics prioritize errors that affect layer outputs. On Qwen2.5-3B-Instruct, adding 0.162 scope-bits/weight to an INT4 RTN backbone closes 88.2%, 78.9%, and 71.3% of the matched PPL, KL, and accuracy gaps to BF16. Repairing a matched strong low-bit backbone also improves all measured quality metrics. With a matched 49.25 MB sidecar, about 0.8% of the BF16 model-weight payload, AWSRC gives the best perplexity and mean task accuracy among sparse, low-rank, and vector-quantized codecs.

Obsidian Notes

  • 元数据与摘要由 opencli arxiv paper 2608.23144 -f json 拉取。
  • 中文导读锚定在论文摘要声明的 claim 与数字上;未补充摘要之外的实验细节。
  • 选题来源: OpenClaw定时任务/论文流水线/2026-08-26-论文流水线.md(评分 4/5 对应流水线 8.x/10 档)。
  • 本页由 AAIF daily-intake-evening 任务生成(2026-08-26)。