Agent 与自动化 4.0 · 优秀 2026-08-31 · 论文

Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents

这篇把 coding agent 的"工作记忆"当作独立评估对象来分析,理由是不同语义对象(指令工件工具输出agent 自生成状态)在保留与压缩行为上差异显著,不能用统一策略一概而论作者在 55 条存档 coding agent 轨迹上对比对象感知压缩与基于检索两种语义感知策略,发现:(1) 在单任务校准的收益无法直接迁移到 held-out 任务;(2) 名义 token 预算不能等同于"实际送达的上下文+管理开销"真实系统重放里还暴露了服务端限制这类隐藏成本最大的价值是给"agent 记忆管理"提供一个分层评估框架stored state / delivered context / management work / task outcome值得所有做 agent 记忆设计的人先读

打开原文回到归档

Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents

  • ID: 171ea5be
  • 原文链接: https://arxiv.org/abs/2608.31057
  • PDF: https://arxiv.org/pdf/2608.31057v1
  • 作者: Le Chen, Zishen Wan, Baixi Sun, Xiaolong Ma, Chih-Hsuan Yang, Feng Yan, Sheng Di, Franck Cappello, R...
  • 日期: 2026-08-31
  • 抓取时间: 2026-09-02T15:31:00Z
  • 分类: agents
  • 来源类型: paper
  • 语言: zh
  • 标签: agent-memory, coding-agent, evaluation, long-context, rlm
  • 质量评分: 4/5

中文导读

这篇把 coding agent 的"工作记忆"当作独立评估对象来分析,理由是不同语义对象(指令工件工具输出agent 自生成状态)在保留与压缩行为上差异显著,不能用统一策略一概而论作者在 55 条存档 coding agent 轨迹上对比对象感知压缩与基于检索两种语义感知策略,发现:(1) 在单任务校准的收益无法直接迁移到 held-out 任务;(2) 名义 token 预算不能等同于"实际送达的上下文+管理开销"真实系统重放里还暴露了服务端限制这类隐藏成本最大的价值是给"agent 记忆管理"提供一个分层评估框架stored state / delivered context / management work / task outcome值得所有做 agent 记忆设计的人先读

一句话点评

这篇把 coding agent 的"工作记忆"当作独立评估对象来分析,理由是不同语义对象(指令工件工具输出agent 自生成状态)在保留与压缩行为上差异显著,不能用统一策略一概而论作者在 55 条存档 coding agent 轨迹上对比对象感知压缩与基于检索两种语义感知策略...

English Abstract / Summary

Across 55 archived coding-agent trajectories, the authors show semantically different working-memory objects exhibit distinct retention and compression behavior, motivating semantically informed management. They evaluate object-aware compression vs a retrieval-based policy, finding calibration on one task does not transfer, and nominal token budgets fail to capture delivered context plus management overhead. Real-system replay surfaces hidden server-side limits. The paper frames working-memory evaluation along four axes (stored state, delivered context, management work, task outcome), useful for auditing agent memory designs before adopting new mechanisms.

Obsidian Notes

  • 由 daily-intake-evening 2026-09-02 cron 从当日 Obsidian 摘要(论文流水线 / AK-RSS / ClawFeed / X 书签消化)发现并入库存量阶段。
  • 中文导读与判断均锚定在条目已有摘要、源页面正文、作者、日期与分类信息;未补充源页面之外的实验细节。