Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents
- ID: 171ea5be
- 原文链接: https://arxiv.org/abs/2608.31057
- PDF: https://arxiv.org/pdf/2608.31057v1
- 作者: Le Chen, Zishen Wan, Baixi Sun, Xiaolong Ma, Chih-Hsuan Yang, Feng Yan, Sheng Di, Franck Cappello, R...
- 日期: 2026-08-31
- 抓取时间: 2026-09-02T15:31:00Z
- 分类: agents
- 来源类型: paper
- 语言: zh
- 标签: agent-memory, coding-agent, evaluation, long-context, rlm
- 质量评分: 4/5
中文导读
这篇把 coding agent 的"工作记忆"当作独立评估对象来分析,理由是不同语义对象(指令工件工具输出agent 自生成状态)在保留与压缩行为上差异显著,不能用统一策略一概而论作者在 55 条存档 coding agent 轨迹上对比对象感知压缩与基于检索两种语义感知策略,发现:(1) 在单任务校准的收益无法直接迁移到 held-out 任务;(2) 名义 token 预算不能等同于"实际送达的上下文+管理开销"真实系统重放里还暴露了服务端限制这类隐藏成本最大的价值是给"agent 记忆管理"提供一个分层评估框架stored state / delivered context / management work / task outcome值得所有做 agent 记忆设计的人先读
一句话点评
这篇把 coding agent 的"工作记忆"当作独立评估对象来分析,理由是不同语义对象(指令工件工具输出agent 自生成状态)在保留与压缩行为上差异显著,不能用统一策略一概而论作者在 55 条存档 coding agent 轨迹上对比对象感知压缩与基于检索两种语义感知策略...
English Abstract / Summary
Across 55 archived coding-agent trajectories, the authors show semantically different working-memory objects exhibit distinct retention and compression behavior, motivating semantically informed management. They evaluate object-aware compression vs a retrieval-based policy, finding calibration on one task does not transfer, and nominal token budgets fail to capture delivered context plus management overhead. Real-system replay surfaces hidden server-side limits. The paper frames working-memory evaluation along four axes (stored state, delivered context, management work, task outcome), useful for auditing agent memory designs before adopting new mechanisms.
Obsidian Notes
- 由
daily-intake-evening2026-09-02 cron 从当日 Obsidian 摘要(论文流水线 / AK-RSS / ClawFeed / X 书签消化)发现并入库存量阶段。 - 中文导读与判断均锚定在条目已有摘要、源页面正文、作者、日期与分类信息;未补充源页面之外的实验细节。