TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories
Source: https://arxiv.org/abs/2608.06346
PDF: https://arxiv.org/pdf/2608.06346v1
Content fetched: 2026-08-08T15:34:45.962729+00:00
Grounding: OpenCLI source metadata/body plus Obsidian digest evidence
Metadata
- Author(s): Yunjia Qi, Zehua Yin, Xintong Shi, Hao Peng, Songyuanyi Lu, Yixian Liu, Richeng Xuan, Yuhong Liu, Zhichao Hu, Xiaozhi Wang, Lei Hou, Bin Xu, Juanzi Li
- Original date: 2026-08-06
- Platform: arxiv
- AAIF quality score: 5
中文摘要
TRAJDEBUG 针对长轨迹 agent 的失败调试,提出错误生命周期追踪:先用多粒度历史压缩和证据式错误识别定位局部错误,再追踪每个错误是否被后续步骤修复、是否仍影响最终失败。论文构造 TrajErrBench,包含 486 条来自 Tau2Bench 与 SWE-Bench Pro 的人工标注失败轨迹,并报告在多类 agent benchmark 上优于现有 baseline。
English Summary
TrajDebug addresses critical error detection in long-horizon LLM agent trajectories. It combines multi-granularity history compression, evidence-based error identification, and lifecycle tracing of each error’s resolution status and terminal impact. The authors build TrajErrBench with 486 manually annotated failed trajectories from Tau2Bench and SWE-Bench Pro and report improved diagnosis quality and actionable feedback for downstream agent success.
Intake Rationale
长轨迹 agent 调试需要区分局部错误、已修复错误和真正导致失败的关键错误。
Obsidian Evidence
- Evidence note: /Users/gracker/Library/Mobile Documents/iCloud~md~obsidian/Documents/Obsidian/OpenClaw定时任务/论文流水线/2026-08-08-论文流水线.md
- arXiv ID: 2608.06346
- Primary category: cs.AI
- Categories: cs.AI
Source Excerpt
TrajDebug addresses critical error detection in long-horizon LLM agent trajectories. It combines multi-granularity history compression, evidence-based error identification, and lifecycle tracing of each error’s resolution status and terminal impact. The authors build TrajErrBench with 486 manually annotated failed trajectories from Tau2Bench and SWE-Bench Pro and report improved diagnosis quality and actionable feedback for downstream agent success.
<!-- aaif-entry-id: 5c4dc703 -->