QuoteBench: How Matched Scores Can Hide Command-Path Failures
Source: https://arxiv.org/abs/2608.13547
Authors: Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang
Published: 2026-08-13
Categories: cs.AI, cs.SE
PDF: https://arxiv.org/pdf/2608.13547v1
Comment: 29 pages, 5 figures. Project page: https://quotebench.lsamc.website/
中文导读
QuoteBench 测的是 LLM coding agent 评测里一个被普遍忽略的边界:agent 发出的 Bash 命令要经过序列化、包装、再解析的执行接口。匹配分数(matched score)本身无法区分"模型生成错了命令"和"生成之后被传输层改坏"——两类完全不同的失败在 matched 评测里长得一样。
方法:56 个一次性任务、14 个来自真实事故的故障族,在生成契约(generation contract)与执行传输(execution transport)的交叉处放置一个故意不转义的附加解析器,并用精确的最终状态校验(exact final-state validation)判定成败。在插值点做转义可以复现每条重放回复的原始路径结果,因此披露边界后的任何恢复都必须来自模型改变生成行为本身。
Key Findings
- 边界损伤量化:8 个同窗口配置下,同一回复经附加解析器重放使成功率下降 55.4–73.2 个百分点。
- 披露的恢复不对称:边界披露为 6 个配置挽回 30.4–60.7 个百分点;对其余 2 个配置为零或轻微负效果。
- 饱和点判断:原始生成能力在前沿已接近饱和,边界适配才是当前拉开模型差距的变量。
- 极端案例:GPT-5.6-sol 的 matched 差距 -3.6 分,实际掩盖了 -64.3 分的损伤与 +60.7 分的补偿。
- 排名可被部署配置改写:26 个可比配对中出现 1 次明确的模型排序反转、另有 4 次处于单任务边缘。
- 建议:命令式 agent 的评测应报告模型配置、生成契约、执行路径、工作点与最终状态校验器,而不是把 matched 分数当作模型的内生属性。
Intake rationale
- Category: agents | Quality score: 4/5
- 对所有做 coding-agent 评测的人都有直接方法论价值:matched score 会系统性隐藏执行边界引入的失败,评测协议需要显式报告命令路径与校验器。
Grounding
opencli arxiv paper 2608.13547 -f json(标题/作者/摘要/日期/分类/评论均来自 arXiv 元数据)。