AI 编程 4.0 · 优秀 2026-08-13 · 论文

QuoteBench: How Matched Scores Can Hide Command-Path Failures

LLM编码agent发出的Bash命令要经过序列化包装重解析的接口传输层,matched执行分数本身无法区分命令生成错误与生成之后才引入的失败QuoteBench用56个一次性任务14个事故衍生家族,在精确最终态校验下交叉生成契约与执行传输:同一回复仅经过一个额外加压解析器重放,成功率即下降55.4到73.2个百分点;披露边界后6种配置恢复30.4到60.7点,另外两种为零或微负结论:前沿模型的原始生成已接近饱和,边界适配才是真正分水岭;GPT-5.6-sol的-3.6点matched差距实际掩盖了-64.3点损伤与+60.7点补偿评测命令型agent应报告模型配置生成契约执行路径与最终态校验器,而非把matched分当作模型内禀属性

打开原文回到归档

QuoteBench: How Matched Scores Can Hide Command-Path Failures

Source: https://arxiv.org/abs/2608.13547
Authors: Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang
Published: 2026-08-13
Categories: cs.AI, cs.SE
PDF: https://arxiv.org/pdf/2608.13547v1
Comment: 29 pages, 5 figures. Project page: https://quotebench.lsamc.website/

中文导读

QuoteBench 测的是 LLM coding agent 评测里一个被普遍忽略的边界:agent 发出的 Bash 命令要经过序列化、包装、再解析的执行接口。匹配分数(matched score)本身无法区分"模型生成错了命令"和"生成之后被传输层改坏"——两类完全不同的失败在 matched 评测里长得一样。

方法:56 个一次性任务、14 个来自真实事故的故障族,在生成契约(generation contract)与执行传输(execution transport)的交叉处放置一个故意不转义的附加解析器,并用精确的最终状态校验(exact final-state validation)判定成败。在插值点做转义可以复现每条重放回复的原始路径结果,因此披露边界后的任何恢复都必须来自模型改变生成行为本身。

Key Findings

  • 边界损伤量化:8 个同窗口配置下,同一回复经附加解析器重放使成功率下降 55.4–73.2 个百分点。
  • 披露的恢复不对称:边界披露为 6 个配置挽回 30.4–60.7 个百分点;对其余 2 个配置为零或轻微负效果。
  • 饱和点判断:原始生成能力在前沿已接近饱和,边界适配才是当前拉开模型差距的变量。
  • 极端案例:GPT-5.6-sol 的 matched 差距 -3.6 分,实际掩盖了 -64.3 分的损伤与 +60.7 分的补偿。
  • 排名可被部署配置改写:26 个可比配对中出现 1 次明确的模型排序反转、另有 4 次处于单任务边缘。
  • 建议:命令式 agent 的评测应报告模型配置、生成契约、执行路径、工作点与最终状态校验器,而不是把 matched 分数当作模型的内生属性。

Intake rationale

  • Category: agents | Quality score: 4/5
  • 对所有做 coding-agent 评测的人都有直接方法论价值:matched score 会系统性隐藏执行边界引入的失败,评测协议需要显式报告命令路径与校验器。

Grounding

opencli arxiv paper 2608.13547 -f json(标题/作者/摘要/日期/分类/评论均来自 arXiv 元数据)。