模型与实验室 4.0 · 优秀 2026-08-13 · 论文

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

把多模态源到结构化产出的任务建模为围绕model-harness系统的长程agentic过程:meta-harness优化器引导代码agent基于rollout反馈递归改进harness,使其对齐人类设计先验并积累可复用经验在论文转海报任务上构建PosterBench(100篇论文主赛道加10篇受控子集):AutoDesign拿到78.32分,超闭源商业系统Claude Design 7.45分;在7种受控代码agent模型配置下,学到的DesignHarness把平均分从54.99提升到67.39(+12.4%);全自主长程循环执行253次工具调用11轮编辑,40分钟内成本低于3美元达到人类评审的会议海报平均质量,系统盲测人类偏好排名第一

打开原文回到归档

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

Source: https://arxiv.org/abs/2608.13560
Authors: Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li
Published: 2026-08-13
Categories: cs.CV, cs.AI, cs.CL
PDF: https://arxiv.org/pdf/2608.13560v1
Comment: Tech Report. Code at: https://github.com/Yaxin9Luo/AutoDesign

中文导读

AutoDesign 把"多模态源 → 压缩结构化媒体产物"(以论文转学术海报为实例)概念化为围绕 model-harness 系统的长程 agent 过程。理想 harness 应对齐人类设计先验、并通过实证探索积累可复用经验以递归自我改进;现有范式是静态的,缺这一能力。

框架:meta-harness 优化器引导一个 code agent,基于 rollout 反馈递归改进 harness 本身——不是改进单次输出,而是改进"怎么产出"的那层。

Key Findings

  • PosterBench:100 篇论文的 Main Track(覆盖 5 个学科)+ 10 篇共享子集 PosterBench-mini(受控评测)。
  • 主榜成绩:AutoDesign 在 Main Track 得 78.32 分,超过闭源商业系统 Claude Design 7.45 分。
  • harness 可移植性:7 个受控 code-agent-模型配置下,接入学到的 DesignHarness 一致涨分,PosterBench Score 均值 54.99 → 67.39(+12.4%)。
  • 自主长程循环成本:40 分钟内执行 253 次工具调用、11 轮编辑,成本低于 3 美元,人工评测达到会议海报平均质量。
  • 盲测人评:系统盲 human study 中 AutoDesign 获得被评系统中最高的偏好。

Intake rationale

  • Category: agents | Quality score: 4/5
  • "优化 harness 而非优化输出"的递归自我改进路线在海报生成任务上拿到了超闭源系统的实证结果;+12.4% 的跨配置一致提升说明学到的 harness 有可移植性,不只是任务特调。

Grounding

opencli arxiv paper 2608.13560 -f json(标题/作者/摘要/日期/分类/评论均来自 arXiv 元数据)。