Agent 与自动化 4.0 · 优秀 2026-08-25 · 论文

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments

StarHarness 是一个在保持模型权重不变的前提下自动进化面向特定环境 agent harness 的框架:可进化对象覆盖 prompt 与任务框定工具接口技能MCP 支持的 providers子智能体结构和 agent-loop 配置方法上按基线失败行为对任务分层以构造紧凑的进化池,将 proposer 可见的搜索任务与隐藏的选择任务分开,并保留 held-out 任务评估泛化能力在 ITBench SREEnterpriseOps-Gym ITSM 和 AutomationBench Finance 三个企业环境中,每个环境经过 4-12 次被接受的变更后,整体基准性能比默认 harness 提高 20-35 个百分点;这些增益在未参与进化的任务上同样成立,并且无需重新进化即可跨 GPT 与 Qwen 两个模型族迁移

打开原文回到归档

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments

  • ID: 79b44ad7
  • 原文链接: https://arxiv.org/abs/2608.24804
  • PDF: https://arxiv.org/pdf/2608.24804v1
  • 作者: Esakkivel Esakkiraja, Denis Akhiyarov, Vikas Yadav, Sai Rajeswar, Patrice Bechard, Sridhar Nemala, Sagar Davasam
  • 日期: 2026-08-25
  • 更新: 2026-08-25
  • 分类: agents
  • 来源类型: paper
  • 标签: agents, harness-evolution, enterprise, stratified-search, arxiv
  • 质量评分: 4/5
  • 抓取时间: 2026-08-27T05:21:12Z

中文导读

StarHarness 是一个在保持模型权重不变的前提下自动进化面向特定环境 agent harness 的框架:可进化对象覆盖 prompt 与任务框定工具接口技能MCP 支持的 providers子智能体结构和 agent-loop 配置方法上按基线失败行为对任务分层以构造紧凑的进化池,将 proposer 可见的搜索任务与隐藏的选择任务分开,并保留 held-out 任务评估泛化能力在 ITBench SREEnterpriseOps-Gym ITSM 和 AutomationBench Finance 三个企业环境中,每个环境经过 4-12 次被接受的变更后,整体基准性能比默认 harness 提高 20-35 个百分点;这些增益在未参与进化的任务上同样成立,并且无需重新进化即可跨 GPT 与 Qwen 两个模型族迁移

为什么值得关注

StarHarness:权重固定只靠分层搜索进化环境专属 harness(prompt/工具/技能/子智能体/循环配置),企业基准性能提升 20-35 个百分点并可跨模型族迁移

关键信息

  • 论文标题: StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
  • 作者: Esakkivel Esakkiraja, Denis Akhiyarov, Vikas Yadav, Sai Rajeswar, Patrice Bechard, Sridhar Nemala, Sagar Davasam
  • arXiv: https://arxiv.org/abs/2608.24804
  • 发布时间: 2026-08-25
  • arXiv 分类: cs.AI, cs.SE
  • 备注: 无
  • 关联标签: agents, harness-evolution, enterprise, stratified-search, arxiv
  • Categories: cs.AI, cs.SE; enterprise settings: ITBench SRE, EnterpriseOps-Gym ITSM, AutomationBench Finance
  • +20-35 percentage points over default harness after 4-12 accepted changes; gains persist on held-out tasks and transfer across GPT/Qwen families

English Abstract

We present StarHarness, a framework for evolving environment-specific agent harnesses while keeping model weights fixed. The evolved harness can include prompt and task framing, tool interfaces, skills, MCP-backed providers, subagent structure, and agent-loop configuration. StarHarness constructs a compact evolution pool by stratifying tasks according to baseline failure behavior, separates proposer-visible search tasks from proposer-hidden selection tasks, and reserves held-out tasks for evaluating generalization. Across ITBench SRE, EnterpriseOps-Gym ITSM, and AutomationBench Finance, harness evolution improves full-benchmark performance by 20-35 percentage points over the default harness after 4-12 accepted changes per environment. These gains persist on tasks excluded from evolution and transfer without re-evolution across GPT and Qwen model families. Trace analysis links the improvements to interface repairs, environment conventions, and operational knowledge that compresses search, with fewer false-positive diagnoses and shorter trajectories in several settings. StarHarness therefore offers a practical way to reduce persistent model-environment mismatch in tool-rich enterprise tasks.

Obsidian Notes

  • Metadata and abstract fetched via opencli arxiv paper 2608.24804 -f json (2026-08-27T05:21:12Z); response parsed list-or-dict tolerant.
  • 中文导读与价值判断锚定在条目已有摘要与论文摘要上,未补充摘要之外的实验细节。
  • Canonical backfill page for existing entry 79b44ad7 in data/entries.json; generated by AAIF content-fetcher (2026-08-27), no push.