Agent 与自动化 3.0 · 值得看 2026-05-11 · 文章 Harness不是目的,知识才是护城河AI工程交付团队的知识沉淀实践 腾讯技术工程分享 AI 工程交付团队的知识沉淀实践核心观点:Harness(工具链/框架)不是最终目的,真正的护城河在于团队积累的领域知识和工程经验强调在 AI 项目交付过程中系统性地沉淀知识,而非仅关注工具层面原文需微信公众号阅读全文 打开原文回到归档 备注:原文抓取失败,以下为摘要。 腾讯技术工程 — 原文来自微信公众号,抓取受限(CAPTCHA)。 Related继续阅读 Agents 5.0 · 必读 How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering? 在相同时间预算与同一 frontier LLM backbone 下,对比开源 SOTA 精心搭建的 MLE agent harness(多 agent 编排专职检索 subagent 等)与只给 read/write/bash 原语的极简单会话 coding agent 基线:前者没有优势,性能主要由 backbone 决定大规模系统性消融显示,在 coding agent 场景里这些机制层是冗余的围绕强模型手工堆 harness 的边际收益在当前 MLE 基准上很差与 Pi 1.0 的极简 harness 路线以及 2609.40330 的实例自适应 harness 优化形成有趣对照:harness 的价值取决于模型强度与任务分布,复杂度本身不等于收益 2026-09-30 · 论文 · Kirill Brilliantov, Alejandro Hernndez-Cano, Emmanuel Abb Agents 5.0 · 必读 Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical... arXiv 2609.15983(cs.AI/CL/LG,2026-09-14,Lin/Woodruff/Deng 等,含 Google 研究者)提出与模型无关的 Stellar Colosseum 推理分配框架:在证明前并行探索策略,用 readiness gate 决定何时分解,证明计划以相互依赖的小节子问题表示,验证器发现路由回受影响的论证段;最终通过重叠随机抽样树聚合融合候选与批评整个流程已集成进 Google Antigravity 的 TeamworkLong Proof模式配 Gemini 3.1 Pro,得出多个 FOCS/JMLR 论文遗留的开放问题新结果;TCS-Bench 准确率 71.0%,Codeforces 218/222 2026-09-14 · 论文 · Honghao Lin, David P. Woodruff, Yuan Deng Agents 5.0 · 必读 FrontierHarness Eval: 9 harnesses x 12 configs on Kimi K3 same model, 17.5x cost spread FrontierHarness Eval v1.0 在 Kimi K3 上对比 9 个 harness(Codex / Claude Code / DSH Creator/Standard/Minimal/Pi / Hermes / OpenCode / Oh My Pi / Kimi Code / Exo)共 12 个配置,30 个任务 / 360 次冷启动同 checkpoint 评测Pass rate 跨度 50.0%66.7%(Codex 66.7 / Claude Code 63.3 / Hermes 50 / Exo 53.3)... 2026-09-01 · 文章 · Runta Agents 5.0 · 必读 The Empire, Long Divided, Must Unite: Architectural Convergence in Three LLM Agent Harnesses 单作者源码级多案例研究:把三个刻意对立哲学的开源 coding agent harnessLangChain deepagents(全家桶)Earendil pi(激进极简)DeepSeek dsh(一切皆插件)钉在固定 commit 上逐 commit 对照两个成熟 harness 朝相反方向演化(deepagents 在删自研脚手架,pi 在攒基础设施),却收敛到同一中间形态,要素有五:商品化的请求循环只追加且可重放的会话记录以数据形式保存的模型怪癖上下文渐进披露显式扩展缝... 2026-08-25 · 论文 · Dai Jiahong
Agents 5.0 · 必读 How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering? 在相同时间预算与同一 frontier LLM backbone 下,对比开源 SOTA 精心搭建的 MLE agent harness(多 agent 编排专职检索 subagent 等)与只给 read/write/bash 原语的极简单会话 coding agent 基线:前者没有优势,性能主要由 backbone 决定大规模系统性消融显示,在 coding agent 场景里这些机制层是冗余的围绕强模型手工堆 harness 的边际收益在当前 MLE 基准上很差与 Pi 1.0 的极简 harness 路线以及 2609.40330 的实例自适应 harness 优化形成有趣对照:harness 的价值取决于模型强度与任务分布,复杂度本身不等于收益 2026-09-30 · 论文 · Kirill Brilliantov, Alejandro Hernndez-Cano, Emmanuel Abb
Agents 5.0 · 必读 Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical... arXiv 2609.15983(cs.AI/CL/LG,2026-09-14,Lin/Woodruff/Deng 等,含 Google 研究者)提出与模型无关的 Stellar Colosseum 推理分配框架:在证明前并行探索策略,用 readiness gate 决定何时分解,证明计划以相互依赖的小节子问题表示,验证器发现路由回受影响的论证段;最终通过重叠随机抽样树聚合融合候选与批评整个流程已集成进 Google Antigravity 的 TeamworkLong Proof模式配 Gemini 3.1 Pro,得出多个 FOCS/JMLR 论文遗留的开放问题新结果;TCS-Bench 准确率 71.0%,Codeforces 218/222 2026-09-14 · 论文 · Honghao Lin, David P. Woodruff, Yuan Deng
Agents 5.0 · 必读 FrontierHarness Eval: 9 harnesses x 12 configs on Kimi K3 same model, 17.5x cost spread FrontierHarness Eval v1.0 在 Kimi K3 上对比 9 个 harness(Codex / Claude Code / DSH Creator/Standard/Minimal/Pi / Hermes / OpenCode / Oh My Pi / Kimi Code / Exo)共 12 个配置,30 个任务 / 360 次冷启动同 checkpoint 评测Pass rate 跨度 50.0%66.7%(Codex 66.7 / Claude Code 63.3 / Hermes 50 / Exo 53.3)... 2026-09-01 · 文章 · Runta
Agents 5.0 · 必读 The Empire, Long Divided, Must Unite: Architectural Convergence in Three LLM Agent Harnesses 单作者源码级多案例研究:把三个刻意对立哲学的开源 coding agent harnessLangChain deepagents(全家桶)Earendil pi(激进极简)DeepSeek dsh(一切皆插件)钉在固定 commit 上逐 commit 对照两个成熟 harness 朝相反方向演化(deepagents 在删自研脚手架,pi 在攒基础设施),却收敛到同一中间形态,要素有五:商品化的请求循环只追加且可重放的会话记录以数据形式保存的模型怪癖上下文渐进披露显式扩展缝... 2026-08-25 · 论文 · Dai Jiahong