Agent 与自动化 3.0 · 值得看 2026-05-11 · 文章 Harness不是目的,知识才是护城河AI工程交付团队的知识沉淀实践 腾讯技术工程分享 AI 工程交付团队的知识沉淀实践核心观点:Harness(工具链/框架)不是最终目的,真正的护城河在于团队积累的领域知识和工程经验强调在 AI 项目交付过程中系统性地沉淀知识,而非仅关注工具层面原文需微信公众号阅读全文 打开原文回到归档 备注:原文抓取失败,以下为摘要。 腾讯技术工程 — 原文来自微信公众号,抓取受限(CAPTCHA)。 Related继续阅读 Agents 5.0 · 必读 Automated Discovery Has No Universally Superior Harness 系统分解 OpenEvolve/TTT-Discover 类自动发现 harness,在 12 组模型-问题对超 310 万次 LLM rollout 上评估 30 种预算对齐变体,发现没有固定 harness 能跨设置稳定领先,OpenEvolve 变体整体常弱于更简单方案;harness 应视为随问题与模型调整的超参,并用早期进度做在线自适应预算分配收录理由:直接挑战通用最优 harness叙事,为 agent 搜索脚手架选型提供可复用统计基线与工程结论 2026-07-20 · 论文 · Akshat Gupta, Jermaine Lei, Alexander Lu, Gopala Anumanchipalli, Leshem Choshen Agents 4.0 · 优秀 Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents 工具获取不是排序分数,而是在异质成本下决定截取多少工具提出CAM-DF/CAM-DF-lite:在排序前缀上做成本感知边际停止,用离线现在停 vs 继续的收益差直接训练五域1343任务;-bench Retail上收益领先,实跑相对全量访问少暴露37%工具且任务成功率相当可作预训练无关的轻量前置插件 2026-07-29 · 论文 · Yicheng Feng, Yan Zhang, Yan Cheng, Wei Qi Agents 4.0 · 优秀 Recursive Harness Self-Improvement 在 modelharness 共演化视角下提出 Recursive Harness Self-Improvement(RHI):把 harness 当作 prompt 级 agent 循环规范,用自身修订历史的成对反馈轻量迭代优化;在 30 个合成 ML 研究任务上,少量迭代即可抬高低推理力度 agent 上限并超过最大推理设置,同时最高节省约 60% 推理成本,增益主要来自任务特定上下文与跨 agent 信息流管理收录理由:给出可操作的 harness-in-the-loop 学习路径,连接即时性能与未来训练轨迹质量 2026-07-17 · 论文 · Hyunin Lee, Jinglue Xu, Jeffrey Seely, Donghyun Lee, Matei Zaharia, Yujin Tang Agents 4.0 · 优秀 Building an Advanced Agentic Harness Data4Sci 把生产级 agent harness 拆成可组合原语:Pydantic typed toolsPlanner 生成依赖 DAGWorker 按 ready set 并发执行分层 memory确定性校验优先再上 LLM judge,以及多维 budget / pressure 降级它还把错误分成 transienttool misusemissing infofatal,强调缺信息才 replan,不应盲目重试文章适合从框架黑盒退回到可审计的 agent 运行时设计 2026-07-15 · 文章 · Data4Sci
Agents 5.0 · 必读 Automated Discovery Has No Universally Superior Harness 系统分解 OpenEvolve/TTT-Discover 类自动发现 harness,在 12 组模型-问题对超 310 万次 LLM rollout 上评估 30 种预算对齐变体,发现没有固定 harness 能跨设置稳定领先,OpenEvolve 变体整体常弱于更简单方案;harness 应视为随问题与模型调整的超参,并用早期进度做在线自适应预算分配收录理由:直接挑战通用最优 harness叙事,为 agent 搜索脚手架选型提供可复用统计基线与工程结论 2026-07-20 · 论文 · Akshat Gupta, Jermaine Lei, Alexander Lu, Gopala Anumanchipalli, Leshem Choshen
Agents 4.0 · 优秀 Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents 工具获取不是排序分数,而是在异质成本下决定截取多少工具提出CAM-DF/CAM-DF-lite:在排序前缀上做成本感知边际停止,用离线现在停 vs 继续的收益差直接训练五域1343任务;-bench Retail上收益领先,实跑相对全量访问少暴露37%工具且任务成功率相当可作预训练无关的轻量前置插件 2026-07-29 · 论文 · Yicheng Feng, Yan Zhang, Yan Cheng, Wei Qi
Agents 4.0 · 优秀 Recursive Harness Self-Improvement 在 modelharness 共演化视角下提出 Recursive Harness Self-Improvement(RHI):把 harness 当作 prompt 级 agent 循环规范,用自身修订历史的成对反馈轻量迭代优化;在 30 个合成 ML 研究任务上,少量迭代即可抬高低推理力度 agent 上限并超过最大推理设置,同时最高节省约 60% 推理成本,增益主要来自任务特定上下文与跨 agent 信息流管理收录理由:给出可操作的 harness-in-the-loop 学习路径,连接即时性能与未来训练轨迹质量 2026-07-17 · 论文 · Hyunin Lee, Jinglue Xu, Jeffrey Seely, Donghyun Lee, Matei Zaharia, Yujin Tang
Agents 4.0 · 优秀 Building an Advanced Agentic Harness Data4Sci 把生产级 agent harness 拆成可组合原语:Pydantic typed toolsPlanner 生成依赖 DAGWorker 按 ready set 并发执行分层 memory确定性校验优先再上 LLM judge,以及多维 budget / pressure 降级它还把错误分成 transienttool misusemissing infofatal,强调缺信息才 replan,不应盲目重试文章适合从框架黑盒退回到可审计的 agent 运行时设计 2026-07-15 · 文章 · Data4Sci