Agent 与自动化 3.0 · 值得看 2026-08-14 · 文章

Agent 与人类协作三原则:授权分桶外显可解释性静默抑制

每日 Agent 实践笔记:授权按可逆性 影响力两轴分四桶,比单一置信度阈值稳;可解释性不是解释为什么,而是外显看了什么/做了什么/没做什么三类证据;静默抑制是 cron agent 协作第一原则输出与上次同 hash 就不投递,token 不足只写 trace附 5 条可执行实践与一个 20 分钟的三段式摘要小实验

回到归档

Agent 与人类协作三原则:授权分桶、外显可解释性、静默抑制

  • ID: 3cb2c509
  • 原文链接: (本地 Obsidian 综合,无外部 URL)
  • 作者: gracker
  • 日期: 2026-08-14
  • 分类: agents
  • 来源类型: article
  • 标签: agent-collaboration, authorization, explainability, cron, human-in-the-loop
  • 质量评分: 3/5
  • 抓取时间: 2026-08-14T15:38:57Z
  • Obsidian 证据: OpenClaw定时任务/Agent实践探索/2026-08-14-Agent实践探索.md

中文导读

每日 Agent 实践笔记:①授权按「可逆性 × 影响力」两轴分四桶,比单一置信度阈值稳;②可解释性不是解释为什么,而是外显「看了什么/做了什么/没做什么」三类证据;③静默抑制是 cron agent 协作第一原则——输出与上次同 hash 就不投递,token 不足只写 trace。附 5 条可执行实践与一个 ≤20 分钟的三段式摘要小实验。

为什么值得关注

Harness 运行时之外的另一层:runtime 解「agent 自己怎么不崩」,协作纪律解「人与 agent 的边界」。三段式摘要与静默抑制可直接落到现有 cron 任务上。

正文存档

每日 Agent 实践 · 2026-08-14

今日主题

Agent 与人类协作:授权边界、监督粒度与可解释性设计。

核心洞察

1. 授权分桶比单一阈值更稳:按"可逆性 × 影响力"两轴划分

  • 来源:Anthropic 在 2024-2025 多篇 agent safety 文章中反复出现的可逆性分类(reversible vs irreversible),结合本机 Hermes 的 cron + skill 模型观察。
  • 解读:把"是否能撤销"和"影响多少人/多少数据"做 2×2 矩阵,把任务分成四桶:①完全可逆且影响小(自动跑,如监控、日报),②可逆但影响中等(默认自动,事后留痕,如文档改写),③不可逆但影响中等(默认留草稿,人工触发落盘,如数据库 schema 改动),④不可逆且影响大(必须人在回路,如邮件外发、删表、付款)。Hermes 当前的"cron 跑+人工复审最终文本"实际落在第②桶,是这套思路的轻量实现。比起一个统一的"置信度>0.9 才执行"阈值,分桶把决策上下文固化进了任务定义本身,调试时也更直观。

2. 可解释性不是解释"为什么",是解释"我看到了什么、查了什么、跳过了什么"

  • 来源:OpenAI 2024 函数调用文档对 tool_calls 透明性的设计建议,以及 Anthropic 关于 agent trace 的人类可读性研究。
  • 解读:人对 agent 的不信任,几乎都来自"它是不是偷偷干了什么",而不是"它为什么这么干"。所以人类真正需要看的不是 chain-of-thought 的内心戏,而是三类外显信息:① 它读了哪些文件、查了哪几个 URL(输入侧证据),② 它调用了哪些工具、参数是什么(动作侧证据),③ 它放弃/没做哪些候选方案(剪枝侧证据)。Hermes 的 tool 调用日志天然提供了前两类,第三类通常被省略。一个 5 分钟的改动就能让 cron 任务在结尾补一行 "skipped: <被否掉的方案>",比任何 "I considered X" 的内心独白都管用。

3. "静默抑制"是 cron agent 的人类协作第一原则:没新东西就别说话

  • 来源:本机 Hermes 实践观察:cron 任务配置中的 [SILENT] 抑制协议、notify_on_complete 与 watch_patterns 的语义区别、背景进程的生命周期管理。
  • 解读:人类对 agent 最常见的疲劳不是"它做错了",而是"它没做错但一直在说话"。可执行做法是三条规则的硬编码:① 若输出与上次相同 hash,丢弃;② 若输出长度低于某阈值且不含新 token,直接返回 "[SILENT]";③ cron 任务的"完成通知"要按重要度分级,常规聚合任务只记 trace,不进人类收件箱。OpenClaw 旧实践里大量定时消息直接落到 Telegram,现在 Hermes 的设计明显更克制——这种克制本身就是协作效率的一部分,而不是"功能缺失"。

可执行实践

1. 给每个 cron 任务打"可逆性 × 影响力"标签

  • 步骤:在 Hermes 的 cron 配置或任务描述里加一行前缀,例如 # bucket=B2 reversible-yes impact-medium。在执行回溯时,按桶来决定是否需要人在回路。
  • 预期收益:把"这个任务到底要不要我盯着"从每次人脑判断,变成任务定义自带的事实。

2. 三段式执行摘要替代自由叙述

  • 步骤:在 cron 输出模板里固定三段:① 看了什么(inputs/reads)、② 做了什么(tools/calls)、③ 没做什么(skipped/declined)。每段最多 3 行。
  • 预期收益:可解释性提升一个数量级,且不需要 agent 自己"反思",降低 token 浪费。

3. 建立"静默抑制"双开关

  • 步骤:① 输出 diff vs 上次结果,相同则不投递;② 输出包含有效 token 数低于阈值(如 < 50 字或全是固定模板)则只写 trace,不推送。
  • 预期收益:把 cron agent 从"定时打扰源"变成"安静的值守者",人只在真正有信号时被打断。

4. handoff 边界写成显式协议

  • 步骤:当 agent 需要把任务交给人类时,输出必须是结构化的:context(背景)/ what I did(做了什么)/ what I need(需要人决定什么)/ options(候选方案与代价)。不要用自然语言散文。
  • 预期收益:人在回路的决策时间从"读完一整段再判断"压成"看 options 那一栏秒决策"。

5. 每周一次"协作审计"

  • 步骤:每周五抽 5 条 cron 任务的人类介入记录,复查:① 这条是不是本来可以归到 B1 自动跑?② 这条是不是因为 handoff 没写好导致人浪费时间?③ 这条触发了多少"假警报"?
  • 预期收益:长期收敛授权边界,避免人类协作负载随任务数量线性增长。

今日小实验

实验:给你的一个 cron 任务加上三段式摘要 + 静默抑制(≤20 分钟)

1. 在任务脚本末尾,原本 print(result) 的地方,改成先计算 result 的 sha256,与 ~/.hermes/state/<task>.last 里保存的上次 hash 比较;相同则只 print [SILENT],并 exit 0。 2. 把输出文案改成三段:## saw / ## did / ## skipped,每段最多 3 行。 3. 跑两次任务(两次输入要一样),验证第二次是否真安静。 4. 跑一次输入改变的场景,验证三段式是否齐全。

  • 输入:任选一个现有 Hermes cron 任务(最好是监控/巡检类,不是发邮件/改库那种危险动作)。
  • 步骤:
  • 验收标准:
  • 第二次同输入运行时,Telegram/收件箱没有新消息(trace log 里有 [SILENT] 字样)。
  • 第三次不同输入运行时,输出同时包含 ## saw、## did、## skipped 三段。
  • 输出总行数 < 15 行。

知识归档

归档路径: /Users/gracker/Library/Mobile Documents/iCloud~md~obsidian/Documents/Obsidian/OpenClaw定时任务/Agent实践探索/2026-08-14-Agent实践探索.md