OpenAI 新研究:Agent 正在重塑工作方式,能承担更长更复杂的任务
How agents are transforming work
OpenAI 新研究:Agent 正在重塑工作方式,能承担更长更复杂的任务
继续阅读
Jason Liu 分享如何用 Codex 处理长时间跨度的复杂工程任务:通过上下文持久化任务拆分与项目管理,让 Codex 的工作能力跨越单次提示的限制
HiSkill 针对 trajectory-to-skill 常见缺陷扁平文本技能库技能关系缺失高层描述与可执行动作断层提出层次技能图:节点含 skill 与 AtomicOp,边覆盖分解时序迁移兼容支持与恢复推理时检索任务相关子图,维护 symbolic task state 与 active skill,迭代选择 AtomicOp 并 grounding 为可执行动作三个交互环境上优于 SOTA,并降低 inference token;代码与数据开源在 BUPT-GAMMA/HiSkill
Sakana AI CEO David Ha 在 2026-06-15 宣布首款商用产品 Sakana Marlin 上线,定位为"Ultra Deep Research"自主代理(Virtual CSO)与分钟级 deep research 不同,Marlin 把推理时计算拉到连续 8 小时的自主推理,主动形成假设上网查证解决矛盾,输出结构化战略报告与幻灯片底层是 Sakana 团队 AB-MCTS(NeurIPS 2025 Spotlight)和 The AI Scientist(Nature)研究的工程化产物代表 agentic AI 从演示走向长时程sample-efficient 的实操路径
Franois Chollet 在 2026-06-15 呼吁业界停止对 prompt engineering 噱头恐慌式反应,转而建立标准化可量化可验证的 agentic 能力 benchmark在他看来,无法客观透明地测量这些系统到底在做什么,整个生态就会持续成为不可预期任意政府监管的靶子这一观点与 Frontier Model Forum 的能力评估框架方向一致,但明确把监管风险绑入 benchmark 缺失的代价清单