Agent 与自动化 3.0 · 值得看 2026-06-15 · 论文

AI Agent Benchmark & Evaluation OSWorld 2026-06-15

本文是关于 AI Agent Benchmark & Evaluation 的深度精读,主要聚焦于 OSWorld 和 CUA (Computer-Use Agent) 领域OSWorld 已成为 Computer-Use Agent 评测的事实标准,从 2023 年的模拟玩具环境发展到 2026 年的全平台真实 OS 评测矩阵文章详细分析了 CUA 训练范式从 SFT 反思长 CoT RLVR MCP 工具集成的演进历程,强调了鲁棒性作为 CUA deployment 的核心瓶颈2026 年标志着 multi-agent CUA 元年的到来,FSM 和 DAG 两大范式在 OSWorld 上均达到 SOTA同时,评测矩阵已成熟涵盖全平台 全能力,训练范式已收敛,多智能体成为必由之路,鲁棒性是 deployment 瓶颈,跨平台成为产品级要求

打开原文回到归档

本文是关于 AI Agent Benchmark & Evaluation 的深度精读,主要聚焦于 OSWorld 和 CUA (Computer-Use Agent) 领域OSWorld 已成为 Computer-Use Agent 评测的事实标准,从 2023 年的模拟玩具环境发展到 2026 年的全平台真实 OS 评测矩阵文章详细分析了 CUA 训练范式从 SFT 反思长 CoT RLVR MCP 工具集成的演进历程,强调了鲁棒性作为 CUA deployment 的核心瓶颈2026 年标志着 multi-agent CUA 元年的到来,FSM 和 DAG 两大范式在 OSWorld 上均达到 SOTA同时,评测矩阵已成熟涵盖全平台 全能力,训练范式已收敛,多智能体成为必由之路,鲁棒性是 deployment 瓶颈,跨平台成为产品级要求