OpenRouter 发表博文,讨论在具身智能与机器人控制场景中 Claude 与 Grok 等模型的取舍文章分析不同 LLM 在物理世界 Agent 任务中的可靠性安全性与延迟表现
A robot is sprinting towards you. Do you want it running on Claude or Grok?
OpenRouter 发表博文,讨论在具身智能与机器人控制场景中 Claude 与 Grok 等模型的取舍文章分析不同 LLM 在物理世界 Agent 任务中的可靠性安全性与延迟表现
继续阅读
ChinAI #372 译出晚得的具身 AI 资本游戏关键数据与场景:一家估值超 200 亿人民币的具身 AI 公司在尽调中现场让机器人折毛巾,15 分钟还没折完;某机器人拿轴承运行 70 秒,迟到加 10 倍也进不了工厂晚得分析两种中国特色需求机制:地方国资同时充当股东客户运营合作方;另一类研究机构是公司嫌有了 500 个同行买家反而可以销出去,个别馆买下 8000 万的机器人后转卖给学校Unitree 2025 工业实际场景营收不到 10%,其中一半是接待参观收入,超过 70% 来自科研场景把中国机器人公司超越人类指标背后的财务结构清楚画出
RPG(Reconstruct, Practice, Go Real):不更新模型权重的机器人执行系统自主改进框架从离线数据集中识别操作能力,在仿真中构造相关练习任务;练习时用执行反馈仿真器特权状态和数据集视频诊断失败,进而新增可复用符号技能改进已有技能修订系统提示词,候选改动先做跨任务评估再决定保留测试时由多模态 LLM 用最终系统提示词和技能库协调感知与控制在 22 个操作任务的 held-out 初始化上,任务成功率从第一轮练习后的 28.6% 升到 15 轮后的 95.0%,优于所有对比基线2026-10-01,cs.RO/cs.AI/eess.SY
怎么让 VLM 的世界知识变成机器人控制?Show-Harness 给的答案是"具身 harness":暴露离散的语义动作单元让 VLM 推理,由具体本体(embodiment)的解释器确定性地落到本地机器人动作,细粒度物理决策仍由 VLM 直接负责 同一接口验证两件事:闭源 frontier VLM 直接零样本控制机器人;小规模开源 VLM 只用几个 GPU 小时微调即可低成本部署 还做了 GUMI(GUI Manipulation Interface):把同一语义动作空间扩展到 GUI 示教采集,人和智能体都能"玩"机器人,不需要专业遥操作硬件 实验显示 Show-Harness 加持的 VLM 智能体跨任务/本体/环境泛化稳健,超过代表性 agentic 和 VLA 范式...
研究语音控制的具身智能(EAI)中 ASR 识别错误是否会导向不安全输出作者模拟 ASR 错误并与现有安全基准 SafeAgentBenchPOEX 结合评估:部分错误类型保留语义结构但放大有害歧义,另一些则削弱模型拒绝行为,使不安全计划得以生成并执行;自动纠错在某些场景能降低风险,但并不总是有效结论是 ASR 错误对语音控制具身 AI 构成显著安全风险,为语音入口 agent 执行链的安全评测提供了新的攻击面视角