Agent 与自动化 4.0 · 优秀 2026-08-13 · 论文

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

端到端全模态AI科学家系统:感知层加选题实验写作三个自主agent运行在确定性流水线上,直接处理图像信号音频视频3D结构轨迹表格公式等异构原始证据,而不是预计算摘要系统在代码中执行新颖性筛查统计有效性执行溯源与数值可追溯检查;36个真实数据案例(5个学科族)全部走通从原始数据到编译成稿的完整闭环,论文平均分6.3;与只接收预计算标量特征的盲测变体对比,直接感知在全部7个评测维度上占优头对头评审胜率85%核心论点:工作流覆盖不等于证据可及,全生命周期感知才是证据接地的关键

打开原文回到归档

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

Source: https://arxiv.org/abs/2608.13558
Authors: Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu
Published: 2026-08-13
Categories: cs.AI, cs.CL
PDF: https://arxiv.org/pdf/2608.13558v1
Comment: 30 pages, 13 figures, 19 tables. Project page: https://omni-scientist.github.io/

中文导读

OmniScientist 是一个端到端的全模态(omni-modal)、跨学科 AI 科学家系统。它的核心立场是:工作流覆盖不等于证据可及——现有 AI 科学家系统大多只在文本、代码、标签或预计算摘要上推理,而科学发现所依赖的空间、时序、跨通道与过程性关系对 agent 是不可见的。

系统结构:一个感知层(perception layer)加上选题(ideation)、实验(experiment)、写作(writeup)三个自主 agent,运行在一条确定性流水线上,使观察可以在研究全生命周期中不断塑造研究问题、实验决策与最终结论。新颖性筛查、统计有效性、执行溯源、数值可追溯等 idea/rigour/claim 检查全部以代码执行方式强制执行。

Key Findings

  • 评测规模:36 个真实数据案例,横跨 5 个学科族、4 类科学证据,模态覆盖图像、信号、音频、视频、3D 结构、轨迹、表格、公式、图。
  • 全闭环完成率:36/36 案例全部走通"原始数据 → 编译成稿"完整路径;参考推理骨干下论文平均总分 6.3。
  • 感知的因果价值(配对对照):与只接收预计算标量特征的"盲测"变体对比,直接感知在全部 7 个评测维度上占优,head-to-head 评审胜率 85%。
  • 核心论点:lifecycle-wide perception(全生命周期感知)是证据接地的科学发现的必要条件,为通用 AI 科学家提供了可行路径。

Intake rationale

  • Category: agents | Quality score: 4/5
  • 把"AI 科学家"的瓶颈从工作流自动化推进到证据模态可及性,配对消融(直接感知 vs 预计算特征)给出了感知层价值的干净因果证据。

Grounding

opencli arxiv paper 2608.13558 -f json(标题/作者/摘要/日期/分类/评论均来自 arXiv 元数据)。