OpenAI发布LifeSciBench一个由生命科学领域专家撰写并审核的基准测试,用于评估AI系统在真实生命科学研究任务和决策中的表现该基准填补了现有评测在专业科研流程覆盖度上的空白,为学术与制药场景下模型选型提供更严谨的参照
Introducing LifeSciBench
OpenAI发布LifeSciBench一个由生命科学领域专家撰写并审核的基准测试,用于评估AI系统在真实生命科学研究任务和决策中的表现该基准填补了现有评测在专业科研流程覆盖度上的空白,为学术与制药场景下模型选型提供更严谨的参照
继续阅读
Gary Marcus 9 月 7 日针对 Jensen HuangAGI 比赛已经结束的公开表态写了一篇短文,核心反驳有两层:一是 Astra 与 Fable 5.1 在多数基准上差距不明显,Artificial Analysis 把 Astra 排在 Fable 5.1 之后约 5 分;二是 ARC-AGI 3 的 99.9% 分数是用 OpenAI 自家 Provider Adapter harness 跑出来的,默认 harness 只到 62.7%,ARC 作者 Franois Chollet 本人明确说做对不等于 AGIMarcus 还引述他和 Brundage 的 10 项打赌,认为 Astra 至多命中自动形式化和可靠编码两项,其余八项都没到,结论是用没有定义的口号抢先给科学问题盖棺
OpenAI 发布 Deployment Simulation(部署模拟)方法:在模型正式上线前,利用真实历史对话数据模拟真实部署环境,提前预测新模型的行为表现,从而提升安全评估的准确性并降低上线风险
这篇来自企业一线的论文主张:企业部署的是"系统"而不是"权重",可用能力由权重服务路径精度输出契约和 harness 共同决定,但作者审计的 18 个基准全都在给宣传用的模型 ID 打分,这本身就是测量误差 论文提出 IB2 协议让这一误差变得可报告:gold-blind 的能力绑定预检先验证服务路径能否执行评测契约;首过计分把失败纳入分数把不支持的能力挡在外面;裁定环节结构性盲分 在 11 个系统的实测中:同一权重不同服务路径的两次完整运行分别未通过绑定门的不同谓词,而第三次通过了宣传的模型 ID 完全暴露不了这种差异;七个套件中四个在六系统区间内饱和,区分度几乎全部来自受治理的数据库操作和多表 join;服务侧选择让同一声明版本+精度从 77.38 变到 82.54;把失败响应从分母剔除会直接改变排名结论
MV-Bench 把多模态大模型的 UI/可视化生成评测从单图表推进到 coordinated multi-view interface:用 Tableau workbook 作为 ground truth,因为其中显式包含数据绑定视觉映射和交互基准包含 92 个基础界面1,048 个验证实例摘要显示最强模型视觉布局可达 75.45%,但数据绑定只有 21.71%交互完整性 11.68%,说明看起来像距离可用交互界面仍很远