基础设施 3.0 · 值得看 2026-05-12 · 文章 LanceDB Lance Format v2.2: Half the Storage, None of the Slowdown LanceDB 发布 Lance 格式 v2.2 版本基准测试结果:存储空间减半,性能无损失该格式是 LanceDB 向量数据库的底层数据格式,v2.2 在保持查询速度的同时显著降低存储成本,对大规模向量检索场景有实际意义 打开原文回到归档 备注:原文抓取失败,以下为摘要。 LanceDB v2.2 — 原文来自 Telegram 频道转发。 Related继续阅读 Infra 4.0 · 优秀 MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Con... MV-Bench 把多模态大模型的 UI/可视化生成评测从单图表推进到 coordinated multi-view interface:用 Tableau workbook 作为 ground truth,因为其中显式包含数据绑定视觉映射和交互基准包含 92 个基础界面1,048 个验证实例摘要显示最强模型视觉布局可达 75.45%,但数据绑定只有 21.71%交互完整性 11.68%,说明看起来像距离可用交互界面仍很远 2026-07-22 · 论文 · Yue Zhao; Hongxu Liu; Feiyu Wang; Xiaoyu Yang; Tong Ge; Zhen Yang; Chao Wang; Qi... Infra 4.0 · 优秀 WCXB: A Multi-Type Web Content Extraction Benchmark WCXB 构建了一个多类型 Web 内容抽取基准, 覆盖 2,008 个页面, 1,613 个域名和七种结构化页面类型. 摘要指出当前抽取器在文章页上表现接近, 但在产品, 列表, 文档等结构化页面上 F1 差异明显. 这对 RAG, 搜索索引和训练数据清洗都有实用参考. 2026-05-20 · 论文 · Murrough Foley Infra 3.0 · 值得看 Introducing LifeSciBench OpenAI发布LifeSciBench一个由生命科学领域专家撰写并审核的基准测试,用于评估AI系统在真实生命科学研究任务和决策中的表现该基准填补了现有评测在专业科研流程覆盖度上的空白,为学术与制药场景下模型选型提供更严谨的参照 2026-06-17 · 文章 · OpenAI Agents 5.0 · 必读 AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers 论文把 LLM Agent 做实验的能力拆成连续 HPO 决策问题,而不是只看一次性代码生成或最终答案AgentHPOBench 包含 30 个可执行机器学习任务,覆盖 7 类研究场景;每个任务从 validated baseline run 开始,Agent 根据历史配置metrics 和 logs 继续给下一步配置摘要结论是当前 Agent 已有可测的实验优化能力,但持续迭代复杂日志诊断稳定接近 reference performance 仍弱 2026-07-31 · 论文 · Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, J...
Infra 4.0 · 优秀 MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Con... MV-Bench 把多模态大模型的 UI/可视化生成评测从单图表推进到 coordinated multi-view interface:用 Tableau workbook 作为 ground truth,因为其中显式包含数据绑定视觉映射和交互基准包含 92 个基础界面1,048 个验证实例摘要显示最强模型视觉布局可达 75.45%,但数据绑定只有 21.71%交互完整性 11.68%,说明看起来像距离可用交互界面仍很远 2026-07-22 · 论文 · Yue Zhao; Hongxu Liu; Feiyu Wang; Xiaoyu Yang; Tong Ge; Zhen Yang; Chao Wang; Qi...
Infra 4.0 · 优秀 WCXB: A Multi-Type Web Content Extraction Benchmark WCXB 构建了一个多类型 Web 内容抽取基准, 覆盖 2,008 个页面, 1,613 个域名和七种结构化页面类型. 摘要指出当前抽取器在文章页上表现接近, 但在产品, 列表, 文档等结构化页面上 F1 差异明显. 这对 RAG, 搜索索引和训练数据清洗都有实用参考. 2026-05-20 · 论文 · Murrough Foley
Infra 3.0 · 值得看 Introducing LifeSciBench OpenAI发布LifeSciBench一个由生命科学领域专家撰写并审核的基准测试,用于评估AI系统在真实生命科学研究任务和决策中的表现该基准填补了现有评测在专业科研流程覆盖度上的空白,为学术与制药场景下模型选型提供更严谨的参照 2026-06-17 · 文章 · OpenAI
Agents 5.0 · 必读 AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers 论文把 LLM Agent 做实验的能力拆成连续 HPO 决策问题,而不是只看一次性代码生成或最终答案AgentHPOBench 包含 30 个可执行机器学习任务,覆盖 7 类研究场景;每个任务从 validated baseline run 开始,Agent 根据历史配置metrics 和 logs 继续给下一步配置摘要结论是当前 Agent 已有可测的实验优化能力,但持续迭代复杂日志诊断稳定接近 reference performance 仍弱 2026-07-31 · 论文 · Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, J...