Artificial Analysis Intelligence Index 评测显示,智谱 GLM-5.2 已登顶开源权重模型榜首该模型在推理代码与多模态任务上全面超越此前的开源 SOTA
GLM-5.2 is the new leading open weights model on Artificial Analysis
Artificial Analysis Intelligence Index 评测显示,智谱 GLM-5.2 已登顶开源权重模型榜首该模型在推理代码与多模态任务上全面超越此前的开源 SOTA
继续阅读
智谱 Z.ai 发布 GLM-5 系列首个原生多模态模型 GLM-5.3-Flash:总参数 320B激活参数仅 18B,价格约为前代的十分之一,却在其六个编码与 agentic 基准上全面超过 GLM-5.2(DeepSWE v1.1 得 63.4 对 46.2,AutomationBench 得 48.8 对 26.2),总体接近 Claude Opus 4.8(Z.ai Code Bench 最高努力档 29.0 对 29.5);在 Artificial Analysis Intelligence Index v4.1.1 上以每任务约 0.045 美元的折扣价拿下 57 分架构上首次引入稀疏加线性的混合注意力,显著降低长上下文服务成本,并用 mHC(流形约束超连接)提升缩放效率...
Artificial Analysis 对 DeepSeek V4 Flash 0731(Reasoning, Max Effort)的综合评测:智能指数 50(全网第 3/101),远超同类型模型中位数 25价格极具竞争力:输入 $0.14/1M tokens输出 $0.28/1M tokens,均低于市场中位数(0.43/1.20)缓存命中价格 $0.003/1M(全网最低,下降 98%)上下文窗口 1M tokens,支持文本输入输出在智能指数评测中产生 210M tokens,冗余度高于中位数的 100M
智谱/Z.ai 将 GLM-5.3 开放权重(HF: zai-org/GLM-5.3)与 GLM-5.2 共用同一底座,全部增益来自后训练:自研 Z.ai Code Bench 提升 50%,Terminal Bench 3.0 开源 SOTA(28.3,GLM-5.2 仅 4.6),Agents' Last Exam 28.5模型卡明示后训练规模化带来涌现网络攻防能力:CyberGym 漏洞发现 SOTA(84.5),利用链基准较 GLM-5.2 翻倍以上(ExploitBench 54.4 vs 24.4,ExploitGym 2h/6h 105/130 vs 29/39)支持 SGLang/vLLM/Transformers 等部署,reasoning_effort 支持 low/high/max 三档默认 max
ScholarCatalyst:衡量检索能启发新研究的论文这一能力的基准184 位近期 CS 论文的第一/lead 作者(覆盖 207 篇论文)通过自动化流水线标注哪些候选文献实际或可能推进了自己的项目,并给出详细理由;任务设定为在项目开始时点可用的文献范围内,给定初始研究问题检索这些论文结果:agentic search(把同一个 embedding 检索器当工具调用)Recall@20 0.42,反而不如纯 embedding 检索的 0.48;即便是训练数据里可能见过这些已完成论文的 Claude Fable 5.1 agent 也只有 0.51说明科学家式嗅探哪篇前作关键仍是 AI 系统的明显短板2026-10-01 提交,cs.AI/cs.CL/cs.IR