模型与实验室 4.0 · 优秀 2026-05-11 · 论文 ICML 2026|PRISM框架让dLLM也能高效Test-Time Scaling ICML 2026 论文提出 PRISM 框架,解决离散大语言模型(dLLM)的 Test-Time Scaling 效率问题传统方法依赖暴力扩展计算量,PRISM 通过更高效的策略实现同等或更优性能,拒绝大力出奇迹路线原文需微信公众号阅读全文 打开原文回到归档 备注:原文抓取失败,以下为摘要。 PRISM框架 — 原文来自微信公众号,抓取受限(CAPTCHA)。 Related继续阅读 Models 5.0 · 必读 Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck 首个在医学/法律/金融/通用对话/创意写作五个开放生成基准上做计算量归一化对比的测试时扩展(TTS)研究,覆盖五类方法核心发现:探索侧没有问题候选池里最好样本随算力持续变好;瓶颈在利用侧(从池里挑出最终答案)SOTA 奖励模型与真实质量相关性仅 0.12,选择近乎随机;树搜索会因多样性坍缩放大这个失败;跨候选融合(Fusion)是唯一稳定优于单样本基线的方法,但也只回收约 40% 可用质量对做 agent 评测RLVRbest-of-N 管线的人是必读的负结果 2026-08-19 · 论文 · Davide Romano, Kanak Raj, Jerrod Parker, Daniele Giofr Models 5.0 · 必读 Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility 这篇综述把 reasoning LLM 的 test-time scaling 拆成单轨迹延长多候选投票或验证以及未完成状态搜索等不同推理制度,强调它们在统计结构算力记账和失败模式上不可互换;作者提出统一符号和报告清单,用于减少评测与复现实验中的口径混乱 2026-08-04 · 论文 · Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Sa... Models 4.0 · 优秀 Introducing Clef: our open-source decision models, and new RL fine-tuning platform 跟进 Typesafe 的 Jev 决策模型概念,Cloudflare 发布开源权重(Apache 2.0)决策模型 Clef 与 Clef-flash,托管在 Workers AI 且与 Jev API 兼容,在 Jev Decision Index 上居首与 Jev 差异:带视觉编码器可分类图像(Jev 仅文本)64k 上下文(Jev 32k)架构上冻结 Qwen3.8-27B / Qwen3.5-9B backbone,加 rank-256 LoRA 与两阶段 attention routing,推理时 prefill-only 一次前向并行给所有合法 schema 选项打分决策步非自回归无逐 token 生成,中位延迟 209.3ms/38.8ms(Jev 524.1ms)... 2026-10-01 · 文章 · Cloudflare Models 4.0 · 优秀 The AI Race Just Got Awkward insufferable.dev 把 Opus 5.5 与 GPT-6.1 Sol 的 cache read 降价直接归因到 DeepSeek 公开的 KV cache 优化:MLA 先压缩约 15 倍,随后 CSAHeavily Compressed Attention,到 V4.1-Flash 用 CSA2跨层缓存复用causal encoder-decoder 与 FP4 caching 把全局 KV cache 压到每 token 890 字节,长会话场景相对 V1 约 437 倍直接后果是西方定价:Opus 5.5 cache read 对 Opus 5 降 60%,GPT-6.1 Sol 对 GPT-5.6 Sol 7 月末定价降 80%... 2026-09-29 · 文章 · insufferable.dev
Models 5.0 · 必读 Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck 首个在医学/法律/金融/通用对话/创意写作五个开放生成基准上做计算量归一化对比的测试时扩展(TTS)研究,覆盖五类方法核心发现:探索侧没有问题候选池里最好样本随算力持续变好;瓶颈在利用侧(从池里挑出最终答案)SOTA 奖励模型与真实质量相关性仅 0.12,选择近乎随机;树搜索会因多样性坍缩放大这个失败;跨候选融合(Fusion)是唯一稳定优于单样本基线的方法,但也只回收约 40% 可用质量对做 agent 评测RLVRbest-of-N 管线的人是必读的负结果 2026-08-19 · 论文 · Davide Romano, Kanak Raj, Jerrod Parker, Daniele Giofr
Models 5.0 · 必读 Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility 这篇综述把 reasoning LLM 的 test-time scaling 拆成单轨迹延长多候选投票或验证以及未完成状态搜索等不同推理制度,强调它们在统计结构算力记账和失败模式上不可互换;作者提出统一符号和报告清单,用于减少评测与复现实验中的口径混乱 2026-08-04 · 论文 · Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Sa...
Models 4.0 · 优秀 Introducing Clef: our open-source decision models, and new RL fine-tuning platform 跟进 Typesafe 的 Jev 决策模型概念,Cloudflare 发布开源权重(Apache 2.0)决策模型 Clef 与 Clef-flash,托管在 Workers AI 且与 Jev API 兼容,在 Jev Decision Index 上居首与 Jev 差异:带视觉编码器可分类图像(Jev 仅文本)64k 上下文(Jev 32k)架构上冻结 Qwen3.8-27B / Qwen3.5-9B backbone,加 rank-256 LoRA 与两阶段 attention routing,推理时 prefill-only 一次前向并行给所有合法 schema 选项打分决策步非自回归无逐 token 生成,中位延迟 209.3ms/38.8ms(Jev 524.1ms)... 2026-10-01 · 文章 · Cloudflare
Models 4.0 · 优秀 The AI Race Just Got Awkward insufferable.dev 把 Opus 5.5 与 GPT-6.1 Sol 的 cache read 降价直接归因到 DeepSeek 公开的 KV cache 优化:MLA 先压缩约 15 倍,随后 CSAHeavily Compressed Attention,到 V4.1-Flash 用 CSA2跨层缓存复用causal encoder-decoder 与 FP4 caching 把全局 KV cache 压到每 token 890 字节,长会话场景相对 V1 约 437 倍直接后果是西方定价:Opus 5.5 cache read 对 Opus 5 降 60%,GPT-6.1 Sol 对 GPT-5.6 Sol 7 月末定价降 80%... 2026-09-29 · 文章 · insufferable.dev