模型与实验室 4.0 · 优秀 2026-05-11 · 论文 ICML 2026|PRISM框架让dLLM也能高效Test-Time Scaling ICML 2026 论文提出 PRISM 框架,解决离散大语言模型(dLLM)的 Test-Time Scaling 效率问题传统方法依赖暴力扩展计算量,PRISM 通过更高效的策略实现同等或更优性能,拒绝大力出奇迹路线原文需微信公众号阅读全文 打开原文回到归档 备注:原文抓取失败,以下为摘要。 PRISM框架 — 原文来自微信公众号,抓取受限(CAPTCHA)。 Related继续阅读 Models 5.0 · 必读 Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility 这篇综述把 reasoning LLM 的 test-time scaling 拆成单轨迹延长多候选投票或验证以及未完成状态搜索等不同推理制度,强调它们在统计结构算力记账和失败模式上不可互换;作者提出统一符号和报告清单,用于减少评测与复现实验中的口径混乱 2026-08-04 · 论文 · Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Sa... Models 4.0 · 优秀 LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference LiveMem 将长运行助手和 Agent 的问题表述为 context turnover 下的 state continuity:当工作上下文被替换时,固定容量的记忆状态仍要承载历史计算方法在全注意力 LLM 中加入可持续的 memory state,结合记忆导向 post-training 和 state-aware serving,在 LongMemEval 上显示证据移出当前窗口后依然可被利用 2026-08-03 · 论文 · Zhichen Liu, Ruihan Sun, Hengjie Yang, Zipeng Wu, Zhaohan Chen, Xiaofan Zhang, Y... Models 4.0 · 优秀 GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reason... GradCuit 把可优化 latent states 插入 Transformer 指定层,让 continuation token 的 log-probability 通过因果自注意力对前置 latent state 形成可微路径,从而把结果反馈直接分配到内部推理状态作者报告它在 5 个 instruction-tuned backbone3 个 reasoning benchmark 和 2 种答案格式上平均准确率 64.5%,比 CoT prompting 高 6.6 个百分点,并在不同学习率下比 LatentSeek 更稳定 2026-08-03 · 论文 · Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang, Song-Chun Zhu, Chi Zhang, Zilong... Infra 4.0 · 优秀 DeepSeek V4 Flash on a single AMD MI300X 这个仓库给出单张 AMD MI300X 部署 DeepSeek V4 Flash 的生产配置样本,覆盖 vLLM ROCm nightlyAITERFP8DSparkKV cacheCaddySHA-256 pin 与 smoke testClawFeed 摘要记录作者报告单流解码 168.6 tok/s8 并发 542 tok/s aggregate64-stream burst 830 tok/s aggregate,权重 156.67 GiB 放入 HBM,未额外量化或 offload它的价值在可复现配置版本 pin启动日志和 ROCm/MI300X 坑点,而不只是能跑模型 2026-08-05 · GitHub · Ryan Zhou
Models 5.0 · 必读 Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility 这篇综述把 reasoning LLM 的 test-time scaling 拆成单轨迹延长多候选投票或验证以及未完成状态搜索等不同推理制度,强调它们在统计结构算力记账和失败模式上不可互换;作者提出统一符号和报告清单,用于减少评测与复现实验中的口径混乱 2026-08-04 · 论文 · Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Sa...
Models 4.0 · 优秀 LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference LiveMem 将长运行助手和 Agent 的问题表述为 context turnover 下的 state continuity:当工作上下文被替换时,固定容量的记忆状态仍要承载历史计算方法在全注意力 LLM 中加入可持续的 memory state,结合记忆导向 post-training 和 state-aware serving,在 LongMemEval 上显示证据移出当前窗口后依然可被利用 2026-08-03 · 论文 · Zhichen Liu, Ruihan Sun, Hengjie Yang, Zipeng Wu, Zhaohan Chen, Xiaofan Zhang, Y...
Models 4.0 · 优秀 GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reason... GradCuit 把可优化 latent states 插入 Transformer 指定层,让 continuation token 的 log-probability 通过因果自注意力对前置 latent state 形成可微路径,从而把结果反馈直接分配到内部推理状态作者报告它在 5 个 instruction-tuned backbone3 个 reasoning benchmark 和 2 种答案格式上平均准确率 64.5%,比 CoT prompting 高 6.6 个百分点,并在不同学习率下比 LatentSeek 更稳定 2026-08-03 · 论文 · Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang, Song-Chun Zhu, Chi Zhang, Zilong...
Infra 4.0 · 优秀 DeepSeek V4 Flash on a single AMD MI300X 这个仓库给出单张 AMD MI300X 部署 DeepSeek V4 Flash 的生产配置样本,覆盖 vLLM ROCm nightlyAITERFP8DSparkKV cacheCaddySHA-256 pin 与 smoke testClawFeed 摘要记录作者报告单流解码 168.6 tok/s8 并发 542 tok/s aggregate64-stream burst 830 tok/s aggregate,权重 156.67 GiB 放入 HBM,未额外量化或 offload它的价值在可复现配置版本 pin启动日志和 ROCm/MI300X 坑点,而不只是能跑模型 2026-08-05 · GitHub · Ryan Zhou