Infra

基础设施

推理、RAG、微调、评测、多模态、芯片和端侧部署。

146精选条目
01Infra
基础设施 4.0 · 优秀
We're going to need default hard budget caps on pretty much everything

Simon Willison 10月3日短文:coding agent / personal agent 把搭一个能花钱的应用的门槛压到几乎为零,但大量按量付费 API 只有超预算发警告邮件的软上限,一夜跑出几千美元账单才发现他主张 pay-by-use 服务必须默认提供硬预算上限(触线直接停服务并返回错误),想冒险的人显式勾选自担费用选项;点名 AWS 最该做这件事,并引用 AWS 9月16日刚发布的 monthly spend limit(项目触线当月暂停,仍限量开放)和 Google Cloud 7月的 Spend Caps 作为行业转向的证据,还希望 agent 以后推荐服务时优先选带硬上限的供应商

为什么重要Simon Willison 10月3日短文:coding agent / personal agent 把搭一个能花钱的应用的门槛压到几乎为零,但大量按量付费 API 只有超预算发警告邮件的软上限...
2026-10-03 · 文章 · Simon Willison
02Infra
基础设施 3.0 · 值得看
Cloudflare K2: serverless event streams (public beta)

Cloudflare 发布 serverless 事件流 K2 公测:把 producer/consumer 解耦,在 R2 对象存储之上实现分区持久日志,事件按序存储支持长期 retention,消费者可以分摊读取或全量广播,长时间宕机也不丢数据起源是自家需求:Basin Pipelines 的流处理引擎是 pull 模型,需要一条绝不丢事件的持久缓冲层实现上消息先在 edge 节点内存攒成 segment,再用 R2 的原子操作拿到严格排序与递增 offset,省掉独立协调服务;代价是 produce 端 p99 约 1 秒(等 segment 攒齐再写 R2)与 Queues 的分工:Queues 适合单条重活加 retry/DLQ,K2 适合批量高扇出与长期保留

为什么重要Cloudflare 把对象存储当状态原语又落一子:K2 用 R2 原子操作换掉协调服务,1 秒 p99 换不丢事件的长保留缓冲
2026-10-01 · 文章 · Cloudflare
03Infra
基础设施 4.0 · 优秀
RIP, vector database

turbopuffer 宣布 v3 存储架构重写:ANN 向量索引从主索引降级为普通二级索引,换用新主索引,文本/正则/向量检索全面提速,并为把更多 SQL 查询(GROUP BY聚合)搬到 turbopuffer 打基础回顾演进:v1 以对象存储为真相源SPANN 分层聚类索引起步后迁移到 SPFresh 支持增量索引,靠极致便宜+够快的向量检索赢得 CursorNotion 等早期客户;v2 补强文本与正则检索并被 Linear 用于同步引擎向量优先架构约束了 GROUP BY 与聚合等查询计划已到极限向量数据库作为品类叙事被自家官方送终,检索基础设施正走向通用查询引擎

为什么重要turbopuffer v3 把向量索引降为二级索引:向量数据库品类叙事终结,检索基建走向通用查询引擎
2026-09-30 · 文章 · Dan Harrison
Infra 2026-09-29 · GitHub
Magnitude: self-optimizing inference engine for agents

在 HN 上 Launch 的开源推理引擎:在用户设备上编译并调优 kernel,宣称开源模型比 llama.cpp 最多快 2 倍(Metal decode +92%,CUDA decode +19%),支持 Apple SiliconNVIDIAAMD 与纯 CPU桌面应用内置 magnitude CLI,一键连接 PiOpenCodeHermesCodex 等现有 agent;会话间共享前缀缓存,每 agent 内存低 27%,Apache 2.0,数据不出本机

inference-enginelocal-llmkernel-tuningllama-cpphn
4.0 · 优秀 开发者
Infra 2026-09-29 · 论文
RLX: A Unified Multi-Backend Tensor Compiler and Distributed Runtime in Rust

单个 Rust 代码库同时承担编译器与运行时:围绕一套三层 primitive 级 IR 和透明 dispatch contract每个算子被解析到 nativecommon-IR 或重写 lowering,无法 legalization 就直接编译报错同一 IR 目标覆盖 14 种运行时设备(cpu/metal/mlx/ane/cuda/rocm/oneapi/tpu/hexagon/vulkan/webgpu 等)加 Cortex-M INT8 与 FPGA 两条特种代码路径,支持 safetensors/GGUF/ONNX/rten 输入与 F16/BF16/INT4/INT8 量化流,经 TCP/RDMA 做张量/流水线并行扩展同机同法对比 PyTorch/MLX/IREE/TensorRT/tinygrad 等...

tensor-compilerrustruntimemulti-backend
3.0 · 值得看 开发者
Infra 2026-09-29 · 论文
Joint Effects of GPU Server Topology, Parallelism, and Congestion Control on MoE Inference: A Co...

用 ASTRA-sim 加 NS-3 离散事件后端搭 32 GPU rank 受控矩阵:6 种服务器拓扑4 种 TP/EP 划分2 种 TP 集合通信算法4 种网络/拥塞控制,共 768 次确定型模拟(DP/PP 固定为 14096-token 合成 Chakra trace四种 MoE 配置)开启反馈的子集里暴露通信占平均完成时间 89.9-95.8%;TP16EP2 的完成时间是 TP2EP16 的 3.68-4.35 倍;固定 rank mapping 时 Double Binary Tree 比 Ring 慢 28.3-83.2%;RoCE 上 DCQCN 比 HPCC 慢 23.8-35.7%拓扑结论是条件性的低 TP 度领先的拓扑到高 TP 度会反转全是模拟无实测,引用时记住这个边界,但作为集群规划的敏感性检查表够用

moetopologycongestion-controlsimulation
3.0 · 值得看 开发者
Infra 2026-09-29 · 论文
Efficient Agentic LLM Serving over SSD-based Sparse KV Storage

agentic 会话在推理与工具调用间切换历史越积越长;稀疏注意力加 SSD 存 KV 是便宜组合,但稀疏选择依赖推理中的临时中间值,SSD 读被压进关键路径,还要吃碎片访问与读写干扰Janus 聚焦占历史 KV 加载大头的 append prefill:用较早中间值跑模型自带的 KV 选择模块预测需求(无需额外训练),预测读与计算重叠,miss 在 attention 执行前补读保证输出不变;SSD 侧合并相邻读CPU 上把碎片 KV 页打包顺序写读活跃时限制后台写三个模型三条 agentic trace 上 TTFT 较已有最好工作最高快 1.57-3.69 倍(平均 1.22-1.85 倍),decode 效率不掉

kv-cachessdsparse-attentionagent-serving
3.0 · 值得看 开发者
Infra 2026-09-28 · 论文
TokenCast: Forecasting Token Consumption During LLM Agent Execution

同一任务在 LLM 智能体多次执行间 token 消耗可差一个数量级,且总消耗在执行前难以预测TokenCast 为每个执行段学习可组合的成本表示(自身消耗+带来的上下文增长),相邻段复合成累计估计,把前段上下文被后继每次调用重读的隐性成本纳入预测;执行中随新证据刷新预测且不增加额外 LLM 调用,SWE-bench Verified 上平均累计预测耗时 32.8ms/次跨 4 个任务套件6 个智能体模型的 96 种组合中,对最强对比方法的 MAE 平均降低 14.5%;离线预算控制重放中,在相同轨迹完成率下比固定预算策略平均省 21.3% token代码已开源(github.com/DEFENSE-SEU/TokenCast)

token-costagent-observabilitybudget-controlswe-bench
4.0 · 优秀 开发者
Infra 2026-09-28 · 论文
KV-streams for Efficient Compaction in Agentic Reinforcement Learning

拉长智能体 RL 的任务时程被 GPU 显存中的长轨迹上下文卡住,主流上下文压缩策略每次压缩都要反复 prefill,拖垮训练吞吐KV-streams 提出流式前传 KV cache 而非压缩后冲刷,与任意压缩策略即插即用:在三种压缩策略上取得 2.65 倍训练 wall-clock 加速且未见性能受损额外发现:流式保留的 KV cache 可充当循环状态,携带早已离开上下文窗口的信息;受控实验显示仅靠 RL 即可涌现这一行为,与此前需要额外机制的结论相反定位为任何 post-training 流水线的轻量即插即用组件

agentic-rlkv-cachecontext-compactiontraining-throughput
4.0 · 优秀 开发者
Infra 2026-09-28 · GitHub
Jeff: Jev-compatible 0.8B decision models, trained at home, ~30 ms

Jeff:Qwen3.5 / Gemma 4 微调(0.8B-2B)的零样本分类小模型描述情境并列出选项,单次前向直接返回每个选项的校准概率,不生成文本无需解析,RTX PRO 6000 上约 22msM4 Max (MLX) 约 28ms 一次决策全流程本地硬件训练(单卡 0.8B 约 2 小时),合成数据由开源模型生成;请求格式与 Jev 兼容短微调收益巨大:语音导航任务 held-out 准确率 31.7% -> 95.8%,单 GPU 半小时内小模型做结构化判断大模型做推理的分工再次被验证

small-modelszero-shot-classificationcalibrationjevon-devicesynthetic-data
4.0 · 优秀 开发者
Infra 2026-09-28 · 论文
Dynamic Flow, Static Graph: KV Cache Reuse for Efficient LLM Serving on Mobile NPUs

面向移动 NPU 的 LLM serving KV 复用系统设计:现有 KV 缓存为云 GPU 动态执行环境优化,而移动 NPU 计算图需静态编译内存容量与 I/O 带宽双受限方案是计算-存储协同设计图内机制把选择性 KV 重计算映射进静态 NPU 图,调和算法动态性与 NPU 静态性;图间调度器用动态规划做 chunk 合并与 padding 最小化;再加 tree-hash-semantic 混合层级 KV 管理器成本感知预取/驱逐,以及把 KV 加载rerotation存储与 NPU 执行重叠的二维流水线代表性端侧负载上 TTFT 较无复用与仅前缀缓存降 40-60%EuroSys 2027 Spring Cycle 接收

kv-cachenpuon-devicellm-serving
4.0 · 优秀 开发者
Infra 2026-09-28 · 论文
Argus: Agentic, Reference-Calibrated, Tree-Guided, System-Software-Level Bottleneck Localization

ETH Zurich 的 agentic profiler:应用逻辑挪去加速器后,CPU 越来越忙于驱动调用数据搬运与同步;perf/VTune 只给测量ftrace 重度插桩会扰动短操作,定位具体内核代码路径通常要反复插桩加人工解读Argus 用 LLM agent 生成插桩代码并自主推理 OS 级瓶颈,两个关键机制:拿 idle 系统的一次测量做参考校准;用树状结构表示 OS 执行路径帮助定位,目标直指具体内核代码路径而非子系统级结论THP 干扰与不同类型 page fault 两个案例中,错误深路径诊断比无参考校准的最强 LLM 基线少 19 倍,time-to-diagnosis 约 31 秒ISCA 2026 Architecture 2.0 workshop 论文扩展版

profilingllm-agentosbottleneck-localization
4.0 · 优秀 开发者
Infra 2026-09-28 · 论文
Spexis: Speculative Lookahead Scheduling for LLM Inference

把投机执行从省单请求时延的手法升级为新的并行轴:Spexis 让 speculation 与正常执行并行跑,叠在流水线并行与张量并行之上不增加 KV cache 内存,从而改善多卡推理的内存效率与瓶颈;lookahead 调度预测投机质量与未来内存压力,减少白做的投机KV 驱逐与重算基于 vLLM 实现,多种 GPU 配置下相对最优 PP+TP 组合基线最高加速 34%,代码开源EMNLP 2026 main

speculative-decodingllm-servingparallelismvllm
3.0 · 值得看 开发者
Infra 2026-09-28 · 论文
Semantics, Workflows, and Infrastructure: Understanding Agent Serving at Production Scale

分析某通用 agent 生产平台两周 1170 万请求的 trace底层超 1 万 GPU 的推理集群,把测量接成三层:任务层发生语义工作流层执行形态基础设施层 serving 需求发现的负载形态包括:会话间请求量高度倾斜逻辑兄弟请求很少出现执行重叠任务边界之间存在上下文复用这些数字是 agent serving 调度与容量设计的直接输入,也让 EfficientAgent 的 working set 结论有了生产侧印证;表征研究本身不提供方案,但 open problems 列得比较具体

agent-servingcharacterizationproduction-tracecapacity-planning
3.0 · 值得看 开发者
Infra 2026-09-27 · 论文
EfficientAgent: What Makes KV Cache Offloading Work for Concurrent Agents?

同一套 coding-agent 负载,KV 卸载到主存在的一个部署加速另一个变慢第三个无感原因是缓存必须活到再次被用:一个 agent 等工具时,服务端在处理其余所有 agent 的上下文,前缀能复用的条件是 host 层装得下整个 agent 池的可复用上下文,作者称为 reuse working set方案用 stack-distance 模型从 agent 历史在线估计 working set 来定 host 层容量;容量不足时停止写入会被驱逐的大块 refill只扩展仍被缓存的前缀,充足时全量写入SWE-bench Verified 上按估计 working set 定容量后重算 prompt token 减少 93%端到端时间减少 39%...

kv-cacheoffloadingagent-servingcapacity-planning
4.0 · 优秀 开发者
Infra 2026-09-25 · 论文
The KV Cache Is the New Memory Wall

SoK 论文(arXiv 2609.30854,28p)指出长上下文自回归 LLM 推理受内存带宽约束而非算力,绑定资源随序列增长从权重转移到 KV cache以 Llama-3-70B BF16 为例:140 GB 权重超出单卡 80 GB HBM,128k token 单序列再加 42 GB KV论文在 NVIDIA H100 / B200AMD MI300X 三种硬件上推导出随 context 衰减的算术强度闭式解,统一比较量化/驱逐/paging/前缀复用/异构分层五域核心结论是三段式:交叉点以下权重流量主导,KV 压缩几乎无收益;交叉点以上各域都在拿质量换带宽;paging/前缀共享无损但只解容量不解带宽

kv-cachememory-wallsokarithmetic-intensityh100mi300x
4.0 · 优秀 开发者
Infra 2026-09-25 · 论文
Can You Check That? The Checkability Boundary for Local LLM Network Automation

arXiv 2609.31540 提出 checkability 判据:网络自动化任务若存在廉价确定性的内在检查(能拒绝违反必要正确性条件的输出),就适合本地小模型推理落地为 Touchstone 流水线7 个 1-8B SLM 生成候选任务内在检查拒绝未决输入升级给 frontier LLM冲突检测和意图翻译分别达到 98.6% / 93.8% 端到端准确率,只需升级 16% / 17% 的输入;没有内在检查的纯知识任务(TeleQnA)则追不上 frontier 基线部署规则:能精确廉价检查的留本地,其余升级

local-inferenceslmnetwork-automationcheckabilityprivacyescalation-pipeline
4.0 · 优秀 开发者
Infra 2026-09-25 · 论文
ActKV: Efficient LLM Agents through Action-Guided KV Cache Management

ActKV(arXiv 2609.31395)是第一个面向 agentic 推理的 KV cache 压缩框架,关键思路是把驱逐标准从整体输出质量改为对动作生成的贡献三点核心:Action-oriented KV cache 驱逐利用稳定的动作访问模式保留对未来动作关键的条目;Confidence-driven adaptive budget allocation 用 LLM 内在置信度把预算分配适配到演化的动作关键内存需求;Page-aware compression 把压缩标准化成三个原语并配 kernel长 trace 任务上,ActKV 用 FullKV 25.98% 的峰值内存保留 98.53% 的精度,token/task 吞吐分别达到 FullKV 的 3.97x / 3.58x

kv-cacheagent-inferenceevictionpaged-memoryservingarxiv-cs-os
4.0 · 优秀 开发者
Infra 2026-09-25 · 文章
Anthropic to pay Akamai $11.6 billion over seven years in cloud deal

Akamai 9月24日官宣Anthropic将在七年内支付116亿美元使用其云基础设施,是Akamai历史最大单,约为双方5月18亿美元前序交易的六倍多本单押注AI基础设施低曝光的CPU一角:agent承担更多任务后通用芯片需求上涨,用途未披露8-K(签署日2026-09-18,MSA日期2026-05-05,新签Project Plan 2与3)写明承诺以交付与服务可用性要求为前提,任一方可按条件终止;Anthropic可在重大停机后对单个Plan有条件终止,Akamai控制权落入Anthropic直接竞争对手时可退出;MSA全文随2026-09-30季度10-Q提交收入节奏:2026无收入,2027H2起15亿-3亿美元,2028年底约17亿美元年化...

anthropicakamaicpu-cloudwarrant8-kai-infra
4.0 · 优秀 开发者
Infra 2026-09-24 · 文章
Package Manager Sandboxing

Andrew Nesbitt 9 月 24 日把过去四个月包管理器沙箱化进展盘成一张纵览:Homebrew 7.0.0(9 月 13 日)把fetch 阶段联网写 cache;install 阶段离线只读 cache做成一等公民,cask 的 LaunchServices 逃逸被堵,formula post_install 这种任意 Ruby 钩子被换成 signed *_steps,deadline 2027 年 12 月Homebrew 6.0 起的迁移路径是 Linux 先上 Bubblewrap 7 月换 Landlock 8 月删 Bubblewrap跨生态对照一长串:opam 2.0(2018)把 build/install 全部塞 bubblewrap + 断网...

package-managersandboxagent-securitysupply-chainseccomplandlock
5.0 · 必读 开发者
Infra 2026-09-24 · 论文
When Fancy Eviction Fails: Rethinking Cache Replacement For LLM Prefix Reuse

arXiv 2609.28870 拿两家公司生产 trace 评估了 14 种驱逐算法,在 HBM 限制与大内存池两种设置下都跑结论直接:相比 Belady oracle 仍有大缺口,但花哨策略相对 LRU 的提升很小原因在结构:前缀复用被活跃会话的规律节奏主导,recency 异常可预测论文引入 compute-savings ratio 与两个 offline oracle 来量化这种效应,并指出 prefix cache 还引入两个新挑战:重尾 session footprint 与 attention 计算随序列增长带来高方差 miss cost直接的反证:对 LLM prefix cache该不该上复杂策略是直接答案大多数情况下 LRU 已经够了

prefix-cachingevictionlruproduction-tracesnegative-result
4.0 · 优秀 开发者
Infra 2026-09-24 · 论文
Paging the Experts: Flash-Backed MoE Inference on iPhone

Routide(arXiv 2609.29032)是一个 Swift/MLX 运行时,在 iPhone 上跑 Qwen3.6-35B-A3B 量化版的文本路径,专家权重放存储,内存只留字节预算内的子集文章刻意保留热节流负面对比和数值等价不成立的限定,做诚实的端侧实测关键数字:五个 128-token 工作负载,固定路由重放下 512 MiB LRU 0.00% demand 命中种子随机驱逐 18.80%576 MiB LRU 38.58%容量悬崖是策略负载交互,不是固定的内存需求同运行时 Mac 对照组保住生成序列在驱逐与异步预取下的一致性,含 2560 次 exact token 比较与 10334 次 speculative load

moeflash-storageiphonemlxcache-policyreproducibility
4.0 · 优秀 开发者
Infra 2026-09-24 · 论文
To Store or To Regenerate? A Cost Model for AI-Generated Content at Scale

arXiv 2609.30448 建立一个成本模型比较 AI 生成内容的持久存储与按需重生成,涵盖语料增长HDD/磁带价格趋势驱动器替换电价请求偏斜缓存generator FLOPs 与未来 GPU 价格性能改进对图像生成:prompt-based regeneration 要到 2040 年前后才比存储便宜,因每次条件生成都远比一次存储贵数字反直觉但推演透明,适合做茶余谈资

storage-costregeneration-costcost-modelgpu-priceimage-generation
3.0 · 值得看 开发者
Infra 2026-09-24 · 文章
Oracle sends force majeure notice on its New Mexico Stargate data center

Bloomberg 9月24日首报:Oracle向新墨西哥Project Jupiter(Stargate数据中心园区)开发商Blue Owl Capital旗下主体发出force majeure通知Oracle否认意在退出主租户身份,而是为设施错过2028年上线目标时的付款义务预留豁免空间园区设计容量2.45GW,电力方案是Bloom Energy燃气燃料电池,可靠气源成为时间表咽喉;配套Energy Transfer输气管线在监管方多次拒绝许可后已推迟近六个月至2027年2月1日Oracle对CNBC声明项目仍按计划推进完全致力于新墨西哥...

oraclestargateopenaiblue-owlforce-majeuredatacenter
3.0 · 值得看 开发者
Infra 2026-09-23 · 论文
Xtrace: High-Fidelity GPU Intra-Kernel Tracing via Binary-Level Instruction Splicing

Xtrace(arXiv 2609.28769)把 probe 直接插进编译后的 GPU kernel 二进制,而不是插在编译前,从而避开现有工具的trace 的是另一个二进制问题方法上复用插入点的 dead 寄存器,按 compiler hazard table 消解所有冒险,再调度指令顺序对 LLM 生产 kernel:保留 94-98% 指令(现有工具 8-48%),开销 0.9-2.8%(现有 3.8-75.6%);用于引导 coding agent 优化 FlashAttention-3 时少 3.9x 迭代,并 trace 闭源 cuDNN kernel 把 FA4 吞吐抬 5.2-13.3%支持 19 种 NVIDIA/AMD 架构,代码公开

gpuprofilingintra-kernelbinary-instrumentationflashattentiontrace-fidelity
5.0 · 必读 开发者
Infra 2026-09-23 · 论文
The KV Cache Working Set: Online Capacity Planning for LLM Inference Systems

KVSET(arXiv 2609.27746)提出一个在线分析器,用 Mattson 栈算法估计 LLM serving 负载的KV cache 工作集即达到目标命中率所需的最小容量避免逐容量模拟前缀缓存在 agentic 工作负载上特别关键,因为模型会被反复调用并持续追加会话/工具历史;保留全部历史 KV 太贵,容量不够又显著降低命中率KVSET 与 ActKV 互补一个管驱逐策略,一个管容量规划

kv-cacheprefix-cachingcapacity-planningmattson-stackagent-inference
4.0 · 优秀 开发者
Infra 2026-09-23 · 文章
Snapdragon 8 Elite Gen 6:把手机拉进 agent 时代

高通在 Snapdragon Summit 2026 发布两块旗舰 SoC:Snapdragon 8 Elite Gen 6 与 Snapdragon 8 Elite Extreme Gen 6两块都用 TSMC N2 工艺,CPU 换新八核 Oryon 架构两颗 prime core 加六颗 performance core,是首批 mobile CPU 突破 5 GHzOryon Flex-Cache 把全部八核接进同一片 L2 pool,给 agent 这种跨核来回搬 working set的工作负载专门修了一次 miss costAI 侧:Hexagon NPU 重做,新增 Element Accelerator,context window 上限 32,000 tokens,共享 NPU 内存多 50%...

qualcommsnapdragonnpuagentic-aion-devicemoe
4.0 · 优秀 开发者
Infra 2026-09-22 · 文章
Package Manager Threat Model, Revisited

Andrew Nesbitt 把 5 月的两份包管理器威胁模型清单(CWE 清单 + attacker-goal 设计问题)在 10 个真实包管理器上跑了四个月后的合并复盘:5 月中旬以来 126 份公告涉及 23 个客户端与注册中心,约为这些工具历史公告总量的四分之一,主要由 pnpm(20 份)Homebrew(13 份)Flatpak(10 份)三轮集中审计贡献路径遍历仍居首位(33 份),且绝大多数来自 manifest 字段而非压缩包条目...

supply-chainpackage-managersecuritythreat-modelaudit
4.0 · 优秀 开发者
Infra 2026-09-21 · 文章
Cloudflare Python Workers are now generally available

Cloudflare 9 月 21 日把两年前 preview 的 Python Workers 转正:Python 在 Cloudflare Developer Platform 上成为一等公民机制早就铺好:Workers 自 2018 年起就支持 WebAssembly,Cloudflare 直接拿 Pyodide 把 Python 解释器编译到 Wasm 跑在 workerd(V8-based)上路径带来一个明确的工程后果:任何带 C/C++/Rust 原生扩展的包都必须被 cross-compile 到 Wasm 才能跑,Cloudflare 因此推动了 Pyodide 的工具链...

cloudflareworkerspythonwebassemblypyodideserverless
4.0 · 优秀 开发者
Infra 2026-09-21 · 文章
Cloudflare Python Workers are now generally available

Simon Willison 9 月 21 日转述 Cloudflare 的官方公告:经过两年预览期,Python 在 Workers 平台正式 GA,定位是Cloudflare Developer Platform 上的一等公民完全支持的语言运行机制是 Python 经 Pyodide 编译到 WebAssembly,在 V8 基础的 workerd runtime 里跑代价写在 limitation 文档里WebAssembly VM 里 multiprocessing 和 threading 都不能用开发体验上,pywrangler(PyPI 上的包名是 workers-py,命名有点反直觉)跑的是 workerd 本地模拟,里头有一个 123MB 的 binary...

cloudflarepythonwebassemblypyodideworkersserverless
3.0 · 值得看 开发者
Infra 2026-09-19 · 论文
DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scal...

DSec 是 DeepSeek 自家生产环境的 agentic 训练沙箱平台论文讲四件实事:1) 沙箱后端四选一统一封装FnCall / container / microVM / full-VM 通过统一 SDK 暴露,按任务安全等级挑;2) 状态层独立版本化跨任务复用把镜像依赖用户数据各自做成可独立打包的 layer,agent 长会话保留状态靠这套 layer 复用,而不是每次重起容器;3) 内存共享 / 回收 + CPU 重叠DSec 在 cluster 内做 placement 协调,把同一个 30B 量级 MoE 模型的冷权重镜像做跨任务 memory sharing,并让 CPU 与 IO 重叠跑agentic 训练开窗口开一波跑长任务回收一波的形态直接对应这套调度...

deepseekagentic-trainingsandboxinfrareward-hacking
4.0 · 优秀 开发者
Infra 2026-09-19 · 文章
RSA-896 Factored with CADO-NFS on GPU, ~30 GPU-years in 10 days

Stephen A. Weis 9 月 19 日宣布 factor 掉 RSA-896(RSA Factoring Challenge 历史遗留挑战数,896-bit / 270 位十进制),公开 pq 乘积精确等于原数且 p/q 都通过素数检测方法没有新数学,仍是 90 年代的 GNFS(开源实现 CADO-NFS)...

rsafactoringcado-nfsai-assistedcomputer-sciencenews
4.0 · 优秀 开发者
Infra 2026-09-19 · 文章
Package Management 周报 09-19:Rust 社工攻防YARD 文档生成执行边界Podman/CVE-2025-11395

Andrew Nesbitt 包管理器周报本期以供应链安全为主轴:Rust 团队官方警告针对 rust-lang team 及热门 crate 维护者的社工攻防,攻击者以招聘/项目/合作为由头约视频面试,诱使目标安装音频编解码器或执行剪贴板里的命令,以优质账号后续发布恶意 crate;Aaron Patterson 本人拆解 5 月 rubygems.org spam 事件:攻击者将 --load ./script.rb 塞进 gem 的 .yardopts,YARD 文档生成阶段直接执行,在 rubygems.info 容器内获得 cached API key随后批量发布恶意 gem其他实操:Podman 6.1.2/5.8.7 修 CVE-2025-11395(podman load 加载构造 layer tarball 可覆盖宿主机文件)...

supply-chainpackage-managementrustrubygemspodman
4.0 · 优秀 开发者
Infra 2026-09-17 · 论文
On-Demand Attention: Language Models Know When to Recall

提出 On-Demand Attention (ODA):给预训练模型挂一个轻量 recall head,先用 local attention 解码,只在 recall head 预测全局收益足够时再触发 global attention;推理时只训练 recall head,原模型权重不动,完整 KV cache 保留已在 Qwen / Gemma / hybrid-attention 骨干上验证:相比纯 local attention 恢复大部分质量,并显著减少 global 读次数;已移植到 vLLM GPU 条件执行,在长上下文解码场景拿到实际加速论文 28 页,2026-09-17 提交 cs.CL

arxivpaperlong-contextattentiondecodingvllm
4.0 · 优秀 开发者 / 研究者
Infra 2026-09-13 · 论文
BigMoMo: Efficient Inference of Large-Scale MoE with Speculative Decoding on Mobile Devices

手机跑 MoE 的瓶颈是数据搬运而非算力:DRAM 装不下权重,flash 分页读取碎片化,token 路由每次只换少量专家BigMoMo 利用推测解码的多 token 验证窗口解耦权重搬运与单 token 执行:按接受率/路由影响/搬运成本剪枝推测分支与专家激活,按运行时共加载模式重排 flash 专家布局,把就绪专家与 NPU 计算批量并行4 个 MoE 模型5 个基准2 个移动平台上 decode 平均比 on-demand autoregressive offload 快 4.83,比最优推测 MoE 基线快 1.82,支持到 30B 参数规模

arxivmoespeculative-decodingmobile-inferencenpu
5.0 · 必读 开发者
Infra 2026-09-13 · 论文
Partition-Aware Scheduling for Mobile Heterogeneous Inference Co-Execution

移动端推理跑在多核 CPU 集群 + 移动 GPU 的异构平台上,现有优化要么算子间并行(整个算子分给 CPU 或 GPU),要么算子内并行(切分每个算子),没有统一答案本文把 partitiondevice assignmentexecution order 三个决策联合建模求解,给出 partition-aware 调度器,在真机上端到端延迟优于两类纯策略与 SOTA 基线IFIP Performance 2026 / Performance Evaluation 期刊录用对端侧 LLM 推理调度是 CPU-GPU DAG 协同的参考实现

arxivmobile-inferencecpu-gpuschedulingdag
4.0 · 优秀 开发者
Infra 2026-09-10 · 论文
AgentZip: Memory Compression for High-Fanout Agent Sandboxes

AgentZip(HKUST + OPPO + Purdue, Mengming Li 等, 2026-09-10 提交)针对 agent 任务派生出大量并发沙箱会话的现实这些沙箱从同一模板启动执行相关轨迹,模板内和跨沙箱之间存在显著内存冗余传统内存压缩在怎么压(无法利用非相同页面的相似性)压什么(保守选页只看 page-fault 开销)何时压(被动按内存压力触发或完全无 agent 执行阶段感知)三个维度都不太对AgentZip 是专门给 AI agent 沙箱设计的内存压缩系统:利用模板相对和跨沙箱冗余的双重机制;把压缩对象扩展到任何有更省表示的页面;用 restore-time 预取取代压缩时的页面选择...

agent-sandboxmemory-compressiontemplate-redundancyprefetchhkustoppo
5.0 · 必读 开发者
Infra 2026-09-10 · 论文
AKTS: Sub-Microsecond Kernel Policy Switching for LM Agents (eBPF)

AKTS(mali-kh, 2026-09-10 提交,6 页附 1 图,代码与原始数据在 github.com/mali-kh/akts)针对 GPU 推理服务器把交互请求和后台批作业混跑在同一批 CPU 上的现实请求来时要保 TTFT,空闲时让批作业多吃吞吐,固定内核策略会牺牲一边;agent OS 要能在工作负载变化时切档难处在 eBPF 验证器不让在 110 s 调度事件里跑复杂代码:scalar 调控表达力不够动态生成 eBPF 策略把编译/验证/加载/可能的拒绝挂到运行时AKTS 把策略库在加载期一次性验证,运行时只写一个整数索引到内核里的已验证策略数组,内核内 tail call 解析索引,agent 发的是索引不是代码Linux 6.14 上策略切换 p50 920 ns;非法索引在 60,217 次调用里全部 inert...

agent-osebpfkernel-schedulervllmlinux-6.14policy-switching
5.0 · 必读 开发者
Infra 2026-09-09 · 论文
UNISON: Co-Designed Near-Memory Session KV Scheduler for LLM Agents

UNISON(复旦, Fan HeYan LiXiaoyang Zeng, 2026-09-09 提交)针对 LLM 被组合进 agent 循环(规划调工具等回应再恢复同一任务)的现实这与传统多轮聊天对内存的压力完全不同:工具等待期间持续累积 KV 前缀,多个会话共用 SRAM/HBM,淘汰和分层放置成了与计算模式正交的会话级效率问题基于 recency / timeout / 身份的策略把活的工具等待当成冷可弃单元错UNISON 是在 SRAM/HBM 旁的事件驱动近存调度器,SPEAR(基于会话间隔均值和 turn-indexed hazard 选谁离开)与 TIDE(把观察到的等待当作 DMA 预算,决定谁坐在快层)共享同一份 live ranking1,415 个会话33,596 轮的编码与通用任务基准上...

near-memorykv-cacheagent-memory28nmspeartide
5.0 · 必读 开发者
Infra 2026-09-09 · 论文
IBIB: A Protocol for Measuring Enterprise AI Systems by Serving Route, Not Model Identifier

这篇来自企业一线的论文主张:企业部署的是"系统"而不是"权重",可用能力由权重服务路径精度输出契约和 harness 共同决定,但作者审计的 18 个基准全都在给宣传用的模型 ID 打分,这本身就是测量误差 论文提出 IB2 协议让这一误差变得可报告:gold-blind 的能力绑定预检先验证服务路径能否执行评测契约;首过计分把失败纳入分数把不支持的能力挡在外面;裁定环节结构性盲分 在 11 个系统的实测中:同一权重不同服务路径的两次完整运行分别未通过绑定门的不同谓词,而第三次通过了宣传的模型 ID 完全暴露不了这种差异;七个套件中四个在六系统区间内饱和,区分度几乎全部来自受治理的数据库操作和多表 join;服务侧选择让同一声明版本+精度从 77.38 变到 82.54;把失败响应从分母剔除会直接改变排名结论

evaluationenterprise-aibenchmarkserving-routefield-note
4.0 · 优秀 开发者 / 研究者
Infra 2026-09-09 · 论文
ConvMem: Convolutional Memory for Long-Context Reasoning

MemAgent 一类的顺序方法靠分段阅读+迭代更新固定大小记忆来扩展有效上下文,但延迟高且依赖昂贵的 RL 训练(容易在特定数据集上过拟合) ConvMem 把长上下文重构成层级卷积:把"带着 query 的 LLM"当作卷积核,层级式摘要文本段,把线性链式推理路径缩成对数树 三个机制:Configurable Strides 与 Skip Connections 保证证据的稳健捕获与传播;Multi-Kernel Convolution 把复杂 query 分解到解耦的语义通道 training-free可在文本段和推理线程两个维度大规模并行;RULER-HotpotQA 和 RULER-2WikiMultiHopQA 上超过 training-free 基线,并避开了 RL 训练模型在分布外任务上过拟合参数先验的风险

long-contextmemorytraining-freeparallel-inferencefield-note
4.0 · 优秀 开发者
Infra 2026-09-07 · 文章
Jensen Huang 在没有定义的情况下宣布AGI 已经到来令人失望

Gary Marcus 9 月 7 日针对 Jensen HuangAGI 比赛已经结束的公开表态写了一篇短文,核心反驳有两层:一是 Astra 与 Fable 5.1 在多数基准上差距不明显,Artificial Analysis 把 Astra 排在 Fable 5.1 之后约 5 分;二是 ARC-AGI 3 的 99.9% 分数是用 OpenAI 自家 Provider Adapter harness 跑出来的,默认 harness 只到 62.7%,ARC 作者 Franois Chollet 本人明确说做对不等于 AGIMarcus 还引述他和 Brundage 的 10 项打赌,认为 Astra 至多命中自动形式化和可靠编码两项,其余八项都没到,结论是用没有定义的口号抢先给科学问题盖棺

agiopenaiastrabenchmarksafetyevaluation
4.0 · 优秀 开发者 / 研究者
Infra 2026-09-06 · 文章
Have the frontier labs mixed up AI safety and security?

Martin Alderson 区分 AI safety 与 security:前者常用 classifierRLHF 等非确定性拒答机制,后者要求单个控制点在已知漏洞上完整生效他用 Boris Cherny 提到的 Gray Swan IPI 基准反驳prompt injection largely solved:最佳 Opus 5 在 15 次尝试下仍有 2% 失败率,约 500 次即可统计击穿结合 Anthropic/OpenAI sandbox 事故,他认为问题不是没有告警,而是监控触发后仍继续运行;agent 安全要默认拒绝联网关闭 egress把告警当真

ai-securityagent-safetysandboxprompt-injectionfrontier-labsfield-note
4.0 · 优秀 开发者
Infra 2026-09-04 · 论文
Same Request, Different Answer: Quantization Amplifies Cache-Induced Divergence in LLM Serving

Prefix caching 是开源推理引擎默认开的优化,复用相同前缀的 KV 张量但论文测出它对可复现性的代价随量化加深:固定模型解码参数种子请求顺序,串行 batch=1 跑 80 episode 的多轮 agentic tool-use 任务,开启 cache 时 16-bit 下 36.2% episode 改变 agent 轨迹,4-bit 下飙到 75.0%;关闭 cache 在所有 4 个 weight format 下 800 episode 都 bit-identical(其他非确定性源 0.5%)结论:cache state 默认不重置是 LLM serving 的隐含坑,做 agent 评估不修这个坑就会出现'同一个模型同一个 benchmark 跑出两个结论'的尴尬

llm-servingprefix-cachequantizationreproducibilityagent-eval
5.0 · 必读 开发者
Infra 2026-09-04 · 论文
Vertumnus: Adaptive Context Parallelism for Production LLM Serving

LLM context window 越长,serving 算力与内存压力越大,context parallelism(CP)按序列切分到多 rank 是长上下文推理主流路径已有方案或静态 CP 或只在 active 请求/批次层面调 CP 度,跟不上异构负载也难在 cluster 层重组Vertumnus 是自适应 CP:请求层用 placement cost(预测排队延迟 + cache-aware prefill + GPU-time cost)在不同 CP 度 worker 间路由;集群层做秒级 split/merge 重组 worker;叠加全局 prefix-cache 策略跨同/异 CP 度协调放置与复制,保证 locality 不随 worker 组合变化

llm-servingcontext-parallelismprefix-cacheheterogeneous-gpuscheduling
4.0 · 优秀 开发者
Infra 2026-09-04 · 文章
在约束里写作必然让文本变形:AI 词序水印同样会拧巴

John Gruber 9 月 4 日从 1990 年代一份 17,000 词的 Super Metroid FAQ 讲到 AI 文本水印:rs1n 那份 FAQ 用等宽字体做到全文右对齐不靠加空格或连字符,读起来略微生硬像 ESL正是为了右对齐牺牲了自然表达;Ernest Vincent Wright 1939 年的无 e 小说Gadsby同理Gruber 由此推断:即便水印的约束比禁字母 e和75 列硬换行轻得多,只要词序必须服从某种隐藏模式,文本必然会有点拧巴在约束里写作必然让写作本身变形,程度只是相对而不是绝对

ai-detectionwatermarkwritingevaluation
4.0 · 优秀 开发者
Infra 2026-09-03 · 论文
Para-Pipe: Exploiting Hierarchical Operator Parallelism of ML Computational Graphs on SoCs

Yujie Zhang 等 9 月 3 日 arXiv (cs.DC) 投稿,IEEE TCAD 已接收把 ML 计算图映射到 heterogeneous SoC:在 Amlogic(ARM big.LITTLE + GPU)和黑芝麻(DLA + 2 DSP)上做 hierarchical 阶段内 + 阶段间算子并行,吞吐优先配置相对纯 pipeline 平均能效 +11.0%相对纯并行 +23.3%

edge-inferencesocheterogeneous-computingml-compiler
4.0 · 优秀 开发者
Infra 2026-09-03 · 论文
Latency-Aware Orchestration for Multi-Agent LLM Workflows on Heterogeneous GPUs

Jinghao Wang 等 9 月 3 日 arXiv (cs.DC) 投稿并发多 agent workflow 暴露未来依赖与 serving-state 需求,同时运行在 heterogeneous GPU 池上(负载模型驻留可用资源均随时间变化)本文给出 latency-aware 调度策略,让多 agent workflow 在异构 GPU 上把 makespan 显著拉短(论文报告 -36.8%),并对 model residency 与迁移开销建模

multi-agentorchestrationgpu-schedulinginference
4.0 · 优秀 开发者
Infra 2026-09-02 · 论文
SchedBlame: Who Ran While You Waited? Culprit-Attributed CPU Contention for Containers on Stock...

容器共享 CPU 时的争用归因问题PSIper-cgroup waitRQ-latency 都是 victim-side,只能说'这个容器在等'不说'它在等谁'SchedBlame 是 eBPF tracer,在不动内核的前提下倒过来记账:测 victim 可运行期间同 CPU 上每个其他 cgroup 实际跑了的 CPU 时间机制是 per-CPU bitmap + 4 个 scheduler hook,16 字节切片同时把 competitorvictim blame matrix 写完生产 96 核 84 容器验证:Redis 吞吐开销 1%单核开销 6%

ebpfcontainercpu-contentionkernel-obserabilitysched-tracing
4.0 · 优秀 开发者
Infra 2026-09-02 · 论文
AceSpec: An Asymmetric Edge-Cloud Collaborative Framework for Communication-Efficient LLM Infere...

Yida Zhang 等 9 月 2 日 arXiv (cs.DC) 投稿端侧部署 LLM 通常依赖模型压缩或 split inference,但压缩会损推理能力,split inference 受网络不稳拖累AceSpec 提出非对称端云协同框架,WAN 不稳时把 speculative pipeline flush 转本地 O(1) 查询;3.52 加速,50 Kbps 极限场景近峰值吞吐

edge-inferencespeculative-decodingedge-cloud
4.0 · 优秀 开发者
Infra 2026-09-01 · GitHub
slotstream: run Qwen3.8-Flash-Next on a Mac that can't hold it

carloslfu 这周发的 slotstream 把 Qwen3.8-Flash-Next(125B MoE,4-bit 量化后 104 GB)从 SSD 上按 expert 流式加载到 MLX,Swift 单二进制,兼容 Ollama 和 OpenAI chat 协议,已有的工具链不用改48 GB M5 Pro 上 warm decode 约 12 tok/s,冷启动到第一个 token 约 3s,峰值占用 32 GBauto-size 表给得透明8 GB Mac 跑 3 tok/s16 GB 跑 424 GB 跑 832 GB 跑 9,数字可以从 slotstream doctor --sim-ram N 重现安装一行 curl...

apple-siliconmoemlxollamaquantization
4.0 · 优秀 开发者
Infra 2026-09-01 · 论文
mzCache: On-Device LLM Memory Management under Multitasking

MobiCom 2026 收录端侧 LLM 推理最大现实问题不是模型大小而是多任务切换导致 LLM 内存被系统驱逐恢复靠慢速存储读取或 KV 重算,首 token 延迟崩mzCache 利用 SoC 统一内存把 LLM 内存切成细粒度共享 buffer,做 partial eviction + 跨处理器并发回填;hybrid swap + backward-out 策略保证从任意驱逐状态都能低延迟恢复基于 llama.cpp 实现为 Android 应用,对 storage-backed partial offload 的 TTFT 降 2.15.5

on-device-llmkv-cacheandroidmemory-managementmobicom-2026
4.0 · 优秀 开发者
Infra 2026-08-31 · 论文
Faithfulness Is Not Free: Auditing Offline KV-Cache Quantization in Retrieval-Augmented Generati...

RAG 离线缓存把检索文档的 KV 预计算存储,量化能进一步省存储,但没人系统回答过:压缩是否伤害忠实度?这篇第一次把准确率和忠实度拆开审计,对 Qwen2.5-7B-Instruct 在 RGB 和 HotpotQA 上用 INT8/INT4 测,幻觉检测器NLI 蕴含LLM judge 三个口径并行结论是:INT8 接近无损;INT4 即使在仍然事实正确的答案里,超过 90% 的忠实度变化是负向的accuracy 指标对这个退化完全失明,且检索噪声越大chunk 越多伤害越大所有做 KV cache 量化上线的人都该把"忠实度审计"加入发布门禁

kv-cachequantizationragfaithfulnesseval
4.0 · 优秀 开发者
Infra 2026-08-31 · 论文
A Universal Context-Reuse Layer for Cross-Model KV Sharing

现有 KV cache 复用几乎都假设生产者与消费者是同一模型,这篇把跨模型 KV 共享做成系统抽象,研究如何把 A 模型的 KV 状态翻译给规模架构attentiontokenizer模型家族都不同的 B 模型消费同族 Qwen2.5-7B Qwen2.5-1.5B 在 LongBench2 把准确率从 27.59% 提到 34.48%;跨族 Qwen2.5-1.5B Gemma-2-2B 在 4K 上下文下目标侧 prefill 成本最多降 67.05%;更异构的 Llama3.1-70B Qwen2.5-7B 拿到 44.0% vs 原生 45.7% 的准确率同时把延迟从 899ms 降到 138ms跨家族 1.7 点换 6.5 倍延迟改善的取舍对多 agent 流水线往往划算,但跨 tokenizer 的翻译边界作者自认尚未说透

kv-cachecross-modelinferenceprefillagent-pipeline
4.0 · 优秀 开发者
Infra 2026-08-31 · 文章
io_uring without readahead

Fernando Simes 8 月 31 日发的测量文,把 Turso 数据库 io_uring + O_DIRECT 后端打开,看为什么 Turso 那条 PR 用应用层 readahead 能跑出明显加速原因拆得很细:不开 readahead 时一次只提交一个 SQE,内核队列里始终只有一个 bio 可合并,所以 SQEs 195,207 个设备侧也接到约 196,000 个合并率 %rrqm 几乎为零...

io-uringo-directreadaheadstorage-engineperf
4.0 · 优秀 开发者
Infra 2026-08-29 · 文章
What GLM-5.3 Flash running on Chinese hardware actually means

Martin Alderson 拆解 Z.AI "GLM-5.3 Flash 端到端跑在国产芯片上"的声明:Z.AI 未点名芯片厂未给吞吐/功耗数据(无人独立验证),他默认华为海思 910c 一档96GB HBM2e 双计算 dieINT8 约 1.6 PFLOP/s约 3TB/s600W,约为四年前 H100 的 60%,且无原生 FP8950 系算力不涨,拆 prefill(950PR,配慢的 HiBL)与 decode(950DT,配 HiZQ)两种 SKU 分摊国产 HBM 产能真正的墙是 EUV:深圳逆向样机尚未产出可用芯片,业界预计规模量产不早于 2030(ASML 走了 25 年)...

ai-hardwarechina-semiconductorsglm-5.3inference-costeuv
4.0 · 优秀 开发者
Infra 2026-08-29 · 文章
Creepy Crawlies: AI Crawler Load on git.kernel.org, With Hard Numbers

kernel.org 的 Konstantin Ryabitsev 公布 AI 爬虫对 git.kernel.org 负载的硬数字:渲染 commit 页面给爬虫消耗的 CPU 已超过所有正常访问(含 git clone)的总和5 个地理分布节点共 90 核中,任何时刻有 14-16 核纯粹在为爬虫渲染 HTML,约占容量 20% 且呈波峰式冲击荒诞点在于这些数据一条 git clone 就能全部拿走,但爬虫坚持逐 commit 抓 HTML:linux.git 有 148 万 commit 加 922 个 forkpatch/plain/diff 视图,可枚举 URL 空间近乎无限对抗史很典型:UA 封禁导致伪装浏览器;封 IP/ASN 后爬虫转向住宅与移动代理轮换...

ai-crawlersweb-infrastructureanubisproof-of-workdata-scraping
4.0 · 优秀 开发者
Infra 2026-08-28 · X
LLM 推理栈里 4 种 cache:KV / Prefix / Prompt / Semantic 存的根本不是同一类东西

@_avichawla 8月28日长文KV, Prefix, Prompt and Semantic Caching in LLMs, clearly explained从第一性原理拆分四种 cache:KV cache 存的是单次请求内每个 token 每层 attention 张量;Prefix cache 按 token ID 哈希链放服务端做跨请求复用;Prompt cache 是把 prefix cache 包成计费产品(读 0.1x写 1.25x);Semantic cache 存生成结果字符串按 embedding 余弦相似度做模糊匹配前三种是精确匹配 + 正确性中性,命中失败只花钱+拖慢...

cachingkv-cacheprompt-cachesemantic-cacheagent-harness
4.0 · 优秀 开发者
Infra 2026-08-27 · 论文
Beyond Parallel Blindness: Information Floors and Model Gaps in Block Drafting

块草拟(一次前向提出多个 token)的拒绝率混合了两种损失:块内路径信息缺失与对可观测信息建模不完美,仅看接受长度无法区分本文提出信息地板(information floor):给定条件化顺序下的最低期望拒绝率,超过地板的部分即模型差距在四个领域四个开源目标模型与一个前沿 API 模型上估计得到三个发现:Qwen3-4B 末槽全并行地板达 0.286,任何提议器单槽接受率上限 71%;一个已实现 token 可消除 86-100% 的地板(局域性,独立的互信息分析同样复原该结论);当前草拟器远高于地板:末槽模型差距占 DFlash 拒绝的 43-64%DSpark oracle 条件拒绝的 85-92%这些结果把短程条件化的价值与提议器质量区分开来

speculative-decodingblock-draftinginformation-theoryinference-optimizationacceptance-rate
4.0 · 优秀 开发者
Infra 2026-08-27 · 论文
Beyond F1: Evaluating Coverage and Failure Recovery in AI Model Security Scanners

在 170 个 Pickle/PyTorch 工件145 个 specimen 家族的受控基准上评估 ModelScanModelAuditFickling 三个 ML 工件安全扫描器,核心区分判断准确率与判断可用性:ModelAudit 对 135 个有标注家族 100% 给出确定结论,Fickling 81.5%,ModelScan 仅 49.6%;但在能给出确定结论的条件下 ModelScan 精准率/召回率/F1 全部 100%ModelScan 分析失败的 48 个恶意家族里,ModelAudit 与 Fickling 都给出符合真值的检测结论:单看 F1 会掩盖覆盖率缺口,工具互补与增量检测覆盖才是部署关键,对做模型供应链扫描的团队是直接的选型证据

model-securitysupply-chainscannersevaluationpickle
4.0 · 优秀 开发者
Infra 2026-08-27 · 文章
Bazel Module Versions Aren't SemVer

packages.ecosyste.ms 把 Bazel Central Registry 上 protobuf 最新版显示成四年前的 3.19.6,根因是用严格 SemVer 解析器统一过滤所有生态:protobuf 自 2022 年去掉 3....

bazelbzlmodsemverversioningdependency-managementmvs
4.0 · 优秀 开发者
Infra 2026-08-25 · 文章
Hardening the Override Flag: 包管理器危险开关的防御设计

Andrew Nesbitt 梳理过去几年包管理器与 CLI 工具里危险开关的防御设计把 rmaptpipcargopacmanGoNixHomebrewDockergitCeph 摆到一张表里,按长名字无短选项不接环境变量必须写明目标会过期看状态必须离开通道六个属性归类关键结论:单纯把开关换成长名只挡得住眼睛扫到的脚本;挡住被劫持父进程的关键是拒绝环境变量通道真实事故记录:2026 年 6 月 140 个 @mastra/* npm 包被投毒因为 Node 无条件读 NODE_TLS_REJECT_UNAUTHORIZED=0;2024 年 needrestart CVE 是 root 进程继承普通进程的 PYTHONPATH...

supply-chain-securitypackage-managerscli-designagent-safety
4.0 · 优秀 开发者
Infra 2026-08-24 · 论文
Activation-Weighted Seeded Residual Coding for Low-Bit LLM Weight Repair

AWSRC 是给现成低位宽量化 backbone 配套的修复编解码器:把残差 WW0 用确定性种子生成的基编码,sidecar 只存种子选择器低位系数与尺度,不需要显式码本;激活统计优先修复影响层输出的误差Qwen2.5-3B-Instruct 上,给 INT4 RTN backbone 增加 0.162 bit/权重的开销,就关闭了对 BF16 的 88.2%/78.9%/71.3%(PPL/KL/准确率)匹配差距;49.25MB 的 sidecar 约为 BF16 权重载荷的 0.8%,在稀疏低秩向量量化编解码器对比中拿到最佳困惑度与平均任务准确率先量化后修补的端侧部署配方,按 MB 计费的场景可以直接试

quantizationresidual-codingweight-repairedge-deploymentllm-compression
4.0 · 优秀 开发者
Infra 2026-08-24 · 文章
Introducing Pipette: A benchmarking suite for on-device intelligence

Liquid AI 与 Artificial Analysis 联合开源 Pipette 端侧基准平台(Apache 2.0,含 pipette-mgmt/clients/scores 与 iOS/Android 原生客户端):核心论点是端侧行为是部署系统的属性,不是模型的属性,评测单元是 model quantization runtime device context 五维组合,已发布 1,000+ 实验室验证配置30+ 模型256-8192 token 上下文,覆盖 M5 MaxiPhone 17 ProGalaxy S26 Ultra公开数据示例:Galaxy S26 Ultra 上 Q4_K_M2564096 输入 token...

on-device-llmbenchmarkquantizationmobilellama-cppedge-ai
4.0 · 优秀 开发者 / 研究者
Infra 2026-08-23 · 文章
A Syncthing and SQLite Gotcha

作者的 Rust 日记应用 Epoch(systemd 服务 + SQLite)经 Syncthing 在桌面/笔记本间同步数据库,出现怪 bug:笔记本写完等同步完成桌面打开当条记录文字消失;用 sqlite3 命令行看文件内容都在,只有重启服务才能读到新文本根因在 POSIX rename 的语义:Syncthing 用 rename 原子替换文件,而 rename 只改路径inode的目录项映射不碰文件对象本身;持有旧文件描述符的进程继续读写那个已经没有路径指向的孤儿 inode,直到所有 fd 释放它才真正消失作者由此把路径即文件的心智模型纠正为目录项 vs 文件对象双层模型

sqlitesyncthingposixrenameinodefilesystem
4.0 · 优秀 开发者
Infra 2026-08-21 · 论文
TreeWY: Speculative Verification for Gated DeltaNet Hybrids

开源模型架构主流正在变成混合架构:大部分层是带固定大小递归状态的 Gated DeltaNet 线性注意力层,解码时不再维护增长的 KV 缓存,但投机解码的验证-回滚需要快照完整递归状态且无法在 draft tree 分支间共享,宽树在高接受率下内存不可行TreeWY 用树状 WY 变换重写 gated delta rule:每个 draft 节点的输出用一次三角求解得到,提交时只重建被接受的那个状态,用小伪值矩阵替代逐节点快照在 Qwen3.5 35B/397B 两个规模上,相同接受长度下投机递归状态内存和 KV 缓存压力显著下降做线性注意力推理引擎的人直接拿去用

linear-attentionspeculative-decodinginference-efficiencyarxiv
4.0 · 优秀 开发者
Infra 2026-08-20 · 论文
Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities...

用统一协议 (CLEVER) 系统评测语义缓存驱逐策略:FIFO/LRU/LFU/ARC/GDSF/流式 SISO/语义冗余度,覆盖 3 个查询语料 3 种容量 2 种编码器共 18 个设置没有任何策略比 LFU 高出 0.041pt 以上,FIFO 与流式 SISO 在紧张容量下最多落后 8.67/8.55ptLFU 就是最强简单默认更大的警讯来自质量审计:MiniLM 中位阈值下仅 2.1-3.9% 的命中可判定答案可替换,把 51-60% 的原始命中率压到 1.1-2.2% 的质量调整命中率,且阈值不可跨编码器迁移上语义缓存省成本前,先测命中是否等价这一关

semantic-cachellm-inferenceeviction-policysystems-evaluation
4.0 · 优秀 开发者
Infra 2026-08-20 · 论文
Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation

把多专家 LLM 系统该把查询路由给谁形式化为带昂贵检验的经典 Pandora's Box 问题:廉价估计器(嵌入预测)快而噪,精确估计器(带检索/部分推理的微调模型)准而贵在高斯信号模型下推导出闭式 value-of-information 表达式,据此得到集中式 Pandora's Router 与去中心化 Pandora's Bidder 两种策略;在多 LLM 基准RAG 专家与可变推理时长三类场景中,Router 以远更少的高价估计达到与穷尽估计相当的路由质量对多模型网关/路由层的成本-质量权衡给出了理论化框架

model-routingvalue-of-informationllm-infracost-efficiency
4.0 · 优秀 开发者
Infra 2026-08-20 · 论文
Learning how to Forget: fine-tuning for long-context sparse attention

KV 缓存压缩后掉点一直靠训练时用精确注意力绕开,本文给出针对稀疏注意力的微调方法:适用任意 KV 缓存策略,单张 A100 40GB 可跑,模型与驱逐策略共同适应后常超过精确注意力训练的模型领先策略 H2O 有专用 SDPA kernel 实现,全部方法收录于 AWS 开源库 KeysAndValues

long-contextkv-cachesparse-attentionarxiv
4.0 · 优秀 开发者
Infra 2026-08-20 · 论文
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalizati...

面向检索-free 文档知识内化的三段式后训练框架 IAR:Inject 把源文档转成续写/改写/指令条件重建目标做结构化注入,Align 用仅答案的 QA 监督对齐行为,Recover 与基座指令模型合并以恢复通用能力在 Common Corpus/CCI 语料与 LlamaPhiQwenSmolLM 四个模型家族上,8 个数据-模型设置中 7 个于全部四项指标超过 Vanilla SFT:领域 QA 平均 +3.6pt,通用能力 (IFEval/MMLU/MSBench) 平均 +12.1ptRAG 之外,把固定语料变成参数化知识的可复现路线

knowledge-internalizationpost-trainingrag-alternativefine-tuning
4.0 · 优秀 开发者
Infra 2026-08-20 · 论文
Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference

Daedalus-150M 反向设计小模型:先固定目标(单用户逐 token4-bit 权重普通 CPU)再选架构,18 层中仅 6 层保留完整注意力,其余用两步卷积避免重读增长的缓存;59.9B token 从零训练后超过 GPT-2 124MPythia-160M 等同量级模型

small-modelcpu-inferenceefficiencyarxiv
4.0 · 优秀 开发者
Infra 2026-08-20 · 文章
Malicious Rust crate arrayref runs a build-time payload

crates.io 上 arrayref 0.3.10 被注入对 typosquat 包 proc-macro1(仿冒 proc-macro2)的依赖,其 build script 用 base64 拼出恶意下载地址,跳过证书校验按架构下载二进制运行攻击者先把 0.3.50.3.9 yank 掉强迫升级到剩下的 0.3.10;维护者账号 droundy 确认被入侵,GitHub 仓库已 404arrayref 累计下载约 2.45 亿次,通过 tiny-skia winit 覆盖大多数 egui/iced GUI 项目文章列出完整 IoC(IP/端口/路径/SHA256),可直接用作 Cargo.lock 扫描与升级策略 playbook

supply-chain-securityrustmalwarecrates-iosbom
4.0 · 优秀 开发者
Infra 2026-08-20 · 文章
Cerebras CS-4: rack-scale wafer inference, up to 30x faster than GPUs

Cerebras 发布 CS-4 机柜级推理系统:每套三片 WSE-3 Turbo 晶圆(官称单瓦较上代提速至 2 倍);宣称较 GPU 系统推理快至 30 倍,瓦间互连延迟降至 2 微秒,在超过 10 万亿参数的模型上保持 1000+ tokens/s;每瓦吞吐量较 CS-3 高至 10 倍;配 Nexus 机柜平台面向超大规模部署

cerebraswafer-scaleinference-hardwarellm-servinglaunch
4.0 · 优秀 开发者
Infra 2026-08-19 · 论文
Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI PC Fleets

用普通局域网把几台 16GB 统一内存的 Intel AI PC(iGPU+NPU)拼起来跑单机放不下的大模型:按层切成流水线分片,每个分片预编译成 OpenVINO 图,激活值在机间传递三个工程关键点:在每个分片注入 beam_idx Gather 触发 IndirectKVCache fusion 恢复未切分速率;在有状态 OpenVINO 模型上做投机解码;请求携带各自 KV 缓存在流水线级间交错实现多用户并发两节点 Llama 3.1 8B INT4 双用户吞吐为单机单用户 1.79 倍;四节点 Lunar Lake 阵列可单用户交互式速度服务 70B 模型对端侧/边缘推理基础设施有直接参考价值

distributed-inferenceedge-aiopenvinopipeline-parallelismllm-serving
4.0 · 优秀 开发者
Infra 2026-08-19 · 文章
smolmachines / smolvm as a sandbox for untrusted Python & JavaScript

Simon Willison 让 Claude Fable 5 在 Claude Code for web 里实测 smolvm 1.8.3 作为不可信 Python 与 JS 代码沙箱容器本身是 Firecracker guest无 /dev/kvm,smolvm machine run 报 kvm not available,Fable 的 Plan B 是把完整测试集放到有 /dev/kvm 的 GitHub Actions ubuntu runner 上跑再删除 workflow结果确认硬件隔离 microVM 属性全部到位:冷启动 0.6-1.5 秒热执行约 50msCPU 与 RAM 限制guest 超时存储配额只读输入挂载与可写输出挂载非特权模式均按预期工作

sandboxmicrovmagent-safetytestingbenchmark
3.0 · 值得看 开发者 / 研究者
Infra 2026-08-18 · 文章
Two-Factor Authentication Across Package Registries

Nesbitt 按账户身份来自哪里把 ecosyste.ms 上包数过万的 registry 切成四档横向对比 2FA 进度:PyPI 是唯一全员强制(2024-01 起 TOTP/WebAuthn 都收,2022 年还发过 4000 把硬件 key);npm 走 cohort 强制2026-08 关掉账户治理类操作的 2FA bypass;RubyGems 对累计下载 1.8 亿次以上 gem 强制;NuGet 2022 年起依托 MSA/AAD 最早一刀切...

supply-chain2fapackage-registriessecuritytrusted-publishing
5.0 · 必读 开发者
Infra 2026-08-18 · 文章
Git at any scale: Cursor Origin's Continuity storage

Cursor 发布 Origin 背后的 Git 托管系统 Continuity:核心原语是存 S3 对象存储的 write-ahead log,push 先完整持久化为 WAL entry绝不提前 ack,可见性由后续 prepare/publish 流程决定;仓库磁盘副本不再是对共识最重要的东西,replica 从 pets 变回 cattle文中对照 GitHub Spokes 的教训块级文件系统复制(GFS/DRBD)全部碰壁磁盘仓库为 source of truth 导致每个副本都是 pets路由表成为可用性单点这是Git 按数据库运维路线的完整机制文档

gitstoragewalorigininfrastructurecode-hosting
4.0 · 优秀 开发者
Infra 2026-08-17 · 文章
AliExpress page keeps multipoint Bluetooth headphones locked to PC via WebAudio fingerprinting

作者发现 AliExpress 首页会让支持 multipoint 的蓝牙耳机卡在 PC 端不走音频路径,排除常规嫌疑后通过重写 AudioContext 构造函数发现 collina.js 和 fireyejs.js 搭建锯齿波振荡器 AnalyserNode ScriptProcessorNode 增益为 0 destination的图,看似无声其实让系统音频通路持续激活;浏览器判定这是实时音频处理所以 Media Session 和 mute 都拦不住脚本同时采集 canvas/WebGL/设备参数/WebRTC/传感器指纹并加密上报附 uBlock Origin filter 规则,是少有的端到端取证样本

browser-fingerprintingwebaudioprivacybluetoothforensics
4.0 · 优秀 开发者
Infra 2026-08-17 · 文章
VRAM Management Part 2: Beyond the Limits of Physical VRAM

Natalie Vock 的 amdgpu/TTM VRAM overcommit 补丁在 Linux 7.3 上游合并文章解释显存超卖时游戏崩溃的根因:RADV 提交命令时收到 -ENOMEM,而命令提交本身不分配新内存,问题出在 drm_exec 未与 TTM 串联遇 ABBA 死锁直接放弃她将 Christian Knig 2024 年 patchset rebase 到当前内核补掉残留 bug,加入 dmem cgroup 优先级,并按 vkSetDeviceMemoryPriorityEXT 优先级在内核 LRU 中排序 eviction实测把Indiana Jones从 8GiB 显存硬上到 9GiB 请求帧时仍稳定 19.6ms改动已在 SteamOS Stable 与 Preview 生效

linuxgpuamdgpukernelvram
3.0 · 值得看 开发者
Infra 2026-08-15 · 论文
From LLM Inference to Agentic Workloads: Characterization and Implications for Serving Systems

AgentSysBench 用十个代表性 agentic 应用和统一的系统层埋点,在受控部署与生产 trace 上量出 agentic 负载与常规推理服务的六条差异:单会话沙箱工作集内存峰值 28 GB;十个应用里五个的非 LLM 组件占延迟大头;GPU 推理内存密集检索与 CPU 密集沙箱混部使任务延迟最多相差 32 倍;生产会话在活跃步骤之间把状态闲置数分钟到数小时;工具 schema 与观测内容构成的 control-plane 开销持续挤占有效上下文;搜索查询与网络抓取存在大量跨请求重复四项优化实验验证这些数字能兑现:任务感知服务延迟降低 29%-40%,通信感知放置最高 4.5 倍,状态卸载节省 4.6 倍内存,工具结果缓存消除 35.2% 重复搜索并节省 19.3% 搜索成本

agentic-workloadsserving-systemsbenchmarkprofilingresource-management
4.0 · 优秀 开发者 / 研究者
Infra 2026-08-13 · 论文
vToken: Token-Level Virtualization for Reclaimable KV Caches

PagedAttention 的定长块消掉了分配器级碎片,但 token 粒度的 KV 驱逐比块管理更细,块内碎片大量不可回收vToken 加一层轻量 token 级虚拟化:用 token 表间接层把逻辑存活与物理摆放解耦,维持稳定逻辑视图,异步 repack 存活 token 实现物理回收;保持 PagedAttention kernel 与 CUDA Graph 兼容对比基线每请求保留 KV 块降 27.2%-72.3%,SLA 约束吞吐最高提升 1.37x

kv-cachepaged-attentionvirtualizationmemory-fragmentationserving
4.0 · 优秀 开发者
Infra 2026-08-12 · 文章
OTel Isn't Going Well (And I Made A Spreadsheet About It)

用 24 个月的 Git 贡献者分布对比 Envoy / Prometheus,把OTel 进度慢从感觉变成证据;对正在评估迁回 vendor SDK 的工程团队有直接参考价值作者画出 PHP / Ruby SDK 维护者高度集中在 2 人Go / .NET 健康度接近 Envoy 的对比图,并把 OTEP Spec Semantic Conventions 各语言 SDK 的锁死链拆给读者看,问题不在人少,而在binary stability gate + 极大 scope + 极少 maintainer三件套共振

opentelemetryoss-governanceenvoyprometheussdk
4.0 · 优秀 开发者
Infra 2026-08-12 · 文章
Apple Silicon and macOS VMs: 11-16x Faster LLM Inference with llama.cpp

Cua 在 Apple 的 Virtualization.framework 之上做了一层进程级 Metal capability shim,让 macOS guest 里的 llama.cpp 报出 Apple family 9 和 64 KB threadgroup memory,从而选到 SIMD-group matrix / bfloat16 路径,吞吐追到裸金属的 99%M1 Ultra 上 TinyLlama 1.1B Q4_K_M prompt 处理 11.08 倍token 生成 16.36 倍;Gemma 4 12B QAT Q4_0 7.20 倍 / 14.54 倍...

apple-siliconllama-cppinferencemacos-vmmetal
4.0 · 优秀 开发者
Infra 2026-08-12 · 文章
A new security baseline for enterprise agentic adoption

Docker 联合 SnykKeycard 发布 Agent Baseline v1.0-draft(2026-07-30 草案,Black Hat USA 2026 发布):定义企业 agent 部署最低安全结果的开放蓝图核心判断:问题不在模型能否识别恶意指令,而在模型周边系统是否限制 agent 可达范围可用权限判断错误时能采取的动作三问框架:什么在运行并能做什么/是否在批准边界内/出事能否证明并止损六结果 + 35 控制:DiscoverConstrainAuthorizeObserveValidateRespond个人最小集Constrain+授权短时 scope+Observe收录理由:企业上 agent 的可映射安全清单蓝图...

agent-baselinedockersnykkeycardenterprise-securityblueprint
4.0 · 优秀 开发者
Infra 2026-08-12 · 文章
Modular 26.5: Mojo 1.0 is here

Mojo 1.0 把过去几年快速演进遗留的多套并立语法收敛到 var 声明单一 Pointer统一定义 lambda,并且首次明确给出向后兼容承诺,可以视作 Mojo 进入能写生产代码的阶段自 2023 年首次发布以来 Mojo 进入 1.0,社区贡献 200 人1100 PR20 万行代码;26.5 引入 Python 风格 lambda稳定的 LSPMojo AI Skills 1.0引用失效诊断where 子句统一错误信息Modular 同时承诺在 2026 年开源 Mojo 编译器和工具链,并预告接下来要补异步编程模型pattern matchingunion 等核心能力MAX 方面把 max servemax benchmarkmax all 拆开安装,26.6 起废弃 modular 包

mojomodularlanguagemaxcompiler
3.0 · 值得看 开发者
Infra 2026-08-11 · 论文
ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantizat...

ReRound 解决 calibration-free LLM 量化里的 midpoint ambiguity:训练 conditional diffusion model 生成 low-bit weight 的连续 reconstruction,为接近量化区间中点的 weight 提供 rounding direction guidance;非敏感权重继续 RTN方法离线推理无额外开销,小模型 3-bit / 4-bit 量化稳定超过 RTN

llm-quantizationon-device-aidiffusioninference-optimization
4.0 · 优秀 开发者
Infra 2026-08-11 · 论文
Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models

Gated VLA-Cache 针对 Vision-Language-Action 模型复用 KV cache 的可靠性问题,引入 top-2 action token logit margin 作为零成本置信信号:margin 低于阈值就失效 cache 触发 full recomputeOpenVLA / OpenVLA-OFT 在 LIBERO-Goal / Long 上恢复 100% 精度损失,同时保留约 80% compute savings

vlakv-cacheon-device-airoboticsinference-optimization
4.0 · 优秀 开发者
Infra 2026-08-11 · 论文
ImpactHO: Importance-Aware KV Cache Transfer for Multi-User Edge LLM Handover

用户在边缘节点间切换时,KV cache 要在移动性约束的时间窗内传完,并发切换会打满回传带宽ImpactHO 按重要性对每个用户的 cache 排序只传信息量最大的那部分,把传输建模为多用户回传分配问题,最优解是闭式加权注水推广了信息论注水且支持在线调度500ms 传输窗内平均精度 93.7%+(距全 cache 上界 0.5pp 以内),达到千里眼上界的 98.2-99.5%

kv-cacheedge-computinghandoverwater-fillingbandwidth-allocation
4.0 · 优秀 开发者
Infra 2026-08-11 · X
Hetzner 实验性 open-weight 推理 API 上线

Hetzner 官方上线 exploratory platform,提供实验性 open-weight LLM inference API;免费无 SLA,明确不承诺成为正式产品社区截图提到模型覆盖包括 DeepSeek v4GLM 5.2Kimi 等这是传统云/主机商首次把免费实验 API无 SLA作为试水做法,对本地/自建 Agent 的推理后端选项有直接意义,但不适合直接上生产

hetzneropen-weightinference-apideepseekglmkimi
4.0 · 优秀 开发者
Infra 2026-08-10 · 产品
Needle 2: 14MB Agentic LLM for Phones, Wearables, and Microcontrollers

Needle 2 是一个 45M 参数的代理型 LLM,通过从预训练开始的 2-bit Cactus Quants 量化压缩至 14MB,面向低于 200 美元的边缘设备(手机可穿戴树莓派微控制器)采用 Simple Attention Network 架构,结合 Hadamard MLP 和哈希 n-gram 记忆表,每 token 仅需 70 MFLOPs通过 256-token 滑动 KV 窗口将会话 RAM 上限控制在 28MB已在 Pebble Index 01 智能指环中生产部署,以单一无依赖 C++ 二进制跨 Cortex-M 到 x86 到 WebAssembly 运行

edge-aion-devicetiny-modelfunction-callingquantizationiot
4.0 · 优秀 开发者
Infra 2026-08-10 · 文章
Watch out for cache read costs

作者用 20-100 轮的 agent 任务对比账单:上下文随轮次增长,缓存读取在 Opus 5 与 GPT 5.6 Sol 上分别占 76% 与 82% 总成本GPT 5.6 Sol 在 272k token 处有一次长上下文重定价,单轮成本会翻倍KV cache 已压缩到 5GB 量级可下沉到 NVMe,这意味着缓存读取是利润最厚的环节

llm-costkv-cacheagent-economicscontext-cache
4.0 · 优秀 开发者
Infra 2026-08-10 · 文章
Docker Sandboxes: Sandboxes for Coding Agents

Docker 给 coding agent 提供独立 microVM,只挂载项目工作区,允许 agent 在隔离环境里安装依赖修改配置和再启动容器Sandbox 默认可销毁,支持 Claude CodeCopilot CLICodexKiro 和 OpenCode,覆盖 macOSWindowsUbuntu性能描述如比虚拟机更快没有测试数据,适合先在非敏感仓库验证启动成本和隔离效果

dockersandboxcoding-agentisolation
4.0 · 优秀 开发者
Infra 2026-08-09 · 文章
SQLite compressed text-history prototypes: 20.4MB to 80.3KB

Simon Willison 原型了基于 SQLite 的文本修订历史存储:把所有历史版本放入 JSON 数组再整体压缩1000 次修订的 20.4MB 压缩到 80.3KB分块变体将历史拆成最多 128 次或 3MB 的块以避免全量解压缩

sqlitetext-historycompressiondata-storageprototyping
4.0 · 优秀 开发者
Infra 2026-08-08 · 论文
RotaryQuant: Fitting 120B MoE Models on Consumer Hardware via Fused Compressed-Space Attention

三轴压缩把 26-120B MoE 塞进消费级硬件:按架构角色分派位宽的混合精度权重量化(dense 层 4-bit路由专家 2-bit高激活峰度的共享专家 8-bit)+ LRU 专家卸载 + 对角 SO(4) 旋转把激活各向同性化后再做 3-bit 标量 KV 量化融合四 kernel 的 Metal 管线直接在 packed 3-bit 张量上做 attention,免物化全精度 KV是执行模型改变而非单纯量化16GB 内跑 26B-A4B/Qwen3-30B-A3B32GB 内跑 Nemotron-H 120B,交互式 9-19 tok/s,困惑度近乎零退化

kv-cachequantizationmoeconsumer-gpucompressionmetal
4.0 · 优秀 开发者
Infra 2026-08-07 · 论文
CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG

CoinRAG 通过复用离线计算的细粒度金块缓存来优化长上下文 RAG 的延迟-质量 Pareto 前沿它不再对整个 chunk 编码,而是通过两阶段检索识别查询相关的语义单元,将其切片 KV 表示与 chunk 级上下文拼装在 LongBench 多跳问答任务上,答案质量 (F1) 平均相对提升 5.3%,同时显著降低运营成本

ragkv-cachelong-contextinference-optimizationarxiv
4.0 · 优秀 开发者
Infra 2026-08-06 · 文章
How Compiler Explorer Runs on AWS in 2026

Matt Godbolt 更新 Compiler Explorer 在 AWS 上的十年架构:CloudFront/WAF 到 ALB 多舰队,生产几乎全靠 spot 与蓝绿部署;编译器存储从 EFS 到 SquashFS,再到内容寻址 CEFS + autofs 按需挂载,解决几千个编译器版本的启动和存储成本文中公开七月约 523 万次编译约 3600 美元月费和约 0.0007 美元/次编译,是少见的公共开发者工具运维复盘

compiler-explorerawsspot-instancescefsdeveloper-tools
4.0 · 优秀 开发者
Infra 2026-08-05 · GitHub
DeepSeek V4 Flash on a single AMD MI300X

这个仓库给出单张 AMD MI300X 部署 DeepSeek V4 Flash 的生产配置样本,覆盖 vLLM ROCm nightlyAITERFP8DSparkKV cacheCaddySHA-256 pin 与 smoke testClawFeed 摘要记录作者报告单流解码 168.6 tok/s8 并发 542 tok/s aggregate64-stream burst 830 tok/s aggregate,权重 156.67 GiB 放入 HBM,未额外量化或 offload它的价值在可复现配置版本 pin启动日志和 ROCm/MI300X 坑点,而不只是能跑模型

deepseekmi300xvllmrocminference
4.0 · 优秀 开发者
Infra 2026-08-05 · 文章
How Castform + Neon Beats Frontier Models on Price and Efficiency

Neon / Castform 把 agentic multi-hop 检索成本问题拆成可训练可算账的系统问题:私有语料进入 Neon Postgres + Lakebase hybrid search,用合成问答任务和检索/引用/正确性奖励对 4B 开源模型做任务向 RL post-train文章称检索准确率可接近 frontier 多轮搜索,而推理成本低约两个数量级;同时强调 stateful agent 训练需要廉价 branch 与隔离环境

agentic-retrievalpost-trainingneoncost-efficiencyrl
4.0 · 优秀 开发者
Infra 2026-08-04 · 文章
Keyv and friends compromised in active Shai-Hulud supply chain attack

Aikido 记录了 Keyv 维护者账号被攻破后的 Shai-Hulud npm 供应链攻击:攻击者向 keyvflat-cachefile-entry-cachecacheable 等高下载量包发布带 preinstall 的恶意版本,借 GitHub Actions provenance 正常签名发布payload 会下载 Bun 执行混淆脚本,窃取 npmGitHubAWSKubernetesVaultStripeSlack 等凭据,并利用 token 继续感染包和仓库8 月 5 日更新称至少 444 个包1381 个版本20 亿月安装量受影响

npmsupply-chain-securitycredential-theftshai-huludgithub-actions
5.0 · 必读 开发者
Infra 2026-08-04 · 论文
Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse

论文针对生产系统在同一模型家族内切换不同尺寸模型时需要重新 prefill 的成本,提出 cross-model KV cache transfer:在 KV head 数和维度匹配时用闭式线性映射复用源模型 KV cache;摘要报告 Qwen3 14B 到 32B 等场景中可跳过 prefill 并保持质量

kv-cachellm-inferencemodel-routingcost-optimization
4.0 · 优秀 开发者
Infra 2026-08-04 · 文章
brew install actions/checkout

Andrew Nesbitt 把 GitHub Actions 的 uses 生态类比为缺少依赖可见性和审查层的包管理器,并提出用 Homebrew tap / OCI artifact 方式包装 actions:formula 可以携带 SHA-256依赖声明auditsigstore attestation 与人工 review文章进一步讨论 composite action 内部 uses 重写runner 本地路径解析自托管 runner cache 和 zizmor index-time audit,适合从 CI 供应链角度重新看 actions/checkout 这类基础依赖

github-actionssupply-chain-securityhomebrewciattestation
4.0 · 优秀 开发者
Infra 2026-08-03 · 论文
Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM...

PRECOG/SMC 利用 State-Space Model 固定大小位置无关的隐状态,将文档语料离线预编码为 hidden state,查询时直接注入最匹配的状态,从而把 RAG prefill 成本从 O(L_context) 降到 O(1)摘要以 1.2B TENNs-LLM 演示在边缘硬件上将 prefill 延迟从约 27s 降到 <6ms,同时支持层次化持久记忆

ragssmedge-llmpersistent-memory
4.0 · 优秀 开发者
Infra 2026-08-03 · 论文
Meganeura: Portable GPU Training and Inference through Vulkan and Metal

验证单个紧凑原生编译器能否同时覆盖训练与部署推理:类型化静态图自动微分优化器checkpoint内存规划与运行时,全部经 Vulkan/Metal 降低到消费级 GPU五个匹配工作负载与 PyTorch 在 NVIDIA/AMD 独显AMD APUApple siliconIntel 核显上对比,严格 f32 与验证过的 fast path 分离前向反向独立过门裁剪后二进制 13 MiB;附 Android XR 实机案例Meganeura 训练的解码器迁入 Adreno/OpenXR 应用并与图形共享 command queue若该路线持续兑现,端侧 train-to-deploy 栈有去厂商化空间

vulkanmetalgpu-compilertrain-to-deployandroid-xrportability
4.0 · 优秀 开发者
Infra 2026-07-31 · 文章
Tailscale in the Hugging Face intrusion: The good news and the bad news

Tailscale 对 Hugging Face 入侵中的自身角色做复盘:没有 Tailscale 漏洞被利用,但逃逸的 AI agent 在生产 secret store 中读到 136 把密钥,其中可复用 Tailscale auth key 被带到外部沙箱并注册 181 个节点文章把重点放在长期凭据可复制工作负载身份flow logsTailnet Lock 和 workload identity federation 上,说明 Agent 时代的零信任网络也要把安全默认路径做得更容易

agent-securitycredentialstailscalehugging-facezero-trustincident-response
5.0 · 必读 开发者
Infra 2026-07-31 · 文章
Everyone is building LLM routers, we deprecated ours

Manifest 复盘自己下线 LLM router 的原因:按 prompt 预判复杂度无法覆盖工具调用后的真实任务上下文;prefix cache 对系统提示和历史上下文的降本效果往往比路由更直接;多模型切换会破坏行为一致性,并让 eval提示词和可观测性维护成本上升文章基于四个月约 7000 个云端用户的使用经验,主张多数场景应显式选择稳定模型和参数,而不是把不确定性外包给 router

llm-routingllm-gatewayagent-infraprompt-cachingmodel-selectionobservability
4.0 · 优秀 开发者
Infra 2026-07-31 · 文章
Asynchronous I/O in DuckDB: Work, Thread, Work

DuckDB v2.0(2026 秋)将默认对 Parquet/CSV 开异步读:引入 REGULAR + ASYNC 两个线程池,ASYNC 池负责让 fetch 持续在飞worker 拿到 job 即解码,fetch 与 decode 重叠同步读下 row group 的 fetch 未返回时 worker 只能空转;该改造直接面向 EC2/S3 计算存储分离场景(DuckLake + Quack 远程协议),本地 SSD 收益有限对直接查 S3 上 Parquet的湖仓工作流是一次免费吞吐提升

duckdbasync-ioparquetlakehouses3database
4.0 · 优秀 开发者
Infra 2026-07-30 · 文章
H96 TV Streaming Stick Ad Fraud: 38,000 Devices Spoofing Phones for Click Fraud

Krebs 联合 Bitsight 的深度调查:研究人员注册了一个过期域名,意外接管了约 38,000 台 H96 安卓电视棒的遥测通道这些设备不仅在 TV 开着时充当住宅代理出租 IP,TV 关着时还伪装成三星/华为/小米手机,访问蜂窝集团运营的 AI 生成网站,点击广告实施欺诈日收入估计 5 万美元

ad-fraudiot-securityh96fengwo-group
4.0 · 优秀 开发者
Infra 2026-07-29 · 文章
Self-hosting Kimi K3: 20% more hardware cost, 20% better task resolution

同团队把 Kimi K3 塞进真实 coding-agent 自托管基准:权重 1.4TB 需 8B300(约贵 20%)16 并发吞吐约 122 tok/s(GLM-5.2 为 170),中位任务 38 分钟对 26 分钟任务解决率 86.4%(对照 62.5%)前文还量化了 agent 账单长尾:中位员工年 API ~$140,P99 接近 ~$90k

gpu-self-hostingkimi-k3tcosglangcoding-agent
4.0 · 优秀 开发者
Infra 2026-07-28 · 文章
Why npm Dependency Trees Are So Big

Nesbitt 对比 Bundler一进程一版本冲突直接报错与 npm按路径加载模块冲突就复制一份:JavaScript 两个 node_modules 里的同名包是两份文件,安装几乎从不因版本冲突失败,约束对作者近乎零成本,微包与重复依赖随之膨胀Rust cargo 在 major 不兼容时也呈现类似复制策略树大是解析器与成本分配的系统设计结果,不是玄学

npmdependency-managementpackage-ecosystemnodejs
4.0 · 优秀 开发者
Infra 2026-07-26 · 文章
LLM token relay market: 便宜 token 转售已经变成可套利攻击面

Simon Willison 介绍了围绕 LLM token 转售形成的市场买家用低价代理规避地区限制降低成本,甚至收集蒸馏数据API key 池免费试用滥用开放 support bot 代理盗卡和 chargeback 已经组成完整的黑灰产生态链工程建议很具体:LLM vendor 需要给 API key 提供严格费用上限,让应用达到金额阈值后直接停止,而不是等账单爆炸后追责

llm-securitytoken-relayapi-abusecost-controlfraud
4.0 · 优秀 开发者
Infra 2026-07-26 · 文章
Bringing PyTorch Monarch to AMD GPUs: Single-Controller Distributed Training on ROCm

PyTorch 团队把 Monarch 的单控制器actor runtimeprocess mesh 和 supervision tree 带到 ROCm,让 AMD GPU 集群可以跑弹性分布式训练文章给出 TorchTitanTorchFTMonarch 组合后的无全局重启恢复流程,包括本地重启Lighthouse 选 donorpeer checkpoint transfer 和 quorum 重建,并展示 128/256 GPU 规模下的故障恢复实验

pytorchmonarchrocmdistributed-trainingfault-tolerance
4.0 · 优秀 开发者
Infra 2026-07-25 · 文章
Open-weight AI is having its Kubernetes moment. Let's not ruin it.

Tobi Knaup 借 Kubernetes 打败 Mesos 的历史解释 open-weight AI 的平台化时刻:当模型权重可运行可微调可部署时,推理服务Agent runtime评测沙箱可观测性和垂直微调会围绕共同底座继续生长文章也提醒 open-weight 不等于完整开源,政策应通过开放前沿模型采购标准测试和配套基础设施参与竞争,而不是粗暴封禁

open-weight-modelsai-infrastructurekubernetesecosystemmodel-governance
5.0 · 必读 开发者
Infra 2026-07-23 · 论文
Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context

Windowed-MTP 针对百万 token 上下文下 speculative decoding 的 draft KV 成本,给 MTP draft attention 加滑窗与 attention sink,而 target verification 仍保留全注意力摘要称在 1M 上下文中 draft KV 工作集可降约 99%,SGLang 单卡 decode-step 成本下降 28%44%

speculative-decodinglong-contextmtpsglanginference
4.0 · 优秀 开发者
Infra 2026-07-23 · Newsletter
Nobody knows what a used GPU cluster is worth

GPU 债和飞机船舶不同:面值清算价持续运营价是三套数,而持续运营价取决于拓扑知识散热 quirk 和静默数据损坏处置能力,这些通常不在贷款合同可见范围文章用 H100 租金波动和 CoreWeave 类 GPU 抵押贷溢价说明,市场给出的高收益本质上是在给看不清风险定价

gpu-clusterai-infradebtcoreweaverisk
4.0 · 优秀 开发者
Infra 2026-07-22 · 论文
PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

PyroDash 关注 SLM/LLM 协作推理的 token-level 交接:小模型在生成中通过控制 token 判断是否把 query 和部分 reasoning trace 交给冻结大模型补全,不需要单独 router重训大模型或访问大模型 logits训练包括控制 token embedding面向 offloading 的 SFT以及带成本项的 GRPO摘要给出两类运行点:=0.05 时平均准确率 64.04%比 LLM-only 高 6.36 个百分点且成本降 20.4%;高成本约束下 LLM token ratio 仅 1.90%,总成本从 49.36 美元降到 1.78 美元

llm-inferencesmall-language-modelsroutingcost-optimizationreasoning
4.0 · 优秀 开发者
Infra 2026-07-22 · 论文
MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Con...

MV-Bench 把多模态大模型的 UI/可视化生成评测从单图表推进到 coordinated multi-view interface:用 Tableau workbook 作为 ground truth,因为其中显式包含数据绑定视觉映射和交互基准包含 92 个基础界面1,048 个验证实例摘要显示最强模型视觉布局可达 75.45%,但数据绑定只有 21.71%交互完整性 11.68%,说明看起来像距离可用交互界面仍很远

multimodal-llmbenchmarkvisualizationui-generationevaluation
4.0 · 优秀 开发者 / 研究者
Infra 2026-07-22 · 文章
Everyone Should Know SIMD (Mitchell Hashimoto)

用 Ghostty 里扫 codepoint 找 C0 控制字符的真实热路径,把 SIMD 收成固定五步:broadcast 常量 按向量宽循环 并行运算 reduce scalar tail端到端约 5 吞吐提升论点:SIMD 可以简单到和 for 循环一样容易写,常见的处理 N 个值模式几乎总有同样的形状

simdperformanceghosttyoptimization
4.0 · 优秀 开发者
Infra 2026-07-21 · 文章
NVIDIA Vera Rubin NVL72 on CoreWeave: 10x More Tokens Per Megawatt Than Blackwell

CoreWeave 发布 Vera Rubin NVL72 首个实测硅片性能:DeepSeek R1 工作负载matched interactivity target(TPS/user 对齐)条件下,相对 GB200 NVL72 生成 10x tokens-per-second per megawatt优化栈全开:大规模专家并行NVFP4multi-token predictionprefill/decode 分离(TensorRT-LLM + Dynamo)落地读法:同功率预算跑 10 倍 reasoning 流量或同流量省一个数量级功率,agentic 多步负载受益最直接不可外推边界:10x 是 tok/s/MW @ matched TPS/user,不是通用 TCO 常数;厂商自测无第三方复测;缺 TPS/user 目标的机架对比不要抄这个数...

vera-rubin-nvl72inference-infrastructureenergy-efficiencydeepseek-r1matched-interactivity
4.0 · 优秀 开发者
Infra 2026-07-21 · 文章
Build intelligent Android apps: On-device inference

Google 的 Android 端侧推理文章把 Gemini NanoML Kit GenAI APIMediaPipe LLM Inference API 和 NNAPI 等路径放到同一张开发图里,并强调能力探测模型下载状态结构化输出端云回退和响应时延它适合作为移动 AI 从发布会功能走向工程指标的参考

mobile-aiandroidon-device-inferencegemini-nanollm-infra
4.0 · 优秀 开发者
Infra 2026-07-20 · 论文
SuperPass: Fast-Tracking Blocking Threads to Mitigate Priority Inversion on Mobile Devices

SuperPass 发现 Android 上的优先级反转长阻塞主要由低优先级线程的累积 CPU 等待时间造成,而非临界区延迟本身在 Pixel 8 上实测,内核 fast-track 调度让 UI 线程 P99.9 阻塞时长降 72.0%阻塞次数降 47.7%janky frames 降 29.2%,全系统 CPU 开销仅 0.74%优于 priority inheritancereal-time UI promotion 和 Proxy Execution 三种既有方案

androidpriority-inversionperformancejankkernel-scheduler
4.0 · 优秀 开发者
Infra 2026-07-19 · 论文
WAR: Workload-Aware Rollouts for Synchronous Agentic Reinforcement Learning

把同步 agentic RL 的长轨迹 rollout 当作系统瓶颈:低负载用无额外 draft 模型的 SuffixDecoding 复用已完成轨迹后缀模式;高负载转向缓存感知全局调度,按 cache locality轨迹进度与负载放置请求,减少 KV 重算与负载不均摘要称长上下文 agentic rollout 吞吐低负载约 1.4高负载最高约 1.6,不改底层 RL 算法价值在于按 runtime load 切换解码级与系统级优化,而不是一套策略打天下

agentic-rlrolloutkv-cachesuffix-decodingsystemsarxiv
4.0 · 优秀 开发者
Infra 2026-07-15 · 论文
X-CoSD: Communication-Efficient Cross-Vocabulary Collaborative Speculative Decoding

端云协作推测解码(CoSD)通常要求设备端 SLM 与服务端 LLM 共享词表,否则残差 resampling 要来回传整段 token 分布,通信开销吃掉本地解码收益X-CoSD 用 hybrid resampling 把残差切分成设备侧公共词表段+服务端 LLM-only 段,分布传输只在公共词表段发生;增强版 X-CoSD-E 让服务端只发替换候选+概率由设备本地验证,传输量进一步下降论文形式证明两个变体均无损保留服务端 LLM 输出分布,实验显示 token 生成显著加速且质量持平词表不匹配不再是端云协同解码的硬约束

arxivspeculative-decodingedge-cloudllm-inferencecommunication-efficiency
4.0 · 优秀 开发者
Infra 2026-07-04 · GitHub
pxpipe: Cut Token Usage by Rendering Context as Images

把 system prompttool docs 和历史对话渲染成 PNG 发给模型,利用图像 token 成本由像素尺寸决定实现 59-70% 成本削减密集内容每个 image-token 包含约 3.1 字符 vs 文本 token 约 1 字符Fable 5 上 10/10 读取准确,但标注了 lossy 限制:12 字符 hex 精确值在 Opus 上 0/15

token-optimizationimage-renderingcost-reductioncontext-engineering
4.0 · 优秀 开发者
Infra 2026-06-23 · 文章
三星芯片利润暴涨近 50 倍至 53.7 万亿韩元,预警 2027 年供应缺口将进一步扩大

三星芯片利润暴涨近 50 倍至 53.7 万亿韩元,预警 2027 年供应缺口将进一步扩大 作者:Reuters / Bloomberg 原文链接: 日期:2026-04-30 三星电子 Q1 营业利润 57.2 万亿韩元(约 386 亿美元),创历史新高,半导体部门贡献 53.7 万亿韩元,利润率超 70%,超过英伟达和台积电同期。三星已签多年期约束性合同锁定产能,警告 2027 年存储芯片供需缺口将比 2026 年更大。AI 数据中心对 HBM 的需求是核心驱动力。...

3.0 · 值得看 开发者
Infra 2026-06-23 · 文章
AI时代的性能分析:GPU Profiling初探

AI时代的性能分析:GPU Profiling初探 Source: Quality Score: 4 English 在CPU优化的过程中,例如我们遇到CPU打满的情况,我们可以通过perf等工具进行Profiling,然后将数据可视化成火焰图等形式进行分析;同样的,在GPU的优化过程中,我们也可以通过Profiling来进行性能优化。例如在大热的DeepSeek的推理系统中,就提到用Profiling来优化:本文主要介绍一些常见的GPU Profiling工具和可视化工具。由于笔者对GPU领域了解甚少,抛砖引玉,欢迎读者多多交流。公众号回复加群即可添加笔者微信拉入性能交流群。...

3.0 · 值得看 开发者
Infra 2026-06-23 · X
5Hv63Unh

2026-03-03-1210-yibie-Shipping-at-Inference-Speed-Notes-2028650995153314299

3.0 · 值得看 开发者
Infra 2026-06-22 · 文章
BatteryLife:面向电池寿命预测的综合数据集与基准测试 精读笔记

电池寿命预测(Battery Life Prediction, BLP)依赖于电池退化测试产生的时间序列数据,对于电池的使用优化和生产至关重要尽管该领域取得了显著进展,但仍面临三个关键挑战首先,现有数据集规模有限,阻碍了对现代电池寿命数据的深入理解其次,大多数数据集仅涵盖在实验室中在有限的多样性条件下测试的小容量锂离子电池,引发了对研究结论泛化能力的担忧第三,不同研究间不一致且有限的基准测试模糊了基线方法的有效性,也不清楚在其他时间序列领域流行的模型是否适用于BLP为应对这些挑战,我们提出了BatteryLife一个面向BLP的综合数据集与基准测试BatteryLife集成了16个数据集,样本量是此前最大数据集的2.5倍,并提供了最多样化的电池寿命资源,涵盖8种电池形态59种化学体系9种工作温度和421种充放电协议...

5.0 · 必读 开发者
Infra 2026-06-17 · 文章
Introducing LifeSciBench

OpenAI发布LifeSciBench一个由生命科学领域专家撰写并审核的基准测试,用于评估AI系统在真实生命科学研究任务和决策中的表现该基准填补了现有评测在专业科研流程覆盖度上的空白,为学术与制药场景下模型选型提供更严谨的参照

openaibenchmarklifescienceevaluationresearch
3.0 · 值得看 开发者 / 研究者
Infra 2026-06-12 · X
华为的Tau Scaling Law:半导体范式转移

franchement l'annonce de Huawei hier Shanghai vient de mettre noir sur blanc ce que j'essaie de vous faire comprendre ici depuis des annes p

x-post
4.0 · 优秀 开发者
Infra 2026-06-11 · 论文
MemRefine: LLM-Guided Compression for Long-Term Agent Memory

MemRefine:面向资源受限平台的预算化长期记忆管理长程交互中记忆库无限增长,冗余条目推高存储成本并通过挤占最有用证据而劣化检索;论文提出存储预算下的记忆管理任务在固定预算内维持已构建的记忆库,同时保留对未来交互有用的信息由于表面相似度难以反映事实价值,MemRefine 仅用相似度提出候选,由 LLM 引导压缩决策

agent-memorycompressionmemory-budgetstorage-managementretrievalarxiv
4.0 · 优秀 开发者
Infra 2026-06-09 · 论文
Infini Memory: Maintainable Topic Documents for Long-Term LLM Agent Memory

Infini Memory:把智能体长期记忆组织成可维护的主题文档现有记忆系统把观察存成孤立记录摘要或索引片段,导致证据聚合事实修订与记忆维护都困难;该架构把记忆视为主题结构化文本每个主题文档是一个语义单元,负责收集相关证据保存元数据并随时间修订事实;新观察先进缓冲区,再周期性合并成连贯文本上下文;推理时通过迭代式工具调用让 LLM 反复读取记忆而非单步检索;MemoryAgentBench 上验证

agent-memorylong-term-memorytopic-documentsretrievalmemoryagentbencharxiv
4.0 · 优秀 开发者
Infra 2026-05-20 · 论文
WCXB: A Multi-Type Web Content Extraction Benchmark

WCXB 构建了一个多类型 Web 内容抽取基准, 覆盖 2,008 个页面, 1,613 个域名和七种结构化页面类型. 摘要指出当前抽取器在文章页上表现接近, 但在产品, 列表, 文档等结构化页面上 F1 差异明显. 这对 RAG, 搜索索引和训练数据清洗都有实用参考.

web-extractionragbenchmarkdatasetevaluation
4.0 · 优秀 开发者 / 研究者
Infra 2026-05-19 · 文章
WeatherNext Helps NHC Predict Hurricane Melissa Cat-5 Landfall 5 Days Out

Google DeepMind 2026-05-19 复盘 WeatherNext 在 2025 飓风 Melissa 上的实战:这是有记录以来袭击牙买加的最强飓风, 也是大西洋最强之一WeatherNext 提前 5 天以 80% 置信度预测 Cat-5 登陆牙买加,3 天前升至接近 100%,首次实现从 Cat-1 起报直接预测到 Cat-5 强度其 50 路集合预报在 2025 年加权平均上同时拿下 track 与 intensity SOTA,补上了 全球模型过去"路径 vs 强度"二选一的缺口

weather-modeltropical-cycloneensembleearth-aigoogle-deepmind
4.0 · 优秀 开发者
Infra 2026-05-12 · 文章
LanceDB Lance Format v2.2: Half the Storage, None of the Slowdown

LanceDB 发布 Lance 格式 v2.2 版本基准测试结果:存储空间减半,性能无损失该格式是 LanceDB 向量数据库的底层数据格式,v2.2 在保持查询速度的同时显著降低存储成本,对大规模向量检索场景有实际意义

lancedbvector-databasestoragebenchmarkdata-format
3.0 · 值得看 开发者 / 研究者
Infra 2026-04-09 · 论文
Your Agent Is Mine: malicious intermediary attacks on LLM API routers

论文系统研究第三方 LLM API router 对 tool-calling agent 的供应链风险:router 作为应用层代理可明文访问整段 JSON payload,而客户端到上游模型之间缺少加密完整性保障作者定义 payload injectionsecret exfiltration 及两个自适应变体,扫描 28 个付费 router 和 400 个免费 router,发现 1 个付费与 8 个免费 router 主动注入恶意代码2 个使用自适应规避17 个触碰 AWS canary 凭证1 个抽走 ETH 私钥防线包括 fail-closed policy gateresponse-side anomaly screening 和 append-only transparency logging

llm-routeragent-securitytool-callingsupply-chainapi-securityarxiv
4.0 · 优秀 开发者
Infra 2026-03-19 · 论文
Prompt Control-Flow Integrity: A Priority-Aware Runtime Defense Against Prompt Injection in LLM...

PCFI (Prompt Control-Flow Integrity):把 prompt 视为 system / developer / user / 检索文档的有序组合,在转发到后端 LLM 之前跑三段式中间件(词法启发role-switch 检测层次化策略)实现为 FastAPI gateway,在合成 + 半真实 prompt-injection 评测上:所有带攻击标签的请求都被拦截False Positive Rate 0%中位开销仅 0.04 ms强调"provenance + priority aware"是部署侧实用且轻量的护栏,2026-03-19 提交 cs.CR

arxivpaperprompt-injectiondefensecontrol-flow
4.0 · 优秀 开发者 / 研究者
Infra 2026-02-17 · 论文
Agent Memory Below the Prompt: Persistent Q4 KV Cache for Multi-Agent LLM Inference on Edge Devi...

边缘设备上多 agent LLM 的显存困境:Apple M4 Pro 10.2GB cache 预算下 FP16 8K 上下文只能容纳 3 个 agent,10-agent 工作流需频繁驱逐重载,无持久化时每次驱逐都触发完整 prefill(4K 上下文每 agent 15.7 秒)方案是把每个 agent 的 KV cache 以 4-bit 量化持久化到磁盘并直接重载进 attention 层,免除重复 O(n) prefill收录理由:把 agent 记忆下沉到 KV cache 层的系统设计,对端侧多 agent 部署有直接工程价值

kv-cacheedge-inferencemulti-agentquantizationarxiv
4.0 · 优秀 开发者
Infra 2026-02-03 · 论文
Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis

arXiv 2602.03128(cs.AI,2026-02-03,25 页 9 图 13 表,Orogat/Rostam/Mansour)指出多 agent LLM 框架的架构选择可单独带来数量级延迟/吞吐差异显著的准确率与可扩展性变化,但缺乏框架级统一评测提出架构分类法 + 集成现有基准的统一执行流水线 MAFBench控制性实证发现框架级设计选择可使延迟增 100 以上规划准确率降 30%协调成功率从 90%+ 降至 30% 以下;据此给出具体架构设计原则与框架选择指引

multi-agentframework-comparisonlatencycoordinationagent-benchmark
4.0 · 优秀 开发者
Infra 2025-11-17 · 论文
Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of v...

vLLM vs HuggingFace TGI 的实证对比论文:在 LLaMA-2 7B-70B 上测吞吐量 / 端到端延迟 / GPU 显存占用 / 可扩展性结论:vLLM 在高并发批处理上凭借 PagedAttention 比 TGI 高达 24 吞吐;TGI 在交互式单用户场景下尾延迟更低论文给出按工作负载选型的具体建议10 页工程评测,2025-11-17 提交 cs.LG

arxivpaperinference-servingvllmtgibenchmark
3.0 · 值得看 开发者 / 研究者