Matt Godbolt 更新 Compiler Explorer 在 AWS 上的十年架构:CloudFront/WAF 到 ALB 多舰队,生产几乎全靠 spot 与蓝绿部署;编译器存储从 EFS 到 SquashFS,再到内容寻址 CEFS + autofs 按需挂载,解决几千个编译器版本的启动和存储成本文中公开七月约 523 万次编译约 3600 美元月费和约 0.0007 美元/次编译,是少见的公共开发者工具运维复盘
基础设施
推理、RAG、微调、评测、多模态、芯片和端侧部署。
这个仓库给出单张 AMD MI300X 部署 DeepSeek V4 Flash 的生产配置样本,覆盖 vLLM ROCm nightlyAITERFP8DSparkKV cacheCaddySHA-256 pin 与 smoke testClawFeed 摘要记录作者报告单流解码 168.6 tok/s8 并发 542 tok/s aggregate64-stream burst 830 tok/s aggregate,权重 156.67 GiB 放入 HBM,未额外量化或 offload它的价值在可复现配置版本 pin启动日志和 ROCm/MI300X 坑点,而不只是能跑模型
Neon / Castform 把 agentic multi-hop 检索成本问题拆成可训练可算账的系统问题:私有语料进入 Neon Postgres + Lakebase hybrid search,用合成问答任务和检索/引用/正确性奖励对 4B 开源模型做任务向 RL post-train文章称检索准确率可接近 frontier 多轮搜索,而推理成本低约两个数量级;同时强调 stateful agent 训练需要廉价 branch 与隔离环境
Aikido 记录了 Keyv 维护者账号被攻破后的 Shai-Hulud npm 供应链攻击:攻击者向 keyvflat-cachefile-entry-cachecacheable 等高下载量包发布带 preinstall 的恶意版本,借 GitHub Actions provenance 正常签名发布payload 会下载 Bun 执行混淆脚本,窃取 npmGitHubAWSKubernetesVaultStripeSlack 等凭据,并利用 token 继续感染包和仓库8 月 5 日更新称至少 444 个包1381 个版本20 亿月安装量受影响
论文针对生产系统在同一模型家族内切换不同尺寸模型时需要重新 prefill 的成本,提出 cross-model KV cache transfer:在 KV head 数和维度匹配时用闭式线性映射复用源模型 KV cache;摘要报告 Qwen3 14B 到 32B 等场景中可跳过 prefill 并保持质量
Andrew Nesbitt 把 GitHub Actions 的 uses 生态类比为缺少依赖可见性和审查层的包管理器,并提出用 Homebrew tap / OCI artifact 方式包装 actions:formula 可以携带 SHA-256依赖声明auditsigstore attestation 与人工 review文章进一步讨论 composite action 内部 uses 重写runner 本地路径解析自托管 runner cache 和 zizmor index-time audit,适合从 CI 供应链角度重新看 actions/checkout 这类基础依赖
PRECOG/SMC 利用 State-Space Model 固定大小位置无关的隐状态,将文档语料离线预编码为 hidden state,查询时直接注入最匹配的状态,从而把 RAG prefill 成本从 O(L_context) 降到 O(1)摘要以 1.2B TENNs-LLM 演示在边缘硬件上将 prefill 延迟从约 27s 降到 <6ms,同时支持层次化持久记忆
TokTier shows tokenization can dominate TTFT once agent prompt-cache hit rates get high.
Tailscale 对 Hugging Face 入侵中的自身角色做复盘:没有 Tailscale 漏洞被利用,但逃逸的 AI agent 在生产 secret store 中读到 136 把密钥,其中可复用 Tailscale auth key 被带到外部沙箱并注册 181 个节点文章把重点放在长期凭据可复制工作负载身份flow logsTailnet Lock 和 workload identity federation 上,说明 Agent 时代的零信任网络也要把安全默认路径做得更容易
Manifest 复盘自己下线 LLM router 的原因:按 prompt 预判复杂度无法覆盖工具调用后的真实任务上下文;prefix cache 对系统提示和历史上下文的降本效果往往比路由更直接;多模型切换会破坏行为一致性,并让 eval提示词和可观测性维护成本上升文章基于四个月约 7000 个云端用户的使用经验,主张多数场景应显式选择稳定模型和参数,而不是把不确定性外包给 router
Krebs 联合 Bitsight 的深度调查:研究人员注册了一个过期域名,意外接管了约 38,000 台 H96 安卓电视棒的遥测通道这些设备不仅在 TV 开着时充当住宅代理出租 IP,TV 关着时还伪装成三星/华为/小米手机,访问蜂窝集团运营的 AI 生成网站,点击广告实施欺诈日收入估计 5 万美元
同团队把 Kimi K3 塞进真实 coding-agent 自托管基准:权重 1.4TB 需 8B300(约贵 20%)16 并发吞吐约 122 tok/s(GLM-5.2 为 170),中位任务 38 分钟对 26 分钟任务解决率 86.4%(对照 62.5%)前文还量化了 agent 账单长尾:中位员工年 API ~$140,P99 接近 ~$90k
Nesbitt 对比 Bundler一进程一版本冲突直接报错与 npm按路径加载模块冲突就复制一份:JavaScript 两个 node_modules 里的同名包是两份文件,安装几乎从不因版本冲突失败,约束对作者近乎零成本,微包与重复依赖随之膨胀Rust cargo 在 major 不兼容时也呈现类似复制策略树大是解析器与成本分配的系统设计结果,不是玄学
Simon Willison 介绍了围绕 LLM token 转售形成的市场买家用低价代理规避地区限制降低成本,甚至收集蒸馏数据API key 池免费试用滥用开放 support bot 代理盗卡和 chargeback 已经组成完整的黑灰产生态链工程建议很具体:LLM vendor 需要给 API key 提供严格费用上限,让应用达到金额阈值后直接停止,而不是等账单爆炸后追责
PyTorch 团队把 Monarch 的单控制器actor runtimeprocess mesh 和 supervision tree 带到 ROCm,让 AMD GPU 集群可以跑弹性分布式训练文章给出 TorchTitanTorchFTMonarch 组合后的无全局重启恢复流程,包括本地重启Lighthouse 选 donorpeer checkpoint transfer 和 quorum 重建,并展示 128/256 GPU 规模下的故障恢复实验
Tobi Knaup 借 Kubernetes 打败 Mesos 的历史解释 open-weight AI 的平台化时刻:当模型权重可运行可微调可部署时,推理服务Agent runtime评测沙箱可观测性和垂直微调会围绕共同底座继续生长文章也提醒 open-weight 不等于完整开源,政策应通过开放前沿模型采购标准测试和配套基础设施参与竞争,而不是粗暴封禁
Windowed-MTP 针对百万 token 上下文下 speculative decoding 的 draft KV 成本,给 MTP draft attention 加滑窗与 attention sink,而 target verification 仍保留全注意力摘要称在 1M 上下文中 draft KV 工作集可降约 99%,SGLang 单卡 decode-step 成本下降 28%44%
GPU 债和飞机船舶不同:面值清算价持续运营价是三套数,而持续运营价取决于拓扑知识散热 quirk 和静默数据损坏处置能力,这些通常不在贷款合同可见范围文章用 H100 租金波动和 CoreWeave 类 GPU 抵押贷溢价说明,市场给出的高收益本质上是在给看不清风险定价
PyroDash 关注 SLM/LLM 协作推理的 token-level 交接:小模型在生成中通过控制 token 判断是否把 query 和部分 reasoning trace 交给冻结大模型补全,不需要单独 router重训大模型或访问大模型 logits训练包括控制 token embedding面向 offloading 的 SFT以及带成本项的 GRPO摘要给出两类运行点:=0.05 时平均准确率 64.04%比 LLM-only 高 6.36 个百分点且成本降 20.4%;高成本约束下 LLM token ratio 仅 1.90%,总成本从 49.36 美元降到 1.78 美元
MV-Bench 把多模态大模型的 UI/可视化生成评测从单图表推进到 coordinated multi-view interface:用 Tableau workbook 作为 ground truth,因为其中显式包含数据绑定视觉映射和交互基准包含 92 个基础界面1,048 个验证实例摘要显示最强模型视觉布局可达 75.45%,但数据绑定只有 21.71%交互完整性 11.68%,说明看起来像距离可用交互界面仍很远
用 Ghostty 里扫 codepoint 找 C0 控制字符的真实热路径,把 SIMD 收成固定五步:broadcast 常量 按向量宽循环 并行运算 reduce scalar tail端到端约 5 吞吐提升论点:SIMD 可以简单到和 for 循环一样容易写,常见的处理 N 个值模式几乎总有同样的形状
Google 的 Android 端侧推理文章把 Gemini NanoML Kit GenAI APIMediaPipe LLM Inference API 和 NNAPI 等路径放到同一张开发图里,并强调能力探测模型下载状态结构化输出端云回退和响应时延它适合作为移动 AI 从发布会功能走向工程指标的参考
SuperPass 发现 Android 上的优先级反转长阻塞主要由低优先级线程的累积 CPU 等待时间造成,而非临界区延迟本身在 Pixel 8 上实测,内核 fast-track 调度让 UI 线程 P99.9 阻塞时长降 72.0%阻塞次数降 47.7%janky frames 降 29.2%,全系统 CPU 开销仅 0.74%优于 priority inheritancereal-time UI promotion 和 Proxy Execution 三种既有方案
把同步 agentic RL 的长轨迹 rollout 当作系统瓶颈:低负载用无额外 draft 模型的 SuffixDecoding 复用已完成轨迹后缀模式;高负载转向缓存感知全局调度,按 cache locality轨迹进度与负载放置请求,减少 KV 重算与负载不均摘要称长上下文 agentic rollout 吞吐低负载约 1.4高负载最高约 1.6,不改底层 RL 算法价值在于按 runtime load 切换解码级与系统级优化,而不是一套策略打天下
把 system prompttool docs 和历史对话渲染成 PNG 发给模型,利用图像 token 成本由像素尺寸决定实现 59-70% 成本削减密集内容每个 image-token 包含约 3.1 字符 vs 文本 token 约 1 字符Fable 5 上 10/10 读取准确,但标注了 lossy 限制:12 字符 hex 精确值在 Opus 上 0/15
OpenAI 与 Broadcom 联合推出 Jalapeo 自研 LLM 推理芯片
三星芯片利润暴涨近 50 倍至 53.7 万亿韩元,预警 2027 年供应缺口将进一步扩大 作者:Reuters / Bloomberg 原文链接: 日期:2026-04-30 三星电子 Q1 营业利润 57.2 万亿韩元(约 386 亿美元),创历史新高,半导体部门贡献 53.7 万亿韩元,利润率超 70%,超过英伟达和台积电同期。三星已签多年期约束性合同锁定产能,警告 2027 年存储芯片供需缺口将比 2026 年更大。AI 数据中心对 HBM 的需求是核心驱动力。...
xAI 发布 Grok 4.3:常驻推理100万上下文超低定价,附带语音克隆套件 Custom Voices
The Future of AI: Multimodal Systems Domination
AI时代的性能分析:GPU Profiling初探 Source: Quality Score: 4 English 在CPU优化的过程中,例如我们遇到CPU打满的情况,我们可以通过perf等工具进行Profiling,然后将数据可视化成火焰图等形式进行分析;同样的,在GPU的优化过程中,我们也可以通过Profiling来进行性能优化。例如在大热的DeepSeek的推理系统中,就提到用Profiling来优化:本文主要介绍一些常见的GPU Profiling工具和可视化工具。由于笔者对GPU领域了解甚少,抛砖引玉,欢迎读者多多交流。公众号回复加群即可添加笔者微信拉入性能交流群。...
OpenAI发布LifeSciBench一个由生命科学领域专家撰写并审核的基准测试,用于评估AI系统在真实生命科学研究任务和决策中的表现该基准填补了现有评测在专业科研流程覆盖度上的空白,为学术与制药场景下模型选型提供更严谨的参照
franchement l'annonce de Huawei hier Shanghai vient de mettre noir sur blanc ce que j'essaie de vous faire comprendre ici depuis des annes p
WCXB 构建了一个多类型 Web 内容抽取基准, 覆盖 2,008 个页面, 1,613 个域名和七种结构化页面类型. 摘要指出当前抽取器在文章页上表现接近, 但在产品, 列表, 文档等结构化页面上 F1 差异明显. 这对 RAG, 搜索索引和训练数据清洗都有实用参考.
LanceDB 发布 Lance 格式 v2.2 版本基准测试结果:存储空间减半,性能无损失该格式是 LanceDB 向量数据库的底层数据格式,v2.2 在保持查询速度的同时显著降低存储成本,对大规模向量检索场景有实际意义