Infra
4.0 · 优秀
DeepSeek V4 Flash on a single AMD MI300X
这个仓库给出单张 AMD MI300X 部署 DeepSeek V4 Flash 的生产配置样本,覆盖 vLLM ROCm nightlyAITERFP8DSparkKV cacheCaddySHA-256 pin 与 smoke testClawFeed 摘要记录作者报告单流解码 168.6 tok/s8 并发 542 tok/s aggregate64-stream burst 830 tok/s aggregate,权重 156.67 GiB 放入 HBM,未额外量化或 offload它的价值在可复现配置版本 pin启动日志和 ROCm/MI300X 坑点,而不只是能跑模型
2026-08-05 · GitHub · Ryan Zhou
Models
4.0 · 优秀
Introducing Shieldstral.
Mistral 发布 Shieldstral,一个 3B open-weights multimodal safety classifier,Apache 2.0它把内容审核建模为推理时可输入自然语言 policy 的 yes/no 问答:请求由 InstructQueryDocument 组成,只读取 yes/no logits 并归一化成安全分相比固定 taxonomy guardrail,这种形态更适合不同产品地区和人群切换安全策略;官方称单张 16GB NVIDIA GPU 可运行,并在文本安全拒答检测和多模态审核上达到强表现
2026-08-04 · 产品 · Mistral AI
Research
4.0 · 优秀
smevals: a small eval suite for models, prompts, and harnesses
Simon Willison 与 Prime Radiant 合作开发的 eval 框架核心是一套清晰的词汇表:eval 是挑战集合,task 是单个挑战,config 指定模型+参数+harness,run 记录执行结果,grader 用 check 序列打分运行和评分分离设计,可以先批量跑再统一评支持本地 web 可视化和静态 HTML 报告导出用 uvx smevals docs 就能让 coding agent 自学使用方式
2026-07-31 · 产品 · Simon Willison
Coding
5.0 · 必读
OpenAI Codex Security (CLI + TypeScript SDK)
OpenAI 开源 Codex Security:CLI + TypeScript SDK,定位 find/validate/fix 代码安全漏洞,支持整仓/路径/diff/工作区扫描findings 跟踪coverageSARIFCI 与 pre-commit最小路径 npm install @openai/codex-security npx codex-security login npx codex-security scan .;CI 用 OPENAI_API_KEY文档要求 Node 22+scan/export 需 Python 3.10+;CLI/SDK beta 且需要 access工程意义是把安全检查嵌进 edittestscanfixretest loop,而不是替代人工安全评审
2026-07-28 · GitHub · OpenAI
Coding
4.0 · 优秀
Grok Build Mode
xAI 发布 Grok Build Mode Early Beta(面向 SuperGrok Heavy):描述想法 会话内 live preview 发布到 grok.me 或自定义域名;覆盖 web / iOS / Android产物类型含 websitesappsgamesinteractive dashboards工程读法:这是原型与轻应用交付面,不是 terminal coding agent 的项目控制面替代品;进入主仓前仍要补架构上下文测试与安全扫描
2026-07-28 · 产品 · xAI
Research
4.0 · 优秀
Can a MUD evaluate LLMs? CrucibleBench
CrucibleBench 用可枚举动作空间的 MUD 环境评估 LLM:7 类命令12 个房间14 件物品,再加 NPC 信任/怀疑状态和局内持久化,把幻觉动作对话死循环错误房间交互变成可算法检测的失败模式作者明确声明它不是通用社交智能标尺,而是可解释行为测量的 POC
2026-07-23 · 产品 · CrucibleBench
Coding
4.0 · 优秀
CodeAlmanac: A codebase wiki for AI coding agents
仓库内 Markdown 活 wiki,记录代码说不清的决策流程不变量与坑本地索引,经 Git review;支持 search/show/topics/health/validate 与本地 web viewer当前支持 macOS 上 Codex 或 Claude Code,Python 3.12+自动化可扫描本地会话沉淀长期知识信任边界重要:lifecycle agent 有广泛本地文件权限,almanac/ 边界靠指令与提交策略而非 OS sandbox把 agent 上下文从一次性 prompt 迁到可 review 的仓库知识层
2026-07-22 · GitHub · AlmanacCode
Models
4.0 · 优秀
Introducing Laguna S 2.1
Poolside Laguna S 2.1:118B MoE每 token 激活 8B最长约 1M 上下文,训练到发布不到九周强调长程 coding 与推理,并公开 final eval 全轨迹(trajectories.poolside.ai)文中 Terminal-Bench 2.1 等分数与案例(含长步骤 canvas 引擎自家 harness 加速)需注意 harness 边界,作者也提示 DeepSWE 等与 leaderboard harness 不可简单横比价值在长任务验证循环与评测透明度,而不只是再报一个 coding 榜
2026-07-21 · 产品 · Poolside