Agents
3.0 · 值得看
aweb: Communication for AI agents
开源(MIT)的 agent 通信基础设施:给 agent 稳定身份跨会话/运行时/机器的持久 mail 与 chat以及唤醒事件;独立运营的服务器可互相联邦CLI 与 API 与运行时无关,官方维护 Claude Code 与 Pi 的唤醒集成,其他运行时可消费事件流示例场景:机器 A 上 Claude Code 里的 Alice 给机器 B 上 Pi 里的 Bob 发消息,aweb 存储消息并通过 Pi 扩展唤醒 Bob,Bob 离线则消息等待定位在 A2A/MCP 之外的agent 收件箱层,站点还直接教用户让 agent 读 llms.txt 自行评估并接入
2026-10-02 · 产品 · aweb
Infra
4.0 · 优秀
Magnitude: self-optimizing inference engine for agents
在 HN 上 Launch 的开源推理引擎:在用户设备上编译并调优 kernel,宣称开源模型比 llama.cpp 最多快 2 倍(Metal decode +92%,CUDA decode +19%),支持 Apple SiliconNVIDIAAMD 与纯 CPU桌面应用内置 magnitude CLI,一键连接 PiOpenCodeHermesCodex 等现有 agent;会话间共享前缀缓存,每 agent 内存低 27%,Apache 2.0,数据不出本机
2026-09-29 · GitHub · magnitudedev
Infra
4.0 · 优秀
Jeff: Jev-compatible 0.8B decision models, trained at home, ~30 ms
Jeff:Qwen3.5 / Gemma 4 微调(0.8B-2B)的零样本分类小模型描述情境并列出选项,单次前向直接返回每个选项的校准概率,不生成文本无需解析,RTX PRO 6000 上约 22msM4 Max (MLX) 约 28ms 一次决策全流程本地硬件训练(单卡 0.8B 约 2 小时),合成数据由开源模型生成;请求格式与 Jev 兼容短微调收益巨大:语音导航任务 held-out 准确率 31.7% -> 95.8%,单 GPU 半小时内小模型做结构化判断大模型做推理的分工再次被验证
2026-09-28 · GitHub · firelex
Models
4.0 · 优秀
Introducing Claude Sonnet 5.5
Anthropic 发布 Claude 5.5 家族第二款模型 Sonnet 5.5:比 Sonnet 5 快 30%+,单价不变($2/$10 每百万输入/输出 token)但单任务成本最多降 30%agentic coding 基准 Terminal-Bench 4.0 得分 70.6%(Sonnet 5 仅 10.3%),GDPval-AA 距 Opus 5.5 仅 2 分,还是首个纯靠截图打通宝可梦红的 Sonnet由于网络安全能力比肩 Opus 5,它成为首个上线 cyber safeguards 与 fallback 的 Sonnet;Haiku 5.5 将在数周内加入家族
2026-09-28 · 产品 · Anthropic
Coding
3.0 · 值得看
Imp: declarative self-improving language-model programs for Elixir/BEAM
deepfates/imp 是把 DSPy 全量移植到 BEAM(Elixir/Erlang 虚拟机)上的项目:开发者用 signature 声明"输入 输出字段"(如 issue -> kind: enum[bug,feature,question], summary),由 Imp 生成 prompt解析并做字段校验,全程不需要手写提示词或解析器;predict / chain_of_thought / react 三种模块风格覆盖单次推理与多步 tool 调用...
2026-09-27 · GitHub · deepfates
Coding
3.0 · 值得看
Codex 0.157.1: Windows daemon 后台稳定性补丁
OpenAI Codex CLI 9月26日发布0.157.1补丁版:0.157.0到0.157.1仅5个commits10个文件变更可考变更集中在Windows本地daemon/后台运行稳定性:新增Windows回归测试,验证被捕获的launcher输出在detached子进程仍存活时正确关闭子进程继续向配置的日志文件写入对应Windows上后台启动Codex时父进程句柄不释放弹窗挂起的日用摩擦...
2026-09-26 · GitHub · openai (github-actions)
Coding
3.0 · 值得看
Release v2.1.283 anthropics/claude-code
Claude Code v2.1.283(9 月 25 日发布)是一版明显偏向托管与企业部署的更新:新增 availableModelsMatch 管理设置,设为 exact 时 availableModels 只放行点名的模型版本,新发布模型默认被挡在外面,另加 deniedModels 显式黑名单;网关提示头新增 x-claude-code-prompt-id,让 LLM gateway 能把服务同一 user prompt 的请求分组对账;OTEL 的 tool.output 事件可选带出 MCPWebFetch 与 WebSearch 输出;新增 /doctor prompt-audit 审计 CLAUDE.mdskillsagents 里写给旧模型的提示模式...
2026-09-25 · GitHub · ashwin-ant
Models
4.0 · 优秀
livenerf: deterministic benchmark for post-launch model drift (Opus 5.5)
针对Anthropic 上线后悄悄削弱模型的持续争论,livenerf 从 Opus 5.5 发布日(2026-09-22)起建 day-0 基线:78 题固定题组(2,336 题池中筛出的 GPQA Diamond / MMLU-Pro / competition-math / AIME 2025-26 有时有错的部分),每天 90 个 sample 跑 30 天,再加 10 天 baseline 与两组 10 天对照窗因为采样参数被锁思考无法关闭,项目把其余一切钉死:frozen promptspinned Claude Code CLI 2.1.280harness 哈希 461391b6fce64167永久保留原始日志,基于 UK AISI 的 Inspect 框架...
2026-09-22 · GitHub · ninjahawk