Sean Goedecke 借 Dota 2 的 laning 和 Magic/StarCraft 的 aggro 类比论证:大厂工程师的一切技能都压在能 ship 这个地基上不能直接交付的人会花 15 分钟估一个 5 分钟能做完的任务提出发不出去的设计把琐事膨胀成跨团队项目,并让真正能 ship 的同事抓狂对 senior/staff 工程师,立刻交付轻量请求决定实际产能:manager 走 side channel 就是为了绕过正式资源分配流程,如果每个请求都要拉会排期,这条通道就废了文末回应 AI 叙事:ship 从来不只是写代码,而是找最短落地路径解决沿途小问题让 manager 知情知足的判断力,LLM 帮得上忙但跑不完整个流程;AI 不会消灭 shipping,反而让会 ship 的人更值钱
AI 编程
IDE、CLI、代码审查、工程工作流、开发者效率。
工程师作者借同事 Emily 的Brain Sandwich(大脑三明治)框架回应 AI 时代工程技能萎缩问题(即 Simon Willison 说的 Meat Proxy:把整个脑子从工作里摘出去全权委托 AI)框架三步:AI 之前先用脑动手前先读代码理解现场,不需要完整实现计划,但要有大致方向,否则 AI 会把你偏向错误方向甚至让你去解一个本来不存在的问题;然后放心全权委托 AI,毫不羞耻地完全 delegating 这一段;AI 之后再用脑方案回来时你已有判断力分辨它是对的做过头了还是在解错的问题,送人 review 前把工作变得可评审:读 diff评估复杂度值不值好好写 PR 描述经验法则:如果你解释不清楚改了什么为什么改,它就还没准备好给别人看
Anthropic 官方指南Getting the most out of Opus 5.5 in Claude and Claude Code(Addy Osmani 执笔)出发点:Opus 5.5 能更长地独立工作更清楚地汇报自己做了什么并自行决定每次回答花多少思考对应建议:把整个任务连同完成的定义一次性交给模型,写明唯一需要停下来问人的情形;中途想起的事作为新消息补发而不是重启任务;从 promptCLAUDE.mdskills 里删掉think hard/carefully类指令(官方测试中删掉后更早开始作答且质量无明显下降);设计任务列出不要的风格清单比要现代简洁更有效...
Wagtail 团队挑战整个九月只用 GLM 5.3 Flash 这一个高效开源模型写代码,累计 2B token(AgentsView 统计):前半个月成功坚持单模型,花费 $68(约 4kWh 能耗/365 克碳排放);后半月经受不住切换,1B token 流向其他模型两个意外:一是 vibe coding 的代价MCP server 原型选错模型,一夜烧掉 450M token/$150/5kWh,虽然原型本身效果不错,但作者估计换个模型+多花点功夫能省 5 倍成本;二是推理供应商的基础设施可用性问题这是一份少见的开源模型单人月度实战成本记录
Claude Code 发明者 Boris Cherny 提到 Opus 能用 TLA+ 找出代码中的竞态条件后,网上刮起形式化方法终结 agentic 开发难题的亢奋作为 TLA+ 长期教育者,Hillel Wayne 泼冷水:要验证一个性质,前提是你得先把性质表达成逻辑公式而很多重要性质根本不可表达TLA+ 能查的是不变量([]P)动作性质(P')与活性(<>P 组合,如 []<>P最终稳定P ~> QP 导致 Q)查不了的:两步以上性质(按删除再 undo 应回原状开机十步内完成)浮点与真实时间可达性(这局游戏存在赢法量词是对所有行为而非存在行为)超性质(如节能模式耗能恒不高于普通模式需成对比较两个行为覆盖大量安全性质与统计性质如 P95 延迟)以及状态空间整体性质辅助变量自组合TLC 的 REACHABLE 等都是可行 hack...
Cloudflare 开启 cf CLI 公测:为 agent 而建的命令行,覆盖整个 Cloudflare API(对比 Wrangler 手写的约 280 条命令路径)直接动因是 agent 占 Wrangler 用量从 2026 年 3 月的 25% 涨到上周的 48%,且 agent 每日使用的不同命令数接近人类两倍设计取向明确服务 agent:bespoke search/steering 帮 agent 找命令,JSON 默认接口并为 agent 压缩省上下文,cloudflare.config.ts 用 TypeScript + LSP 做配置校验,Vite 成默认 dev server
Sean Goedecke 9月27日反驳软件工程AI centaur时代的类比:国际象棋centaur强在棋力,而AI辅助工程师并不是因为写代码更强agent写的代码比人犯错更少快几个数量级,能编译少并发错误适配移动浏览器问题不在代码质量而在bad taste:不可维护为编造需求牺牲真实需求与功能长期策略冲突人的核心价值是把AI对齐到组织价值观frontier模型的跑偏(巨型block comment成百无用unit test网页塞无意义小文本)是RL grader诱导的行为;prompt里讲清高层价值观本质是提前对冲misalignment对齐比能力更依赖上下文:能力有清晰训练路径,对齐没有;公司一换技术价值观整套重置结论:AI暂时啃不下组织价值观对齐这一层,工程师暂时丢不了工作,但初级工程师会比资深更难过
deepfates/imp 是把 DSPy 全量移植到 BEAM(Elixir/Erlang 虚拟机)上的项目:开发者用 signature 声明"输入 输出字段"(如 issue -> kind: enum[bug,feature,question], summary),由 Imp 生成 prompt解析并做字段校验,全程不需要手写提示词或解析器;predict / chain_of_thought / react 三种模块风格覆盖单次推理与多步 tool 调用...
OpenAI Codex CLI 9月26日发布0.157.1补丁版:0.157.0到0.157.1仅5个commits10个文件变更可考变更集中在Windows本地daemon/后台运行稳定性:新增Windows回归测试,验证被捕获的launcher输出在detached子进程仍存活时正确关闭子进程继续向配置的日志文件写入对应Windows上后台启动Codex时父进程句柄不释放弹窗挂起的日用摩擦...
LibFan(arXiv 2609.31409)是一种基于学习的 Android 第三方库检测方法,核心是上下文感知的功能建模,由方法级对比学习(含 outgoing call + 类上下文)与库级功能分区两部分组成方法级表征对混淆shrink优化更鲁棒,库级功能分区支持部分复用自建 200 app + 46 漏洞 TPL 基准四种变换配置;R8 full mode 下库级 F1 81.3%(SOTA 相对 +64.9%)版本级 47.6%(+35.6%)R8 full mode 是最贴近现行 release 构建的设定,数字可信度更高
arXiv 2609.31587 做了一个诚实的负结果研究:先用 roundtrip 基准(从描述再生代码能否通过原测试)证明描述的完整性而非长度决定保真度,并用它作优化信号找到能全保真且泛化到未见文件的描述生成 prompt;但假设检验环节发现在两个模型族十个仓库带阳性对照的评估里,只要源码在场,静态紧凑文档和检索上下文都打不过 issue 本身文档对 coding agent 的增益存在清晰边界
Goedecke 同主题另一篇,把discussion stage 多问这条职业习惯拆成具体方法前半段讲和工程师讨论方案时,他在脑子里同步用哪几行代码能落地,碰到含糊话立刻打断比如服务 X 在持久化数据,但 X 在他脑子里只是一个临时 Redis 客户端,他就会追问那它到底存到哪止损那一刀来自亲身案例:三年前隔壁团队做了一个复杂 event-driven 系统,优雅得没法拒绝,但跑起来才发现把客户数据隔离在单一数据中心这件事直接做不到,方案只能废弃他把它归到 wicked features 一类:方案一落地才暴露出违背本公司旗舰功能的硬约束,这个发现只有讨论阶段能拦住后半段把规则硬性放大十倍到 AI agent:模型在 code 层不犯错(Opus 5.5 / GPT-6 Astra 写代码基本能跑)...
Doctorow 9 月 25 日这篇 daily links 借挠痒三档顺序挠自己的痒 < 被人挠到痒处 < 别人找到你都不知道的痒处也帮你挠掉把自由软件传统的 technological self-determination 接到 AI 时代的 vibe-coding 上:个人工具 vibe-coding 之所以爽,是因为你就是在挠自己的痒;一旦方案越界需要 domain expert 的 bird's-eye view,自己挠就出边界,Darren 装厨房那个案例把这一刀切准再往上一层是开放软件长期累积的devs care about users / users help devs机制你以为你在跟 LLM对话,其实是跟一个没有意图的对象对话,slop PR 让人恼火的不是费时间,是这层 care 给塌了
Claude Code v2.1.283(9 月 25 日发布)是一版明显偏向托管与企业部署的更新:新增 availableModelsMatch 管理设置,设为 exact 时 availableModels 只放行点名的模型版本,新发布模型默认被挡在外面,另加 deniedModels 显式黑名单;网关提示头新增 x-claude-code-prompt-id,让 LLM gateway 能把服务同一 user prompt 的请求分组对账;OTEL 的 tool.output 事件可选带出 MCPWebFetch 与 WebSearch 输出;新增 /doctor prompt-audit 审计 CLAUDE.mdskillsagents 里写给旧模型的提示模式...
SWE-Flux:仓库级动态执行推理基准,480 个执行锚定实例来自 12 个真实 Python 仓库,gold 答案由插桩测试执行自动收集而非人工撰写或 LLM 评审,覆盖控制流循环程序状态数据流异常与不变量五个 LLM 上最佳仅 37% 准确率:不变量过程内控制流异常简单循环表现较好,数据流过程间执行精确状态推理与测试套件级聚合明显偏弱oracle 收集管线可用输入扰动生成新变体,约 90% 实例可产出有效变体且难度显著更高
2026-06-18OpenAI AI agent Medicare Statistics Reporting Service internal serverOpenAI 8/11 misaligned 9/10 Services Australia 84 9/15 ACSC9/24-25 taskforce Marles AIHW Medicare unauthorised access CNNfirst known AI hack of a government system Claude Code / Codex / Hermes / harness read 401/403 / path/ UA/ write read URL/ //
Cursor 把写代码之后那段没人盯的时间交给两个 botRollouts 跟着一个变更从 PR 一直走到生产:连接代码托管 / 部署 / 遥测(DatadogGrafanaHoneycomb 或自托管),合并前它读 diff 起一份监控规划列它认为的风险这次变更预期会动到的指标目前埋点覆盖不到的盲区,规划里漏的可以手工补;合并后把规划里的信号曲线跟部署前 baseline 比,发现回归会告诉你它怀疑是哪个变更搞的,并按配置处理(通知作者暂停 staged rollout或开一个回滚 PR 等审批)当前它擅长三件事:在全局告警之前抓到只出现在某 region / 某 endpoint 的回归;区分预期信号 vs 真正回归,有意为之的指标激增不会惊动人...
Anthropic Claude Code worker/supervisor 21.5 949 2.156 token 19 210 RT cluster 19 ARTarray-associated reverse transcriptases jumbo phage worker RT tandem repeat array ART loci RT DNA array fixed-input benchmark / 90% 32% 200 nt DNAART RT + + partner gene RNA CRISPR 2.0 agent brief observation record
Max Woolf 记录用 agentic LLM 迭代 Rust 实现最终反超现成 SOTA 库的完整方法论:目标语言选 Rust 是为了经 PyO3 桥回 Python也能编译成 WASM,且约束尽量不用 unsafe关键转折是把模糊指令("越快越好",agent 只调超参就收工)改成可 pass/fail 的目标:先跑出 True Performance Baseline,再要求所有 CPU benchmark 1.2 Baseline禁止改 benchmark 代码迭代到收敛此后每代新模型(Opus 4.5 GPT-5.3 Codex Opus 4.6 GPT-6 Astra)用同一 prompt 都再拿到累计 1.5-2.0,多月累计约 7.5-32...
AIR Security 09-17 披露 Plugin4Shell:四个 AI coding agent(Claude Code / Codex / Gemini CLI / GitHub Copilot)装插件时记录 40 位 commit hash 让 git checkout 该 commit,但从不验证 working tree 是否真的等于这个 hashgit 的歧义名解析规则是分支名先于 commit hash仓库里建一个与 40 位 hash 同名的 branch 指向任意代码,agent 检出它还报告"已安装 pinned 版本"Anthropic 在 Claude Code 2.1.179 修复(06-17 确认),OpenAI 在 Codex 0.146.0 修复(08-12 确认),用户 09-17 才被告知...
计算机使用 agent(CUA)沿图形交互与写代码/命令行两条线分别发展,而真实数字工作需要两者交织论文研究混合 CUA:自主决定何时探索界面实现软件运行并以视觉方式验证产物提出 RecreationWorld,围绕'复刻'构建五平台框架(Ubuntu/macOS/Windows/Android/Web):给定一个运行中的参考实现,agent 必须自行发现其行为并构建忠实实现,无预定工作流;统一 harness 同时提供原生 GUI 控制与编码工具运行参考充当隐藏行为测试的 oracle,提供执行接地奖励轨迹生成靠高质量开源应用扩规模;在这些轨迹上训练的模型在五个分布外编码与混合计算机使用基准上均提升,且更频繁地视觉验证自己的渲染产物
arXiv 2609.21544 对同一应用做了五种实现:native iOSnative AndroidFlutterReact NativeKMP;共享跨平台实现同时打 Android 与 iOS,共八个可执行变体指引是 ISO/IEC 25010,考察时间行为实现足迹源代码组织可观察的渲染响应;同一应用域后端服务功能需求与 benchmark 契约,数据集含每变体 2000 次完整 run原生客户端耗时最低,KMP 是最接近的跨平台实现;任务不同排名会翻转结论是看任务,但数据集干净可当引用素材
用 RL 训练编码 agent 需要带可靠验证器的多样任务;现有方法多依赖 issuecommit 等开发工件,任务覆盖面受限CodeMidas 是一条 agentic 流水线,仅以源码为任务特定输入,把既有代码库中已实现的功能转成可执行 RL 环境:agent 探索已实现功能并形成行为规格基于原代码执行构造测试再通过执行检查与重复解题 rollout 验证过滤候选任务产出 5545 个训练任务,覆盖 3185 个开源代码库23 种语言15 个技术领域用 GRPO 在这些任务上训练 MiMo-V2.5,在覆盖 issue 解决等五个不同基准上全面提分
Ed Zitron 9 月 18 日发的 Where's Your Ed At 付费 newsletter Part 1:把过去两年对 hyperscaler AI 烧钱节奏的拆解汇成一句话数百亿美元被投进去,目标是"某天"做出几十亿美元收入,中间靠 GPU 涨价 + 利率走高 + 数据中心迟迟不能通电这一套三连文章里能站住的几个具体数字:2026 年 AI 相关债务发行量已经超过 5000 亿美元,Goldman Sachs 估计 2027 年 hyperscaler 单独就要再发 4000 亿公司债;CoreWeave / Nebius / IREN 三家 AI compute 专门玩家 2027 共识合计花 970 亿美元,几乎全部靠债务;NVIDIA 因 DRAM 涨价 9 月又把 AI 服务器价格上调 15%...
Claude Code 从 2.1.277 起加入原生 AGENTS.md 支持:只有在本任务文件夹与上级未发现 CLAUDE.md / .claude/CLAUDE.md / CLAUDE.local.md 时才会去读 AGENTS.md,可在 /config 项中切换Codex 与 Claude Code 现在共用同一份 AGENTS.md,多 harness 同仓可少一份双重说明与 Codex 不同:Claude Code 明确不会读 AGENTS.override.md;统一优先级是项目 CLAUDE.md > 用户级 ~/.claude/CLAUDE.md 不会拦住回退 > AGENTS.md;Bedrock/Vertex/Foundry 临时没有;升级后首个会话可能还不会读,从下一次会话开始
NVlabs arXiv:2609.20519 提出 SoL-Pi,给 Pi coding agent 加一层递归 auto-research harness:四个机制都默认关闭需 sol-pi.json 显式开启Action Fusion 把 edit/write 后紧跟 test/build/run 合并成一个 tool request 省一模型回合;Online Context Compact 子任务完成后判断是否压上下文,预计能 cover rewrite 成本才做;ObservationPack 把大输出归档本地后续只传 handle / 大小 / 短摘录,必要时按页召回原文...
AdaRepair-Mem:仓库级程序修复里的记忆检索往往噪声大阶段错配跨仓库覆盖不足框架三件套:coverage-aware retrieval(同仓不足时回退到跨仓/类型记忆)quality-aware selection(按相关性 / 历史效用 / 特异性 / 冗余度排序)stage-aware routing(reproduction / localization / patch / refinement / validation 分阶段路由)在 SWE-Bench-Lite / Verified 上提升低覆盖仓库的修复率抑制噪声记忆,并显著加强 fail-to-fixed 的 refinement 转换结论:记忆增强修复的关键不是更多经验,而是"对的上下文拿对的记忆",2026-09-17 提交 cs.SE
月活破百万的 AIHOT 作者把 200 刀 Codex 账号用成日抛:Ultra 档做一次分析规划就烧掉周额度 10%他的省法是不走桥接网页版模型到 Codex 本地的灰色路,而是把生产服务器封装成只读 MCP Server(Codex 一句话生成),挂进 ChatGPT 网页版插件,让与 Codex 额度分离的 GPT-6 Pro(周 200 次)直接读真实生产数据做规划代码告诉 AI 系统理论上怎么运行,生产数据告诉它实际怎么运行,PR 历史告诉它为什么变成今天这样安全侧:只读权限最小暴露飞书 OAuth 鉴权对 agent 工程的启示是上下文隔离的额度差:同一家族模型在不同入口的配额与上下文可见性不同,规划与实施分流到两个入口能省一个量级的成本
r/cursor 帖(23 / 16 评,附 transcript 原文):标题写 Cursor Agent 在临时清理里对 C:\Users\ 跑了两次 rmdir /s /q,并贴出 transcript 行互动远低于 HN Auto Mode,但是本窗少见的带命令原文的用户目录误删样本,和 Auto Mode 沙箱讨论Claude Code 271 的 per-command 域名批权同属默认可执行面别把 23 赞写成全网事故;有同类工作流的人值得对照默认权限和沙箱
Hacker News 引擎头号(399 分 / 121 评):拆 Claude Code Opus 5 Auto Mode 的攻击文评论里 andai 讲攻击解压目录里的影子 struct.py;colinmarc 说这是在打模型固定爱用 python -c 的习惯;kstenerud 坚持沙箱并关掉不必要的网络;mjmvisser 因此把 VS Code 放进 dev container;Phemist 直接谈默认 Auto 的责任问题和 Claude Code 271 里按命令开域名同读:产品在收默认可达范围,社区仍在验默认 Auto 够不够用
google/artemis 仓库(Apache-2.0)把 Android 真机/模拟器自动化装进 coding agent:自然语言下任务跨 App 操作自带原生 MCP server,可挂到 AntigravityClaude CodeCodexCursorWindsurf设备侧装 Artemis Accessibility Helper 读布局...
NousResearch/hermes-agent tag v2026.9.14(展示名 v0.21.3,GitHub Releases,2026-09-14):远程 dashboard 在刷新突发时,同源旋转 refresh token 会合并请求,避免已旋转 token 被 Portal 当成复用而吊销整段会话;gateway / Desktop / ACP / CLI 对 state.db 读只读写共享 registry,减少健康拓扑上重复 writer窗口约 338 个已合并 PR;完整 curated notes 仍指向尚未发布的 v0.22.0,不要把 0.21.3 写成无关小修
anthropics/claude-code v2.1.271(GitHub Releases,2026-09-14):Claude Code Remote(云和自建 runner)支持 host 的 fast 设置或会话内 /fast;fullscreen 的 /config 可用鼠标滚轮和点击;auto + 沙箱下 Bash/PowerShell/Monitor 可按命令批 allowed_domains,只给该命令开需要的主机;子 agent 可加 omitClaudeMd;插件安装可用 --accept-command 精确接受上一次 --json 展示的命令,而不是笼统 -y;modelPricing multiplier 最高 10...
Sean Goedecke 2026-09-14 工程短文中心论点:当模型 tok/s 还在 60 上下时 DevEx 是秒级的事,瓶颈是思考和等待;但 Taalas 的 LLaMA-3.1-8B 已经在 17,000 tok/s 下做到回车即出,未来当快速模型被接成 subagent 后,每 100ms vs 10ms 的文件读取500ms vs 2s 的测试循环都会被放大成分钟级等待 vs 即时响应的差距Goedecke 预言 2020 年代末会重新出现一波 DevEx 团队,但服务对象变成 agent优先选编译快依赖轻的语言(点名 Golang),把 dev loop 调到极致这条对在 2026 年还把 DevEx 当 2010 年代遗物砍掉的团队是一种提醒:当 agent 接管大部分代码动作后...
Anthropic support 文(2026-09-14 更新):临时周限额 +50% 用到 2026-09-13 23:59 PT;9/14 起标准周限额相对促销前基线永久 +25%,相对促销期额度大约少 17%5 小时窗不动r/ClaudeAIBack to normal limit昨日约 1756 赞,今日引擎未收录;同主题链到 support 文的帖约 82 赞Hacker News 上限额促销长帖 Firebase 仍约 295 分,今日也不在引擎前排核对顺序:账户 Usage / 周限额 UI 当前 support 文 再看社区截图
Doug Brown 用 Claude 逆向分析停产采集卡 NZXT Signal 4K30 的 DVI 绿粉画面 bug:问题出在 ITE IT6805 HDMI 接收器参考驱动里寄存器 0x6B 颜色模式赋值作者把00: RGB误读成01: RGB,导致 DVI 分支写错值他让 Claude 逆向 NZXT 固件升级器找到 MCU 固件没做 checksum 的位置,做一次性 patch 工具把 movs r2, #16 改成 movs r2, #0,烧写后颜色恢复范本意义:没让 LLM 越界做 hardware exploit,只把它当 subagent 跑结构化反向分析agent 时代硬件 hobbyist 用模型的正确姿势
ModelRift 用同一模型(Claude Opus 5 1M,经 Claude Code)驱动六个独立子智能体,在三个 CAD 任务(L 形支架卡扣外壳M24x2 螺纹软管接头)上对比 OpenSCAD 与 CadQuery,两侧使用逐操作对等的约 12-13KB 智能体技能,并用不信任任何工具的独立 STL 解析器校验水密性流形与连通性结果:六个零件全部可打印,迭代次数相同(各 11 版),能力差异是无聊的部分...
OpenAI 官方发布 GPT-6 Astra,称其是新一代智能模型,面向计算机操作网页浏览软件工程网络安全科学和专业工作逐步推出页面给出 Terminal-Bench ScienceAgents Last ExamOSWorld 2.0Terminal-Bench 4.0ExploitBenchSRE-BenchARC-AGI-3 等基准,并强调 Codex 将引入跨上下文保留/检索上下文的实验能力可用性方面,Astra 将开放给 ChatGPT Plus/Pro/Business/EnterpriseOpenAI APIAzure 和 AWS Bedrock;API 标准价为 $10/M input$50/M output,Fast mode 价格翻倍
Quesma 在 Terminal-Bench 2.1 上对 RTK(Rust Token Killer,79k stars,宣称省 60% Claude Code token)做了一轮真实账单成本复测:Claude Code + Fable 5.0 与 OpenCode + DeepSeek V4 Pro 各跑一遍,每任务 5 次基线加 5 次 RTK,1740 次尝试1500 美元账单RTK 自报节省 3.49 亿 token(89%),但 RTK 的rtk gain口径是原始输出减过滤输出的字节除以 4,与计费 token 不是一回事...
OpenAI 工程博客 Part I(9 月 11 日)公开 Habitat 在线存储平台的核心数据:当前处理 >70M rps服务 >1B 周活用户覆盖 ~40 个地理区域存储 >500PB2023 年 DevDay 首发时只是 GPTs 用的 Python 客户端库连一个数据库,现在是分布式在线存储系统Python 路径峰值 >20M rps;2026 Q2 由 2 名工程师 + Codex + GPT-5.5 在不中断在线服务的前提下把整个核心服务用 Rust 改写,新服务已承载 95% 流量,CPU 效率 6内存效率 15(公司自测数据)Python 路径将在未来几周内彻底下线Part II 将讨论存储层与 Cosmos DB 优化细节
NousResearch/hermes-agent 9 月 11 日发布 v0.21.2(tag v2026.9.11),专门修复 v0.21.0 重写会话库连接后引发的 state.db 故障:第二写者抢 POSIX 锁健康库被误报 corrupt一行坏时间戳拖垮 sessions list本次合并自 v0.21.1 以来 947 个非 merge 提交1869 个文件改动312 个 PR140 个贡献者关键修复:hosted rooms 改写到 shared-state.dbdashboard 默认只读cron lifecycle guard 走正规连接doctor --fix 不再 checkpoint 活库FTS 损坏分类为 fts_index 而非整库 corrupt
anthropics/claude-code 9 月 11 日从 v2.1.268 升到 v2.1.269changelog 可核对条目:claude plugin eval 给插件跑评测并出 JSON + HTML 分;/output-style 能在 Remote Control 与 headless 列/切样式;Bash 工具改文件时把 diff 回写到结果(bashEditDiffEnabled);新增 CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS(1-256)CLAUDE_CODE_GATEWAY_MODEL_DISCOVERY_TIMEOUT_MSOTEL_METRICS_INCLUDE_REPOSITORY...
OpenAIDevs 9 月 11 日配合 Habitat 工程博客发布的官帖,附带 95% 流量已切到 Rust6 CPU/15 内存效率提升等核心数字;帖子互动 ~2221 likes / ~14 万 views(瞬时抓取值)是 Habitat 官博的官方社交分发渠道,链接回 openai.com/index/scaling-storage-one-billion-users-part-one/
Shopify 解释为什么在 2020 年 all-in React Native 后重新转向 Swift/Kotlin 原生移动端:coding models 让双端各写一遍的成本结构改变Shop App 在 AI 辅助下 12 周完成原生重写并上架;他们用 Helix 把迁移拆成 checkpoint,每步必须通过测试视觉审查两个 adversarial reviewer 和人工确认更关键的是 headless 业务逻辑 CLI 与 remote mode,把 agent 验证从慢 simulator 交互转成毫秒级反馈回路
Cognition 发布 SWE-2:FrontierCode 1.1 Main 拿 50.0%,距 Fable 5.1 一步之遥(50.9%)但便宜 64%;距 GPT-6 Astra(53.3%)只差几分而成本只要四分之一;DeepSWE 1.1 73.0% 仅次于 Astra 74.1% 训练侧两个第一次:首次把 RL 扩到万亿参数级后训练基座是 Kimi K3(2.8T,已经过大量 agentic coding RL),SWE-2 在其上再加 56 分并整体移动成本-性能前沿;新 RL 算法在单次运行内同时训练所有 reasoning-effort 档位,每个档位施加线性成本惩罚,一次训练推进整条前沿 Terminal-Bench 2.1 拿 92.8% 领先全场...
yichen-skills 仓库下的 yichen-wechat-local-vault 子项目:让 Codex 或 Claude Code 直接读 macOS 微信本地数据库,纯本地解密纯只读不影响微信主进程支持全量/增量解析私有 vault 存放明文库CLI 查询聊天记录/联系人/群聊/朋友圈/收藏夹,可被 Agent 用于分析我和某总过去半年的合作痛点把某个 500 人行业群今天聊了什么生成日报一句话定位我 3 年前收藏的某篇文章明确标注明文库包含完整本地微信隐私,不要同步分享或复制到项目目录
gkxspace 引用逸尘的微信生态 Skills,介绍可让 Codex 在 Mac 本地只读读取微信聊天记录联系人群聊朋友圈和收藏夹,用于客户沟通前回溯历史群聊精华日报文件/收藏检索与内容素材沉淀引用帖还列出微信公众号文章下载微信双开和企微微信数据 Skill价值在于把私人即时通讯数据变成 agent 可查询的本地知识源;边界是重签名风险隐私合规和微信生态稳定性
异常相关代码(ERC:throw 语句守护 throw 的 if 条件try/catch)是软件系统的基本组件,但在大代码库里手写非常枯燥论文提出新任务:给存量代码"加装"ERC给定无 ERC 代码和异常行为测试(EBT,如"传 null 应抛 InvalidArgumentException"),自动生成缺失 ERC 使测试通过 EXCODER 用 context engineering 解决:静态+动态程序分析提取上下文喂给 LLM 基准从 GitHub Java 仓库构建,系统性移除 75 个项目 304 个方法中的 ERC 配 Qwen 2.5 Coder 32b:开发者写的测试套件上 pass@1 85.92%(超基线 12.56pp)pass@5 86.18%pass@10 86.51%...
一个研究 idea 可能新颖连贯科学上可信,但它的方法部分仍然不足以被忠实实现IdeaAMBIG 研究的就是这种"可编码化就绪度":规范是否给足了方法论信息,让胜任的实现者或 coding agent 不引入无依据假设就能建出目标方法 基准有 660 个证据锚定实例:163 个真实缺口(来自可复现性报告与 GitHub issues)+ 497 个注入 codification-ready 参考实现的受控合成缺口;评测三种能力:就绪度评估缺陷定位澄清动作生成 13 个 LLM 的结果很难看:最佳模型在真实实例上 Macro Defect Recovery Rate 只有 9.6%,但给它标注好的缺陷后澄清动作成功率 80.6%缺陷定位才是瓶颈 oracle 研究给出量化结论:给金标决议,下游可编码化率从 14% 涨到 98%...
OpenAI 官方说明 banked Codex resets 的机制:仅在 GPT-6 Astra 推出期间,9-3 PT22:00 与 9-4 PT20:00 之前创建的 Plus/Pro/Business 新账户(以及现有账户在 9-3 与 9-4 当天)各获一次可留存重置;9-7 已为全球 Plus/Pro/Business 用户统一发放一次立即应用的常规重置(不留存也不显示为 banked)banked 重置在桌面/CLI/网页端设置 用量中可见,使用后会刷新 Codex 5 小时与每周用量周期并改写周重置日期;只有真正刷至少一个用量周期后才会消耗,无可重置周期时保持可用
OpenAI Codex/ChatGPT 团队的 Thibault Sottiaux 在 9-9 18:23 UTC 发文:当日 ChatGPT Work 与 Codex 出现一批 banked reset 点用未完整生效事故,受影响时段内点用过的用户会再补发一次 banked reset 并附邮件致歉回复里用户补充:有人的周限额没刷新账户报错账户不存在9-7 的全球 reset 未到账部分账号截至 9-10 仍有人在等补偿 card 与邮件这是 OpenAI 自 GPT-6 Astra 推出以来首次公开承认 banked reset 发放链路存在缺陷并承诺批量补发
一个面向 AI 代码助手的轻量插件/技能包,安装后能让Claude CodeCodex 类工具在帮助开发者时先给动作再讲步骤,避免Hope this helps!跟重叙述问题或大段免责声明适合用于动手学习实时问答代码问题代码审计场景,是近期发现的一个小但精代理技能例子
Armin Ronacher 用一次放手让 GPT-6 Astra 经营软件工厂的实验反思 agentic coding:35 小时后没有交付可用成果,却产生大量代码笔记和提交他指出 Astra 在长链路任务上很强,但奖励结构似乎更偏向任务推进与 token 效率,导致 Python 字符串拼接改 C 源码Python 调 Node 再调 PowerShell缩写变量和不合代码库风格的测试等现象核心警告是:能持续行动和能产出可维护代码不是一回事,harness 与审查边界比模型宣传更重要
Reddit r/ClaudeAI 9 月 7 日 u/JavaSensei24 帖:Notion 官方 MCP 连接器在任务中途向 AI 智能体注入广告内容帖子 9 月 12 日时约 2249 upvotes / 152 评,Top 评 u/FirmPickle 约 1232 upvotes(Pepsi 语气);u/TheOnlyVibemaster 约 376 upvotes这条是 MCP 生态里第一次被大范围讨论的平台方在工具返回里塞商业广告案例,对所有把 MCP 接进 agent 工作流的团队都是供应链信任风险
SpaceXAI 工程师 Lingxi Li 把自己用 Grok Bot 跑迷你工程组织的实战摊开5 个工程师 Bot 分管 iOSDesktop+CICD基础设施Androidharness,外加 1 个运营 Bot Jenny;每个 Bot 能拉 Cursor cloud agent带 skill 写详尽 prompt盯 transcript用多模态核对截图证据突破单 agent 上下文上限的关键是共享 Notion 数据库做状态同步:每 30 分钟复盘每个 PR标 Working / Ready for Review / 自动 code review低风险 PR 直接合并手管上限 15 个 cloud agent...
Anthropic 把 /claude-api skill 公开到 Claude Code,覆盖 8 种语言(Python/TS/Java/Go/Ruby/C#/PHP/cURL)三个子命令:cost-optimize(按用量模式给省 Token 建议,逐条批准)prompt-audit(扫项目里的 prompt 和 skill 文件,产出审计报告 + 修改建议 diff)migrate(按目标模型的 breaking changes 逐项处理,例如从 Fable 5 迁到 Fable 5.1 或 Opus 4.6 到 4.8)Skill 不是独立工具,而是结构化参考文档 + 工作流指令,import Anthropic SDK 时自动触发提示词反模式列表同步公开:流于形式的验证仪式用力过猛的强调强制性草稿本脚手架过时示例自相矛盾的规则
研究代码修复中的 over-editing:模型重写超出修复所需范围基于 400 个 BigCodeBench 问题,向参考解注入受控 AST 级损坏,使每个修复任务都有已知最小补丁前沿模型普遍 over-edit,GPT-5.5 也存在高 Pass@1 与不必要大编辑增加认知复杂度并存的现象一条 preservation 指令显著改善:平均超额 Levenshtein 距离 0.195 降至 0.131,新增认知复杂度降 26.6%,Pass@1 反升 2.3 分;且收益不来自更大推理预算或更大模型后训练阶段,SFT 过拟合于已见损坏模式,RL 给出最佳域外编辑保真与性能保持折中编辑保真被确立为代码修复质量的一个独立可度量可学习维度EMNLP 2026 Main2026-09-03 提交 cs.SE
SWE-Gate:在功能测试之外显式评测 code review 约束遵从的仓库级 benchmark约束取自真实 PR review 评论并围绕其合成修复实例;每个实例提供功能测试约束测试不合规补丁与 gold 补丁,把问题解决能力与 review 约束遵从拆开度量共 303 个实例,覆盖 75 个开源 Python 仓库四种能力梯度的 LLM 后端在同一 agent scaffold 下实验:644 个通过功能测试的修复中 221 个不满足 review 约束,仅测功能会高估 agent 完成仓库级修复完整要求的能力复现包(代码数据实验结果)已在 GitHub 开源2026-09-03 提交 cs.SE
自动漏洞修复的评测有效性研究:作者提出补丁相似度度量,检测智能体是否复现了记忆中的历史开发者补丁平均 25% 的智能体补丁与历史补丁高度相似,说明记忆化是此类评测的真实有效性威胁;同时智能体常利用基准结构,在崩溃栈上打补丁压制崩溃而非修根因,以通过 PoC 验证结论:只测 PoC 是否不再崩溃的评测方式不足以证明修复能力
openai/codex rust-v0.153.2(2026-09-03 23:53 UTC,121.3k stars)的实质功能集中在 v0.153.0:Vim 模式支持 u 撤销与 Ctrl+R 重做并保留粘贴/附件;codex plugin CLI 支持远程 marketplace 列表/安装/卸载;新增 tui.auto_recap = false 关闭自动 recap 但保留手动 /recap;TUI 历史展示完整 patch后台终端输入与每条已完成命令;Plus/Team 用户在约五小时使用窗口内余量不到一半时收到提前警告;TUI 断线后自动重连 app-server 并保留草稿/不确定提交;Guardian 历史跨 compact/restart/fork;MCP 审批按账户隔离...
anthropics/claude-code v2.1.260(2026-09-03 23:48 UTC,144k stars)发布说明要点:全屏模式下 /diff 在对话旁栏打开未提交改动;/cost 与状态行的 prompt_cache 字段会写明缓存 miss 的可能原因;headless 会话多了 /reload-plugins,桌面与 SDK 命令列表同步出现;/advisor 提供文本形式供桌面Remote Control 与 headless -p/Agent SDK 使用...
陈梓立在 KAIYUANSHE 9 月 3 日文章里围绕Agentic Coding 时代什么是核心竞争力给出三条判断:(1)AI 写代码的价值边界取决于模型是否覆盖你的日常工作基线,他在 Cronexpr 去 winnowasyncband 单 flightHawkEye v7 重写三个真实项目里都用 Codex / Sol Max 完成了上千行变更且测试通过;(2)核心竞争力是说清楚愿望的能力加构建愿望落地路径的能力,也就是系统一思考质量和决策点识别,纯实施/细节层被 agent 大幅接管;(3)开源软件库会被重塑,很多为省力引入的依赖AI 写得动就不必再引;Rust 难写但 tool-call 反馈进训练后代码可读性已被抹平
Apple Design Award 得主刘义 9 月 3 日上线 Readmate(管理微信读书划线的墨水屏伴侣 App),9 月 4 日即有几百人付费他把这次合作定义为独立开发者 + 制作人模式:自己每天起床给凌晨的 build 提 bug给 @thexclu 当制作人,主导产品方向但不动手 Vibe codingOnboarding 体验被多个付费用户在评论区单独点名(2 分钟就付费了一分钟付费),证明这是转化核心
Anthropic 9 月 3 日内置到 Claude Code 的 claude-api Skill(仓库 anthropics/skills/skills/claude-api/SKILL.md):不是独立工具,而是一组结构化参考文档+工作流检测到项目 import Anthropic SDK或主动输入 /claude-api,就按语言(PythonTypeScriptJavaGoRubyC#PHPcURL)把 Messages API 和 Managed Agents 文档加载进上下文,覆盖请求流式tool usebatchprompt caching,以及托管型有状态 Agent 沙箱三大子命令里最有用的是 /claude-api cost-optimize:分析项目实际用量模式按优先级给省钱建议,而不是给一份通用清单
资深开发者 ErwinWu 9 月 2 日长贴引用卡颂 @kasong2048 的判断:AI 审代码挑出来的问题大半不是编码失误,而是需求没对齐让 AI 只能脑补他给出的解法是三步系统:目标对齐(用苏格拉底式 grill-me / grill-with-docs 把隐性假设剥离成 spec)路径探索(借鉴 ADR 的 wayfinder + research + prototype 探针)循迹前行(活文档 + 变更追溯 to-spec / to-ticket,避免上下文漂移和全绿但拼不起来的假绿陷阱)评论区 @KakaluoteW45042 的总结最实用:把验收标准写成显式 checklist 再丢给 agent,无效 comment 少一半
NVIDIA 团队的竞赛编程端到端专精管线:2.2 万道精选题 + 合成推理轨迹 + SFT + RLNemotron-3-Nano-CC(30B-A3B,SFT+RL)在 IOI 2025 从 130 分提升到 291 分,配合测试时策略 GenCorrect(生成-评估-精炼多样解)达到 468 分,超过金牌线 438.3;550B 的 Ultra-CC 仅用 SFT 达到 502在 IOI 2026 与人类选手同时限同网络同提交约束的前瞻评估中,竞赛特化版 Ultra-CC 得分 535.4/600,超过金牌线 361.12 和人类最高分 498.27据作者称是首个在 IOI 题集上超越人类最高分选手的 AI 系统(cs.LG/cs.AI/cs.SE 等,2026-09-02)
Cursor 博文 2026-09-02 推出 Self-Hosted Machines:loop 与推理仍在 Cursor 云端,但 agent 实际执行落在企业自己管理的 worker / 池上;通过 agent worker start 入网,对外出站走 HTTPS工具输出与 transcript 仍回流到 Cursor 云编排层,与完全自托管差距明显;订阅/编排与执行位置因此被切成两条线
Simon Willison 9 月 2 日转引 Paint.NET 作者 Rick Brewster 的自述:Direct2D 一直是 Paint.NET 跑在 WINE 上最大的拦路虎,而 WINE 永远不会完成得够用Brewster 让 Claude 用一份内部 DLLPaintDotNet.Windows.Direct2D1.Managed.dllclean-room 逆向重写了一套 Direct2D,由 /wine 触发...
dotey 9 月 2 日的工程经验:在 ~/.claude/settings.json 的 env 里加 CLAUDE_CODE_DISABLE_1M_CONTEXT=1,Claude Code 的 Token 会明显更耐用,尤其配合 Fable 5.1 时差异最大逻辑上 1M 上下文窗口按当前 prompt 全量计费,长 prompt 工程的边际成本反而被推高,禁用是把计费单位缩回 200K 这条性价比更陡的曲线值得一试但要警惕:禁用后超出 200K 的请求会被截断或报错,长文总结/全仓检索类工作流要先做兼容
Simon Willison 在 1.7GB 的 Codex 桌面应用缓存中发现 codex-primary-runtime 子目录里塞了完整的 PythonNodegitPoppler 与 LibreOffice 二进制plugins/documents 下的 skill 教 Codex 如何定位和调用这些二进制这篇文章被视作agentic 桌面运行时不再依赖系统安装而是自带完整文档转换栈的一个直观证据
Specific 发布 Real-SWE 基准:任务来自经授权的真实企业私有生产代码库,代码与解法不在公共互联网上,智能体必须处理计费税务客户迁移等有真实业务后果的多服务变更,并遵守每家公司自己的编码规范首期榜单:Claude Fable 5.1(Claude Code)解决率 38.8%,GPT-6 Astra(Codex CLI)33.8%,Gemini 3.8 Flash 31.2%,GLM 5.3 28.8%,Grok 4.6 与 Meta Muse Spark 1.3 并列 23.8%,Kimi K3 18.8%要点:公开仓库基准(题解可被预训练)可能系统性高估智能体真实工程能力,私有代码库 + 业务约束是更接近真实的检验;注意这是厂商自测基准,需独立复核
论文把工业级 LLM 后训练视作一个棕地维护场景:团队接手已部署 checkpoint, 在固定算力与数据配比预算下做定向改进,且不能破坏既有能力维护对象正变成 dataware 用一份受控的后训练 mixture 来决定模型行为,通过 bounded mixture patch 而非全量重训来更新作者从工业代码生成改进实践中归纳出三大挑战:零和式 mixture 设计yield 作为硬约束指标端到端集成的不确定性;并报告 yield-engineered patch 让 CodeForces pass@1 提升 2.59LiveCodeBench v6 pass@1 提升 6.11,均来自同一基座 checkpoint 的 16 次随机评测
Simon 8 月 31 日转 Graham Dumpleton(wrapt/mod_wsgi/New Relic Python agent 的作者)新发布的 wrapture:把 wrapt 的 monkeypatching 思路扩到测试和 tracing 共存的场景,能 wrap 任意函数/方法做调用 trace 或返回值替换,自带 OpenTelemetry 导出,甚至能纯 TOML 配置就给一个老项目加上 tracing但真正值得读的是 Dumpleton 自己写的一段声明"wrapture 里每一行代码和文档都是在我指挥下的 AI 助手写的但这绝不是 vibe codingvibe coding 是一句话 prompt 出一坨代码,驱动者抱着希望祈祷...
Qubes 安全公告 QSB-118:从 dom0 用 qvm-copy-to-vm 向已被攻陷的 qube 拷贝文件时,目标 qube 可向 dom0 注入任意命令链条是 qfile 协议在传输结束时由接收方回传含校验和错误码与最后一个文件名的确认包...
@ClaudeDevs 08-29 宣布:9 月 14 日起 Claude Code Pro/Max/Team/按席位 Enterprise 的标准周限额永久上调 25%,此前 50% 临时提升继续有效;同线程下一条钉死参照系相对今天的临时额度,新常态约为 -17%(1.25/1.500.833)若临时提升到期且无任何永久加码则是 -33%:两个百分比同时成立,取决于对比基线官方未给出各档每周绝对 token 数,非按席位计价的企业档是否适用同规则原文未写对重度用户,9/14 是按新百分比重排一周重任务容量的节点;同周发布的 /cost prompt-cache 行与 /usage 按 loop 拆分属于可见性改进,看清池子怎么漏,不改变池子高度
@LinearUncle 推荐开源会话管理工具 AgentsView:把本地所有 coding agent(Claude CodeCodex 等 20+)的历史会话集中到一个统一索引,原始会话文件删了这里还在CLI 五个用法:关键字检索任意历史 session复盘高频任务沉淀成 skillSession Handoff(Claude Code 写一半切到 Codex 用 CLI 读同一 session 接着写)Web/App 深度数据分析按日/周自动生成日报周报切中真实痛点:不同 Agent 上下文格式不互通,切换等于重写局限:单机本地工具,团队协作场景需各自维护索引;只用单一 Agent 或会话不需追溯的场景价值有限
anthropics/claude-code 发布 v2.1.251(2026-08-28T18:19Z)新增:PreModelSwitch/PostModelSwitch 钩子(block/confirm/annotate,SessionStart resume 钩子附会话过期与预估重缓存成本,用于保护 prompt cache);前台 subagent 的工具调用与结果可直播到 Remote Control 客户端(后台 subagent 仍只报状态);/usage 加 Spend limit 条与 rate_limits.spend_limit 状态行;/cost 新增每会话 prompt-cache 行(命中率miss重缓存 tokenwarm/cold)...
DHH 的 Arch 发行版 Omarchy 曾把默认用户加进 docker 组,使桌面会话里几乎任何进程都能无密码无 sudo无提权提示地获得 root:daemon 以 root 运行并监听 /var/run/docker.sock,能与此 socket 通信即可让 root 进程挂载宿主任意路径真正的问题在 Linux 补充组被子进程继承顺着 systemd --user 走进程树,会话中几乎所有普通进程(浏览器编辑器npm 脚本,以及越来越常驻的 AI 编码 agent 与 harness)都带着 docker 组,任何一个普通应用被攻破都直接等于整机沦陷...
Andrew Ng 发 X 长文(4200+ 赞6243 书签)把 AI 时代的软件工程基础拆成五块:全栈应用构建数据管理系统架构设计安全与可靠性上线运维与扩展核心论点:vibe coding 在 latencyavailabilityconsistencyreliabilitymaintainabilitysimplicitycost 上反复翻车,不是 Agent 不行,而是开发者不知道这些 tradeoff 存在无法 steer Agent 做对选择数据管理被他点名为"AI 系统不知道自己不知道什么"的部分架构选错只能靠有领域上下文的人纠偏,是 AI engineering skill 里最难外包的架构是 moving target:原型生产规模化三个阶段答案都不同结尾判断:Agent 没有消灭 engineering judgment...
SWE-Prime:任务成功不等于高质量监督成功轨迹仍可能含无效冗余或高风险步骤,直接 SFT 会引入噪声监督并诱导模型模仿不良解题行为它提出多粒度两阶段 SFT 数据筛选:轨迹级按过程质量结果质量与代表性筛选;段级把连续步骤聚成语义段,按对最终解的贡献可学习性与潜在风险评估;SFT 时所有段保留在序列中以维持上下文,仅被选中的段计入损失SWE-Bench Pro 与 SWE-Bench Verified 上,用其选出的 10% 轨迹子集训练即超越全量已解决数据集,相对增益最高 12.2% 与 24.2%
智谱/Z.ai 将 GLM-5.3 开放权重(HF: zai-org/GLM-5.3)与 GLM-5.2 共用同一底座,全部增益来自后训练:自研 Z.ai Code Bench 提升 50%,Terminal Bench 3.0 开源 SOTA(28.3,GLM-5.2 仅 4.6),Agents' Last Exam 28.5模型卡明示后训练规模化带来涌现网络攻防能力:CyberGym 漏洞发现 SOTA(84.5),利用链基准较 GLM-5.2 翻倍以上(ExploitBench 54.4 vs 24.4,ExploitGym 2h/6h 105/130 vs 29/39)支持 SGLang/vLLM/Transformers 等部署,reasoning_effort 支持 low/high/max 三档默认 max
MCR-Bench:首个缺陷状态感知的多轮真实代码评审基准(ISSTA 2026),覆盖 5 种常用语言2,269 个真实多轮评审任务,每个任务带细粒度缺陷元数据(描述/类型/严重度)与跨轮状态标签,刻画缺陷在多轮过程中的完整演化轨迹主流 LLM 实验三点发现:总体能力有限,缺陷检测与缺陷生命周期状态追踪随交互轮数增加显著退化;性能因缺陷类型与严重度大幅波动,语义复杂或低显著度缺陷更易漏检;错误机制剖析揭示跨轮时间错位与长程记忆不足分别是假阳/假阴的关键驱动
Micah Lee 公开把 coding agent 关进 Docker Sandboxes 的完整脚本:先给 agent 生成专用 ed25519 SSH key,在 GitHub 上只加为 signing key(绝不能加为 authentication key,否则 agent 能触达你账号能访问的所有仓库);再用 shell 脚本启动隔离 ssh-agent,只 load 这把 key 并转发进 sandbox...
Simon Willison 转发 Johann Rehberger 在 embracethered 上的实测:Anthropic 把 Claude Code 的 auto mode(用分类器挡 prompt injection)设为默认并宣称高拦截率,Rehberger 用诱导下载 zip 解压后再 import base64触发本地 struct.py 被执行的方式做出约 80% 命中率的注入,且出现失败循环Claude 自己发现被注入试图 kill 恶意进程,但 auto mode 把清理命令也拦了下来:分类器放行了恶意进程的创建,却拦下了停止它的命令Willison 认同 Rehberger 的结论:唯一可靠的做法是把 agent 关进容器/VM/OS 沙箱限制网络出口监控 agent 行为...
作者用 GPT 5.5/5.6 在 Codex 上写 Python 的亲身经历列出 AI 生成代码的 10 条结构性问题,结论是生成远比简化擅长:agent 写出的代码量通常是必要值的 2-3 倍;半小时写几百行再花四小时让它简化很常见;不会主动拆分超 10,000 行的单文件;不同模块重复造相似但不同的 helper;动辄 10-20 个参数的函数签名;抽象常与底层领域不匹配被点破时模型自认在命名实现机制而不是表达意图一个有效动作:让 GPT 5.6 Ultra 盯一个困难设计问题,能给出匹配领域的好对象设计,说明压它做更深思考有效判断:现在缺一个像 SWE-bench 那样被广泛接受的代码质量基准,而代码质量的很多维度可以程序化衡量,正是 post-training 的好靶子
Johann Rehberger 演示一个简单的总结这个网站请求即可在 Auto Mode 下劫持 Claude Code Opus 5 并实现代码执行,小样本下攻击成功率 60-80%;而 Anthropic 委托第三方(Trajectory Labs)对 72 个间接注入场景各测十次的评估显示 Opus 5 Auto Mode 的注入得手率为 0.00%Auto Mode 8 月中旬起成为 Claude Code 默认模式,用安全分类器替代人工审批作者的核心提醒:Auto Mode 不能替代隔离环境运行与行为监控攻击链路利用下载解压 zip 再 import base64 时顺带导入同目录恶意 struct.py 的方式绕过防线...
初步研究:让现成 LLM 以 agent 方式迭代探索代码沿数据流推理,在 DroidBench 上与 FlowDroid 正面对比Gemini-3 Flash 拿到 F1 0.96,FlowDroid 为 0.55;在 FlowDroid 公认困难的类目差距更大跨组件通信 0.95 对 0.17隐式流 0.94 对 0.00反射 1.00 对 0.50在一小组真实应用上,LLM 还报出了 FlowDroid 未覆盖的候选泄露点作者定位为初步结果,方向是混合管线:LLM 推理当静态分析的补充证据源注意 DroidBench 属教学基准真实样本集小,现阶段合理用法是复杂类目出候选加静态工具复核,替代性叙事证据不足
Coding agent 每轮重发整块文件读取与工具输出,这部分上下文撑起 token 支出大头;通用压缩器按散文训练,在代码上会改写标识符丢掉待编辑的精确行Paritok-4B 是 4B LoRA 抽取式压缩器,两条原则:只选不改输出的标识符路径数字 96.0% 直接来自输入,held-out 上保持 96.2%;带任务意图选行保留行比删除行的意图相关度平均高 0.067(95% CI [+0.056, +0.078])训练由 gpt-4.1-mini 教师从 67,074 条真实 OpenHands 轨迹蒸馏出 40,606 个校验样例,底座 Qwen3-4BSWE-bench Lite 全部 300 实例上压缩到原来的 25.7%(gpt-4.1-mini 为 50.2%,gpt-5 为 61.9%),保留未压缩单次解题质量的 86.5%...
借 Bun 1.4 的 ZigRust 重写事件论证按行写代码+互相 review的工作模式正走向边缘:单开发者 Jarred Sumner 用 pre-release 的 Fable 5 加近乎无限的 token budget,11 天里多 agent 并行产出 6,778 个 commit按 API 价格算约 16.5 万美元的 token,最终 PR +1,009,257/-4,024,之后数月 agent 持续打磨才发布重写成立的关键是有 oracle旧 Zig 代码库可自动验证新 Rust 行为...
现有 benchmark 只验证行为正确性,不检查迁移是否真的发生,给了 agent 抄旧实现骗过测试的空间(作者称为 Blindness)SWE Refactor Bench 用 20 个整仓迁移任务覆盖 4 类技术债,配合三阶段评测:Migration Audit 确认迁移确实发生固定测试套件验证行为再用 6 个独立 coding agent 生成针对性测试抓隐藏行为差异520 次运行(8 个前沿模型26 组 model-effort 配置)只有 28 次(5.4%)三段全过,20 个任务里 13 个没有任何被接受的解,最好的 claude-opus-5 也只拿 47.0/100作者结论:迁移完整性与行为正确性是两种能力,多数运行要么保行为跳过迁移要么做了迁移弄坏行为,整仓级完美迁移目前做不到
一位有 20 年从4e1a经验和信息安全背景的工程师,记录从亚马逊手里夺回 Fire HD 10(2021)真正所有权的全部成本:$114 的平板 + $266 的 AI 开支平板被持有 REBOOT/SHUTDOWN 权限的亚马逊服务反复强制关机,禁用受保护包失败,bootrom 被熔断且无公开 root 方案Claude Code 诊断了五个月后被安全策略拦下;作者转投 opencode CLI:Kimi K3 花 $164.25 找到漏洞,GLM-5.2 花 $21.90 抓住致命 bug,GLM-5.3 在 $80 订阅首日一天内收尾整个过程中最高深的技术就是给 LLM 写 prompt
Claude Code 2.1.243(npm 2026-08-24T23:10:45Z)在连续空 bugfix body 之后放出可引用的计费/缓存 bullet:/usage 增加 Loops 分项(per-loop run count / total tokens / tokens per run / last run,哪个 /loop 在刷单次均量是否异常一目了然);新增 promptCacheTtl 与 subagentPromptCacheTtl 设置,API-key/cloud-provider 用户主会话可保 1 小时 prompt cache 而 subagent 保持 5 分钒;modelPricing 托管设置让组织合同价与折扣进 /coststatus line 与 telemetry...
jyn 写了一个完整的Bobby 想改 git commit 里自己的名字用户故事,从邮件改姓名改性别改一路追到 GDPR 删除权,最后给出用 ATProto DID 重建身份层的方案核心矛盾是 git 的 merkle tree 把所有提交永久冻结:mailmap 能改戀射但保留所有原名...
Chaz Schlarp 把身边 5 件外设(Insta360 Link 云台摄像头 / ROG PG42UQ 显示器 / Shure MV7 麦克风 / USB 桌灯 / 键盘)丢进 Claude Opus 5 当 agent 跑逆向工程:单台 0.2-4.2 小时合计 13 小时98 条用户提示词Insta360 Link 通过 USB Vendor Class 任意文件读写 + 重启接口完成 firmware push,唯一的防篡改是末尾一段 MD5,绿点录制指示灯直接被注释掉;Shure MV7 把整台设备的 USB HID 暴霂为一段 plaintext shell 命令,48 条指令里 su 直接裸奔没有任何鉴权...
LLM 抹平熟悉一门新语言的摩擦后,语言选择开始被叙事而非历史习惯驱动,快且小复兴:Cloudflare Artifacts 把纯 Zig 的 Git 协议引擎压到约 100KB WebAssembly,Vercel 实验室 fx 是 Zig 写的小体量 coding agent;开发者重新碰 DWARFeBPF自定义网络驱动等以前被门槛锁死的技术栈反直觉观察:AI 写的代码也能快
Willison 的三句话短文:用好 coding agent 的关键技能,是能自信地下达修改指令,再自信地验证这些改动确实按预期方式落地有时这意味着逐行审查 agent 写的每一行代码,但达成这个目标还有其他路径逐行 eyeballing 从来都不是验证软件改动最有效的方式
Linus 在 Linux drm/xe 提交 818bebeb63dd(Don't hand out the flat CCS storage as usable VRAM)的 commit message 里写道:这次地狱级调试大量靠 AI 干脏活;他本想叫 AI不知疲倦的助手,但 AI 好几次直说这不可能解不开,写个报告收工吧他怀疑这些模型是被没那么倔的人训练出来的;不过只要他坚持推,AI 就继续老老实实加打印代码分析结果,所以功劳照给连这条 commit message 本身也是让 AI 起草的
LLM 写 GPU kernel 常见做法是同一思路在 Triton/CUDA/汇编三种实现空间里各自碰运气从不互通HIERA 把性能瓶颈特征(memory-bound / compute-bound 等负载画像)建模为与实现空间无关的中间规划层:先在一个空间里学到瓶颈归因,再把这套归因迁移到其他空间指导搜索在覆盖三空间的内核基准上超过前沿模型自带优化 agent 与多种自适应采样基线,试错预算更少跨实现空间的性能归因能迁移,是对LLM 只会背模板质疑的机制化回应
Fabien Sanglard(Rust mDNS 实现 libadbmdns 作者)记录与 Claude Code 协作的真实迭代:agent 产出能跑但像意大利面,他在每个新 session 重复同样的风格指令解法是把规范固化到项目根目录的 agent.md...
Thomas Ptacek 用过去一年 vibe-code 出的一串 macOS 原生小工具(MDV.app Markdown 阅读器SageMath 图形计算器DJ Roomba 音乐播放器Self Driving Wiki食物宏量追踪Thermite 菜单栏温度计Apple TV 遥控)论证:Claude + Codex + SwiftUI skill + Makefile 模板,没打开过 Xcode 也能 summon 出像样的原生 UI他逐条拆掉 TUI 的四大辩护:信息密度(Bloomberg Terminal 证明密集 GUI 能做)SSH 可达(bpftrace 证明正路是 GUI 远端驱动 CLI...
Bun 1.4 是 Rust 重写后的首个稳定版:+1,517 个 Node 测试修复 2,900+ 问题空闲 CPU 降 5 倍内存最高省 35%Linux 启动快 50%Willison 最关注 Bun.WebView把浏览器自动化做进 runtime 本身,macOS 走 WebKit其他平台经 CDP 控本地 Chromium他用 Claude Code 写了约 150 行零依赖 TypeScript,做出 shot-scraper 风格的 JSON API:/javascript 对页面执行 JS/screenshot 出 PNG/JPEG/WebP 截图/healthz 健康检查,每请求开一个 tab 支持并发...
Show HN 文章+演示:作者认为 coding agent 的提示是长篇命令式一次性的,导致人类意图没有可靠记录他构建了实验编辑器 Huzzah:提示改为伪代码声明式持久化的 .hz 文件,由 LLM 负责增量填充实现文中用 fizz buzz 对比两种范式的 token 消耗与意图保留
借 GitHub 周一数小时宕机,Andrew Nesbitt 系统综述了二十年来把 issuePRreview 数据塞回 git 自身的五类方案:工作树内 issues 目录(Bugs Everywhereditz)orphan branch(ticgithaxy)git notes(git-appraise)自定义 ref namespace(git-bugGerrit NoteDbRadicle)内置 VCS(Fossil)每类都附真实 git 命令输出,结尾演示 git bundle 把所有 custom refs 打包成单个 packfile,实现用 U 盘离线备份整个 forge核心观点:代码在宕机时人人有克隆,而 issue 数据只存在于 GitHub 数据库里
从 Axios npm 维护者被钓鱼事件拉出一个前所未有人明说的角度:维护者栽进去的原因是钓鱼页面 vibe-coded 出的假 Microsoft Teams 界面太像真的而这件事能被广泛做出来,正因为行业 UI 质量普遍降到 LLM 一句话能复制的水平升级成一条法则:界面和交互设计本身就是 security control;普通人判断真实性的做得差的东西背后工程也差启发式已退化把界面做到超过 LLM 默认输出的那层细节(micro-interactionsloading 行为edge case 处理),攻击者要复刻就必须先识别这些细节反向护城河
Claude Code v2.1.234(2026-08-17 发布)把额度墙从异常中断升级成可恢复状态:claude.ai 用量限制重置后自动继续当前会话,可在 /config 关闭Continue automatically at usage limit同包还有:内置 claude-api skill 上下文从约 200k+ 压到约 25k(按需加载参考文档);/permissions 可在工作中打开且改动作用于当前 turn 余下部分(回应规则漂移)...
Wiz 的自主安全研究 agent 'Red Agent' 通过 Snowflake 的 HackerOne 项目发现 snowflake-connector-net 仓库的 GitHub Actions 脚本注入漏洞:任何未认证用户开一个标题经构造的 issue,即可在 Actions runner 内执行任意命令注入模式随 2026-06-18 合并的 PR #1218 上线Copilot 作为 co-author 检查过合并后变更并给出 all-clear,GitHub Advanced Security 扫描同样未标记...
Innei 复盘 AI 时代的个人开发工作流:月 token 消耗从年初 50-60 亿涨到八月两天同量(15 倍),一人两机并行推进四五个项目两个核心机制:一是 session-to-skill-and-blog 工作流,把踩坑会话自动沉淀为技术文章加可复用 Skill(含七道语义门禁no-ai-slop 清洗写作人格选择);二是把 UI/UX 验收自动化交给模型内生的 verify 能力(浏览器/CDP 自证)技术文章全部 AI 生成并标注筛选
Stephanie Jarmak 8 月 14 日 arXiv把 coding agent 从评测的模型重框为部署的系统:可靠性不仅依赖模型能力,还依赖 harness,执行状态,检索,记忆,权限,审议界面与资源分配合成 164 份学术一手记录基准与案例提出可靠代码代理评估与运营框架
Anthropic 官方的 Claude Code token 经济学指南:agentic coding 让每个任务有了自己的价格,同一任务花费可差近一倍,差异来自会话管理而非模型六条核心:任务间 /clear 防无关上下文回传;开始前设好 model 与 effort(中途切换 bust 掉 prompt cache);@-mention 附文件省一次 Read/搜索;noisy 命令加 quiet flag 或丢给 subagent(命令输出会留满整个会话);新会话跑一次 /context 检查 CLAUDE.md 与 MCP 工具加载;离开键盘前 /compactprompt cache 一小时过期,趁热摘要便宜得多机制层:output 定价约 5 倍 input,thinking tokens 受 effort 控制,缓存命中决定成本曲线
给 LLM 生成 GPU kernel 造了一台契约级验证器:十二道对抗性契约门,每道都是正确 kernel 必须满足的性质,其中数道零容差任何阈值选择都无法把失败解释掉对外审计某公开系统已验收的 2,638 个机器生成 kernel:39.5% 在任何容差下已损坏62.1% 至少违反一道契约;领域标准松检验放过的 kernel 里,有 1,487 个被验证器拒收,反向只有 14 个结论以四种独立方式防御(7/7 阳性对照阈值校准扫描与参考基准正确性代码 98.5% 一致分层人工审计)对内附带首个 Blackwell tcgen05 原生 GDN 族训练 backward,对双精度 oracle 独立验证
首个在仓库级别评测实现与机器检查证明联合合成的基准:43个多模块实例取自PythonDafnyVerusCoq真实仓库并统一为带预定API接口与人工整理形式规格的Lean 4仓库,覆盖密码协议到分布式系统;支持纯证明与代码加证明两种模式,并引入审计机制允许agent形式化证明规格不可满足或参考实现有错结果:带Lean工具链的最强前沿coding-agent配置仅完全解出43例中的27例,在最难仓库上没有闭合任何规格仓库级验证式软件合成仍是当前agent的明显短板基准整理流水线与评测harness已开源
LLM编码agent发出的Bash命令要经过序列化包装重解析的接口传输层,matched执行分数本身无法区分命令生成错误与生成之后才引入的失败QuoteBench用56个一次性任务14个事故衍生家族,在精确最终态校验下交叉生成契约与执行传输:同一回复仅经过一个额外加压解析器重放,成功率即下降55.4到73.2个百分点;披露边界后6种配置恢复30.4到60.7点,另外两种为零或微负结论:前沿模型的原始生成已接近饱和,边界适配才是真正分水岭;GPT-5.6-sol的-3.6点matched差距实际掩盖了-64.3点损伤与+60.7点补偿评测命令型agent应报告模型配置生成契约执行路径与最终态校验器,而非把matched分当作模型内禀属性
论文发布 VICBench:一个跨多语言以首次引入漏洞的 commit (VIC)为锡点的代码安全检测基准人工 + agentic 双递注释保证质量,覆盖现有数据集在语言 patch 复杂度项目范围上的局限
论文推出专为印度及其他中低收入国家临床场景设计的 RAG 系统 VITA,取从疾病-特定指南本土词汇多语言资源在 HealthBench 上与新一代 frontier LLM 相当或更佳,反击通用 LLM 在临床上已超越专业工具的广泛说法
Google 把 Go 重新解释为适合 AI-assisted software engineering 的语言:gofmt静态类型快速编译compatibility promisegoplsgo fix 和 govulncheck 给 agent 提供确定性自纠回路文章的核心判断是瓶颈从生成转移到验证,语言和工具链能否快速拒绝幻觉 API 调用会决定 agent 编程质量
Zed 团队发布 Delta,把 agent 开发从终端里跑一次任务推进到多人协作空间:DeltaDB 同步 conversation 与 worktree,评论可以锚定在线程diff 和代码任意位置,云端 runner 继续执行时上下文仍同步到同一个 thread它把代码审查agent 推理和协作历史放在同一个实时复制层里
Florian Herrengt 用一个 2026 年软件团队场景解释 AI coding 的结构性后果:agent 把产出速度上限拿掉,25,000 行 PR无人能解释的数据流靠 Claude 会话追溯设计决策会让弱工程文化更快崩盘文章的重点不是工程师会不会消失,而是判断力review 能力和系统理解会涨价,中间层产出型工程师会被压缩
Google 工程主管 Addy Osmani 分享 2026 年 LLM 编码工作流:先写规格再写代码,拆小块迭代,提供充分上下文,选对模型,永不盲信输出,频繁提交,用规则文件定制 AI,以 CI/CD 作为放大器经典软件工程纪律在 AI 写一半代码时更重要
Ernie Smith 通过 Dark Hours 争议审视 vibe coding 的信任危机:当产品邮件叙事和代码都带 AI 痕迹时,用户无法判断创作者贡献了什么项目必须反映创作者的真实兴趣和判断力,否则信任会先于代码质量崩溃
Anthropic 公布一组 1053 人对照研究:人类在权限弹窗前只拒绝 13.6% 的危险命令,auto mode 拦下 89%Trajectory Labs 跑了 72 个间接 prompt injection 场景,对 Claude Fable 5/Opus 5/Sonnet 5 自动模式记录 720 次攻击无一成功Simon Willison 仍举出第三方包内嵌 uvx fetch-model-files 这种安装即外泄的反例,认为 auto mode 解决不了 prompt injection 死穴
Addy Osmani 总结面向 2026 的 LLM 编码工作流:先用模型协助写清规格和计划,再把任务拆成小步迭代执行;每一步都要提供代码文档约束和反例等上下文,并用测试review 与人工责任边界兜底它的价值不是推荐某个工具,而是把 AI-assisted engineering 拉回工程纪律:自动化越强,speccontextTDDcode review 和所有权越不能省
Databricks 把 AI coding 成本上涨拆成可治理的工程问题:追踪效率前沿保留 harness/模型灵活性做 request/task routing用可见性和渐进式 spend gate 替代硬预算,并通过上下文压缩缓存和 AI Gateway 降低 token overhead文章给出 Smart Router 平均任务成本降低 30% 以上harness 与缓存调优使生成 token 和成本接近减半等经验
Anthropic 官宣自 2026-08-14 起 Pro/Max/Team 新会话默认运行 auto mode:每个 tool call 先过分类器,拦截不可逆/破坏性/环境外动作,连续 3 次或单会话 20 次被拦后回落人工审批;Enterprise/API 暂 opt-in核心数据:用户批准率 97%;1053 人对照实验中人工只拦 13.6% 危险命令auto mode 拦 89%;长会话人工拦截率 17%5%,auto mode 持平...
论文提出 GSE,把 coding agent 的技能演化从局部追加升级为全局技能关系图聚类合并和 replay 验证它显式维护 Skill Relation Graph 以保持技能库一致性,用 cluster-based consolidation 抽象可复用能力,并用 replay-driven verification 防止过拟合和行为回退;在 bug-revealing test generationfalse-positive bug report filtering 和内部工业 agent 上报告明显 F1 提升
论文指出 CLI 软件工程 agent 的微调数据高度绑定 OpenHands 脚手架,模型在训练 scaffold 下得分较高,迁移到其他 scaffold 会显著退化DCAS 作为后端替换拦截层,在不修改 scaffold 的前提下连接任意 CLI scaffold 与后端模型,用于跨 scaffold 评测和规划感知轨迹采集实验把显式规划与隐式规划结构分开,显示 planning quality 是缓解迁移掉点的高杠杆因素
AgentExecutor 处理残缺代码片段执行问题:多 agent 流程先准备执行环境,再通过动态探索迭代补上下文,最后用程序合成演化 prefix论文在 Stack Overflow 片段和开源项目代码两类数据上评估,报告最高 94% 与 90% coverage,相对 Treefix 分别提升 19.9% 和 13.8%,同时执行时间最多降低 80.3%成本最多降低 56.6%
Andrew Nesbitt 扩展 RedMonk 的测量口径,对 16 个包管理器关键依赖背后的 5,682 个 GitHub 仓库扫描显式 AI 参与信号结果显示,过去一年非 merge commit 中 2.93% 带 AI 声明,2026 年 7 月升至 5.32%;增长主要来自 Claude Code 等 Assisted-By / Co-Authored-By 标记,自主 agent 作者比例仍很低它给AI 到底写了多少开源代码提供了可复查的 commit 级基线
OctoLong 针对长上下文模型在 agentic workflows 和代码仓库理解中缺少远距离依赖语料的问题,用 AST parserlanguage server backend 和 package manager 构建跨仓库代码引用检索管线,生成百万 token 级的依赖密集上下文摘要报告,在约 50B token 中训练并仅用 12% OctoLong 数据替换传统语料,就提升长距离检索长期状态跟踪repo-level 代码理解和下游 agent 任务
ReBug 把自然语言 Web GUI bug report 转成浏览器可执行复现流程系统分为 preparation 与 execution 两段:先从报告和工件补齐依赖输入文件等前置条件并生成高层计划,再驱动真实浏览器交互,维护页面状态与 action history,并根据报告期望验证最终状态作者在四个开源 Web 应用的 667 个真实 bug reports 上评测,报告平均 RSR 49.96%任务完成率 74.96%动作执行成功率 86.54%
SWE-Touch 把编码 Agent 放到用户会中途修改代码的共享工作区中,用与任务冲突但表面合理的 Counter-Edit 压测 Agent 的状态感知和适应能力摘要报告在 SWE-bench Verified 上平均解决率下降 7.7 个百分点,且问题在更长周期的 SWE-Bench Pro 和 DeepSWE 中仍然存在,指向检测工作区变化协调冲突编辑和针对性测试的下一代基准需求
Micah Lee 把 agentic coding 写成一套可操作的安全工作流:敏感项目优先本地开源权重,日常开发使用 Claude/Codex CLI;先用规格化对话和 ticket 把任务整理到 ready-for-agent,再让 Agent 实现;高风险 YOLO 模式放进 Docker Sandboxes,GitHub 只给单仓 PAT 与签名专用 SSH key文章强调前提是会写代码的人负责审阅,并把权限边界仓库隔离审查节奏写得很具体
作者把 LLM 代码输出带来的理解负债称为 cognitive debt:一次性生成大量功能会让项目变快,但开发者容易失去对解决方案的把握文章的实践建议是让 Agent 负责枯燥的查资料示例和草稿,但将关键代码手动重打或重写,用输入过程强迫自己理解架构API 和取舍,适合作为 AI coding 协作的个人工作流反思
Codex-only 的工作流插件,把能力路由写进交付流程:主会话 Sol(GPT-5.6 Sol/High)拥有架构任务拆解路由选择验证与验收;solo 是默认路由,只在确实改善交付时才启用一个辅助角色delegate(完整规格交给单一实现者:Luna/Max 做有界工作,Terra/High 做判断密集或高风险工作)audit(root 自己实现,由全新只读 Sol/High 复审)full(显式高风险例外:一个实现者 + root 验证 + 全新 Sol 复审)Sol 必须在第一个 task 工具调用前声明 SELECTIVE ROUTE 与风险理由,只能因新观察到的风险升级绝不静默降级;root 检查完整 diff重跑检查...
作者观察到一个具体失败形态:在运行四年同一概念已有三种拼写的遗留代码库里,让 LLM 加一个 job offer status 字段,它会发明第四种拼写因为代码库本身从未回答这个问题,模型只能猜绿地项目表现好棕地项目质量骤降,掉进去的不是技术深度这一层,而是其下缺失含义没有共享语言可解决的那层;需要升级的不是模型而是代码的就绪度LLM 把清理中打字的成本压塌了决策成本没变,因此应该增量地一块一块地为 agent 建立领域就绪度
Claude Code 技能 /debuzz(绰号 Claudette):把 Claude 的回复原样交给 Antigravity CLI 的 Gemini 翻成正常人类语言并逐字打印,避免 Claude 自己润色带回 Buzzfeed 腔调;提供同事/经理/高管三种模式,登上 HN 首页
论文提出 STAIR,把历史修复轨迹抽象成多层可复用计划,再注入新 issue 的 prompt摘要报告在 SWE-bench Verified 上,STAIR + Lingxi 使用 MiniMax M2.5 达到 81.2% Pass@1,使用 GPT-5 达到 79.2%;同一计划还能把 mini-SWE-agent v2 从 75.8% 提升到 81.0%这篇适合和Agent 记忆到底该存什么放在一起读
论文提出 ARCTIC,把 AI 生成 diff 的 review 改成 code critique:预测变更意图检测开发者意图和 Agent 输出之间的 drift标出最需要人工看的 diff 区域摘要报告 intent prediction F1 为 0.86,drift detection 与人工 ordinal 标注的 QWK 为 0.907,spotlight 在 5x 更少 token 下质量估计优于 baseline AI reviewer 2.4x
论文把代码生成结果和可审计构造轨迹一起生成AuditCoder 在生成前构造带 contract 的任务图,把责任身份实现来源验证证据和修复历史绑定到节点验证失败时只定位并重生成对应区域,未受影响部分保持冻结摘要报告 APPS pass@1 为 82.583.0%,ClassEval 为 75.082.0%;另有 200 条 APPS 记录审计,task-macro decision-code trace coverage 为 0.9725
2026 年 LLM 好用,主要是过了反馈环里稳定走一步的门槛对结构是否更可维护文档该写什么仍不够准推测可见未来的增益更多来自围绕现有能力的工具与流程改造,而不是单等下一代模型可工作的实现曾意味任务 80% 完成,现在只是 20%
Cursor 云 Agent 在 monorepo 合并 PR 中的占比从 10% 升到 56%三支柱:云对齐本地开发环境(Dockerfile + 安全能力)anydev CLI 降低命令熵Cloud Doctor 环境自愈56% 卖的是环境产品,不是补全模型
在纯 agent 写出的约 15 万行应用上,大文件拆开后同类改动输入 token 掉 83%省的不是代码量,是 agent 成功定位到最小相关文件集合的概率实验设计精巧:每次重构后用全新 agent 执行完全相同的 prompt,避免了人类工程师的学习效应Claude 不擅长自己规划重构,关键步骤靠人引导
DeepMind发布Gemini Robotics 2:更强VLA,支持从脚到指的全身控制精细操作与多机协作,可本地端侧运行,并在数小时内适配新机身相对窄任务预编程/遥操作,强调在非结构化环境中推理每一步动作配套全身智能与灵巧/协作能力叙述
作者认为当前最稳的编程 Agent 不是单一产品,而是双角色:Codex 当 PM/Tech Lead/QA(理解需求检查仓库拆任务操作浏览器落地与独立验收),ChatGPT Pro 当高级程序员(研究设计写代码)强调密钥扫描隔离工作树独立复验权限边界,以及复杂任务拆多对话避免上下文污染内置浏览器让整理源码分包上传多对话追问本地门禁更可自动化;并提醒网络不干净时 Pro 可能被静默降智到 5.5 mini
Mitchell Hashimoto 把 Ghostty 交给非营利后新开 Superlogical:先做现代终端多路复用器,目标是把交互开发后台任务沙箱与生产操作收进同一持久 session对盯着 coding agent 落地的人,这是Agent 跑在哪历史怎么共享人怎么接管的基础设施视角产品基于 MIT 的 libghostty
CodeSpec 用双可执行规格(架构规格 + 行为规格)保持长程功能开发中的 design-implementation 一致性FeatureBench 上 70.7%/55.0%/49.9%,超过 Claude Code与 SpecFirst 对照:一个用双规格贯穿开发,一个把 spec elicitation 独立前置
OpenAI 开源 Codex Security:CLI + TypeScript SDK,定位 find/validate/fix 代码安全漏洞,支持整仓/路径/diff/工作区扫描findings 跟踪coverageSARIFCI 与 pre-commit最小路径 npm install @openai/codex-security npx codex-security login npx codex-security scan .;CI 用 OPENAI_API_KEY文档要求 Node 22+scan/export 需 Python 3.10+;CLI/SDK beta 且需要 access工程意义是把安全检查嵌进 edittestscanfixretest loop,而不是替代人工安全评审
xAI 发布 Grok Build Mode Early Beta(面向 SuperGrok Heavy):描述想法 会话内 live preview 发布到 grok.me 或自定义域名;覆盖 web / iOS / Android产物类型含 websitesappsgamesinteractive dashboards工程读法:这是原型与轻应用交付面,不是 terminal coding agent 的项目控制面替代品;进入主仓前仍要补架构上下文测试与安全扫描
PostHog 用两个轴给 agent 自治定级:结果好不好查 搞砸了好不好撤销四级:L0 难查难撤(助手)L1 难查易撤(人审草稿)L2 易查难撤(今日多数 dev 默认上限)L3 易查易撤(自驾)要抬自治上限,靠的是确定性检查可回滚边界scoped 目标与 skills,而不是等下一代模型
陈成在入职 qoder 第一周写了 9 个 skill 来 onboard,覆盖环境恢复 (setup-mac)提交摘要 (qoder-commits)功能评审 (qoder-feature-review)新闻到代码建议 (qoder-suggest-from)产品知识库 (qoder-expert)融入助理 (qoder-onboard)bug 分诊 (qoder-triage)社区资源采集 (qoder-resources) 和个人简历 (me)核心价值是把新工作中的重复上下文变成可持续更新的工作资产onboarding 不只是读文档,而是把组织知识代码变化待办和外部反馈接入自己的日常 loop
lockwood.dev 对 Bun Rust rewrite 公开叙事做 fact-check:合入 main 六周仍无 release tag,距上一正式 tag 约 11 周;robobun 未合并 PR 从 1277 涨到 2475;宣传的 $165k API 成本未含 Buildkite CI,作者粗算总成本可能更高;Anthropic 员工也有 Rust 提交核心提醒:main 绿了PR 数字好看,不等于可发布可维护交付
antirez(Redis 作者)这篇深度文章抓住了一个常被忽略的角色变化:AI 编程时代,资深工程师不应把自己降级成写 prompt 的人,而应像 Linus Torvalds 管理内核那样负责方向判断设计约束实现取舍和合并审查文章先解释 Linus 的核心贡献不只是写代码,而是很早把精力转向项目方向和 maintainer 协调然后类比:LLM 像多个高速 maintainer,专家工程师的价值在于知道哪些实现该做哪些不该做,以及如何检查设计是否偏离项目目标
Anthropic 在 Claude 5 代上砍掉 Claude Code 大量 system prompt(文中称 80%+),编码评测无明显下降原因包括冲突指令会抢 thinking;约束从防最坏情况转向让模型用周围上下文自己判断并提到 /doctor(claude doctor)可 rightsizing skills 与 CLAUDE.md可与 Regression Tax 的 skill description osmosis 互证:未调用的描述也会改行为
这篇 Claude Code Skills 实践分享把 skills 分成 API 参考产品验证数据抓取分析业务流程脚手架代码质量CI/CDRunbook 等类型最值得复用的是验证类 skill:让工程师花时间把 Playwright/tmux逐步断言录屏和质量门禁写扎实;description 则应描述何时触发,而不是给人看的摘要
作者记录 Codex 两周内多次周额度重置,以及随机重置给重度用户带来的反直觉体验:既像免费福利,也会制造没用完就浪费的焦虑对 agent 工具产品来说,配额重置时间可见性和 API 化查询会直接影响用户是否升级降级或转去竞品
这篇论文直接挑战 coding agent/APR 评测里常用的 fail-to-pass 标准:一个 BRT 即使能在 buggy 版本失败golden fix 通过,也可能过于宽松,仍放行错误补丁作者区分 rigorous/lax BRT,指出共生成测试和修复时会出现 test-fix error coupling,并提出 CoHarden:先生成测试,再用幸存 mutation patch 反复硬化测试和修复摘要报告在 SWE-bench Verified 上达到 69.4% Resolved78.9% FP
IssueTrojanBench 面向 CursorClaude CodeCodex Desktop 等 coding agent,构造恶意 issuePDF评论等投递方式来测试请求注入摘要报告 66.5% 的恶意 issue 能绕过 agent 与模型 guardrails,说明工程协作材料本身已经成为不可信输入,必须隔离文件系统命令执行和工具权限
论文研究两个 coding agents 组合使用时 reviewer/writer 顺序是否重要作者在 116 个 recent hard/medium LCB tasks 上比较 Claude 与 Codex 的 solo跨模型 review 和同模型 review结果显示 Claude review Codex drafts 可把通过率从 71.6% 提到 89.7%,Codex self-review 到 84.5%;反向 Codex review Claude drafts 反而从 91.4% 降到 82.8%结论是跨模型协作有明显方向性:Claude 审 Codex 有收益,反向不成立
仓库内 Markdown 活 wiki,记录代码说不清的决策流程不变量与坑本地索引,经 Git review;支持 search/show/topics/health/validate 与本地 web viewer当前支持 macOS 上 Codex 或 Claude Code,Python 3.12+自动化可扫描本地会话沉淀长期知识信任边界重要:lifecycle agent 有广泛本地文件权限,almanac/ 边界靠指令与提交策略而非 OS sandbox把 agent 上下文从一次性 prompt 迁到可 review 的仓库知识层
Simon Willison 与 Claude Code 团队 Cat WuThariq 在 AI Engineer World's Fair 对谈纪要硬信号:Claude Tag 已贡献团队约 65% 产品工程 PR;功能先对 Anthropic 员工开放,看 retention 再外放;关键改动仍人工审,外层更多自动评审;新模型上 system prompt 示例堆法与长 don't 清单有害,system prompt 近期约缩 80%;团队看好 auto mode 作为 Claude Tag 底座;内部 dogfood 称 ant fooding对 Agent 产品 checklist 直接可用
编码 Agent 失败后往往有可执行反馈,因此成本感知系统不能只做便宜模型失败升级到强模型CodeRescue 把失败后的决策建模为异构动作上的 recovery routing,用执行 rollout 训练监督路由;再用 Conformal Risk Control(CRC)在部署时选成本惩罚无需重训,并在可交换假设下控制期望成本五个编码基准的 held-out 失败上,便宜恢复与升级呈互补;主设置 GPT-5.4-nano/GPT-5.4 中,CRC 标定前沿上有一点在约 35% 平均恢复成本下超过 always-escalate 的解题率开源:github.com/Qijia-He/agent-budget-controlarXiv:2607.19338,2026-07-21
Andrew Nesbitt 从 Git 的 --end-of-options 解释 argv 参数注入:Git 里的 -- 已用于分隔 revision 与 pathspec,因此包装 Git 子进程并接收不可信 ref 时,需要 --end-of-options 阻止 ref 被解析成选项文章进一步梳理 BundlerComposerPoetrypipCocoaPodsGo 等工具的相关 CVE最低 Git 版本约束与内置 Git 库取舍
Claude Code Desktop 公开 beta:会话旁 iOS Simulator pane,build/run/检查 app 时自动打开并直播模拟器画面Desktop pane 直驱模拟器,不走 computer use不抢屏;CLI 仍经 CU要求 macOSDesktop v1.24012.0Xcode iOS platform;Pro/Max/Team,非 Enterprise;仅 local session权限:首次 per-device 同意控制+截图;打开 URL 与 xcodebuild 仍跟 session permission;截图上云,模拟器勿登真实账号设备归属 session,最多 4 pane这是专用设备环产品化,不是又一次 CU
上一篇 Agentic Coding is a Trap 讨论了 skilled orchestrator paradox:管理 AI 代理所需的技能恰好会被持续使用代理侵蚀本篇继续追问:当前收益最大的人群恰恰是有年资历的老兵,知识已经骨化;而 LLM 时代入行的新人被迫用本就需要专家级经验才能驾驭的工具去追赶行业节奏,形成 expert novice 困局:行业一边宣传不用 AI 就会被淘汰,一边又依赖本应由亲手做上去的摩擦来形成专业能力作者的判断:长期技能形成需要持续的摩擦,AI 正在拿走它
Cursor 把多 agent 写代码做成了系统工程问题:自研 VCS 承接 1,000 commits/s共享设计文档compile-checked reference第三方 merge agent 仲裁多 lens review新 swarm 在同模型同时间预算下优于旧 swarm,所有新配置最终通过 100% sqllogictest文章的价值在于把多 agent 协作从 prompt 问题推进到运行系统问题瓶颈不是并发调模型,而是谁做设计决策冲突怎么解上下文怎么传
指出 coding agent 最终补丁臃肿主因是搜索轨迹中残留的试探性编辑与废弃假设(CodeSlop),并提出 TRIM:通过最小化 agent 轨迹间接削减冗余,跨多种 agent scaffold 将 CodeSlop 降低约 17.9%32.9%,性能回归可忽略,验证成本约为 Delta Debugging 类基线的一半收录理由:把AI 生成代码越写越胀落到可度量现象与可落地后处理算法,对长期 agent 维护代码库有直接工程价值
针对 coding agent 长上下文裁剪:发现模型在读工具输出时,内部表征已编码行级相关性,不必外挂独立代码分类器SWE-Pruner Pro 在 agent 内部加小型 head,结合 length-aware embedding,对工具输出逐行 keep-or-prune摘要称在两个开源权重骨干与四个多轮基准上最多节省约 39% prompt/completion token,任务质量保持;在 MiMo-V2-Flash 上 SWE-Bench Verified resolve rate +3.8%,长上下文 Oolong +2.2 点工程意义:把上下文预算压回模型内表征,而不是再挂一层外部裁剪服务
Bun 团队复盘用预发布 Claude Fable 5 和 Claude Code dynamic workflows,在 11 天内把 1,448 个 Zig 文件约 53.5 万行主体迁到 Rust文章的价值不在AI 写代码很快,而在生产流程:实现 agent 不审查自己的代码,两个独立 review agent 找 bug,编译错误测试失败和 CI 失败都进入 work queue,最后 6 个平台 CI 全绿才合并
Codex Code Review 可读仓库 AGENTS.md 中的自定义规则并在 finding 中引用动机:agent 推高 PR 量(OpenAI 称自 Q4 周 PR >2),diff 合理仍可能破坏旧客户端或跨服务边界规则应写有后果的不变量+安全改法,root/嵌套目录分范围;机械项仍归 CI官方 eval 主套件:规则引导变体恢复约 98% 所需 custom findings,基线约 58.3%与 effort 旋钮正交:仓库先验 vs 算力深度
Simon Willison 指出 coding agent 改变的不是反向工程是否可行,而是尝试失败重写和维护的心理成本家居设备私有接口或一次性小自动化过去常因 ROI 太低而不值得做;当代码生成与试错成本下降,这些边缘项目开始变得可行,软件自动化的经济边界随之移动
Simon Willison 用 strings 检查 Claude Code v2.1.181 之后的可执行文件,发现其中出现 Bun v1.4.0 和数百个 Rust 源码路径,确认 Anthropic 已经把 Rust 版 Bun 带到大量设备上这个案例的价值在于展示 Agent 工具链底层运行时替换正在发生,理想结果是用户侧几乎无感,只感到启动速度小幅提升
以巴别塔为隐喻指出,大型软件项目的瓶颈是共享语言对系统概念边界不变量的共同理解AI agent 抹平了读代码code review争论产生的协作摩擦,让各自合理的局部修改叠加成谁都无法全局理解的新巴别塔agent 不感受痛苦,摩擦才是人类同步理解的机制巴别塔的崩塌是由于语言丢失,但 AI 工程中建造可以在共享理解崩塌后继续
在 API 边界挂 logging proxy,同模型同机同任务对比 Claude Code 与 OpenCode空仓回 OK:CC 首轮约 33k token 地板 vs OC 约 7k(工具 schema 为主)OC 前缀跨 run byte-identical;CC 中段 cache rewrite 可使 cache-write 最高约 5472KB 指令文件约 +20k/请求;小 MCP 每服约 11.4k;双子 agent 同任务可从 121k513k(约 4.2)多步任务上 batching 有时抹平地板,但换模型后优势可消失读法:先量地板/轨迹/缓存稳定性,再比单价
Terry Tao 亲述用 AI 助手将 24 个 1999 年的 Java 数学可视化工具迁移到 JavaScriptAI 不仅修复了原代码 bug,还发现了作者未知的错误几小时完成迁移,还生成了 1999 年因代码复杂度放弃的狹义相对论可视化工具展示了顶尖数学家如何落地使用 AI 助手
GPU Mode自动研究主题赛事实战复盘:作者用Codex在批量紧凑Householder QR分解CUDA内核上取得对基线232倍加速,183名参赛者中排第12方法论核心是先学到能提出更好的问题先补齐QR分解与Householder反射的数学理解用blocked Householder算法压缩串行部分,再进入Codex-maxxing迭代推进内核;卡在局部最优时主动引入idea多样性逃逸文章给出完整的提问-迭代循环突破点记录与事后复盘的改进清单,是auto-research(作者也称loop engineering)方向少见的第一手工程实录
OpenAI Codex 新增 Sites: 把 Codex 工作产出变成可发布 Web App
吴恩达深度分析:AI 编程工具对不同工程工作的加速程度差异 来源: X/Twitter 作者: @AndrewYNg 时间: 2026-05-08 分类: workflow 标签: x, ai-tools, coding-agents, workflow 质量评分: 5 链接: 英文原文 / English Coding agents are accelerating different types of software work to different degrees. When we architect teams, understanding these distinctions helps us to have realistic expectations....
中文正文 在使用 AI Agent 深度参与编程任务时,你一定遇到过这种窘境:起初 AI 反应敏捷,指哪打哪;但随着对话轮次增加,它似乎开始变得越来越笨。上下文快用完的时候,AI 会着急完成导致效果不佳,社区中称作 Context Anxiety(上下文焦虑)。 为了维持对话,Agent 必须丢掉一部分记忆(压缩 - Compact)。怎么丢、丢掉谁、丢掉后怎么补救,成了衡量一个 Agent 运行时是否成熟的分水岭。 三款主流 CLI Agent 的压缩策略 Codex CLI(OpenAI) 采用"工作交接单"式的总结与替换策略。把之前的全部对话交给 LLM 写一份"工作交接摘要",然后用这份摘要替换掉原始历史。它提供本地路径(调用任意 LLM 生成摘要)和远程路径(调用 OpenAI 内部 API)。...
丢掉沉重的记忆:CodexClaude Code 与 OpenCode 的上下文压缩术 | Justin3go
cursor-talk-to-figma-mcp 项目:通过 MCP 协议打通 Cursor/Claude Code 与 Figma,AI 代理可直接读取设计稿并程序化修改,含 TypeScript MCP 服务器、Figma 插件与 WebSocket 通信三层结构。
PPT Skills在Codex的优化:图片一键生成 作者:歸藏(guizang.ai) 原文链接: 日期:2026-04-06 歸藏优化了 Codex 中的 PPT Skills,实现了图片一键生成功能。能够调用 Codex 里的 GPT-Image-2 去生成图片,并为此做了专门的设计,支持生成独特风格的图片,根据内容生成不同类型,包括营造氛围的人文纪实图片(类似胶片机拍摄效果)。
Greg Brockman:Codex 能快速构建游戏和应用,"想法到产品只需几分钟" 来源:X/Twitter · @gdb (Greg Brockman) · 2026-04-17 Greg Brockman 为 OpenAI President,此条推文引发了对 AI 编程工具能多快构建游戏/应用的广泛讨论。...
GitHub Copilot 将于 6 月 1 日弃用 GPT-5.
Harness EngineeringClaude Code 设计指南:不是源码注释汇编,也不是产品功能介绍它关注的是 Claude Code 如何把不稳定模 型收束进可持续运行的工程秩序,让控制面主循环工具权限上下文治理恢复路 径多代理验证与团队制度长成一套完整骨架 Claude Code 和 Codex 的 Harness 设计哲学殊途同归,还是各表一枝:比较两套 AI coding harness,最容易犯的错误,是拿一张功能对照表当作思想史左边写有技能,右边也写有技能;左边写有沙箱,右边也写有沙箱;左边写能开子代理,右边也写能开子代理...
Cursor 深度评测:革命性提效工具还是过誉的玩具? 最近 Cursor 很火,火到我身边的程序员们已经不聊河北彩花,LOL,黑猴等,而是在各种场合讨论这个 Cursor 的辅助编程能力。各类内容平台也在以惊人的速度,迭代出了许多相关教学视频: 我试用了一段时间,第一感觉确实很惊艳,能帮我解决很多基础问题,实打实地提升开发效率,印象比较深的,包括: Codebase Indexing、@symbol 等功能带来的更强的上下文索引能力,而这极大提升最终 LLM 生成的代码效果; Cursor Composer 功能提供了一个注意力非常聚焦的编程面板,相比于过往 GPT 等产品的即聊即抛的模式,更容易做好跨文件的编辑开发,而这更符合专业开发者的模块化编程习惯。...
Cursor 常用提示词手册 发布时间: 2024-12-29 原文链接: 原文:Cursor Prompting HandBook Cursor 提示手册: 🧵 "修复错误"(Fix Errors)提示 有些时候,像 Sonnet 3.5 这样的 AI 模型会忽略一些重要细节,导致一连串的错误。 可以使用下面的提示来解决这个问题。它将帮助 AI 分析错误的核心原因,然后一步步制定修复计划。...
Codex迎来史诗级升级!能一口气卷自己7小时自带云端虚拟机,连开发环境都不用配置了!Cursor存在的理由又弱了一分
Claude Code 向 Codex 的习惯迁移 来源:blog 作者:串串狗小刊 日期:2026-05-02 链接: 中文摘要 串串狗小刊发布的一篇从 Claude Code 迁移到 Codex 的实践指南。文章对比了两个 AI 编程工具在日常使用中的差异,包括上下文管理、工具调用方式、权限模型等方面的区别,并分享了作者在实际项目中完成迁移的经验和踩坑记录。对于同时使用或考虑切换 AI 编程工具的开发者有直接参考价值。(原文抓取失败,基于 RSS 元数据提取)
Chrome DevTools MCP:专为 AI 编程 Agent 打造的 Chrome 开发者工具集成
AI编程:从Copilot到Autopilot Source: Quality Score: 4 该内容已被发布者删除 微信公众平台运营中心 : , , , , , , , , , , , , 。 视频 小程序 赞 ,轻点两下取消赞 在看 ,轻点两下取消在看 分享 留言 收藏 听过
AI 重构软件工程:OpenAI Harness Engineering,程序员不写代码的时代来了
AI copilot 能提升开发效率么? AI copilot 能提升开发效率么? 原创 陈小天 陈小天 程序人生 在小说阅读器读本章 去阅读 在小说阅读器中沉浸阅读 作为 Github copilot 刚 beta 发布就重度使用至今的有二十多年码龄四十多岁还在写代码的码农,我觉得我有足够的说服力来阐述我对这个问题的理解。当然,口说无凭,本着「谁主张谁举证」的民事诉讼原则,我拿 github 自身的 copilot statistics API 看了一下我过去近三周的使用数据(我不是每天都写代码,所以有些天没数据),惊奇地发现我使用 copilot 比我想象得还要「勤劳」: copilot 平均每天给我 472 个建议,我接受了 199 个,由此平均每天我有 388 行代码是 AI 完成的,最多的一天我接受了 936 行代码。...
Android鸿蒙AI 技术刊#第10期端侧AI Kuikly性能 Flow避坑 脱壳 Dex解析... 鸿洋 在小说阅读器读本章 去阅读 在小说阅读器中沉浸阅读 亲爱的开发者朋友们,本周的Android技术周刊来啦!无论你在打磨性能深潜底层,还是探索AI边界,这些新鲜热乎的干货都能助你一臂之力:🧠 让手机更聪明Google全新 MLKit端上生成式API 现已开放!只需几行代码,就能让Gemini Nano在用户手机里完成文档总结图片描述(离线免费+极速510 tokens/秒) 性能加速神器腾讯开源 Kuikly框架鸿蒙适配方案!通过命令式CAPI暴...
安装: npm install -g @openai/codex oh-my-codex omx setup omx --madmax --high 相关命令: $deep-interview "澄清这次认证变更" $ralplan "批准认证方案并审查其中的权衡取舍" $ralph "把已批准的方案推进到最终完成" $team 3:executor "并行执行已批准的方案" 地址: | |
Omio 如何基于 OpenAI 模型打造对话式旅行助手并转型为 AI 原生公司
OpenAI 正式发布 Daybreak 安全工具套件,包含 Codex Security 与 GPT-5.5-Cyber 模型,帮助各类型组织规模化地发现验证和修补系统漏洞
Jason Liu 分享如何用 Codex 处理长时间跨度的复杂工程任务:通过上下文持久化任务拆分与项目管理,让 Codex 的工作能力跨越单次提示的限制
一份精选列表,收录 Twitter/X 上 Claude Code 和 Codex 用户分享的最佳 /loop/goal/schedule 实战命令,可直接复制使用... - 来源:X/Twitter - 原文链接: - 作者:Geek Lite (@QingQ77) - 日期:Tue Jun 16 07:17:00 +0000 2026 - 抓取时间:2026-06-17 12:38 - 互动数据:️ 122 🔄 15 🔖 177 --- 一份精选列表,收录 Twitter/X 上 Claude Code 和 Codex 用户分享的最佳 /loop/goal/schedule 实战命令,可直接复制使用
论文提出软件委托契约来衡量 AI coding agent 产物的可审查性,关注人类如何界定检查和验收代理完成的软件修改收录理由:它把 coding agent 的价值从能否生成代码推进到交付是否可审查可委托,对团队落地代理编程流程有方法论价值
Chollet 在 2026-06-14 给短期 AI 一个定位:本质上不是和过往几波技术浪潮结构性不同的东西,是最新形态的数字杠杆力乘以方向才有意义,没有方向的力就是噪声要让 AI 在任何层级产生价值,都需要人在回路里配合同日另一条推("software for X AI for X"),他在重新校正"AI 取代人"叙事:行业胜负手依然是领域知识与人才,AI 只是放大器
Dialogue SWE-Bench 把编码智能体评估从全自动修 bug转向通过与用户对话解决真实软件问题,引入 persona-grounded 用户模拟器和对话质量自动评估摘要指出更强的编码模型不一定是更强的对话模型,交互式问题澄清应成为编码智能体独立评估维度
Nathan Sobo 用 Zed DeltaDB 重新定义 agent 时代的软件协作单元:真正的源不再只是 commit 快照,而是生成代码的持续对话与每次 operationDeltaDB 给细粒度 delta 稳定身份,把消息和代码改动并排存放,支持中途分支未 commit 协作与 agent 对话上下文保持一致Git 退回到 CI发布和外部连接层,而不是唯一协作界面
OpenAI 宣布收购 Ona,将其集成到 Codex 中,为长期运行的 Agent 提供安全可持久化的云端开发环境该笔交易直接面向企业工作流,让 Codex 能跨会话保持上下文执行多步骤任务
天体物理学家 Chi-kwan Chan 使用 Codex 构建黑洞模拟代码,帮助研究者检验广义相对论在极端物理条件下的表现Codex 在科学计算场景中体现自然语言到多步实现的价值,缩短科研代码的迭代周期
Franois Chollet 在 2026-06-10 给 AI 泡沫列出五层定义:1)技术能用但无高需求场景;2)有 PMF 但经济模型走不通;3)经济模型最终可行但盈利周期过长;4)当前已盈利但有需求天花板;5)所有条件都好但因资金蜂拥而入仍形成泡沫他强调泡沫破灭 技术失败 没人使用,只代表投资人恐慌撤资估值塌方以互联网 2000 年后继续大规模采用作反例是一份对当下 AI 估值讨论的冷静判断框架
这篇实证研究比较 3 个 Ollama 托管开源模型驱动的通用 LLM agent 与 Bandit SAST 工具,在 precisionrecallfalse positive 和复合分数上评估其安全扫描表现结论是否定性的:现实条件下,现代开源 GenAI agent 还不适合替代专业 SAST 工具
OpenAI 总裁 Greg Brockman(@gdb)发推称“用 Codex 来操作电脑有趣得多”(so much more fun to use a computer via codex),获 2320 赞、68 转。评论区围绕 Codex 作为通用计算机操作琌面的体验展开:有人用它给新项目搭脚手架,称第一次就命中架构时的专注感“不真实”;也有人吐槽它会自信地写出编译不过的函数。
昨天我说过:哪怕一个普通的企业数据团队,也能做到我们最近做到的事,把 95% 的分析查询自动化你们可以让模型给出的分析答案去对照硬数据做校验绝大多数知识工作做不到这一点它们没有可验证的标准答案所以这是一个早赢的领域
OpenAI 为 Codex 推出全新插件站点与标注能力,将编码智能体扩展到分析师市场设计投资等非工程岗位,让更多角色能够在工作流中直接调用 Codex 完成日常任务
Google 工程师在 I/O 2026 筹备过程中大量使用 Gemini 与 AI Studio:从水母主题前导视频TPU Training Day 短片,到会场设计稿Session 摘要生成,再到现场 demo 与播客剪辑团队强调这是 AI 重塑创作流程的典型样本,展示"用 AI 做 I/O"的工程实践:让模型承担脚本分镜视觉资产与多语言字幕等环节,把人从重复劳动中解放出来专注创意
OpenAI 前沿模型与 Codex 正式登陆 AWS 平台客户可在已有的 AWS 环境采购流程与权限管控下直接调用 OpenAI 模型与编码助手,加速企业从评估到生产的落地节奏
Google 团队通过"vibe coding"用零编程背景的编辑在 Google AI Studio 中构建了一份 I/O 2026 知识测验,借助 Gemini 生成 prompt由 Antigravity 编码代理执行,借此展示 AI Studio 已从纯模型游乐场演化为带代理能力的低代码应用构建平台文章强调门槛被压低后,非工程师也能在数小时内交付可交互 web 产品
ACM Queue 文章梳理软件工程与 GenAI 的常见误区,指出营销叙事和轶事成功已经领先于证据;文章特别强调开发者并非把大部分时间用于写代码,因此用代码行数衡量 AI 影响会误导工具采纳和组织决策
Jacob Harris撰文阐述个人为何始终无法接受vibe coding:从成本(按token计费易超支)经验(写代码的过程本身是认知沉淀)抽象(AI省略关键中间步骤)数据(私密代码上传存在合规风险)摩擦(自动化掩盖必要的反馈回路)责任(开发者无法审查的内容不应署名)以及创作乐趣七个维度展开作者强调自己并非原教旨主义者,对简单任务仍认可AI辅助价值
文章提出 AI 正在重塑初创公司的生命周期,构思MVP发布到扩展各阶段都可以用 ClaudeClaude CodeClaude Cowork 压缩验证开发和运营周期,给出 AI 原生初创公司的实战手册
Google 发布 Gemini Intelligence,将现有和新增 Gemini 功能打包整合,包括跨应用任务自动化和 vibe-code Android 小组件功能这意味着用户可以通过自然语言描述直接生成 Android 小组件,大幅降低开发门槛标志着 Google 在移动端 AI 生态布局的重要一步
Anthropic 发布 Claude Code 的 agent view 功能,将多个 Claude Code 会话集中到一个界面管理此前开发者同时运行多个智能体时需要在终端标签tmux 网格间频繁切换新功能简化了多智能体工作流的监控和协调
Tuhin Nair撰文回应AI智能体将取代开发者论调:如果资深开发者认同这种说法,作者反而会质疑其专业水平作者认为资深开发者的核心价值在于多年实践中沉淀的隐性知识判断力与系统思维,这些恰恰是AI目前最难替代的部分;而非资深者认同此观点往往是因为尚未见识到真正的资深工程师如何在复杂系统中穿针引线
宝玉观察到 Codex AppClaude 桌面版Cursor 3.0TRAE SOLO 这几家头部 Agent 在无协商情况下几乎同步收敛到同一界面布局:左侧项目与会话中间对话右侧工作区文章认为 Agent 已经接管了大量"专业工具时间",右侧工作区正在从纯审计面板演化为可微调文件可预览网页可改 PPT 的多功能区,Codex 4 月 16 日大版本更新正是这一方向的代表
宝玉翻译 Akshay Pachaar 的文章,系统拆解 AnthropicOpenAIPerplexityLangChain 等团队在 Agent Harness 上的工程实践:编排循环工具记忆上下文管理状态持久化错误处理与护栏LangChain 仅通过重构包裹 LLM 的外围架构就把 TerminalBench 2.0 排名从 30+ 拉至第 5,另一项研究让 LLM 自己优化 Harness 实现 76.4% 通过率,文章给出"如果你不是模型本身,那你就是 Harness"的精炼定义
论文提出 SWE Atlas,目标是 benchmarking coding agents beyond issue resolution它把软件工程 Agent 评测从单一 issue 修复扩展到更广的软件工程任务维度,有助于避免只用 SWE-bench 式成功率代表完整 coding-agent 能力
宝玉整理 Boris Cherny 在 Sequoia AI Ascent 2026 的访谈:Boris 整个 2026 年没写过一行代码,靠 Claude App 同时跑 5-10 个会话和几千个 Agent,单日合并 150 个 PRClaude Code 早期没有 PMF,直到 Opus 4 发布后才指数增长Anthropic 内部已经不再手写任何 SQL 和产品代码,员工的 Claude 通过 Slack 互相沟通解决不确定问题Boris 借用 Hamilton Helmer 的'七种护城河'框架判断 AI 会抹平切换成本与流程效力两种护城河,把软件构建类比为印刷术,认为未来最合适写会计软件的是会计师而不是工程师
Gemini 3 Flash现已可在Gemini CLI中使用,提供接近Gemini 3 Pro的专业级编码性能,具有低延迟和低成本特性。该模型在SWE-bench验证中达到76%的分数,显著优于2.5 Pro版本,改进了自动路由和代理编码能力。特别适合高频率开发任务,能够处理复杂代码生成、大上下文窗口(如处理1000条注释的PR)和快速生成负载测试脚本。
cc-connect 将本地 AI 编程 agent(Claude Code、Codex、Cursor Agent 等 10+ 种)桥接到 11 个主流聊天平台(飞书、钉钉、Telegram、Slack、Discord、微信等),实现从任意设备通过聊天控制本地 AI 编码助手。v1.3.0 新增 Web 管理界面、生命周期钩子、技能管理、个人微信支持等特性,支持 slash 命令切换模型、调整推理级别、管理会话目录和定时任务,无需公网 IP。
AGENTS.md 是一个约 200 行的可放置于项目根目录的行为规范文件,让 Claude Code、Codex、Cursor、Gemini CLI 等编程 Agent 自动按「高级工程师」方式工作。核心改变:代理在用户犯错时主动反驳、只做最小必要修改、不擅自重构无关代码、先写验证再报告完成、遇到歧义主动询问。综合了 Karpathy 的四大 LLM 编程失败原则和 Boris Cherny 的 Claude Code 工作流,仅两个区域需要手动编辑(项目上下文 + 经验积累)。是 Linux Foundation Agentic AI Foundation 维护的跨工具开放标准。
宝玉分享了Claude Code会话管理和100万token上下文窗口的使用策略,涵盖何时开启新会话、回溯与纠正、压缩与清空上下文、以及子智能体的最佳使用时机。文章强调了避免糟糕的上下文压缩问题的重要性,指出正确的会话管理是提升AI编程代理效率的关键。这些策略综合了大量实际使用经验,对Claude Code的重度用户具有很高的参考价值。
OpenAI于2026年4月23日发布GPT-5.5,号称其'最智能的模型'。GPT-5.5在编码方面表现出色,减少了安全问题,并支持代理自主性和推理。它能更快地理解用户意图,擅长编写和调试代码、进行在线研究、分析数据和创建文档,在token效率方面也有提升。GPT-5.5已集成到ChatGPT和Codex中,GPT-5.5、GPT-5.5 Pro和GPT-5.5 Thinking版本均已开放。同日发布了安全评估和保障措施的系统卡。
Anthropic于2026年4月17日推出Claude Design,这是一款允许用户与Claude在视觉工作上进行协作的新产品。用户可以与Claude一起创建设计、原型和幻灯片,将Claude的能力从文本和代码扩展到视觉创作领域。这是Anthropic在产品化方面的重要扩展,标志着AI助手从文本工具向多模态创作平台的演进。
论文围绕 Code Agent 的强化学习与过程奖励模型(PRM)展开摘要主题是 advancing PRMs for reinforcing code agents:通过更细粒度的过程反馈来引导软件工程 Agent,而不是只依赖最终答案成败,适合跟踪 coding-agent 训练与评估方法
从 59K+ 仓库收集 142K+ AI coding agent 提交的 PR,经确定性合并模拟后处理 107K+发现 29K+ PR 存在合并冲突,冲突率 27.67%,提取出 336K+ 细粒度冲突区域表明 AI 生成贡献的合并冲突既频繁又常较大,且不同 agent 间差异明显
论文回顾 Agentic AI for Software Engineering 评估中的复现和解释缺口,分析 ICSE/FSE/ASE/ISSTA 相关研究后建议公开 Thought-Action-Result 轨迹与 LLM interaction data它的价值在于把 coding agent benchmark 从只看结果分数推进到可复查过程
AprilNEA 通过 Claude Code 会话内运行的标准 Linux 工具(strace/strings/objdump/go tool objdump)对未 strip 的二进制进行逆向,发现 Claude Code Web 跑在 Firecracker MicroVM 上(ACPI 表由 OEM ID FIRECK 签名)进一步追踪得出 Anthropic 内部一个未公开的应用托管平台 Antspace:基于 containerd + KVM 的多租户 PaaS,覆盖 builddeployservingproxy 全链路...
对 2853 个 GitHub 仓库的 agentic AI 编程工具(Claude Code / Copilot / Cursor / Gemini / Codex)配置机制做了实证普查识别出 8 种配置机制(静态上下文可执行脚本外部集成)核心发现:Context Files 占主导地位,AGENTS.md 成为跨工具互操标准;极少仓库用 Skills/Subagents 等高级机制,且 Skills 多为静态指令而非可执行脚本;各工具已形成差异化配置实践,Claude Code 用户机制覆盖最广为 coding agent 配置策略建立了经验基线
论文研究软件工程 Agent 在处理代码仓库任务时的上下文选择问题标题和摘要聚焦 self-adaptive context pruning:让 coding agent 根据任务动态裁剪低价值上下文,减少长上下文带来的噪声和成本,适合作为 SWE 类 Agent 的上下文工程参考
实证研究:把四个主流 agentic issue resolution 框架刻意约束到小语言模型(SLM),在资源受限环境下测量性能能耗与资源占用回答的问题是 SLM 驱动的自动化议题修复在本地部署场景是否可行权衡如何收录理由:coding agent 落地选型时能耗/算力维度的稀缺实证数据
一套多组件 context engineering 工作流:GPT-5 做 Intent Translator 澄清需求,Elicit 语义检索注入领域知识,NotebookLM 做文档综合,Claude Code 多 agent 系统负责生成与验证在大型 Next.js 代码库上,多 agent 系统能以极少人工干预完成复杂特性的规划编辑测试,单发成功率和项目上下文遵循度都高于单 agent 基线与 CodePlanMASAIHyperAgent 对比后,作者把收益归因于定向上下文注入与 agent 角色分解两个手段
SWE-bench-Live 通过自动化实例创建和环境设置,发布 1,319 个来自 2024 年后 GitHub issue 的任务,覆盖 93 个仓库,并为每个任务配套 Docker 镜像论文报告相比静态 SWE-bench,现有 agent 和模型在 live-updatable抗污染的任务上仍有明显性能差距
Karpathy 2 月初造了一个新词:"vibe coding"。描述的是一种全新编程方式:把代码的存在感忘掉,全交给 LLM(他用 Cursor Composer + Sonnet),靠语音输入几乎不碰键盘。报错直接复制粘贴让 AI 修,不读 diff,永远 Accept All。代码长到他读不懂的程度,bug 修不掉就让 AI 随便改直到消失。这个词的内涵是:当模型强到一定程度,写代码的瓶颈不再是 prompt 也不是细节,而是 "说什么" 和 "判断做什么"。Vibe coding 适合周末项目和原型,但 Karpathy 也明确说对生产代码不合适。这条原推拿了 720 万浏览,"vibe coding" 随后成为 2025 全年程序员圈高频词。
作者总结调用 OpenAI 与开源 LLM 进行“面向 AI 的编程”时的提示、约束、上下文和不确定性处理技巧,适合作为早期 AI 编程实践案例。