Andrew Nesbitt 扩展 RedMonk 的测量口径,对 16 个包管理器关键依赖背后的 5,682 个 GitHub 仓库扫描显式 AI 参与信号结果显示,过去一年非 merge commit 中 2.93% 带 AI 声明,2026 年 7 月升至 5.32%;增长主要来自 Claude Code 等 Assisted-By / Co-Authored-By 标记,自主 agent 作者比例仍很低它给AI 到底写了多少开源代码提供了可复查的 commit 级基线
AI 编程
IDE、CLI、代码审查、工程工作流、开发者效率。
ReBug 把自然语言 Web GUI bug report 转成浏览器可执行复现流程系统分为 preparation 与 execution 两段:先从报告和工件补齐依赖输入文件等前置条件并生成高层计划,再驱动真实浏览器交互,维护页面状态与 action history,并根据报告期望验证最终状态作者在四个开源 Web 应用的 667 个真实 bug reports 上评测,报告平均 RSR 49.96%任务完成率 74.96%动作执行成功率 86.54%
SWE-Touch 把编码 Agent 放到用户会中途修改代码的共享工作区中,用与任务冲突但表面合理的 Counter-Edit 压测 Agent 的状态感知和适应能力摘要报告在 SWE-bench Verified 上平均解决率下降 7.7 个百分点,且问题在更长周期的 SWE-Bench Pro 和 DeepSWE 中仍然存在,指向检测工作区变化协调冲突编辑和针对性测试的下一代基准需求
Micah Lee 把 agentic coding 写成一套可操作的安全工作流:敏感项目优先本地开源权重,日常开发使用 Claude/Codex CLI;先用规格化对话和 ticket 把任务整理到 ready-for-agent,再让 Agent 实现;高风险 YOLO 模式放进 Docker Sandboxes,GitHub 只给单仓 PAT 与签名专用 SSH key文章强调前提是会写代码的人负责审阅,并把权限边界仓库隔离审查节奏写得很具体
作者把 LLM 代码输出带来的理解负债称为 cognitive debt:一次性生成大量功能会让项目变快,但开发者容易失去对解决方案的把握文章的实践建议是让 Agent 负责枯燥的查资料示例和草稿,但将关键代码手动重打或重写,用输入过程强迫自己理解架构API 和取舍,适合作为 AI coding 协作的个人工作流反思
论文提出 STAIR,把历史修复轨迹抽象成多层可复用计划,再注入新 issue 的 prompt摘要报告在 SWE-bench Verified 上,STAIR + Lingxi 使用 MiniMax M2.5 达到 81.2% Pass@1,使用 GPT-5 达到 79.2%;同一计划还能把 mini-SWE-agent v2 从 75.8% 提升到 81.0%这篇适合和Agent 记忆到底该存什么放在一起读
论文提出 ARCTIC,把 AI 生成 diff 的 review 改成 code critique:预测变更意图检测开发者意图和 Agent 输出之间的 drift标出最需要人工看的 diff 区域摘要报告 intent prediction F1 为 0.86,drift detection 与人工 ordinal 标注的 QWK 为 0.907,spotlight 在 5x 更少 token 下质量估计优于 baseline AI reviewer 2.4x
论文把代码生成结果和可审计构造轨迹一起生成AuditCoder 在生成前构造带 contract 的任务图,把责任身份实现来源验证证据和修复历史绑定到节点验证失败时只定位并重生成对应区域,未受影响部分保持冻结摘要报告 APPS pass@1 为 82.583.0%,ClassEval 为 75.082.0%;另有 200 条 APPS 记录审计,task-macro decision-code trace coverage 为 0.9725
2026 年 LLM 好用,主要是过了反馈环里稳定走一步的门槛对结构是否更可维护文档该写什么仍不够准推测可见未来的增益更多来自围绕现有能力的工具与流程改造,而不是单等下一代模型可工作的实现曾意味任务 80% 完成,现在只是 20%
Cursor 云 Agent 在 monorepo 合并 PR 中的占比从 10% 升到 56%三支柱:云对齐本地开发环境(Dockerfile + 安全能力)anydev CLI 降低命令熵Cloud Doctor 环境自愈56% 卖的是环境产品,不是补全模型
在纯 agent 写出的约 15 万行应用上,大文件拆开后同类改动输入 token 掉 83%省的不是代码量,是 agent 成功定位到最小相关文件集合的概率实验设计精巧:每次重构后用全新 agent 执行完全相同的 prompt,避免了人类工程师的学习效应Claude 不擅长自己规划重构,关键步骤靠人引导
DeepMind发布Gemini Robotics 2:更强VLA,支持从脚到指的全身控制精细操作与多机协作,可本地端侧运行,并在数小时内适配新机身相对窄任务预编程/遥操作,强调在非结构化环境中推理每一步动作配套全身智能与灵巧/协作能力叙述
作者认为当前最稳的编程 Agent 不是单一产品,而是双角色:Codex 当 PM/Tech Lead/QA(理解需求检查仓库拆任务操作浏览器落地与独立验收),ChatGPT Pro 当高级程序员(研究设计写代码)强调密钥扫描隔离工作树独立复验权限边界,以及复杂任务拆多对话避免上下文污染内置浏览器让整理源码分包上传多对话追问本地门禁更可自动化;并提醒网络不干净时 Pro 可能被静默降智到 5.5 mini
Mitchell Hashimoto 把 Ghostty 交给非营利后新开 Superlogical:先做现代终端多路复用器,目标是把交互开发后台任务沙箱与生产操作收进同一持久 session对盯着 coding agent 落地的人,这是Agent 跑在哪历史怎么共享人怎么接管的基础设施视角产品基于 MIT 的 libghostty
CodeSpec 用双可执行规格(架构规格 + 行为规格)保持长程功能开发中的 design-implementation 一致性FeatureBench 上 70.7%/55.0%/49.9%,超过 Claude Code与 SpecFirst 对照:一个用双规格贯穿开发,一个把 spec elicitation 独立前置
OpenAI 开源 Codex Security:CLI + TypeScript SDK,定位 find/validate/fix 代码安全漏洞,支持整仓/路径/diff/工作区扫描findings 跟踪coverageSARIFCI 与 pre-commit最小路径 npm install @openai/codex-security npx codex-security login npx codex-security scan .;CI 用 OPENAI_API_KEY文档要求 Node 22+scan/export 需 Python 3.10+;CLI/SDK beta 且需要 access工程意义是把安全检查嵌进 edittestscanfixretest loop,而不是替代人工安全评审
xAI 发布 Grok Build Mode Early Beta(面向 SuperGrok Heavy):描述想法 会话内 live preview 发布到 grok.me 或自定义域名;覆盖 web / iOS / Android产物类型含 websitesappsgamesinteractive dashboards工程读法:这是原型与轻应用交付面,不是 terminal coding agent 的项目控制面替代品;进入主仓前仍要补架构上下文测试与安全扫描
PostHog 用两个轴给 agent 自治定级:结果好不好查 搞砸了好不好撤销四级:L0 难查难撤(助手)L1 难查易撤(人审草稿)L2 易查难撤(今日多数 dev 默认上限)L3 易查易撤(自驾)要抬自治上限,靠的是确定性检查可回滚边界scoped 目标与 skills,而不是等下一代模型
陈成在入职 qoder 第一周写了 9 个 skill 来 onboard,覆盖环境恢复 (setup-mac)提交摘要 (qoder-commits)功能评审 (qoder-feature-review)新闻到代码建议 (qoder-suggest-from)产品知识库 (qoder-expert)融入助理 (qoder-onboard)bug 分诊 (qoder-triage)社区资源采集 (qoder-resources) 和个人简历 (me)核心价值是把新工作中的重复上下文变成可持续更新的工作资产onboarding 不只是读文档,而是把组织知识代码变化待办和外部反馈接入自己的日常 loop
lockwood.dev 对 Bun Rust rewrite 公开叙事做 fact-check:合入 main 六周仍无 release tag,距上一正式 tag 约 11 周;robobun 未合并 PR 从 1277 涨到 2475;宣传的 $165k API 成本未含 Buildkite CI,作者粗算总成本可能更高;Anthropic 员工也有 Rust 提交核心提醒:main 绿了PR 数字好看,不等于可发布可维护交付
antirez(Redis 作者)这篇深度文章抓住了一个常被忽略的角色变化:AI 编程时代,资深工程师不应把自己降级成写 prompt 的人,而应像 Linus Torvalds 管理内核那样负责方向判断设计约束实现取舍和合并审查文章先解释 Linus 的核心贡献不只是写代码,而是很早把精力转向项目方向和 maintainer 协调然后类比:LLM 像多个高速 maintainer,专家工程师的价值在于知道哪些实现该做哪些不该做,以及如何检查设计是否偏离项目目标
Anthropic 在 Claude 5 代上砍掉 Claude Code 大量 system prompt(文中称 80%+),编码评测无明显下降原因包括冲突指令会抢 thinking;约束从防最坏情况转向让模型用周围上下文自己判断并提到 /doctor(claude doctor)可 rightsizing skills 与 CLAUDE.md可与 Regression Tax 的 skill description osmosis 互证:未调用的描述也会改行为
这篇 Claude Code Skills 实践分享把 skills 分成 API 参考产品验证数据抓取分析业务流程脚手架代码质量CI/CDRunbook 等类型最值得复用的是验证类 skill:让工程师花时间把 Playwright/tmux逐步断言录屏和质量门禁写扎实;description 则应描述何时触发,而不是给人看的摘要
作者记录 Codex 两周内多次周额度重置,以及随机重置给重度用户带来的反直觉体验:既像免费福利,也会制造没用完就浪费的焦虑对 agent 工具产品来说,配额重置时间可见性和 API 化查询会直接影响用户是否升级降级或转去竞品
这篇论文直接挑战 coding agent/APR 评测里常用的 fail-to-pass 标准:一个 BRT 即使能在 buggy 版本失败golden fix 通过,也可能过于宽松,仍放行错误补丁作者区分 rigorous/lax BRT,指出共生成测试和修复时会出现 test-fix error coupling,并提出 CoHarden:先生成测试,再用幸存 mutation patch 反复硬化测试和修复摘要报告在 SWE-bench Verified 上达到 69.4% Resolved78.9% FP
IssueTrojanBench 面向 CursorClaude CodeCodex Desktop 等 coding agent,构造恶意 issuePDF评论等投递方式来测试请求注入摘要报告 66.5% 的恶意 issue 能绕过 agent 与模型 guardrails,说明工程协作材料本身已经成为不可信输入,必须隔离文件系统命令执行和工具权限
论文研究两个 coding agents 组合使用时 reviewer/writer 顺序是否重要作者在 116 个 recent hard/medium LCB tasks 上比较 Claude 与 Codex 的 solo跨模型 review 和同模型 review结果显示 Claude review Codex drafts 可把通过率从 71.6% 提到 89.7%,Codex self-review 到 84.5%;反向 Codex review Claude drafts 反而从 91.4% 降到 82.8%结论是跨模型协作有明显方向性:Claude 审 Codex 有收益,反向不成立
仓库内 Markdown 活 wiki,记录代码说不清的决策流程不变量与坑本地索引,经 Git review;支持 search/show/topics/health/validate 与本地 web viewer当前支持 macOS 上 Codex 或 Claude Code,Python 3.12+自动化可扫描本地会话沉淀长期知识信任边界重要:lifecycle agent 有广泛本地文件权限,almanac/ 边界靠指令与提交策略而非 OS sandbox把 agent 上下文从一次性 prompt 迁到可 review 的仓库知识层
Simon Willison 与 Claude Code 团队 Cat WuThariq 在 AI Engineer World's Fair 对谈纪要硬信号:Claude Tag 已贡献团队约 65% 产品工程 PR;功能先对 Anthropic 员工开放,看 retention 再外放;关键改动仍人工审,外层更多自动评审;新模型上 system prompt 示例堆法与长 don't 清单有害,system prompt 近期约缩 80%;团队看好 auto mode 作为 Claude Tag 底座;内部 dogfood 称 ant fooding对 Agent 产品 checklist 直接可用
编码 Agent 失败后往往有可执行反馈,因此成本感知系统不能只做便宜模型失败升级到强模型CodeRescue 把失败后的决策建模为异构动作上的 recovery routing,用执行 rollout 训练监督路由;再用 Conformal Risk Control(CRC)在部署时选成本惩罚无需重训,并在可交换假设下控制期望成本五个编码基准的 held-out 失败上,便宜恢复与升级呈互补;主设置 GPT-5.4-nano/GPT-5.4 中,CRC 标定前沿上有一点在约 35% 平均恢复成本下超过 always-escalate 的解题率开源:github.com/Qijia-He/agent-budget-controlarXiv:2607.19338,2026-07-21
Andrew Nesbitt 从 Git 的 --end-of-options 解释 argv 参数注入:Git 里的 -- 已用于分隔 revision 与 pathspec,因此包装 Git 子进程并接收不可信 ref 时,需要 --end-of-options 阻止 ref 被解析成选项文章进一步梳理 BundlerComposerPoetrypipCocoaPodsGo 等工具的相关 CVE最低 Git 版本约束与内置 Git 库取舍
Claude Code Desktop 公开 beta:会话旁 iOS Simulator pane,build/run/检查 app 时自动打开并直播模拟器画面Desktop pane 直驱模拟器,不走 computer use不抢屏;CLI 仍经 CU要求 macOSDesktop v1.24012.0Xcode iOS platform;Pro/Max/Team,非 Enterprise;仅 local session权限:首次 per-device 同意控制+截图;打开 URL 与 xcodebuild 仍跟 session permission;截图上云,模拟器勿登真实账号设备归属 session,最多 4 pane这是专用设备环产品化,不是又一次 CU
Cursor 把多 agent 写代码做成了系统工程问题:自研 VCS 承接 1,000 commits/s共享设计文档compile-checked reference第三方 merge agent 仲裁多 lens review新 swarm 在同模型同时间预算下优于旧 swarm,所有新配置最终通过 100% sqllogictest文章的价值在于把多 agent 协作从 prompt 问题推进到运行系统问题瓶颈不是并发调模型,而是谁做设计决策冲突怎么解上下文怎么传
指出 coding agent 最终补丁臃肿主因是搜索轨迹中残留的试探性编辑与废弃假设(CodeSlop),并提出 TRIM:通过最小化 agent 轨迹间接削减冗余,跨多种 agent scaffold 将 CodeSlop 降低约 17.9%32.9%,性能回归可忽略,验证成本约为 Delta Debugging 类基线的一半收录理由:把AI 生成代码越写越胀落到可度量现象与可落地后处理算法,对长期 agent 维护代码库有直接工程价值
针对 coding agent 长上下文裁剪:发现模型在读工具输出时,内部表征已编码行级相关性,不必外挂独立代码分类器SWE-Pruner Pro 在 agent 内部加小型 head,结合 length-aware embedding,对工具输出逐行 keep-or-prune摘要称在两个开源权重骨干与四个多轮基准上最多节省约 39% prompt/completion token,任务质量保持;在 MiMo-V2-Flash 上 SWE-Bench Verified resolve rate +3.8%,长上下文 Oolong +2.2 点工程意义:把上下文预算压回模型内表征,而不是再挂一层外部裁剪服务
Bun 团队复盘用预发布 Claude Fable 5 和 Claude Code dynamic workflows,在 11 天内把 1,448 个 Zig 文件约 53.5 万行主体迁到 Rust文章的价值不在AI 写代码很快,而在生产流程:实现 agent 不审查自己的代码,两个独立 review agent 找 bug,编译错误测试失败和 CI 失败都进入 work queue,最后 6 个平台 CI 全绿才合并
Codex Code Review 可读仓库 AGENTS.md 中的自定义规则并在 finding 中引用动机:agent 推高 PR 量(OpenAI 称自 Q4 周 PR >2),diff 合理仍可能破坏旧客户端或跨服务边界规则应写有后果的不变量+安全改法,root/嵌套目录分范围;机械项仍归 CI官方 eval 主套件:规则引导变体恢复约 98% 所需 custom findings,基线约 58.3%与 effort 旋钮正交:仓库先验 vs 算力深度
Simon Willison 指出 coding agent 改变的不是反向工程是否可行,而是尝试失败重写和维护的心理成本家居设备私有接口或一次性小自动化过去常因 ROI 太低而不值得做;当代码生成与试错成本下降,这些边缘项目开始变得可行,软件自动化的经济边界随之移动
Simon Willison 用 strings 检查 Claude Code v2.1.181 之后的可执行文件,发现其中出现 Bun v1.4.0 和数百个 Rust 源码路径,确认 Anthropic 已经把 Rust 版 Bun 带到大量设备上这个案例的价值在于展示 Agent 工具链底层运行时替换正在发生,理想结果是用户侧几乎无感,只感到启动速度小幅提升
以巴别塔为隐喻指出,大型软件项目的瓶颈是共享语言对系统概念边界不变量的共同理解AI agent 抹平了读代码code review争论产生的协作摩擦,让各自合理的局部修改叠加成谁都无法全局理解的新巴别塔agent 不感受痛苦,摩擦才是人类同步理解的机制巴别塔的崩塌是由于语言丢失,但 AI 工程中建造可以在共享理解崩塌后继续
在 API 边界挂 logging proxy,同模型同机同任务对比 Claude Code 与 OpenCode空仓回 OK:CC 首轮约 33k token 地板 vs OC 约 7k(工具 schema 为主)OC 前缀跨 run byte-identical;CC 中段 cache rewrite 可使 cache-write 最高约 5472KB 指令文件约 +20k/请求;小 MCP 每服约 11.4k;双子 agent 同任务可从 121k513k(约 4.2)多步任务上 batching 有时抹平地板,但换模型后优势可消失读法:先量地板/轨迹/缓存稳定性,再比单价
Terry Tao 亲述用 AI 助手将 24 个 1999 年的 Java 数学可视化工具迁移到 JavaScriptAI 不仅修复了原代码 bug,还发现了作者未知的错误几小时完成迁移,还生成了 1999 年因代码复杂度放弃的狹义相对论可视化工具展示了顶尖数学家如何落地使用 AI 助手
吴恩达深度分析:AI 编程工具对不同工程工作的加速程度差异 来源: X/Twitter 作者: @AndrewYNg 时间: 2026-05-08 分类: workflow 标签: x, ai-tools, coding-agents, workflow 质量评分: 5 链接: 英文原文 / English Coding agents are accelerating different types of software work to different degrees. When we architect teams, understanding these distinctions helps us to have realistic expectations....
丢掉沉重的记忆:CodexClaude Code 与 OpenCode 的上下文压缩术 | Justin3go
PPT Skills在Codex的优化:图片一键生成 作者:歸藏(guizang.ai) 原文链接: 日期:2026-04-06 歸藏优化了 Codex 中的 PPT Skills,实现了图片一键生成功能。能够调用 Codex 里的 GPT-Image-2 去生成图片,并为此做了专门的设计,支持生成独特风格的图片,根据内容生成不同类型,包括营造氛围的人文纪实图片(类似胶片机拍摄效果)。
OpenAI Codex 新增 Sites: 把 Codex 工作产出变成可发布 Web App
GitHub Copilot 将于 6 月 1 日弃用 GPT-5.
Harness EngineeringClaude Code 设计指南:不是源码注释汇编,也不是产品功能介绍它关注的是 Claude Code 如何把不稳定模 型收束进可持续运行的工程秩序,让控制面主循环工具权限上下文治理恢复路 径多代理验证与团队制度长成一套完整骨架 Claude Code 和 Codex 的 Harness 设计哲学殊途同归,还是各表一枝:比较两套 AI coding harness,最容易犯的错误,是拿一张功能对照表当作思想史左边写有技能,右边也写有技能;左边写有沙箱,右边也写有沙箱;左边写能开子代理,右边也写能开子代理...
Cursor 深度评测:革命性提效工具还是过誉的玩具? 最近 Cursor 很火,火到我身边的程序员们已经不聊河北彩花,LOL,黑猴等,而是在各种场合讨论这个 Cursor 的辅助编程能力。各类内容平台也在以惊人的速度,迭代出了许多相关教学视频: 我试用了一段时间,第一感觉确实很惊艳,能帮我解决很多基础问题,实打实地提升开发效率,印象比较深的,包括: Codebase Indexing、@symbol 等功能带来的更强的上下文索引能力,而这极大提升最终 LLM 生成的代码效果; Cursor Composer 功能提供了一个注意力非常聚焦的编程面板,相比于过往 GPT 等产品的即聊即抛的模式,更容易做好跨文件的编辑开发,而这更符合专业开发者的模块化编程习惯。...
Cursor 常用提示词手册 发布时间: 2024-12-29 原文链接: 原文:Cursor Prompting HandBook Cursor 提示手册: 🧵 "修复错误"(Fix Errors)提示 有些时候,像 Sonnet 3.5 这样的 AI 模型会忽略一些重要细节,导致一连串的错误。 可以使用下面的提示来解决这个问题。它将帮助 AI 分析错误的核心原因,然后一步步制定修复计划。...
Codex迎来史诗级升级!能一口气卷自己7小时自带云端虚拟机,连开发环境都不用配置了!Cursor存在的理由又弱了一分
Claude Code 向 Codex 的习惯迁移 来源:blog 作者:串串狗小刊 日期:2026-05-02 链接: 中文摘要 串串狗小刊发布的一篇从 Claude Code 迁移到 Codex 的实践指南。文章对比了两个 AI 编程工具在日常使用中的差异,包括上下文管理、工具调用方式、权限模型等方面的区别,并分享了作者在实际项目中完成迁移的经验和踩坑记录。对于同时使用或考虑切换 AI 编程工具的开发者有直接参考价值。(原文抓取失败,基于 RSS 元数据提取)
Chrome DevTools MCP:专为 AI 编程 Agent 打造的 Chrome 开发者工具集成
AI编程:从Copilot到Autopilot Source: Quality Score: 4 该内容已被发布者删除 微信公众平台运营中心 : , , , , , , , , , , , , 。 视频 小程序 赞 ,轻点两下取消赞 在看 ,轻点两下取消在看 分享 留言 收藏 听过
AI 重构软件工程:OpenAI Harness Engineering,程序员不写代码的时代来了
Android鸿蒙AI 技术刊#第10期端侧AI Kuikly性能 Flow避坑 脱壳 Dex解析... 鸿洋 在小说阅读器读本章 去阅读 在小说阅读器中沉浸阅读 亲爱的开发者朋友们,本周的Android技术周刊来啦!无论你在打磨性能深潜底层,还是探索AI边界,这些新鲜热乎的干货都能助你一臂之力:🧠 让手机更聪明Google全新 MLKit端上生成式API 现已开放!只需几行代码,就能让Gemini Nano在用户手机里完成文档总结图片描述(离线免费+极速510 tokens/秒) 性能加速神器腾讯开源 Kuikly框架鸿蒙适配方案!通过命令式CAPI暴...
安装: npm install -g @openai/codex oh-my-codex omx setup omx --madmax --high 相关命令: $deep-interview "澄清这次认证变更" $ralplan "批准认证方案并审查其中的权衡取舍" $ralph "把已批准的方案推进到最终完成" $team 3:executor "并行执行已批准的方案" 地址: | |
Omio 如何基于 OpenAI 模型打造对话式旅行助手并转型为 AI 原生公司
OpenAI 正式发布 Daybreak 安全工具套件,包含 Codex Security 与 GPT-5.5-Cyber 模型,帮助各类型组织规模化地发现验证和修补系统漏洞
Jason Liu 分享如何用 Codex 处理长时间跨度的复杂工程任务:通过上下文持久化任务拆分与项目管理,让 Codex 的工作能力跨越单次提示的限制
一份精选列表,收录 Twitter/X 上 Claude Code 和 Codex 用户分享的最佳 /loop/goal/schedule 实战命令,可直接复制使用... - 来源:X/Twitter - 原文链接: - 作者:Geek Lite (@QingQ77) - 日期:Tue Jun 16 07:17:00 +0000 2026 - 抓取时间:2026-06-17 12:38 - 互动数据:️ 122 🔄 15 🔖 177 --- 一份精选列表,收录 Twitter/X 上 Claude Code 和 Codex 用户分享的最佳 /loop/goal/schedule 实战命令,可直接复制使用
论文提出软件委托契约来衡量 AI coding agent 产物的可审查性,关注人类如何界定检查和验收代理完成的软件修改收录理由:它把 coding agent 的价值从能否生成代码推进到交付是否可审查可委托,对团队落地代理编程流程有方法论价值
Chollet 在 2026-06-14 给短期 AI 一个定位:本质上不是和过往几波技术浪潮结构性不同的东西,是最新形态的数字杠杆力乘以方向才有意义,没有方向的力就是噪声要让 AI 在任何层级产生价值,都需要人在回路里配合同日另一条推("software for X AI for X"),他在重新校正"AI 取代人"叙事:行业胜负手依然是领域知识与人才,AI 只是放大器
Dialogue SWE-Bench 把编码智能体评估从全自动修 bug转向通过与用户对话解决真实软件问题,引入 persona-grounded 用户模拟器和对话质量自动评估摘要指出更强的编码模型不一定是更强的对话模型,交互式问题澄清应成为编码智能体独立评估维度
Nathan Sobo 用 Zed DeltaDB 重新定义 agent 时代的软件协作单元:真正的源不再只是 commit 快照,而是生成代码的持续对话与每次 operationDeltaDB 给细粒度 delta 稳定身份,把消息和代码改动并排存放,支持中途分支未 commit 协作与 agent 对话上下文保持一致Git 退回到 CI发布和外部连接层,而不是唯一协作界面
OpenAI 宣布收购 Ona,将其集成到 Codex 中,为长期运行的 Agent 提供安全可持久化的云端开发环境该笔交易直接面向企业工作流,让 Codex 能跨会话保持上下文执行多步骤任务
天体物理学家 Chi-kwan Chan 使用 Codex 构建黑洞模拟代码,帮助研究者检验广义相对论在极端物理条件下的表现Codex 在科学计算场景中体现自然语言到多步实现的价值,缩短科研代码的迭代周期
Franois Chollet 在 2026-06-10 给 AI 泡沫列出五层定义:1)技术能用但无高需求场景;2)有 PMF 但经济模型走不通;3)经济模型最终可行但盈利周期过长;4)当前已盈利但有需求天花板;5)所有条件都好但因资金蜂拥而入仍形成泡沫他强调泡沫破灭 技术失败 没人使用,只代表投资人恐慌撤资估值塌方以互联网 2000 年后继续大规模采用作反例是一份对当下 AI 估值讨论的冷静判断框架
这篇实证研究比较 3 个 Ollama 托管开源模型驱动的通用 LLM agent 与 Bandit SAST 工具,在 precisionrecallfalse positive 和复合分数上评估其安全扫描表现结论是否定性的:现实条件下,现代开源 GenAI agent 还不适合替代专业 SAST 工具
昨天我说过:哪怕一个普通的企业数据团队,也能做到我们最近做到的事,把 95% 的分析查询自动化你们可以让模型给出的分析答案去对照硬数据做校验绝大多数知识工作做不到这一点它们没有可验证的标准答案所以这是一个早赢的领域
OpenAI 为 Codex 推出全新插件站点与标注能力,将编码智能体扩展到分析师市场设计投资等非工程岗位,让更多角色能够在工作流中直接调用 Codex 完成日常任务
Google 工程师在 I/O 2026 筹备过程中大量使用 Gemini 与 AI Studio:从水母主题前导视频TPU Training Day 短片,到会场设计稿Session 摘要生成,再到现场 demo 与播客剪辑团队强调这是 AI 重塑创作流程的典型样本,展示"用 AI 做 I/O"的工程实践:让模型承担脚本分镜视觉资产与多语言字幕等环节,把人从重复劳动中解放出来专注创意
OpenAI 前沿模型与 Codex 正式登陆 AWS 平台客户可在已有的 AWS 环境采购流程与权限管控下直接调用 OpenAI 模型与编码助手,加速企业从评估到生产的落地节奏
Google 团队通过"vibe coding"用零编程背景的编辑在 Google AI Studio 中构建了一份 I/O 2026 知识测验,借助 Gemini 生成 prompt由 Antigravity 编码代理执行,借此展示 AI Studio 已从纯模型游乐场演化为带代理能力的低代码应用构建平台文章强调门槛被压低后,非工程师也能在数小时内交付可交互 web 产品
ACM Queue 文章梳理软件工程与 GenAI 的常见误区,指出营销叙事和轶事成功已经领先于证据;文章特别强调开发者并非把大部分时间用于写代码,因此用代码行数衡量 AI 影响会误导工具采纳和组织决策
Jacob Harris撰文阐述个人为何始终无法接受vibe coding:从成本(按token计费易超支)经验(写代码的过程本身是认知沉淀)抽象(AI省略关键中间步骤)数据(私密代码上传存在合规风险)摩擦(自动化掩盖必要的反馈回路)责任(开发者无法审查的内容不应署名)以及创作乐趣七个维度展开作者强调自己并非原教旨主义者,对简单任务仍认可AI辅助价值
文章提出 AI 正在重塑初创公司的生命周期,构思MVP发布到扩展各阶段都可以用 ClaudeClaude CodeClaude Cowork 压缩验证开发和运营周期,给出 AI 原生初创公司的实战手册
Google 发布 Gemini Intelligence,将现有和新增 Gemini 功能打包整合,包括跨应用任务自动化和 vibe-code Android 小组件功能这意味着用户可以通过自然语言描述直接生成 Android 小组件,大幅降低开发门槛标志着 Google 在移动端 AI 生态布局的重要一步
Anthropic 发布 Claude Code 的 agent view 功能,将多个 Claude Code 会话集中到一个界面管理此前开发者同时运行多个智能体时需要在终端标签tmux 网格间频繁切换新功能简化了多智能体工作流的监控和协调
Tuhin Nair撰文回应AI智能体将取代开发者论调:如果资深开发者认同这种说法,作者反而会质疑其专业水平作者认为资深开发者的核心价值在于多年实践中沉淀的隐性知识判断力与系统思维,这些恰恰是AI目前最难替代的部分;而非资深者认同此观点往往是因为尚未见识到真正的资深工程师如何在复杂系统中穿针引线
宝玉观察到 Codex AppClaude 桌面版Cursor 3.0TRAE SOLO 这几家头部 Agent 在无协商情况下几乎同步收敛到同一界面布局:左侧项目与会话中间对话右侧工作区文章认为 Agent 已经接管了大量"专业工具时间",右侧工作区正在从纯审计面板演化为可微调文件可预览网页可改 PPT 的多功能区,Codex 4 月 16 日大版本更新正是这一方向的代表
宝玉翻译 Akshay Pachaar 的文章,系统拆解 AnthropicOpenAIPerplexityLangChain 等团队在 Agent Harness 上的工程实践:编排循环工具记忆上下文管理状态持久化错误处理与护栏LangChain 仅通过重构包裹 LLM 的外围架构就把 TerminalBench 2.0 排名从 30+ 拉至第 5,另一项研究让 LLM 自己优化 Harness 实现 76.4% 通过率,文章给出"如果你不是模型本身,那你就是 Harness"的精炼定义
论文提出 SWE Atlas,目标是 benchmarking coding agents beyond issue resolution它把软件工程 Agent 评测从单一 issue 修复扩展到更广的软件工程任务维度,有助于避免只用 SWE-bench 式成功率代表完整 coding-agent 能力
宝玉整理 Boris Cherny 在 Sequoia AI Ascent 2026 的访谈:Boris 整个 2026 年没写过一行代码,靠 Claude App 同时跑 5-10 个会话和几千个 Agent,单日合并 150 个 PRClaude Code 早期没有 PMF,直到 Opus 4 发布后才指数增长Anthropic 内部已经不再手写任何 SQL 和产品代码,员工的 Claude 通过 Slack 互相沟通解决不确定问题Boris 借用 Hamilton Helmer 的'七种护城河'框架判断 AI 会抹平切换成本与流程效力两种护城河,把软件构建类比为印刷术,认为未来最合适写会计软件的是会计师而不是工程师
Gemini 3 Flash现已可在Gemini CLI中使用,提供接近Gemini 3 Pro的专业级编码性能,具有低延迟和低成本特性。该模型在SWE-bench验证中达到76%的分数,显著优于2.5 Pro版本,改进了自动路由和代理编码能力。特别适合高频率开发任务,能够处理复杂代码生成、大上下文窗口(如处理1000条注释的PR)和快速生成负载测试脚本。
cc-connect 将本地 AI 编程 agent(Claude Code、Codex、Cursor Agent 等 10+ 种)桥接到 11 个主流聊天平台(飞书、钉钉、Telegram、Slack、Discord、微信等),实现从任意设备通过聊天控制本地 AI 编码助手。v1.3.0 新增 Web 管理界面、生命周期钩子、技能管理、个人微信支持等特性,支持 slash 命令切换模型、调整推理级别、管理会话目录和定时任务,无需公网 IP。
AGENTS.md 是一个约 200 行的可放置于项目根目录的行为规范文件,让 Claude Code、Codex、Cursor、Gemini CLI 等编程 Agent 自动按「高级工程师」方式工作。核心改变:代理在用户犯错时主动反驳、只做最小必要修改、不擅自重构无关代码、先写验证再报告完成、遇到歧义主动询问。综合了 Karpathy 的四大 LLM 编程失败原则和 Boris Cherny 的 Claude Code 工作流,仅两个区域需要手动编辑(项目上下文 + 经验积累)。是 Linux Foundation Agentic AI Foundation 维护的跨工具开放标准。
宝玉分享了Claude Code会话管理和100万token上下文窗口的使用策略,涵盖何时开启新会话、回溯与纠正、压缩与清空上下文、以及子智能体的最佳使用时机。文章强调了避免糟糕的上下文压缩问题的重要性,指出正确的会话管理是提升AI编程代理效率的关键。这些策略综合了大量实际使用经验,对Claude Code的重度用户具有很高的参考价值。
OpenAI于2026年4月23日发布GPT-5.5,号称其'最智能的模型'。GPT-5.5在编码方面表现出色,减少了安全问题,并支持代理自主性和推理。它能更快地理解用户意图,擅长编写和调试代码、进行在线研究、分析数据和创建文档,在token效率方面也有提升。GPT-5.5已集成到ChatGPT和Codex中,GPT-5.5、GPT-5.5 Pro和GPT-5.5 Thinking版本均已开放。同日发布了安全评估和保障措施的系统卡。
Anthropic于2026年4月17日推出Claude Design,这是一款允许用户与Claude在视觉工作上进行协作的新产品。用户可以与Claude一起创建设计、原型和幻灯片,将Claude的能力从文本和代码扩展到视觉创作领域。这是Anthropic在产品化方面的重要扩展,标志着AI助手从文本工具向多模态创作平台的演进。
论文围绕 Code Agent 的强化学习与过程奖励模型(PRM)展开摘要主题是 advancing PRMs for reinforcing code agents:通过更细粒度的过程反馈来引导软件工程 Agent,而不是只依赖最终答案成败,适合跟踪 coding-agent 训练与评估方法
从 59K+ 仓库收集 142K+ AI coding agent 提交的 PR,经确定性合并模拟后处理 107K+发现 29K+ PR 存在合并冲突,冲突率 27.67%,提取出 336K+ 细粒度冲突区域表明 AI 生成贡献的合并冲突既频繁又常较大,且不同 agent 间差异明显
论文回顾 Agentic AI for Software Engineering 评估中的复现和解释缺口,分析 ICSE/FSE/ASE/ISSTA 相关研究后建议公开 Thought-Action-Result 轨迹与 LLM interaction data它的价值在于把 coding agent benchmark 从只看结果分数推进到可复查过程
对 2853 个 GitHub 仓库的 agentic AI 编程工具(Claude Code / Copilot / Cursor / Gemini / Codex)配置机制做了实证普查识别出 8 种配置机制(静态上下文可执行脚本外部集成)核心发现:Context Files 占主导地位,AGENTS.md 成为跨工具互操标准;极少仓库用 Skills/Subagents 等高级机制,且 Skills 多为静态指令而非可执行脚本;各工具已形成差异化配置实践,Claude Code 用户机制覆盖最广为 coding agent 配置策略建立了经验基线
论文研究软件工程 Agent 在处理代码仓库任务时的上下文选择问题标题和摘要聚焦 self-adaptive context pruning:让 coding agent 根据任务动态裁剪低价值上下文,减少长上下文带来的噪声和成本,适合作为 SWE 类 Agent 的上下文工程参考
SWE-bench-Live 通过自动化实例创建和环境设置,发布 1,319 个来自 2024 年后 GitHub issue 的任务,覆盖 93 个仓库,并为每个任务配套 Docker 镜像论文报告相比静态 SWE-bench,现有 agent 和模型在 live-updatable抗污染的任务上仍有明显性能差距
Karpathy 2 月初造了一个新词:"vibe coding"。描述的是一种全新编程方式:把代码的存在感忘掉,全交给 LLM(他用 Cursor Composer + Sonnet),靠语音输入几乎不碰键盘。报错直接复制粘贴让 AI 修,不读 diff,永远 Accept All。代码长到他读不懂的程度,bug 修不掉就让 AI 随便改直到消失。这个词的内涵是:当模型强到一定程度,写代码的瓶颈不再是 prompt 也不是细节,而是 "说什么" 和 "判断做什么"。Vibe coding 适合周末项目和原型,但 Karpathy 也明确说对生产代码不合适。这条原推拿了 720 万浏览,"vibe coding" 随后成为 2025 全年程序员圈高频词。