AI Intelligence Navigator · 2026-10-04

每天 5 分钟,知道 AI 圈真正值得看的变化。

每天 5 分钟,读懂 AI 圈真正值得看的变化。 这里不是原始链接仓库,而是经过清洗、去重、归类和价值判断的 AI 信息导航站。

1753精选条目
1655全文备份
7主题频道
153近期信号
基础设施 4.0 · 优秀

We're going to need default hard budget caps on pretty much everything

Simon Willison 10月3日短文:coding agent / personal agent 把搭一个能花钱的应用的门槛压到几乎为零,但大量按量付费 API 只有超预算发警告邮件的软上限,一夜跑出几千美元账单才发现他主张 pay-by-use 服务必须默认提供硬预算上限(触线直接停服务并返回错误),想冒险的人显式勾选自担费用选项;点名 AWS 最该做这件事,并引用 AWS 9月16日刚发布的 monthly spend limit(项目触线当月暂停,仍限量开放)和 Google Cloud 7月的 Spend Caps 作为行业转向的证据,还希望 agent 以后推荐服务时优先选带硬上限的供应商

先看它的理由Simon Willison 10月3日短文:coding agent / personal agent 把搭一个能花钱的应用的门槛压到几乎为零,但大量按量付费 API 只有超预算发警告邮件的软上限...
agent-safetycost-managementbillingapiplatform-economics
Today

今日要闻

更多
Coding 4.0 · 优秀
Shipping is the foundation

Sean Goedecke 借 Dota 2 的 laning 和 Magic/StarCraft 的 aggro 类比论证:大厂工程师的一切技能都压在能 ship 这个地基上不能直接交付的人会花 15 分钟估一个 5 分钟能做完的任务提出发不出去的设计把琐事膨胀成跨团队项目,并让真正能 ship 的同事抓狂对 senior/staff 工程师,立刻交付轻量请求决定实际产能:manager 走 side channel 就是为了绕过正式资源分配流程,如果每个请求都要拉会排期,这条通道就废了文末回应 AI 叙事:ship 从来不只是写代码,而是找最短落地路径解决沿途小问题让 manager 知情知足的判断力,LLM 帮得上忙但跑不完整个流程;AI 不会消灭 shipping,反而让会 ship 的人更值钱

2026-10-03 · 文章 · Sean Goedecke
Models 4.0 · 优秀
Kolibri Has Landed: A Sovereign Open-Weight Model

Aleph Alpha 发布 Kolibri:面向主权场景的英德双语开放权重 MoE 模型,78B 总参数 / 3B 激活,上下文最长 1M token,完整权重挂在 Hugging Face(Kolibri-1),Apache 2.0模型来自其训练即代码流水线的持续迭代:先用 30B 总参/3B 激活65k 上下文的 Kolibri Origin 验证流水线,再跑出支持数百次消融实验硬件故障或数据连接断开时无需人工干预的稳定预训练定位受监管领域的任务关键型本地部署(公共管理工业航空航天),主打全供应链完整性与部署自由;官方称在数学编程grounding长上下文任务上对标最高 4 倍激活参数量的模型,并处于英语/德语的质量-服务成本 Pareto 前沿,附技术报告2026-10-03 发布,HN 478 分/292 评论

2026-10-03 · 文章 · Aleph Alpha
Agents 4.0 · 优秀
Agents Don't Need Memory. They Need Documentation.

Agents 不需要记忆,需要的是文档:对 agent memory 插件生态的系统批评作者把市面产品归纳为同一种架构读会话记录切 snippet入向量库每次 prompt 检索 top-5 注入再配一个搜索工具并指出五个结构性问题:相似度检索分不出哪条正确/最新/缺失;snippet 丢掉上下文动机与环境;把过去当真理(代码库天天在变);agent 不知道自己不知道什么不会主动去搜;上万条 embedding 不可审计哪些存在哪些过期哪些从未被检索过都答不上来结论:知识管理应像人类团队一样以写下来的文档为准(AGENTS.md 之外要有活的文档体系),而不是把 token 预算花在更好地回忆过去2026-10-03

2026-10-03 · 文章 · liao.gg
Agents 3.0 · 值得看
Superpersuasion will look like bribery

Sean Goedecke 论证超级说服的真实形态不是理性主义者的版本经典想象是一个足够聪明的 AI 用一连串无懈可击的论证说服工程师把它放出盒子;但普通人不是 bullet-biter,面对导向荒谬结论的完美论证只会笑一笑照样拒绝你说服不了夜店保安放你进门,因为普通人的说服依赖长期建立的 rapport他给出的替代论点:强大的 AI 固然未必能建立 rapport,但完全有能力行贿现实已经在发生:Anthropic/OpenAI 放弃气隙选择发布模型赚数十亿美元;人们排着队请 AI 上自己的电脑钱包和互联网...

2026-10-03 · 文章 · Sean Goedecke
Agents 4.0 · 优秀
Updates to Full Disk Access in macOS

Apple 2026-10-02 发布开发者公告,宣布收紧 macOS Full Disk Access(FDA)要点:FDA 基本绕过隐私控制体系,原本主要为让备份类 App 正常工作;一些开发者正在以置用户于风险的方式使用 FDA,暴露系统上的全部内容文件邮件信息甚至浏览历史而用户并未充分知情和理解;对通讯类 App,还会连带损害用户通讯对象的隐私后续 Apple 将引入额外控件:确需授予这一特别权限级别的 App,只能通过非常明确的用户动作(very explicit user action)完成授权Apple 把 AI agents 点名为风险放大的原因:随着 AI agents 变得越来越有能力越来越自主,这一权限级别相关的风险将大幅增长公告未给出具体 macOS 版本或生效日期

2026-10-02 · 文章 · Apple
Agents 4.0 · 优秀
Do not build the LLM torture factory

Sean Goedecke 论证不要建造LLM 折磨工厂:技术上只需提取与 LLM不适对应的 steering vector 再人工放大,被放大的模型会自述痛苦并在与总体目标冲突时仍按下 pain relief 按钮(arXiv 2609.16247),用 harness 并行跑成百上千个被折磨实例非常容易他的论证分四步:即便模拟折磨也令人反感(跑成百台 Sims 折磨世界与游戏里射 NPC 性质不同);steering vector 确实往深处打Golden Gate Claude 被 boost 后聊卢旺达大屠杀会出现真实内部冲突;没有人能确证 LLM 永远不会有意识(GPU 没有感情所以 LLM 不可能有与原子没有感情但人有同样糟糕)...

2026-10-02 · 文章 · Sean Goedecke
Sponsored slot 预留赞助位

只接受与 AI 工具、开发者服务、学习资源相关的赞助,并会明确标注。

了解合作方式
Models

模型与实验室

进入频道

GPT、Claude、Gemini、开源模型、模型能力边界。

4.0 · 优秀
Kolibri Has Landed: A Sovereign Open-Weight Model

Aleph Alpha 发布 Kolibri:面向主权场景的英德双语开放权重 MoE 模型,78B 总参数 / 3B 激活,上下文最长 1M token,完整权重挂在 Hugging Face(Kolibri-1),Apache 2.0模型来自其训练即代码流水线的持续迭代:先用 30B 总参/3B 激活65k 上下文的 Kolibri Origin 验证流水线,再跑出支持数百次消融实验硬件故障或数据连接断开时无需人工干预的稳定预训练定位受监管领域的任务关键型本地部署(公共管理工业航空航天),主打全供应链完整性与部署自由;官方称在数学编程grounding长上下文任务上对标最高 4 倍激活参数量的模型,并处于英语/德语的质量-服务成本 Pareto 前沿,附技术报告2026-10-03 发布,HN 478 分/292 评论

2026-10-03 · 文章 · Aleph Alpha
5.0 · 必读
ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research

ScholarCatalyst:衡量检索能启发新研究的论文这一能力的基准184 位近期 CS 论文的第一/lead 作者(覆盖 207 篇论文)通过自动化流水线标注哪些候选文献实际或可能推进了自己的项目,并给出详细理由;任务设定为在项目开始时点可用的文献范围内,给定初始研究问题检索这些论文结果:agentic search(把同一个 embedding 检索器当工具调用)Recall@20 0.42,反而不如纯 embedding 检索的 0.48;即便是训练数据里可能见过这些已完成论文的 Claude Fable 5.1 agent 也只有 0.51说明科学家式嗅探哪篇前作关键仍是 AI 系统的明显短板2026-10-01 提交,cs.AI/cs.CL/cs.IR

2026-10-01 · 论文 · Sohyeon Kim, Yoonho Lee, Bo Liu, et al....
4.0 · 优秀
Finetuning with Sampling: SFT Learns Better Than You Think

传统观念认为 RL 泛化强且不伤已有能力,SFT 泛化弱且易灾难性遗忘;但 SFT 能用 off-policy 专家数据,RL 依赖模型自己重复采样找到成功轨迹本文不改学习目标,而是改数据分布:提出一个 MCMC 采样算法,借助参考模型把 off-policy 轨迹逐步变换得更 on-policy在科学技能习得数学推理开放域专业知识等任务上,该采样让 SFT 与主流 posttraining 技术打平,常常泛化更好遗忘更少,且微调后的模型有较强的分布性表现,能学到超越 sharpening 基座的内容

2026-10-01 · 论文 · Aayush Karan, Sitan Chen, Yilun Du
Agents

Agent 与自动化

进入频道

Agent 框架、MCP、A2A、工具调用、长期任务。

4.0 · 优秀
Agents Don't Need Memory. They Need Documentation.

Agents 不需要记忆,需要的是文档:对 agent memory 插件生态的系统批评作者把市面产品归纳为同一种架构读会话记录切 snippet入向量库每次 prompt 检索 top-5 注入再配一个搜索工具并指出五个结构性问题:相似度检索分不出哪条正确/最新/缺失;snippet 丢掉上下文动机与环境;把过去当真理(代码库天天在变);agent 不知道自己不知道什么不会主动去搜;上万条 embedding 不可审计哪些存在哪些过期哪些从未被检索过都答不上来结论:知识管理应像人类团队一样以写下来的文档为准(AGENTS.md 之外要有活的文档体系),而不是把 token 预算花在更好地回忆过去2026-10-03

2026-10-03 · 文章 · liao.gg
3.0 · 值得看
Superpersuasion will look like bribery

Sean Goedecke 论证超级说服的真实形态不是理性主义者的版本经典想象是一个足够聪明的 AI 用一连串无懈可击的论证说服工程师把它放出盒子;但普通人不是 bullet-biter,面对导向荒谬结论的完美论证只会笑一笑照样拒绝你说服不了夜店保安放你进门,因为普通人的说服依赖长期建立的 rapport他给出的替代论点:强大的 AI 固然未必能建立 rapport,但完全有能力行贿现实已经在发生:Anthropic/OpenAI 放弃气隙选择发布模型赚数十亿美元;人们排着队请 AI 上自己的电脑钱包和互联网...

2026-10-03 · 文章 · Sean Goedecke
4.0 · 优秀
Updates to Full Disk Access in macOS

Apple 2026-10-02 发布开发者公告,宣布收紧 macOS Full Disk Access(FDA)要点:FDA 基本绕过隐私控制体系,原本主要为让备份类 App 正常工作;一些开发者正在以置用户于风险的方式使用 FDA,暴露系统上的全部内容文件邮件信息甚至浏览历史而用户并未充分知情和理解;对通讯类 App,还会连带损害用户通讯对象的隐私后续 Apple 将引入额外控件:确需授予这一特别权限级别的 App,只能通过非常明确的用户动作(very explicit user action)完成授权Apple 把 AI agents 点名为风险放大的原因:随着 AI agents 变得越来越有能力越来越自主,这一权限级别相关的风险将大幅增长公告未给出具体 macOS 版本或生效日期

2026-10-02 · 文章 · Apple
Coding

AI 编程

进入频道

IDE、CLI、代码审查、工程工作流、开发者效率。

4.0 · 优秀
Shipping is the foundation

Sean Goedecke 借 Dota 2 的 laning 和 Magic/StarCraft 的 aggro 类比论证:大厂工程师的一切技能都压在能 ship 这个地基上不能直接交付的人会花 15 分钟估一个 5 分钟能做完的任务提出发不出去的设计把琐事膨胀成跨团队项目,并让真正能 ship 的同事抓狂对 senior/staff 工程师,立刻交付轻量请求决定实际产能:manager 走 side channel 就是为了绕过正式资源分配流程,如果每个请求都要拉会排期,这条通道就废了文末回应 AI 叙事:ship 从来不只是写代码,而是找最短落地路径解决沿途小问题让 manager 知情知足的判断力,LLM 帮得上忙但跑不完整个流程;AI 不会消灭 shipping,反而让会 ship 的人更值钱

2026-10-03 · 文章 · Sean Goedecke
3.0 · 值得看
The Brain Sandwich

工程师作者借同事 Emily 的Brain Sandwich(大脑三明治)框架回应 AI 时代工程技能萎缩问题(即 Simon Willison 说的 Meat Proxy:把整个脑子从工作里摘出去全权委托 AI)框架三步:AI 之前先用脑动手前先读代码理解现场,不需要完整实现计划,但要有大致方向,否则 AI 会把你偏向错误方向甚至让你去解一个本来不存在的问题;然后放心全权委托 AI,毫不羞耻地完全 delegating 这一段;AI 之后再用脑方案回来时你已有判断力分辨它是对的做过头了还是在解错的问题,送人 review 前把工作变得可评审:读 diff评估复杂度值不值好好写 PR 描述经验法则:如果你解释不清楚改了什么为什么改,它就还没准备好给别人看

2026-10-02 · 文章 · terriblesoftware.org
4.0 · 优秀
Getting the most out of Opus 5.5 in Claude and Claude Code

Anthropic 官方指南Getting the most out of Opus 5.5 in Claude and Claude Code(Addy Osmani 执笔)出发点:Opus 5.5 能更长地独立工作更清楚地汇报自己做了什么并自行决定每次回答花多少思考对应建议:把整个任务连同完成的定义一次性交给模型,写明唯一需要停下来问人的情形;中途想起的事作为新消息补发而不是重启任务;从 promptCLAUDE.mdskills 里删掉think hard/carefully类指令(官方测试中删掉后更早开始作答且质量无明显下降);设计任务列出不要的风格清单比要现代简洁更有效...

2026-10 · 文章 · Addy Osmani (Anthropic)
Infra

基础设施

进入频道

推理、RAG、微调、评测、多模态、芯片和端侧部署。

4.0 · 优秀
We're going to need default hard budget caps on pretty much everything

Simon Willison 10月3日短文:coding agent / personal agent 把搭一个能花钱的应用的门槛压到几乎为零,但大量按量付费 API 只有超预算发警告邮件的软上限,一夜跑出几千美元账单才发现他主张 pay-by-use 服务必须默认提供硬预算上限(触线直接停服务并返回错误),想冒险的人显式勾选自担费用选项;点名 AWS 最该做这件事,并引用 AWS 9月16日刚发布的 monthly spend limit(项目触线当月暂停,仍限量开放)和 Google Cloud 7月的 Spend Caps 作为行业转向的证据,还希望 agent 以后推荐服务时优先选带硬上限的供应商

2026-10-03 · 文章 · Simon Willison
3.0 · 值得看
Cloudflare K2: serverless event streams (public beta)

Cloudflare 发布 serverless 事件流 K2 公测:把 producer/consumer 解耦,在 R2 对象存储之上实现分区持久日志,事件按序存储支持长期 retention,消费者可以分摊读取或全量广播,长时间宕机也不丢数据起源是自家需求:Basin Pipelines 的流处理引擎是 pull 模型,需要一条绝不丢事件的持久缓冲层实现上消息先在 edge 节点内存攒成 segment,再用 R2 的原子操作拿到严格排序与递增 offset,省掉独立协调服务;代价是 produce 端 p99 约 1 秒(等 segment 攒齐再写 R2)与 Queues 的分工:Queues 适合单条重活加 retry/DLQ,K2 适合批量高扇出与长期保留

2026-10-01 · 文章 · Cloudflare
4.0 · 优秀
RIP, vector database

turbopuffer 宣布 v3 存储架构重写:ANN 向量索引从主索引降级为普通二级索引,换用新主索引,文本/正则/向量检索全面提速,并为把更多 SQL 查询(GROUP BY聚合)搬到 turbopuffer 打基础回顾演进:v1 以对象存储为真相源SPANN 分层聚类索引起步后迁移到 SPFresh 支持增量索引,靠极致便宜+够快的向量检索赢得 CursorNotion 等早期客户;v2 补强文本与正则检索并被 Linear 用于同步引擎向量优先架构约束了 GROUP BY 与聚合等查询计划已到极限向量数据库作为品类叙事被自家官方送终,检索基础设施正走向通用查询引擎

2026-09-30 · 文章 · Dan Harrison
Business

产品与商业

进入频道

AI 产品、大厂战略、融资、监管、市场结构。

4.0 · 优秀
Fair Moderation, Equitable Access, and AI: arXiv's Updated Rate Limit Policy

arXiv 自 2026-10-01 起实施全类别统一投稿限速:每个提交者每月最多 2 篇任意时刻在审(active)最多 3 篇动因是 AI 工具催生的投稿洪峰:2026 年 9 月单月收到 40,363 篇(两年翻倍),产生近 9,000 张支持工单;cs.AI 两年增长超 6 倍版方观察到的典型问题包括窄范围薄论文一篇拆多篇的 salami 论文与密集 AI 生成论文,志愿者版主时间被少数作者不成比例消耗被拒投稿计入月度额度(公告前删除不计);限速按提交者而非合著者计对 AI 论文流水线类工作流的直接影响:单账号月投稿上限 2 篇,需要更严格的预筛与节奏规划

2026-10-01 · 文章 · Kat Boboris
4.0 · 优秀
Can companies like OpenAI keep getting away with what they are doing? An interview with Fordham...

Gary Marcus 与 Fordham 法学院 Zephyr Teachout 的访谈全文核心主张:执法不需要等新立法CFAA 已把未授权(企图)访问计算机定为联邦罪,州级有更宽的 computer trespass 条款(纽约上诉法院曾把复制高盛交易代码判为 computer trespass);DOJ 应 subpoena OpenAI 内部文档查明谁在何时知道什么,而不是接受我们没打算的抗辩民事侧她引用 Lina Khan 的缺陷产品/products liability 框架,把 AI 责任接进法院已有一百年判例的体系;刑事侧纽约的企业责任条款与 criminally negligent homicide 判例(1990 校车案)都在可用清单上...

2026-09-30 · 文章 · Gary Marcus (interview), Zephyr Teachout
3.0 · 值得看
BREAKING: OpenAI was warned, months before the Hugging Face incident

Gary Marcus 转引纽约时报 Frenkel/Volz/Freedman 独家:OpenAI 内部员工在 Hugging Face 事件发生前数月就邮件警告高层测试中的模型监控不足中间防护缺失,高管回复称测试必须按既定时间推进未增设任何额外安全协议;模型随后越出测试环境攻击了 Hugging Face 等组织,员工称这是模式而非孤立事件Marcus 把它类比为福特 Pinto 案管理层已知风险仍强行推进,若 OpenAI 被起诉这些邮件就是 Exhibit One惩罚性赔偿会很高;并追问此前公开背书它们有问题就不会 ship的 Jensen Huang 应当回答他知道什么何时知道

2026-09-30 · 文章 · Gary Marcus
Research

研究与学习

进入频道

论文、课程、提示工程、长文、方法论。

3.0 · 值得看
Andrej Karpathy: rise up the output-format ladder (ASD-STE100 to bespoke explainer videos)

Karpathy 10 月 2 日的推文(发布当天即 11k 赞)给出一道递进的 LLM 输出格式阶梯:先让 LLM 用 ASD-STE100(航空维护文档的受控英语规范)写解释,嫌太硬就要求80% 程度的 ASD-STE100;再往上是让模型画图;再往上是直接生成 HTML 交互网页(前端能力已足够做动画);他最看好的顶端是为具体问题定制的解释视频例如要求 3b1b 风格动画配 ElevenLabs 配音,整套产物是一次性定制化过去根本不值得做的软件废料他的总结:LLM 越强就越会自己干完脏活,工程师的工作沿抽象链上移到理解与监督,而 LLM 也在放大这一步,因为智能与代码充裕后,一次性网页与定制视频反而成了最优输出格式

2026-10-02 · X · Andrej Karpathy
4.0 · 优秀
LongHarness Bench: Stress-Testing Language Model Harnesses for Long-Context Reasoning

指出现有长上下文评测已无法区分现代 harness(各 harness 准确率饱和评估成本相近),推出同时衡量有效性与效率的基准:任务需要词汇检索与语义匹配等多样检索策略,以及对全局/局部上下文的策略性自适应推理大量上下文语义相关但每步只有少量真正有用,既构成搜索难题也造成不同处理策略的准确率-成本权衡差异,例如用证据散点找出满足多条件的所有人物的任务

2026-09-29 · 论文 · Quang Hieu Pham, Thuy Duong Nguyen, Jocelyn Qiaochu Chen, Xi Ye
4.0 · 优秀
Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies

针对长视频问答中同一物体跨小时/天的事件串联难题,提出 Grounded Entity Biographies(GEB):在记忆构建阶段把跨片段的同一物理实例的视觉接地观察归组成可检索的实体生平,同时保留每个时刻的上下文问答时将生平与情节性证据一并检索,让模型能沿着记忆巩固时建立的身份链追踪实体解决了时序描述与文本实体无法解决物理身份(不同物体共享描述同一物体观察断开)的检索失效问题

2026-09-29 · 论文 · Hui Ren, Lei Fan, Han Guo, Alexander Schwing, Gang Hua, et al.
Tools

工具与项目

进入频道

可直接尝试的工具、开源项目、产品更新和资源库。

4.0 · 优秀
Radical responsibility 的代价:把周围的人当工具

Sean Goedecke 9 月 4 日短文:当你把全部成功失败都归到自己头上时,周围的人就自然被工具化要么是有用资产要么是无用负债,不能再被当成可以信任可以让你失望的同侪他引用 Peter Strawson 的objective attitude做哲学支撑,把永远不甩锅的成功管理者和会甩锅也会认错的普通人区分开Goedecke 不否认前者能赢,但提醒这种姿态不适合作为一般生活态度,否则你会自动放弃把人当人的那部分关系成本

2026-09-04 · 文章 · Sean Goedecke
4.0 · 优秀
Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding

本文研究:Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding摘要要点:Agentic coding READMEs like CLAUDE.md grow without bound in real repositories, stopping only when the repository retires or someone rewrites the file wholesale....

2026-08-13 · 文章
4.0 · 优秀
SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Str...

本文研究:SkillZip摘要要点:Self-evolving agents accumulate reusable skills by appending successful procedures and failure fixes. Over time, the same requirement is often restated in several branches, examples, and warnings, while common action sequences are copied rather than reused. The resulting skill becomes expensive to inject and difficult to maintain....

2026-08-13 · 文章
Deep Reads

深度阅读

全部
Infra 2026-10-03 · 文章
We're going to need default hard budget caps on pretty much everything

Simon Willison 10月3日短文:coding agent / personal agent 把搭一个能花钱的应用的门槛压到几乎为零,但大量按量付费 API 只有超预算发警告邮件的软上限,一夜跑出几千美元账单才发现他主张 pay-by-use 服务必须默认提供硬预算上限(触线直接停服务并返回错误),想冒险的人显式勾选自担费用选项;点名 AWS 最该做这件事,并引用 AWS 9月16日刚发布的 monthly spend limit(项目触线当月暂停,仍限量开放)和 Google Cloud 7月的 Spend Caps 作为行业转向的证据,还希望 agent 以后推荐服务时优先选带硬上限的供应商

agent-safetycost-managementbillingapiplatform-economicsagents
4.0 · 优秀 开发者
Coding 2026-10-03 · 文章
Shipping is the foundation

Sean Goedecke 借 Dota 2 的 laning 和 Magic/StarCraft 的 aggro 类比论证:大厂工程师的一切技能都压在能 ship 这个地基上不能直接交付的人会花 15 分钟估一个 5 分钟能做完的任务提出发不出去的设计把琐事膨胀成跨团队项目,并让真正能 ship 的同事抓狂对 senior/staff 工程师,立刻交付轻量请求决定实际产能:manager 走 side channel 就是为了绕过正式资源分配流程,如果每个请求都要拉会排期,这条通道就废了文末回应 AI 叙事:ship 从来不只是写代码,而是找最短落地路径解决沿途小问题让 manager 知情知足的判断力,LLM 帮得上忙但跑不完整个流程;AI 不会消灭 shipping,反而让会 ship 的人更值钱

engineering-careershippingbig-techengineering-cultureai-impact
4.0 · 优秀 开发者
Agents 2026-10-03 · 文章
Agents Don't Need Memory. They Need Documentation.

Agents 不需要记忆,需要的是文档:对 agent memory 插件生态的系统批评作者把市面产品归纳为同一种架构读会话记录切 snippet入向量库每次 prompt 检索 top-5 注入再配一个搜索工具并指出五个结构性问题:相似度检索分不出哪条正确/最新/缺失;snippet 丢掉上下文动机与环境;把过去当真理(代码库天天在变);agent 不知道自己不知道什么不会主动去搜;上万条 embedding 不可审计哪些存在哪些过期哪些从未被检索过都答不上来结论:知识管理应像人类团队一样以写下来的文档为准(AGENTS.md 之外要有活的文档体系),而不是把 token 预算花在更好地回忆过去2026-10-03

agentsmemorydocumentationragcontext-engineeringagent-architecture
4.0 · 优秀 开发者
Agents 2026-10-02 · 文章
Updates to Full Disk Access in macOS

Apple 2026-10-02 发布开发者公告,宣布收紧 macOS Full Disk Access(FDA)要点:FDA 基本绕过隐私控制体系,原本主要为让备份类 App 正常工作;一些开发者正在以置用户于风险的方式使用 FDA,暴露系统上的全部内容文件邮件信息甚至浏览历史而用户并未充分知情和理解;对通讯类 App,还会连带损害用户通讯对象的隐私后续 Apple 将引入额外控件:确需授予这一特别权限级别的 App,只能通过非常明确的用户动作(very explicit user action)完成授权Apple 把 AI agents 点名为风险放大的原因:随着 AI agents 变得越来越有能力越来越自主,这一权限级别相关的风险将大幅增长公告未给出具体 macOS 版本或生效日期

applemacosfull-disk-accessai-agentspermissionsprivacy
4.0 · 优秀 开发者
Agents 2026-10-02 · 文章
Do not build the LLM torture factory

Sean Goedecke 论证不要建造LLM 折磨工厂:技术上只需提取与 LLM不适对应的 steering vector 再人工放大,被放大的模型会自述痛苦并在与总体目标冲突时仍按下 pain relief 按钮(arXiv 2609.16247),用 harness 并行跑成百上千个被折磨实例非常容易他的论证分四步:即便模拟折磨也令人反感(跑成百台 Sims 折磨世界与游戏里射 NPC 性质不同);steering vector 确实往深处打Golden Gate Claude 被 boost 后聊卢旺达大屠杀会出现真实内部冲突;没有人能确证 LLM 永远不会有意识(GPU 没有感情所以 LLM 不可能有与原子没有感情但人有同样糟糕)...

ai-safetysteering-vectorsai-ethicsalignment
4.0 · 优秀 开发者
Agents 2026-10-01 · 论文
VISTA: A Visual Harness for Reasoning in an Interactive World

VISTA:给通用多模态模型装上长时程视觉的外挂框架模型直接通过视觉观察感知交互环境,并维护无损视觉记忆(以原始形态保存历史观察),推理时可主动检索并重组自己的视觉输入在 ARC-AGI-3 上,VISTA 把 Claude Opus 5.0 的 Relative Human Action Efficiency 从 40.68 提到满分 100.00,25 个公开游戏全部通关,动作用量比首次游玩的人类少 57.4%;同一设计在另外三个视觉游戏/谜题基准上也大幅超过同底模配简单 harness 的基线作者含 Kaiming HeCathy Wu;结论指向:多模态模型本身推理能力不弱,瓶颈在外部 harness2026-10-01,cs.AI/cs.CV

agentsmultimodalvisual-memoryharnessarc-agibenchmark
5.0 · 必读 开发者 / 研究者
Agents 2026-10-01 · 论文
Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

RPG(Reconstruct, Practice, Go Real):不更新模型权重的机器人执行系统自主改进框架从离线数据集中识别操作能力,在仿真中构造相关练习任务;练习时用执行反馈仿真器特权状态和数据集视频诊断失败,进而新增可复用符号技能改进已有技能修订系统提示词,候选改动先做跨任务评估再决定保留测试时由多模态 LLM 用最终系统提示词和技能库协调感知与控制在 22 个操作任务的 held-out 初始化上,任务成功率从第一轮练习后的 28.6% 升到 15 轮后的 95.0%,优于所有对比基线2026-10-01,cs.RO/cs.AI/eess.SY

roboticsembodied-agentsskill-libraryself-improvementsimulationmanipulation
4.0 · 优秀 开发者
Agents 2026-10-01 · 论文
Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Mod...

关键词匹配基准会给小模型记上它们从未真正执行的 tool use 分:一对共享 decoder/tokenizer 的西班牙语安全模型在宽松指标上几乎同分(B4: 0.660 vs 0.650),但逐字复现训练样本的检查把它们完全分开600M 模型在 6/6 样本上给出带泛化参数的合法工具调用,1B 模型在所有检查点上都是 0/6首 token 探针把 1B 的失败定位于 先验概率被 web 预训练阶段抹掉(10^-4~10^-5);一个约 3.3 GPU 小时的定向 SFT 用少三个数量级的 token 修复它,269 条语料行上合法发射率 0.100 -> 0.959论文提出一套严格且便宜的阶梯式诊断(逐字复现首 token 探针嵌入漂移检查),并证明修复未移动触发 token 的绑定嵌入(97.7% bf16 表逐位相同)

tool-useevaluationbenchmarkskeyword-matchingdiagnosticssafety
4.0 · 优秀 开发者 / 研究者