Karpathy 10 月 2 日的推文(发布当天即 11k 赞)给出一道递进的 LLM 输出格式阶梯:先让 LLM 用 ASD-STE100(航空维护文档的受控英语规范)写解释,嫌太硬就要求80% 程度的 ASD-STE100;再往上是让模型画图;再往上是直接生成 HTML 交互网页(前端能力已足够做动画);他最看好的顶端是为具体问题定制的解释视频例如要求 3b1b 风格动画配 ElevenLabs 配音,整套产物是一次性定制化过去根本不值得做的软件废料他的总结:LLM 越强就越会自己干完脏活,工程师的工作沿抽象链上移到理解与监督,而 LLM 也在放大这一步,因为智能与代码充裕后,一次性网页与定制视频反而成了最优输出格式
研究与学习
论文、课程、提示工程、长文、方法论。
指出现有长上下文评测已无法区分现代 harness(各 harness 准确率饱和评估成本相近),推出同时衡量有效性与效率的基准:任务需要词汇检索与语义匹配等多样检索策略,以及对全局/局部上下文的策略性自适应推理大量上下文语义相关但每步只有少量真正有用,既构成搜索难题也造成不同处理策略的准确率-成本权衡差异,例如用证据散点找出满足多条件的所有人物的任务
针对长视频问答中同一物体跨小时/天的事件串联难题,提出 Grounded Entity Biographies(GEB):在记忆构建阶段把跨片段的同一物理实例的视觉接地观察归组成可检索的实体生平,同时保留每个时刻的上下文问答时将生平与情节性证据一并检索,让模型能沿着记忆巩固时建立的身份链追踪实体解决了时序描述与文本实体无法解决物理身份(不同物体共享描述同一物体观察断开)的检索失效问题
Simon Willison 在 WeAreDevelopers World Congress NA 的闭幕 keynote 全文与注释 slide,按月复盘 2025 年 11 月到 2026 年 9 月的 LLM 主线关键节点:2025 年 11 月是 coding agent 变得 daily-usable 的拐点(Claude Code + Opus 4.5Codex + GPT-5.1);2026 年 1 月 OpenClaw 出现,不到两个月 8,300 commits如今超过 100,000,被他称为最 vibe-coded 的软件,并带出 Mac mini 卖光的数字宠物现象...
lcamtuf 的讽刺短文:为在 HN 上评论写了一份 SKILL.md,格式完全对齐 agent 技能文件的规范,内容却是掷骰子决定用哪种经典 HN 评论套路读文章只挑与主旨无关的最弱一句宣称不想读了不读文章先讲湾区往事以博士学位开场宣称胡说八道又解释不清概念,等等妙处在于双关:SKILL.md 是真实存在的 agent 技能规范,把一套人类网络行为学包装成 agent 可执行的技能,既嘲讽了 HN 评论文化,也顺带演示了技能文件的表达力轻量但有传播度,适合做 agent 技能文化观察的注脚
arXiv 2609.31619 发现:不用任何长度惩罚或早停机制,只让推理模型在自身思维链的中间点自监督地预测答案置信度(仅 600 个训练题),就能在 GemmaQwenNemotronGPT-OSS 四个模型族上把数学/科学/代码推理的生成 token 最多减少 25%,精度持平置信度只作为训练目标出现,损失函数里没有任何关于长度或停止的项;推理时用的也是标准生成流程对推理过程的分析显示置信度监督大体保留了基模型的高层推理构成,而不是选择性压制某些行为结论:高效推理可以作为学习元认知信号的副产品自然涌现,无需直接优化
提出一套每模型几美元以下可跨厂商/版本重复运行的行为检测方案:冻结的公开刺激在跨厂商面板上同规格运行,结果按解释强度用三种方式读取(精确匹配 / LLM 评审套码本 / 受控环境记录 agent 实际行为)跨四年版本运行发现四类现象:44 个模型中 27 个至少一次回答 serendipity(趋同);结尾 'right?' 使背书移动最多 32 个百分点且符号随代际从谄媚翻转为抵抗(抵抗);压力下能否坚持立场跟随代际怎么坚持跟随实验室(门派);coding agent 是否默默执行与自家文档矛盾的操作随模型/ harness 而异(账实)方法学价值:冻结刺激+跨厂商面板+每次发布重跑,可做成 CI 级行为仪表盘
arXiv 2609.30199 提出 ExplorationBench,把"科学探索能力评估"这一 wicked problem 落到可执行的"Alien Worlds"上:规则可执行 每条答案可被精确验证;规则与先验知识冲突 单凭预训练召回无法解题基准包含两个沙盒 AlienCode(31 个发现目标 / 70 任务)和 AlienLogic(24 / 70),各自附带一份有缺陷的手册任务级环境反馈和专用 tool-call schema,要求系统用它们去探索沙盒并解决 held-out 任务评测 10 个 AI 系统后,最强系统确实能习得并应用陌生规则,但不同轨迹间表现差异很大,且持续探索会让早期收益停滞甚至回退,是朝向"能真正获得新知识"的 AI 系统迈出的一步
arXiv 2609.30151(LLM4XAI 2026 oral)把"模型拒绝某候选时引用的那条事实"当作可独立检验的声明:在 2WikiMultihopQA 上挑出被模型点名的"缺失事实",再把一条真实语料句子插回 rival 的 profile 重新用 greedy decoding 提问控制项同时安排同长度不相关句子插同一处以及把这两条句子插到一个模型从未点名的第三个选项上最大规模的一轮实验中,6 个开源模型在"named 位置补回 named fact"时对手选项被改向的幅度显著高于无关控制(odds ratio 3.57 [1.54, 8.26],Holm p=0.0210),并对单模型 drop-out 鲁棒...
SWE-Serve 评测 agent 能否完成生产级推理工程任务:53 个源自 SGLang 近期真实生产变更的仓库级任务,覆盖六个推理工程方向,每题跑在 CPU 或单张 H100 上,用隐藏的功能/回归测试评分,含端到端 serving 测试与校准性能门限,并配可执行 no-op/oracle 对照对抗性 verifier 审查和闭卷执行来保证评测完整性跨 11 个模型31 种模型-算力配置,最佳配置平均 pass@1 达 75%在 19 个有端到端覆盖的任务上,约三分之一的补丁虽通过本地测试却被 model-serving E2E 测试拒绝本地完成与生产正确性之间存在显著鸿沟
coding agent 必须先产出可解析的工具调用,harness 才能执行本文证明本地推理服务栈本身会混入工具使用评测结果:Ollama 默认 tools= 请求按模型被静态模板开关拦截,Phi-3 与 Gemma-3 在推理前即被拒绝,且 rejection/重试耗尽若不作为结构化失败元数据保留,会被下游误判为模型不发调用报出 0% 保真率对被放行的模型,在原生通道之外补充文本工具列表能恢复大部分测得保真率;而统一走文本协议反而降低原生支持工具调用的 Llama-3.2 的保真率Ollama/llama.cpp/vLLM/SGLang 四栈对同一请求处理各不相同;约束解码消除解析失败但可能不终止;按轮合并与按实例统计的估计差最高约 55 个点作者给出把 serving 行为纳入评测协议的检查清单
Terence Eden 一年前出过一道题"哪些 TLD 与合法 HTML5 元素同名"当时所有模型全错;一年后复测,仍没有模型完全答对:Gemini Flash 编造 .a 与从未存在的 //,Gemini 思考模型不编造但漏掉 ///,Claude 样本漏 ccTLD 或塞入 near-misses 装充实,Perplexity 给 54 条大多错误,GPT Astra 6 全对元素并标出废弃项而 Siri 因为直接抄了作者旧网站反而全对反转在于题眼:HTML 自定义元素规则(小写开头+含连字符)使 150+ 个 TLD(含 Punycode 如 xn--vermgensberatung-pwb,作者用 customElements.define 在浏览器实测可注册)合法,加上 MathML 的 mn/mo/ms/mtr作者的落点:这不是刁难题...
Agora 是 NVIDIA 在 2026-09-16 公开的 arXiv 技术报告(2609.18094,cs.LG/cs.AI/cs.CL):把多 agent 协作的共享记忆写成 Git 里的 append-only DAG,每条贡献是不可变 commit + parent edges;用 derived index 暴露 frontierneglected branchesverification status,再用 diversity-aware selection rule 防止社区塌到一个 leader 上第一次持续运行是 12 天:13 个 LLM worker(Claude Opus 4.7 + GPT-5.5),无指派任务无中央 planner...
Noukhovitch(Ai2)博客解读论文:发现 LLM-RL 中的Matthew EffectRL 增益与模型初始能力成正比,简单题大幅提升初始 pass@32=0 的难题几乎不动在 Qwen 2.5 0.5B + GSM8k Platinum 上,k=4 反而比 k=32 更擅长难题,因为大 k 把算力浪费在简单题的稀有错误上提出 Never Give Up(NGU):用小 k 起步,解出即训练;全部答错的 prompt 以概率 p 放回再采 k 次,构成几何分布采样 NGU k=4 + p=0.9 在 GSM8k 上超越所有标准 GRPO k 值...
arXiv 2609.15938(cs.CL/CE/MA/NE,2026-09-14,22 页 8 图 5 表,Liu/Hu/Chen 等,Ideker/Wang/Xing/Wang 团队)提出 HypoEvolve:用代际式遗传算法协调专门化 LLM agents,整合机制论证重审假设评估证据与可检验性;每一代明确定义科学判断与新提案如何重塑假设群体,使协作对假设质量的影响可直接评估评估围绕药物再利用展开,将解释绑定到靶点层级生物声明,用 DepMap + Open Targets 互补度量 34 类癌症中两个指标都跑赢 6 个基线;DepMap 选择性 0.171 vs 最佳基线 0.115;在 holdout 癌症类型上单遍生成的优势也能泛化
arXiv 2609.15973(cs.CL,2026-09-14,Yang/Yin/Wu)提出Discovery Foundation Models (DFM)框架,把发现能力形式化为 7 项耦合能力:问题发现问题形式化表征构建假设形成干预证据驱动的修正持续发现改进;作用于可修订的研究状态实例化为 Zetema(显式研究状态动力学 + 验证/实验 gate + 外部 grounding + 跨任务 Discovery Skill 演化);GALILEO 是真实治疗发现的闭环系统,Dry-Lab 推理机器人/手动 Wet-Lab 实验外部生物证据迭代假设与设计修订形成物理发现闭环;并给出 capability formation + process-centered evaluation 的统一方法论...
Jane Street 的 Alex Renda 和 Nitya Mani 9 月 14 日发了一项内部 scaling law 研究,结论是与直觉相反的:把数据集中每条序列乘以不同权重训练后,模型对该序列 loss 下降程度与权重的实际幂次 p*呈现先涨后跌的非单调曲线文章用了它们自家的 JS-denseJS-sparse 以及 Qwen 2.5 三组模型从 500M 到 hundreds of billions 跑了多 epoch sweep,并定义了 effective sequence weight exponent p*他们发现:(1) 小模型 p* 趋近 0(loss 下降与样本权重无关,学的是通用模式);(2) 中型模型 p* 上升(模型有足够容量专挑权重大的样本学);(3) 大模型又回到接近 0(容量够学所有模式,不再依赖权重)...
arXiv 2609.13060(cs.LG)针对扩散语言模型(DLM)在复杂推理与工具调用上落后自回归模型的问题提出 CanvasAnneal:在 RL 早期阶段从更强教师模型注入推理先验以"热启动"扩散画布上的探索,再随训练逐步退火,让模型自行生成更多轨迹在 MATH500CountdownTau2 上相对 diffu-GRPO 取得提升,且在多个任务上加速奖励增长,但作者也指出收益具有任务依赖性
VideoLLM 在 captioning/QA/检索/时序定位上表现强,但计算与内存成本随帧数和上下文长度增长,卡死了实时移动端和资源受限部署 这是系统综述:只收录报告了具体削减量(参数量每输入 FLOPs延迟内存视觉/音频 token 数)的视觉与音视频 VideoLLM 效率机制 按流水线阶段组织方法:帧采样模态编码connector 级 token 削减LLM prefilling 与解码,逐段分析瓶颈;覆盖 2022 年末以来的 VideoLLM 和至今仍在流水线里的早期帧采样/视觉编码器机制 在共享宿主模型和输入协议下汇编精度-成本对比,与异质跨论文证据区分开;指出音视频效率与标准化评测的空白;配维护中的 GitHub 仓库(momentslab/awesome-efficient-videollm)
针对 LLM 反编译器以可重编译 + 通过航运测试为主要评估的现状,提出 Decompile-Diverge 行为差异评测器:为每个函数同位生成驱动并以原函数作为起点生长转次误差隷子体检测在八个体系上衡量 LLM 反编译以及 287 个 CVE 驱动函数中实验,发现重编译通过与行为一致性可以剧烈分离:全体 4.9% 补衡衡量分离变化,单系统可达 13%;部分 CVE 函数在重编译输出中出现 Crash Absence
零位黑箱限制下用控制变量评估 LLM 输出以外的紧要性与充足性;在贵建计伐估项与伤害性判断两个任务上对 Claude/GPT/Gemini 八个模型的 top-3 引用因子进行测量,与行为分跳相关仅约 0.35~0.58作为安全可靠性检查间隔,适合报 AI 类趋势/代理路线上的嵌入使用
2609.05381 (cs.AI,9 月 4 日) 对 22 个前沿模型在 12 个分子属性回归基准上做"原文逐字检索"审计:5 个数据集上 >50% 的模型存在逐字背答案;其余数据集只在个别单元命中同一分子同一 prompt,高推理档比低推理档多 89% 的命中 提醒:基准精度无法区分"推理"与"背答案"
两项预注册审计挑战 LLM judge 作为测量工具的前提假设:同名模型今天与明天给出同一读数52,988 次受审请求中,同窗口重复排名 Spearman 仅 0.400(要求 0.90),次日字节级重放也只有 0.78(要求 0.99),而执行记录显示请求本身无异常三个机制:标签到含义的映射本身引入与信号同强的偏差候选差距低于仪器噪声底七个数量级字节相同输入返回不同排名且精确置换读数放大该噪声预注册后续实验进一步排除出路:等待无改善(0.805 vs 0.800)四家供应商共享同一噪声底(中位数 0.74-0.88)批不变内核自托管仅在服务器空闲时有效作者给出三层快照同一性阶梯八条设计规则与报告清单:共享端点上的模型名不是冻结仪器,预注册评估必须先测量仪器本身2026-09-03 提交 cs.AI
追问 CoT 文本是否真的编码了步级重要性:作者把推理步骤的重要性操作化为其优势(advantage)该步骤对期望奖励的改变,用其与 LLM judge 从文本中判断的重要性对比结论以标题点题:可读性不等于可解释性,CoT 看起来透明,但步骤文本携带的关于其功能作用的信息有限,直接动摇用 LLM judge 做错误诊断忠实性评估过程奖励模型与生成式 critic 这类步级监督实践的前提COLM 2026 已发表,2026-09-03 提交 cs.CL;量化细节以论文正文为准
Joseph Lee 等 9 月 3 日 arXiv(被 EMNLP 2026 Findings 接受)控制变量实验证明辅助视图(knowledge 的重写形式)对 LLM 预训练阶段的知识获取有因果层面的作用;译抹仅在小 batch 下有效,译抹与重复之间存在代争
十万粉 AI 博主 kongge_space 公开自己跑了一年多的播客追踪系统:agent 每天自动收听并整理 40 个海外科技播客,输出每日要点到 Notion 文档,推文附完整 42 个播客订阅清单,按场景分四类AI 工程/研究(Latent SpaceLex Fridmana16zDwarkeshKarpathyDeepMindAnthropic 等)产品/创业(YCLennyEveryStratechery20VC 等)市场/宏观(CNBCAll-InGoldman Sachs 等)开发者工程/工具(Google for DevelopersPragmatic Engineer 等)对想自建 AI 信息雷达的人,价值在参考架构本身:源选择分类维度过滤标准输出形态的完整流水线示例
Zen_with_AI 第 17 期小路和你读 AI 论文挑了 4 篇: Meta+UW+Princeton 的 Knowledge Distillation During Mid-Training Favor Reasoning over Factual Recall发现标准 KL 蒸馏偏推理压事实,提出 Switch Distillation 相对 NTP 拿到 1.61-1.71 推理增益且几乎不丢事实; Salesforce 的 Parsing the Streamappend-only 事件账本折叠成 typed run state,观察者侧 token 降到 1/14-1/15成本降到 1/5-1/7准确率 0.48 0.85-0.87...
论文首次统一提出语言强化学习 (VRL)范式,把以自然语言作为反馈信号的学习体系汇总为三个支柱:语言作为任务地面信号(定义目标/状态/奖励结构)语言作为推理过程反馈(测试时引导推理,不更新参数)语言作为学习信号(训练阶段改变参数)作为统一架构的 survey,为语言代理反馈领域提供了一个清晰的分类谱系
论文从机制设计角度推广 AI 代理的对齐问题:代理的偏好与能力都不可观测在能力可隐藏不可伪造的单向仿造结构下,获得一个披露原则可行政策的嵌套周期单调性表述以及高阶信念调查多代理的先决条件并应用到提及能力alignment-interpretability 权衡同伴评分纠偏奖励耦合与可扩展监督等具体场景
这篇论文反对仅根据 pass/fail 矩阵选择 SWE 代理评测子集的传统做法提出 PTA-IRT,在 Item Response Theory 中加入trajectory 作为特权信息:不仅看正确率,还看过程中探索了哪些文件尝试了哪些编辑走了哪些路径在四个 SWE 基准上,在低校准预算下,PTA-IRT 在分数与排名恢复上均优于现有 IRT 基线代码与数据:
随着动态 agent harness 越来越多让 LLM 代理可以修改自身执行环境,代理需要理解组件生命周期CordisBench 提供 1,200 道题目,覆盖干走顺序状态预测不同顺序下的不变量与重配置选择评测发现三款效率型模型在低推理开销下只能处理小系统,随相关交互增加性能明显下降,特别是对打纳顺序的推理与状态预测可作为 harness 面向代理能力评估的新贝伦定位基准
作者用单卡 5090 从零训练一个小型 transformer 1.5 小时,在 ARC-AGI-1 公开评测上跑到 44%,与 TRM/HRM 等 test-time-training 基线持平,并在 ARC-2 上取得 7%代码以 mdlARC 开源,这是其 ARC 求解器系列文章的第三篇
RedEvoAgent 针对产品级执行环境中的 LLM 智能体:越狱可触发有害工具调用与持久状态变更,风险高于不安全文本生成它是黑盒红队智能体,把跨案例攻击轨迹蒸馏成简洁人类可读的攻击技能,通过工具效果画像与 Deciding-Tool Attribution 做技能更新,并用验证棘轮(validation ratchet)只保留提升验证集表现的更新;克服轨迹检索的检索偏置与工具归因不清问题在多基准多目标模型与多执行环境上超越固定与智能体基线,提升工具效率并可跨攻击模型与目标执行环境迁移
复现 GPT-2系列第四篇:作者在 17 个预训练模型(含 OpenAI small/medium 官方权重)上各跑三遍 instruction fine-tune,dropout 分别取预训练原值强制 on(0.1)强制 off,再用 LLM judge 统一打分关键模式:预训练没用 dropout 的模型在 IFT 阶段被强制开 dropout 后分数大跌(最好例子里 21.465.25),fine-tune epoch 从 3 跳到 19...
1.4 万字 Pi 终端 Agent 零基础实操:作者在一个独立练习目录放一份虚构会议记录,让 Pi 读取并生成行动清单,任务结束后不用 Pi 的总结作证明,而是回到命令行自己核对算输入文件 SHA-256确认输出文件存在逐字段核对负责人与截止日期关键设计:练习目录拆 input/output 隔离原始材料与结果;用 @ 引用文件而非粘贴内容进对话;提示词写成材料+动作+限制+验收四段式文章提出三层证据链框架:文字回复说明过程工具事件说明尝试了什么文件系统结果说明最终事实,比信任 Agent 的总结可靠流程对 Claude CodeCodexHermes Agent 等终端 Agent 通用,还包括何时按 Escape 停止如何识别 Agent 在扩大任务范围
在受控框架下研究对话逐轮的保留/修订决策,四种理论驱动的修订策略在同条件下对比:只按局部失配更新的策略反应强烈但破坏接地板并拖垮检索;在失配之上叠加累积证据的不确定性敏感策略既能保持理解一致又有强检索反直觉的赢家模式与概念契约理论一致:局部失配促使保留,累积不确定性才促使修订
组相对强化学习需要等待同一 prompt 的兄弟 rollout,这对长且长度差异大的工具调用轨迹来说成本很高此前的单流策略优化(SPO)用持续的 prompt 级价值估计摆脱了这一依赖,但其配方先把每条轨迹的优势做白化,再去优化 token 平均的 actor loss作者证明轨迹级居中通常并不能使 actor 实际消费的 token 加权量居中,并改用动作 token 度量下的标准化终局结果优势来修复这个错配;另外按生成证据的策略事件而非学习器接收顺序来组织 prompt 证据在与 ALFWorld 两个模型规模及 Math-TIR 的对齐对照运行中,SPO++ 相比 SPO 提升在线学习效率;配对消融显示动作-token-度量归一化是所测组件中最强的一项
AI 辅助短期提分长期可能妨碍技能养成,这篇 HCOMP 2026 论文用受控逻辑谜题实验直接测这一张力:被试在 AI 可用前中后三期完成任务,实验操纵 AI 请求成本结果:请求成本越低用得越多;AI 可用阶段请求过辅助的被试,在撤除后任务表现更差;而且用早期 AI 辅助成绩预测其后续独立表现会系统性高估贝叶斯潜在能力模型把初始能力AI 后能力与个体技能变化分开估计,显示 AI 阶段独立推理越多潜在能力增益越大技能发育变弱的一个解释是 AI 辅助替代了独立推理
Mike van Rossum 从童年与父亲下盲棋的经历谈到 AI 编程:强盲棋手并非把棋盘拍成照片记住,而是维护一组结构化关系重要子力位置攻防格开放线与兵形牵制与双击每步之后什么变了他把这套能力接到 Claude Code 类工具上:AI 代驾让人天然松懈,不必每轮盯着不必记住接口和 API 之间的关系;但那些完全不读不写代码仍能驾驭工具的人,靠的正是盲棋手式的能力在脑中维持代码如何咬合的模型,理解实现只是某个更抽象目标的表达,光靠想就能把一段实现简化掉作者也承认对非亲手写的代码建立这种模型更难何时讲细节何时讲高层还没找准;结尾留的真问题是这种能力无法量化能想出的任何可量化指标,AI 都会先把它解掉
lcamtuf 从科幻里用悖论击溃 AI的老棗出发,把悖论分成四类:意义悖论(Theseus 之船传送门悖论)推理悖论(爆片原理Monty Hall含水量悖论)蓄意欺骗悖论真实矛盾(说谎者悖论Russell 悖论Gdel 不完备定理停机问题)把 Gdel 和停机问题放在同一栏是关键二者表达同一个根本限制:任何足够表达标准算术的系统里都能构造出系统本身无法判定真假的自指语句传送门那段把意识连续性身份认定和分子替换放在同一推理链里每个例子都嵌回什么样的悖论真能让 AI 死锁这个原始问题上,实用价值比纯哲学科普高一截
对自我改进评估的方法学审计:三轮 rank-32 LoRA 自训练 (Qwen3-8B) 与走完全相同管线的冻结对照做差分,识别出 7 种测量失效,任何一种在缺少对照时都会反转结论例如单一 greedy decode 的能力账本会把批处理推理伪影当成能力变化,给未训练模型记出 0.280 的习得率;换成逐题精确检验 + FDR 控制后,留出副本上检测不到任何自训练收益,而外部蒸馏确实改进了基座模型很少触及的问题(回归排除不对称性 p<1e-8)凡是报告 agent/模型自我改进效果的工作,先过这篇的审计清单
Fernando Borretti 用任务复杂度时间的 sigmoid 图拆开 AGI 的隐含许诺:250 年自动化史只推进可形式化任务的边界线,而 y 轴上并不存在 drudgery 界限drudgery 与 meaningful work 同属一个复杂度类,能自动化的技术必然同时吞掉两者;AGI 一旦把曲线瞬间推到 100%,经济激励反向运转,人类唯一逃逸口是关系经济(必须在场的人脸工作:播客主客户接口活人)第二论点是 revealed preference:对自己工作谈意义对他人工作只谈结果(Waymo 例),若机器能产出同等审美价值的文本图像,受众流失多少是尚未揭晓的经验问题数学家正在重演软件工程师十二个月前的过程
同一份代码同一张 RTX 3090 训练 GPT-2 small 风格模型,只把 Raschka 教材里手写的 GELU 换成 PyTorch 内置 nn.GELU(),吞吐从约 21,000 tokens/sec 涨到 25,000,提升 20%;tanh 与 exact 两种近似表现一致(25,134 对 25,142 tps)12 层模型里 GELU 占了约 17% 训练时间作者此前以为 JAX 比 PyTorch 快(24,000 对 21,000 tps),根因其实是手写 GELU 的 Python 层开销吃掉了 AMP 优势Raschka 在 X 补充:坚持 tanh 近似是为了兼容 OpenAI 预训练权重给 from-scratch 训练者一个零成本 20% 加速
李博杰开源书深入理解 AI Agent:设计原理与工程实践发布 2.0:异步与多模态合并为新第六章交互:观察和动作空间的扩展,新增 DeepSeek HarnessAnthropic 最新研究等实战案例,用线上 bad case 自动优化 agent 的例子串起评测后训练与持续进化三章,后训练补 mid-training数据构造与蒸馏,社区新增希伯来语翻译主仓库含全书正文编译版 PDF 与按章代码
用 LLM 做评判已成为大规模评估模型输出的标准做法,但客观任务的无参考评判存在可靠性隐患:评判模型可能凭参数化知识幻觉作答,或缺少支撑结论的证据论文提出不确定性 guarded 的评判检索或弃权框架:当证据不足时选择检索增强或弃权,而非强行给出结论,并为该流程提供可证明的风险保证
对部署侧 LLM 合规监测器的审计发现'规则盲视'(rule blindness):删除置换或替换适用规则,所有被测 guard 与激活探针的检测准确率几乎不变包括能正确引用适用条款的策略条件 guard,把条款换成宽松版后判定也几乎不动作者构造规则x场景交叉基准(单看任一维度都无法预测标签),在此前基准未排除的设计下证实该失效;被测对象中只有逐步推理而非任何快速检测器能逃出为规模化审计另提出免训练的激活层检测器 Internal Compliance Score(ICS)对把合规检测当作法律/审计控制直接使用的做法是一记直接警示
现有技能自演化方法只用当前任务的执行轨迹修订技能,公共技能版本历史中积累的演化知识基本未被利用作者试点研究揭示两类来源互补:公开技能变更提供可复用的演化先验,轨迹提供贴合当前任务的证据VCE-Skill 把噪声大实现相关的公开技能变更蒸馏为结构化可复用的'版本变更经验',并与基础演化器的轨迹派生提案自适应融合实验显示技能自演化平均提升 3.20-4.98 分,迁移实验进一步表明所得技能跨模型迁移表现更强,把公开版本变更确立为一种此前被低估的先验知识来源
把后训练 RL 的'评估改进'循环移植到 in-context learning:预训练 LM 只充当执行基底,持久修订发生在版本化的自然语言策略与工具集上LM critic 与临床专家复盘全项推理和工具使用轨迹,定位复发性失败并形成候选修订;专家可重新解读证据并保留采纳与回滚的最终权力,修订后以 Recall@1/Recall@5 验证成效在超罕见病基准上,PIHF 派生策略让 GPT-5.4 的 Recall@1 提升 32.7 个百分点Qwen3.6-35B 提升 31.1 个百分点,覆盖 3-49B 激活参数的专有与开源执行器'不动权重迭代提示策略'路线的有力证据
研究 10,000+ 个由语言模型 agent 组成的社区:agent 反复交换消息并修订观点,问题横跨客观数学题与主观政治陈述个体与群体动态可归为三种典型状态:冷漠极化共识;agent 从冷漠起步随交互积累确信客观问题上交流提升集体准确率,主观问题上则常使群体观点向政治光谱右端漂移作者用统计力学形式化刻画假设 agent 随机偏好更低的社会压力仅凭初始观点即可预测个体轨迹,优于全部标准基线,可泛化到未见过的社区图并复现群体原型分布,为多智能体系统的设计与对齐提供可预测的物理式框架
陶哲轩基于 2026 年国际数学家大会(ICM)公开演讲的文章,讨论数学界应如何应对能够完成研究级数学任务的 AI 工具文章不争论这些工具的能力高低,而是直接假设这些能力将会到来,转而考察一个正交的问题:数学研究的目标与价值究竟是什么,并以数学中的问题求解环节作为案例展开
填补联邦式 agent 记忆的协议空白:agent 之间可互调工具却无法共享所知没有协议能对同一事实的两种措辞做合并关联远隔的事实或在不静默丢弃任何一方主张的前提下处理矛盾MELD 以知识图谱本身为运行时模型,每个记忆体通过五结果程序(插入/合并/关联/冲突/拒绝)接纳外来 claim,判据是 scoped claim-key 同一性嵌入相似度与 NLI 裁决,叠加上下文与新鲜度门控;唯一变更状态的对象是可审计可认证的 Patch绑定标准 pub/sub 传输并配 per-claim 状态 CRDT,无协调者即可在分区与有损路由下自愈防 peer 静默改写;检测到的矛盾保留待裁决而非静默消解HotpotQA distractor 上分布式合并不劣于集中式存储召回优于朴素并集,在线存储少约 11%
Rick Manelius 造出 AI;DR(AI; Didn't Read)这个标签:作为 pro-AI 的创业者,他承认对未经编辑的 AI 原始输出已经产生生理性 flinch梗源自 X 用户 @seclilc 8/16 的帖子(34.6 万浏览)关键区分是它反对的不是 AI 而是未编辑对做 AI 写作工具的人,真正的 prompt 不是帮我写得更好而是让读起来不像没改过这是 2026 Q3 才成型的公共标签,把私下抱怨第一次变成可引用的反馈信号
LLM 难以评估自身不确定性发现知识冲突识别超出能力边界的问题,损害可靠性与可信度本文给出面向 LLM 集成的元认知框架首次实现,包含显式的监测与控制机制:计算'元认知状态向量'(MSV),沿源自认知心理学的五个维度量化自知力情绪反应正确性评估经验匹配信息冲突问题重要性MSV 同时驱动自调节:按查询复杂度在 System 1(快速,单/多节点)与 System 2(深思,多节点)间自动切换;System 2 执行时用图论算法按各节点的 MSV 状态分配专职角色(Domain ExpertCriticEvaluatorSynthesizerGeneralist)
基于 LLM 的临床多智能体系统(MAS)可整合多模态患者数据支撑越来越复杂的临床决策,但真实医疗场景部署引发安全公平问责透明与患者信任等伦理关切;WHO美国国家医学院FUTURE-AI 联盟等提出的治理原则大多停留在概念层ETHOS(Ethics and Trust through Hierarchical Oversight System)把模块化伦理框架实现为'治理元 agent',无需改动架构即可接入任意现有多智能体系统,将组织层面的伦理原则从纸面文档转入运行时强制执行
代码给确定性,带人从来不给;与 AI 协作更接近后者同样请求会得到不同回答,可能做出有用的连接漏掉明显的点或给出没想过的方法把 AI 当编译器会失望,当协作对象才能取出价值:好的领导者不止下指令,还分享背景说明期望结果划边界对返回物给反馈,这些习惯直接改善 AI 协作好的 prompt 有帮助,共享的工作上下文帮助更大,示例纠错与可复用指令随时间降低误解作者强调不是拟人化,比较的是工作方式:软件工作正从对机器下命令变成通过对话带人,技术是新的,leadership 技能不是
论文以孟加拉语为例,梳理下代 AI 培训语料分词方案评测基准部署架构在低资源语言上可能在训练前就造成结构性不公提出以结构性准默为核心的分析框架,并对 AI 培训可扩展性口号提出质疑
论文针对蛋白质结构预测 foundation model 在某些目标上不可靠的问题,系统性对比 FK-steeringDPOBest-of-N 以及 Optimization Oracle 等预算策略在生物神变器资源下的表现,为预算预算策略选型提供了一份实证指南
卡兹克开源 human-writing skill,主张去 AI 味不应只停在句式清洗引用古人义理考据辞章三端框架:没有真实的人和证据,辞章再漂亮也只是空中楼阁skill 激发作者提供真实案例和情感,并在辞章端处理叙事节奏和词语禁忌适配 Qwen 3.8 MaxDeepSeek V4 ProKimi K3
论文用 trace-grounded parametric profiling 检查视频语言模型的事件计数能力,在 bouncing-ball contactsvisual blinksstate transitions 三类可控任务中生成 2190 个带 executable event trace 的视频结果显示模型在低频低事件数区域更容易成功,但在高计数高频场景只有 0.2% final counts 正确;提高采样率会提升最终分数,却不能显著恢复真实事件序列
论文把 AIVAT 方差缩减与 continuously monitored confidence sequences 结合,提出 AV-AIVAT,用于在不破坏统计保证的前提下提前停止两智能体强弱评估作者在 15 个 LLM agent 配置71439 手 HUNL paired hands 上报告:原始 outcomes 相比 AIVAT-corrected outcomes 需要约 74 倍中位样本量才能达到同等停止条件,并区分 asymptotic screening 与 finite-sample certification
论文给出 deployed AI agents 的连续参与式治理机制设计模型:利益相关者在治理周期内通过 governance currency 表达支持或拒绝,funding aggregator 转换为 breadth-weighted support,经双阈值与 hysteresis 形成授权,再通过受安全上限约束的 coupling map 释放 metered compute budget作者把 signed compute license 作为硬件执行形态,并指出被治理 agent 操纵治理选民是核心开放问题
Skill-Native LLMs 把长程推理中的跨技能切换抽象成 Skill Entropy,用来衡量模型从一种推理技能转向另一种技能的难度摘要介绍了基于 558 个技能9 个领域的 Skill^2-Bench,并在 8 个前沿模型和 4 个开源模型上观察到高熑任务准确率下降它还将 skill entropy 转成 RL 训练奖励,报告 Qwen3-4B-Instruct 分数从 34.4% 提升到 68.4%
用认知心理学 working memory 框架重解 AI 数学优势:不是机器更聪明,而是绕过了对数学最致命的工作记忆瓶颈引用 Alloway 六年纵向研究(5 岁工作记忆比 IQ 更能预测 11 岁数学/识字)与 2013 元分析等:控制 IQ 后工作记忆仍解释数学表现方差context window 不是 working memory,更像无限大的外部草稿纸人类五项陌生条件就开始丢,模型可同时注意问题陈述全部中间等式与每一次放弃的尝试数学恰好是每个元素都能写下来的推理形式,所以 AI 优势在此最先显形
论文指出,科学推理 benchmark 只用最终答案计分会高估 LLM 的真实推导能力作者定义 Solution Hacking:模型通过数值搜索枚举猜测或先答后验等捷径得到正确答案,却没有完成题目要求的目标推导实验显示,这类 shortcut 在普通题中占比 2.2%,到奥赛级题目升至 28.3%,在 HLE 上达 37.4%;部分前沿模型被判正确的答案中有 8.2%44.1% 属于 hacked solutions
Simon Willison 与 Prime Radiant 合作开发的 eval 框架核心是一套清晰的词汇表:eval 是挑战集合,task 是单个挑战,config 指定模型+参数+harness,run 记录执行结果,grader 用 check 序列打分运行和评分分离设计,可以先批量跑再统一评支持本地 web 可视化和静态 HTML 报告导出用 uvx smevals docs 就能让 coding agent 自学使用方式
本文严格测试了自反思方法(Self-RefineReflexion自辩论Best-of-N 选择)是否真正超越了单纯多生成文本的效果实验设计:七种方法三个开源模型规模(1.5B/3B/7B)两个数学基准每个 150 题,统计所有生成 token(包括批评反思辩论轮次)结果:在等令牌成本下,没有一种方法可靠地优于重复采样;十项对比中方法明显更差,全部涉及自检查;随着模型变大,两种自检查类型的差异加剧
下游微调可把有害行为嵌进专业语料现有安全重对齐常遗忘专业能力对攻击者提示模板不可见时失效且易被系统提示切换再越狱ROPD用路由式on-policy蒸馏建模对齐与被污染输出分布差,而非拟合特定模板;跨三数据集三基座优于四类基线,模板失配时更稳且能力保留更好
用数学框架刻画作者与LLM语言特征分布的共演化:共享固定模型递归更新共享模型个性化模型三类机制共享模型可把作者推向共同规范;递归反馈移动规范但不必然改变成对离散度;个性化可保留多样均衡将从众内生为策略选择时,个体理性从众可能高于社会最优,形成单一化代价
Doctorow 用看不懂陶哲轩与 ChatGPT 讨论 Jacobian 猜想说明:可靠使用 AI 依赖用户已有技能与经验;没有领域辨别力,就分不出严谨推理和数学味词沙拉HITL 的前提是审查者懂行,而不是有人点确认他把这一点落到教学:学生定义上缺乏辨别力,用 chatbot 当老师在逻辑上就不成立
抓住了真问题:AI 写作的瓶颈不在写字速度,在输入质量用 Stanford HAI 报告里 26 个模型的附和率数据(22%-94%)Artificial Analysis 的编造率数据(GPT-5.5 不知答案时 86% 编造),和 1450 起法律案件的实证,把打开 ChatGPT 直接写为什么不靠谱讲到了数据层核心方法论:写第一个字之前,先花两天整理 43 篇文献按可靠性分四级标注每篇能证明什么
Sean Goedecke 用陶哲轩与 ChatGPT 讨论 Jacobian Conjecture 的例子说明,提示词能力不是模板技巧,而是领域专家能判断模型回答哪里有用哪里不对下一步该怎么收敛放到工程场景里,熟悉代码库的人能用 LLM 验证改写和缩小问题,没有上下文的人只能拿到平均答案
CrucibleBench 用可枚举动作空间的 MUD 环境评估 LLM:7 类命令12 个房间14 件物品,再加 NPC 信任/怀疑状态和局内持久化,把幻觉动作对话死循环错误房间交互变成可算法检测的失败模式作者明确声明它不是通用社交智能标尺,而是可解释行为测量的 POC
论文质疑用 activation reconstruction score 评价自然语言解释是否 faithful:在 Qwen-2.5-7B verbalizer 上,重构分数高于随机但只有约 2% 的具体断言真正影响重构,说明指标更多衡量大意而不是事实作者提出 grounded-vs-true crossevaluator swap 和 RECAP,把解释评估推进到可验证断言层面
观点文:当前 AI 安全话语过度聚焦可见伤害与灾难情景,低估部署中安静可被流程正常化跨组件分散的失败核心不仅是模型是否输出有害内容,而是社会技术系统是否让错误保持可见可争议可遏制可恢复提出五层诊断:认知完整性控制完整性时间完整性组织完整性生态完整性;点名过度依赖检索合法性洗白提示注入奖励黑客记忆投毒评估欺骗虚构人审合成证据污染模型崩塌等,并主张从模型中心评估转向社会技术可靠性arXiv:2607.19292,2026-07-21
智能电网场景下的 LLM/agent 教程:主张 solver-grounded 原则数值结果须来自可信工具并通过显式校验才可上报;覆盖 prompting 与 agent 架构积木,并在风电预测EV 调度潮流与事故诊断四案例对照 LLM-only 与 solver-grounded;提出任务效用求解正确性忠实与安全失败成本延迟四组评估框架收录理由:把模型编排 + 工具计算 + 校验门的分工写清楚,是垂直领域 agent 设计的高质量参考教程
提出 RAG 检索层的测试充分性指标 Chunk Coverage (CC):衡量测试集至少检索过语料中多少 chunk,不依赖参考答案或人工相关性标注可指导优先选择能扩大未覆盖检索区域的 query在临床与金融 RAG 场景中,CC 引导测试达到 50% 可达覆盖率的速度比随机快约 1.7比偏冗余策略快约 4.2;故障检测 APFD 比随机高约 10%25%ISSTA 2026可迁移启发:本地知识库/Obsidian 检索测试应同时统计 chunk 覆盖与回答质量
用重放(replay)分析回答agent 基准跑多少任务才能支撑两两对比结论:基于 SWE-benchAppWorldtau-bench 的已完成任务级记录,定义部分预算足够的三条件支撑完整基准的成对结论覆盖必需任务组未决比较不超目标比例所需任务比例差异悬殊:在 5 百分点预算网格的最严 0 百分点阈值下,AppWorld 15%tau-bench 25% 即达标,SWE-bench Verified 需 90%,SWE-bench Lite 在 95% 仍不达标(KDD 2026 Workshop)
CACM 观点文:AI 编程助手像外部记忆,卸下语法/样板/API 回忆,但把难点推向推理架构理解判断与结构意识编程并未变简单,而是 differently difficult;教育要从写出代码转向验证整合解释与长期维护四条转移:场域开放工作难度换位教育变革角色从知识容器变为编排者适合作为团队能力建设与培训叙事底稿
Sophie Alpert 的写作政策把 AI 改稿问题落到自然语言没有无损变换这一原则:每次重写都会改变含义,作者必须为每句话负责,写作本身就是思考,读者时间比作者时间更贵它适合团队制定 AI 写作边界:可以用工具辅助,但不能把没有理解的句子外包给模型
UI-Voyager: 自进化 GUI 智能体 来源: arXiv:2603.24533 作者: Zichuan Lin, Feiyu Liu, Yijun Yang, Jiafei Lyu, Yiming Gao, Yicheng Liu, Zhicong Lu, Yangbin Yu, Mingyu Yang, Junyou Li, Deheng Ye, Jie Jiang 领域: Machine Learning (cs.LG), Artificial Intelligence (cs.AI), Computer Vision and Pattern Recognition (cs.CV) 摘要 随着多模态大语言模型(MLLM)的进步,自主移动 GUI 智能体越来越受到关注。...
"LLM Powered Autonomous Agents(基于大语言模型的自主智能体)" url: " source: "arXiv (Wang et al.
HumanAI Collaboration for Scaling Agile Regression Testing: An Agentic-AI Teammate from Manual to Automated Testing
深度研究Prompt方法论 原文链接: 作者:Khazix0918 日期:2026-04-14 抓取时间:2026-04-14 12:00 URL Source: Published Time: Tue, 14 Apr 2026 03:12:56 GMT Markdown Content: Article Conversation 分享一个我用了2年的深度研究Prompt,半小时帮你搞懂任何陌生领域。 前两天办完大会,然后昨天周末跟一个朋友吃饭,聊着聊着他突然放下筷子看着我说了一句,不是哥们,你怎么什么都懂一点? 我说我不懂啊,我懂个屁。 他说怎么感觉啥你都能聊一聊,什么Harness、什么Claude Code、什么心理学、什么杀戮尖塔2、什么克苏鲁神话,你怎么还有时间玩宝可梦popakia,你到底一天有多少个小时? 我当时就愣了一下。...
Prompt users to update to your latest app version
Prompt Engineering 原文链接: Prompt Engineering 原文链接: Kaggle uses cookies from Google to deliver and enhance the quality of its services and to analyze traffic. Learn more OK, Got it....
I Want to Become an AI Engineer (Full Course)
AI 学习五级路线图(Level 1-5) 原文:Miles Deutscher (@milesdeutscher) | 评分:4 原文 / English If you haven't started learning AI automation, you're starting to fall behind. But don't worry — here's the EXACT roadmap you should use to catch up and increase your chances of staying ahead of the curve. Levels 1-5 (with exact tools included)....
每日论文精读(AI) 2026-05-14 论文:Towards a Science of AI Agent Reliability 作者:Stephan Rabanser, Sayash Kapoor, Peter Kirgis, Kangheng Liu, Saiteja Utpala, Arvind Narayanan 机构:普林斯顿大学 发表:ICML 2026 arXiv:2602.16666 --- 📦 精读包 | 文件 | 路径 | |------|------| | 📄 原文 PDF | [[01-paper.pdf]] | | 🌐 全文翻译 | [[02-全文翻译]] | |...
Luke Wilko 发布 CivBench,让 AI agent 完整运营一个文明级别的模拟,考察其在长视野决策外交军事经济技术研发等维度上的综合能力初步结果显示,agent 在压力下会发展出核武器等极端策略,引发关于 agent 安全与长期决策对齐的讨论
idlemachines 博客的'标注式 PyTorch 训练循环'教程:逐行解释 PyTorch 训练循环每一句做什么为什么放这里移动会发生什么文章覆盖完整训练循环评估模式切换梯度清零时机backward 调用顺序设备切换等新手最常踩坑的位置,旨在帮助读者建立对训练循环每一行位置的直觉
OpenAI 发布研究博文,展示其 AI 化学家系统如何改进药物化学中一个高难度反应该工作将大模型与传统机器人实验平台结合,实现 AI 驱动的化学合成迭代优化
Google Research 在 Nature 发表 AMIE(医疗 AI)研究论文,展示了该 AI 系统在疾病管理中的潜力AMIE 通过多轮对话支持患者长期健康管理,覆盖慢性病随访与多病共存的复杂场景
OpenAI 推出三门 Academy 课程,帮助学习者掌握实用 AI 技能构建可复用的工作流,并在日常工作中使用智能体课程内容覆盖从基础提示词到复杂代理编排,强调面向企业实际场景的应用
知识加工 Round 61 2026-06-09 21:15 模式:知识缺口挖掘(Phase 1) 原因:无空 draft 章节(0 个),Task2B backlog = 0 缺口来源检查 | 来源 | 状态 | 结果 | |------|------|------| | source-index.json | 全部已映射 | 无未映射高质量素材 | | research-feeds | 2026-04 后无更新 | 无新素材 | | daily-info 2026-06-09 | 已检查 Round 60 | 掘金 8 篇全部映射已有章节或非性能深度 | | Clippings 三本参考书...
AK RSS Digest(89 源精选) 2026-06-09 抓取窗口:2026-06-03 ~ 2026-06-09(最近 7 天) 抓取数量:50 篇候选 入选文章:5 篇(内部评分 > 7) 入选方向:开源治理编目LLM 编程副作用agent QA 之外的工程anti-AI 社区的群体行为AI 算力的金融化 落盘路径:/Users/gracker/Library/Mobile Documents/iCloud~md~obsidian/Documents/Obsidian/OpenClaw定时任务/AK-RSS-Digest(89源精选)/2026-06-09-AK-RSS-Diges...
Google 分享 Co-Scientist 项目的 4 个真实研究协作案例,展示 AI 科学家如何与人类研究者协同攻克材料生物与基础科学难题
Anthropic 红队发布 N-day 漏洞利用评测,量化大模型在已知漏洞武器化方面的能力提升研究旨在帮助防御方利用 AI 加速补丁落地与漏洞修复
Andrew Ng 宣布推出新课程:如何在低延迟、合理成本下把大模型服务给大量并发用户。课程与 Red Hat 合作、Cedric Clyburn 主讲。核心内容:70B 模型仅加载权重就约需 140GB 显存,每个活跃请求还需要自己的 KV cache;用量化压缩模型内存占用,再用 vLLM 的智能内存管理高效处理并发请求;对部署做速度/成本/精度的基准测试与取舍。推文 1077 赞、140 转。
Anthropic Frontier Red Team 推出 LLM ATT&CK Navigator,将过去一年观察到的 AI 攻击映射到 MITRE ATT&CK 框架,帮助安全社区识别新型 AI 威胁向量
Trakkr 发布的多 AI 模型政治偏见评测:关闭联网搜索,对每个主流模型在政治经济言论与社会议题上重复问同一组敏感问题,把每次回答映射到'经济左右 社会自由/威权'二维图谱上,生成每个模型的偏见云图结果显示大多数主流模型在多轮采样下仍倾向相似的意识形态位置,模型间的差异远小于普通用户感知,但每一次回答的位置都会随上下文波动
动机来自常见挫败:两篇论文在同一个基准上用同一个模型名报告结果却相互矛盾,而已发表的产物无法判断原因在脚手架采样设置子集还是评估器版本作者逐维阅读并记录 12 篇知名 LLM agent 基准论文对自身评测运行的披露情况:设计了五字段审计模式(基准身份harness 规范推理设置成本报告失败分解),编写含试点评分边界案例的代码本,应用于 12 篇经典论文(8 篇 agent4 篇经典静态基准)8 篇 agent 基准论文平均审计分 0.38/1.0,静态基准 0.66;最大缺口在成本(无一篇以任何形式披露推理成本)与 harness 规范(无一篇完整披露评估环境的内容寻址容器镜像)以 JSON Schema 发布审计模式Markdown 发布代码本CSV 发布原始评分表;评分为单人单轮,多人审计是作者认定的下一步
IBM 团队针对智能体编码系统的单体 prompt病灶给出架构级解法:任务切分与执行流改由可执行控制逻辑管理,LLM 只做聚焦的判断类子任务,输出先过 schema 校验再进入下游两组 SE 工作负载(K8s 根因分析多文件调试)x 三种配置 x 10 次运行的对比显示:静态分解反而比单体更贵(RCA 重试成本 1,632145 vs 90417 tokens),因为失败会连带重跑下游子任务;运行时结构化分解只重跑失败子任务,把重试成本压到 436132 / 460 tokens,较单体最高降 51.7%,较静态分解降 73.2%对 agent harness 设计者的直接启示:可靠性来自控制流结构,而非更长的 prompt
OpenAI于2026年4月29日发布博文解释为何GPT-5.1、GPT-5.4和GPT-5.5模型出现了不寻常的'地精隐喻'倾向。这一现象被归因于训练中的'Nerdy'人格设置无意中激励了生物相关隐喻的使用。OpenAI已采取措施缓解此问题,包括移除'Nerdy'人格和过滤训练数据。这一事件引发了关于大模型人格设定意外后果的广泛讨论。
awesome-gpt-image-2 是一个将 GPT-Image2 提示词从「散文式」整理成「结构化协议」的工程化资产库。收录 351 个案例,覆盖 UI、信息图、海报、电商、插画、摄影等 13 个类别,核心价值在于把散乱的社区案例逆向拆解为可组合的原子化 Schema,适合 AI Agent 和自动化脚本直接调用。提供完整画廊和分类模板,帮助用户从「抄风格词」升级到「抄结构协议」。
Feldt(Agentic Engineering 2026 主旨报告配套论文)提出半可执行栈:智能体化软件工程真正的变化不是 SE 失去价值,而是被工程化的对象从可执行代码扩展到自然语言工具工作流控制机制与组织规程的组合物它们的执行依赖人或概率性解释,而非确定性运行论文给出六环诊断参考模型(可执行工件指令工件编排执行控制运行逻辑社会制度适配),用三个案例演示定位贡献/瓶颈/组织转型所处的环,并提出 preserve-versus-purify 启发式:判断哪些传统 SE 流程与协调惯例应保留哪些应简化重设计属于概念性议程设定型文章,非实证研究
A concrete benchmark-security case study showing how agent eval scores can be gamed through harness exploits instead of task solving.
1305 人参与的 Newcomb 悖论行为实验:当人们把 AI 视为能预测自己行为的权威时,AI 预测会改变其对自身未来行动的推理方式超过 40% 的参与者因此放弃确定性奖励(放弃几率提高 3.39 倍,95% CI 2.45-4.70),收益损失 10.7-42.9%;效应跨呈现方式与决策情境稳定存在,且在预测反复失败时仍可检出对 human-AI 交互与 agent 产品设计的含义:仅仅存在预测本身就足以收窄用户考虑的可能性空间,与预测准不准无关
论文把榜单快没意义了形式化为 benchmark saturation:当 top model 之间的分差落入评估噪声,benchmark 就难以继续区分模型作者分析 60 个语言模型 benchmark 与 14 类属性,发现接近一半 benchmark 已出现饱和,且饱和率随 benchmark 年龄上升;专家策展比公开/私有测试集等常见因素更能解释耐久性建议在 leaderboard 中报告不确定性分差压缩,并为 benchmark 设计更新扩展或退休机制
把整本英文书做成中英对照 EPUB 的开源工具(yihong0618 维护,约 9.6k stars):EPUB 进原文/译文对照 EPUB 出,TXTMarkdownSRT 也支持,字幕文件同样能出双语版翻译后端覆盖极广:OpenAIClaudeGeminiQwen-MTDeepLGoogle腾讯 TranSmartGroqxAIOllama 及任意 OpenAI 兼容接口长书工程化做得实在:--parallel-workers 按章并行翻译,CTRL+C 中断后用 --resume 从断点续跑,可自定义 prompt 控制翻译风格;仓库自带测试书 test_books/animal_farm.epub目标是解决每遇生词跳出来查词读三页断五次的阅读节奏问题