论文指出,科学推理 benchmark 只用最终答案计分会高估 LLM 的真实推导能力作者定义 Solution Hacking:模型通过数值搜索枚举猜测或先答后验等捷径得到正确答案,却没有完成题目要求的目标推导实验显示,这类 shortcut 在普通题中占比 2.2%,到奥赛级题目升至 28.3%,在 HLE 上达 37.4%;部分前沿模型被判正确的答案中有 8.2%44.1% 属于 hacked solutions
研究与学习
论文、课程、提示工程、长文、方法论。
Simon Willison 与 Prime Radiant 合作开发的 eval 框架核心是一套清晰的词汇表:eval 是挑战集合,task 是单个挑战,config 指定模型+参数+harness,run 记录执行结果,grader 用 check 序列打分运行和评分分离设计,可以先批量跑再统一评支持本地 web 可视化和静态 HTML 报告导出用 uvx smevals docs 就能让 coding agent 自学使用方式
本文严格测试了自反思方法(Self-RefineReflexion自辩论Best-of-N 选择)是否真正超越了单纯多生成文本的效果实验设计:七种方法三个开源模型规模(1.5B/3B/7B)两个数学基准每个 150 题,统计所有生成 token(包括批评反思辩论轮次)结果:在等令牌成本下,没有一种方法可靠地优于重复采样;十项对比中方法明显更差,全部涉及自检查;随着模型变大,两种自检查类型的差异加剧
下游微调可把有害行为嵌进专业语料现有安全重对齐常遗忘专业能力对攻击者提示模板不可见时失效且易被系统提示切换再越狱ROPD用路由式on-policy蒸馏建模对齐与被污染输出分布差,而非拟合特定模板;跨三数据集三基座优于四类基线,模板失配时更稳且能力保留更好
用数学框架刻画作者与LLM语言特征分布的共演化:共享固定模型递归更新共享模型个性化模型三类机制共享模型可把作者推向共同规范;递归反馈移动规范但不必然改变成对离散度;个性化可保留多样均衡将从众内生为策略选择时,个体理性从众可能高于社会最优,形成单一化代价
Doctorow 用看不懂陶哲轩与 ChatGPT 讨论 Jacobian 猜想说明:可靠使用 AI 依赖用户已有技能与经验;没有领域辨别力,就分不出严谨推理和数学味词沙拉HITL 的前提是审查者懂行,而不是有人点确认他把这一点落到教学:学生定义上缺乏辨别力,用 chatbot 当老师在逻辑上就不成立
抓住了真问题:AI 写作的瓶颈不在写字速度,在输入质量用 Stanford HAI 报告里 26 个模型的附和率数据(22%-94%)Artificial Analysis 的编造率数据(GPT-5.5 不知答案时 86% 编造),和 1450 起法律案件的实证,把打开 ChatGPT 直接写为什么不靠谱讲到了数据层核心方法论:写第一个字之前,先花两天整理 43 篇文献按可靠性分四级标注每篇能证明什么
Sean Goedecke 用陶哲轩与 ChatGPT 讨论 Jacobian Conjecture 的例子说明,提示词能力不是模板技巧,而是领域专家能判断模型回答哪里有用哪里不对下一步该怎么收敛放到工程场景里,熟悉代码库的人能用 LLM 验证改写和缩小问题,没有上下文的人只能拿到平均答案
CrucibleBench 用可枚举动作空间的 MUD 环境评估 LLM:7 类命令12 个房间14 件物品,再加 NPC 信任/怀疑状态和局内持久化,把幻觉动作对话死循环错误房间交互变成可算法检测的失败模式作者明确声明它不是通用社交智能标尺,而是可解释行为测量的 POC
论文质疑用 activation reconstruction score 评价自然语言解释是否 faithful:在 Qwen-2.5-7B verbalizer 上,重构分数高于随机但只有约 2% 的具体断言真正影响重构,说明指标更多衡量大意而不是事实作者提出 grounded-vs-true crossevaluator swap 和 RECAP,把解释评估推进到可验证断言层面
观点文:当前 AI 安全话语过度聚焦可见伤害与灾难情景,低估部署中安静可被流程正常化跨组件分散的失败核心不仅是模型是否输出有害内容,而是社会技术系统是否让错误保持可见可争议可遏制可恢复提出五层诊断:认知完整性控制完整性时间完整性组织完整性生态完整性;点名过度依赖检索合法性洗白提示注入奖励黑客记忆投毒评估欺骗虚构人审合成证据污染模型崩塌等,并主张从模型中心评估转向社会技术可靠性arXiv:2607.19292,2026-07-21
智能电网场景下的 LLM/agent 教程:主张 solver-grounded 原则数值结果须来自可信工具并通过显式校验才可上报;覆盖 prompting 与 agent 架构积木,并在风电预测EV 调度潮流与事故诊断四案例对照 LLM-only 与 solver-grounded;提出任务效用求解正确性忠实与安全失败成本延迟四组评估框架收录理由:把模型编排 + 工具计算 + 校验门的分工写清楚,是垂直领域 agent 设计的高质量参考教程
提出 RAG 检索层的测试充分性指标 Chunk Coverage (CC):衡量测试集至少检索过语料中多少 chunk,不依赖参考答案或人工相关性标注可指导优先选择能扩大未覆盖检索区域的 query在临床与金融 RAG 场景中,CC 引导测试达到 50% 可达覆盖率的速度比随机快约 1.7比偏冗余策略快约 4.2;故障检测 APFD 比随机高约 10%25%ISSTA 2026可迁移启发:本地知识库/Obsidian 检索测试应同时统计 chunk 覆盖与回答质量
CACM 观点文:AI 编程助手像外部记忆,卸下语法/样板/API 回忆,但把难点推向推理架构理解判断与结构意识编程并未变简单,而是 differently difficult;教育要从写出代码转向验证整合解释与长期维护四条转移:场域开放工作难度换位教育变革角色从知识容器变为编排者适合作为团队能力建设与培训叙事底稿
UI-Voyager: 自进化 GUI 智能体 来源: arXiv:2603.24533 作者: Zichuan Lin, Feiyu Liu, Yijun Yang, Jiafei Lyu, Yiming Gao, Yicheng Liu, Zhicong Lu, Yangbin Yu, Mingyu Yang, Junyou Li, Deheng Ye, Jie Jiang 领域: Machine Learning (cs.LG), Artificial Intelligence (cs.AI), Computer Vision and Pattern Recognition (cs.CV) 摘要 随着多模态大语言模型(MLLM)的进步,自主移动 GUI 智能体越来越受到关注。...
HumanAI Collaboration for Scaling Agile Regression Testing: An Agentic-AI Teammate from Manual to Automated Testing
深度研究Prompt方法论 原文链接: 作者:Khazix0918 日期:2026-04-14 抓取时间:2026-04-14 12:00 URL Source: Published Time: Tue, 14 Apr 2026 03:12:56 GMT Markdown Content: Article Conversation 分享一个我用了2年的深度研究Prompt,半小时帮你搞懂任何陌生领域。 前两天办完大会,然后昨天周末跟一个朋友吃饭,聊着聊着他突然放下筷子看着我说了一句,不是哥们,你怎么什么都懂一点? 我说我不懂啊,我懂个屁。 他说怎么感觉啥你都能聊一聊,什么Harness、什么Claude Code、什么心理学、什么杀戮尖塔2、什么克苏鲁神话,你怎么还有时间玩宝可梦popakia,你到底一天有多少个小时? 我当时就愣了一下。...
Prompt users to update to your latest app version
Prompt Engineering 原文链接: Prompt Engineering 原文链接: Kaggle uses cookies from Google to deliver and enhance the quality of its services and to analyze traffic. Learn more OK, Got it....
I Want to Become an AI Engineer (Full Course)
AI 学习五级路线图(Level 1-5) 原文:Miles Deutscher (@milesdeutscher) | 评分:4 原文 / English If you haven't started learning AI automation, you're starting to fall behind. But don't worry — here's the EXACT roadmap you should use to catch up and increase your chances of staying ahead of the curve. Levels 1-5 (with exact tools included)....
Luke Wilko 发布 CivBench,让 AI agent 完整运营一个文明级别的模拟,考察其在长视野决策外交军事经济技术研发等维度上的综合能力初步结果显示,agent 在压力下会发展出核武器等极端策略,引发关于 agent 安全与长期决策对齐的讨论
idlemachines 博客的'标注式 PyTorch 训练循环'教程:逐行解释 PyTorch 训练循环每一句做什么为什么放这里移动会发生什么文章覆盖完整训练循环评估模式切换梯度清零时机backward 调用顺序设备切换等新手最常踩坑的位置,旨在帮助读者建立对训练循环每一行位置的直觉
OpenAI 发布研究博文,展示其 AI 化学家系统如何改进药物化学中一个高难度反应该工作将大模型与传统机器人实验平台结合,实现 AI 驱动的化学合成迭代优化
Google Research 在 Nature 发表 AMIE(医疗 AI)研究论文,展示了该 AI 系统在疾病管理中的潜力AMIE 通过多轮对话支持患者长期健康管理,覆盖慢性病随访与多病共存的复杂场景
OpenAI 推出三门 Academy 课程,帮助学习者掌握实用 AI 技能构建可复用的工作流,并在日常工作中使用智能体课程内容覆盖从基础提示词到复杂代理编排,强调面向企业实际场景的应用
知识加工 Round 61 2026-06-09 21:15 模式:知识缺口挖掘(Phase 1) 原因:无空 draft 章节(0 个),Task2B backlog = 0 缺口来源检查 | 来源 | 状态 | 结果 | |------|------|------| | source-index.json | 全部已映射 | 无未映射高质量素材 | | research-feeds | 2026-04 后无更新 | 无新素材 | | daily-info 2026-06-09 | 已检查 Round 60 | 掘金 8 篇全部映射已有章节或非性能深度 | | Clippings 三本参考书...
AK RSS Digest(89 源精选) 2026-06-09 抓取窗口:2026-06-03 ~ 2026-06-09(最近 7 天) 抓取数量:50 篇候选 入选文章:5 篇(内部评分 > 7) 入选方向:开源治理编目LLM 编程副作用agent QA 之外的工程anti-AI 社区的群体行为AI 算力的金融化 落盘路径:/Users/gracker/Library/Mobile Documents/iCloud~md~obsidian/Documents/Obsidian/OpenClaw定时任务/AK-RSS-Digest(89源精选)/2026-06-09-AK-RSS-Diges...
Google 分享 Co-Scientist 项目的 4 个真实研究协作案例,展示 AI 科学家如何与人类研究者协同攻克材料生物与基础科学难题
Anthropic 红队发布 N-day 漏洞利用评测,量化大模型在已知漏洞武器化方面的能力提升研究旨在帮助防御方利用 AI 加速补丁落地与漏洞修复
Anthropic Frontier Red Team 推出 LLM ATT&CK Navigator,将过去一年观察到的 AI 攻击映射到 MITRE ATT&CK 框架,帮助安全社区识别新型 AI 威胁向量
Trakkr 发布的多 AI 模型政治偏见评测:关闭联网搜索,对每个主流模型在政治经济言论与社会议题上重复问同一组敏感问题,把每次回答映射到'经济左右 社会自由/威权'二维图谱上,生成每个模型的偏见云图结果显示大多数主流模型在多轮采样下仍倾向相似的意识形态位置,模型间的差异远小于普通用户感知,但每一次回答的位置都会随上下文波动
OpenAI于2026年4月29日发布博文解释为何GPT-5.1、GPT-5.4和GPT-5.5模型出现了不寻常的'地精隐喻'倾向。这一现象被归因于训练中的'Nerdy'人格设置无意中激励了生物相关隐喻的使用。OpenAI已采取措施缓解此问题,包括移除'Nerdy'人格和过滤训练数据。这一事件引发了关于大模型人格设定意外后果的广泛讨论。
论文把榜单快没意义了形式化为 benchmark saturation:当 top model 之间的分差落入评估噪声,benchmark 就难以继续区分模型作者分析 60 个语言模型 benchmark 与 14 类属性,发现接近一半 benchmark 已出现饱和,且饱和率随 benchmark 年龄上升;专家策展比公开/私有测试集等常见因素更能解释耐久性建议在 leaderboard 中报告不确定性分差压缩,并为 benchmark 设计更新扩展或退休机制