5 things to try with Gemini 3 Pro in Gemini CLI 在 Gemini CLI 中尝试 Gemini 3 Pro 的 5 种玩法
5 things to try with Gemini 3 Pro in Gemini CLI
5 things to try with Gemini 3 Pro in Gemini CLI 在 Gemini CLI 中尝试 Gemini 3 Pro 的 5 种玩法
继续阅读
ScholarCatalyst:衡量检索能启发新研究的论文这一能力的基准184 位近期 CS 论文的第一/lead 作者(覆盖 207 篇论文)通过自动化流水线标注哪些候选文献实际或可能推进了自己的项目,并给出详细理由;任务设定为在项目开始时点可用的文献范围内,给定初始研究问题检索这些论文结果:agentic search(把同一个 embedding 检索器当工具调用)Recall@20 0.42,反而不如纯 embedding 检索的 0.48;即便是训练数据里可能见过这些已完成论文的 Claude Fable 5.1 agent 也只有 0.51说明科学家式嗅探哪篇前作关键仍是 AI 系统的明显短板2026-10-01 提交,cs.AI/cs.CL/cs.IR
FineWeb 质量过滤后,2026 年 6 月网页 token 中 27.5% 被 Pangram 判为 AI 生成,8 月升至 31.1%作者预训练 800 个语言模型系统改变 AI token 与人类 token 配比并拟合 scaling law:数据饥饿的模型加 AI token 初期降低 human text loss,但很快饱和并反转成伤害;在人类文本高预算下 AI token 几乎立刻抬升 loss,而同量新鲜人类 token 持续降 loss...
Google 发布新一代旗舰模型 Gemini 4 Argon:输出上限从 64K 提到行业领先的 1M token,面向长时程复杂工作流(真实软件工程法律/金融知识工作网络防御)定价 $2/$10 每百万 token,缓存输入享 95% 折扣...
安全公司 Hacktron 三名研究员用 Claude Opus 5 辅助,从 OpenAI 公共帮助论坛(Discourse)的 bug 出发链到 OpenAI 自家登录系统的弱点,接管多名员工账号并进入内部代码仓库,全程不到 72 小时;用一次无害 PR 证明访问后停止OpenAI 约 14 小时确认修复,09-01 给出 $6,500 赏金,但声明奖金只覆盖 OpenAI 侧发现Discourse 论坛测试不在 bounty 范围...