Auto-research with Codex: How I achieved a 232x Faster Kernel over baseline with Codex in GPU Mode's qr_v2 problem
Source: https://sankalp.bearblog.dev/autoresearch
Author: Sankalp
Published: 2026-07-08
Type: blog / contest writeup
Leaderboard: https://www.gpumode.com/leaderboard/774?tab=rankings(12/183, 232x speedup)
中文导读
GPU Mode 与 Core Automation 合办的 auto-research 主题比赛(题目:批量方阵紧凑 Householder QR 分解,即 torch.geqrf 兼容的 (H, tau) 输出),作者以非专业选手身份拿到 12/183、相对 baseline 232 倍加速。这篇复盘的价值不在 CUDA 细节,而在怎么为"会做题的模型"搭一个能持续产生好想法的研究循环(loop engineering)。
比赛要点
- 赛题:批量 FP32 方阵 QR 的紧凑 Householder 表示;正确性由 checker 重建 Q 验证,排名按各形状几何平均运行时。14 天内作者提交超过 1500 次。
- 为什么适合 auto-research:popcorn CLI 让 agent 能直接测试、benchmark、提交;checker 给形状级反馈——紧反馈回路正是 agent 爬山的最爱。
- 架构选择:与 Claude/GPT-5.5 讨论后确定 blocked Householder + trailing WY 更新作为主架构,把串行依赖"变 GEMM 形"。
逃出局部最优的策略(最有复用价值的部分)
在 3000→1800 µs 区间模型陷入局部最优(无限微调同一 idea 的小变体)后,作者的对策:
1. Beam of candidates:不做单冠军 hill-climb,维护 3–5 个活跃 idea 族(exploit / near-miss / 结构性高风险各一支),结构性改动允许先输再赢。 2. Human in the loop:长时间无进展时人工定向介入。 3. 鼓励冒险:明确指示模型尝试激进 idea——实测有效;并观察到 Claude 常在几轮后找借口放弃,Codex 更持久。 4. 强 advisor 模型:AGENTS.md 里指示用 claude -p 无头调用拿新想法、喂 profiling 数据。作者判断 advisor 策略(GPT-5.6 Sol / Fable 级)会成为 auto-research 标配。 5. 子 agent 并行:让 sub-agent 试激进想法、搜博客论文找微优化。 6. 双 profiler 交叉:NCU 与 Modal 各跑一遍,只做两边都指出的瓶颈。 7. 定期清理:清上下文重开、归档旧提交、周期性删死代码。
AGENTS.md 里成文的 Beam Search Discipline(beam 记录父候选/假设/改动/证据、何时杀 beam 的明确判据)与"timeout 算 inconclusive 而非失败"的证据纪律,都是可直接抄的工程约定。
复盘:差在哪
对照 top 10(含第 5 名 Mike 的 writeup):没写数据分布探测器(低秩/聚簇等输入族可利用);没像第 2、5 名那样用自写三角逆替换库函数;trailing matrix 应常驻 fp16;beam 应从第一天就建;没用上 Blackwell 的 tcgen05 张量核指令。
Intake rationale
- Category: agents | Quality score: 4/5
- 一线实践者对 auto-research 循环工程的完整复盘:beam 维护、advisor 模型、证据纪律、何时人工介入,都是从 1500+ 次提交里换来的可复用经验。
Grounding
opencli web read(全文 962 行已抓取);关键数字(12/183、232x、1500+ submissions、3000→1800µs、beam 3-5、AGENTS.md 纪律条目)均直接来自原文。