AI 编程 4.0 · 优秀 2026-07-08 · 文章

Auto-research with Codex: How I achieved a 232x Faster Kernel over baseline

GPU Mode自动研究主题赛事实战复盘:作者用Codex在批量紧凑Householder QR分解CUDA内核上取得对基线232倍加速,183名参赛者中排第12方法论核心是先学到能提出更好的问题先补齐QR分解与Householder反射的数学理解用blocked Householder算法压缩串行部分,再进入Codex-maxxing迭代推进内核;卡在局部最优时主动引入idea多样性逃逸文章给出完整的提问-迭代循环突破点记录与事后复盘的改进清单,是auto-research(作者也称loop engineering)方向少见的第一手工程实录

打开原文回到归档

Auto-research with Codex: How I achieved a 232x Faster Kernel over baseline with Codex in GPU Mode's qr_v2 problem

Source: https://sankalp.bearblog.dev/autoresearch
Author: Sankalp
Published: 2026-07-08
Type: blog / contest writeup
Leaderboard: https://www.gpumode.com/leaderboard/774?tab=rankings(12/183, 232x speedup)

中文导读

GPU Mode 与 Core Automation 合办的 auto-research 主题比赛(题目:批量方阵紧凑 Householder QR 分解,即 torch.geqrf 兼容的 (H, tau) 输出),作者以非专业选手身份拿到 12/183、相对 baseline 232 倍加速。这篇复盘的价值不在 CUDA 细节,而在怎么为"会做题的模型"搭一个能持续产生好想法的研究循环(loop engineering)。

比赛要点

  • 赛题:批量 FP32 方阵 QR 的紧凑 Householder 表示;正确性由 checker 重建 Q 验证,排名按各形状几何平均运行时。14 天内作者提交超过 1500 次。
  • 为什么适合 auto-research:popcorn CLI 让 agent 能直接测试、benchmark、提交;checker 给形状级反馈——紧反馈回路正是 agent 爬山的最爱。
  • 架构选择:与 Claude/GPT-5.5 讨论后确定 blocked Householder + trailing WY 更新作为主架构,把串行依赖"变 GEMM 形"。

逃出局部最优的策略(最有复用价值的部分)

在 3000→1800 µs 区间模型陷入局部最优(无限微调同一 idea 的小变体)后,作者的对策:

1. Beam of candidates:不做单冠军 hill-climb,维护 3–5 个活跃 idea 族(exploit / near-miss / 结构性高风险各一支),结构性改动允许先输再赢。 2. Human in the loop:长时间无进展时人工定向介入。 3. 鼓励冒险:明确指示模型尝试激进 idea——实测有效;并观察到 Claude 常在几轮后找借口放弃,Codex 更持久。 4. 强 advisor 模型:AGENTS.md 里指示用 claude -p 无头调用拿新想法、喂 profiling 数据。作者判断 advisor 策略(GPT-5.6 Sol / Fable 级)会成为 auto-research 标配。 5. 子 agent 并行:让 sub-agent 试激进想法、搜博客论文找微优化。 6. 双 profiler 交叉:NCU 与 Modal 各跑一遍,只做两边都指出的瓶颈。 7. 定期清理:清上下文重开、归档旧提交、周期性删死代码。

AGENTS.md 里成文的 Beam Search Discipline(beam 记录父候选/假设/改动/证据、何时杀 beam 的明确判据)与"timeout 算 inconclusive 而非失败"的证据纪律,都是可直接抄的工程约定。

复盘:差在哪

对照 top 10(含第 5 名 Mike 的 writeup):没写数据分布探测器(低秩/聚簇等输入族可利用);没像第 2、5 名那样用自写三角逆替换库函数;trailing matrix 应常驻 fp16;beam 应从第一天就建;没用上 Blackwell 的 tcgen05 张量核指令。

Intake rationale

  • Category: agents | Quality score: 4/5
  • 一线实践者对 auto-research 循环工程的完整复盘:beam 维护、advisor 模型、证据纪律、何时人工介入,都是从 1500+ 次提交里换来的可复用经验。

Grounding

opencli web read(全文 962 行已抓取);关键数字(12/183、232x、1500+ submissions、3000→1800µs、beam 3-5、AGENTS.md 纪律条目)均直接来自原文。