研究与学习 4.0 · 优秀 2026-09-01 · 文章

44% on ARC-AGI: small transformer trained in 1.5 hours on a 5090

作者用单卡 5090 从零训练一个小型 transformer 1.5 小时,在 ARC-AGI-1 公开评测上跑到 44%,与 TRM/HRM 等 test-time-training 基线持平,并在 ARC-2 上取得 7%代码以 mdlARC 开源,这是其 ARC 求解器系列文章的第三篇

打开原文回到归档

44% on ARC-AGI: small transformer trained in 1.5 hours on a 5090

  • ID: 44526c12
  • 原文链接: https://mvakde.github.io/blog/44-on-arc-1
  • 作者: mvakde (evilmathkid)
  • 日期: 2026-09
  • 分类: learning
  • 来源类型: article
  • 标签: arc-agi, small-model, test-time-training, benchmark
  • 质量评分: 4/5
  • 抓取时间: 2026-09-02T04:23:36Z

中文导读

独立研究者在单张 RTX 5090 上用 1.5 小时从零训练了一个小型 transformer,在 ARC-AGI-1 公开评测拿到 44%(ARC-2 上 7%),与 TRM/HRM 持平并超过不少 LLM,成本更低且完全开源(GitHub: mvakde/mdlARC)。方法要点:每个输入输出对转成 token 序列,测试时在 train + eval 谜题(隐藏标签)上从零自回归训练;每个谜题有独立可学习的加性 embedding,位置编码用 3D RoPE;配合颜色/二面角数据增强,推理时对输出做逆变换,提交最常见的 2 个答案。

相比上一版(曾因"在 eval 谜题上训练"引发 Lucas Beyer、Jeremy Howard 等人热议,作者逐一反驳:训练从不接触测试标签,ARC 本身是 metalearning 基准,eval 输入可用属于 transductive reasoning)的主要改动:现代架构(SwiGLU、RMSNorm)、8 层、数据多样性提升、AdamW 换 Normuon、flash attention varlen 训练;最大的一处变化是不再对输入 token 计损失——方法变成纯监督,分数从 40% 升到 44%,作者坦承不理解原因(猜测与有限模型容量有关),且测试 loss 反而变差、方差更小。消融显示 3D RoPE 与 per-task embedding 是最大功臣:去掉任何一个都掉到约 24%;换成 CompressARC 式逐任务无监督训练只有约 18%。作者只加了 ARC-2 中不与 ARC-1 重叠的任务作为训练数据并仔细过滤了 773 个重复谜题(无泄漏;去掉这部分数据仍有约 40%,但算力翻倍)。作者认为 union-of-runs 已到 55%,65% 在纯 transformer 框架内可达。

为什么值得关注

这是把"样本效率"当成第一性问题的难得样本:不用 LLM、不用海量合成数据,靠表征设计(3D RoPE + per-task embedding)+ 测试时训练,在消费级单卡 1.5 小时内做到与专门方法持平。对 ARC/抽象推理方向,它同时给出了可复现的开源基线和明确的改进路线(PoPE、去增强、手写 GPU 内核降 10 倍成本)。

关键信息

English Summary

The author trains a small transformer from scratch in 1.5 hours on a single RTX 5090 and scores 44% on ARC-AGI-1 public eval (7% on ARC-2), matching TRM/HRM at lower cost, fully open source. Key ingredients: test-time autoregressive training on train+eval puzzles with hidden labels, per-task learnt additive embeddings, 3D RoPE, color/dihedral augmentations with inverse transforms at inference, SwiGLU/RMSNorm architecture, Normuon optimizer, and a supervised loss over output tokens only (40%→44%, reason unclear to the author). Ablations: removing 3D RoPE or per-task embeddings drops to ~24%; CompressARC-style per-task unsupervised training gives ~18%. The author filtered 773 duplicated ARC-1 puzzles out of ARC-2 training data (no leakage) and argues 65% is reachable within the transformer framework.

Obsidian Notes

  • 内容由 opencli web read 抓取原文全文生成,所有数字(44%/7%、1.5h、消融 24%/18%、2.84x 类比无、773 个重复谜题过滤)均出自原文。