mdlARC 技术解读:0.67 美元、1.5 小时,75M 参数小模型在 ARC-AGI-1 拿到 44%

ARC-AGI-1 公开评测集上出现了一个新的低成本纪录:独立研究者 Mithil Vakde 训练的 75M 参数小模型 mdlARC 拿到 44% 的解题率,总训练成本约 0.67 美元,用时 1.5 小时,硬件是一张在 vast.ai 上租来的 RTX 5090。这组数字来自作者发布的技术博客与开源仓库 mdlARC,代码、数据构建脚本和复现步骤全部公开。

ARC-AGI-1 Public Eval:得分与全生命周期成本对比

这个成绩放在当前 ARC-AGI-1 榜单里是什么水平,需要分两层看。准确率层面,44% 与两种专为 ARC 设计的循环架构 TRM(Tiny Recursive Model,44%)持平,超过 HRM(Hierarchical Reasoning Model,41%),距离 LLM 阵营中表现最好的商用模型还有明显差距。成本层面则是断档式的:TRM 达到同样的 44% 花费约 158 美元,HRM 拿到 41% 花费约 133 美元,mdlARC 的 0.67 美元相当于把同等准确率的训练开销压缩到约二百四十分之一。作者自己制作的对比图把各家方案放在「得分 × 全生命周期成本」的对数坐标系里,mdlARC 的三个训练点(31.5%、38.9%、44%)全部落在图表最左下角的空白区域,右侧远处才是 TRM 和 HRM 的坐标点。

消融实验:表示层贡献最大,去掉 3D RoPE 或任务嵌入后得分封顶在 25%

模型的工作方式:每道题现场训练,从零开始

理解这个项目的关键在于它的训练范式。mdlARC 不是拿一个预训练模型做微调,也不使用任何语言模型的权重。它是一个从随机初始化开始训练的标准 transformer 架构模型,而且训练发生在推理阶段,即 test-time training(测试时训练)。

具体流程是:每道 ARC 谜题由若干输入输出网格对组成。模型把这些网格对转成 token 序列,在训练集谜题和当前评测谜题的样例对上现场做自回归训练,评测谜题的测试标签保持隐藏。训练完成后,模型对测试输入做预测。也就是说,模型见过的所有答案标签都不包含评测题的测试输出,但它允许「读题」——用评测题自带的示例对来学习这道题自己的规则。ARC 官方规则允许并鼓励这种做法,因为 ARC 本身被设计成元学习基准:每道题考查一条不同的规则,模型需要现场从示例中归纳规则,而不是依赖预先背下的题库。

在表征设计上,作者用了两个关键组件。其一是每道题独立的可学习加性嵌入(per-task embedding),让模型在跨任务训练时能区分不同谜题的规则域。其二是 3D RoPE 位置编码:每个 token 序列包含输入和输出两个二维网格,三维旋转位置编码把「网格内行列坐标」和「属于第几个网格」编码到不同维度。消融实验显示这两个组件的贡献最大,去掉任何一个,得分都会从 44% 附近直接掉到 25% 左右封顶;把 3D RoPE 换成普通一维 RoPE 得分约 24%,完全去掉任务嵌入约 24.8%。推理时,模型对测试输入做颜色和二面角变换增广,对每组增广输出去逆变换,再取出现次数最多的两个输出提交。

从 27.5% 到 44%:三轮迭代改了什么

这是该系列的第三个版本。前作 27.5% 用了不到 3 小时 A100、成本 1.8 美元;本次 44% 把得分提高六成的同时,把成本再砍掉约 63%。

得分增长主要来自三处:架构现代化(激活函数从 GELU 换成 SwiGLU、LayerNorm 换成 RMSNorm)、数据多样性改善与更充分的混洗、模型从 4 层加深到 8 层。成本下降则来自另一组改动:增广数量大幅减少(增广越少、样本效率越高,训练量越小)、优化器从 AdamW 换成 NorMuon(作者先试过原版 Muon,训练更快但损失值在后期徘徊不收敛,NorMuon 消除了这个问题)、以及 packed varlen flash-attention 训练配合 flex attention 推理内核。

还有一个反直觉的改动:作者不再对输入 token 计算损失,只对输出 token 做监督训练。这一改动把得分从 40% 提到 44%,但作者在博客里明确写了不理解原因,猜测可能与有限的模型容量有关。作者同时观察到,这个改法下测试损失反而变差、得分却更高且方差更小,并借此指出一个失效模式:在小数据集上追求最低验证损失的常见做法并不必然对应更高的下游得分。

训练数据的选择同样影响结果的可信度。模型在 ARC-1、ConceptARC 之外加入了 ARC-2 中的非重叠任务。ARC-2 包含 773 道 ARC-1 旧题和 347 道新题,直接在 ARC-2 上训练会通过重复题泄露答案,作者通过过滤全部重复题来避免泄漏,并说明去掉这部分额外数据后模型仍能得约 40%,只是计算量翻倍。仓库的部署说明里专门留了一个可选步骤:删除原始数据、答案文件和数据构建脚本后再运行,用于自证没有泄漏。

不同消融设置下的最佳得分对比

训练与部署成本:一张消费级显卡的事

复现门槛在个人研究者可及范围内。官方 README 给出的部署路径:租一张 5090(要求 CUDA 12.8 以上,最好 13.0 以上),安装 torch、numpy、numba、matplotlib 和 flash-attn,运行数据集构建脚本,再跑训练加推理脚本。脚本支持 low、medium、high 三档模式。0.67 美元对应 vast.ai 上 1.5 小时的 5090 租金,按 high 档配置。

相比之下,榜单上同档方案都在数据中心硬件上训练。TRM 官方报告的 44% 对应约 158 美元全周期成本,HRM 的 41% 约 133 美元。作者在博客中强调这类对比只在同类方法之间成立:mdlARC、TRM、HRM 同样在全部测试任务上一次性训练,口径一致;LLM 阵营存在大规模离线预训练,其成本未计入上述数字,作者因此不把 LLM 放进同一张成本对比图。LLM 的得分由各家商用模型报告,推理调用费用按 token 计,训练侧成本不公开。作者在博客末尾估算了优化空间:如果手写 GPU 内核,成本还有约一个数量级的下降空间;他取多次运行已解决任务的并集得到 55% 的上限参考,认为在 transformer 框架内做到 65% 是现实目标。

榜单数字之外:样本效率问题与评测边界

作者把这项工作定位为对样本效率问题的直接攻击:ARC 只有 1000 道题,每个谜题一条独立规则,评测集需要的所有概念都出现在训练集里,几乎没有注入先验的空间。这是当前深度学习最薄弱的维度之一——主流 LLM 的能力建立在海量数据上,而 ARC 这类基准衡量的是从极少样本中归纳规则的能力。

HN 讨论区(251 分、72 条评论)的质疑集中在评测边界上。票数最高的评论指出,作者只在单一基准上优化,模型无法泛化到 ARC 之外的任务。这一点作者没有回避,模型名字就叫 mdlARC,目标函数就是 ARC 的得分。值得区分的是两件事:benchmaxxing(针对榜单优化)的批评成立与否是一回事,训练过程是否使用被禁止的信息是另一回事。对于后者,博客用专门章节回应了四类质疑:训练集不包含任何评测谜题的测试输出标签;在评测谜题的示例对上现场学习属于转导推理(transductive reasoning),自 Vapnik 时代就有研究;ARC 官方的测试政策限制的是设计系统的人,不限制系统本身,test-time training 在 ARC 社区一直是被允许和鼓励的做法。

另一些评论提到了更有信息量的观察。有人对比了近期另一个结果——用 Claude Opus 4.8、Fable 5、GPT-5.6 Sol 等前沿模型组成 harness 的方案在 ARC-AGI-3 公开集报告了约 99% 的得分,作者回应称 mdlARC 在 ARC-3 上不经过大改不会有好成绩。两组数字放在一起,恰好划出了两种技术路线的边界:LLM 加工程流水线可以把特定基准推到接近满分,但单次运行依赖参数量千倍于 75M 的模型和持续的推理开销;mdlARC 展示的是另一端,用 0.67 美元和一张消费级显卡,把「从示例归纳规则」这件事做到目前非 LLM 方案的最好水平之一。作者同时在博客里对 TRM 和 HRM 的参数量口径提出质疑,认为两个项目宣传的 7M 量级参数只计入了部分权重,嵌入层等 O(100M+) 量级的被训练权重未包括在内,并据此认为「递归结构带来性能」的归因证据不足——mdlARC 不用递归结构拿到了同等得分。

作者下一步计划继续压成本、探索新的样本效率研究思路,目标是让全世界的独立研究者都能低成本参与 ARC 研究。对一个六年前设立、悬赏百万美元至今未饱和的基准来说,门槛从实验室级别降到一杯咖啡的价格,参与者的数量本身可能就是这项工作最大的影响。

附:关键数字速查

指标mdlARC(本次)mdlARC(前作)TRMHRM
ARC-AGI-1 公开集得分44%27.5%44%41%
全周期训练成本~$0.67~$1.8~$158~$133
训练硬件RTX 5090(租用)A100(Colab)数据中心 GPU数据中心 GPU
训练时长1.5 小时<3 小时
参数量75M7M(存在口径争议)7M(存在口径争议)

注:TRM 与 HRM 官方宣传的 7M 量级参数存在口径争议, mdlARC 作者指出其嵌入层等 O(100M+) 量级的被训练权重未计入,详见正文。数据来源:作者技术博客(mvakde.github.io)、mdlARC GitHub 仓库 README、TRM/HRM 官方报告数字(转引自作者对比图)。项目代码以开源协议发布,含完整数据构建与防泄漏自证脚本。


参考链接: