何恺明团队用ImageNet预训练提升ARC视觉推理
何恺明团队提出纯视觉ARC解题方案NAT-ARC,不使用大语言模型,而是先用ImageNet自然图像训练视觉编码器,再迁移到抽象彩色格子推理。在ARC-1测试中,最佳单模型pass@2达到63.4±0.7%,集成模型达到70.2±0.6%。
ARC由François Chollet于2019年提出,每题包含最大30×30、最多10种颜色的格子,以及2至5组输入输出示例,模型需归纳隐藏规则并应用到新输入。此前主流方案多将格子转成文本或符号交给大模型处理。
纯视觉路线后来出现:VARC将任务定义为条件图像生成,19M参数取得54%;LoopViT加入循环推理后以18M参数达到65.8%,Loop-OWM借助视频预训练模型和少样本学习,以10.6M参数达到68.5%。
多数视觉方案从随机初始化开始,缺少大模型依靠海量预训练获得的扩展能力。NAT-ARC因此在VARC流程前加入何恺明于2022年提出的ImageNet MAE预训练,让编码器学习物体形状、结构和空间关系。
其训练分三步:先用约130万张自然图像训练MAE编码器,再在ARC训练集离线训练编解码器,测试时针对每道题用2至5组示例进行LoRA微调。研究直接使用公开checkpoint,没有额外预训练;为适配64×64的ARC格子,舍弃原patch embedding和位置编码,仅保留backbone,并改用2D RoPE。
注意力可视化显示,ImageNet预训练模型即使没见过ARC,也能比随机初始化模型更集中地识别前景和有意义区域。15道提升明显的题目中,6道属于匹配复制,6道属于连通区域推理,说明自然图像中的目标分离、图案匹配和区域分割先验可以迁移到抽象格子。
NAT-ARC的huge单模型含约0.6B参数,成绩为63.4%;融合三种初始化策略后,总参数约2B,达到70.2%,接近8B参数的专用系统The ARChitects(71.6%)。无预训练时模型从large到huge会因数据稀少而过拟合,加入ImageNet预训练后,base、large、huge性能随规模持续提升。
研究人员还训练自动编码器,将ImageNet图片转换为60×60、10色离散格子,再让NAT-ARC执行旋转180度、添加蓝色边框等变换并还原图像,猫和边框均被正确处理。
这一实验表明自然图像与ARC格子可能共享物体分组和规则变换等底层表征。一作Xiaoman Delores Ding是MIT CSAIL成员,来自何恺明团队。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文