2026年10月4日,ARC-AGI-3 Kaggle社区排行榜迎来剧烈波动。Tufa Labs以55.89%的相对人类行动效率(RHAE)登顶,几乎翻倍了9月30日里程碑获胜者创下的27.9%纪录。值得注意的是,支撑这一突破的底层模型并未发生本质变化,真正的变量在于包裹模型的工程架构。

OpenAI在7月的一项受控实验中量化了这种“包装”的价值:仅通过两项配置更改,便在未改动模型的情况下,使ARC-AGI-3得分提升4.9倍。目前,这一洞察已在社区大规模验证中落地——榜单首位的运行环境仅依赖一块借用的GPU和拥有270亿参数的开源权重模型。

榜单格局与大奖悬空

当前排行榜显示,Tufa Labs以55.89 RHAE领先,Yi-Chia Chen以48.59分紧随其后,大量竞争者集中在33%至38%区间。尽管分数飙升,旨在奖励达到人类水平表现的70万美元大奖仍无人问津。最终提交截止日期为2026年11月2日。

ARC-AGI-3:从静态谜题到交互智能

ARC-AGI-3由ARC Prize基金会于2026年3月25日发布,创始人包括AI研究员François Chollet和企业家Mike Knoop。与前代静态网格视觉谜题不同,新基准将AI智能体置于类似简单电子游戏的交互环境中。这里没有明确规则或指令,智能体必须基于第一性原理,通过感知、行动和反馈循环推断目标。

性能指标采用相对人类行动效率(RHAE),即AI完成任务所需行动数与人类中位数基线的比值。100%代表人类效率,理论上限为115%。由于评估集包含真正新颖的环境,记忆过往数据无效,而低效的蛮力探索会导致RHAE趋近于零。发布之初,前沿模型得分均低于1%,与人类的100%形成巨大落差。

开源引发的“级联效应”

竞赛规定所有方案必须在获取私有评估分数前以开源许可证发布,且需在Kaggle严格的单GPU、无网络限制下运行。这一机制催生了社区的技术级联。

最具影响力的开源项目是Tufa Labs开发的The Duck。该团队赢得6月30日里程碑首奖后,在MIT许可下开源框架。The Duck基于阿里云的Qwen 3.6 27B FP8开源模型,其核心设计极简:

  • Python REPL接口:将游戏状态编码为Python变量,模型通过实时REPL进行交互式编程。
  • 三通道感知:同时处理渲染图像、原始ASCII网格及分割缩放工具。
  • 上下文驱逐机制:移除旧消息以保留系统提示和近期历史,实现无限时长的探索会话。

Tufa Labs发现,添加手工专用工具反而降低性能,模型在通用界面上的即兴发挥效果更佳。此后,社区在此框架上快速迭代。9月30日里程碑的前三名得主均深受The Duck影响,通过优化上下文管理、感知管道和内存策略,在保持基础模型不变的前提下显著提升了分数。

工程架构:被低估的性能杠杆

OpenAI的实验提供了最直接的证据:通过保留GPT-5.6 Sol的私有推理状态并将上下文截断改为压缩,其得分从7.8%跃升至38.3%,Token生成量减少6倍。另一项名为Schema的研究也显示,优化后的支架使Claude和GPT基线在公共游戏集上的得分从42.83%飙升至98.98%。

这些数据揭示了一个关键事实:在智能体系统中,“脚手架”设置——即如何管理上下文、推理状态和感知输入——本身就是基准分数的重要组成部分。

56%分数的真实含义

分数的快速攀升引发了对基准有效性的讨论:如果同一模型因推理编排不同而产生巨大分数差异,基准究竟在测量什么?RHAE虽能防止数据记忆和蛮力作弊,但无法完全剥离“推理编排效率”这一维度。

对此,ARC Prize基金会保持谨慎。其验证排行榜采用标准化跨提供商支架,以确保可比性。目前,GPT-6 Astra在验证榜上得分为62.7%,Claude Opus 5为30.2%。相比之下,Kaggle社区榜允许自定义支架,反映的是模型能力与工程复杂度的复合体。

基金会指出,更好的支架带来了“进一步的任务自动化能力”,具有经济价值,但这不一定代表向AGI迈进的本质进步。然而,在单GPU限制下构建高效智能体的工程挑战是真实的,相关成果对从业者具有直接应用价值。

冲刺阶段:大奖仍存悬念

随着11月2日截止日临近,28支活跃团队竞争激烈。社区在四天内将榜单从27.9%推高至55.89%,显示迭代速度未减。但由于私有评估集完全未见,公共榜分数无法直接预测私有表现。从55.89%跨越到私有集上的100%,需要智能体具备对全新环境的可靠泛化能力,而不仅仅是更优的支架。

无论结果如何,竞赛已成功加速了开源智能体推理研究。获奖者将于2026年12月4日公布。


常见问题解答

什么是智能体脚手架?为何它对ARC-AGI-3至关重要?

智能体脚手架指围绕基础模型构建的基础设施,负责管理上下文、推理状态保留及感知管道。在ARC-AGI-3中,RHAE评分惩罚低效探索,奖励有效假设形成。因此,模型是否保留思维链或如何结构化上下文,直接决定分数。OpenAI实验证明,仅调整这两项配置即可使分数翻倍。

为何分数超55%却无人领取70万美元大奖?

Kaggle社区榜基于可提前研究的25个公共游戏,允许自定义支架;而大奖要求在私有保留集上达到100%人类水平,且需在标准化条件下独立验证。目前尚无提交作品在私有集上接近该阈值,公共高分与私有满分之间存在巨大鸿沟。

验证排行榜与Kaggle社区榜有何区别?

验证排行榜使用标准化支架,反映基础模型差异(如GPT-6 Astra得62.7%);Kaggle社区榜允许自定义支架,反映模型与工程的复合能力。这种设计旨在促进社区实验,但也意味着两者不可直接横向对比。

脚手架驱动的高分是否意味着AI变聪明了?

ARC Prize基金会认为,支架改进提升了任务自动化能力,具有经济价值,但不一定代表底层模型的新颖推理能力增强。社区榜与验证榜追踪不同维度,混淆二者可能导致误判。