ARC-AGI-3排行榜引入了一个关键视角:评估AI智能不能只看它能不能解决问题,还要看它用多低的成本解决。
这个排行榜的核心指标是「每任务成本」与「准确率」的关系。散点图直观展示了不同AI系统在效率上的差异——越靠近左上角的系统,越能用更少资源达成更高性能。
为什么效率开始被重视
早期的ARC-AGI-1和2版本主要测量AI的「被动流体智力」,即从已有数据中提取规律的能力。ARC-AGI-3则转向测试AI智能体在全新交互环境中的快速适应能力。这种转变意味着测试场景更接近真实世界——AI需要在有限信息下边做边学。
当测试从「会不会」变成「多快学会」,成本就成了核心变量。同样解决一个问题,用$0.1和用$10的模型,背后的能力结构完全不同。
三类参赛者代表不同策略
推理系统(Reasoning Systems):如o1、Claude等带「思考链」功能的模型。图表中同一模型的多个点代表不同推理时长设置——推理时间越长,性能通常越高,但存在收益递减。
基础大语言模型(Base LLMs):GPT-4.5、Claude 3.7等单次推理的版本,没有额外思考过程。它们的性能代表模型的「裸机」能力。
Kaggle竞赛系统(Kaggle Systems):专为ARC Prize设计的方案,受$50计算预算限制(处理120道题)。这代表在严苛资源约束下优化到极致的方法。
排行榜门槛
目前仅展示运行成本低于$10,000的系统,意味着它本质上是一个「性价比」排行榜,而非单纯的性能排行。这让资源有限的开发者也能找到参考基准。
编注:信源为ARC Prize官方排行榜说明页,材料侧重三类系统的定义与成本-性能关系的意义,解释了排行榜的评估逻辑,未涉及具体模型排名数据或得分。