AI评估新风向:排行榜从「能不能」转向「多划算」

AI评估新风向:排行榜从「能不能」转向「多划算」

_

ARC-AGI-3排行榜引入了一个关键视角:评估AI智能不能只看它能不能解决问题,还要看它用多低的成本解决。

这个排行榜的核心指标是「每任务成本」与「准确率」的关系。散点图直观展示了不同AI系统在效率上的差异——越靠近左上角的系统,越能用更少资源达成更高性能。

为什么效率开始被重视

早期的ARC-AGI-1和2版本主要测量AI的「被动流体智力」,即从已有数据中提取规律的能力。ARC-AGI-3则转向测试AI智能体在全新交互环境中的快速适应能力。这种转变意味着测试场景更接近真实世界——AI需要在有限信息下边做边学。

当测试从「会不会」变成「多快学会」,成本就成了核心变量。同样解决一个问题,用$0.1和用$10的模型,背后的能力结构完全不同。

三类参赛者代表不同策略

推理系统(Reasoning Systems):如o1、Claude等带「思考链」功能的模型。图表中同一模型的多个点代表不同推理时长设置——推理时间越长,性能通常越高,但存在收益递减。

基础大语言模型(Base LLMs):GPT-4.5、Claude 3.7等单次推理的版本,没有额外思考过程。它们的性能代表模型的「裸机」能力。

Kaggle竞赛系统(Kaggle Systems):专为ARC Prize设计的方案,受$50计算预算限制(处理120道题)。这代表在严苛资源约束下优化到极致的方法。

排行榜门槛

目前仅展示运行成本低于$10,000的系统,意味着它本质上是一个「性价比」排行榜,而非单纯的性能排行。这让资源有限的开发者也能找到参考基准。

编注:信源为ARC Prize官方排行榜说明页,材料侧重三类系统的定义与成本-性能关系的意义,解释了排行榜的评估逻辑,未涉及具体模型排名数据或得分。


英美机构评估Kimi K3:网络攻防优于开源对手,但距美国前沿模型仍有显著差距 2026-07-25
携程因垄断被罚没51.79亿元,滥用市场支配地位被定性 2026-07-25