ARC-AGI 排行榜
Hacker News 摘要ARC-AGI 排行榜是一个用于追踪 AI 系统在通用人工智能(AGI)推理任务中表现的权威平台。该测试旨在衡量 AI 适应新颖、从未见过环境的能力,而非单纯的模式匹配。
排行榜背景与意义
ARC-AGI 已经从最初的 1 和 2 版本演进到了最新的 ARC-AGI-3。早期的版本主要衡量被动流体智力,而 ARC-AGI-3 则挑战 AI 代理在新型互动环境中的即时适应能力。
排行榜的核心逻辑在于可视化单次任务成本与性能表现之间的关系。这反映了 AI 的效率,因为真正的智能不仅在于解决问题,更在于以最少的资源高效地解决问题。
数据解读说明
排行榜通过散点图和详细列表展示了不同类型的 AI 方案:
• 推理系统趋势线:连接同一种模型在不同推理水平下的点。这些趋势线展示了增加推理时间如何影响性能,通常表现为随着思考时间增加,性能提升趋于渐进式。
• 基础大语言模型:代表标准语言模型(如 GPT-4.5 或 Claude 3.7)在没有扩展推理能力的情况下的单次推理表现,展示了模型的原始能力。
• Kaggle 系统:展示了来自 Kaggle 挑战赛的竞赛级方案。这些方案在严格的计算约束下运行,例如 120 个评估任务仅有 50 美元的计算预算,代表了专门为 ARC 奖项设计的极其高效的方法。
核心 AI 系统表现
根据 2026 年年中的最新数据,多个顶尖模型展示了极高的推理水平:
• Anthropic 系列:Claude Opus 5 (High) 在 ARC-AGI-1 达到 97.5%,ARC-AGI-3 达到 30.2%,单次任务成本约为 1.45 美元。早期的 Claude Opus 4.8 和 4.6 也有多档推理水平记录。
• xAI 系列:Grok 4.5 提供了高、中、低三种推理配置,其中高级版在 ARC-AGI-1 的得分为 85.7%,ARC-AGI-2 为 52.6%。
• OpenAI 系列:GPT-5.6 分为 Sol、Terra、Luna 三个子系列。Sol (Max) 在 ARC-AGI-2 拿下了 92.5% 的高分,单次任务成本为 1.44 美元。Terra 和 Luna 系列则在成本和性能之间提供了不同的平衡点。
• Google 系列:Gemini 3.5 Flash 和 3.1 Pro 参与了测评。Gemini 3.1 Pro (Preview) 在 ARC-AGI-1 取得了 98.0% 的极高分数。
性能细分与分类
排行榜通过以下维度对系统进行分类:
1. 系统类型:包括思维链(CoT)、基础大语言模型(Base LLM)、精炼方案(Refinement)以及自定义系统(Custom)。
2. 版本得分:
• ARC-AGI-1:大多数顶尖模型已接近 90% 到 98% 的高分区间。
• ARC-AGI-2:难度提升,顶级推理系统的得分在 70% 到 92% 之间。
• ARC-AGI-3:目前最具挑战性的版本,即便是最强的 Claude Opus 5 暂时也只达到了 30.2%。
3. 经济效率:列出了每个系统的单次任务成本。例如,一些小型模型如 GPT-5.4 Nano 的成本极低,仅为 0.003 到 0.01 美元,但性能也相应较低。
人类基准对比
为了评估 AI 与人类智能的差距,排行榜引入了人类测试数据:
• STEM 专业毕业生:在 ARC-AGI-3 的表现为 98.0%。
• 人类专家小组:在 ARC-AGI-3 同样达到 98.0%,在 ARC-AGI-2 达到 100%。
• 平均众包测试者:在 ARC-AGI-3 的平均表现为 77.0%。
验证政策与限制
所有展示的系统运行成本必须低于 10,000 美元。如果模型无法产生完整的测试输出,剩余任务将被标记为错误。标有 preview 字样的结果为非正式结果,可能基于不完整的测试。排行榜由 ARC Prize 官方维护,并根据最新的 AI 技术进展持续更新。