Opus 5 目前在 Artificial Analysis 智能排行榜上排名第一
Hacker News 摘要原标题:Opus 5 is currently #1 on Artificial Analysis Intelligence Leaderboard
Artificial Analysis 网站提供了一个全面的 AI 模型对比平台,从智能程度、性能表现和价格等多个维度对各种 AI 模型进行深入分析。该页面涵盖了超过 580 个模型,通过标准化测试来衡量它们的质量、价格、输出速度、延迟和上下文窗口等指标。
核心性能指标概况
• 智能程度: 目前 Claude Opus 5 (max) 和 Claude Opus 5 (xhigh) 是智能指数最高的模型。紧随其后的是带有回退机制的 Claude Fable 5 和 GPT-5.6 Sol (max)。
• 输出速度: Mercury 2 以每秒 902 个标记的速度位居榜首。HyperNova 60B 2605 达到每秒 440 个标记,位列第二。
• 延迟: Gemini 2.5 Flash-Lite 的首个标记响应时间最短,仅为 0.33 秒。Command A+ 以 0.42 秒排名第二。
• 价格: Devstral 2 和 North Mini Code 是目前最便宜的模型,费用趋近于零。
• 上下文窗口: Llama 4 Scout 拥有最大的 10M(一千万)标记上下文空间。Grok 4.20 0309 提供 2M 空间。
智能指数排行榜
该智能指数综合了 9 项评估,包括代码编写、科学推理、法律工作、长文本推理和防幻觉测试。以下是目前得分最高的模型及其分值:
1. Claude Opus 5 (max):61 分
2. Claude Fable 5 (with fallback):60 分
3. GPT-5.6 Sol (max):59 分
4. Kimi K3:57 分
5. Grok 4.5 (high):54 分
6. GLM-5.2 (max):51 分(也是排名最高的开源权重模型)
成本与效率分析
网站通过加权平均成本来衡量完成特定智能任务的费用。
• 低成本高效益: DeepSeek V4 Pro (max)、gpt-oss-120b (high) 和 MiniMax-M3 在性价比象限表现出色,任务成本低且智能程度较高。
• 高成本模型: Claude Opus 5 (max) 和 Claude Fable 5 虽然智能领先,但每项任务的成本也最高,分别达到 2.03 美元和 2.75 美元。
技术细节与响应性能
• 推理模型: 页面用灯泡图标标注了推理模型(如 Claude Opus 5、GPT-5.6 Sol)。这些模型在回答前会进行深度思考,虽然端到端响应时间较长,但在复杂逻辑任务中表现更好。
• 端到端时间: 计算了从发送请求到输出 500 个标记的总时间。对于推理模型,这包括了输入处理时间、内部思考时间以及最后的答案生成时间。
• 开源权重模型: 评估涵盖了 94 个开源权重模型。除了 GLM-5.2 外,MiniMax-M3 和 DeepSeek V4 Pro 也是开源领域中的佼佼者。
常见问题解答摘要
• 最智能的模型: Claude Opus 5 (max) 目前在 170 个已评估模型中排名第一。
• 最快的模型: Mercury 2 的生成速度最快。
• 最便宜的模型: Nova Micro 和 Gemma 4 E4B 等模型在每百万标记费用上极具竞争力。
• 最佳开源模型: GLM-5.2 (max) 目前是开源权重类别的冠军。
该平台允许用户点击具体的模型名称来查看更详尽的测量数据,或者利用模型选择器来自定义对比图表,从而帮助开发者根据具体需求选择最合适的 AI 模型。