Opus 5 目前在 Artificial Analysis 智能排行榜上排名第一

Opus 5 目前在 Artificial Analysis 智能排行榜上排名第一

Hacker News 摘要

原标题:Opus 5 is currently #1 on Artificial Analysis Intelligence Leaderboard

Artificial Analysis 网站提供了一个全面的 AI 模型对比平台,从智能程度、性能表现和价格等多个维度对各种 AI 模型进行深入分析。该页面涵盖了超过 580 个模型,通过标准化测试来衡量它们的质量、价格、输出速度、延迟和上下文窗口等指标。

核心性能指标概况

智能程度: 目前 Claude Opus 5 (max)Claude Opus 5 (xhigh) 是智能指数最高的模型。紧随其后的是带有回退机制的 Claude Fable 5GPT-5.6 Sol (max)

输出速度: Mercury 2 以每秒 902 个标记的速度位居榜首。HyperNova 60B 2605 达到每秒 440 个标记,位列第二。

延迟: Gemini 2.5 Flash-Lite 的首个标记响应时间最短,仅为 0.33 秒。Command A+ 以 0.42 秒排名第二。

价格: Devstral 2North Mini Code 是目前最便宜的模型,费用趋近于零。

上下文窗口: Llama 4 Scout 拥有最大的 10M(一千万)标记上下文空间。Grok 4.20 0309 提供 2M 空间。

智能指数排行榜

该智能指数综合了 9 项评估,包括代码编写、科学推理、法律工作、长文本推理和防幻觉测试。以下是目前得分最高的模型及其分值:

1. Claude Opus 5 (max):61 分

2. Claude Fable 5 (with fallback):60 分

3. GPT-5.6 Sol (max):59 分

4. Kimi K3:57 分

5. Grok 4.5 (high):54 分

6. GLM-5.2 (max):51 分(也是排名最高的开源权重模型)

成本与效率分析

网站通过加权平均成本来衡量完成特定智能任务的费用。

低成本高效益: DeepSeek V4 Pro (max)gpt-oss-120b (high)MiniMax-M3 在性价比象限表现出色,任务成本低且智能程度较高。

高成本模型: Claude Opus 5 (max)Claude Fable 5 虽然智能领先,但每项任务的成本也最高,分别达到 2.03 美元和 2.75 美元。

技术细节与响应性能

推理模型: 页面用灯泡图标标注了推理模型(如 Claude Opus 5、GPT-5.6 Sol)。这些模型在回答前会进行深度思考,虽然端到端响应时间较长,但在复杂逻辑任务中表现更好。

端到端时间: 计算了从发送请求到输出 500 个标记的总时间。对于推理模型,这包括了输入处理时间、内部思考时间以及最后的答案生成时间。

开源权重模型: 评估涵盖了 94 个开源权重模型。除了 GLM-5.2 外,MiniMax-M3DeepSeek V4 Pro 也是开源领域中的佼佼者。

常见问题解答摘要

最智能的模型: Claude Opus 5 (max) 目前在 170 个已评估模型中排名第一。

最快的模型: Mercury 2 的生成速度最快。

最便宜的模型: Nova MicroGemma 4 E4B 等模型在每百万标记费用上极具竞争力。

最佳开源模型: GLM-5.2 (max) 目前是开源权重类别的冠军。

该平台允许用户点击具体的模型名称来查看更详尽的测量数据,或者利用模型选择器来自定义对比图表,从而帮助开发者根据具体需求选择最合适的 AI 模型。


原文:https://artificialanalysis.ai/models

评论:https://news.ycombinator.com/item?id=49040741

Report Page