• 正文
  • 相关推荐
申请入驻 产业图谱

三个主流大模型榜单前十与中国模型位置

08/26 10:53
1564
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

我把截至 2026 年 8 月 16 日仍能公开核对的榜单重新过了一遍,这次选了 Artificial Analysis、Arena Text 和 Agent Arena三家机构榜单,分别代表模型的标准化综合能力、真人文本偏好和 Agent 执行表现。

价格统一写成美元/百万 token,顺序为输入/输出。榜单未显示的价格保留为空,不用聚合站估价补齐。

这三个榜单为什么值得看

榜单 评测方式 当前规模 认可度来自哪里 主要限制
Artificial Analysis Intelligence Index v4.1.1 独立运行 9 项标准化评测 已评 159 个模型,页面另含更多历史配置 评测方法、权重和模型运行数据公开,覆盖 Agent、编程、科学推理与通用能力 以英文文本为主,不能直接代表中文体验
Arena Text 真人匿名两两盲选 7,779,985 票,391 个模型 长期积累的大规模真实用户偏好数据,榜单给出置信区间和票数 文风、篇幅和回答习惯会影响偏好,相邻名次常有区间重叠
Agent Arena 真实 Agent 会话中的随机化组件选择与因果追踪 1,793,983 次会话,48 个模型 直接观察任务成功、用户反馈和工具恢复,能拆分主控模型的贡献 测到的是特定 Agent 环境中的表现,样本与工具配置会继续变化

Artificial Analysis 把 Agent、编程、科学推理和通用能力按 34%、24%、24% 和 18% 加权。Arena Text 更接近普通用户对回答质量的判断。Agent Arena 关注模型进入工具环境以后能否完成任务。这三种口径放在一起,比单看一道考试更完整。

Artificial Analysis 前十

下表采用总榜默认视图,每个模型使用当前页面展示的代表性高分配置,避免同一模型的多个推理档位重复占位。分数按页面显示值取整。

名次 模型配置 AA 综合指数 API 价格
1 Claude Opus 5 Max 63 5 / 25
2 Claude Fable 5 Max,含 Opus 4.8 回退 62 10 / 50
3 GPT-5.6 Sol Max 61 5 / 30
4 Grok 4.6 High 61 2 / 6
5 Kimi K3 Max 60 3 / 15
6 Qwen3.8 Max 58 2 / 6,取 Arena 显示价
7 Muse Spark 1.2 xHigh 57 1.25 / 4.25
8 GPT-5.6 Terra Max 57 2 / 12
9 Gemini 3.7 Flash High 56 0.75 / 3.57
10 DeepSeek V4 Pro 0813 Max 53 当前 0.435 / 0.87

DeepSeek 将在北京时间 8 月 17 日零时切换峰谷价格。V4 Pro 谷时为 0.66 / 1.98,峰时为 1.32 / 3.96。Artificial Analysis 模型页已经按峰时价格展示。

Arena Text 前十

Arena Text 当前快照来自 8 月 12 日。分数后的 ± 表示榜单给出的不确定范围。

名次 模型配置 综合分 票数 API 价格
1 Claude Fable 5 1506 ± 5 21,533 10 / 50
2 Claude Opus 4.6 High 1505 ± 4 72,516 5 / 25
3 Claude Opus 4.7 High 1502 ± 4 60,331 5 / 25
4 Muse Spark 1.2 xHigh 1498 ± 10 3,280 1.25 / 4.25
5 Claude Opus 4.6 1497 ± 3 76,474 5 / 25
6 Claude Opus 4.7 1494 ± 4 61,419 5 / 25
7 Claude Opus 5 High 1493 ± 5 20,030 5 / 25
8 Qwen3.8 Max 1491 ± 8 7,004 2 / 6
9 Gemini 3.7 Flash High 1490 ± 8 5,744 0.75 / 3.57
10 Claude Opus 5 Max 1489 ± 7 9,679 5 / 25

前三名的置信区间明显重叠。1506、1505 和 1502 可以视为同一领先区间,榜单暂时不能证明三者之间存在稳定差距。

Agent Arena 前十

Agent Arena 当前快照来自 8 月 13 日。总排名依据 Net Improvement,表示主控模型对 Agent 表现带来的净提升。工具幻觉率越低越好,其余分项越高越好。

名次 模型配置 净提升 确认成功 可纠偏性 Bash 恢复 API 价格
1 Claude Opus 5 High 12.19 ± 1.45 15.35 ± 3.03 11.34 ± 2.79 13.89 ± 0.79 5 / 25
2 Claude Fable 5 High 12.01 ± 2.57 10.66 ± 4.90 8.84 ± 5.23 14.19 ± 3.71 10 / 50
3 Claude Opus 5 Max 11.95 ± 1.71 17.96 ± 3.18 6.95 ± 3.43 14.38 ± 0.88 5 / 25
4 GPT-5.6 Sol xHigh 10.86 ± 1.80 10.12 ± 3.69 9.23 ± 3.74 10.71 ± 1.27 5 / 30
5 Kimi K3 Max 10.60 ± 1.04 15.55 ± 2.06 7.80 ± 1.91 8.12 ± 0.83 3 / 15
6 Claude Opus 4.8 High 9.78 ± 1.78 9.45 ± 3.10 8.44 ± 3.33 9.29 ± 2.89 5 / 25
7 GPT-5.5 xHigh 8.90 ± 1.03 4.97 ± 2.18 9.17 ± 1.92 14.53 ± 1.25 2.50 / 15
8 Claude Opus 4.7 High 8.17 ± 1.43 6.61 ± 2.95 7.72 ± 2.91 13.09 ± 2.08 5 / 25
9 GPT-5.5 High 7.73 ± 0.97 4.03 ± 2.04 8.59 ± 1.79 13.21 ± 0.97 2.50 / 15
10 Claude Opus 4.7 7.66 ± 1.45 5.45 ± 3.08 9.95 ± 2.87 10.15 ± 2.31 5 / 25

中国模型在三个榜单中的位置

Artificial Analysis

中国名次 全球名次 模型配置 综合指数 API 价格
1 5 Kimi K3 Max 60 3 / 15
2 6 Qwen3.8 Max 58 2 / 6
3 10 DeepSeek V4 Pro 0813 Max 53 当前 0.435 / 0.87
4 11 GLM-5.2 Max 53 1.40 / 4.40
5 14 MiniMax-M3 45 0.30 / 1.20

Arena Text

中国名次 全球名次 模型配置 综合分 API 价格
1 8 Qwen3.8 Max 1491 ± 8 2 / 6
2 12 Kimi K3 Max 1489 ± 6 3 / 15
3 26 Qwen3.7 Max Preview 1474 ± 10 1.48 / 4.42,榜单显示价
4 33 GLM-5.2 Max 1471 ± 5 1.40 / 4.40
5 37 ERNIE 5.1 1468 ± 5 榜单未显示
6 38 MiMo v2.5 Pro 1468 ± 4 0.43 / 0.87
7 51 DeepSeek V4 Pro 1458 ± 4 1.17 / 2.34,榜单参赛版本

Agent Arena

中国名次 全球名次 模型配置 净提升 确认成功 API 价格
1 5 Kimi K3 Max 10.60 ± 1.04 15.55 ± 2.06 3 / 15
2 14 GLM-5.2 Max 6.74 ± 0.90 8.39 ± 1.91 1.40 / 4.40
3 19 DeepSeek V4 Flash High 20260731 4.04 ± 0.81 8.70 ± 1.93 榜单未显示
4 25 Kimi K2.7 Code 1.08 ± 2.15 4.43 ± 4.55 0.47 / 2
5 26 GLM-5.1 0.58 ± 0.82 1.75 ± 1.82 1.40 / 4.40
6 27 Qwen3.7 Max 0.20 ± 0.87 0.34 ± 2.13 榜单未显示
7 28 DeepSeek V4 Pro 0.14 ± 0.88 2.16 ± 2.21 1.74 / 3.48,榜单参赛版本

AA 已经完成 Qwen3.8 和 DeepSeek V4 Pro 0813 的新版本复测。Arena 的参赛版本更新时间不同,表中同名模型不能直接当作同一配置比较。

上榜模型的专长与价格

专长主要依据三个榜单里的分项与排名归纳。它适合缩小候选范围,不能替代自己的业务测试。

模型 榜单里表现较强的方向 API 输入/输出价格 更适合的任务
Claude Opus 5 AA 综合能力、Agent 确认成功与纠偏 5 / 25 复杂研究、长程 Agent、失败代价高的任务
Claude Fable 5 Arena Text 综合、编程和创意写作 10 / 50 高要求写作、编程与综合交付,价格最高
Claude Opus 4.6 文本偏好与指令遵循 5 / 25 长文本、严格格式和通用问答
Claude Opus 4.7 文本偏好、Agent 纠偏和 Bash 恢复 5 / 25 编码 Agent 与多轮修改
Claude Opus 4.8 Agent 用户反馈和工具执行 5 / 25 工具调用、复杂任务代理
GPT-5.6 Sol AA 综合能力、Agent 执行和编程 5 / 30 编码、终端任务和复杂 Agent
GPT-5.6 Terra AA 综合分较高,输出速度快于多数深度推理模型 2 / 12 批量分析和速度敏感的推理任务
GPT-5.5 Bash 恢复与 Agent 纠偏 2.50 / 15 编码工具链和需要反复修正的任务
Grok 4.6 AA 综合指数 61,价格低于同分段多数模型 2 / 6 综合推理与成本受限的复杂任务
Kimi K3 AA 开放权重第一、Agent 全球第五、确认成功第二 3 / 15 长程 Agent、编程和需要开放权重的部署
Qwen3.8 Max Arena Text 全球第八,数学和编程分项靠前 2 / 6 中文问答、数学、编程和通用对话
Muse Spark 1.2 Arena Text 全球第四,价格较低 1.25 / 4.25 通用文本与成本敏感的内容任务
Gemini 3.7 Flash 文本前十、速度与单价较低 0.75 / 3.57 高频问答、实时应用和批处理
DeepSeek V4 Pro 0813 AA 开放权重第三,综合指数 53 当前 0.435 / 0.87 低成本推理、编码和自托管评估
GLM-5.2 Max AA 53,Agent 全球第十四,输出速度较快 1.40 / 4.40 国产部署、Agent 与高吞吐任务
MiniMax-M3 AA 中国前五中价格最低,多模态输入 0.30 / 1.20 大批量调用、多模态理解和预算敏感场景
MiMo v2.5 Pro Arena Text 中国前列,价格较低 0.43 / 0.87 通用文本、中文任务和低成本调用

简短建议

    复杂研究和高难 Agent 任务,优先实测 Claude Opus 5、GPT-5.6 Sol 和 Kimi K3。中文文本和通用问答,重点比较 Qwen3.8 Max、Kimi K3 与 GLM-5.2。大调用量场景,MiniMax-M3、MiMo v2.5 Pro 和 DeepSeek 更容易控制 token 账单。有内网部署要求时,还要核对权重许可证、显存、推理框架和合规要求。API 排名不能直接换算成私有化部署效果。

主要来源

    [Artificial Analysis 当前总榜] (https://artificialanalysis.ai/models/)[Artificial Analysis 评测方法] (https://artificialanalysis.ai/methodology/intelligence-benchmarking)[Arena Text 综合榜] (https://arena.ai/leaderboard/text?rankBy=models)[Arena Text 编程榜] (https://arena.ai/leaderboard/text/coding)[Arena Text 数学榜] (https://arena.ai/leaderboard/text/math)[Agent Arena 榜单] (https://arena.ai/leaderboard/agent?stream=top)[Agent Arena 方法说明] https://arena.ai/blog/agent-arena-methodology)[DeepSeek 官方价格页] (https://api-docs.deepseek.com/quick_start/pricing/)

榜单与价格都会变化。本文数据截点为 2026 年 8 月 16 日。

相关推荐