我把截至 2026 年 8 月 16 日仍能公开核对的榜单重新过了一遍,这次选了 Artificial Analysis、Arena Text 和 Agent Arena三家机构榜单,分别代表模型的标准化综合能力、真人文本偏好和 Agent 执行表现。
价格统一写成美元/百万 token,顺序为输入/输出。榜单未显示的价格保留为空,不用聚合站估价补齐。
这三个榜单为什么值得看
| 榜单 | 评测方式 | 当前规模 | 认可度来自哪里 | 主要限制 |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index v4.1.1 | 独立运行 9 项标准化评测 | 已评 159 个模型,页面另含更多历史配置 | 评测方法、权重和模型运行数据公开,覆盖 Agent、编程、科学推理与通用能力 | 以英文文本为主,不能直接代表中文体验 |
| Arena Text | 真人匿名两两盲选 | 7,779,985 票,391 个模型 | 长期积累的大规模真实用户偏好数据,榜单给出置信区间和票数 | 文风、篇幅和回答习惯会影响偏好,相邻名次常有区间重叠 |
| Agent Arena | 真实 Agent 会话中的随机化组件选择与因果追踪 | 1,793,983 次会话,48 个模型 | 直接观察任务成功、用户反馈和工具恢复,能拆分主控模型的贡献 | 测到的是特定 Agent 环境中的表现,样本与工具配置会继续变化 |
Artificial Analysis 把 Agent、编程、科学推理和通用能力按 34%、24%、24% 和 18% 加权。Arena Text 更接近普通用户对回答质量的判断。Agent Arena 关注模型进入工具环境以后能否完成任务。这三种口径放在一起,比单看一道考试更完整。
Artificial Analysis 前十
下表采用总榜默认视图,每个模型使用当前页面展示的代表性高分配置,避免同一模型的多个推理档位重复占位。分数按页面显示值取整。
| 名次 | 模型配置 | AA 综合指数 | API 价格 |
|---|---|---|---|
| 1 | Claude Opus 5 Max | 63 | 5 / 25 |
| 2 | Claude Fable 5 Max,含 Opus 4.8 回退 | 62 | 10 / 50 |
| 3 | GPT-5.6 Sol Max | 61 | 5 / 30 |
| 4 | Grok 4.6 High | 61 | 2 / 6 |
| 5 | Kimi K3 Max | 60 | 3 / 15 |
| 6 | Qwen3.8 Max | 58 | 2 / 6,取 Arena 显示价 |
| 7 | Muse Spark 1.2 xHigh | 57 | 1.25 / 4.25 |
| 8 | GPT-5.6 Terra Max | 57 | 2 / 12 |
| 9 | Gemini 3.7 Flash High | 56 | 0.75 / 3.57 |
| 10 | DeepSeek V4 Pro 0813 Max | 53 | 当前 0.435 / 0.87 |
DeepSeek 将在北京时间 8 月 17 日零时切换峰谷价格。V4 Pro 谷时为 0.66 / 1.98,峰时为 1.32 / 3.96。Artificial Analysis 模型页已经按峰时价格展示。
Arena Text 前十
Arena Text 当前快照来自 8 月 12 日。分数后的 ± 表示榜单给出的不确定范围。
| 名次 | 模型配置 | 综合分 | 票数 | API 价格 |
|---|---|---|---|---|
| 1 | Claude Fable 5 | 1506 ± 5 | 21,533 | 10 / 50 |
| 2 | Claude Opus 4.6 High | 1505 ± 4 | 72,516 | 5 / 25 |
| 3 | Claude Opus 4.7 High | 1502 ± 4 | 60,331 | 5 / 25 |
| 4 | Muse Spark 1.2 xHigh | 1498 ± 10 | 3,280 | 1.25 / 4.25 |
| 5 | Claude Opus 4.6 | 1497 ± 3 | 76,474 | 5 / 25 |
| 6 | Claude Opus 4.7 | 1494 ± 4 | 61,419 | 5 / 25 |
| 7 | Claude Opus 5 High | 1493 ± 5 | 20,030 | 5 / 25 |
| 8 | Qwen3.8 Max | 1491 ± 8 | 7,004 | 2 / 6 |
| 9 | Gemini 3.7 Flash High | 1490 ± 8 | 5,744 | 0.75 / 3.57 |
| 10 | Claude Opus 5 Max | 1489 ± 7 | 9,679 | 5 / 25 |
前三名的置信区间明显重叠。1506、1505 和 1502 可以视为同一领先区间,榜单暂时不能证明三者之间存在稳定差距。
Agent Arena 前十
Agent Arena 当前快照来自 8 月 13 日。总排名依据 Net Improvement,表示主控模型对 Agent 表现带来的净提升。工具幻觉率越低越好,其余分项越高越好。
| 名次 | 模型配置 | 净提升 | 确认成功 | 可纠偏性 | Bash 恢复 | API 价格 |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 High | 12.19 ± 1.45 | 15.35 ± 3.03 | 11.34 ± 2.79 | 13.89 ± 0.79 | 5 / 25 |
| 2 | Claude Fable 5 High | 12.01 ± 2.57 | 10.66 ± 4.90 | 8.84 ± 5.23 | 14.19 ± 3.71 | 10 / 50 |
| 3 | Claude Opus 5 Max | 11.95 ± 1.71 | 17.96 ± 3.18 | 6.95 ± 3.43 | 14.38 ± 0.88 | 5 / 25 |
| 4 | GPT-5.6 Sol xHigh | 10.86 ± 1.80 | 10.12 ± 3.69 | 9.23 ± 3.74 | 10.71 ± 1.27 | 5 / 30 |
| 5 | Kimi K3 Max | 10.60 ± 1.04 | 15.55 ± 2.06 | 7.80 ± 1.91 | 8.12 ± 0.83 | 3 / 15 |
| 6 | Claude Opus 4.8 High | 9.78 ± 1.78 | 9.45 ± 3.10 | 8.44 ± 3.33 | 9.29 ± 2.89 | 5 / 25 |
| 7 | GPT-5.5 xHigh | 8.90 ± 1.03 | 4.97 ± 2.18 | 9.17 ± 1.92 | 14.53 ± 1.25 | 2.50 / 15 |
| 8 | Claude Opus 4.7 High | 8.17 ± 1.43 | 6.61 ± 2.95 | 7.72 ± 2.91 | 13.09 ± 2.08 | 5 / 25 |
| 9 | GPT-5.5 High | 7.73 ± 0.97 | 4.03 ± 2.04 | 8.59 ± 1.79 | 13.21 ± 0.97 | 2.50 / 15 |
| 10 | Claude Opus 4.7 | 7.66 ± 1.45 | 5.45 ± 3.08 | 9.95 ± 2.87 | 10.15 ± 2.31 | 5 / 25 |
中国模型在三个榜单中的位置
Artificial Analysis
| 中国名次 | 全球名次 | 模型配置 | 综合指数 | API 价格 |
|---|---|---|---|---|
| 1 | 5 | Kimi K3 Max | 60 | 3 / 15 |
| 2 | 6 | Qwen3.8 Max | 58 | 2 / 6 |
| 3 | 10 | DeepSeek V4 Pro 0813 Max | 53 | 当前 0.435 / 0.87 |
| 4 | 11 | GLM-5.2 Max | 53 | 1.40 / 4.40 |
| 5 | 14 | MiniMax-M3 | 45 | 0.30 / 1.20 |
Arena Text
| 中国名次 | 全球名次 | 模型配置 | 综合分 | API 价格 |
|---|---|---|---|---|
| 1 | 8 | Qwen3.8 Max | 1491 ± 8 | 2 / 6 |
| 2 | 12 | Kimi K3 Max | 1489 ± 6 | 3 / 15 |
| 3 | 26 | Qwen3.7 Max Preview | 1474 ± 10 | 1.48 / 4.42,榜单显示价 |
| 4 | 33 | GLM-5.2 Max | 1471 ± 5 | 1.40 / 4.40 |
| 5 | 37 | ERNIE 5.1 | 1468 ± 5 | 榜单未显示 |
| 6 | 38 | MiMo v2.5 Pro | 1468 ± 4 | 0.43 / 0.87 |
| 7 | 51 | DeepSeek V4 Pro | 1458 ± 4 | 1.17 / 2.34,榜单参赛版本 |
Agent Arena
| 中国名次 | 全球名次 | 模型配置 | 净提升 | 确认成功 | API 价格 |
|---|---|---|---|---|---|
| 1 | 5 | Kimi K3 Max | 10.60 ± 1.04 | 15.55 ± 2.06 | 3 / 15 |
| 2 | 14 | GLM-5.2 Max | 6.74 ± 0.90 | 8.39 ± 1.91 | 1.40 / 4.40 |
| 3 | 19 | DeepSeek V4 Flash High 20260731 | 4.04 ± 0.81 | 8.70 ± 1.93 | 榜单未显示 |
| 4 | 25 | Kimi K2.7 Code | 1.08 ± 2.15 | 4.43 ± 4.55 | 0.47 / 2 |
| 5 | 26 | GLM-5.1 | 0.58 ± 0.82 | 1.75 ± 1.82 | 1.40 / 4.40 |
| 6 | 27 | Qwen3.7 Max | 0.20 ± 0.87 | 0.34 ± 2.13 | 榜单未显示 |
| 7 | 28 | DeepSeek V4 Pro | 0.14 ± 0.88 | 2.16 ± 2.21 | 1.74 / 3.48,榜单参赛版本 |
AA 已经完成 Qwen3.8 和 DeepSeek V4 Pro 0813 的新版本复测。Arena 的参赛版本更新时间不同,表中同名模型不能直接当作同一配置比较。
上榜模型的专长与价格
专长主要依据三个榜单里的分项与排名归纳。它适合缩小候选范围,不能替代自己的业务测试。
| 模型 | 榜单里表现较强的方向 | API 输入/输出价格 | 更适合的任务 |
|---|---|---|---|
| Claude Opus 5 | AA 综合能力、Agent 确认成功与纠偏 | 5 / 25 | 复杂研究、长程 Agent、失败代价高的任务 |
| Claude Fable 5 | Arena Text 综合、编程和创意写作 | 10 / 50 | 高要求写作、编程与综合交付,价格最高 |
| Claude Opus 4.6 | 文本偏好与指令遵循 | 5 / 25 | 长文本、严格格式和通用问答 |
| Claude Opus 4.7 | 文本偏好、Agent 纠偏和 Bash 恢复 | 5 / 25 | 编码 Agent 与多轮修改 |
| Claude Opus 4.8 | Agent 用户反馈和工具执行 | 5 / 25 | 工具调用、复杂任务代理 |
| GPT-5.6 Sol | AA 综合能力、Agent 执行和编程 | 5 / 30 | 编码、终端任务和复杂 Agent |
| GPT-5.6 Terra | AA 综合分较高,输出速度快于多数深度推理模型 | 2 / 12 | 批量分析和速度敏感的推理任务 |
| GPT-5.5 | Bash 恢复与 Agent 纠偏 | 2.50 / 15 | 编码工具链和需要反复修正的任务 |
| Grok 4.6 | AA 综合指数 61,价格低于同分段多数模型 | 2 / 6 | 综合推理与成本受限的复杂任务 |
| Kimi K3 | AA 开放权重第一、Agent 全球第五、确认成功第二 | 3 / 15 | 长程 Agent、编程和需要开放权重的部署 |
| Qwen3.8 Max | Arena Text 全球第八,数学和编程分项靠前 | 2 / 6 | 中文问答、数学、编程和通用对话 |
| Muse Spark 1.2 | Arena Text 全球第四,价格较低 | 1.25 / 4.25 | 通用文本与成本敏感的内容任务 |
| Gemini 3.7 Flash | 文本前十、速度与单价较低 | 0.75 / 3.57 | 高频问答、实时应用和批处理 |
| DeepSeek V4 Pro 0813 | AA 开放权重第三,综合指数 53 | 当前 0.435 / 0.87 | 低成本推理、编码和自托管评估 |
| GLM-5.2 Max | AA 53,Agent 全球第十四,输出速度较快 | 1.40 / 4.40 | 国产部署、Agent 与高吞吐任务 |
| MiniMax-M3 | AA 中国前五中价格最低,多模态输入 | 0.30 / 1.20 | 大批量调用、多模态理解和预算敏感场景 |
| MiMo v2.5 Pro | Arena Text 中国前列,价格较低 | 0.43 / 0.87 | 通用文本、中文任务和低成本调用 |
简短建议
- 复杂研究和高难 Agent 任务,优先实测 Claude Opus 5、GPT-5.6 Sol 和 Kimi K3。中文文本和通用问答,重点比较 Qwen3.8 Max、Kimi K3 与 GLM-5.2。大调用量场景,MiniMax-M3、MiMo v2.5 Pro 和 DeepSeek 更容易控制 token 账单。有内网部署要求时,还要核对权重许可证、显存、推理框架和合规要求。API 排名不能直接换算成私有化部署效果。
主要来源
- [Artificial Analysis 当前总榜] (https://artificialanalysis.ai/models/)[Artificial Analysis 评测方法] (https://artificialanalysis.ai/methodology/intelligence-benchmarking)[Arena Text 综合榜] (https://arena.ai/leaderboard/text?rankBy=models)[Arena Text 编程榜] (https://arena.ai/leaderboard/text/coding)[Arena Text 数学榜] (https://arena.ai/leaderboard/text/math)[Agent Arena 榜单] (https://arena.ai/leaderboard/agent?stream=top)[Agent Arena 方法说明] https://arena.ai/blog/agent-arena-methodology)[DeepSeek 官方价格页] (https://api-docs.deepseek.com/quick_start/pricing/)
榜单与价格都会变化。本文数据截点为 2026 年 8 月 16 日。
1564