LMArena Math Arena 数学推理能力排行榜
基于 LMArena Math Arena 用户匿名投票的最新AI大模型数学推理能力排行榜,涵盖各模型的 Elo 得分、95% 置信区间、投票量、机构与许可证。
榜首模型
deepseek-v4.1-flash-max
最高得分
1502.00
模型数量
395
数据版本
2026年09月30日
数据来源: LM Arena
关于本排行榜
本排行榜展示了当前 AI 大模型在数学推理任务中的实力排名。数据来源于 LMArena 的 Math 子赛道,通过真实用户匿名盲测投票评估各模型在数学解题任务中的表现。
评测方法概要
匿名盲测:用户提出数学题目后,由两个"隐藏身份"的模型分别作答,用户投票选出解题更优的一方,排除品牌偏见。
Elo 评分:采用 Bradley-Terry 模型计算 Elo 分数,分数越高说明该模型在数学场景中被用户更频繁地选择。
覆盖多种数学场景:包括代数、几何、计算推理、竞赛数学等多元化的真实数学任务。
DataLearner 在原始数据基础上提供中文解读与深度分析,并将排行榜模型关联至 DataLearner 模型库,方便您一键查看模型详情、API 定价、评测得分等完整信息。
排名总表
| 排名 | 模型名称 | 得分 | 95% CI | 投票数 | 机构 | 许可证 |
|---|---|---|---|---|---|---|
| 13 | deepseek-v4.1-flash-maxDeepSeek | 1502.00 | +/-28 | 408 | DeepSeek | MIT |
| 16 | kimi-k3-maxMoonshot | 1500.00 | +/-17 | 1,190 | Moonshot | Kimi K3 license |
| 18 | qwen3.8-maxAlibaba | 1497.00 | +/-18 | 1,111 | Alibaba | Proprietary |
| 35 | Kimi K2.6Moonshot AI | 1479.00 | +/-13 | 2,074 | Moonshot AI | Modified MIT |
| 48 | Kimi K2 ThinkingMoonshot AI | 1471.00 | +/-9 | 4,151 | Moonshot AI | Modified MIT |
| 53 | deepseek-v4-pro-high-previewDeepSeek | 1466.00 | +/-12 | 2,706 | DeepSeek | MIT |
| 62 | qwen3.8-27bAlibaba | 1458.00 | +/-20 | 849 | Alibaba | Apache 2.0 |
| 63 | deepseek-v4-pro-high-20260813DeepSeek | 1457.00 | +/-28 | 406 | DeepSeek | MIT |
| 81 | DeepSeek-V4-ProDeepSeek-AI | 1445.00 | +/-11 | 3,052 | DeepSeek-AI | MIT |
| 84 | Kimi K2.5 InstantMoonshot AI | 1443.00 | +/-24 | 552 | Moonshot AI | Modified MIT |
| 88 | deepseek-v4-flash-high-previewDeepSeek | 1441.00 | +/-12 | 2,618 | DeepSeek | MIT |
| 92 | Kimi K2 Thinking (thinking-turbo)Moonshot AI | 1436.00 | +/-10 | 3,905 | Moonshot AI | Modified MIT |
| 100 | MiniMax M3MiniMaxAI | 1433.00 | +/-11 | 2,854 | MiniMaxAI | MiniMax Community License |
| 103 | hunyuan-hy3-previewTencent | 1431.00 | +/-27 | 429 | Tencent | tencent-hunyuan-community |
| 105 | DeepSeek V3.2-Exp (thinking)DeepSeek-AI | 1428.00 | +/-11 | 2,623 | DeepSeek-AI | MIT |
| 109 | DeepSeek V3.2DeepSeek-AI | 1427.00 | +/-11 | 3,129 | DeepSeek-AI | MIT |
| 115 | DeepSeek-V4-FlashDeepSeek-AI | 1425.00 | +/-12 | 2,686 | DeepSeek-AI | MIT |
| 119 | qwen3-max-2025-09-23Alibaba | 1423.00 | +/-24 | 568 | Alibaba | Proprietary |
| 120 | MiniMax-M2.7MiniMaxAI | 1422.00 | +/-10 | 3,977 | MiniMaxAI | Modified MIT |
| 123 | DeepSeek V3.2-Exp (thinking)DeepSeek-AI | 1421.00 | +/-27 | 472 | DeepSeek-AI | MIT |
| 129 | Kimi K2 0905Moonshot AI | 1416.00 | +/-21 | 750 | Moonshot AI | Modified MIT |
| 132 | DeepSeek-V3.1 (thinking)DeepSeek-AI | 1414.00 | +/-22 | 656 | DeepSeek-AI | MIT |
| 133 | DeepSeek-V3.1DeepSeek-AI | 1414.00 | +/-18 | 977 | DeepSeek-AI | MIT |
| 134 | DeepSeek V3.2-ExpDeepSeek-AI | 1413.00 | +/-20 | 789 | DeepSeek-AI | MIT |
| 135 | DeepSeek-R1DeepSeek-AI | 1412.00 | +/-14 | 1,606 | DeepSeek-AI | MIT |
| 145 | Step 3.5 FlashStepFunAI | 1407.00 | +/-10 | 3,419 | StepFunAI | Apache 2.0 |
| 154 | Step 3.5 FlashStepFunAI | 1401.00 | +/-11 | 3,375 | StepFunAI | Proprietary |
| 160 | DeepSeek-V3.1 TerminusDeepSeek-AI | 1397.00 | +/-39 | 216 | DeepSeek-AI | MIT |
| 161 | qwen3-235b-a22b-thinking-2507Alibaba | 1397.00 | +/-25 | 477 | Alibaba | Apache 2.0 |
| 165 | DeepSeek-R1-0528DeepSeek-AI | 1393.00 | +/-20 | 852 | DeepSeek-AI | MIT |
| 166 | MiniMax M2.5MiniMaxAI | 1393.00 | +/-12 | 2,543 | MiniMaxAI | Modified MIT |
| 167 | qwen3-235b-a22b-no-thinkingAlibaba | 1392.00 | +/-12 | 2,355 | Alibaba | Apache 2.0 |
| 168 | M2.1MiniMaxAI | 1392.00 | +/-18 | 1,041 | MiniMaxAI | MIT |
| 174 | Kimi K2Moonshot AI | 1388.00 | +/-14 | 1,673 | Moonshot AI | Modified MIT |
| 192 | minimax-m1MiniMax | 1370.00 | +/-14 | 1,756 | MiniMax | Apache 2.0 |
| 193 | DeepSeek-V3-0324DeepSeek-AI | 1368.00 | +/-10 | 3,147 | DeepSeek-AI | MIT |
| 199 | Step3StepFunAI | 1362.00 | +/-31 | 349 | StepFunAI | Apache 2.0 |
| 209 | MiniMax M2MiniMaxAI | 1350.00 | +/-33 | 317 | MiniMaxAI | Apache 2.0 |
| 214 | hunyuan-turbos-20250416Tencent | 1346.00 | +/-20 | 845 | Tencent | Proprietary |
| 222 | qwen-plus-0125Alibaba | 1323.00 | +/-19 | 732 | Alibaba | Proprietary |
| 229 | step-2-16k-exp-202412StepFun | 1312.00 | +/-20 | 642 | StepFun | Proprietary |
| 233 | DeepSeek-V3DeepSeek-AI | 1310.00 | +/-11 | 2,721 | DeepSeek-AI | DeepSeek |
| 240 | qwen2.5-plus-1127Alibaba | 1303.00 | +/-14 | 1,404 | Alibaba | Proprietary |
| 243 | hunyuan-turbos-20250226Tencent | 1301.00 | +/-31 | 238 | Tencent | Proprietary |
| 246 | glm-4-plus-0111Zhipu | 1298.00 | +/-19 | 721 | Zhipu | Proprietary |
| 248 | step-1o-turbo-202506StepFun | 1296.00 | +/-24 | 559 | StepFun | Proprietary |
| 253 | hunyuan-large-2025-02-10Tencent | 1293.00 | +/-24 | 497 | Tencent | Proprietary |
| 254 | deepseek-v2.5-1210DeepSeek | 1292.00 | +/-17 | 1,031 | DeepSeek | DeepSeek |
| 255 | qwen-max-0919Alibaba | 1291.00 | +/-12 | 2,249 | Alibaba | Qwen |
| 256 | hunyuan-standard-2025-02-10Tencent | 1290.00 | +/-24 | 499 | Tencent | Proprietary |
| 259 | DeepSeek V2.5DeepSeek-AI | 1287.00 | +/-10 | 3,649 | DeepSeek-AI | DeepSeek |
| 260 | glm-4-plusZhipu AI | 1287.00 | +/-10 | 3,599 | Zhipu AI | Proprietary |
| 265 | hunyuan-large-visionTencent | 1281.00 | +/-30 | 344 | Tencent | Proprietary |
| 266 | hunyuan-turbo-0110Tencent | 1279.00 | +/-31 | 243 | Tencent | Proprietary |
| 275 | deepseek-coder-v2DeepSeek | 1272.00 | +/-14 | 1,858 | DeepSeek | DeepSeek License |
| 290 | hunyuan-standard-256kTencent | 1249.00 | +/-29 | 361 | Tencent | Proprietary |
| 323 | qwen1.5-32b-chatAlibaba | 1201.00 | +/-12 | 2,649 | Alibaba | Qianwen LICENSE |
| 347 | DeepSeek LLM 67B ChatDeepSeek-AI | 1156.00 | +/-24 | 576 | DeepSeek-AI | DeepSeek License |
数据仅供参考,以官方来源为准。模型名称旁的链接可跳转到 DataLearner 模型详情页。
常见问题 (FAQ)
什么是 LMArena Math Arena?
LMArena Math Arena 是 LMArena 旗下专注于数学推理能力的匿名评测平台。用户提交真实数学问题(如代数、几何、竞赛数学等),系统将不同模型的解题过程并排展示(隐藏模型名称),由用户投票选出更好的解答,最终通过 Elo 算法汇总形成动态排行榜。
Math Arena 与 MATH-500、AIME 等静态基准有什么区别?
MATH-500、AIME、AMC 等静态基准使用固定题目集和自动评分,可重现性强但容易被针对性优化("刷榜")。Math Arena 来自真实用户的开放式数学问题,测试内容不固定,更能反映模型在实际数学场景中的自然表现,两者互为补充。
思考模型(Thinking Model)在数学 Arena 中表现更好吗?
整体而言,具备思维链(Chain-of-Thought)或扩展推理能力的模型在数学 Arena 中往往排名更高。Claude Opus 系列 Thinking 模式、GPT 高算力模式以及 DeepSeek 思考版本均在榜单前列,说明延长推理时间对数学问题的解答质量有显著提升。
国产大模型在数学能力方面表现如何?
DeepSeek、Qwen3 系列、GLM 等国产模型在 Math Arena 表现亮眼,已跻身全球前列。DeepSeek 以 MIT 协议开源,Qwen3-235B 等系列支持中文数学场景,是选择开源数学推理模型的重要参考。





