DataLearner 标志

LMArena Math Arena 数学推理能力排行榜

基于 LMArena Math Arena 用户匿名投票的最新AI大模型数学推理能力排行榜,涵盖各模型的 Elo 得分、95% 置信区间、投票量、机构与许可证。

榜首模型

deepseek-v4.1-flash-max

最高得分

1502.00

模型数量

395

数据版本

2026年09月30日

数据来源: LM Arena

关于本排行榜

本排行榜展示了当前 AI 大模型在数学推理任务中的实力排名。数据来源于 LMArena 的 Math 子赛道,通过真实用户匿名盲测投票评估各模型在数学解题任务中的表现。

评测方法概要

匿名盲测:用户提出数学题目后,由两个"隐藏身份"的模型分别作答,用户投票选出解题更优的一方,排除品牌偏见。

Elo 评分:采用 Bradley-Terry 模型计算 Elo 分数,分数越高说明该模型在数学场景中被用户更频繁地选择。

覆盖多种数学场景:包括代数、几何、计算推理、竞赛数学等多元化的真实数学任务。

DataLearner 在原始数据基础上提供中文解读与深度分析,并将排行榜模型关联至 DataLearner 模型库,方便您一键查看模型详情、API 定价、评测得分等完整信息。

榜单历史快照月份:

排名总表

排名模型名称得分95% CI投票数机构许可证
13DeepSeekdeepseek-v4.1-flash-maxDeepSeek1502.00+/-28408DeepSeekMIT
16Moonshotkimi-k3-maxMoonshot1500.00+/-171,190MoonshotKimi K3 license
18Alibabaqwen3.8-maxAlibaba1497.00+/-181,111AlibabaProprietary
35Moonshot AIKimi K2.6Moonshot AI1479.00+/-132,074Moonshot AIModified MIT
48Moonshot AIKimi K2 ThinkingMoonshot AI1471.00+/-94,151Moonshot AIModified MIT
53DeepSeekdeepseek-v4-pro-high-previewDeepSeek1466.00+/-122,706DeepSeekMIT
62Alibabaqwen3.8-27bAlibaba1458.00+/-20849AlibabaApache 2.0
63DeepSeekdeepseek-v4-pro-high-20260813DeepSeek1457.00+/-28406DeepSeekMIT
81DeepSeek-AIDeepSeek-V4-ProDeepSeek-AI1445.00+/-113,052DeepSeek-AIMIT
84Moonshot AIKimi K2.5 InstantMoonshot AI1443.00+/-24552Moonshot AIModified MIT
88DeepSeekdeepseek-v4-flash-high-previewDeepSeek1441.00+/-122,618DeepSeekMIT
92Moonshot AIKimi K2 Thinking (thinking-turbo)Moonshot AI1436.00+/-103,905Moonshot AIModified MIT
100MiniMaxAIMiniMax M3MiniMaxAI1433.00+/-112,854MiniMaxAIMiniMax Community License
103Tencenthunyuan-hy3-previewTencent1431.00+/-27429Tencenttencent-hunyuan-community
105DeepSeek-AIDeepSeek V3.2-Exp (thinking)DeepSeek-AI1428.00+/-112,623DeepSeek-AIMIT
109DeepSeek-AIDeepSeek V3.2DeepSeek-AI1427.00+/-113,129DeepSeek-AIMIT
115DeepSeek-AIDeepSeek-V4-FlashDeepSeek-AI1425.00+/-122,686DeepSeek-AIMIT
119Alibabaqwen3-max-2025-09-23Alibaba1423.00+/-24568AlibabaProprietary
120MiniMaxAIMiniMax-M2.7MiniMaxAI1422.00+/-103,977MiniMaxAIModified MIT
123DeepSeek-AIDeepSeek V3.2-Exp (thinking)DeepSeek-AI1421.00+/-27472DeepSeek-AIMIT
129Moonshot AIKimi K2 0905Moonshot AI1416.00+/-21750Moonshot AIModified MIT
132DeepSeek-AIDeepSeek-V3.1 (thinking)DeepSeek-AI1414.00+/-22656DeepSeek-AIMIT
133DeepSeek-AIDeepSeek-V3.1DeepSeek-AI1414.00+/-18977DeepSeek-AIMIT
134DeepSeek-AIDeepSeek V3.2-ExpDeepSeek-AI1413.00+/-20789DeepSeek-AIMIT
135DeepSeek-AIDeepSeek-R1DeepSeek-AI1412.00+/-141,606DeepSeek-AIMIT
145StepFunAIStep 3.5 FlashStepFunAI1407.00+/-103,419StepFunAIApache 2.0
154StepFunAIStep 3.5 FlashStepFunAI1401.00+/-113,375StepFunAIProprietary
160DeepSeek-AIDeepSeek-V3.1 TerminusDeepSeek-AI1397.00+/-39216DeepSeek-AIMIT
161Alibabaqwen3-235b-a22b-thinking-2507Alibaba1397.00+/-25477AlibabaApache 2.0
165DeepSeek-AIDeepSeek-R1-0528DeepSeek-AI1393.00+/-20852DeepSeek-AIMIT
166MiniMaxAIMiniMax M2.5MiniMaxAI1393.00+/-122,543MiniMaxAIModified MIT
167Alibabaqwen3-235b-a22b-no-thinkingAlibaba1392.00+/-122,355AlibabaApache 2.0
168MiniMaxAIM2.1MiniMaxAI1392.00+/-181,041MiniMaxAIMIT
174Moonshot AIKimi K2Moonshot AI1388.00+/-141,673Moonshot AIModified MIT
192MiniMaxminimax-m1MiniMax1370.00+/-141,756MiniMaxApache 2.0
193DeepSeek-AIDeepSeek-V3-0324DeepSeek-AI1368.00+/-103,147DeepSeek-AIMIT
199StepFunAIStep3StepFunAI1362.00+/-31349StepFunAIApache 2.0
209MiniMaxAIMiniMax M2MiniMaxAI1350.00+/-33317MiniMaxAIApache 2.0
214Tencenthunyuan-turbos-20250416Tencent1346.00+/-20845TencentProprietary
222Alibabaqwen-plus-0125Alibaba1323.00+/-19732AlibabaProprietary
229StepFunstep-2-16k-exp-202412StepFun1312.00+/-20642StepFunProprietary
233DeepSeek-AIDeepSeek-V3DeepSeek-AI1310.00+/-112,721DeepSeek-AIDeepSeek
240Alibabaqwen2.5-plus-1127Alibaba1303.00+/-141,404AlibabaProprietary
243Tencenthunyuan-turbos-20250226Tencent1301.00+/-31238TencentProprietary
246glm-4-plus-0111Zhipu1298.00+/-19721ZhipuProprietary
248StepFunstep-1o-turbo-202506StepFun1296.00+/-24559StepFunProprietary
253Tencenthunyuan-large-2025-02-10Tencent1293.00+/-24497TencentProprietary
254DeepSeekdeepseek-v2.5-1210DeepSeek1292.00+/-171,031DeepSeekDeepSeek
255Alibabaqwen-max-0919Alibaba1291.00+/-122,249AlibabaQwen
256Tencenthunyuan-standard-2025-02-10Tencent1290.00+/-24499TencentProprietary
259DeepSeek-AIDeepSeek V2.5DeepSeek-AI1287.00+/-103,649DeepSeek-AIDeepSeek
260glm-4-plusZhipu AI1287.00+/-103,599Zhipu AIProprietary
265Tencenthunyuan-large-visionTencent1281.00+/-30344TencentProprietary
266Tencenthunyuan-turbo-0110Tencent1279.00+/-31243TencentProprietary
275DeepSeekdeepseek-coder-v2DeepSeek1272.00+/-141,858DeepSeekDeepSeek License
290Tencenthunyuan-standard-256kTencent1249.00+/-29361TencentProprietary
323Alibabaqwen1.5-32b-chatAlibaba1201.00+/-122,649AlibabaQianwen LICENSE
347DeepSeek-AIDeepSeek LLM 67B ChatDeepSeek-AI1156.00+/-24576DeepSeek-AIDeepSeek License

数据仅供参考,以官方来源为准。模型名称旁的链接可跳转到 DataLearner 模型详情页。

常见问题 (FAQ)

01

什么是 LMArena Math Arena?

LMArena Math Arena 是 LMArena 旗下专注于数学推理能力的匿名评测平台。用户提交真实数学问题(如代数、几何、竞赛数学等),系统将不同模型的解题过程并排展示(隐藏模型名称),由用户投票选出更好的解答,最终通过 Elo 算法汇总形成动态排行榜。

02

Math Arena 与 MATH-500、AIME 等静态基准有什么区别?

MATH-500、AIME、AMC 等静态基准使用固定题目集和自动评分,可重现性强但容易被针对性优化("刷榜")。Math Arena 来自真实用户的开放式数学问题,测试内容不固定,更能反映模型在实际数学场景中的自然表现,两者互为补充。

03

思考模型(Thinking Model)在数学 Arena 中表现更好吗?

整体而言,具备思维链(Chain-of-Thought)或扩展推理能力的模型在数学 Arena 中往往排名更高。Claude Opus 系列 Thinking 模式、GPT 高算力模式以及 DeepSeek 思考版本均在榜单前列,说明延长推理时间对数学问题的解答质量有显著提升。

04

国产大模型在数学能力方面表现如何?

DeepSeek、Qwen3 系列、GLM 等国产模型在 Math Arena 表现亮眼,已跻身全球前列。DeepSeek 以 MIT 协议开源,Qwen3-235B 等系列支持中文数学场景,是选择开源数学推理模型的重要参考。