DataLearner 标志

LMArena Coding Arena 代码能力排行榜

基于 LMArena Coding Arena 用户匿名投票的最新AI大模型代码编程能力排行榜,涵盖各模型的 Elo 得分、95% 置信区间、投票量、机构与许可证。

榜首模型

kimi-k3-max

最高得分

1541.00

模型数量

405

数据版本

2026年09月30日

数据来源: LM Arena

关于本排行榜

本排行榜展示了当前 AI 大模型在代码编程任务中的实力排名。数据来源于 LMArena (前身为 LMSYS Chatbot Arena)的 Coding 子赛道,通过真实用户匿名盲测投票评估各模型在代码编程任务中的表现。

评测方法概要

匿名盲测:用户发出编程问题后,由两个"隐藏身份"的模型分别给出代码解答,用户投票选出更好的回答,排除品牌偏见。

Elo 评分:采用 Bradley-Terry 模型计算 Elo 分数,分数越高说明该模型的代码回答越容易被用户选择。

覆盖多种编程场景:包括代码生成、Bug 修复、算法实现、代码解释等高频真实编程场景。

DataLearner 在原始数据基础上提供中文解读与深度分析,并将排行榜模型关联至 DataLearner 模型库,方便您一键查看模型详情、API 定价、评测得分等完整信息。

榜单历史快照月份:

排名总表

排名模型名称得分95% CI投票数机构许可证
7Moonshotkimi-k3-maxMoonshot1541.00+/-87,165MoonshotKimi K3 license
23DeepSeekdeepseek-v4.1-flash-maxDeepSeek1529.00+/-122,314DeepSeekMIT
29Alibabaqwen3.8-maxAlibaba1522.00+/-86,480AlibabaProprietary
41Moonshot AIKimi K2.6Moonshot AI1516.00+/-711,069Moonshot AIModified MIT
63DeepSeekdeepseek-v4-pro-high-20260813DeepSeek1506.00+/-112,815DeepSeekMIT
65Alibabaqwen3.8-27bAlibaba1505.00+/-95,005AlibabaApache 2.0
68Moonshot AIKimi K2.5 InstantMoonshot AI1503.00+/-141,868Moonshot AIModified MIT
69Moonshot AIKimi K2 ThinkingMoonshot AI1502.00+/-520,732Moonshot AIModified MIT
76DeepSeek-AIDeepSeek-V4-ProDeepSeek-AI1500.00+/-617,135DeepSeek-AIMIT
82MiniMaxAIMiniMax M3MiniMaxAI1495.00+/-616,800MiniMaxAIMiniMax Community License
95DeepSeekdeepseek-v4-pro-high-previewDeepSeek1488.00+/-616,000DeepSeekMIT
97Moonshot AIKimi K2 Thinking (thinking-turbo)Moonshot AI1486.00+/-515,272Moonshot AIModified MIT
100DeepSeek-AIDeepSeek-V4-FlashDeepSeek-AI1484.00+/-615,253DeepSeek-AIMIT
106MiniMaxAIMiniMax-M2.7MiniMaxAI1480.00+/-522,747MiniMaxAIModified MIT
108DeepSeekdeepseek-v4-flash-high-previewDeepSeek1479.00+/-615,210DeepSeekMIT
111DeepSeek-AIDeepSeek V3.2-Exp (thinking)DeepSeek-AI1476.00+/-78,876DeepSeek-AIMIT
112DeepSeek-AIDeepSeek V3.2-Exp (thinking)DeepSeek-AI1475.00+/-131,916DeepSeek-AIMIT
116Alibabaqwen3-max-2025-09-23Alibaba1473.00+/-132,017AlibabaProprietary
121DeepSeek-AIDeepSeek V3.2DeepSeek-AI1469.00+/-610,909DeepSeek-AIMIT
123Moonshot AIKimi K2 0905Moonshot AI1467.00+/-132,224Moonshot AIModified MIT
125DeepSeek-AIDeepSeek V3.2-ExpDeepSeek-AI1467.00+/-122,537DeepSeek-AIMIT
128DeepSeek-AIDeepSeek-R1-0528DeepSeek-AI1464.00+/-112,681DeepSeek-AIMIT
133DeepSeek-AIDeepSeek-V3.1 Terminus (thinking)DeepSeek-AI1460.00+/-24631DeepSeek-AIMIT
136Moonshot AIKimi K2Moonshot AI1460.00+/-85,169Moonshot AIModified MIT
144DeepSeek-AIDeepSeek-V3.1 (thinking)DeepSeek-AI1456.00+/-131,871DeepSeek-AIMIT
147Tencenthunyuan-hy3-previewTencent1453.00+/-132,052Tencenttencent-hunyuan-community
151StepFunAIStep 3.5 FlashStepFunAI1449.00+/-615,171StepFunAIApache 2.0
153DeepSeek-AIDeepSeek-V3.1DeepSeek-AI1447.00+/-122,594DeepSeek-AIMIT
155MiniMaxAIMiniMax M2.5MiniMaxAI1446.00+/-611,348MiniMaxAIModified MIT
156Alibabaqwen3-235b-a22b-no-thinkingAlibaba1445.00+/-86,893AlibabaApache 2.0
157DeepSeek-AIDeepSeek-R1DeepSeek-AI1444.00+/-122,317DeepSeek-AIMIT
161Alibabaqwen3-235b-a22b-thinking-2507Alibaba1442.00+/-151,587AlibabaApache 2.0
162DeepSeek-AIDeepSeek-V3.1 TerminusDeepSeek-AI1440.00+/-21770DeepSeek-AIMIT
163MiniMaxAIM2.1MiniMaxAI1438.00+/-103,483MiniMaxAIMIT
166Tencenthunyuan-vision-1.5-thinkingTencent1436.00+/-27419TencentProprietary
168StepFunAIStep 3.5 FlashStepFunAI1436.00+/-617,684StepFunAIProprietary
182DeepSeek-AIDeepSeek-V3-0324DeepSeek-AI1428.00+/-78,292DeepSeek-AIMIT
191MiniMaxminimax-m1MiniMax1416.00+/-86,357MiniMaxApache 2.0
199StepFunAIStep3StepFunAI1409.00+/-171,207StepFunAIApache 2.0
207Tencenthunyuan-turbos-20250226Tencent1399.00+/-30275TencentProprietary
210Tencenthunyuan-turbos-20250416Tencent1394.00+/-141,757TencentProprietary
220DeepSeek-AIDeepSeek-V3DeepSeek-AI1387.00+/-103,280DeepSeek-AIDeepSeek
228MiniMaxAIMiniMax M2MiniMaxAI1381.00+/-151,537MiniMaxAIApache 2.0
231Alibabaqwen-plus-0125Alibaba1379.00+/-18893AlibabaProprietary
233DeepSeekdeepseek-v2.5-1210DeepSeek1374.00+/-171,079DeepSeekDeepSeek
236StepFunstep-2-16k-exp-202412StepFun1371.00+/-20737StepFunProprietary
237Tencenthunyuan-turbo-0110Tencent1371.00+/-30299TencentProprietary
244DeepSeek-AIDeepSeek V2.5DeepSeek-AI1368.00+/-94,252DeepSeek-AIDeepSeek
245Tencenthunyuan-large-2025-02-10Tencent1366.00+/-25519TencentProprietary
256Tencenthunyuan-large-visionTencent1357.00+/-19951TencentProprietary
257Alibabaqwen2.5-plus-1127Alibaba1356.00+/-141,553AlibabaProprietary
263Alibabaqwen-max-0919Alibaba1353.00+/-112,756AlibabaQwen
264glm-4-plusZhipu AI1352.00+/-94,449Zhipu AIProprietary
265StepFunstep-1o-turbo-202506StepFun1351.00+/-151,482StepFunProprietary
273DeepSeekdeepseek-coder-v2DeepSeek1342.00+/-122,671DeepSeekDeepSeek License
282Tencenthunyuan-standard-2025-02-10Tencent1331.00+/-24549TencentProprietary
283glm-4-plus-0111Zhipu1330.00+/-18894ZhipuProprietary
305Tencenthunyuan-standard-256kTencent1301.00+/-24497TencentProprietary
330Alibabaqwen1.5-32b-chatAlibaba1262.00+/-113,930AlibabaQianwen LICENSE
350DeepSeek-AIDeepSeek LLM 67B ChatDeepSeek-AI1219.00+/-23649DeepSeek-AIDeepSeek License

数据仅供参考,以官方来源为准。模型名称旁的链接可跳转到 DataLearner 模型详情页。

常见问题 (FAQ)

01

什么是 LMArena Coding Arena?

LMArena Coding Arena 是 LMArena 旗下专注于代码能力的匿名评测平台。用户提交真实编程任务(如调试、代码生成、算法实现),系统将不同模型的输出并排展示(隐藏模型名称),由用户投票选出更好的答案,最终通过 Elo 算法汇总形成动态排行榜。

02

Coding Arena 与 SWE-bench、HumanEval 等静态基准有什么区别?

SWE-bench、HumanEval、MBPP 等静态基准使用固定测试集和自动化评分,可重现性强但容易被针对性优化("刷榜")。Coding Arena 来自真实用户的开放式需求,测试内容不固定,更能反映模型在实际编程场景中的表现,两者互为补充。

03

国产大模型在代码能力方面表现如何?

DeepSeek、Qwen 等国产模型在 Coding Arena 表现亮眼,已跻身全球前列。DeepSeek 以 MIT 协议开源,Qwen 系列支持中文编程场景,是开发者选择开源代码模型的重要参考。

04

如何用 AI 辅助日常编程工作?

常见场景包括:代码补全与生成、调试、代码审查、单元测试生成,以及跨语言翻译。