DataLearner 标志
返回总榜单

大模型代码编程能力评测排行榜

本页面提供大模型代码编程能力评测排行榜,涵盖 SWE-Bench Verified、SWE-Bench Pro、LiveCodeBench、SWE-bench Multilingual 等数据集,对 GPT、Claude、Qwen、DeepSeek 等模型进行对比。

数据更新于 2026-09-25 13:11:42

截至 2026年9月,本页覆盖 SWE-bench Verified, LiveCodeBench, SWE-Bench Pro - Public, SWE-bench Multilingual 等评测基准,聚焦 大模型代码编程能力评测排行榜 方向的模型对比。

点击模型名称可进入详情页查看上下文长度、许可方式与 API 价格。数据口径说明见 数据方法论。

代码能力参考综合排名

目前没有一个被普遍认可的代码能力综合排行榜。SWE-bench、HumanEval 等静态基准可以衡量特定技能,但容易被针对性优化("刷榜")。为此我们选取了两个切入角度不同的人类偏好参考榜单并列展示:LMArena Coding Arena 通过匿名盲测评测通用编程能力(调试、算法实现、代码生成等);Design Arena 专注评测具有视觉呈现效果的前端代码生成(网站、UI 组件、游戏等),两者方法论相同但考察场景各异,结合参考效果最佳。

LMArena Coding Arena

完整排名

基于真实开发者提交的通用编程任务(调试、算法、代码生成)进行匿名 A/B 盲测投票,Elo 算法动态排名。

数据更新于 2026-09-30

#模型Elo
1
Google
gemini-4-argon-high
1559
2
Anthropic
claude-fable-5-high
1552
4
1551
5
1547
6
Anthropic
Opus 4.7
1547
7
Moonshot
kimi-k3-max
1541
8
X
mimo-v2.6-pro
1540
9
OpenAI
gpt-6-astra-max
1539
10
Meta
muse-spark-1.3-max
1539
来源:LMArena

Design Arena

完整排名

基于 Arcada Labs 平台,对视觉前端代码任务(网站、UI 组件、游戏、数据可视化等)进行匿名投票,Bradley-Terry 模型动态排名。

数据更新于 2026-10-01

#模型Elo
1
Anthropic
Claude Opus 5.5
1395
3
Moonshot AI
Kimi K3
1372
5
Meta
Muse Spark 1.3 (xhigh)
1359
6
Meta
Muse Spark 1.3 Max
1358
8
1342
9
Anthropic
Claude Opus 5
1329
10
DeepSeek
DeepSeek-V4.1-Flash
1329
来源:DesignArena

榜单亮点

按 SWE-Bench Pro - Public 排序

大模型性能评测结果

数据来源:DataLearnerAI

点击任意行查看模型详情;勾选左侧 可对比最多 4 个模型。

Qwen3.8-Max阿里巴巴
思考水平 · 极高工具
SWE-bench Verified—
LiveCodeBench—
SWE-Bench Pro - Public67.70
SWE-bench Multilingual—
有条件商用
SWE-bench Verified—
LiveCodeBench—
SWE-Bench Pro - Public65.70
SWE-bench Multilingual82.90
免费商用
Qwen3.8-Flash-Next阿里巴巴
思考水平 · 极高工具
SWE-bench Verified—
LiveCodeBench—
SWE-Bench Pro - Public62.50
SWE-bench Multilingual81.00
有条件商用
4
GLM-5.2智谱AI
开启思考工具
SWE-bench Verified—
LiveCodeBench—
SWE-Bench Pro - Public62.10
SWE-bench Multilingual—
免费商用
5
Qwen3.8-27B阿里巴巴
开启思考工具
SWE-bench Verified—
LiveCodeBench—
SWE-Bench Pro - Public61.70
SWE-bench Multilingual—
免费商用
6
Qwen3.7 Max阿里巴巴
开启思考工具
SWE-bench Verified80.40
LiveCodeBench—
SWE-Bench Pro - Public60.60
SWE-bench Multilingual78.30
闭源
7
MiniMax M3MiniMaxAI
开启思考工具
SWE-bench Verified—
LiveCodeBench—
SWE-Bench Pro - Public59.00
SWE-bench Multilingual—
不可商用
8
Kimi K2.6Moonshot AI
开启思考工具
SWE-bench Verified80.20
LiveCodeBench—
SWE-Bench Pro - Public58.60
SWE-bench Multilingual76.70
免费商用
9
GLM 5.1智谱AI
开启思考工具
SWE-bench Verified—
LiveCodeBench—
SWE-Bench Pro - Public58.40
SWE-bench Multilingual—
免费商用
10
Hy3腾讯AI实验室
开启思考工具
SWE-bench Verified78.00
LiveCodeBench—
SWE-Bench Pro - Public57.90
SWE-bench Multilingual75.80
免费商用
11
Qwen3.6-Max-Preview阿里巴巴
深度思考模式工具
SWE-bench Verified—
LiveCodeBench—
SWE-Bench Pro - Public57.30
SWE-bench Multilingual—
闭源
SWE-bench Verified78.80
LiveCodeBench—
SWE-Bench Pro - Public56.60
SWE-bench Multilingual—
闭源
SWE-bench Verified78.80
LiveCodeBench—
SWE-Bench Pro - Public56.60
SWE-bench Multilingual73.80
闭源
SWE-bench Verified—
LiveCodeBench87.10
SWE-Bench Pro - Public56.60
SWE-bench Multilingual73.80
闭源
15
Step 3.7 FlashStepFunAI
开启思考工具
SWE-bench Verified—
LiveCodeBench—
SWE-Bench Pro - Public56.30
SWE-bench Multilingual—
免费商用
16
MiniMax-M2.7MiniMaxAI
开启思考工具
SWE-bench Verified—
LiveCodeBench—
SWE-Bench Pro - Public56.20
SWE-bench Multilingual76.50
不可商用
17
DeepSeek-V4-ProDeepSeek-AI
思考水平 · 极高工具
SWE-bench Verified80.60
LiveCodeBench—
SWE-Bench Pro - Public55.40
SWE-bench Multilingual76.20
免费商用
18
MiniMax M2.5MiniMaxAI
开启思考工具
SWE-bench Verified80.20
LiveCodeBench—
SWE-Bench Pro - Public55.40
SWE-bench Multilingual—
免费商用
19
DeepSeek-V4-ProDeepSeek-AI
开启思考工具
SWE-bench Verified79.40
LiveCodeBench—
SWE-Bench Pro - Public54.40
SWE-bench Multilingual74.10
免费商用
20
Qwen3.6-27B阿里巴巴
开启思考工具
SWE-bench Verified77.20
LiveCodeBench—
SWE-Bench Pro - Public53.50
SWE-bench Multilingual71.30
免费商用
21
DeepSeek-V4-FlashDeepSeek-AI
思考水平 · 极高工具
SWE-bench Verified79.00
LiveCodeBench—
SWE-Bench Pro - Public52.60
SWE-bench Multilingual73.30
免费商用
22
SWE-bench Verified78.60
LiveCodeBench—
SWE-Bench Pro - Public52.30
SWE-bench Multilingual70.20
免费商用
23
DeepSeek-V4-ProDeepSeek-AI
常规模式工具
SWE-bench Verified73.60
LiveCodeBench—
SWE-Bench Pro - Public52.10
SWE-bench Multilingual69.80
免费商用
SWE-bench Verified—
LiveCodeBench83.60
SWE-Bench Pro - Public50.90
SWE-bench Multilingual69.30
免费商用
25
Kimi K2.5Moonshot AI
开启思考工具
SWE-bench Verified76.80
LiveCodeBench—
SWE-Bench Pro - Public50.70
SWE-bench Multilingual—
免费商用
SWE-bench Verified73.40
LiveCodeBench80.40
SWE-Bench Pro - Public49.50
SWE-bench Multilingual67.20
免费商用
27
SWE-bench Verified73.70
LiveCodeBench—
SWE-Bench Pro - Public49.10
SWE-bench Multilingual69.70
免费商用
SWE-bench Verified76.50
LiveCodeBench—
SWE-Bench Pro - Public46.90
SWE-bench Multilingual71.70
闭源
29
SWE-bench Verified70.60
LiveCodeBench—
SWE-Bench Pro - Public44.30
SWE-bench Multilingual—
免费商用
SWE-bench Verified70.20
LiveCodeBench83.30
SWE-Bench Pro - Public40.90
SWE-bench Multilingual—
免费商用
31
GLM-4.7智谱AI
开启思考工具
SWE-bench Verified73.80
LiveCodeBench—
SWE-Bench Pro - Public40.60
SWE-bench Multilingual—
免费商用
32
M2.1MiniMaxAI
开启思考工具
SWE-bench Verified—
LiveCodeBench—
SWE-Bench Pro - Public32.60
SWE-bench Multilingual—
免费商用
SWE-bench Verified69.20
LiveCodeBench—
SWE-Bench Pro - Public27.67
SWE-bench Multilingual—
免费商用
34
GLM-5智谱AI
开启思考
SWE-bench Verified77.80
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
35
SWE-bench Verified76.40
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified75.30
LiveCodeBench85.90
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
37
M2.1MiniMaxAI
开启思考
SWE-bench Verified74.80
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified74.40
LiveCodeBench86.40
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
39
DeepSeek V3.2DeepSeek-AI
开启思考工具
SWE-bench Verified73.10
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified72.40
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
41
Kimi K2 ThinkingMoonshot AI
开启思考工具
SWE-bench Verified71.30
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified69.60
LiveCodeBench57.50
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
43
MiniMax M2MiniMaxAI
开启思考工具
SWE-bench Verified69.40
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
44
Kimi K2 0905Moonshot AI
开启思考工具
SWE-bench Verified69.20
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified68.40
LiveCodeBench74.90
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified68.00
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
47
GLM-4.6智谱AI
开启思考工具
SWE-bench Verified68.00
LiveCodeBench84.50
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
48
SWE-bench Verified67.80
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified67.00
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified66.00
LiveCodeBench56.40
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
排序:
已显示 50 / 115 个模型查看 SWE-Bench Pro - Public 基准测试完整页面