Arcada Labs Code Categories Arena 代码能力排行榜
基于 Arcada Labs Code Categories Arena 用户匿名投票的最新AI大模型代码能力排行榜,通过 Bradley-Terry 模型对 Website、UI Component、Game Dev、Data Visualization 等代码子类别进行综合评分与排名。
榜首模型
Kimi K3
最高得分
1417.00
模型数量
147
数据版本
2026年08月02日
数据来源: Arcada Labs
排名总表
| 排名 | 模型名称 | 得分 | 95% CI | 投票数 | 机构 | 许可证 |
|---|---|---|---|---|---|---|
Kimi K3Moonshot AI | 1417.00 | +/-11.4 | 4,230 | Moonshot AI | Open Source | |
Claude Opus 5Anthropic | 1356.00 | +/-11.2 | 4,064 | Anthropic | Proprietary | |
GPT-5.6 SolOpenAI | 1352.00 | +/-9.1 | 6,377 | OpenAI | Proprietary | |
| 4 | GLM-5.2智谱AI | 1343.00 | +/-6.7 | 11,968 | 智谱AI | Open Source |
| 5 | Claude Fable 5Anthropic | 1342.00 | +/-8.3 | 7,668 | Anthropic | Proprietary |
| 6 | Claude Opus 4.6Anthropic | 1323.00 | +/-4.9 | 24,836 | Anthropic | Proprietary |
| 7 | Claude Opus 4.6 (thinking)Anthropic | 1318.00 | +/-5.1 | 21,528 | Anthropic | Proprietary |
| 8 | Opus 4.7Anthropic | 1318.00 | +/-5.3 | 20,178 | Anthropic | Proprietary |
| 9 | Gemini 3.6 FlashGoogle | 1315.00 | +/-8 | 8,028 | Proprietary | |
| 10 | 1312.00 | +/-6.8 | 11,519 | xAI | Proprietary | |
| 11 | MiMo-V2.5-ProXiaomi | 1309.00 | +/-6.6 | 11,931 | Xiaomi | Open Source |
| 12 | Qwen3.7 Max阿里巴巴 | 1308.00 | +/-5.4 | 19,121 | 阿里巴巴 | Proprietary |
| 13 | Kimi K2.6Moonshot AI | 1307.00 | +/-4.7 | 26,255 | Moonshot AI | Open Source |
| 14 | Claude Sonnet 4.6Anthropic | 1306.00 | +/-4.9 | 24,267 | Anthropic | Proprietary |
| 15 | GLM 5.1智谱AI | 1306.00 | +/-6 | 14,917 | 智谱AI | Open Source |
| 16 | Muse Spark 1.1Facebook AI研究实验室 | 1303.00 | +/-9.2 | 5,891 | Facebook AI研究实验室 | Proprietary |
| 17 | Claude Sonnet 5Anthropic | 1301.00 | +/-7.5 | 9,043 | Anthropic | Proprietary |
| 18 | GLM-5-Turbo智谱AI | 1299.00 | +/-4.5 | 28,910 | 智谱AI | Proprietary |
| 19 | MiMo-V2.5Xiaomi | 1291.00 | +/-4.3 | 32,360 | Xiaomi | Open Source |
| 20 | Kimi K2.7 CodeMoonshot AI | 1290.00 | +/-6.8 | 11,053 | Moonshot AI | Open Source |
| 21 | Qwen3.7-Plus阿里巴巴 | 1290.00 | +/-10.9 | 4,113 | 阿里巴巴 | Proprietary |
| 22 | Gemini 3.5 FlashGoogle Deep Mind | 1289.00 | +/-5.2 | 20,164 | Google Deep Mind | Proprietary |
| 23 | 1285.00 | +/-5.9 | 15,309 | MiniMaxAI | Open Source | |
| 24 | GPT-5.5OpenAI | 1284.00 | +/-5.4 | 18,811 | OpenAI | Proprietary |
| 25 | Muse SparkFacebook AI研究实验室 | 1281.00 | +/-10.9 | 4,249 | Facebook AI研究实验室 | Proprietary |
| 26 | GLM-5智谱AI | 1277.00 | +/-3.8 | 45,314 | 智谱AI | Open Source |
| 27 | DeepSeek-V4-ProDeepSeek-AI | 1273.00 | +/-5.2 | 20,232 | DeepSeek-AI | Open Source |
| 28 | Opus 4.5Anthropic | 1272.00 | +/-4.1 | 35,011 | Anthropic | Proprietary |
| 29 | Claude Opus 4.8Anthropic | 1271.00 | +/-5.3 | 19,003 | Anthropic | Proprietary |
| 30 | Nex N2 ProNex AGI | 1271.00 | +/-8.3 | 7,172 | Nex AGI | Open Source |
| 31 | Gemini 3.1 Pro PreviewGoogle Deep Mind | 1271.00 | +/-4.9 | 23,843 | Google Deep Mind | Proprietary |
| 32 | Kimi K2.5 (thinking)Moonshot AI | 1267.00 | +/-3.9 | 41,111 | Moonshot AI | Open Source |
| 33 | GPT-5.6 TerraOpenAI | 1265.00 | +/-9.7 | 5,274 | OpenAI | Proprietary |
| 34 | 1264.00 | +/-4.2 | 33,180 | MiniMaxAI | Open Source | |
| 35 | Qwen 3.6 Plus Preview阿里巴巴 | 1264.00 | +/-4.6 | 26,529 | 阿里巴巴 | Proprietary |
| 36 | Gemini 3.1 Pro PreviewGoogle Deep Mind | 1259.00 | +/-4 | 38,463 | Google Deep Mind | Proprietary |
| 37 | GLM-5V-Turbo智谱AI | 1259.00 | +/-4.2 | 33,892 | 智谱AI | Proprietary |
| 38 | Hy3腾讯AI实验室 | 1257.00 | +/-6.2 | 13,662 | 腾讯AI实验室 | Open Source |
| 39 | GPT-5.6 LunaOpenAI | 1252.00 | +/-10 | 4,997 | OpenAI | Proprietary |
| 40 | 1248.00 | +/-4.5 | 28,838 | xAI | Proprietary | |
| 41 | GLM-4.7智谱AI | 1247.00 | +/-3.6 | 46,802 | 智谱AI | Open Source |
| 42 | GPT-5.4 (Design Skill, Medium)OpenAI | 1241.00 | +/-7.3 | 9,604 | OpenAI | Proprietary |
| 43 | GPT-5.4 (medium)OpenAI | 1239.00 | +/-5.3 | 18,950 | OpenAI | Proprietary |
| 44 | InklingThinking Machines Lab | 1238.00 | +/-12.4 | 3,183 | Thinking Machines Lab | Open Source |
| 45 | 1237.00 | +/-6.7 | 11,504 | MiniMaxAI | Open Source | |
| 46 | DeepSeek-V4-FlashDeepSeek-AI | 1235.00 | +/-4.6 | 27,456 | DeepSeek-AI | Open Source |
| 47 | 1232.00 | +/-4.3 | 31,036 | xAI | Proprietary | |
| 48 | 1220.00 | +/-5.1 | 20,805 | MiniMaxAI | Open Source | |
| 49 | Gemini 3.0 FlashGoogle Deep Mind | 1219.00 | +/-10.6 | 4,414 | Google Deep Mind | Proprietary |
| 50 | 1216.00 | +/-4.8 | 23,910 | xAI | Proprietary | |
| 51 | Claude Sonnet 4.5Anthropic | 1213.00 | +/-3.7 | 43,705 | Anthropic | Proprietary |
| 52 | Claude Sonnet 4.5 (thinking)Anthropic | 1212.00 | +/-3.7 | 42,668 | Anthropic | Proprietary |
| 53 | GPT-5.4 (low)OpenAI | 1209.00 | +/-5.1 | 21,125 | OpenAI | Proprietary |
| 54 | Qwen3.5-397B-A17B阿里巴巴 | 1209.00 | +/-7.9 | 8,131 | 阿里巴巴 | Open Source |
| 55 | GPT-5.4 (None)OpenAI | 1208.00 | +/-4.8 | 23,583 | OpenAI | Proprietary |
| 56 | GLM-4.7-Flash智谱AI | 1207.00 | +/-6.6 | 11,706 | 智谱AI | Open Source |
| 57 | Claude Sonnet 3.7Anthropic | 1206.00 | +/-5.9 | 15,245 | Anthropic | Proprietary |
| 58 | Hy3 (low)腾讯AI实验室 | 1206.00 | +/-11.2 | 4,038 | 腾讯AI实验室 | Open Source |
| 59 | DeepSeek-V3.1 (thinking)DeepSeek-AI | 1205.00 | +/-5.7 | 16,258 | DeepSeek-AI | Open Source |
| 60 | Step 3.7 FlashStepFunAI | 1203.00 | +/-5.8 | 15,834 | StepFunAI | Open Source |
| 61 | Opus 4.1 (thinking)Anthropic | 1201.00 | +/-5.8 | 15,677 | Anthropic | Proprietary |
| 62 | GPT-5.1 (high)OpenAI | 1201.00 | +/-5.7 | 16,056 | OpenAI | Proprietary |
| 63 | DeepSeek V3.2-ExpDeepSeek-AI | 1200.00 | +/-5.2 | 19,490 | DeepSeek-AI | Open Source |
| 64 | GPT-5.2 (None)OpenAI | 1199.00 | +/-4.4 | 28,885 | OpenAI | Proprietary |
| 65 | GPT-5.2 (medium)OpenAI | 1199.00 | +/-4.5 | 27,939 | OpenAI | Proprietary |
| 66 | GPT-5 (high)OpenAI | 1198.00 | +/-6.2 | 13,397 | OpenAI | Proprietary |
| 67 | GLM-4.6智谱AI | 1196.00 | +/-5.6 | 16,911 | 智谱AI | Open Source |
| 68 | Qwen3.5 Plus (0215)阿里巴巴 | 1196.00 | +/-5.4 | 18,505 | 阿里巴巴 | Proprietary |
| 69 | GLM-4.5智谱AI | 1195.00 | +/-5.2 | 19,637 | 智谱AI | Open Source |
| 70 | GPT-5 (minimal)OpenAI | 1195.00 | +/-4.2 | 32,857 | OpenAI | Proprietary |
| 71 | GPT-5.2 (low)OpenAI | 1195.00 | +/-4.6 | 25,456 | OpenAI | Proprietary |
| 72 | Opus 4.1Anthropic | 1194.00 | +/-3.9 | 39,517 | Anthropic | Proprietary |
| 73 | DeepSeek V3.2DeepSeek-AI | 1194.00 | +/-4.4 | 29,097 | DeepSeek-AI | Open Source |
| 74 | GPT-5.1 (medium)OpenAI | 1191.00 | +/-5 | 21,288 | OpenAI | Proprietary |
| 75 | Claude Opus 4Anthropic | 1190.00 | +/-5.6 | 16,669 | Anthropic | Proprietary |
| 76 | GPT-5.1 (low)OpenAI | 1186.00 | +/-4.9 | 22,157 | OpenAI | Proprietary |
| 77 | MiMo-V2-FlashXiaomi | 1185.00 | +/-4.1 | 35,231 | Xiaomi | Open Source |
| 78 | Gemini 2.5 ProGoogle Deep Mind | 1183.00 | +/-8.6 | 7,044 | Google Deep Mind | Proprietary |
| 79 | GPT-5.1 CodexOpenAI | 1180.00 | +/-16.4 | 1,807 | OpenAI | Proprietary |
| 80 | GPT-5.1 (None)OpenAI | 1180.00 | +/-4.9 | 22,270 | OpenAI | Proprietary |
| 81 | GPT-5.2 (high)OpenAI | 1179.00 | +/-10.8 | 4,167 | OpenAI | Proprietary |
| 82 | GPT-5.3 CodexOpenAI | 1174.00 | +/-5.8 | 15,668 | OpenAI | Proprietary |
| 83 | Qwen3-Coder-480B-A35B阿里巴巴 | 1173.00 | +/-16.3 | 1,958 | 阿里巴巴 | Open Source |
| 84 | Mistral Large 3MistralAI | 1172.00 | +/-4.3 | 30,428 | MistralAI | Open Source |
| 85 | Claude Sonnet 4Anthropic | 1171.00 | +/-5.5 | 17,532 | Anthropic | Proprietary |
| 86 | DeepSeek-R1-0528DeepSeek-AI | 1168.00 | +/-5.4 | 17,944 | DeepSeek-AI | Open Source |
| 87 | GLM-4.5-Air智谱AI | 1167.00 | +/-5.5 | 17,256 | 智谱AI | Open Source |
| 88 | Claude Sonnet 4 (thinking)Anthropic | 1166.00 | +/-5.7 | 16,227 | Anthropic | Proprietary |
| 89 | AGI-01 SwiftLucidQuery | 1165.00 | +/-20.3 | 1,233 | LucidQuery | Proprietary |
| 90 | 1165.00 | +/-6.8 | 10,828 | MiniMaxAI | Open Source | |
| 91 | Nemotron 3 UltraNVIDIA | 1156.00 | +/-6.7 | 12,324 | NVIDIA | Open Source |
| 92 | AesCoder-4BDesignFlow | 1154.00 | +/-3.9 | 39,677 | DesignFlow | Open Source |
| 93 | Mistral Medium 3.5MistralAI | 1151.00 | +/-7 | 10,901 | MistralAI | Open Source |
| 94 | Mistral Medium 3.1 (2508)Mistral | 1150.00 | +/-4.5 | 27,678 | Mistral | Proprietary |
| 95 | Trinity Large ThinkingArcee AI | 1147.00 | +/-6.5 | 12,846 | Arcee AI | Open Source |
| 96 | Haiku 4.5Anthropic | 1144.00 | +/-4.1 | 35,511 | Anthropic | Proprietary |
| 97 | GPT-5-miniOpenAI | 1144.00 | +/-4 | 37,061 | OpenAI | Proprietary |
| 98 | DeepSeek-V3.1DeepSeek-AI | 1142.00 | +/-5.1 | 20,278 | DeepSeek-AI | Open Source |
| 99 | Qwen3-Max-Thinking阿里巴巴 | 1139.00 | +/-4.2 | 33,357 | 阿里巴巴 | Proprietary |
| 100 | DeepSeek-V3-0324DeepSeek-AI | 1138.00 | +/-5.2 | 19,257 | DeepSeek-AI | Open Source |
| 101 | Prime Intellect: INTELLECT-3Prime Intellect | 1136.00 | +/-4.3 | 31,349 | Prime Intellect | Open Source |
| 102 | Gemini 2.5 Flash-Preview-09-2025Google Deep Mind | 1134.00 | +/-5.3 | 19,299 | Google Deep Mind | Proprietary |
| 103 | 1130.00 | +/-4 | 36,636 | xAI | Proprietary | |
| 104 | Kimi K2 0905Moonshot AI | 1128.00 | +/-17.9 | 1,504 | Moonshot AI | Open Source |
| 105 | GPT-5.1 Codex MiniOpenAI | 1123.00 | +/-4.2 | 33,813 | OpenAI | Proprietary |
| 106 | 1122.00 | +/-4.2 | 33,404 | xAI | Proprietary | |
| 107 | 1117.00 | +/-4.3 | 31,110 | xAI | Proprietary | |
| 108 | GPT-5-NanoOpenAI | 1114.00 | +/-8.6 | 6,710 | OpenAI | Proprietary |
| 109 | Kimi K2 Turbo PreviewMoonshot AI | 1113.00 | +/-15.2 | 2,094 | Moonshot AI | Open Source |
| 110 | Gemini 2.5 Flash-Lite-Preview-09-2025Google Deep Mind | 1111.00 | +/-8.5 | 6,860 | Google Deep Mind | Proprietary |
| 111 | Gemini 3.1 Flash-LiteGoogle Deep Mind | 1101.00 | +/-5 | 23,530 | Google Deep Mind | Proprietary |
| 112 | Phi-3-medium 14B-previewMicrosoft Azure | 1099.00 | +/-8.9 | 6,396 | Microsoft Azure | Proprietary |
| 113 | Ministral 3 14BMistralAI | 1095.00 | +/-14.4 | 2,379 | MistralAI | Open Source |
| 114 | Gemini 2.5 FlashGoogle Deep Mind | 1089.00 | +/-8.5 | 6,960 | Google Deep Mind | Proprietary |
| 115 | v0-1.5-mdVercel | 1086.00 | +/-6.9 | 11,081 | Vercel | Proprietary |
| 116 | Ministral 3 8BMistralAI | 1083.00 | +/-14.3 | 2,427 | MistralAI | Open Source |
| 117 | 1082.00 | +/-4.6 | 26,862 | xAI | Proprietary | |
| 118 | 1080.00 | +/-4.1 | 37,373 | xAI | Proprietary | |
| 119 | Qwen3-235B-A22B-2507阿里巴巴 | 1068.00 | +/-8.6 | 6,932 | 阿里巴巴 | Open Source |
| 120 | Kimi K2Moonshot AI | 1063.00 | +/-19.5 | 1,352 | Moonshot AI | Open Source |
| 121 | Magistral Medium 1.2 (2509)Mistral | 1063.00 | +/-9.4 | 5,851 | Mistral | Proprietary |
| 122 | Qwen3-235B-A22B-Thinking-2507Alibaba | 1062.00 | +/-9.1 | 6,169 | Alibaba | Open Source |
| 123 | GPT-4.1OpenAI | 1055.00 | +/-17.3 | 1,747 | OpenAI | Proprietary |
| 124 | OpenAI o3OpenAI | 1049.00 | +/-19.5 | 1,365 | OpenAI | Proprietary |
| 125 | 1046.00 | +/-4.9 | 23,998 | xAI | Proprietary | |
| 126 | Devstral MediumMistralAI | 1042.00 | +/-8.6 | 7,158 | MistralAI | Proprietary |
| 127 | Ministral 3 3B (2512)Mistral | 1040.00 | +/-13.5 | 2,852 | Mistral | Open Source |
| 128 | Codestral 2508Mistral | 1037.00 | +/-8.8 | 6,745 | Mistral | Proprietary |
| 129 | Qwen3-235B-A22B阿里巴巴 | 1032.00 | +/-10.1 | 5,154 | 阿里巴巴 | Open Source |
| 130 | 1029.00 | +/-11.1 | 4,295 | xAI | Proprietary | |
| 131 | GPT-4.1 miniOpenAI | 1023.00 | +/-18.3 | 1,566 | OpenAI | Proprietary |
| 132 | Mercury 2Inception | 1022.00 | +/-8.6 | 10,152 | Inception | Proprietary |
| 133 | Magistral Small 1.2 (2509)Mistral | 1015.00 | +/-9.2 | 6,448 | Mistral | Open Source |
| 134 | OpenAI o4 - miniOpenAI | 1005.00 | +/-16.2 | 2,011 | OpenAI | Proprietary |
| 135 | Olmo 3.1 32B ThinkAllen AI | 1005.00 | +/-6.3 | 16,162 | Allen AI | Open Source |
| 136 | GPT OSS 120BOpenAI | 993.00 | +/-10.3 | 5,268 | OpenAI | Open Source |
| 137 | GPT-4.1 nanoOpenAI | 992.00 | +/-16.9 | 1,901 | OpenAI | Proprietary |
| 138 | Qwen3-30B-A3B阿里巴巴 | 971.00 | +/-14.6 | 2,575 | 阿里巴巴 | Open Source |
| 139 | 960.00 | +/-8.8 | 7,626 | xAI | Proprietary | |
| 140 | Llama 3.1 Nemotron Ultra 253BNVIDIA | 959.00 | +/-13.8 | 3,172 | NVIDIA | Open Source |
| 141 | Mistral-Small-3.2MistralAI | 937.00 | +/-20.8 | 1,243 | MistralAI | Open Source |
| 142 | Llama 4 MaverickFacebook AI研究实验室 | 909.00 | +/-18.4 | 1,678 | Facebook AI研究实验室 | Open Source |
| 143 | Mistral Large 2.1 (2411)Mistral | 893.00 | +/-21 | 1,317 | Mistral | Proprietary |
| 144 | GPT-4oOpenAI | 890.00 | +/-18.2 | 1,780 | OpenAI | Proprietary |
| 145 | Codestral 2 (2501)Mistral | 863.00 | +/-20.7 | 1,444 | Mistral | Open Source |
| 146 | Devstral Small 1.1MistralAI | 837.00 | +/-22.5 | 1,250 | MistralAI | Open Source |
| 147 | Llama 4 ScoutFacebook AI研究实验室 | 819.00 | +/-22.6 | 1,275 | Facebook AI研究实验室 | Open Source |
数据仅供参考,以官方来源为准。模型名称旁的链接可跳转到 DataLearner 模型详情页。
关于本榜单
本榜单数据来源于Design Arena,由 Y Combinator 支持的 Arcada Labs 开发,是专注于评测 AI 设计代码生成能力的众包匿名对战平台。
与 LMArena 评测通用文本和编程能力不同,Design Arena 的代码榜专门考察模型生成具有视觉呈现效果的前端代码的能力。平台将代码任务细分为 Website、UI 组件、游戏开发、数据可视化、SVG、Web App、移动端等多个子类别,每个子类别均有独立排行。
本页展示的是 Code Categories 综合榜,即将所有子类别的用户投票混合汇总后,统一用 Bradley-Terry 模型(类 Elo 算法)计算出的综合排名。每票等权,不对各子类别做加权处理,因此投票量较大的子类别(如 Website)对综合分数的影响更大。得分越高,代表模型在设计代码生成场景下的综合人类偏好越强。
常见问题 (FAQ)
什么是 Arcada Labs Code Categories Arena?
Arcada Labs Code Categories Arena 是专注于设计代码生成能力的匿名评测平台,覆盖 Website、UI 组件、游戏开发、数据可视化等多个代码生成子类别,并将投票汇总为综合榜单。
Arcada Code Arena 与 LMArena Coding Arena 有什么区别?
LMArena Coding Arena 主要评测通用编程能力,例如代码生成、调试和算法实现;Arcada Code Arena 专注于具有视觉呈现效果的前端设计代码,例如 HTML 页面、交互 UI、图表、SVG 和原型。
排名方法论是什么?
Arcada Labs 将各代码子类别的原始投票混合后运行 Bradley-Terry 模型。每票等权,不按子类别单独加权,因此投票量较大的子类别会对综合分数产生更大影响。
哪类模型在设计代码场景表现更好?
具备强视觉理解和前端代码生成能力的大模型通常表现更好。针对 UI 和代码生成优化的专项模型,在布局、交互和视觉细节任务上也可能有突出表现。









