MiniMax M3vsStep 3.7 Flash
在 9 个共同 benchmark 中,MiniMax M3 整体领先:MiniMax M3 领先 9 项,Step 3.7 Flash 领先 0 项,持平 0 项,平均分差 +5.54。
MiniMax M3
MiniMaxAI · 2026-06-01 · 多模态大模型
Step 3.7 Flash
StepFunAI · 2026-05-29 · 推理大模型
MiniMax M39 项(100%)(0%)0 项Step 3.7 Flash
评测分数
按能力类目分组,每组内按分差大小排列;共 9 项。
自主开发与终端任务
MiniMax M3 领先 2/2| 评测项 | MiniMax M3 | Step 3.7 Flash | 分差 |
|---|---|---|---|
| Terminal Bench Hard | 42.4045 / 244Thinking (With Tools) | 35.6070 / 244Thinking (With Tools) | +6.80 |
| Terminal-Bench 2.1 | 6645 / 57Thinking (With Tools) | 59.5049 / 57Thinking (With Tools) | +6.50 |
仓库修复与多文件工程
MiniMax M3 领先 1/1| 评测项 | MiniMax M3 | Step 3.7 Flash | 分差 |
|---|---|---|---|
| SWE-Bench Pro - Public | 5916 / 62Thinking (With Tools) | 56.3028 / 62Thinking (With Tools) | +2.70 |
图像感知与视觉推理
MiniMax M3 领先 1/1| 评测项 | MiniMax M3 | Step 3.7 Flash | 分差 |
|---|---|---|---|
| MMMU-Pro | 78.6055 / 229Thinking (No Tools) | 75.3088 / 229Thinking (No Tools) | +3.30 |
客服与业务流程
MiniMax M3 领先 1/1| 评测项 | MiniMax M3 | Step 3.7 Flash | 分差 |
|---|---|---|---|
| τ³-Banking | 15.30110 / 167Thinking (With Tools) | 12126 / 167Thinking (With Tools) | +3.30 |
法律
MiniMax M3 领先 1/1| 评测项 | MiniMax M3 | Step 3.7 Flash | 分差 |
|---|---|---|---|
| Harvey Lab-AA | 88.4115 / 44Thinking (With Tools) | 72.7332 / 44Thinking (With Tools) | +15.68 |
科学知识与推理
MiniMax M3 领先 1/1| 评测项 | MiniMax M3 | Step 3.7 Flash | 分差 |
|---|---|---|---|
| CritPt | 3.70111 / 204Thinking (No Tools) | 2.30130 / 204Thinking (No Tools) | +1.40 |
科学计算与科研编程
MiniMax M3 领先 1/1| 评测项 | MiniMax M3 | Step 3.7 Flash | 分差 |
|---|---|---|---|
| SciCode | 45.3792 / 134Thinking (No Tools) | 43.9097 / 134Thinking (No Tools) | +1.47 |
跨能力综合测试
MiniMax M3 领先 1/1| 评测项 | MiniMax M3 | Step 3.7 Flash | 分差 |
|---|---|---|---|
| SuperCLUE | 56.9012 / 13Reported best (effort unspecified) | 48.1613 / 13Reported best (effort unspecified) | +8.74 |
规格对比
| 字段 | MiniMax M3 | Step 3.7 Flash |
|---|---|---|
| 发布机构 | MiniMaxAI | StepFunAI |
| 发布时间 | 2026-06-01 | 2026-05-29 |
| 模型类型 | 多模态大模型 | 推理大模型 |
| 架构 | MoE 架构 | MoE 架构 |
| 参数规模 | 4280亿 | 1980亿 |
| 上下文长度 | 1M | 256K |
| 最大输出 | 512K | 暂无数据 |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | MiniMax M3 | Step 3.7 Flash |
|---|---|---|
| 文本输入 | ¥2.1 / 1M tokens | ¥1.35 / 1M tokens |
| 文本输出 | ¥8.4 / 1M tokens | ¥8.1 / 1M tokens |
| 缓存读取 | ¥0.42 / 1M tokens | ¥0.27 / 1M tokens |
小结
- MiniMax M3在以下类目领先:自主开发与终端任务 (2/2)、仓库修复与多文件工程 (1/1)、图像感知与视觉推理 (1/1)、客服与业务流程 (1/1)、法律 (1/1)、科学知识与推理 (1/1)、科学计算与科研编程 (1/1)、跨能力综合测试 (1/1)
9 个共同 benchmark 上,MiniMax M3 平均高出 5.54 分。
单项差距最大的 benchmark:Harvey Lab-AA — MiniMax M3 88.41,Step 3.7 Flash 72.73(分差 +15.68)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。