DataLearner 标志

Qwen3.8-Flash-Next 评测深度分析

与同代开放权重的 Qwen3.8-27B 相比,Qwen3.8-Flash-Next 在共有项目上全面领先,且增量集中在 DeepSWE 这类多轮工具调用的智能体任务;与同档竞品 DeepSeek-V4-Flash 相比,它在 SWE-bench 系列的存量代码库修复上稳定占优,但在从零生成整个仓库的 NL2Repo-Bench 上落后;与闭源旗舰 Claude Opus 4.6 相比,GPQA Diamond 与 HLE 已基本持平,LiveCodeBench 明显更高,但复杂指令遵循(IFBench)仍落后约 12.7 分。所有成绩来自厂商公布数据,带工具与不带工具的口径需分开看。

本页把 Qwen3.8-Flash-Next 与三类参照对象放在一起看:同家族的开放权重小杯 Qwen3.8-27B,用来判断这套新架构相对同代常规模型的增量;同为“快”档定位的 DeepSeek-V4-Flash,属于最直接的同档竞品;以及闭源旗舰 Claude Opus 4.6,用作能力上限的参照。下面只讨论双方都有分数的项目,并在每一节标明测试口径。

相对同代 Qwen3.8-27B:编程与智能体是主要增量

在两者共有的项目上,Qwen3.8-Flash-Next 全面领先,但领先幅度分布很不均匀:

  • DeepSWE:58.7 对 42.2(+16.5)
  • NL2Repo-Bench:48.1 对 42.3(+5.8)
  • LiveCodeBench v6:91.9 对 90.3(+1.6)
  • SWE-bench Pro:62.5 对 61.7(+0.8)
  • MathVision:90.6 对 90.0;带代码解释器时 95.7 对 94.6

差距最大的 DeepSWE 是需要模型在真实仓库里连续操作工具的智能体式评测,而差距最小的 LiveCodeBench 与 SWE-bench Pro 更接近单轮或短流程的代码能力考察。这一分布与官方对该架构的说明方向一致——混合注意力与稀疏注意力的组合主要为长上下文智能体负载服务;换句话说,这次架构改动在“长流程、多轮工具调用”上的收益,明显大于在纯代码生成上的收益。MathVision 上不足 1 分的差距则说明,视觉数学推理并不是这一代架构改动的受益方向。

相对 DeepSeek-V4-Flash:软件工程强,仓库级生成弱

同为面向效率的“快”档模型,两者在四个共有项目上互有胜负:

  • SWE-bench Pro:62.5 对 52.6(+9.9)
  • SWE-bench Multilingual:81.0 对 73.3(+7.7)
  • DeepSWE:58.7 对 54.4(+4.3)
  • NL2Repo-Bench:48.1 对 54.2(−6.1)

三项 SWE 系列评测考察的是在既有代码库中定位并修复问题,Qwen3.8-Flash-Next 的优势稳定,其中多语言场景(SWE-bench Multilingual)的领先幅度尤其值得注意。唯一落后的 NL2Repo-Bench 方向相反——它考察的是从自然语言描述出发生成整个仓库。因此如果任务是在存量项目上改 bug、补功能,这里的数据更支持 Qwen3.8-Flash-Next;如果是从零搭建完整项目骨架,DeepSeek-V4-Flash 在这一项上暂时更好。四项均在 xhigh 思考档位、带工具的智能体环境下取得。

相对 Claude Opus 4.6:科学推理接近,指令遵循仍有差距

与闭源旗舰的对比出现了明显的两极分化(四项均为无工具口径):

  • GPQA Diamond:91.7 对 91.31
  • HLE:35.9 对 34.44
  • LiveCodeBench v6:91.9 对 76.0
  • IFBench:81.3 对 94.0

前两项几乎持平,说明在研究生级科学问答和高难度综合题上,这个每 token 只激活约 60 亿参数的模型已经能贴近旗舰水准。LiveCodeBench 上 15.9 分的领先幅度较大,但该项属于竞赛式编程题,训练数据的覆盖与评测版本差异都会明显影响结果,不宜直接外推到工程实践。真正需要留意的是 IFBench 落后 12.7 分:这项考察的是对复杂、多重约束指令的遵循能力,而这恰恰是把模型接入自动化流程时最影响可靠性的一环。也就是说,在“会不会做”上两者已经接近,在“按要求做”上差距依然存在。

口径与数据限制

  • 本页成绩以厂商官方公布数据为主,不是同一套第三方 harness 下的复测结果,不同模型的推理档位、工具配置和评测版本可能并不一致。
  • Qwen3.8-Flash-Next 的编程与智能体类成绩(DeepSWE、SWE-bench 系列、NL2Repo-Bench)在默认 xhigh 思考档位、带工具的智能体环境下取得;GPQA Diamond、HLE、LiveCodeBench、IFBench 为无工具口径;MathVision 与 CharXiv 分别给出了带/不带代码解释器两组分数。带工具与不带工具的成绩不能直接比较。
  • 与前代 Qwen3.7-Plus 目前没有足够的共有评测项目,暂不做直接对比。
  • 选型时建议把这些分数当作方向性参考,并在自己的真实任务上做一次小规模验证。

评测结果

Qwen3.8-Flash-Next

评测结果

思考模式
工具使用

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
极高
35.90
99 / 235

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
91.70
27 / 253
CritPt
开启思考
11.10
71 / 204

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
91.90
3 / 125

仓库修复与多文件工程

共 4 项评测
评测名称 / 模式
得分
排名/总数
81
6 / 30
62.50
11 / 62
DeepSWE
极高工具
58.70
52 / 92
NL2Repo-Bench
极高工具
48.10
14 / 16

指令与格式遵循

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
极高
81.30
3 / 31

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld 2.0
极高工具
52.30
13 / 14

跨应用与工具编排

共 5 项评测
评测名称 / 模式
得分
排名/总数
73.50
10 / 14
ClawEval-MM
极高工具
60.40
2 / 2
Job Bench
极高工具
55.70
7 / 8
RecreationBench
极高工具
49.90
1 / 1
Agents' Last Exam
极高工具
24.30
22 / 24

图像感知与视觉推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
90.60
7 / 12
MathVision
极高工具
95.70
2 / 12
88.50
1 / 1
MMMU-Pro
开启思考
79.80
46 / 229
ERQA
极高
72.30
2 / 2
Vision2Web
极高工具
64
1 / 1

文档与图表理解

共 3 项评测
评测名称 / 模式
得分
排名/总数
84.60
13 / 19
CharXiv RQ
极高工具
90.60
2 / 19
GDP.pdf
开启思考
15.60
59 / 122

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
开启思考
50.60
69 / 134

客服与业务流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
开启思考工具
45.40
16 / 167

视频理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
LVBench
极高
76.60
5 / 5

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
CoWorkBench
极高工具
73.90
2 / 2

浏览器与移动端操作

共 1 项评测
评测名称 / 模式
得分
排名/总数
AndroidWorld
极高工具
84.50
1 / 1

自主开发与终端任务

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 4.0
开启思考工具
25.30
33 / 98

竞品对比

Qwen3.8-Flash-Next 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项Qwen3.8-Flash-Next当前Qwen3.8-27BDeepSeek-V4-Flash
HLE
Accuracy
综合知识考试
35.90思考水平·极高
30.80开启思考
51.50思考水平·高 | 工具
CritPt
Score
科学知识与推理
11.10开启思考
5.40思考水平·极高
7.10思考水平·高
GPQA Diamond
Accuracy
科学知识与推理
91.70思考水平·极高
89.20开启思考
71.20常规模式
LiveCodeBench
Pass @K
算法与竞赛编程
91.90思考水平·极高
90.30开启思考
91.60思考水平·高
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
58.70思考水平·极高 | 工具
42.20开启思考 | 工具
53.32思考水平·高 | 工具
NL2Repo-Bench
Average test pass rate
仓库修复与多文件工程
48.10思考水平·极高 | 工具
42.30开启思考 | 工具
54.20思考水平·高 | 工具
SWE-bench Multilingual
Accuracy
仓库修复与多文件工程
81.00思考水平·极高 | 工具
--
73.30思考水平·极高 | 工具
SWE-Bench Pro - Public
Accuracy
仓库修复与多文件工程
62.50思考水平·极高 | 工具
61.70开启思考 | 工具
52.60思考水平·极高 | 工具
Agents' Last Exam
Score
跨应用与工具编排
24.30思考水平·极高 | 工具
20.40开启思考 | 工具
25.20思考水平·高 | 工具
Toolathlon-Verified
Score
跨应用与工具编排
73.50思考水平·极高 | 工具
--
70.30思考水平·高 | 工具
MathVision
Accuracy
图像感知与视觉推理
95.70思考水平·极高 | 工具
94.60开启思考 | 工具
--
MMMU-Pro
Accuracy
图像感知与视觉推理
79.80开启思考
76.30思考水平·极高
--
其余 5 个 benchmark 仍可在上方图表中查看。

Qwen3.8-Flash-Next 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。

这些模型的价格币种或计费单位不一致,暂不直接绘制统一柱状图,以下展示原始价格。

Qwen3.8-Flash-Next
供应商: 阿里巴巴
标准输入: ¥1 / 1M tokens
标准输出: ¥3 / 1M tokens
DeepSeek-V4-Flash
供应商: DeepSeek-AI
标准输入: $0.14 / 1M tokens
标准输出: $0.28 / 1M tokens
模型供应商标准输入标准输出标准价适用于
Qwen3.8-Flash-Next
阿里巴巴¥1 / 1M tokens¥3 / 1M tokens—
DeepSeek-V4-Flash
DeepSeek-AI$0.14 / 1M tokens$0.28 / 1M tokens—

历代版本对比

Qwen3.8-Flash-Next 系列各版本的评测成绩纵向对比

Qwen3.8-Flash-NextQwen3.7-Plus
评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

7 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项Qwen3.8-Flash-Next当前Qwen3.7-Plus
CritPt
Score
科学知识与推理
11.10开启思考
9.10开启思考
GPQA Diamond
Accuracy
科学知识与推理
91.70思考水平·极高
81.82常规模式
MMMU-Pro
Accuracy
图像感知与视觉推理
79.80开启思考
80.50开启思考
GDP.pdf
Task pass rate (%)
文档与图表理解
15.60开启思考
12.20开启思考
SciCode
Score
科学计算与科研编程
50.60开启思考
46.10开启思考
τ³-Banking
Score
客服与业务流程
45.40开启思考 | 工具
17.50开启思考 | 工具
Terminal-Bench 4.0
Resolution rate (%)
自主开发与终端任务
25.30开启思考 | 工具
1.00开启思考 | 工具

单评测历史趋势图

当前查看:CritPt · 科学知识与推理

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

Qwen3.8-Flash-Next 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · CNY / 1M tokens

若存在上下文阈值,图中标准价仅适用于以下范围:

Qwen3.7-Plus: 标准价适用于 <= 256000
模型供应商标准输入标准输出标准价适用于
Qwen3.8-Flash-Next
阿里巴巴¥1 / 1M tokens¥3 / 1M tokens—
Qwen3.7-Plus
阿里巴巴¥2 / 1M tokens¥8 / 1M tokens<= 256000

数据来源