DataLearner 标志
GE

Gemini 4 Argon

预览版多模态大模型编程大模型Gemini 4.0

Google Gemini 4 Argon

别名:Argon

发布时间: 2026-09-30更新于: 2026-10-01浏览量: 94
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
暂无数据
多语言支持
暂无数据
推理能力
暂无数据

Google 于 2026 年 9 月 30 日宣布的 Gemini 4 首个前沿模型,最大输出提升到 100 万 tokens;目前只向 Fairwind 计划的受信安全团队开放,推广期 API 价为每百万 tokens 输入 2 美元、输出 10 美元,之后为 4 / 20 美元。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Gemini 4 Argon

模型基本信息

推理过程
支持
思考模式
不支持思考模式
上下文长度
暂无数据
最大输出长度
1M tokens
模型类型
多模态大模型
输入/输出模态
文本、图像、视频 → 文本
发布时间
2026-09-30
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
Gemini 4 Argon

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
暂无
Gemini 4 Argon

官方介绍与博客

Gemini 4 Argon

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$2.00/ 1M tokens$10.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.100/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Gemini 4 Argon

评测结果

Gemini 4 Argon 当前已收录的代表性评测结果包括 DeepSWE(1 / 92,得分 77.90)、Vibe Code Bench v1.1(1 / 61,得分 91.90)、Finance Agent v2(1 / 43,得分 65.40)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
最高工具
77.90
1 / 92

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld 2.0
最高工具
69.20
5 / 14

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
最高工具
51.30
4 / 25

金融

共 1 项评测
评测名称 / 模式
得分
排名/总数
Finance Agent v2
最高工具
65.40
1 / 43

视频理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
LVBench
最高
91.70
1 / 5

生物与基因

共 1 项评测
评测名称 / 模式
得分
排名/总数
LABBench2
最高工具联网
88.80
1 / 3

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
71.60
7 / 11

自主开发与终端任务

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 4.0
最高工具
57.40
9 / 98

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
91.90
1 / 61

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
Gemini 4 Argon

发布机构

Google Gemini 4 Argon

模型解读

Gemini 4 Argon 是 Google DeepMind 于 2026 年 9 月 30 日宣布的 Gemini 4 代首个前沿模型,主攻长周期软件工程、法律与金融等企业知识工作,以及网络安全防御。它的发布方式和定价是两回事:官方公布了推广价和完整评测表,但模型目前只向 Fairwind 计划中的受信网络安全团队开放,开发者暂时拿不到公开的 API 型号,Gemini API 定价页上也还没有它。本站按受限预览(preview)收录,价格与评测均取自 Google 官方公布的数据。

相对 GPT-6 Astra 和 Opus 5.5,Argon 在知识工作类评测上领先最明显

按 Google 评测文档(2026 年 10 月版)的对比表,Argon 在 18 行成绩中有 12 行单独第一、1 行并列第一。差距最大的是企业知识工作:Harvey 法律 Agent 基准 19.6%,GPT-6 Astra 为 5.4%,Claude Opus 5.5 为 3.8%;Vals Finance Agent v2 为 65.4%,比 Astra 的 53.5% 高 11.9 个百分点;Zapier AutomationBench 为 51.3%,Opus 5.5 为 42.5%。长上下文也拉开了差距:GraphWalks 256K–1M 区间的 F1 为 84.2%,Astra 为 71.8%,Opus 5.5 为 66.8%。

编码类成绩则有输有赢。DeepSWE v1.1 为 77.9%,略高于 Opus 5.5 的 74.2% 和 Astra 的 74.1%;但 Terminal-Bench 4.0 只有 57.4%,落后 Opus 5.5 的 66.4% 9 个百分点;FrontierSWE v2 为 55.0%,也低于 Astra 的 65.5% 和 Opus 5.5 的 62.3%。这说明 Argon 的优势集中在长链路的检索、推理和文档类任务,终端操作和大型工程任务并没有全面领先。

不少成绩是 Google 自测,测试条件也不完全一致

DeepSWE、Terminal-Bench 4.0、OSWorld 2.0、LVBench、LABBench2、GraphWalks 和 PostTrainBench 的 Argon 成绩都是 Google 自己跑的,统一使用 Gemini API 的最高思考档位。部分设置与对手不同:Terminal-Bench Science 0.1 给 Argon 放宽了 6 倍验证超时;OSWorld 2.0 取 3 次运行的最好成绩,且只报告离线子集,Argon 为 69.2%,低于 Astra 的 72.6%;LVBench 中 Gemini 按每秒 1 帧采样,对手受 API 限制只用了 300–800 帧。对手成绩大多来自各家自报或公开榜单。

价格:推广期是 Opus 5.5 的一半

Google 公布的推广价为每百万输入 tokens 2 美元、输出 10 美元,缓存输入按输入价打 0.5 折(约 0.10 美元);推广期结束后升到输入 4 美元、输出 20 美元。标准价与 Claude Opus 5.5 的 4 / 20 美元相同;GPT-6 Astra 在 27.2 万 tokens 以内为 10 / 50 美元。推广期的结束日期官方没有给出。

规格与可用性

官方只公开了最大输出:100 万 tokens,比上一代 Gemini 的 6.4 万提升约 16 倍。上下文窗口、知识截止日期、思考档位和 API 型号均未公布。安全方面,Google 称 Argon 能自主发现、验证并修补严重软件漏洞;CWE-bench v1 为 68.0%,与 Astra 持平;在 Gray Swan 间接提示注入测试中的攻击成功率为 0.7%,低于 Astra 的 8.5%。官方计划之后先向付费 API 用户和 Google AI Ultra 订阅用户开放,再扩展到更多开发者、企业和消费者,没有给出具体日期。

适用边界

目前普通开发者还无法调用 Argon。需要现在上线的法律、金融等长文档 Agent 场景,可以选 Claude Opus 5.5 或 GPT-6 Astra;以终端操作为主的编码 Agent,Opus 5.5 在 Terminal-Bench 4.0 上仍明显领先。等 Argon 开放付费 API 后,如果推广价维持,它在知识工作类任务上的性价比会明显高于这两款模型。

来源:Google 发布博客、Gemini 4 Argon 评测方法与结果(PDF)。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码