📊 查看 Gemini 4 Argon 排名

📱 下载 AI Rank App

Gemini 4 Argon 是 Google 新公布的前沿模型,面向复杂、长流程任务中的深度推理。在 2026 年 10 月 8 日发布的 Arena 数据中,它位列综合榜和编程榜第 1;但目前尚未向公众开放,仅通过 Fairwind Program 向部分受信任的网络防御团队提供访问。如果你搜索的是 gemini 4 argon release date(发布时间),或名称顺序颠倒的 gemini argon 4,答案是:Google 已于 2026 年 9 月 30 日公布该模型,但尚未给出公开开放日期。

选型时,需要分清这些信息各自说明什么:Arena 反映用户偏好,Google 的基准成绩来自其评测条件,而产品公告并不等于已经可以调用公开 API。本文依据 Google 官方页面与指定日期的 AI Rank 快照,按截至 2026 年 10 月 11 日的信息梳理排名、能力与开放情况。

Gemini 4 Argon 的 Arena 排名:综合、编程与各分类

Arena 中的条目是 gemini-4-argon-high,即 high 思考档位。这里的文本榜采用风格控制,衡量各分类中的人类偏好,不能直接当作任务准确率。下表对应 2026 年 10 月 8 日发布的数据。

分类 模型 名次 评分 95% 置信区间 票数
综合 Gemini 4 Argon high #1 1525.4 1516.5–1534.2 4,892
综合 Claude Opus 5.5 high #2 1507.1 1499.0–1515.2 6,272
编程 Gemini 4 Argon high #1 1561.9 1544.7–1579.1 1,233
编程 Claude Fable 5 high #2 1551.4 1544.7–1558.1 10,404

→ 在 AI Rank 查看: Gemini 4 Argon 的 Arena 评分、名次与 90 天走势

📱 在 AI Rank App 里持续关注

综合榜的领先在这份数据中较为明确:Argon 的置信区间下界为 1516.5,高于 Opus 5.5 high 的上界 1515.2。编程榜则需要更谨慎。Argon 只有 1,233 票,区间为 1544.7–1579.1,与 Fable 5 high 的 1544.7–1558.1 重叠。因此,编程领先的确定性比单看评分差距时更弱,不能据此认定双方已形成明确的统计分离。

Arena 详情快照中,Argon 在全部 7 个 AI Rank 分类里均排名第 1。分类成绩能补充综合分的含义,但各分类的投票规模差异很大。

分类 名次 评分 票数
中文 #1 1587.7 368
编程 #1 1561.9 1,233
创意写作 #1 1519.2 1,053
指令遵循 #1 1528.7 1,750
数学 #1 1528.3 271
多轮对话 #1 1553.3 670
综合 #1 1525.4 4,892

数学只有 271 票,中文只有 368 票,解读这两项第一名时尤其需要注意样本量。

→ 编程榜: AI Rank 上的 Arena 编程排名(Arena 数据发布于 2026-10-08)。

综合榜历史记录显示,Argon 在 9 月 30 日、10 月 2 日和 10 月 8 日均为第 1,评分分别是 1524.8、1525.2 和 1525.4。这说明它在这些已记录的快照中持续领先,但并不保证之后的名次。

Argon 目前没有 OpenRouter 使用量排名。它未出现在 OpenRouter 公开模型目录,也未出现在核对的、截至 10 月 10 日的日榜、周榜和月榜中。该平台上已有的 Google 模型包括 Gemini 3.8 Flash。AI Rank 的 OpenRouter 使用量榜反映的是这一平台上的使用情况;Argon 缺席不能被解释为其他渠道也无人使用。

Google 公布的基准成绩

Google 在 DeepMind Gemini 基准表中公布了以下结果,数值均为百分比。这些是厂商报告的成绩,AI Rank 未进行独立复现。

基准 Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
Vals Index 68.9% 63.1% 65.8% 67.0%
AutomationBench 51.3% 41.4% 31.4% 42.5%
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2%
FrontierSWE v2 55.0% 65.5% 56.3% 62.3%
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4%
GraphWalks 256k–1M 84.2% 71.8% 65.0% 66.8%
LVBench 91.7% 87.5% 79.7% 83.7%
CWE-bench v1 68.0% 68.0% 58.0% 67.0%
OSWorld-2.0 offline partial 69.2% 72.6% — —

按照 Google 公布的数据,Argon 在 AutomationBench、DeepSWE v1.1 等项目上领先,但并非所有项目都占优。在 FrontierSWE v2 和 Terminal-bench 4.0 上,它低于表中另外三个模型;在 OSWorld-2.0 offline partial 上低于 GPT-6 Astra;在 CWE-bench v1 上则与 Astra 持平。破折号表示 Google 表格中没有给出数值。

Google 的评测方法说明指出,Argon 使用最高思考设置,除特别注明外,成绩以 pass@1 报告。其他厂商模型的结果大多来自各自报告;部分成绩由 Google 计算,包括 Argon 的 DeepSWE 和 Terminal-bench 4.0。理解这些条件,才能判断表格对具体部署场景有多大参考价值。

Gemini 4 Argon Release Date:发布时间与开放情况

Google 于 2026 年 9 月 30 日公布 Argon,介绍的应用方向包括软件工程、法律与金融等企业知识工作,以及网络安全防御。首批开放通过 Fairwind Program进行。该计划在全球拥有超过 650 个合作伙伴,但只有其中部分获得 Argon 访问权限,可独立使用或在 CodeMender 中使用;合作伙伴总数并不等于 Argon 用户数。

Fairwind 优先面向政府与国家网络安全机构、关键基础设施运营方和核心技术平台,机构可通过计划页面的表单申请。使用条件包括用户级身份验证、防钓鱼多因素认证,以及可追踪的使用记录。访问限于内部网络安全、事件响应和渗透测试团队,禁止分享、再分发或转售。通过 Gemini Enterprise 托管模型访问时,支持零数据保留。

Google 表示,后续将首先面向付费 API 客户和 Google AI Ultra 订阅者开放,同时正在参与美国政府自愿性的模型发布前访问流程。但公告没有给出日期。截至 10 月 11 日,尚无公开的 Gemini API 模型 ID,Gemini API 价格页也没有 Argon 条目。

Google 还宣布,输出 token 上限从此前的 64K 提高到 1M。这是输出上限;公告没有说明输入上下文窗口,不能将两者混为一谈。

已公布的价格(暂时还不能付费使用)

Google 公告列出了以下计划中的 API 价格。截至 2026 年 10 月 11 日,这些只是已公布价格,还不是可以付费调用的公开 API 费率。

已公布的阶段 每 1M 输入 token 每 1M 输出 token
优惠期 $2 $10
优惠期结束后 $4 $20

Google 宣布,缓存输入享受输入价格减免 95%。优惠期何时结束尚未注明,Google 也没有公布批量处理或长上下文的分档价格。可以用这些数字做初步预算,但在实际获得访问权限时,仍应核对公开价格条目。

局限与核对要点

目前最有依据的结论是:Argon 在这份指定日期的 Arena 快照中领先,而 Google 的基准表显示它在不同任务上各有优势与落后项目。两类资料都不能直接证明它在你的工作流程中的表现。比较时,应同时考虑 Arena 使用的 high 思考档位、各分类票数差异,以及厂商评测设置。

准备部署前,应核对公开开放日期、正式的 Gemini API 模型 ID,以及已上线的价格条目。还要确认优惠期条款,并分清输出容量与输入上下文。比较排名时看最新投票和置信区间;判断能否使用时,以 Google 的访问说明为准。

选型前先对比: 随着新投票进来,排名会变化,决定前先看 AI Rank 的 Arena 评分榜。

或 📱 下载 AI Rank App 在手机上随时查看。

本文使用自动化编辑辅助,于 2026 年 10 月 11 日依据官方资料与指定日期的 AI Rank 数据核对,未进行自有跑分测试。