Gemini 4 Argon 是 Google 新公布的前沿模型,面向复杂、长流程任务中的深度推理。在 2026 年 10 月 8 日发布的 Arena 数据中,它位列综合榜和编程榜第 1;但目前尚未向公众开放,仅通过 Fairwind Program 向部分受信任的网络防御团队提供访问。如果你搜索的是 gemini 4 argon release date(发布时间),或名称顺序颠倒的 gemini argon 4,答案是:Google 已于 2026 年 9 月 30 日公布该模型,但尚未给出公开开放日期。
选型时,需要分清这些信息各自说明什么:Arena 反映用户偏好,Google 的基准成绩来自其评测条件,而产品公告并不等于已经可以调用公开 API。本文依据 Google 官方页面与指定日期的 AI Rank 快照,按截至 2026 年 10 月 11 日的信息梳理排名、能力与开放情况。
Gemini 4 Argon 的 Arena 排名:综合、编程与各分类
Arena 中的条目是 gemini-4-argon-high,即 high 思考档位。这里的文本榜采用风格控制,衡量各分类中的人类偏好,不能直接当作任务准确率。下表对应 2026 年 10 月 8 日发布的数据。
| 分类 | 模型 | 名次 | 评分 | 95% 置信区间 | 票数 |
|---|---|---|---|---|---|
| 综合 | Gemini 4 Argon high | #1 | 1525.4 | 1516.5–1534.2 | 4,892 |
| 综合 | Claude Opus 5.5 high | #2 | 1507.1 | 1499.0–1515.2 | 6,272 |
| 编程 | Gemini 4 Argon high | #1 | 1561.9 | 1544.7–1579.1 | 1,233 |
| 编程 | Claude Fable 5 high | #2 | 1551.4 | 1544.7–1558.1 | 10,404 |
→ 在 AI Rank 查看: Gemini 4 Argon 的 Arena 评分、名次与 90 天走势
综合榜的领先在这份数据中较为明确:Argon 的置信区间下界为 1516.5,高于 Opus 5.5 high 的上界 1515.2。编程榜则需要更谨慎。Argon 只有 1,233 票,区间为 1544.7–1579.1,与 Fable 5 high 的 1544.7–1558.1 重叠。因此,编程领先的确定性比单看评分差距时更弱,不能据此认定双方已形成明确的统计分离。
Arena 详情快照中,Argon 在全部 7 个 AI Rank 分类里均排名第 1。分类成绩能补充综合分的含义,但各分类的投票规模差异很大。
| 分类 | 名次 | 评分 | 票数 |
|---|---|---|---|
| 中文 | #1 | 1587.7 | 368 |
| 编程 | #1 | 1561.9 | 1,233 |
| 创意写作 | #1 | 1519.2 | 1,053 |
| 指令遵循 | #1 | 1528.7 | 1,750 |
| 数学 | #1 | 1528.3 | 271 |
| 多轮对话 | #1 | 1553.3 | 670 |
| 综合 | #1 | 1525.4 | 4,892 |
数学只有 271 票,中文只有 368 票,解读这两项第一名时尤其需要注意样本量。
→ 编程榜: AI Rank 上的 Arena 编程排名(Arena 数据发布于 2026-10-08)。
综合榜历史记录显示,Argon 在 9 月 30 日、10 月 2 日和 10 月 8 日均为第 1,评分分别是 1524.8、1525.2 和 1525.4。这说明它在这些已记录的快照中持续领先,但并不保证之后的名次。
Argon 目前没有 OpenRouter 使用量排名。它未出现在 OpenRouter 公开模型目录,也未出现在核对的、截至 10 月 10 日的日榜、周榜和月榜中。该平台上已有的 Google 模型包括 Gemini 3.8 Flash。AI Rank 的 OpenRouter 使用量榜反映的是这一平台上的使用情况;Argon 缺席不能被解释为其他渠道也无人使用。
Google 公布的基准成绩
Google 在 DeepMind Gemini 基准表中公布了以下结果,数值均为百分比。这些是厂商报告的成绩,AI Rank 未进行独立复现。
| 基准 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| GraphWalks 256k–1M | 84.2% | 71.8% | 65.0% | 66.8% |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
| OSWorld-2.0 offline partial | 69.2% | 72.6% | — | — |
按照 Google 公布的数据,Argon 在 AutomationBench、DeepSWE v1.1 等项目上领先,但并非所有项目都占优。在 FrontierSWE v2 和 Terminal-bench 4.0 上,它低于表中另外三个模型;在 OSWorld-2.0 offline partial 上低于 GPT-6 Astra;在 CWE-bench v1 上则与 Astra 持平。破折号表示 Google 表格中没有给出数值。
Google 的评测方法说明指出,Argon 使用最高思考设置,除特别注明外,成绩以 pass@1 报告。其他厂商模型的结果大多来自各自报告;部分成绩由 Google 计算,包括 Argon 的 DeepSWE 和 Terminal-bench 4.0。理解这些条件,才能判断表格对具体部署场景有多大参考价值。
Gemini 4 Argon Release Date:发布时间与开放情况
Google 于 2026 年 9 月 30 日公布 Argon,介绍的应用方向包括软件工程、法律与金融等企业知识工作,以及网络安全防御。首批开放通过 Fairwind Program进行。该计划在全球拥有超过 650 个合作伙伴,但只有其中部分获得 Argon 访问权限,可独立使用或在 CodeMender 中使用;合作伙伴总数并不等于 Argon 用户数。
Fairwind 优先面向政府与国家网络安全机构、关键基础设施运营方和核心技术平台,机构可通过计划页面的表单申请。使用条件包括用户级身份验证、防钓鱼多因素认证,以及可追踪的使用记录。访问限于内部网络安全、事件响应和渗透测试团队,禁止分享、再分发或转售。通过 Gemini Enterprise 托管模型访问时,支持零数据保留。
Google 表示,后续将首先面向付费 API 客户和 Google AI Ultra 订阅者开放,同时正在参与美国政府自愿性的模型发布前访问流程。但公告没有给出日期。截至 10 月 11 日,尚无公开的 Gemini API 模型 ID,Gemini API 价格页也没有 Argon 条目。
Google 还宣布,输出 token 上限从此前的 64K 提高到 1M。这是输出上限;公告没有说明输入上下文窗口,不能将两者混为一谈。
已公布的价格(暂时还不能付费使用)
Google 公告列出了以下计划中的 API 价格。截至 2026 年 10 月 11 日,这些只是已公布价格,还不是可以付费调用的公开 API 费率。
| 已公布的阶段 | 每 1M 输入 token | 每 1M 输出 token |
|---|---|---|
| 优惠期 | $2 | $10 |
| 优惠期结束后 | $4 | $20 |
Google 宣布,缓存输入享受输入价格减免 95%。优惠期何时结束尚未注明,Google 也没有公布批量处理或长上下文的分档价格。可以用这些数字做初步预算,但在实际获得访问权限时,仍应核对公开价格条目。
局限与核对要点
目前最有依据的结论是:Argon 在这份指定日期的 Arena 快照中领先,而 Google 的基准表显示它在不同任务上各有优势与落后项目。两类资料都不能直接证明它在你的工作流程中的表现。比较时,应同时考虑 Arena 使用的 high 思考档位、各分类票数差异,以及厂商评测设置。
准备部署前,应核对公开开放日期、正式的 Gemini API 模型 ID,以及已上线的价格条目。还要确认优惠期条款,并分清输出容量与输入上下文。比较排名时看最新投票和置信区间;判断能否使用时,以 Google 的访问说明为准。
选型前先对比: 随着新投票进来,排名会变化,决定前先看 AI Rank 的 Arena 评分榜。
或 📱 下载 AI Rank App 在手机上随时查看。
本文使用自动化编辑辅助,于 2026 年 10 月 11 日依据官方资料与指定日期的 AI Rank 数据核对,未进行自有跑分测试。