模型多源确认87°

Google发布Gemini 4 Argon模型

精选理由

Google终于发布Gemini 4,百万token输出上限,多项基准测试领先,还能帮你写代码找漏洞。

Google发布了Gemini 4系列首个模型Gemini 4 Argon,定位长周期复杂工作流的前沿推理。输出token上限从64K提升至1M,在DeepSWE v1.1基准测试中得分为77.9%,超过Claude Opus 5.5和GPT-6 Astra。Gemini 4 Argon已在Google内部用于代码迁移、内存优化和网络安全防御,定价为$2/$10每百万输入/输出token。

原文 · berryxia

兄弟们,千呼万唤始出来! Google Gemini 4 终于“来了”……

先说好消息,他发布了,坏消息是暂时非Ultra 和API用户不可用,具体时间未知。

Google 发布了 Gemini 4 Argon,Gemini 4 系列的第一个模型,定位是面向长周期复杂工作流的前沿推理,软件工程、法律金融知识工作和网络安全防御。

最显眼的规格变化是输出 token 上限从 64K 直接拉到 1M,在单次响应中可以生成一百万 token。

Google 的说法是,当模型有足够空间做深度思考和长链推理时,复杂问题可以在一趟里解决。

Benchmark 上,DeepSWE v1.1 拿到 77.9%,超过 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%。

Vals Index 经济影响力评测 68.9% 排第一;Zapier 的 AutomationBench 51.3% 排第一;LVBench 长视频理解 91.7%,SOTA;

CWE-bench v1 安全漏洞修复 68%,与 Grok 4.7 和 GPT-6 Astra 并列第一。

Google 内部已经在用 Argon 干实事:agent 正在将 C/C++ 代码库迁移到 Rust,涉及 re2、libgav1 等核心库以及 Fuchsia OS Zircon 内核(80 万行以上)。

在 libgav1 上,Argon 替换了 32K 行 SIMD 代码,生成的安全 Rust 比原有 Rust 移植版快 2.7 倍。

另一组 Argon agent 分析 fleet-wide profiling telemetry,自主找到并应用内存优化,已释放 300+ TiB 数据中心内存,预计总计 500 TiB 到 1 PiB。

网络安全方面,Argon 目前通过 Fairwind Program 先向受信赖的网络安全防御者发布。

Wiz 在 Scan for Good 项目中用 Argon 发现了一个此前所有前沿模型都没找到的关键漏洞,暴露全球医院敏感个人信息的医疗软件安全缺陷。

定价上,推广期 $2/百万输入 token、$10/百万输出 token,缓存输入 95% 折扣。

推广期结束后翻倍到 $4/$20。

Artificial Analysis 评估其与 GPT-6 Astra 在 Intelligence Index 上持平,但每任务成本仅为后者的 60%。

目前还不能直接用,正在参与美国政府自愿性预发布模型访问流程,接下来将向 AI Ultra 订阅用户和付费 API 客户开放,具体时间未定。