9月30日,谷歌在官方博客发布新一代前沿模型 Gemini 4 Argon,署名者为 Google DeepMind 高级副总裁兼谷歌首席AI架构师 Koray Kavukcuoglu。与以往“全家桶式”推送不同,Argon 采取分阶段开放:首批仅向受信任的网络防御者(Fairwind 计划)推出,并主动参与美国政府的预发布模型自愿访问流程;更广泛的开放将从付费 API 客户与 Google AI Ultra 订阅用户开始。雅虎财经称此次发布“在多次延迟之后到来”,CNBC 则指出华尔街真正期待的是“杀手级个人智能体”——新模型与市场叙事之间的错位,本身就值得玩味。
百万 Token 输出与基准跃升
Argon 将输出 token 上限从此前的 64K 直接提升至 100 万,官方称之为业界之最,为单轨迹深度推理留足空间。基准表现方面,据 InfoQ 等媒体报道,Argon 在多项基准测试中领先于 GPT-6 Astra;爱范儿的上手评价则是“我们终于有了一个写作强于代码的前沿模型”。
Gemini 4 Argon 关键基准(谷歌官方博客)
· DeepSWE v1.1(真实长程软件工程):77.9%,刷新纪录
· Zapier AutomationBench(端到端业务自动化):51.3%,排名第一
· LVBench(长视频理解):91.7%,业界最佳
· 金融与法律:Vals Finance Agent v2、Harvey Legal Agent Benchmark 领先
· 漏洞修复评测:68%,并列第一
从核心库到 80 万行内核代码迁移
谷歌同时披露了内部规模化实战:Argon 帮助量子计算研究人员优化子程序的时空资源,数分钟内将发表基线再压 40%;一组 Argon 智能体分析全集群性能遥测、自主实施内存优化,一次性释放超 300 TiB 内存(预计总节省 500 TiB 至 1 PiB)。最受关注的是 C/C++ 转 Rust 迁移——从 re2、libgav1 等核心库的数万行,直至 Fuchsia Zircon 内核的 80 万行以上;其中 libgav1 的 3.2 万行 SIMD 代码被重写为安全 Rust,最终比原 Rust 移植版快 2.7 倍。官方强调,此类大规模重写须经自动化与人工审计、仿真测试和评审后才能进入生产。
“防御者优先”与安全前置
安全设计上,Argon 拒绝网络攻击与 CBRN(化生放核)类有害请求,同时保留正当的双用途科研;在 Gray Swan 间接提示注入(IPI)基准上保持领先;部署了监控思维链与执行动作的失准抑制机制,必要时中止执行;沙箱环境在高风险训练与评测前先行隔离封闭。官方还呼吁全行业在能力跃升的关键期保持推理透明。Fairwind 计划的早期成果颇具说服力:Argon 在全球多家医院使用的医疗软件中发现了一个此前前沿模型均未发现的高危个人信息暴露漏洞。
前沿能力的发布节奏第一次让位于安全验证——先给防御者,再给开发者与消费者,这正在成为旗舰模型的准入门槛。
定价与分析:安全工程成为新竞争力
定价方面,介绍期为每百万 tokens 输入 2 美元、输出 10 美元,缓存输入再享 95% 折扣,期满后恢复 4/20 美元——在价格战余波未平的当下,被外界解读为“以价换量”的进攻性策略。对企业用户而言,Argon 展示的提示注入鲁棒性、思维链监控与智能体沙箱,恰恰是大模型落地时最稀缺的“安全工程”能力:九天天盾的模型红队评测与智能体行为监测正面向此类场景;而百万级输出撑起的长程任务,也在重新定义天行这类智能体调度平台的工作流编排边界。
(信息综合自 Google 官方博客、InfoQ、雅虎财经、CNBC、Ars Technica、爱范儿等公开报道)