谷歌发布Gemini 4 Argon模型
魏伊雪 2026-10-01 10:31
财π新闻 综合《IT之家》2026年10月1日报道,谷歌正式发布新一代前沿AI模型Gemini 4 Argon,该模型作为Gemini 4系列的首款产品,将单次输出Token上限从此前的64K大幅提升至100万,支持单次推理生成数十万Token,完成长周期复杂任务的深度推理,被官方定义为“前沿智能的新阶段”,重点面向长流程软件工程、企业知识工作和网络安全防御三大核心场景打造。

核心性能与基准测试表现
Gemini 4 Argon在多项公开基准测试中取得领先成绩,尤其在知识工作、长文本处理与专业写作领域表现突出。在DeepSWE v1.1真实世界软件工程测试中,该模型得分达到77.9%,超过Claude Opus 5.5的74.2%与GPT-6 Astra的74.1%,位列第一。在评估软件安全漏洞发现与修复能力的CWE-bench v1测试中,Gemini 4 Argon以68%的得分与GPT-6 Astra并列第一,相比此前的3.8 Flash Cyber版本的网络安全防御能力有显著提升。
在其他细分领域基准测试中,Gemini 4 Argon同样交出亮眼成绩单。在Zapier推出的AutomationBench跨业务软件端到端自动执行测试中,该模型以51.3%的得分排名第一;在衡量长视频理解能力的LVBench测试中,取得91.7%的当前最佳成绩;在长上下文图结构推理测试GraphWalks 0–128K中得分99.7%,在256K–1M超长上下文区间也达到84.2%,明显领先同类前沿模型。针对金融、法律等专业领域的专项评测中,该模型同样实现领先,在Text Arena榜单中排名第一,幻觉率降至15%,为当前前沿模型中的最低水平。
不过该模型的编程与Agent能力表现存在明显起伏,并非所有相关测试都处于第一梯队。尽管在DeepSWE v1.1测试中取得领先,但在FrontierSWE v2和Terminal-Bench 4.0测试中处于垫底水平,在Code Arena和Agent Arena榜单中仅排在第8位,有内部知情人士对其在真实复杂编码任务中的实际效果表示怀疑。
分阶段开放部署安排
Gemini 4 Argon的对外开放采用分阶段推进的模式,目前尚未面向普通公众全面开放。第一阶段通过名为Fairwind的专项计划,仅对少量经过严格审核的网络安全合作伙伴开放,谷歌以“不设网络护栏”的方式向这些可信防御者提供模型访问权限,使其能够完整调用前沿防御能力,同时该项目也参与美国政府的自愿预发布模型访问流程。
按照谷歌公布的后续开放节奏,在完成第一阶段的定向测试后,模型将优先向付费API开发者和Google AI Ultra订阅者开放,之后再逐步扩大覆盖范围至企业客户和普通消费者,目前官方尚未公布面向全体公众的具体开放时间节点。为了降低前沿模型的滥用风险,谷歌同步配套了多项发布前安全措施,包括监控模型内部激活以识别网络与生化核等滥用风险、强化对间接提示注入的抵抗力、隔离高风险训练与评测环境,以及对模型的思维链与动作进行失配监控,保障模型在可控范围内发挥能力。
API定价与智价比优势
谷歌为Gemini 4 Argon设置了梯度化的API定价方案,初期执行优惠的 introductory 价格,每百万输入Token定价2美元,每百万输出Token定价10美元,针对缓存输入的Token还可享受0.5折优惠,也就是仅为常规输入价格的5%。该初期定价约为同级竞品的五分之一,在当前前沿大模型产品中具备较高的智价比,能够大幅降低开发者调用前沿长上下文模型的使用成本。
在初期优惠期结束后,模型将切换至标准定价,每百万输入Token的价格调整为4美元,每百万输出Token的价格调整为20美元,缓存输入的折扣政策不再延续。即便切换至标准定价,该模型的整体使用成本仍低于多数同级别前沿模型,能够为需要高频调用长推理能力的企业和开发者提供更具性价比的选择。
谷歌内部实战应用成果
在正式对外发布之前,Gemini 4 Argon已经在谷歌内部完成深度落地应用,数千名员工已经日常使用该模型完成编码、研究和写作类任务,多个核心业务场景已经产出明确的优化成果。其中量子计算相关团队借助该模型的深度推理能力,仅用数分钟就将量子算法基线性能优化了40%,大幅缩短了前沿科研项目的迭代周期。
谷歌内部的智能体团队调用Gemini 4 Argon分析全公司数据中心的全链路遥测数据,自主定位并落地全集群的内存优化策略,全面铺开后释放出超过300TiB的内存资源,预计后续完成全部优化后可释放的内存总量将达到500TiB至1PiB,大幅提升数据中心硬件资源的利用效率。在代码迁移场景中,该模型承担了大规模C/C++代码库向Rust语言迁移的工作,覆盖包括Fuchsia操作系统的Zircon内核在内的超过80万行代码项目,其中在开源视频解码器libgav1的迁移案例中,智能体替换了3.2万行SIMD代码,最终产出的内存安全版本解码器运行速度比原有的Rust移植版快2.7倍,充分验证了长输出Token能力在大型软件工程场景中的实用价值。

(编辑:付健)

购物车