Gemini 4上线:性能超GPT-6,API定价腰斩
2026年9月30日深夜,谷歌正式发布新一代旗舰语言模型Gemini 4 Argon。这款等了将近一年的产品一出手就带着两套武器:跑分和价格。
在代码软件工程基准测试DeepSWE v1.1上,Argon录得77.9%得分,把刚发布的GPT-6 Astra(74.1%)和Claude Opus 5.5(74.2%)都甩在身后。更关键的是定价——每百万输入Token 2美元、输出Token 10美元。据量子位援引的消息,这一价格在单题调用层面比GPT-6 Astra低了大约四成。
对于正在为AI API账单发愁的企业来说,这个数字意味着什么?我们来算一笔账。
跑分亮眼,但Code Arena只排第八
Argon的技术亮点确实集中体现在代码和推理两个方向。它的输出上下文窗口扩展到100万Token,相比此前64K的上限是一个量级跃升。
量子位报道的数据显示,除了DeepSWE之外,Argon在漏洞修复基准CWE-bench v1上达到68%,与GPT-6 Astra并列第一;自动化任务基准AutomationBench上跑出51.3分,排名第一。谷歌还演示了一个具体实验:将视频解码器移植到Rust语言后,Argon实现了2.7倍的性能提升。在谷歌自有数据中心的实践中,它被用于识别并修复内存漏洞,预期释放超过300TiB的存储空间。
但这些数字有一个前提条件:它们主要来自受控的基准测试。
在同为量化评测的Code Arena项目中,Argon的表现并不突出——排在第八位,反而落后于同期竞品。Text Arena方面以1525分位居榜首,但这种侧重理解能力的测试与实际的软件开发效率之间,隔着一条难以精确丈量的鸿沟。
换言之,Argon擅长的是“特定场景的深度推理”,而非通用编码能力的全方位碾压。这也解释了为什么谷歌选择先向网络安全防御方开放——这个垂直领域恰好能最大化Argon的优势,同时最小化其短板的影响。
值得注意的是,这种选择性开放的策略在AI行业并不新鲜。从AlphaFold到早期的Stable Diffusion,高性能模型往往先在科研和专业领域打磨,再逐步推向大众市场。对谷歌而言,Fairwind计划既是一种安全管控手段,也是一种低成本的市场验证方式。
2美元的定价信号
真正的冲击来自价格。
每百万输入Token 2美元、输出10美元。这是谷歌面向付费API客户直接公布的入门级价格结构——缓存输入的Token更是享受95%折扣,即仅需0.1美元/百万Token。
作为参照,GPT-6 Astra的同等定价高出约40%。这意味着一个每天调用数百万次大模型请求的中大型企业客户,年度API支出可能缩减数万美元甚至数十万美元的量级。
当然,Argon当前并非全面开放。它已首批接入谷歌“Fairwind计划”,专门面向通过背景审查的网络安全防御方。这个安排有其合理性:Argon的去护栏版本移除了网络防御安全限制,让企业可以自主用它进行黑箱渗透测试和漏洞挖掘。Wiz等网络安全公司已经将其纳入内部测试流程。
但在商业化路径上,谷歌明确表示未来将逐步面向开发者、企业和消费者开放——首先触达的是付费API用户和Google AI Ultra订阅群体。
这种“先垂直行业、再泛化推广”的节奏,本质上是一种风险控制策略:既能让早期采用者获得性价比优势,又能在出现问题时将影响范围限制在可控领域。对OpenAI和Anthropic而言,这不仅仅是竞争对手发布新模型的常规动作,而是直接冲击其企业客户预算的定价挑战。
谷歌员工为什么不买账
就在量子位的报道末尾,披露了一个耐人寻味的细节:谷歌内部不少工程师对Argon的实际表现持保留态度。
他们的质疑集中在两个方面。其一是部分真实场景下的编程效果并未达到跑分显示的亮眼程度,有人怀疑存在特定数据集“刷榜”的可能性。其二是前端界面的交互体验仍是短板,用户反馈不够流畅。
这不罕见。大型模型研发过程中,基准测试与实际生产力之间的落差几乎是必然存在的——前者测试的是“在已知规则下能否解题”,后者考验的是“在不确定的需求中能否持续产出可用结果”。
但内部质疑的价值在于提醒我们:跑分只是入场券,不是通行证。如果Argon不能在实际开发工作流中证明自己的不可替代性,那么即便价格便宜40%,企业也可能选择继续观望,或者同时使用多个模型来弥补短板。
从商业角度看,这种内部分歧也可能被竞品利用。OpenAI和Anthropic完全可以在客户沟通中放大这些质疑,强调“稳定可靠比跑分更重要”的话术策略。毕竟在AI赛道,信任本身就是最贵的成本。
价格战之后的下一局
Argon的发布标志着AI基础设施成本曲线进入新一轮下行通道。当头部模型的API价格从每百万5美元跌至2美元,整个产业的经济账需要重算。
中小企业可以更便宜地尝试大模型应用,不再需要先验证商业模式再承担高昂调用成本;企业IT决策者将面临新的选型压力——如果两个模型在某个任务上表现相近,价格差距就是决定性因素;开源社区的压力也在增大,闭源模型的性价比持续逼近开源方案,后者需要在延迟、定制化和隐私保护上寻找差异化。
但这一切的前提是Argon能够在大规模商业场景中稳定兑现其承诺。对于普通用户而言,真正的影响还不在于今天跑了多少分、明天能省多少钱,而在于什么时候能用到它——以及到时候,它是否真的像跑分那样好用。
接下来关注三个指标
API账单变化:观察主流云服务商在Argon全量开放后是否会跟进降价,这决定了价格战的范围。
实际代码采纳率:开发者在使用Argon辅助编码后的代码合并率和问题修复周期,比任何基准分数都有说服力。
企业采购意向:关注是否有知名企业在公平开放后宣布迁移或新增Gemini API部署,用真金投票比跑分更可靠。


