
谷歌正式发布前沿AI模型Gemini 4 Argon。该模型目前仅面向受信任的网络防御人员及部分预发布测试人员开放,更广泛的可用性计划将在稍后推出。
在性能表现上,谷歌称Gemini 4 Argon在18项已公开的基准测试中,有13项处于领先地位或与竞争对手持平。具体来看,Argon在12项测试中以绝对优势领先,并在1项中与第一名并列。相比之下,GPT-6 Astra在3项测试中绝对领先,并与Argon在1项中并列第一;Claude Opus 5.5则在2项测试中取得绝对优势。
尽管OpenAI和Anthropic在多个重要技术类别中仍保持优势——例如GPT-6 Astra在软件、科学终端和计算机使用任务方面领先,Claude Opus 5.5在终端智能体和训练后工作流方面占优——但在谷歌公布的内部保密基准测试表中,Argon获得最高分或并列最高分的类别数量多于上述两款竞品。这表明,虽然竞争依然激烈,但Argon在高分分布的广度上已建立起整体领先优势。对于企业买家而言,模型选择仍需取决于具体的工作负载需求。
此外,Gemini 4 Argon显著提升了输出上限。谷歌表示,该模型支持业界领先的100万输出令牌,远超此前6.4万个令牌的限制。这一突破对于代理式软件工程、审计、迁移和法律审查等长链条工作负载具有显著区分度,因为这些场景的价值往往取决于模型在将控制权交还人类前能维持多长的工作链。