
随着谷歌准备向公众推出全新的 Gemini 4 “Argon”模型,公司内部正加速测试更优版本,以期进一步缩小与竞争对手在 AI 编程智能体领域的差距。
据媒体报道及内部文件显示,谷歌员工近期在内部编码平台 Jetski 上试用了一款代号为 “Carbon” 的新版 Gemini 4。该模型可能是 Argon 的最新更新版本(即“检查点”)。一名参与测试的员工表示,Carbon 在编程方面的表现“感觉像 Opus 5.5”,直指 Anthropic 专为长期智能体编程打造的最新强大模型。不过,该员工也强调,目前仍需进一步测试才能下定论。
早期版本的 Argon 在内部测试中虽普遍获好评,但有员工指出其在某些编程任务上略显滞后,性能仅与 Anthropic 较早发布的 Claude Opus 5 相当。最新的 Carbon 更新有望缩小这一差距,但谷歌并未保证一定会发布这些内部版本。文件显示,谷歌正在测试一系列 Gemini 4 模型,内部代号包括 Argon、Barium 和 Carbon。
值得注意的是,谷歌的内部代号通常与公开名称不同步。例如,内部代号 “Barium-B” 的模型最终被选为对外公开的 Argon 模型。目前尚不清楚 Carbon 是作为 Argon 名下的另一个更新版本,还是 Gemini 4 家族中的另一款独立模型。
内部热议与竞争态势
在内部消息频道中,员工们对新版模型展开了热烈讨论。“Carbon 真的很好!”一位员工评论道,认为其表现与 Opus 5.5 相当。另有用户发帖称,“新的 Gemini Pro Next 模型感觉还不错”,指的是内部通常赋予新 Gemini 更新的 “Next” 标签。
谷歌上月曾表示,Argon 在法律、金融等编程和知识工作基准测试中达到了前沿性能,并在防御性网络安全方面具有强大优势。在广泛向公众推出之前,谷歌将首先通过 Fairwind 计划向合作伙伴提供该模型,以测试新模型的网络漏洞。
当前,Anthropic 和 OpenAI 凭借为复杂工程工作设计的模型,在开发者群体中已领先一步。谷歌正面临着展示其模型能力保持前沿竞争力的巨大压力。本周,该公司宣布了一款专为职场设计的新型“通用”Gemini AI 智能体,意在日益激烈的智能体助手竞争中加强市场地位。