跳到正文
原文
IT之家 · AI 筛选·· 1 小时前精选AI 评分82

谷歌发布 Gemini 4 Argon 模型,DeepSWE 测试成绩超 Claude Opus 5.5

谷歌最前沿 AI 模型:Gemini 4 Argon 登场,长周期代码工程 DeepSWE 测试超 Claude Opus 5.5

AI 导读

谷歌正式发布 Gemini 4 Argon 模型,主打长流程软件工程、网络安全防御与企业知识工作,单次输出上限提升至约 100 万 tokens。在 DeepSWE v1.1 软件工程测试中其得分达 77.9%,高于 Claude Opus 5.5 与 GPT-6 Astra,并在 CWE-bench 安全漏洞修复测试中以 68% 并列第一。

推荐理由

原文给出了模型在长流程代码工程与安全基准上的测试成绩及输出上限,读者可以据此了解其在复杂开发场景中的性能定位。

来源:IT之家 · AI 筛选 · ithome.com