谷歌发布Gemini 3.8 Flash:性能逼近顶级模型Claude Opus 5,性价比仍是其核心竞争力

来源 Tradingkey

TradingKey - 谷歌(GOOGL)于美东时间9月2日发布两款新模型:Gemini 3.8 Flash与Gemini 3.8 Flash Cyber。这是谷歌在六周内发布的第三款Flash系列模型,延续了此前Gemini 3.7 Flash的高速和低成本特点,同时进一步提升代码生成、复杂推理、智能体任务以及网络安全能力。

前者被定位为面向软件工程、智能体和专业领域多步骤推理任务;后者则专注漏洞发现和自动修复,仅向通过审核的可信防御者开放。

两款模型虽然面向不同使用场景,但均基于相同的底层智能核心,并通过长期运行的智能体循环,反复评估和优化模型输出。

Gemini 3.8 Flash:强化长周期编程与Agent任务

Gemini 3.8 Flash的最大升级方向,是处理复杂、连续且需要多轮工具调用的任务。谷歌表示,在部分测试中,该模型的表现已经接近成本更高的顶级模型。

在DeepSWE v1.1长周期软件工程测试中,Gemini 3.8 Flash的得分为73.7%,高于Gemini 3.7 Flash的65.3%,也超过GPT-5.6 Sol的72.7%和GPT-5.6 Terra的69.6%,仅略低于Claude Opus 5的74.0%。

8-a2b3c0c9f0044ec88039f9ca0ce895fc

来源:Google

在专业领域任务中,Gemini 3.8 Flash同样展现出较强竞争力。其中,HLE-Verified覆盖科学、技术、人文及专业知识等多学科问题,Gemini 3.8 Flash在该测试中的表现也高于Claude Sonnet 5的31.0%、GPT-5.6 Terra的51.1%、Claude Opus 5的54.4%和GPT-5.6 Sol的54.5%。

价格方面,Gemini 3.8 Flash延续了Gemini 3.7 Flash的初始定价。输入价格为每百万Token0.75美元;输出价格为每百万Token3.75美元。

相比之下,Claude Opus 5的输入和输出价格分别为5美元和25美元,GPT-5.6 Sol分别为4美元和20美元,GPT-5.6 Terra分别为2美元和12美元。

这意味着,Gemini 3.8 Flash在部分编程和推理测试中接近甚至超过更大型模型,但调用成本明显更低。对于需要部署代码智能体、自动化分析和企业级工作流的开发者而言,性价比可能成为其核心吸引力。

Gemini 3.8 Flash Cyber:专注漏洞发现与自动修复

Gemini 3.8 Flash Cyber是此次发布的另一款重点模型,主要面向网络安全防御场景。谷歌表示,该模型不会广泛开放,而是通过新的Fairwind计划,向经过审核的可信防御团队提供。

在网络安全行业常用的 CyberGym漏洞发现测试中,Gemini 3.8 Flash Cyber得分达到 86.2%,高于Gemini 3.5 Flash Cyber的77.5%,也超过GPT-5.6 Sol的83.6%、Mythos 5的83.8%以及GPT-5.5-Cyber的85.6%。

在覆盖20种编程语言的内部真实场景测试中,Gemini 3.8 Flash Cyber的漏洞发现成功率达到 71.0%,高于Gemini 3.7 Flash的58.9%和Gemini 3.5 Flash Cyber的46.6%。

在自动修复方面,Gemini 3.8 Flash Cyber在Collinear运行的CWE-Bench测试中,pass@1达到 47.2%,接近领先顶级模型的47.8%,但谷歌强调其成本更低。

免责声明:仅供参考。 过去的表现并不预示未来的结果。
goTop
quote