TradingKey - Google (GOOGL) 於美東時間 9 月 2 日發布兩款新模型:Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber。這是 Google 在六週內發布的第三款 Flash 系列模型,延續了先前 Gemini 3.7 Flash 的高速與低成本特點,同時進一步提升程式碼生成、複雜推理、Agent 任務以及網路安全能力。
前者被定位為面向軟體工程、Agent 與專業領域多步驟推理任務;後者則專注漏洞發現和自動修復,僅向通過審核的可信防禦者開放。
兩款模型雖然面向不同使用場景,但均基於相同的底層智慧核心,並透過長期運行的 Agent 循環,反覆評估與最佳化模型輸出。
Gemini 3.8 Flash 的最大升級方向,是處理複雜、連續且需要多輪工具呼叫的任務。Google 表示,在部分測試中,該模型的表現已接近成本更高的頂級模型。
在 DeepSWE v1.1 長週期軟體工程測試中,Gemini 3.8 Flash 的得分為 73.7%,高於 Gemini 3.7 Flash 的 65.3%,也超越 GPT-5.6 Sol 的 72.7% 和 GPT-5.6 Terra 的 69.6%,僅略低於 Claude Opus 5 的 74.0%。

來源:Google
在專業領域任務中,Gemini 3.8 Flash 同樣展現出較強競爭力。其中,HLE-Verified 涵蓋科學、技術、人文及專業知識等多學科問題,Gemini 3.8 Flash 在該測試中的表現也高於 Claude Sonnet 5 的 31.0%、GPT-5.6 Terra 的 51.1%、Claude Opus 5 的 54.4% 和 GPT-5.6 Sol 的 54.5%。
價格方面,Gemini 3.8 Flash 延續了 Gemini 3.7 Flash 的初始定價。輸入價格為每百萬 Token 0.75 美元;輸出價格為每百萬 Token 3.75 美元。
相比之下,Claude Opus 5 的輸入與輸出價格分別為 5 美元和 25 美元,GPT-5.6 Sol 分別為 4 美元和 20 美元,GPT-5.6 Terra 分別為 2 美元和 12 美元。
這意味著,Gemini 3.8 Flash 在部分程式設計與推理測試中接近甚至超越更大型模型,但呼叫成本明顯更低。對於需要部署程式碼智慧體、自動化分析和企業級工作流的開發者而言,性價比可能成為其核心吸引力。
Gemini 3.8 Flash Cyber 是此次發布的另一款重點模型,主要面向網路安全防禦場景。Google 表示,該模型不會廣泛開放,而是透過新的 Fairwind 計劃,向經過審核的可信防禦團隊提供。
在網路安全行業常用的 CyberGym 漏洞發現測試中,Gemini 3.8 Flash Cyber 得分達到 86.2%,高於 Gemini 3.5 Flash Cyber 的 77.5%,也超過 GPT-5.6 Sol 的 83.6%、Mythos 5 的 83.8% 以及 GPT-5.5-Cyber 的 85.6%。
在涵蓋 20 種程式語言的內部真實場景測試中,Gemini 3.8 Flash Cyber 的漏洞發現成功率達到 71.0%,高於 Gemini 3.7 Flash 的 58.9% 和 Gemini 3.5 Flash Cyber 的 46.6%。
在自動修復方面,Gemini 3.8 Flash Cyber 在 Collinear 運行的 CWE-Bench 測試中,pass@1 達到 47.2%,接近領先頂級模型的 47.8%,但 Google 強調其成本更低。