AI 模型

Google 发布 Gemini 3.8 Flash,并为可信防御者推出 Cyber 版本

Google 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者提升编码与推理能力,后者面向可信防御者提供漏洞发现和修复能力。

发布于 更新于
Google DeepMindGeminiAI 模型

Google 9 月 2 日发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,把这次更新定位为长周期编码、agent 工作流和防御性网络安全的一次重要升级。新模型距离 Gemini 3.7 Flash 发布只有数周,但普通 Flash 版本继续维持相同的 introductory 价格,即 2026 年底前每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。Google 希望传递的信息很明确:Flash 系列不只是低成本模型,也能承担更复杂、更持久的推理和工程任务。

Gemini 3.8 Flash 面向开发者和企业场景,重点是较低成本下的持续工具调用能力。Google 称它在软件工程、agent 任务和专业领域多步骤推理方面都较 3.7 Flash 有明显提升。公司提到 DeepSWE v1.1、Vals Finance Agent V2、Harvey’s Legal Agent Benchmark 和 HLE-Verified 等评测,其中 HLE-Verified 分数为 54.9%。这些指标背后更关键的是产品方向:模型需要能在复杂任务中反复调用工具、检查结果、继续推进,而不是只回答短提示。

Gemini 3.8 Flash Cyber 则采取更严格的分发方式。Google 称它是公司目前最强的网络安全模型,将通过 Fairwind Program 向可信防御者开放。它与 Gemini 3.8 Flash 基于同一底层智能,但针对漏洞发现和自动化补丁生成进行了部署和调整。Google 表示,该模型在 CyberGym 上达到前沿级自主漏洞发现表现;在覆盖 20 种编程语言复杂代码库的内部基准中,成功率超过 70%。

Google 特别强调防御优先,而不是进攻性漏洞利用。公司称 Gemini 3.8 Flash Cyber 旨在帮助安全团队快速发现、验证并修复漏洞。在 Collinear 运行的外部补丁基准 CWE-Bench 上,Google 报告 pass@1 为 47.2%,接近一个更大型前沿模型的 47.8%,但成本显著更低。Google 还称,Chrome 安全团队发现该模型为 Chrome 漏洞生成的正确补丁数量,是更大型商业模型的 2.6 倍;Wiz 也在内部渗透测试基准中观察到更高召回率和更低成本。

这次发布也说明,大型 AI 实验室正在把网络能力视为特殊部署类别。Gemini 3.8 Flash 对化学、生物、放射、核以及网络攻击相关滥用配备保护措施。Gemini 3.8 Flash Cyber 对网络安全工作更开放,但只提供给 Google 认定的可信防御组织。Google 还表示,新模型在 Gray Swan 衡量的提示注入鲁棒性上有显著提升,这对需要读取不可信网页、文档和代码的 agent 尤其重要。

从市场角度看,这次发布让竞争焦点不再只是模型分数,还包括成本、访问控制和实际交付方式。开发者可以在 Google AI Studio、Gemini API、Android Studio、Google Antigravity、Gemini Enterprise,以及 Gemini App、Search AI Mode 等消费产品中使用 Gemini 3.8 Flash。Cyber 版本则被放在更敏感的位置,通过受限渠道发放。未来前沿模型很可能越来越多采用这种结构:通用推理模型广泛开放,高影响力专用版本则通过审核机制提供。