跳到正文
原文
Google DeepMind·· 2026-09-03精选AI 评分74

Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

AI 导读

Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。

推荐理由

原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。

正文 · AI 翻译

2026年9月2日

|

我们最新的Gemini模型为智能体工作流和网络安全带来下一代智能。


Raluca Ada Popa

Gemini安全负责人,Google DeepMind


a hero image reading "Gemini 3.8 Flash and 3.8 Flash Cyber"

在三周前3.7 Flash的基础上,并标志着我们在仅六周内第三次发布Flash版本,今天我们推出Gemini 3.8,这是我们迄今为止最好的推理和编码模型,速度与3.7相同且成本更低。Gemini 3.8推出两个版本:

  • Gemini 3.8 Flash:我们最智能的主力模型,在软件工程、智能体任务以及专业领域的复杂多步推理方面相比3.7 Flash有显著提升。它以与3.7 Flash相同的入门价格提供,每百万输入tokens $0.75,每百万输出tokens $3.75。 1
  • Gemini 3.8 Flash Cyber:我们最强大的网络安全模型,在漏洞检测和自动修补方面达到前沿性能,通过我们的新Fairwind计划向可信防御者提供。

尽管针对不同的部署环境进行了定制,今天的两个版本都由相同的基础智能驱动,并通过用于递归评估和优化底层模型的长期运行智能体循环进一步加速。这一共享核心在编码和推理方面的显著提升源于多项创新,包括在要求严苛的网络安全领域进行的严格训练。

Gemini 3.8 Flash:为长期编码和自主智能体而打造

Gemini 3.8 Flash相比3.7 Flash有大幅提升,往往接近成本更高的前沿模型的性能。

comparison chart showing Gemini 3.8 Flash and other models

在DeepSWE v1.1(长期软件工程)上,3.8 Flash在自主解决端到端复杂工程问题方面优于大多数更大的前沿模型,而成本仅为其一小部分。

chart showing Gemini 3.8 Flash DeepSWE v1.1

此外,3.8 Flash展现了在关键企业自动化中所需的可靠性,覆盖专业知识领域。在需要高级分析和报告的量化和专业领域,3.8 Flash在Vals Finance Agent V2和Harvey法律智能体基准等基准测试中优于3.7 Flash和其他前沿模型。3.8 Flash在HLE-Verified上还达到54.9%的得分,展示了其在STEM、人文学科和专业领域处理多步推理的能力。

chart showing Gemini 3.8 Flash Vals Finance Agent v2

a chart showing Gemini 3.8 Flash Harvey's Legal Agent Benchmark

a chart showing Gemini 3.8 Flash HLE-Verified

这些性能提升源于一个核心设计选择:3.8 Flash更努力地工作。在复杂任务上,它表现出更大的勤勉——执行额外的推理步骤,并迭代地调用工具。有时,模型可能会使用更多tokens以最大化性能,尤其是在更高投入水平下。

对于计算效率是主要约束的应用,开发者可以降低投入水平以最小化token开销,或继续依赖Gemini 3.7 Flash,后者在效率优先的工作负载上仍得到全面支持。

Gemini 3.8 Flash Cyber:专家级网络性能

Gemini 3.8 Flash Cyber通过Fairwind计划向一组可信防御者提供,凭借Flash的速度和成本支持快速迭代,在当今复杂的网络安全环境中提供决定性优势。

自主漏洞发现

在行业标准漏洞发现基准测试中,CyberGym上的Gemini 3.8 Flash Cyber在自主漏洞发现方面展现出前沿水平的性能。它超越了3.5 Flash Cyber以及规模显著更大的前沿模型。

a chart showing Gemini 3.8 Flash Cyber CyberGym Pass@1

为了更好地捕捉现实世界的防御需求(这些需求不仅限于CyberGym中的C/C++代码库),我们还对Gemini 3.8 Flash Cyber进行了全面的内部基准测试评估,该模型需要跨20种编程语言的复杂代码库中发现广泛的漏洞。在此基准测试中,该模型展示出相较于我们之前模型的显著飞跃,成功率超过70%。

Chart showing Gemini 3.8 Flash Cyber real world vulnerability discovery

自动化修补

对于Gemini 3.8 Flash Cyber,我们特别专注于为防御者提供专家级能力,使他们在对抗攻击者时占据优势。这就是为什么我们从一开始就投资于漏洞修复,并将其优先级置于利用等攻击性能力之上。

CWE-Bench由Collinear运营,是一个具有挑战性的外部修补能力基准测试。在此基准测试中,Gemini 3.8 Flash Cyber处于帕累托前沿:pass@1为47.2%,而领先的前沿模型为47.8%,但其成本显著更低。

Chart showing Gemini 3.8 Flash Cyber StaticBench Pass@1 vs Cost Per Rollout

现实世界影响:保护谷歌代码的安全

我们已经在使用Gemini 3.8 Flash Cyber来保护谷歌内部的代码。例如:

  • Chrome安全团队发现,3.8 Flash Cyber针对Chrome漏洞生成的正确补丁数量是体型大得多的最佳商业模型的2.6倍。
  • Wiz发现,Gemini 3.8 Flash Cyber在其内部渗透测试基准上的召回率高出7.5-9.7%,而成本仅为其他领先前沿模型的1/2.3至1/5.2。
  • 谷歌云漏洞研究团队利用3.8 Flash Cyber模型在不到2小时内发现了一个关键的基础性漏洞,而这类漏洞通常需要数月的研究和发现时间。

我们的Fairwind计划合作伙伴的反馈

quote from David Slater, Founder and Chief Architect, Armadin

quote from Charlie Sestito, Director, Office of the CTO, Palo Alto Networks

quote from Mayank Upadhyay, CSTO, Snowflake

quote from Gal Nagli, Head of Threat Exposure, Wiz

以安全为设计理念

3.8 Flash在化学、生物、放射性和核(CBRN)以及网络攻击领域内置了防滥用保护措施,同时支持有益用例,依据我们的前沿安全框架。3.8 Flash Cyber在网络安全方面提供了更宽松的缓解措施,因此仅对需要更全面网络能力的可信防御者开放。

根据Gray Swan的评估,Gemini 3.8模型在提示注入鲁棒性方面也取得了显著进步,保护Gemini模型用户免受与提示注入相关的恶意攻击。

a chart showing Gemini 3.8 Flash Cyber Gray Swan IPI Benchmark

Gemini 3.8 Flash和Cyber:立即开始使用

来源:Google DeepMind · deepmind.google