🚀 模型 · 发布速递

谷歌连发三款 Gemini Flash,把 AI 智能体推向规模化量产

7 月 21 日,Google DeepMind 同步推出 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber 三款模型,分别面向复杂工作流、高吞吐场景与代码安全。其中 3.6 Flash 在保持质量的同时输出 token 用量降 17%,3.5 Flash-Lite 跑出 350 tokens/s——为生产级 Agent 量产补齐了效率与成本最后一块拼图。

来源:官方发布 2026-07-21 全文约 4 分钟读完
#Gemini 3.6 Flash #Flash-Lite #Flash Cyber #AI Agent
3 款 同步发布,覆盖工作流/吞吐/安全三场景
17% 3.6 Flash 输出 token 较上代降幅
350 tok/s 3.5 Flash-Lite 吞吐速度

⚡ 30 秒速览

  • 3.6 Flash(主力机):编码与知识工作全面升级,token 效率提升 17%,单步推理与工具调用更少,输入 $1.50/百万、输出 $7.50/百万。
  • 3.5 Flash-Lite(吞吐机):3.5 系列最快,350 tok/s,输入 $0.30/百万、输出 $2.50/百万,多项 Agent 评测反超 3 Flash。
  • 3.5 Flash Cyber(安全机):专攻漏洞挖掘与修复,搭配 CodeMender 智能体,仅向政府与可信伙伴开放试点。
  • 下一步:3.5 Pro 已进入合作伙伴测试;Gemini 4 已启动"最具雄心的预训练"。

01三款模型,三种定位 同日发布、各司其职

谷歌此次发布并非单一升级,而是针对生产级 Agent 的三类瓶颈——质量与成本平衡、吞吐速度、安全对抗——同步给出方案:

主力机

3.6 Flash

编码、知识工作、多模态全面升级,token 效率提升 17%,多步推理更精简。

$1.50 / 百万输入 · $7.50 / 百万输出
吞吐机

3.5 Flash-Lite

3.5 系列最快,350 tok/s,高吞吐场景首选,多项 Agent 评测反超 3 Flash。

$0.30 / 百万输入 · $2.50 / 百万输出
安全机

3.5 Flash Cyber

基于 3.5 Flash 微调,专攻漏洞检测与修复,搭配 CodeMender 智能体。

限定试点 · 仅向政府与可信伙伴开放

023.6 Flash 比上代强在哪 六项基准横向对比

3.6 Flash 在保持质量的同时提升 token 效率,核心逻辑是用更少的推理步骤和工具调用完成同等任务。以下为官方披露的六项基准对比:

DeepSWE代码工程精度
3.5 Flash37%
3.6 Flash49%
MLE BenchML 研究能力
3.5 Flash49.7%
3.6 Flash63.9%
OSWorld-Verified计算机操作
3.5 Flash78.4%
3.6 Flash83.0%
GDPval-AA v2知识工作
3.5 Flash1349
3.6 Flash1421
SWE-Bench Pro代码工程(Lite vs 3 Flash)
3 Flash49.6%
3.5 Flash-Lite54.2%
Terminal-Bench 2.1终端任务(Lite vs 3.1 Lite)
3.1 Lite31%
3.5 Lite54%

注:柱形按各基准自身刻度缩放,仅作同项内直观对比;跨基准分数不可直接横比。3.5 Flash-Lite 在 SWE-Bench Pro 与 OSWorld-Verified 上反超 3 Flash,意味着"更便宜"的 Lite 版已在部分 Agent 任务中追平甚至超越上一代旗舰。

03它们能干什么 四类生产场景落地

💹 金融数据分析:财报与电话会议精读3.6 Flash

  • Managed Agents on AIS 上,3.6 Flash 比 3.5 Flash 更高效、准确地解析金融数据与电话会议记录。
  • 客户 Hebbia、Harvey 反馈其在文档解析、图表数据分析、报告起草等多模态任务上能力突出。
客户评价:在成本与质量上同时前进一步,平衡了 token 效率、准确性与速度。

🧩 代码迁移与多智能体编排3.6 Flash

  • AGY 平台上用多智能体编排执行代码迁移,延迟更低、质量更高。
  • 还能用 tldraw 离线编辑器构建交互式主题工作室,展现视觉理解能力。

⚡ 高吞吐批处理:电商与文档流水线3.5 Flash-Lite

  • 海量电商数据集中提取产品特征并合成结构化结果。
  • 作为 3.6 Flash 主智能体下的子智能体,瞬时生成 25 套可探索的网页设计方案。
  • 规模化处理收据翻译与摘要,并支持即时生成并迭代游戏选项。
定位:高吞吐、低延迟的生产流量承载,可按需在"低思考级别"与"多步推理"间切换。

🛡️ 漏洞挖掘与修复:安全对抗闭环3.5 Flash Cyber

  • AI 已能比现有系统更快发现漏洞——Flash Cyber 专攻"检测→验证→修补"全链路。
  • 在 CodeMender 中由多个 Cyber 智能体协作,输出合并报告,在 CyberGym 基准上达到前沿竞争力。
访问限制:仅向政府与可信伙伴开放试点,给前线防御者留出"先修后曝"的时间窗。

04安全护栏与下一代路线

3.6 Flash 出厂即搭载增强版 Frontier Safety 防护,覆盖化学、生物、放射、核(CBRN)及网络攻击滥用领域,对越狱攻击的抵抗力显著提升;同时训练目标刻意减少有益用途的误拒

传统安全对齐

偏保守拒答,有益用途常被连带拦截。

3.6 Flash 双目标

越狱抗性提升 + 有益用途误拒最小化。

Flash Cyber 的部署同样体现克制:因技术具有双重用途性质,谷歌采取定向开放策略——

限定试点政府与可信伙伴前线防御者优先缓解广泛滥用

路线图方面:3.5 Pro 正在合作伙伴中测试,准备就绪后广泛发布;团队已启动 Gemini 4 的预训练,官方称这是"迄今最具雄心的一次"。

编辑视角

本文数据全部来自 Google DeepMind 官方博客,属于企业通稿性质的单方披露。所有基准分数(DeepSWE、MLE Bench、OSWorld、CyberGym 等)均由谷歌自行引用或测试,未见独立第三方复测结果。读者宜带着以下背景理解:厂商自选基准、自选对比对象、自述提升幅度,是行业发布的常规操作——分数本身可信,但"最强""最快"等表述需等待独立榜单验证。

此外,3.5 Flash Cyber 的限定开放策略值得留意:这是主流大模型厂商首次将"专攻漏洞挖掘"的模型明确排除在公开 API 之外,仅向政府与可信伙伴开放。安全模型的访问控制,正在成为新的竞争维度。

当模型厂商开始按"主力机/吞吐机/安全机"分工发布,意味着 AI 行业已从"一个模型打天下"进入"Agent 工具箱"时代——模型不再单卖能力,而是卖可量产的工作流组件。

现在就能用

3.6 Flash 与 3.5 Flash-Lite 已在 Gemini API、Google AI Studio、Gemini Enterprise 及 Gemini App 上线;3.5 Flash Cyber 暂仅限受邀试点。

ai.google.dev → 开发者指南