谷歌连发三款 Gemini Flash,把 AI 智能体推向规模化量产
7 月 21 日,Google DeepMind 同步推出 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber 三款模型,分别面向复杂工作流、高吞吐场景与代码安全。其中 3.6 Flash 在保持质量的同时输出 token 用量降 17%,3.5 Flash-Lite 跑出 350 tokens/s——为生产级 Agent 量产补齐了效率与成本最后一块拼图。
7 月 21 日,Google DeepMind 同步推出 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber 三款模型,分别面向复杂工作流、高吞吐场景与代码安全。其中 3.6 Flash 在保持质量的同时输出 token 用量降 17%,3.5 Flash-Lite 跑出 350 tokens/s——为生产级 Agent 量产补齐了效率与成本最后一块拼图。
谷歌此次发布并非单一升级,而是针对生产级 Agent 的三类瓶颈——质量与成本平衡、吞吐速度、安全对抗——同步给出方案:
编码、知识工作、多模态全面升级,token 效率提升 17%,多步推理更精简。
3.5 系列最快,350 tok/s,高吞吐场景首选,多项 Agent 评测反超 3 Flash。
基于 3.5 Flash 微调,专攻漏洞检测与修复,搭配 CodeMender 智能体。
3.6 Flash 在保持质量的同时提升 token 效率,核心逻辑是用更少的推理步骤和工具调用完成同等任务。以下为官方披露的六项基准对比:
注:柱形按各基准自身刻度缩放,仅作同项内直观对比;跨基准分数不可直接横比。3.5 Flash-Lite 在 SWE-Bench Pro 与 OSWorld-Verified 上反超 3 Flash,意味着"更便宜"的 Lite 版已在部分 Agent 任务中追平甚至超越上一代旗舰。
3.6 Flash 出厂即搭载增强版 Frontier Safety 防护,覆盖化学、生物、放射、核(CBRN)及网络攻击滥用领域,对越狱攻击的抵抗力显著提升;同时训练目标刻意减少有益用途的误拒。
偏保守拒答,有益用途常被连带拦截。
越狱抗性提升 + 有益用途误拒最小化。
Flash Cyber 的部署同样体现克制:因技术具有双重用途性质,谷歌采取定向开放策略——
路线图方面:3.5 Pro 正在合作伙伴中测试,准备就绪后广泛发布;团队已启动 Gemini 4 的预训练,官方称这是"迄今最具雄心的一次"。
本文数据全部来自 Google DeepMind 官方博客,属于企业通稿性质的单方披露。所有基准分数(DeepSWE、MLE Bench、OSWorld、CyberGym 等)均由谷歌自行引用或测试,未见独立第三方复测结果。读者宜带着以下背景理解:厂商自选基准、自选对比对象、自述提升幅度,是行业发布的常规操作——分数本身可信,但"最强""最快"等表述需等待独立榜单验证。
此外,3.5 Flash Cyber 的限定开放策略值得留意:这是主流大模型厂商首次将"专攻漏洞挖掘"的模型明确排除在公开 API 之外,仅向政府与可信伙伴开放。安全模型的访问控制,正在成为新的竞争维度。
3.6 Flash 与 3.5 Flash-Lite 已在 Gemini API、Google AI Studio、Gemini Enterprise 及 Gemini App 上线;3.5 Flash Cyber 暂仅限受邀试点。
ai.google.dev → 开发者指南