🌐 大模型 · 谷歌三连发
谷歌连发三款 Gemini 新模:Token 最高暴降 65%、速度榜包揽前二,但用户苦等的 3.5 Pro 又鸽了
7 月 22 日凌晨,谷歌发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber 三款模型,主线只有一条:为 Agent 工作流省 Token、提速度、稳运行。同时官宣 Gemini 4 已启动公司迄今最大规模预训练——而 I/O 大会上承诺「6 月见」的 Gemini 3.5 Pro,至今仍在合作伙伴测试。
来源:公开报道•
2026-07-22•
全文约 4 分钟读完
#谷歌 Gemini
#AI Agent
#大模型评测
#Gemini 4
−65%
DeepSWE 单任务输出 Token 降幅:27.6 万 → 9.7 万
350 tok/s
3.5 Flash-Lite 输出速度,速度榜第 1
50 分
Intelligence Index 仅列第 7,落后 6 款竞品
⚡ 30 秒速览
- 发了什么:3.6 Flash 主攻编程 / 知识工作 / 多模态;3.5 Flash-Lite 每秒 350 Token,系列最快最便宜;3.5 Flash Cyber 专盯安全漏洞,不对普通开发者开放。
- 省了多少:3.6 Flash 在 DeepSWE 单任务输出 Token 从 27.6 万降到 9.7 万(−65%),Artificial Analysis 智力指数 Token 消耗降 17%;输出价 $7.5 / 百万 Token,低于上代。
- 强与弱:官方自测 DeepSWE 得分 49%(上代 37%);但第三方 Intelligence Index 仅 50 分排第 7,单任务成本 $0.50 也贵于多家竞品——速度是谷歌仅剩的榜一。
- 两张期货:3.5 Pro 预告 6 月发布至今跳票,仍「与合作伙伴测试」;Gemini 4 刚启动「公司史上最大」预训练任务。
- 去哪用:两款开放模型已上线 Google AI Studio 与 Gemini API,Gemini 应用同步可用,Lite 版将逐步接入谷歌搜索。
01三款新模总览 两款现货 + 一把「不随便发」的安全刀
Gemini 3.6 Flash
Agent 工作流主力:编程、知识工作、多模态任务;更少推理步骤与工具调用,输出冗余更低。
输入 $1.5 · 输出 $7.5 / 百万 Token
输出价低于 3.5 Flash,输入价不变
✅ 已开放
Gemini 3.5 Flash-Lite
低延迟、高吞吐:面向 Agent 搜索、文档处理等场景;思考等级可按负载调节。
输入 $0.3 · 输出 $2.5 / 百万 Token
3.5 系列速度最快、价格最低
✅ 已开放
Gemini 3.5 Flash Cyber
基于 3.5 Flash 微调:专职发现、验证并修复网络安全漏洞,搭配代码安全 Agent CodeMender 使用。
未公开售卖
Token 定价低于大模型,适合规模化安全检查
🔒 仅政府与可信伙伴试点
✅ 已开放渠道:Google AI Studio、Android Studio、Gemini API(3.6 Flash 另接入 Google Antigravity 与 Gemini Enterprise 应用);企业客户走 Gemini Enterprise Agent Platform;普通用户可在 Gemini 应用使用,3.5 Flash-Lite 后续接入谷歌搜索。
02Gemini 3.6 Flash 把 Agent 任务的 Token 账单打下来
新模型基于开发者和企业客户对 3.5 Flash 的反馈改进:处理多步骤工作流时,推理步骤和工具调用次数更少,同时压缩了输出冗余——省 Token,就是省钱。
−65%DeepSWE 单任务输出 Token:27.6 万 → 9.7 万
−17%AA 智力指数平均输出 Token:2.8 万 → 2.3 万
$7.5每百万输出 Token 定价(输入 $1.5 不变)
−34%代码迁移任务整体耗时(官方演示)
| 基准测试 | 3.1 Pro | 3.5 Flash | 3.6 Flash | 较 3.5 Flash |
| DeepSWE v1.1 · 软件工程 Agent | 12% | 37% | 49% | +12pp |
| MLE-Bench · 机器学习工程 | 42.6% | 49.7% | 63.9% | +14.2pp |
| GDPval-AA v2 · 知识工作 | 965 | 1349 | 1421 | +72 |
| OSWorld-Verified · 计算机操作 | 76.2% | 78.4% | 83.0% | +4.6pp |
数据来源:官方发布。另:Computer Use(计算机操作能力)现已成为 Gemini API 与 Gemini Enterprise 的内置客户端工具。
💻 官方演示:一次代码迁移任务的正面对比总耗时 −34%
- 规划阶段 24 秒 → 20 秒;执行迁移 2 分 08 秒 → 1 分 20 秒,整体耗时减少约 34%。
- 3.6 Flash 生成了更详细、结构更清晰的代码审计与验证文档,覆盖数据模型、API 接口、业务逻辑、UI 组件等多项验证任务。
- 同场展示:金融数据与电话会议记录分析、多 Agent 协作代码迁移、3D 工作流照片纹理提取工具、结合 tldraw 离线编辑器创建交互式主题设计工具。
「在质量、速度和成本之间取得了较好平衡,可以加快原型探索和迭代。」
Figma · 设计软件公司
文档起草和审查任务平均快 12%。
Harvey · 法律 AI 公司
低推理等级下的编程性能较上一代 Flash 提高10%–20%。
JetBrains · 开发工具公司
注:以上客户评价均引自谷歌官方发布,为谷歌挑选的正面案例。
🛡️ 安全加固:3.6 Flash 加强了针对化学、生物、放射性与核风险(CBRN)以及网络攻击滥用的前沿安全防护,提升抵抗越狱攻击的能力,同时尽量减少对正常用途的错误拒绝。
03同一周的另一份榜单 速度前二,智力第七(Artificial Analysis 第三方口径)
行业媒体直言:作为昔日大模型「御三家」之一,谷歌此次最突出的优势仍然是速度。把官方自测放一边,第三方机构 Artificial Analysis 的榜单讲了另一个故事:
⚡ 输出速度榜 · 包揽前二
3.5 Flash-Lite 以 350 tok/s 位列第 1,3.6 Flash 紧随其后第 2——Flash 家族把「快」守住了。
🧠 Intelligence Index · 仅列第 7
3.6 Flash 智力得分 50,身前压着 6 款模型;单任务成本 $0.50(≈¥3.39),贵于 DeepSeek、MiniMax、GLM、Muse Spark、Grok。
- 1Claude Fable 5Anthropic得分未披露
- 2GPT-5.6 SolOpenAI得分未披露
- 3Kimi K3月之暗面得分未披露
- 4Grok 4.5xAI得分未披露
- 5GLM-5.2智谱得分未披露
- 6Muse Spark 1.1Meta得分未披露
- 7Gemini 3.6 Flash谷歌50 分
注:原始报道仅给出 3.6 Flash 得分(50)与完整排序,未披露前六名具体分数;以上为 Artificial Analysis 第三方测评,与第 02 节谷歌自测口径不同,请分开采信。
🇨🇳 背景补一刀:上周月之暗面发布 Kimi K3,Intelligence 得分仅落后 Claude Fable 5 与 GPT-5.6 Sol,在前端编程测试中甚至排到榜首。行业媒体评价:国产模型已从跟随者变成全球前沿竞争的重要力量——谷歌面对的对手,远不止 OpenAI 和 Anthropic。
04Gemini 3.5 Flash-Lite 最快最便宜,还能越级打
定位 Agent 搜索、文档处理等低延迟、高吞吐场景。开发者可按工作负载调节思考等级:大规模低成本任务选 minimal / low,多步骤子 Agent 任务再开高档;同样内置 Computer Use 工具。
350 tok/s输出速度 · 速度榜第 1
$0.3每百万输入 Token(≈¥2),系列最低
$2.5每百万输出 Token(≈¥17)
+23ppTerminal-Bench 2.1 较上代 Lite 提升
| 基准测试 | 3.1 Flash-Lite | 3.5 Flash-Lite | 提升 |
| Terminal-Bench 2.1 · Agent 终端编程 | 31% | 54% | +23pp |
| GDM-MRCR v2 · 长上下文 | 60.1% | 72.2% | +12.1pp |
| GDPval-AA v2 · 知识工作 | 642 | 1140 | +498 |
数据来源:官方发布。
Gemini 3 Flash(定位更高)
SWE-Bench Pro:49.6%
OSWorld-Verified:65.1%
Gemini 3.5 Flash-Lite(小弟越级)
SWE-Bench Pro:54.2%
OSWorld-Verified:74.0% —— 两项反超
💬 早期客户反馈:美国金融科技公司 Ramp 认为,3.5 Flash-Lite 在票据提取任务中「较好地平衡了准确率、延迟和成本」。
05Gemini 3.5 Flash Cyber 一把不随便发的「安全手术刀」
基于 3.5 Flash 微调,专职发现、验证、修复网络安全漏洞;Token 价格低于大模型,适合规模化检查代码安全。它与谷歌代码安全 Agent CodeMender 配合使用:
并行运行多个 Cyber Agent→合并各路分析结果→输出统一安全报告
CyberGym 测试横向对比(CodeMender 最多调用 5 次模型时,Cyber 得分 83.2%):
GPT-5.5-CyberOpenAI Agent 内
85.6
Mythos 5Anthropic Agent 内
83.8
GPT-5.6 SolOpenAI Agent 内
83.6
Gemini 3.5 Flash CyberCodeMender 内 · ≤5 次调用
83.2
Mythos PreviewAnthropic Agent 内
83.1
注:柱形自 82 分起缩放,非零起点,分差以标注分数为准;各模型均运行于不同厂商的 Agent 框架内,为「Agent 内模型」口径。结论:Cyber 与 Mythos 5、GPT-5.6 Sol 能力相当,已达前沿模型竞争水平。
⚠️ 开放策略:漏洞发现与修复技术具有明显的双重用途,谷歌暂不向普通开发者开放该模型;近期将通过 CodeMender 启动小范围试点,仅供政府机构和可信合作伙伴使用。
06现货之外,是两张期货 3.5 Pro 跳票 · Gemini 4 点火
-
2026-05 · Google I/O
CEO 桑达尔·皮查伊(Sundar Pichai)预告:Gemini 3.5 Pro 将于 6 月推出。
-
2026-06 · 跳票
承诺月份过去,3.5 Pro 没有现身。
-
2026-07-22 · 现状
谷歌口径:3.5 Pro「正在与合作伙伴测试,将在准备就绪后尽快发布」。等了两个月的用户,等来的是三款 Flash。
-
同日 · 新「饼」
官宣 Gemini 4:已启动公司迄今规模最大的预训练任务——从预训练到正式发布,通常还要以季度计。
编辑核心判断
当竞争指标从单次跑分转向「单任务总成本」,谷歌用 Flash 系列把速度与价格打到极致、用生态守住落地;但智力榜前六已无谷歌身影——想重回牌桌中央,只能押注一再跳票的 3.5 Pro 和刚刚点火训练的 Gemini 4。
✍️ 编辑视角 · 这篇报道该怎么读
- 信源构成:本篇为行业媒体的编译整合稿,素材 = 谷歌官方发布稿 + 谷歌官方演示(耗时对比、客户评价)+ 第三方机构 Artificial Analysis 榜单。前两类本质是发布会通稿素材,自带立场;本页已用「官方自测 / 第三方」在各节分别标注,请分开采信。
- 「结论分裂」恰是这篇报道的真实增量:官方口径里 3.6 Flash 进步巨大(Token −65%、DeepSWE 49%);第三方榜上它智力第 7、单任务 $0.50 偏贵、只剩速度第一。两组数字并不矛盾,合起来才是全貌——这是一次「降本提速」的迭代,而非「智力登顶」。
- 客户好评按广告读:Figma、Harvey、JetBrains、Ramp 的评价均由谷歌挑选并发布,属发布会标准配置,不等于独立评测。
- 「Gemini 4 要来了」请打折:目前仅是预训练任务启动公告,距发布通常以季度计,原标题的紧迫感更多是传播修辞。但其「国产模型已从跟随者变为前沿力量」的判断,有 Kimi K3、GLM-5.2 在第三方榜单上的位次支撑,值得认真对待。
▶现在就能用
Gemini 3.6 Flash 与 3.5 Flash-Lite 已上线 Google AI Studio、Android Studio 与 Gemini API,普通用户可在 Gemini 应用中体验,Lite 版后续接入谷歌搜索;3.5 Flash Cyber 仅政府与可信伙伴试点,无公开入口。
aistudio.google.com → 体验新模型