🌐 大模型 · 谷歌三连发

谷歌连发三款 Gemini 新模:Token 最高暴降 65%、速度榜包揽前二,但用户苦等的 3.5 Pro 又鸽了

7 月 22 日凌晨,谷歌发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber 三款模型,主线只有一条:为 Agent 工作流省 Token、提速度、稳运行。同时官宣 Gemini 4 已启动公司迄今最大规模预训练——而 I/O 大会上承诺「6 月见」的 Gemini 3.5 Pro,至今仍在合作伙伴测试。

来源:公开报道 2026-07-22 全文约 4 分钟读完
#谷歌 Gemini #AI Agent #大模型评测 #Gemini 4
−65% DeepSWE 单任务输出 Token 降幅:27.6 万 → 9.7 万
350 tok/s 3.5 Flash-Lite 输出速度,速度榜第 1
50 Intelligence Index 仅列第 7,落后 6 款竞品

⚡ 30 秒速览

  • 发了什么:3.6 Flash 主攻编程 / 知识工作 / 多模态;3.5 Flash-Lite 每秒 350 Token,系列最快最便宜;3.5 Flash Cyber 专盯安全漏洞,不对普通开发者开放。
  • 省了多少:3.6 Flash 在 DeepSWE 单任务输出 Token 从 27.6 万降到 9.7 万(−65%),Artificial Analysis 智力指数 Token 消耗降 17%;输出价 $7.5 / 百万 Token,低于上代。
  • 强与弱:官方自测 DeepSWE 得分 49%(上代 37%);但第三方 Intelligence Index 仅 50 分排第 7,单任务成本 $0.50 也贵于多家竞品——速度是谷歌仅剩的榜一。
  • 两张期货:3.5 Pro 预告 6 月发布至今跳票,仍「与合作伙伴测试」;Gemini 4 刚启动「公司史上最大」预训练任务。
  • 去哪用:两款开放模型已上线 Google AI Studio 与 Gemini API,Gemini 应用同步可用,Lite 版将逐步接入谷歌搜索。

01三款新模总览 两款现货 + 一把「不随便发」的安全刀

Gemini 3.6 Flash

Agent 工作流主力:编程、知识工作、多模态任务;更少推理步骤与工具调用,输出冗余更低。

输入 $1.5 · 输出 $7.5 / 百万 Token
输出价低于 3.5 Flash,输入价不变
✅ 已开放

Gemini 3.5 Flash-Lite

低延迟、高吞吐:面向 Agent 搜索、文档处理等场景;思考等级可按负载调节。

输入 $0.3 · 输出 $2.5 / 百万 Token
3.5 系列速度最快、价格最低
✅ 已开放

Gemini 3.5 Flash Cyber

基于 3.5 Flash 微调:专职发现、验证并修复网络安全漏洞,搭配代码安全 Agent CodeMender 使用。

未公开售卖
Token 定价低于大模型,适合规模化安全检查
🔒 仅政府与可信伙伴试点
已开放渠道:Google AI Studio、Android Studio、Gemini API(3.6 Flash 另接入 Google Antigravity 与 Gemini Enterprise 应用);企业客户走 Gemini Enterprise Agent Platform;普通用户可在 Gemini 应用使用,3.5 Flash-Lite 后续接入谷歌搜索。

02Gemini 3.6 Flash 把 Agent 任务的 Token 账单打下来

新模型基于开发者和企业客户对 3.5 Flash 的反馈改进:处理多步骤工作流时,推理步骤和工具调用次数更少,同时压缩了输出冗余——省 Token,就是省钱。

−65%DeepSWE 单任务输出 Token:27.6 万 → 9.7 万
−17%AA 智力指数平均输出 Token:2.8 万 → 2.3 万
$7.5每百万输出 Token 定价(输入 $1.5 不变)
−34%代码迁移任务整体耗时(官方演示)
基准测试3.1 Pro3.5 Flash3.6 Flash较 3.5 Flash
DeepSWE v1.1 · 软件工程 Agent12%37%49%+12pp
MLE-Bench · 机器学习工程42.6%49.7%63.9%+14.2pp
GDPval-AA v2 · 知识工作96513491421+72
OSWorld-Verified · 计算机操作76.2%78.4%83.0%+4.6pp

数据来源:官方发布。另:Computer Use(计算机操作能力)现已成为 Gemini API 与 Gemini Enterprise 的内置客户端工具。

💻 官方演示:一次代码迁移任务的正面对比总耗时 −34%

  • 规划阶段 24 秒 → 20 秒;执行迁移 2 分 08 秒 → 1 分 20 秒,整体耗时减少约 34%。
  • 3.6 Flash 生成了更详细、结构更清晰的代码审计与验证文档,覆盖数据模型、API 接口、业务逻辑、UI 组件等多项验证任务。
  • 同场展示:金融数据与电话会议记录分析、多 Agent 协作代码迁移、3D 工作流照片纹理提取工具、结合 tldraw 离线编辑器创建交互式主题设计工具。

「在质量、速度和成本之间取得了较好平衡,可以加快原型探索和迭代。」

Figma · 设计软件公司

文档起草和审查任务平均快 12%

Harvey · 法律 AI 公司

低推理等级下的编程性能较上一代 Flash 提高10%–20%

JetBrains · 开发工具公司

注:以上客户评价均引自谷歌官方发布,为谷歌挑选的正面案例。

🛡️ 安全加固:3.6 Flash 加强了针对化学、生物、放射性与核风险(CBRN)以及网络攻击滥用的前沿安全防护,提升抵抗越狱攻击的能力,同时尽量减少对正常用途的错误拒绝。

03同一周的另一份榜单 速度前二,智力第七(Artificial Analysis 第三方口径)

行业媒体直言:作为昔日大模型「御三家」之一,谷歌此次最突出的优势仍然是速度。把官方自测放一边,第三方机构 Artificial Analysis 的榜单讲了另一个故事:

⚡ 输出速度榜 · 包揽前二

3.5 Flash-Lite 以 350 tok/s 位列第 1,3.6 Flash 紧随其后第 2——Flash 家族把「快」守住了。

🧠 Intelligence Index · 仅列第 7

3.6 Flash 智力得分 50,身前压着 6 款模型;单任务成本 $0.50(≈¥3.39),贵于 DeepSeek、MiniMax、GLM、Muse Spark、Grok。

  • 1Claude Fable 5Anthropic得分未披露
  • 2GPT-5.6 SolOpenAI得分未披露
  • 3Kimi K3月之暗面得分未披露
  • 4Grok 4.5xAI得分未披露
  • 5GLM-5.2智谱得分未披露
  • 6Muse Spark 1.1Meta得分未披露
  • 7Gemini 3.6 Flash谷歌50 分

注:原始报道仅给出 3.6 Flash 得分(50)与完整排序,未披露前六名具体分数;以上为 Artificial Analysis 第三方测评,与第 02 节谷歌自测口径不同,请分开采信。

🇨🇳 背景补一刀:上周月之暗面发布 Kimi K3,Intelligence 得分仅落后 Claude Fable 5 与 GPT-5.6 Sol,在前端编程测试中甚至排到榜首。行业媒体评价:国产模型已从跟随者变成全球前沿竞争的重要力量——谷歌面对的对手,远不止 OpenAI 和 Anthropic。

04Gemini 3.5 Flash-Lite 最快最便宜,还能越级打

定位 Agent 搜索、文档处理等低延迟、高吞吐场景。开发者可按工作负载调节思考等级:大规模低成本任务选 minimal / low,多步骤子 Agent 任务再开高档;同样内置 Computer Use 工具。

350 tok/s输出速度 · 速度榜第 1
$0.3每百万输入 Token(≈¥2),系列最低
$2.5每百万输出 Token(≈¥17)
+23ppTerminal-Bench 2.1 较上代 Lite 提升
基准测试3.1 Flash-Lite3.5 Flash-Lite提升
Terminal-Bench 2.1 · Agent 终端编程31%54%+23pp
GDM-MRCR v2 · 长上下文60.1%72.2%+12.1pp
GDPval-AA v2 · 知识工作6421140+498

数据来源:官方发布

Gemini 3 Flash(定位更高)

SWE-Bench Pro:49.6%
OSWorld-Verified:65.1%

Gemini 3.5 Flash-Lite(小弟越级)

SWE-Bench Pro:54.2%
OSWorld-Verified:74.0% —— 两项反超

💬 早期客户反馈:美国金融科技公司 Ramp 认为,3.5 Flash-Lite 在票据提取任务中「较好地平衡了准确率、延迟和成本」。

05Gemini 3.5 Flash Cyber 一把不随便发的「安全手术刀」

基于 3.5 Flash 微调,专职发现、验证、修复网络安全漏洞;Token 价格低于大模型,适合规模化检查代码安全。它与谷歌代码安全 Agent CodeMender 配合使用:

并行运行多个 Cyber Agent合并各路分析结果输出统一安全报告

CyberGym 测试横向对比(CodeMender 最多调用 5 次模型时,Cyber 得分 83.2%):

GPT-5.5-CyberOpenAI Agent 内
85.6
Mythos 5Anthropic Agent 内
83.8
GPT-5.6 SolOpenAI Agent 内
83.6
Gemini 3.5 Flash CyberCodeMender 内 · ≤5 次调用
83.2
Mythos PreviewAnthropic Agent 内
83.1

注:柱形自 82 分起缩放,非零起点,分差以标注分数为准;各模型均运行于不同厂商的 Agent 框架内,为「Agent 内模型」口径。结论:Cyber 与 Mythos 5、GPT-5.6 Sol 能力相当,已达前沿模型竞争水平。

⚠️ 开放策略:漏洞发现与修复技术具有明显的双重用途,谷歌暂不向普通开发者开放该模型;近期将通过 CodeMender 启动小范围试点,仅供政府机构和可信合作伙伴使用

06现货之外,是两张期货 3.5 Pro 跳票 · Gemini 4 点火

  • 2026-05 · Google I/O

    CEO 桑达尔·皮查伊(Sundar Pichai)预告:Gemini 3.5 Pro 将于 6 月推出

  • 2026-06 · 跳票

    承诺月份过去,3.5 Pro 没有现身。

  • 2026-07-22 · 现状

    谷歌口径:3.5 Pro「正在与合作伙伴测试,将在准备就绪后尽快发布」。等了两个月的用户,等来的是三款 Flash。

  • 同日 · 新「饼」

    官宣 Gemini 4:已启动公司迄今规模最大的预训练任务——从预训练到正式发布,通常还要以季度计。

编辑核心判断

当竞争指标从单次跑分转向「单任务总成本」,谷歌用 Flash 系列把速度与价格打到极致、用生态守住落地;但智力榜前六已无谷歌身影——想重回牌桌中央,只能押注一再跳票的 3.5 Pro 和刚刚点火训练的 Gemini 4。

✍️ 编辑视角 · 这篇报道该怎么读

  • 信源构成:本篇为行业媒体的编译整合稿,素材 = 谷歌官方发布稿 + 谷歌官方演示(耗时对比、客户评价)+ 第三方机构 Artificial Analysis 榜单。前两类本质是发布会通稿素材,自带立场;本页已用「官方自测 / 第三方」在各节分别标注,请分开采信。
  • 「结论分裂」恰是这篇报道的真实增量:官方口径里 3.6 Flash 进步巨大(Token −65%、DeepSWE 49%);第三方榜上它智力第 7、单任务 $0.50 偏贵、只剩速度第一。两组数字并不矛盾,合起来才是全貌——这是一次「降本提速」的迭代,而非「智力登顶」。
  • 客户好评按广告读:Figma、Harvey、JetBrains、Ramp 的评价均由谷歌挑选并发布,属发布会标准配置,不等于独立评测。
  • 「Gemini 4 要来了」请打折:目前仅是预训练任务启动公告,距发布通常以季度计,原标题的紧迫感更多是传播修辞。但其「国产模型已从跟随者变为前沿力量」的判断,有 Kimi K3、GLM-5.2 在第三方榜单上的位次支撑,值得认真对待。

现在就能用

Gemini 3.6 Flash 与 3.5 Flash-Lite 已上线 Google AI Studio、Android Studio 与 Gemini API,普通用户可在 Gemini 应用中体验,Lite 版后续接入谷歌搜索;3.5 Flash Cyber 仅政府与可信伙伴试点,无公开入口。

aistudio.google.com → 体验新模型