🚀 模型发布 · 战略信号

三周迭代、性能逼近旗舰、价格腰斩:Gemini 3.7 Flash 突袭,新帅时代第一枪

8 月 13 日,Google DeepMind 正式发布 Gemini 3.7 Flash,距离上一代仅有 三周。代码能力飙升、Agent 执行跃升、输入价格降至 0.75 美元/百万 Token——这是 8 月 5 日换帅后,新掌门 Koray Kavukcuoglu 交出的第一份答卷。

综合公开信息整理 2026-08-14 全文约 4 分钟读完
#Gemini 3.7 Flash #Google DeepMind #AI Agent #模型发布
3 周 3.6 Flash 到 3.7 Flash 迭代间隔
43.6% FrontierCode 1.1 代码基准得分
-50% 对比 3.6 Flash 首发价降幅

⚡ 30 秒速览

  • 性能跃迁:FrontierCode 1.1 从 34.4% 升至 43.6%,DeepSWE v1.1 从约 49% 升至 65.3%,代码与 Agent 能力全面进化。
  • 逼近旗舰:在多项基准上超越 Claude Sonnet 5 与 GPT-5.6 Terra,但 DeepSWE 与 Terminal-bench 3.0 仍有差距。
  • 价格腰斩:促销期输入 0.75 美元/百万 Token,输出 3.75 美元——仅为 3.6 Flash 首发价的一半。
  • 换帅首作:8 月 5 日 DeepMind 权力重组完成,8 月 13 日发布,Koray 时代的第一声枪响。
  • 即日可用:已部署至 Gemini Spark,开发者可通过 Gemini API、AI Studio 等平台直接调用。

01性能跃迁 代码与 Agent 双线爆发

谷歌把 3.7 Flash 的全部重心压在了两个关键词上:CodingAgent。这不是偶然——过去一年,大模型竞争已经从聊天转向代码生成、工具调用与长链条任务执行。

在衡量生产级代码质量的 FrontierCode 1.1 中,3.7 Flash 得分 43.6%,较 3.6 Flash 的 34.4% 提升 9.2 个百分点。在考察长周期软件工程任务的 DeepSWE v1.1 中,成绩从约 49% 跃升至 65.3%。

🥇 Gemini 3.7 FlashFrontierCode 1.1
43.6
Claude Sonnet 5Anthropic
42.7
GPT-5.6 TerraOpenAI
41.3
Gemini 3.6 FlashGoogle
34.4

注:柱形自 30 分起缩放,非零起点;分差以标注分数为准。3.7 Flash 在 FrontierCode 上超越 Claude Sonnet 5 和 GPT-5.6 Terra。

Agent 能力的变化更加显著。在 Terminal-bench 2.1 中,得分从 78.0% 升至 85.8%;更困难的 Terminal-bench 3.0 则从 5.4% 一口气提高到 14.9%。AutomationBench 企业自动化测试中,从 17.0% 提升至 30.4%。OSWorld 2.0 Computer Use 测试也从 33.8% 跃至 47.9%。

一个诚实的注脚:性能逼近旗舰,但并非全面超越。

DeepSWE v1.1 中,GPT-5.6 Terra 仍以 69.6% 领先;Terminal-bench 3.0 中,GPT-5.6 Terra 为 20.8%,明显高于 3.7 Flash 的 14.9%。谷歌的定位很清晰:不需要在所有基准上成为绝对第一,而是用接近前沿的能力、更低的价格和更高的吞吐量,成为真正能大规模跑 Agent 的模型。

02能力全览 代码 · Agent · Web 开发

💻 代码生成与工程 FrontierCode 43.6%

  • 生产级代码质量大幅提升,一次生成即可构建功能可用的 Web 应用与交互式落地页。
  • 对截图、图片及完整 Design System 的还原能力增强,更少的 Prompt 达到更完整的效果
  • 可协调子 Agent,结合 Gemini Omni 创建流畅的交互式组件。
WebDev Arena Elo 从 1538 升至 1588,超越 Claude Sonnet 5 与 GPT-5.6 Terra。

🤖 Agent 执行与工具调用 Terminal-bench 2.1: 85.8%

  • 模型会在多步骤规划和工具调用中"投入更多思考",减少人工监督与重复重试。
  • 遇到执行障碍时更主动调整策略,必要时澄清用户意图,更加严格地遵循指令。
  • 企业级自动化能力翻倍:AutomationBench 从 17.0% 升至 30.4%
Computer Use 能力跃升:OSWorld 2.0 从 33.8% 升至 47.9%

🌐 Web 开发与交互体验 WebDev Arena Elo 1588

  • 从静态 PDF 到交互式数据故事——复杂年报可转化为含实时图表与汇总分析的网页体验。
  • 从文本提示到完全可玩的 3D 游戏,实时动态生成角色、物品与纹理。
  • 一次生成即可打造含流畅视差组件的交互式落地页,协调子 Agent 完成复杂管线。
谷歌官方评价:"迄今最智能的主力模型(workhorse model)"

03价格腰斩 Agent 成本战的明确信号

Gemini 3.7 Flash 更猛烈的是价格。今年年底之前,促销期价格为:输入 0.75 美元/百万 Token,输出 3.75 美元/百万 Token——相当于 3.6 Flash 最初价格的一半。

这不是永久价格。从 2027 年 1 月 1 日起,将恢复至输入 1.5 美元、输出 7.5 美元。但即便如此,这一定价策略仍然说明:谷歌正在认真争夺 Agent 的实际工作负载。

Gemini 3.6 Flash 首发价

输入 1.50 美元 / 百万 Token
输出 7.50 美元 / 百万 Token

Gemini 3.7 Flash 促销价

输入 0.75 美元 / 百万 Token
输出 3.75 美元 / 百万 Token

注:促销期至 2026 年 12 月 31 日。2027 年 1 月 1 日起恢复至输入 1.5 美元、输出 7.5 美元/百万 Token。

进入 Agent 时代后,成本结构发生了根本变化。一个聊天机器人可能只调用模型一两次,但一个真正工作的 Agent 可能需要规划任务、搜索资料、读十几个文件、调用多个工具、失败后重试——Token 消耗会迅速膨胀。谁能以最低成本让足够聪明的模型运行几十步,谁就可能杀出重围。

但价格只是故事的一半。更值得关注的是,这次发布的时间点。

04换帅与提速 Koray 时代的第一声枪响

8 月 5 日,Google DeepMind 完成近年来最剧烈的一次权力重组。Demis Hassabis 卸任 CEO,转任董事长和 Alphabet 首席科学家;Koray Kavukcuoglu 升任高级副总裁,直接掌管 Gemini 模型研发、Frontier AI 研究、Gemini App 和开发者团队,向 Sundar Pichai 汇报。

八天后,Gemini 3.7 Flash 发布。这条时间线很难被忽略。

7 月 21 日
Gemini 3.6 Flash 发布,谷歌同时宣布 3.5 Pro 正在与合作伙伴测试。
8 月 5 日
DeepMind 换帅:Hassabis 转任董事长,Koray 接掌日常管理权,权力从伦敦进一步转向 Mountain View。
8 月 13 日
Gemini 3.7 Flash 发布,仅 3 周迭代。首发即部署至 Gemini Spark,覆盖超 160 个国家和地区。
待定
Gemini 3.5 Pro 仍未发布。谷歌称 Gemini 4 正在进行"迄今最雄心勃勃"的预训练。

谷歌 CEO Pichai 在重组时已经把话说得相当清楚:必须继续加快速度,在 AI 前沿研究上保持专注。3.7 Flash 距离上一代只有三周——这种速度上的追赶,是重组后最直观的变化之一。

Hassabis 时代最重要的标签是 AlphaGo、AlphaFold、科学突破和 AGI。到了 Koray 手里,Google DeepMind 面临的问题更加现实:Gemini 能不能更快迭代?能不能把 Coding 抢回来?能不能真正跑进 Agent?以及,能不能把 TPU、Cloud、Workspace、Android 和 Gemini 用户规模组织成一个统一的商业机器?

Gemini 3.7 Flash 还回答不了所有问题。特别是迟迟没有亮相的 3.5 Pro,仍是判断谷歌是否重回前沿的一场更关键考试。
编辑核心判断

Gemini 3.7 Flash 精准对应了新阶段最紧迫的问题:更快发布、更强 Coding、更低成本、更直接地进入产品。但真正的旗舰考试——Gemini 3.5 Pro 的缺席——让这场"提速"更像是一场补课,而非领跑。换帅后的 DeepMind 首先选择了跑起来,方向正确,但距离终点还有一段距离。

现在就能用

Gemini 3.7 Flash 已部署至 Gemini Spark,覆盖超 160 个国家和地区。开发者可通过 Gemini API、Google AI Studio、Android Studio 等平台直接调用。

DeepMind 模型卡 → 查看详情