三周迭代、性能逼近旗舰、价格腰斩:Gemini 3.7 Flash 突袭,新帅时代第一枪
8 月 13 日,Google DeepMind 正式发布 Gemini 3.7 Flash,距离上一代仅有 三周。代码能力飙升、Agent 执行跃升、输入价格降至 0.75 美元/百万 Token——这是 8 月 5 日换帅后,新掌门 Koray Kavukcuoglu 交出的第一份答卷。
8 月 13 日,Google DeepMind 正式发布 Gemini 3.7 Flash,距离上一代仅有 三周。代码能力飙升、Agent 执行跃升、输入价格降至 0.75 美元/百万 Token——这是 8 月 5 日换帅后,新掌门 Koray Kavukcuoglu 交出的第一份答卷。
谷歌把 3.7 Flash 的全部重心压在了两个关键词上:Coding 和 Agent。这不是偶然——过去一年,大模型竞争已经从聊天转向代码生成、工具调用与长链条任务执行。
在衡量生产级代码质量的 FrontierCode 1.1 中,3.7 Flash 得分 43.6%,较 3.6 Flash 的 34.4% 提升 9.2 个百分点。在考察长周期软件工程任务的 DeepSWE v1.1 中,成绩从约 49% 跃升至 65.3%。
注:柱形自 30 分起缩放,非零起点;分差以标注分数为准。3.7 Flash 在 FrontierCode 上超越 Claude Sonnet 5 和 GPT-5.6 Terra。
Agent 能力的变化更加显著。在 Terminal-bench 2.1 中,得分从 78.0% 升至 85.8%;更困难的 Terminal-bench 3.0 则从 5.4% 一口气提高到 14.9%。AutomationBench 企业自动化测试中,从 17.0% 提升至 30.4%。OSWorld 2.0 Computer Use 测试也从 33.8% 跃至 47.9%。
在 DeepSWE v1.1 中,GPT-5.6 Terra 仍以 69.6% 领先;Terminal-bench 3.0 中,GPT-5.6 Terra 为 20.8%,明显高于 3.7 Flash 的 14.9%。谷歌的定位很清晰:不需要在所有基准上成为绝对第一,而是用接近前沿的能力、更低的价格和更高的吞吐量,成为真正能大规模跑 Agent 的模型。
Gemini 3.7 Flash 更猛烈的是价格。今年年底之前,促销期价格为:输入 0.75 美元/百万 Token,输出 3.75 美元/百万 Token——相当于 3.6 Flash 最初价格的一半。
这不是永久价格。从 2027 年 1 月 1 日起,将恢复至输入 1.5 美元、输出 7.5 美元。但即便如此,这一定价策略仍然说明:谷歌正在认真争夺 Agent 的实际工作负载。
输入 1.50 美元 / 百万 Token
输出 7.50 美元 / 百万 Token
输入 0.75 美元 / 百万 Token
输出 3.75 美元 / 百万 Token
注:促销期至 2026 年 12 月 31 日。2027 年 1 月 1 日起恢复至输入 1.5 美元、输出 7.5 美元/百万 Token。
进入 Agent 时代后,成本结构发生了根本变化。一个聊天机器人可能只调用模型一两次,但一个真正工作的 Agent 可能需要规划任务、搜索资料、读十几个文件、调用多个工具、失败后重试——Token 消耗会迅速膨胀。谁能以最低成本让足够聪明的模型运行几十步,谁就可能杀出重围。
8 月 5 日,Google DeepMind 完成近年来最剧烈的一次权力重组。Demis Hassabis 卸任 CEO,转任董事长和 Alphabet 首席科学家;Koray Kavukcuoglu 升任高级副总裁,直接掌管 Gemini 模型研发、Frontier AI 研究、Gemini App 和开发者团队,向 Sundar Pichai 汇报。
八天后,Gemini 3.7 Flash 发布。这条时间线很难被忽略。
谷歌 CEO Pichai 在重组时已经把话说得相当清楚:必须继续加快速度,在 AI 前沿研究上保持专注。3.7 Flash 距离上一代只有三周——这种速度上的追赶,是重组后最直观的变化之一。
Hassabis 时代最重要的标签是 AlphaGo、AlphaFold、科学突破和 AGI。到了 Koray 手里,Google DeepMind 面临的问题更加现实:Gemini 能不能更快迭代?能不能把 Coding 抢回来?能不能真正跑进 Agent?以及,能不能把 TPU、Cloud、Workspace、Android 和 Gemini 用户规模组织成一个统一的商业机器?
Gemini 3.7 Flash 精准对应了新阶段最紧迫的问题:更快发布、更强 Coding、更低成本、更直接地进入产品。但真正的旗舰考试——Gemini 3.5 Pro 的缺席——让这场"提速"更像是一场补课,而非领跑。换帅后的 DeepMind 首先选择了跑起来,方向正确,但距离终点还有一段距离。
Gemini 3.7 Flash 已部署至 Gemini Spark,覆盖超 160 个国家和地区。开发者可通过 Gemini API、Google AI Studio、Android Studio 等平台直接调用。
DeepMind 模型卡 → 查看详情