⚡ 模型 · 技术速递

谷歌三周再更 Flash 模型,编程与 Agent 能力大幅跃升,年内调用打五折

8 月 14 日,谷歌发布 Gemini 3.7 Flash,成为迄今面向编程与 Agent 场景能力最强的 Flash 系列主力模型。距离上一代仅过去三周,新模型在 DeepSWE v1.1 测试中成绩从 49.0% 跃升至 65.3%,直逼 Claude Sonnet 5 与 GPT-5.6 Terra。

综合公开信息整理 2026-08-14 全文约 3 分钟读完
#Gemini 3.7 Flash #谷歌 #AI Agent #模型迭代
65.3% DeepSWE v1.1 成绩,三周前为 49.0%
50% 年内调用价格,较上代首发直降一半
3 两代 Flash 模型发布间隔,迭代显著提速

⚡ 30 秒速览

  • 迭代节奏:距 Gemini 3.6 Flash 发布仅三周,谷歌再推 3.7 版,聚焦编程、网页开发与企业自动化。
  • 能力跃升:DeepSWE v1.1 从 49.0% 升至 65.3%,AutomationBench 从 17.0% 升至 30.4%,均接近头部竞品。
  • 价格策略:2026 年底前输入 0.75 美元、输出 3.75 美元每百万 Token,为 3.6 首发价的一半,明年 1 月恢复原价。
  • 产品落地:新模型同步成为个人 AI Agent Gemini Spark 底座,跨 Gmail、日历、文档执行多步骤任务。
  • 行业背景:Gemini 月活突破 10 亿,但谷歌 AI 团队近期经历人事调整,迭代持续性面临考验。

01编程与 Agent 能力 三周内的跃升幅度

与 Gemini 3.6 Flash 相比,新模型在排查故障、解决问题等编程任务上首次生成结果的准确率更高,生成可直接用于生产环境的程序时表现也更好。在知识密集型领域,推理能力和准确性同步提升。

但抽象描述不如看硬指标。

DeepSWE v1.1软件工程综合能力
+16.3pp
65.3%
AutomationBench企业工作流自动化
+13.4pp
30.4%
GDP.pdf复杂文档处理
+12.0pp
34.0%
FrontierCode 1.1 Main编程能力基准
+9.2pp
43.6%

注:表内分数为 Gemini 3.7 Flash 绝对得分,delta 列为相较 3.6 Flash 的百分点提升。其中 DeepSWE v1.1 略低于 GPT-5.6 Terra 的 69.6%,FrontierCode 与 Claude Sonnet 5 得分近似。

网页开发方面,新模型能用更少的提示生成实用性更强的页面布局。在 WebDev Arena 测试中,Elo 得分达 1588,领先 Claude Sonnet 5、GPT-5.6 Terra 与 Muse Spark 1.2。根据截图或设计系统生成 UI 时,对参考设计的还原能力也有所提升。

02智能指数对标 第三方测评机构 Artificial Analysis

在第三方模型测评机构 Artificial Analysis 的 Intelligence Index 中,Gemini 3.7 Flash(high)取得 56 分,与当前头部模型得分相近:

上一代 3.6 Flash

编程与 Agent 场景表现中游,复杂工作流中需较多人工监督与重复尝试,成本与性能难以兼顾。

新一代 3.7 Flash

投入更多计算完成多步骤规划与工具调用,更有条理的执行方式减少工程工作流中的人工干预,成本降一半。

在 Intelligence Index 榜单上,与 Gemini 3.7 Flash 得分相近的包括 GPT-5.6 Terra(max)、GPT-5.5(xhigh)、Grok 4.5(high)以及 Claude Sonnet 5(max)。这意味着谷歌在轻量级 Flash 系列上,已逼近甚至追平竞争对手的旗舰级模型表现。

注:Intelligence Index 为 Artificial Analysis 综合评测指数,涵盖编程、推理、数学等多维度。各模型括号内标注为采样配置档位,分数相近不代表各维度表现完全一致。

03它到底能做什么 谷歌展示的三个案例

🎮 3D 游戏生成多模态

  • 配合 Nano Banana,根据一段文本提示,生成画面精致、可玩性高的 3D 游戏。
  • 从概念创意到可交互产物,全链路由模型自主完成。
能力要点:多模态协同,文本到 3D 资产的端到端交付。

🌐 交互式落地网页Agent 协同

  • 模型调用子 Agent,配合 Gemini Omni 生成带有交互式组件的落地网页。
  • 多步骤任务中,能更好地适应障碍、在必要时确认用户意图、更严格地遵循指令。
能力要点:子 Agent 调度,减少工程工作流中的人工监督与重复尝试。

📊 企业数据分析降本增效

  • Databricks AI 研究经理反馈:过去从复杂企业数据中获得高质量答案成本一直很高。
  • 接入 3.7 Flash 后,企业能以更低成本预测营收、识别关键客户并制定投资决策。
客户反馈:性能与准确性均明显优于 3.6 Flash,同时保持较低成本。

04半价策略与生态卡位 从开发者到个人 Agent

价格是这次更新中最具攻击性的一环。2026 年年底前,Gemini 3.7 Flash 的调用价格为 3.6 Flash 首发价的一半

2026 年底前 · 限时五折

$0.75 / 百万输入 Token
$3.75 / 百万输出 Token

2027 年 1 月起 · 恢复原价

$1.50 / 百万输入 Token
$7.50 / 百万输出 Token

注:输入/输出价格按每百万 Token 计,约合人民币 5.06 元 / 25.28 元(限时),10.11 元 / 50.55 元(恢复后)。五折策略带有明确的时间窗口。

除向开发者和企业开放外,3.7 Flash 还成为谷歌个人 AI Agent Gemini Spark 的新底座。Spark 是谷歌在 I/O 大会上推出的个人 Agent,能全天候运行,在用户指示和监督下代为执行任务。

整合多文件信息起草邮件更新项目状态转化为具体操作

换用新模型后,Spark 增强了对 Google Workspace 应用的工具调用能力,重点改善需要多项技能配合的复杂工作流。目前面向 160 多个国家和地区的 Google AI Pro 及 Ultra 订阅用户提供。

05提速背后的隐忧

近期,Gemini 应用月活跃用户突破 10 亿。短短三周连发两代 Flash 模型、限时降低调用价格、接入个人 Agent Spark——谷歌正在加快 Gemini 模型的迭代节奏,并拓展其在 Agent 和 Workspace 工作流中的应用。

但是,速度并不等于稳定。

产品提速的同时,谷歌 AI 团队上周经历了重要人事调整:德米斯·哈萨比斯卸任谷歌 DeepMind CEO转任董事长,杰夫·迪恩等 4 名核心 AI 人员离职创业。组织架构的变动,为模型迭代速度的可持续性打上问号。

编辑核心判断

三周连更与年内五折,本质是谷歌以时间换空间的激进卡位战——用价格杠杆抢占开发者心智。但核心团队流失叠加限时折扣的不可持续性,意味着这轮攻势的真正考验在 2027 年原价恢复之后:届时如果性能未能形成代差,价格优势消失,用户留存将面临硬仗。

现在就能用

开发者可通过 Google AI Studio、Gemini API 及 Android Studio 接入;个人用户可在支持地区通过 Google AI Pro 或 Ultra 订阅体验 Gemini Spark。

Google AI Studio → 获取接入