谷歌连上三款"省油"模型,旗舰跳票致市值一夜蒸发 2000 亿美元
7 月,在 Grok 4.5、GPT-5.6、Kimi K3 集中发布的"被超车之夏",谷歌没有拿出对标旗舰,而是连发三款 Gemini Flash 系列模型,主攻降低 token 消耗与企业运行成本。与此同时,原定 6 月发布的 Gemini 3.5 Pro 因编程能力未达内部预期持续跳票,Alphabet 单日市值蒸发约 2000 亿美元。
7 月,在 Grok 4.5、GPT-5.6、Kimi K3 集中发布的"被超车之夏",谷歌没有拿出对标旗舰,而是连发三款 Gemini Flash 系列模型,主攻降低 token 消耗与企业运行成本。与此同时,原定 6 月发布的 Gemini 3.5 Pro 因编程能力未达内部预期持续跳票,Alphabet 单日市值蒸发约 2000 亿美元。
知识截止更新至 2026 年 3 月,编程、多模态推理均有提升;部分场景输出 token 最多减少 65%。企业客户 Heavia、Harvey 反馈视觉处理与图表分析显著增强。
面向高吞吐智能体搜索与大规模文档处理,350 token/秒。终端工作台 2.1 评分从 31% 升至 54%,SWE-Bench Pro 与 OSWorld-Verified 均超旧款 3 Flash。
基于 3.5 Flash 优化,集成进 DeepMind 代码安全智能体 CodeMender,多子智能体并行扫描并汇总报告。仅向政府机构及可信合作伙伴试点开放。
注:三款模型已向 Gemini 企业用户及 Gemini 应用用户开放;3.5 Flash-Lite 将接入 Google 搜索。
在 CyberGym 基准测试中,Flash Cyber 以 83.2% 逼近 GPT-5.5-Cyber 的 85.6%,分差仅 2.4 个百分点,但模型规模与 token 成本远低于后者。
注:柱形自 80 分起缩放,非零起点;分差以标注分数为准。谷歌优势主要在 token 成本而非绝对分数。
Anthropic 在 AI 安全领域的领先地位正受到挑战。但谷歌承认这类模型"攻防双强",已实施严格访问限制——与 Anthropic 限制 Claude Mythos、OpenAI"可信访问"计划逻辑一致。
三款 Flash 模型之外,市场真正在意的是 Gemini 3.5 Pro 的持续缺席。这款原定 6 月推出的旗舰模型至今仍在测试阶段,华尔街正以它作为衡量 Google DeepMind 能否与 Anthropic、OpenAI 保持竞争力的关键信号。
本篇信息主体来自企业通稿与单方披露:模型性能数据由谷歌自行提供,"省 10 亿美元"为 CEO 公开表态而非第三方审计结论;Flash Cyber 的 83.2% CyberGym 成绩虽含竞品对比,但该基准本身由业界维护、非谷歌自建。
"市值蒸发 2000 亿"与"10 名员工透露担忧"等负面信息引自外媒调查报道,非谷歌官方口径,读者宜结合多方信源判断。同期竞品模型(Grok 4.5、GPT-5.6、Kimi K3)的基准分数与能力定位,均未见独立第三方复测报告。
3.6 Flash 与 3.5 Flash-Lite 已向 Gemini 企业用户及 Gemini 应用用户开放;Flash Cyber 仅限政府与可信伙伴试点。
ai.google.dev → Gemini API 文档