🧊 AI 芯片 · 谷歌双轨战略
谷歌被曝"冷冻芯片"Frozen v2:把 Gemini 刻进硅片,每瓦 Token 能效目标 6–10 倍
据海外科技媒体援引知情人士报道,谷歌正在设计一款内部代号 Frozen v2 的服务器芯片,计划把 Gemini 模型的部分信息直接固化进硬件,最早 2028 年部署;以"单位能耗生成的 Token 数"衡量,效率目标为谷歌最新自研 AI 芯片的 6 至 10 倍。这不只是又一款芯片曝光,而是谷歌芯片战略的一次转向:在 TPU 之外开辟"模型专用硬件"第二路线,把 AI 竞争拖入效率战。
来源:公开报道•
2026-07-21•
全文约 4 分钟读完
#Frozen v2
#谷歌TPU
#Gemini
#每瓦Token
#AI基础设施
🧊 6–10×
每瓦 Token 效率目标 · 内部设计目标,未经公开测试
2028
最早部署年份,与下一代 TPU"Icefish"同年
+3.3%
7 月 20 日消息曝光当日 Alphabet 早盘涨幅
⚡ 30 秒速览
- 发生了什么:谷歌被曝设计 Frozen v2,把 Gemini 部分模型结构、参数或计算模式固化进硅片,牺牲通用性换推理效率;谷歌回应称"并非每个项目最终都会投入生产"。
- 战略变化:Frozen 不是下一代 TPU,而是独立新体系——谷歌芯片进入"双轨制":TPU 越做越开放(原生 PyTorch、对外卖硬件),Frozen 只为 Gemini 服务。
- 指标换代:衡量标尺从峰值算力转向"每瓦 Token"——Agent 场景一次请求背后是规划、搜索、工具调用、多轮反思的海量 Token 消耗。
- 钱的背景:Alphabet 2026 年资本开支指引 1800–1900 亿美元(约为 2025 年两倍),谷歌云因算力紧张已拒绝部分外部订单,"降本叙事"正当其时。
- 最大风险:模型以月迭代、芯片以年量产——若 2028 年前 Gemini 架构大改,固化进硅片的设计可能被迫返工。
01Frozen v2 是什么?已知与未知同样重要
核心逻辑很直接:它计划把 Gemini 模型的部分结构、参数信息或特定计算模式更深入地映射进硬件,以牺牲一定通用性为代价,换取更高的推理效率。芯片越贴近固定工作负载,理论上越能减少不必要的数据搬运、控制逻辑与计算开销——但适用范围也随之收窄。它面对的不再是"什么样的 AI 计算",而是"Gemini 具体怎样计算"。
已曝光(知情人士口径)
· 代号 Frozen v2,最早 2028 年部署
· 目标:每瓦 Token 效率达谷歌最新自研 AI 芯片的 6–10 倍
· 独立于 TPU 的全新芯片体系
· 目前仍处于设计阶段
仍是未知数
· 究竟多少模型信息会被固化进芯片(工程团队尚未最终确定)
· 是否会量产(谷歌未予确认)
· 6–10 倍能否兑现(无公开测试背书)
诚实标注:谷歌仅向 海外科技媒体 表示公司"一直在研究和试验新技术",并强调"并非每个项目最终都会投入生产"。因此 6 至 10 倍目前更接近内部设计目标,而不是经过公开测试的产品指标——请按"设计目标"而非"产品承诺"理解。
02不是下一代 TPU 谷歌芯片进入"双轨制"
海外通讯社援引海外科技媒体称,Frozen 项目的目标是建立一套独立于 TPU 的新芯片体系,而非替代 TPU。从 GPU 到 TPU 再到 Frozen,AI 芯片的专用化程度被又向前推了一层:
GPU · 通用并行计算→TPU · 张量计算专用→Frozen · Gemini 模型家族专用
能否成立,取决于谷歌能否在芯片设计阶段找到 Gemini 中足够稳定、规模足够大、值得被硬件化的部分。
TPU 轨道 · 越做越开放
面向矩阵计算、训练、推理与强化学习的通用 AI 加速器:可运行不同规模、不同架构的模型,经 Google Cloud 提供给外部客户;软件上支持 JAX / PyTorch / vLLM / XLA,第八代强调原生 PyTorch 体验与跨代代码兼容。
Frozen 轨道 · 越做越封闭
未必服务外部模型,也不需要类似 CUDA 的软件生态:只要能稳定运行 Gemini,并在搜索、Gemini 应用、Workspace、广告与云服务中被大规模调用,就足以摊薄芯片研发成本。
两条线同时在推进。TPU 侧,2026 年 4 月发布的第八代 TPU 首次拆分为 TPU 8t(大规模预训练)与 TPU 8i(采样、推理与模型服务)两种架构:
2.7×8t 大规模训练每美元性能(对 Ironwood 最高)
+80%8i 低延迟 MoE 推理每美元性能(最高提升)
2×8t / 8i 每瓦性能(对 Ironwood 最高)
288GB+384MB8i 高带宽内存 + 片上 SRAM
TPU 8i 的 288GB HBM 与 384MB 片上 SRAM,专为压低延迟敏感型推理中的数据访问成本而配置。
商业化也在提速:Alphabet 在 2026 年第一季度财报电话会上宣布,将开始向部分客户交付 TPU 硬件、部署于其自有数据中心(不再只经 Google Cloud 出租算力),相关收入 2026 年下半年开始确认,大部分预计 2027 年体现。
🧊 下一代 TPU 同步推进:代号"Icefish",或同样于 2028 年量产——主要计算部分计划由台积电制造;正讨论由三星以 2 纳米工艺生产连接内存的组件;联发科共同参与设计。
一句话看懂双轨制:TPU 负责扩大基础设施的通用性与商业半径;Frozen 负责把内部核心模型的单位运行成本压到更低。
03真正的信号 衡量标尺换成"每瓦 Token"
Frozen v2 最值得注意的,不是"6 至 10 倍"这个尚未验证的数字,而是谷歌选择的衡量指标——单位能耗产出的 Token 数量:
旧标尺 · 训练时代
浮点算力、参数规模、芯片互联带宽、训练集群规模——但单颗芯片的峰值算力,并不直接决定商业效率。
新标尺 · 大规模推理时代
同样的电力与服务器预算下:能处理多少用户请求、生成多少有效 Token、维持怎样的响应速度。
Agent 场景把这个问题进一步放大——一次用户请求,表面只是完成一个任务,背后的 Token 消耗却远超聊天机器人:
规划→搜索→工具调用→代码执行→结果验证→多轮反思
因此,芯片在数据搬运、内存访问与低批量推理上的效率,开始直接影响产品毛利率。而谷歌的独特筹码在于规模:Gemini 不仅是独立应用,还在进入搜索、广告、Workspace 与 Google Cloud——即便每次调用只节省少量能耗与计算时间,累积到数十亿次请求之后,也会转化为显著的基础设施成本差。
041800 亿美元之后 谷歌必须回答回报问题
Frozen v2 获得资本市场关注,与 Alphabet 迅速膨胀的资本开支直接相关:
2025 实际约 60% 投服务器 / 40% 投数据中心与网络
$914 亿
2026 指引Q1 上调 · 2027 将"显著更高"
$1800–1900 亿
注:柱形自零起点等比缩放;2026 年为指引区间,柱长按上限 1900 亿美元绘制,中值约为 2025 年的两倍。Alphabet 管理层表示,内部与外部对 AI 算力的需求均达"前所未有的水平",Google Cloud 仍处算力供应紧张环境——报道进一步提到,算力短缺已引发内部资源分配压力,并导致 Google Cloud 拒绝部分外部客户订单。
市场的反应立竿见影:海外通讯社报道,新芯片消息发布后,Alphabet 股价 7 月 20 日早盘上涨约 3.3%,截至发稿仍涨 2%。投资者关注的不只是"又多了一款芯片",而是谷歌是否找到了降低 AI 基础设施资本强度与运行成本的方法。
⚠️ 效率 ≠ 回报自动改善:一款芯片能否真正降本,还取决于制造良率、先进封装、内存供应、服务器部署速度、软件适配、实际利用率与芯片生命周期。即便 Frozen v2 达标,若 Gemini 在投产前发生重大架构变化,部分硬件设计也可能被迫返工。
这正是模型专用芯片最大的赌注:模型迭代以月计,先进芯片从架构设计到量产以年计。Frozen v2 押注 2028——谷歌必须判断,Gemini 的哪些能力在未来两年仍然稳定、值得被写进硅片,而不是把快速变化的短暂特征过早固化。
05社区之辩 谷歌的底气是"小模型"还是"便宜的大模型"?
第八代 TPU 发布后,海外技术社区 的讨论很快从芯片转向一个更实际的问题:谷歌"模型—芯片—数据中心"的全栈优势,究竟转化成了多少 Gemini 的产品能力?两种代表性推测针锋相对——
🧑💻 himata4113:模型可能只有对手的 1/5–1/10推测 · 效率派
- Gemini 3 Pro 与 Flash 的规模,可能只有 Claude Opus、GPT-5 级模型的五分之一到十分之一——生成的 Token 明显更少,却在不依赖工具与搜索的原始问题求解中与二者相近。
- 但效率优势没有完全转化为智能体能力:工具调用经常出错、智能体任务表现不理想——"高效的问题解决模型,还不是足够可靠的任务执行者。"
- 他仍相信谷歌迟早会拿出"领先当时最先进水平一代"的产品,前提是先学会从原型过渡到正式产品,而非"不断发布预览版"——目前不少 AI 产品更像向投资者展示进展的匆忙原型。
🧑💻 deaux:"五倍以上的差距,似乎太大了"反驳 · 规模派
- 相反推测:谷歌的硬件优势也许不是用来跑更小的模型,而是让它以更低成本、更高速度运行更大的模型;Gemini 3 Pro 的规模可能小于 GPT-5.4 与 Claude Opus 4.6,但不会差出一个量级。
- 实际体验上,Gemini 3 Pro 是最"智能"的模型之一,尤其人文领域:知识丰富、擅长生成自然近人的文本,小众语言优势更明显——他给出的多语言前四名全部来自谷歌:Gemini 3 Pro、Gemini 3 Flash、Gemini 2.5 Pro、Gemini 2.5 Flash。
- 短板同样明显:数学相对较弱,智能体能力落后更多;Gemini 聊天应用本身"落后了不止一个时代",产品形态与三年前发布的 ChatGPT 差别不大。
🤝 争论之外,共识反而清晰:onlyrealcuzzo 认为谷歌真正的筹码不是再造一个聊天机器人,而是把 AI 嵌入搜索——"搜索是谷歌的命脉,也是最容易盈利的场景",其用户规模超出竞争对手十亿级;asah 补充,Gemini 还能进入 Workspace、YouTube、地图、Google Cloud 与大量已在运行的幕后基础设施。
注:以上均为 海外技术社区 用户个人观点与推测,模型规模等说法没有官方数据佐证,请作"社区情绪样本"阅读。
✍️ 编辑视角 · 请带着这些背景阅读
- 信源成色:核心爆料出自 海外科技媒体 的匿名知情人士,经海外通讯社、海外科技媒体、行业媒体 多层转引——属"单方匿名信源",谷歌官方既未确认量产、也未否认项目存在。"6–10 倍"是内部设计目标,没有任何公开测试背书。
- 时机值得玩味:消息曝光正值 Alphabet 把 2026 年资本开支指引上调至 1800–1900 亿美元、市场集中追问 AI 回报的窗口。早盘 +3.3% 说明资本市场此刻愿意为"降本叙事"付费——这层预期管理的成分,需要计入阅读背景。
我们的独立判断:真正值得跟踪的不是倍数,而是指标切换。"每瓦 Token"取代峰值算力成为叙事中心,意味着 AI 竞争正从算力军备赛转入运营效率赛;若 Frozen 路线走通,"为单一模型家族定制硅片"或将成为头部厂商的标配动作。
▶信源直达 · 延伸阅读
本篇为多层转引的二手报道,建议对照一手信源自行判断:
海外技术社区 原帖讨论 →