十年磨一片晶圆:从濒临倒闭到千亿市值,全球最大芯片的逆袭之路
一家成立时无人看好的公司,用一整片晶圆造出一颗面积是最大 GPU 58 倍的芯片。从百度实验室的 Scaling Law 发现,到 OpenAI 签约 200 亿美元推理合同,Cerebras 证明:当 AI 从训练走向推理,架构的重新发明比参数的堆叠更重要。
一家成立时无人看好的公司,用一整片晶圆造出一颗面积是最大 GPU 58 倍的芯片。从百度实验室的 Scaling Law 发现,到 OpenAI 签约 200 亿美元推理合同,Cerebras 证明:当 AI 从训练走向推理,架构的重新发明比参数的堆叠更重要。
2014 年,吴恩达加入百度,在硅谷成立了 AI 实验室。团队核心成员 Greg Diamos 从英伟达带来了 CUDA 的底层经验,另一位研究员 Dario Amodei 则对语言模型着迷。他们训练了当时全球最大的 3 亿参数语言模型,并发现了一个规律:模型越大、数据越多、算力越强,模型就越聪明,且提升是线性的、可预测的。
这就是后来被称为 Scaling Law 的发现。Dario Amodei 后来将这个发现带去了 OpenAI,成为 GPT 系列的核心逻辑。
但问题随之而来:如果 Scaling Law 成立,未来真正有用的模型,需要的算力将是现有 GPU 集群完全无法提供的量级。
百度的研究员们意识到,他们需要一种新的硬件。同一时间,在硅谷的另一端,五个刚从 AMD 离职的工程师,在一块白板上写下了他们的目标:让硅谷的计算机历史博物馆里有一天出现他们的名字。
2016 年 3 月,Cerebras 正式成立。从第一天起,它的目标就是:为 AI 重新设计一台机器。
AI 训练的瓶颈,从来不只是计算本身。参数、梯度、激活值需要在显存、缓存、计算单元和 GPU 之间来回倒腾。一旦模型大到单卡塞不下,就得切块分给多卡,数据搬运的损耗成为主要矛盾。
大多数芯片公司的解法是:把 GPU 拼成集群,再用高速互联解决通信问题。 Cerebras 的解法则是:把尽可能多的计算单元、内存和互联,放到一整片晶圆上。
HBM 内存与计算芯片分离,数据搬运受限于内存带宽。多卡互联需跨网络通信,延迟与能耗随规模指数增长。
计算单元与片上 SRAM 在同一片硅上,内存带宽是 GPU 的数千倍。数据移动在晶圆内部完成,延迟与能耗大幅降低。
但挑战也是巨大的:晶圆制造一定有缺陷。 在台积电 5nm 工艺下,每平方毫米约 0.001 个缺陷,WSE-3 面积 46,225 mm² 意味着约 46 个缺陷。在传统设计上,任何一个缺陷都足以让整块芯片报废。
Cerebras 的解法包含两个设计:
注:Cerebras 把核心缩到极小(0.05 mm²),使单个缺陷的损失降低两个数量级;再配合 1%–1.5% 的备用核心与片上动态路由网络,将缺陷区域屏蔽。从软件视角看,整片晶圆始终是一块完美芯片。
这个思路并非 Cerebras 首创——内存芯片和 GPU 厂商几十年来都在用冗余核心处理缺陷。但 Cerebras 的创新在于:把冗余逻辑从一块小芯片放大到整张晶圆的尺度,用一个 70 年来被认为"无解"的良率难题,变成了一个可管理的工程问题。
2016 年,百度投资人周楠接到一个任务:寻找英伟达之外的 AI 算力方案。她花了四周时间,把对 Cerebras 的尽调做成了一个科学项目,逐一验证良率、流片、容错、编译器兼容性五个技术风险。
关键转折点发生在 Greg Diamos 见到 Cerebras 团队之后。在此之前,他已经见过 20 多家 AI 芯片创业公司,每家都说自己在做"比英伟达更好的 GPU"。直到他走进 Cerebras 的办公室,看到一整片晶圆原型。
"等一下,GPU 根本不需要这么大的功耗,你们想的肯定不是普通 GPU。"——Greg 意识到,这不是山寨版英伟达,他们在做一件完全不同的事。
百度最终共同领投了 Cerebras 的 Series C。但真正的商业化之路,才刚刚开始。
一个诚实的注脚:G42 的单一客户依赖曾让 Cerebras 的第一次上市申请被 CFIUS 叫停。经过股份结构调整,2025 年 3 月 CFIUS 正式放行。这段等待期并未浪费——公司在私募市场完成了 G 轮和 H 轮融资,估值从 81 亿升至 230 亿美元。
训练是建造模型,推理是使用模型。当 AI 从实验室走向产品,推理速度直接决定了用户体验的边界。
大语言模型生成回答时,是一个严格的串行过程:生成了第一个词,才能知道第二个词。每生成一个 token,都要在模型权重、缓存和计算单元之间搬动大量数据。推理的关键词是内存带宽——这恰恰是 Cerebras 晶圆级架构的优势所在。
Cerebras 目前平均可以达到 每秒超过 2000 个 token 的输出速度,而传统方案通常在 200–300 之间。快了 6–10 倍,改变的不只是速度,而是使用方式。
Angela Yeung(Cerebras 产品副总裁)对此的总结很直接:"推理市场扩张的速度远超训练,我们在推理速度上有约 15 倍的优势,这里的机会比训练更大。"
Cerebras 已将产品包装为 API 服务,兼容 OpenAI 接口——客户只需换一个 API key,就可以把请求送到 Cerebras 后端,无需重写代码。
回看 Cerebras 的十年,有三个关键选择构成了它的护城河:
第一,架构上的激进。 在所有人都沿着 GPU 路线做增量改进时,它选择了晶圆级计算——一个被半导体行业普遍认为"不可能"的方向。这个选择让它花了三年、烧掉近 3 亿美元才拿出第一代产品,但也让它在推理时代拥有了不可复制的带宽优势。
第二,客户选择的精准。 从百度到 G42 再到 OpenAI,每一步都踩在 AI 发展的关键节点上。尤其是平安夜与 OpenAI 签下的 200 亿美元合同,标志着 AI 基础设施从"单一供应商"走向"多元化"的拐点。
第三,从训练到推理的及时转身。 当行业还在聚焦训练时,Cerebras 意识到推理才是更大的市场。把产品从超级计算机重新包装为 API 服务,兼容 OpenAI 生态,是它从"实验室设备"走向"商业基础设施"的关键一步。
当 AI 从"建造模型"进入"使用模型"时代,推理速度不再只是性能指标,而是产品形态的边界定义者。Cerebras 的崛起证明:在架构层面重新思考计算,比在现有路线上堆叠参数,更能捕获代际转折的红利。
Cerebras 推理 API 已全面兼容 OpenAI 接口,无需重写代码即可接入。通过 Cerebras Cloud 或已集成的平台(如 OpenAI Codex Spark)即可体验。
cerebras.ai → 开发者控制台