🔬 硬科技 · 芯片深度

十年磨一片晶圆:从濒临倒闭到千亿市值,全球最大芯片的逆袭之路

一家成立时无人看好的公司,用一整片晶圆造出一颗面积是最大 GPU 58 倍的芯片。从百度实验室的 Scaling Law 发现,到 OpenAI 签约 200 亿美元推理合同,Cerebras 证明:当 AI 从训练走向推理,架构的重新发明比参数的堆叠更重要。

综合公开信息整理 2026-07-22 全文约 5 分钟读完
#Cerebras #晶圆级芯片 #AI推理 #硬科技 #芯片架构
58× 单芯片面积是最大 GPU 的倍数
2000+ tokens/s 推理输出速度,传统方案 6–10 倍
950亿 IPO 市值,五年估值涨 25 倍

⚡ 30 秒速览

  • 十年从零到千亿:2016 年成立,2026 年 IPO 市值 950 亿美元,从濒临倒闭到全球最大芯片公司。
  • 晶圆级颠覆:WSE-3 面积 46,225 mm²,把计算单元与内存放在同一片晶圆上,数据搬运速度是 GPU 的数千倍。
  • 关键客户链:百度早期验证 → G42 贡献 87% 营收 → OpenAI 签下 200 亿美元推理合同,每一步都踩在 AI 转折点上。
  • 推理时代红利:推理速度 2000+ tokens/s,催生实时代码分析、AI 科学家、交互式教育等新场景。
  • 供应链多元化信号:OpenAI 在英伟达之外选择第二供应商,Cerebras 成为全球最大 AI 推理部署方之一。

01起源:Scaling Law 发现者,首先撞上硬件天花板

2014 年,吴恩达加入百度,在硅谷成立了 AI 实验室。团队核心成员 Greg Diamos 从英伟达带来了 CUDA 的底层经验,另一位研究员 Dario Amodei 则对语言模型着迷。他们训练了当时全球最大的 3 亿参数语言模型,并发现了一个规律:模型越大、数据越多、算力越强,模型就越聪明,且提升是线性的、可预测的。

这就是后来被称为 Scaling Law 的发现。Dario Amodei 后来将这个发现带去了 OpenAI,成为 GPT 系列的核心逻辑。

但问题随之而来:如果 Scaling Law 成立,未来真正有用的模型,需要的算力将是现有 GPU 集群完全无法提供的量级。

百度的研究员们意识到,他们需要一种新的硬件。同一时间,在硅谷的另一端,五个刚从 AMD 离职的工程师,在一块白板上写下了他们的目标:让硅谷的计算机历史博物馆里有一天出现他们的名字。

2016 年 3 月,Cerebras 正式成立。从第一天起,它的目标就是:为 AI 重新设计一台机器。

注:Scaling Law 的论文《Deep Learning Scaling is Predictable, Empirically》后来由百度团队正式发表,其核心发现深刻影响了整个 AI 行业的发展路径。

02晶圆级引擎:把整片晶圆做成一颗芯片

AI 训练的瓶颈,从来不只是计算本身。参数、梯度、激活值需要在显存、缓存、计算单元和 GPU 之间来回倒腾。一旦模型大到单卡塞不下,就得切块分给多卡,数据搬运的损耗成为主要矛盾。

大多数芯片公司的解法是:把 GPU 拼成集群,再用高速互联解决通信问题。 Cerebras 的解法则是:把尽可能多的计算单元、内存和互联,放到一整片晶圆上。

传统 GPU 架构

HBM 内存与计算芯片分离,数据搬运受限于内存带宽。多卡互联需跨网络通信,延迟与能耗随规模指数增长。

Cerebras WSE 架构

计算单元与片上 SRAM 在同一片硅上,内存带宽是 GPU 的数千倍。数据移动在晶圆内部完成,延迟与能耗大幅降低。

但挑战也是巨大的:晶圆制造一定有缺陷。 在台积电 5nm 工艺下,每平方毫米约 0.001 个缺陷,WSE-3 面积 46,225 mm² 意味着约 46 个缺陷。在传统设计上,任何一个缺陷都足以让整块芯片报废。

Cerebras 的解法包含两个设计:

0.05mm²每核心面积,仅为 H100 的 1%
1–1.5%备用核心冗余比例
46,225mm²WSE-3 单芯片面积
85WSE-2 AI 计算核心数

注:Cerebras 把核心缩到极小(0.05 mm²),使单个缺陷的损失降低两个数量级;再配合 1%–1.5% 的备用核心与片上动态路由网络,将缺陷区域屏蔽。从软件视角看,整片晶圆始终是一块完美芯片。

这个思路并非 Cerebras 首创——内存芯片和 GPU 厂商几十年来都在用冗余核心处理缺陷。但 Cerebras 的创新在于:把冗余逻辑从一块小芯片放大到整张晶圆的尺度,用一个 70 年来被认为"无解"的良率难题,变成了一个可管理的工程问题。

03商业验证:从百度到 OpenAI,踩准每一个转折点

2016 年,百度投资人周楠接到一个任务:寻找英伟达之外的 AI 算力方案。她花了四周时间,把对 Cerebras 的尽调做成了一个科学项目,逐一验证良率、流片、容错、编译器兼容性五个技术风险。

关键转折点发生在 Greg Diamos 见到 Cerebras 团队之后。在此之前,他已经见过 20 多家 AI 芯片创业公司,每家都说自己在做"比英伟达更好的 GPU"。直到他走进 Cerebras 的办公室,看到一整片晶圆原型。

"等一下,GPU 根本不需要这么大的功耗,你们想的肯定不是普通 GPU。"——Greg 意识到,这不是山寨版英伟达,他们在做一件完全不同的事。

百度最终共同领投了 Cerebras 的 Series C。但真正的商业化之路,才刚刚开始。

2019WSE-1 发布,40 万核心,18GB 片上 SRAM。同年获美国能源部国家实验室订单,用于新冠变异分析、核聚变模拟等科学计算。
2021WSE-2 升级至 7nm,85 万核心。与阿联酋 G42 签署 Condor Galaxy 超算合作,合同超 10 亿美元
2023营收 7870 万美元,G42 占比 83%。2024 上半年进一步提升至 87%。
2025.12平安夜,与 OpenAI 签署 200 亿美元+ 推理部署合同,同时英伟达与 Groq 达成 200 亿美元技术授权交易。
2026.05IPO 市值 950 亿美元,五年估值涨 25 倍。CEO Andrew Feldman 宣布:愿意与所有云厂商合作,除了英伟达。

一个诚实的注脚:G42 的单一客户依赖曾让 Cerebras 的第一次上市申请被 CFIUS 叫停。经过股份结构调整,2025 年 3 月 CFIUS 正式放行。这段等待期并未浪费——公司在私募市场完成了 G 轮和 H 轮融资,估值从 81 亿升至 230 亿美元。

04推理时代:速度,就是交互本身

训练是建造模型,推理是使用模型。当 AI 从实验室走向产品,推理速度直接决定了用户体验的边界。

大语言模型生成回答时,是一个严格的串行过程:生成了第一个词,才能知道第二个词。每生成一个 token,都要在模型权重、缓存和计算单元之间搬动大量数据。推理的关键词是内存带宽——这恰恰是 Cerebras 晶圆级架构的优势所在。

Cerebras 目前平均可以达到 每秒超过 2000 个 token 的输出速度,而传统方案通常在 200–300 之间。快了 6–10 倍,改变的不只是速度,而是使用方式。

💻 代码:悬停即分析实时

  • 光标悬停代码上,系统立刻显示调用关系、依赖链路和上下文分析。如果推理需要 5–10 秒,开发者的思路早已中断;接近瞬时响应,它用起来就像 IDE 原生功能。

🎓 教育:实时对话的黑板互动

  • AI 一边在虚拟黑板上画图,一边回答追问,学生可以圈出图上任意部分让 AI 再讲一遍。推理延迟让静态视频变成可以实时对话的老师

🔬 科研:AI 科学家实时参与讨论协作

  • 新药研发会议中,AI 员工在讨论进行的同时实时查找竞争对手研究、检索论文、测试假设,直接参与讨论。速度让 AI 从工具变成协作者

Angela Yeung(Cerebras 产品副总裁)对此的总结很直接:"推理市场扩张的速度远超训练,我们在推理速度上有约 15 倍的优势,这里的机会比训练更大。"

Cerebras 已将产品包装为 API 服务,兼容 OpenAI 接口——客户只需换一个 API key,就可以把请求送到 Cerebras 后端,无需重写代码。

05为什么是 Cerebras 做出来了?

回看 Cerebras 的十年,有三个关键选择构成了它的护城河:

第一,架构上的激进。 在所有人都沿着 GPU 路线做增量改进时,它选择了晶圆级计算——一个被半导体行业普遍认为"不可能"的方向。这个选择让它花了三年、烧掉近 3 亿美元才拿出第一代产品,但也让它在推理时代拥有了不可复制的带宽优势。

第二,客户选择的精准。 从百度到 G42 再到 OpenAI,每一步都踩在 AI 发展的关键节点上。尤其是平安夜与 OpenAI 签下的 200 亿美元合同,标志着 AI 基础设施从"单一供应商"走向"多元化"的拐点。

第三,从训练到推理的及时转身。 当行业还在聚焦训练时,Cerebras 意识到推理才是更大的市场。把产品从超级计算机重新包装为 API 服务,兼容 OpenAI 生态,是它从"实验室设备"走向"商业基础设施"的关键一步。

编辑核心判断

当 AI 从"建造模型"进入"使用模型"时代,推理速度不再只是性能指标,而是产品形态的边界定义者。Cerebras 的崛起证明:在架构层面重新思考计算,比在现有路线上堆叠参数,更能捕获代际转折的红利。

开发者入口

Cerebras 推理 API 已全面兼容 OpenAI 接口,无需重写代码即可接入。通过 Cerebras Cloud 或已集成的平台(如 OpenAI Codex Spark)即可体验。

cerebras.ai → 开发者控制台