香港全球独角兽大会:国产 TPU 披露单芯片 896 TFLOPS,token 成本压低至海外一半
8月24-25日,香港首届全球独角兽大会现场,中昊芯英 CMO 黄绪在“智能无界”圆桌对话中披露新一代 TPU 芯片“须臾®”的核心数据:单芯片混合精度浮点算力 896 TFLOPS,综合算力达上一代“刹那®”的 3 倍;经芯模联动深度算子调优,百万 token 推理成本仅为海外 GPU 的 35%–50%。
8月24-25日,香港首届全球独角兽大会现场,中昊芯英 CMO 黄绪在“智能无界”圆桌对话中披露新一代 TPU 芯片“须臾®”的核心数据:单芯片混合精度浮点算力 896 TFLOPS,综合算力达上一代“刹那®”的 3 倍;经芯模联动深度算子调优,百万 token 推理成本仅为海外 GPU 的 35%–50%。
先把现场说清楚。8月24-25日,首届全球独角兽大会在香港会议展览中心举办,由香港大公文汇传媒集团主办,主题定为“天生骐骥 创领未来”。
规格不低。而真正和芯片行业相关的信息,出现在其中一场圆桌上。
这场圆桌没有从芯片参数讲起。黄绪先抛出的,是一组关于词元时代的判断——智能体热潮让算力需求指数级攀升,但衡量差距的方式已经变了。
翻译成大白话:大模型公司烧掉的 token 不是竞争力,用同样的算力换回更多可用的结果才是。一句话,把芯片竞争从“堆算力”拉回到“算账本”。
谁拥有最强算力,谁就掌握主动权。参数规模与峰值性能是核心叙事。
谁能构建更适合大模型与智能体公司的专用计算体系,谁能提供最低的 token 成本。
黄绪的判断很直接:AI 芯片的竞争,正在从“谁拥有最强算力”,转向“谁能提供最低的 token 成本”。这也是“须臾®”整套产品逻辑的出发点。
这套逻辑落到产品上,是一组干脆的数字——
注:混合精度与 8-bit 算力为单芯片指标;成本比例为百万 token 推理场景下的相对值,不同模型与场景存在波动。
值得注意的是它的优化方向:词元生成、上下文缓存、批量并发推理——每一项都对准大模型推理的真实开销结构,而不是参数表上的峰值。
注:柱宽表示推理成本,越低越优。“须臾®”实际区间为海外 GPU 的 35%–50%,柱位取区间中值示意;海外 GPU 为标准化基准 100%。
但芯片的价值不在发布会屏幕上,而在机房。须臾® 已经量产落地,千卡万卡集群进入规模化运营,并与多家国内大模型完成芯模联动深度算子调优。
这意味着它已经越过“流片成功”的里程碑,进入订单与运维的深水区。
国产算力的叙事,正在从参数表走向账单。而账单上的数字,才是全球独角兽大会真正想听的语言。
词元时代的算力竞争,已经不在跑分榜上。中昊芯英强调的是“单位算力产出多少可执行、可验证的智能结果”,本质上是把芯片当作成本结构来竞争。把 token 成本压到海外 GPU 的一半,比把算力翻三倍更接近商业的本质——因为前者是商业模式,后者只是工程参数。国产 TPU 的下一个战场,不在发布会,在机房。
原文未提供公开体验入口。须臾® 的量产实绩与真实推理成本,我们将持续跟踪。