🔬 硬科技 · 芯片

香港全球独角兽大会:国产 TPU 披露单芯片 896 TFLOPS,token 成本压低至海外一半

8月24-25日,香港首届全球独角兽大会现场,中昊芯英 CMO 黄绪在“智能无界”圆桌对话中披露新一代 TPU 芯片“须臾®”的核心数据:单芯片混合精度浮点算力 896 TFLOPS,综合算力达上一代“刹那®”的 3 倍;经芯模联动深度算子调优,百万 token 推理成本仅为海外 GPU 的 35%–50%

来源:综合公开信息 事件:8月24-25日 · 香港 全文约 3 分钟读完
#中昊芯英 #TPU芯片 #全球独角兽大会 #AI算力 #词元时代
896 TFLOPS 须臾® 单芯片混合精度浮点算力
1792 TOPS 8-bit 推理算力
35–50% 百万 token 成本 · 海外 GPU 的占比

⚡ 30 秒速览

  • 讲了什么:中昊芯英 CMO 黄绪出席香港首届全球独角兽大会,参加“智能无界”圆桌对话,谈 AI 芯片与算力产业底座。
  • 核心判断:AI 进入词元时代,真正的差距不在消耗 token 的总量,而在每单位算力产出多少可执行、可验证、可创造实际价值的智能结果。
  • 硬参数:“须臾®”单芯片混合精度算力 896 TFLOPS,8-bit 推理算力 1792 TOPS,综合算力为上一代“刹那®”的 3 倍
  • 成本冲击:针对词元生成、上下文缓存、批量并发推理做专属优化,百万 token 推理成本仅为海外 GPU 的 35%–50%
  • 行业信号:国产算力竞争叙事正从“谁的算力最强”转向“谁的 token 成本最低”——用账单语言参与全球竞争。

01现场:一场规格不低的会 香港首次全球独角兽大会

先把现场说清楚。8月24-25日,首届全球独角兽大会在香港会议展览中心举办,由香港大公文汇传媒集团主办,主题定为“天生骐骥 创领未来”。

出席嘉宾
行政长官李家超、创新科技及工业局局长孙东、投资推广署署长刘凯旋出席开幕式并致辞
聚焦领域
人工智能 · 集成电路 · 生物医药 · 新能源 · 新材料 · 机器人
圆桌议题
“智能无界:AI 重塑产业底座与全球化创新范式”等,讨论下一波全球增长动力、AI 走向物理世界
大会目的
推动全球独角兽企业落户香港、借港出海,链接科技、资本与产业

规格不低。而真正和芯片行业相关的信息,出现在其中一场圆桌上。

02圆桌:词元时代的算力逻辑 黄绪的三个判断

这场圆桌没有从芯片参数讲起。黄绪先抛出的,是一组关于词元时代的判断——智能体热潮让算力需求指数级攀升,但衡量差距的方式已经变了。

“真正的差距不在于消耗 token 的总量,而在于每单位算力产出多少可执行、可验证、可创造实际价值的智能结果。”

翻译成大白话:大模型公司烧掉的 token 不是竞争力,用同样的算力换回更多可用的结果才是。一句话,把芯片竞争从“堆算力”拉回到“算账本”。

旧范式:算力军备竞赛

谁拥有最强算力,谁就掌握主动权。参数规模与峰值性能是核心叙事。

新范式:成本与效率

谁能构建更适合大模型与智能体公司的专用计算体系,谁能提供最低的 token 成本。

黄绪的判断很直接:AI 芯片的竞争,正在从“谁拥有最强算力”,转向“谁能提供最低的 token 成本”。这也是“须臾®”整套产品逻辑的出发点。

03参数:须臾® 的底气 6 月 30 日发布的新一代 TPU

这套逻辑落到产品上,是一组干脆的数字——

896TFLOPS · 混合精度浮点算力
1792TOPS · 8-bit 推理算力
综合算力 · 对比“刹那®”
35–50%token 成本 · 对比海外 GPU

注:混合精度与 8-bit 算力为单芯片指标;成本比例为百万 token 推理场景下的相对值,不同模型与场景存在波动。

值得注意的是它的优化方向:词元生成、上下文缓存、批量并发推理——每一项都对准大模型推理的真实开销结构,而不是参数表上的峰值。

海外 GPU推理成本基准
100%
须臾® TPU中昊芯英 · 芯模联动调优后
35–50%

注:柱宽表示推理成本,越低越优。“须臾®”实际区间为海外 GPU 的 35%–50%,柱位取区间中值示意;海外 GPU 为标准化基准 100%。

词元生成优化上下文缓存批量并发推理芯模联动深度算子调优

04行业:从发布会到机房 国产算力叙事在换语言

但芯片的价值不在发布会屏幕上,而在机房。须臾® 已经量产落地,千卡万卡集群进入规模化运营,并与多家国内大模型完成芯模联动深度算子调优。

芯片量产千卡万卡集群芯模联动调优千行百业落地全球化生态

这意味着它已经越过“流片成功”的里程碑,进入订单与运维的深水区。

国产算力的叙事,正在从参数表走向账单。而账单上的数字,才是全球独角兽大会真正想听的语言。

编辑核心判断

词元时代的算力竞争,已经不在跑分榜上。中昊芯英强调的是“单位算力产出多少可执行、可验证的智能结果”,本质上是把芯片当作成本结构来竞争。把 token 成本压到海外 GPU 的一半,比把算力翻三倍更接近商业的本质——因为前者是商业模式,后者只是工程参数。国产 TPU 的下一个战场,不在发布会,在机房。

后续观察

真实成本能否兑现? 35%–50% 的 token 成本优势,需要在大规模生产负载下复现,而非仅在调优场景中成立。
集群规模是否跟上? 千卡万卡集群的稳定性、利用率与运维效率,将决定国产算力能否接住真实需求。
生态绑定有多深? 与国内大模型的深度算子调优是优势,但也需要警惕单一阵营绑定的长期风险。

原文未提供公开体验入口。须臾® 的量产实绩与真实推理成本,我们将持续跟踪。