🚀 开源模型 · 国产算力

智谱GLM-5.3-Flash开源上线:AA指数57分追平Claude Opus,62T流量全由国产芯片扛下

8月26日晚,智谱正式上线并开源 GLM-5.3-Flash——GLM-5系列首个原生多模态模型。AA综合智能指数57分,与Claude Opus 4.8并列。更关键的是,发布前的匿名压力测试中,62T Token请求全部由国产芯片承载

综合公开信息 2026-08-27 全文约 4 分钟读完
#GLM-5.3-Flash #国产算力 #异构混推 #Token工厂
57 AA智能指数 · 与Claude Opus 4.8持平
62T 匿名测试Token调用 · 100%国产芯片
320B 总参数 · 激活18B
3× 端到端服务性能提升

注:AA指数为 Artificial Analysis 综合智能指数;62T 为发布前匿名模型 "Ox-Alpha" 在 OpenCode 与 OpenRouter 上的累计调用量,全部由国产芯片承载;"3×" 为同一硬件环境下初始基线的端到端性能提升。

⚡ 30 秒速览

  • 发布即开源:8月26日晚 GLM-5.3-Flash 上线并开源,320B 总参 / 18B 激活,GLM-5 系列首个原生多模态模型
  • 能力持平:AA智能指数57分,与 Anthropic 最受欢迎的 Claude Opus 4.8 并列,进入全球前沿模型区间。
  • 真实大考:发布前以匿名身份 Ox-Alpha 公开测试,62T Token 调用全部由国产芯片承接,无一场"预演"。
  • 成本跃迁:国产芯片集群端到端性能提升 3倍,硬件效率与单Token成本对齐主流英伟达GPU。
  • 规模信号:商汤大装置 7 月日均 Token 服务量2.42万亿,2026 年底目标突破日均 10 万亿,全年增长 25 倍。

01新模型档案 为极低成本而生的多模态模型

📦 GLM-5.3-Flash 关键参数

  • 320B 总参数 / 18B 激活参数
  • GLM-5 系列首个原生多模态模型
  • 预训练语料 30T Token 多模态数据
  • AA综合智能指数 57分,与 Claude Opus 4.8 持平
  • 架构取向:为极低成本推理而设计

这个模型的特殊之处,不在某一个参数——而在于它的设计取向:不是靠堆算力换性能,而是用更少的计算资源实现更强的性能

57 分将 GLM-5.3-Flash 送入全球前沿模型能力区间。在 Artificial Analysis 的横评体系中,这是国产开源模型与头部商业模型的一次正面并列。

0262T的匿名大考 为什么这次数据可信

能力数字是一回事,真实世界的考验是另一回事。

国产算力真的能扛住前沿模型的大规模商用流量吗?

发布之前,GLM-5.3-Flash 以匿名身份 Ox-Alpha(中文社区称作"牛来")在 OpenCode 和 OpenRouter 上公开运行,累计 Token 调用量达到 62T——这些请求流量,全部由国产芯片提供算力支持。

旧认知

国产算力性价比不高、难以规模商用。市场长期停留在"单点可用、整体算不过账"的固有印象里。

新现实

62T 真实流量全国产承载;端到端性能提升 3 倍;硬件效率与单 Token 成本达到主流英伟达 GPU 同等水平。

一个诚实的注脚:匿名测试期间,平台用户并不知晓算力来自国产芯片。这意味着每一笔调用都是真实业务需求,而不是为"验收"制造的流量。

注:性能与成本对比均基于同一硬件环境下的初始基线;公开第三方独立复测数据尚未发布,建议持续关注后续验证。

03异构混推的杠杆 国产算力的效率破局

性价比的跃迁,不来自某一颗芯片的单点突破,而来自"调度"这门系统工程

商汤大装置的解法是异构混合推理:根据不同推理阶段对计算、带宽的不同需求,让不同架构、不同定位的国产芯片各尽其长、高效协同。

1.25× 整体推理性价比
vs NVIDIA H系列
2.5× 同等成本Token产能
vs 国产同构推理
3× 端到端服务性能提升
同一硬件环境
62T 全程国产芯片承载
匿名生产流量

注:以上均为官方披露口径,对比基线为同一硬件环境初始基线;其中"vs NVIDIA H系列"指整体推理服务性价比,非单卡峰值算力。

不再是"单卡单挑",而是让每颗芯片干自己最擅长的事——这正是异构混推能同时拉高性能与压低成本的根本原因。

04一座Token工厂 从算力到服务的商业模式

商汤把这套能力体系概括为三件事:一套模型、一座Token工厂、一套智能体管控系统

Token工厂承担的核心职责,是把多模态模型与大装置基础设施联合优化,将不同芯片、集群、能源和交付节点组织起来,持续生产更高质量、成本更低的Token,并与模型之间形成双向反哺闭环

国产芯片 Token工厂 Token服务 模型迭代 反哺优化

这套系统的产能增长曲线,已经不只是规划:

2.42万亿 7月日均Token服务量
10万亿 2026年底目标 · 日均

注:7月日均 2.42 万亿为已披露运营数据;2026 年底日均 10 万亿为官方目标,全年 Token 量级预计增长 25 倍。

商汤还重新定义了 AIDC 的价值标尺——TPW(Tokens Per Watt):每瓦特能生产多少 Token。配合算电协同 Agent,国产算力从"拼算力"进化到"拼能效"。

🔓 开源状态:GLM-5.3-Flash 权重已向开发者开放,可通过智谱开放平台获取;商汤大装置同步提供基于国产算力的一站式 Token 托管服务。
编辑核心判断

国产算力的故事,讲到了"算账"这一章。62T 真实流量的验证、1.25 倍的推理性价比、对齐英伟达的单 Token 成本——三个数字指向同一结论:算力国产化已从"政治题"变成"算术题"。当性价比被证明,剩下的悬念不再是"能不能用",而是整个产业链能否把"可用"变成"海量交付"。

现在就能用

GLM-5.3-Flash 权重已开源,开发者可前往智谱开放平台获取模型并本地部署;商汤大装置同步开放国产算力 Token 服务,支持一键托管推理与二次开发。

智谱开放平台 → 获取 GLM-5.3-Flash