🚀 开源模型 · 国产算力
智谱GLM-5.3-Flash开源上线:AA指数57分追平Claude Opus,62T流量全由国产芯片扛下
8月26日晚,智谱正式上线并开源 GLM-5.3-Flash——GLM-5系列首个原生多模态模型。AA综合智能指数57分,与Claude Opus 4.8并列。更关键的是,发布前的匿名压力测试中,62T Token请求全部由国产芯片承载。
综合公开信息•
2026-08-27•
全文约 4 分钟读完
#GLM-5.3-Flash
#国产算力
#异构混推
#Token工厂
57分
AA智能指数 · 与Claude Opus 4.8持平
62T
匿名测试Token调用 · 100%国产芯片
320B
总参数 · 激活18B
3×
端到端服务性能提升
注:AA指数为 Artificial Analysis 综合智能指数;62T 为发布前匿名模型 "Ox-Alpha" 在 OpenCode 与 OpenRouter 上的累计调用量,全部由国产芯片承载;"3×" 为同一硬件环境下初始基线的端到端性能提升。
⚡ 30 秒速览
- 发布即开源:8月26日晚 GLM-5.3-Flash 上线并开源,320B 总参 / 18B 激活,GLM-5 系列首个原生多模态模型。
- 能力持平:AA智能指数57分,与 Anthropic 最受欢迎的 Claude Opus 4.8 并列,进入全球前沿模型区间。
- 真实大考:发布前以匿名身份 Ox-Alpha 公开测试,62T Token 调用全部由国产芯片承接,无一场"预演"。
- 成本跃迁:国产芯片集群端到端性能提升 3倍,硬件效率与单Token成本对齐主流英伟达GPU。
- 规模信号:商汤大装置 7 月日均 Token 服务量2.42万亿,2026 年底目标突破日均 10 万亿,全年增长 25 倍。
01新模型档案 为极低成本而生的多模态模型
📦 GLM-5.3-Flash 关键参数
- 320B 总参数 / 18B 激活参数
- GLM-5 系列首个原生多模态模型
- 预训练语料 30T Token 多模态数据
- AA综合智能指数 57分,与 Claude Opus 4.8 持平
- 架构取向:为极低成本推理而设计
这个模型的特殊之处,不在某一个参数——而在于它的设计取向:不是靠堆算力换性能,而是用更少的计算资源实现更强的性能。
57 分将 GLM-5.3-Flash 送入全球前沿模型能力区间。在 Artificial Analysis 的横评体系中,这是国产开源模型与头部商业模型的一次正面并列。
0262T的匿名大考 为什么这次数据可信
能力数字是一回事,真实世界的考验是另一回事。
国产算力真的能扛住前沿模型的大规模商用流量吗?
发布之前,GLM-5.3-Flash 以匿名身份 Ox-Alpha(中文社区称作"牛来")在 OpenCode 和 OpenRouter 上公开运行,累计 Token 调用量达到 62T——这些请求流量,全部由国产芯片提供算力支持。
旧认知
国产算力性价比不高、难以规模商用。市场长期停留在"单点可用、整体算不过账"的固有印象里。
新现实
62T 真实流量全国产承载;端到端性能提升 3 倍;硬件效率与单 Token 成本达到主流英伟达 GPU 同等水平。
一个诚实的注脚:匿名测试期间,平台用户并不知晓算力来自国产芯片。这意味着每一笔调用都是真实业务需求,而不是为"验收"制造的流量。
注:性能与成本对比均基于同一硬件环境下的初始基线;公开第三方独立复测数据尚未发布,建议持续关注后续验证。
03异构混推的杠杆 国产算力的效率破局
性价比的跃迁,不来自某一颗芯片的单点突破,而来自"调度"这门系统工程。
商汤大装置的解法是异构混合推理:根据不同推理阶段对计算、带宽的不同需求,让不同架构、不同定位的国产芯片各尽其长、高效协同。
1.25×
整体推理性价比
vs NVIDIA H系列
2.5×
同等成本Token产能
vs 国产同构推理
3×
端到端服务性能提升
同一硬件环境
62T
全程国产芯片承载
匿名生产流量
注:以上均为官方披露口径,对比基线为同一硬件环境初始基线;其中"vs NVIDIA H系列"指整体推理服务性价比,非单卡峰值算力。
不再是"单卡单挑",而是让每颗芯片干自己最擅长的事——这正是异构混推能同时拉高性能与压低成本的根本原因。
04一座Token工厂 从算力到服务的商业模式
商汤把这套能力体系概括为三件事:一套模型、一座Token工厂、一套智能体管控系统。
Token工厂承担的核心职责,是把多模态模型与大装置基础设施联合优化,将不同芯片、集群、能源和交付节点组织起来,持续生产更高质量、成本更低的Token,并与模型之间形成双向反哺闭环。
国产芯片→
Token工厂→
Token服务→
模型迭代↺
反哺优化
这套系统的产能增长曲线,已经不只是规划:
2.42万亿
7月日均Token服务量
→
10万亿
2026年底目标 · 日均
注:7月日均 2.42 万亿为已披露运营数据;2026 年底日均 10 万亿为官方目标,全年 Token 量级预计增长 25 倍。
商汤还重新定义了 AIDC 的价值标尺——TPW(Tokens Per Watt):每瓦特能生产多少 Token。配合算电协同 Agent,国产算力从"拼算力"进化到"拼能效"。
🔓 开源状态:GLM-5.3-Flash 权重已向开发者开放,可通过智谱开放平台获取;商汤大装置同步提供基于国产算力的一站式 Token 托管服务。
编辑核心判断
国产算力的故事,讲到了"算账"这一章。62T 真实流量的验证、1.25 倍的推理性价比、对齐英伟达的单 Token 成本——三个数字指向同一结论:算力国产化已从"政治题"变成"算术题"。当性价比被证明,剩下的悬念不再是"能不能用",而是整个产业链能否把"可用"变成"海量交付"。
▶现在就能用
GLM-5.3-Flash 权重已开源,开发者可前往智谱开放平台获取模型并本地部署;商汤大装置同步开放国产算力 Token 服务,支持一键托管推理与二次开发。
智谱开放平台 → 获取 GLM-5.3-Flash