🔥 算力基建 · 国产突破

阿里云超节点 Day0 适配 Kimi K3,国产算力首次跑通近 3 万亿参数模型

7 月 28 日,阿里云真武超节点实例完成对 Kimi K3 的 Day0 适配,成为国内首个跑通近 3 万亿参数模型的超节点系统。单实例 64 卡全互联、9TB 显存规模,首 Token 时延降低约 35%,标志着国产算力已具备支撑超大参数模型大规模应用的能力。

来源:公开报道 2025-07-28 全文约 3 分钟读完
#阿里云 #Kimi K3 #超节点 #国产算力
🥇 国内首个 跑通近 3 万亿参数模型的超节点
9TB 单实例显存规模,突破算力瓶颈
1.8 单卡解码吞吐提升幅度

⚡ 30 秒速览

  • 发生了什么:阿里云真武超节点 Day0 适配 Kimi K3,国内首次在超节点架构上跑通近 3 万亿参数模型。
  • 硬件底座:64 张平头哥真武 M890 通过 ICN Switch 高速互联,实现 800GB/s 全互联,显存规模达 9TB。
  • 性能收益:首 Token 时延降低约 35%,单卡解码吞吐提升 1.8 倍,稳定支持 1M 长上下文。
  • 怎么做到的:阿里云、平头哥与 Kimi 团队从软件栈、算子层面深度联合适配,优化核心算子。
  • 去哪调用:千问 AI 平台与阿里云百炼已提供 Kimi K3 模型 API。

01跑通 3 万亿参数,靠的是什么底座?

主流模型已进入超 2 万亿参数规模时代。这一量级的模型需要将参数分散到几十张甚至上百张高速互联的 GPU 卡上,才能"跑得又稳又快"。普通 AI 集群因通信带宽局限,无法满足高吞吐、低延迟、高并发的需求。

普通 AI 集群

通信带宽受限,难以支撑万亿参数模型的高吞吐、低延迟、高并发运行需求。

真武超节点实例

通过 ICN Switch 高速互联芯片,让 64 张真武 M890 实现 800GB/s 全互联,单实例支撑万亿级 MoE 专家并行。

这套架构的核心在于用高速互联打破单机算力天花板——9TB 显存规模与 800GB/s 互联带宽,使单实例即可承载过去需要多集群协同才能运行的超大参数 MoE 模型。

64 张真武 M890ICN Switch 互联800GB/s 全互联9TB 显存池

02适配后跑得有多快?实测性能与落地场景

⚡ 推理性能实测:时延降 35%,吞吐涨 1.8 倍联合调优成果

  • 真武 M890 对 Kimi K3 模型架构的核心算子进行专项优化,显著提升推理的算力和带宽利用率。
  • 适配后模型首 Token 时延降低约 35%单卡解码吞吐提升 1.8 倍
  • 稳定支持1M 长上下文,从容应对长文档理解、复杂推理等高负载场景。

🌐 落地通道:两大平台同步开放 API已上线

  • 千问 AI 平台阿里云百炼均已提供 Kimi K3 模型 API,开发者可直接调用。
  • 双方将进一步展开国产算力合作,构建从硬件底座到模型服务的完整闭环。

03Day0 适配背后的工程逻辑

Day0 适配不是简单的"能跑就行"。阿里云、平头哥与 Kimi 团队从软件栈、算子等层面进行了深度联合适配——这意味着硬件团队不仅要理解模型架构,还要针对核心算子做底层优化。

这种深度协同的价值在于:硬件不再是被动承载模型的容器,而是主动参与模型效率优化的变量。从算子级优化到系统级互联,每一层都在为"万亿参数跑得又稳又快"服务。

软件栈适配算子级优化带宽利用率提升长上下文稳定

04编辑视角

诚实提示与独立判断

本篇报道的核心数据——"首 Token 时延降低约 35%""单卡解码吞吐提升 1.8 倍"——均来自当事方单方披露,目前未见第三方独立复测结果。读者宜将其视为"工程可行性证明"而非"横向性能基准"。

此外,"国内首个跑通近 3 万亿参数模型的超节点"这一表述,其参照系为公开报道的同类超节点产品,不排除存在未公开的同等能力实例。

当国产 GPU 的单卡性能仍在追赶时,用系统级互联与算子协同把规模优势转化为可用算力,是国产算力绕开单点瓶颈、抢跑万亿参数时代的现实路径。

现在就能用

千问 AI 平台与阿里云百炼已提供 Kimi K3 模型 API,开发者可直接调用。

阿里云百炼 → 调用 Kimi K3