⚙️ 算力交付 · 生态升级
3万亿参数开源大模型接入算力交付网络, Token 工厂进入 3T 时代
7 月 29 日,九章云极 Alaya Token 平台完成对 Kimi K3 模型生产级的适配上线。随着超大体量开源 MoE 模型进入交付网络,AI 工程调度能力的竞争焦点正从千亿参数向万亿级模型与百万上下文吞吐快速平移。
来源:公开报道•
2026-07-29•
全文约 2 分钟读完
#九章云极
#KimiK3
#AlayaToken
#AI基础设施
#MoE架构
3 万亿级
Kimi K3 参数量,创开源模型新高
100 万
上下文窗口 Token 数,原生支持视觉
1679分
Frontend Code Arena 榜首成绩
⚡ 30 秒速览
- 上线内容:Alaya Token 规模化交付平台完成 Kimi K3 适配,算力矩阵扩展至 3T 参数级别。
- 模型位面:Kimi K3 采用 2.8T MoE 架构与自研 KDA 线性注意力,前端代码基准位列全球开源第一。
- 工程攻坚:平台针对 100 万长上下文调优底层算子与 KV Cache 动态调度,保障推理吞吐稳定。
- 交付范式:采用“聚合不锁定”模式,企业通过单套 API 密钥即可无缝切换 GLM-5.2、DeepSeek-V4 Flash 与 Kimi K3。
013T 模型性能表现与架构创新 代码与推理进入第一梯队
在基准测试表现上,Kimi K3 在前端代码生成与复杂工程实操中展现出较高的基准分数:
Frontend Code Arena前端代码基准测试
1679
SWE-bench Verified软件工程自动化解题率
76.8%
注:数据源自官方发布与第三方机构测试。Frontend Code Arena 成绩超过 Claude Fable 5,位居开源模型榜首;SWE-bench 测试体现了其在真实开发场景下的 Agent 推理能力。
KDA 混合线性注意力
引入 Kimi Delta Attention 机制与注意力残差架构,解决长文本状态下计算复杂度剧增问题。
2.8T MoE 原生多模态
基于混合专家架构设计,无需挂载外部视觉编码器,实现文本与图像信息的原生融合理解。
02长上下文交付:底层调度如何接棒?
将 3 万亿参数模型与 100 万 Token 的长上下文推向商业化交付,对计算集群的显存占用和调度响应提出了严峻挑战。Alaya Token 工程团队的优化重点集中于吞吐平滑与资源解耦:
集群算子底层重构→KV Cache 动态调度→长程推理吞吐平滑→标准化 Token 输出
聚合而不锁定:该平台核心考量在于解除企业与单一模型厂商的绑定。用户无需为每个模型单独采购集群套餐,通过一套 API 密钥即可在不同场景下按需调用分布式 Token 算力,目前已应用在金融风控、工业质检和代码生成等场景。
编辑视角 · 审慎评估
本次上线消息源自企业单方发布。需要注意的是,Kimi K3 的 76.8% SWE-bench 得分为第三方评测数据,而 Alaya Token 平台在面对 3T 级超大模型高并发请求时的实际推理延迟、单位 Token 成本以及 SLA 保障能力,仍缺少大规模 ToB 真实业务负载的长时间复测检验。
行业判断: Token 规模化交付正从“算力堆砌”转向“超大模型与百万上下文的底层工程调度能力比拼”,聚合型算力接口将加速重构企业级模型的选型范式。
获取方式:开发者与企业可访问官方平台进行密钥申请 codingplan.alayanew.com