算子挑战赛 S2 赛季启动:FP16 GEMM 优化,国产算力软件栈的极限试炼
摩尔线程正式开启第二届算子挑战赛,聚焦大模型最核心计算载荷 FP16 通用矩阵乘法(GEMM),考验开发者对国产 GPU 计算效能的极致挖掘能力。赛题回归工程本质:不拼参数,拼吞吐。
摩尔线程正式开启第二届算子挑战赛,聚焦大模型最核心计算载荷 FP16 通用矩阵乘法(GEMM),考验开发者对国产 GPU 计算效能的极致挖掘能力。赛题回归工程本质:不拼参数,拼吞吐。
大模型时代,算力即竞争力。从 ChatGPT 到国产大模型的快速迭代,每一次模型能力的跃升,都依赖算力规模与效率的双重突破。随着模型参数从千亿迈向万亿,计算吞吐与显存带宽的需求呈指数级增长。
通用矩阵乘法(GEMM)正是衡量这一能力的关键标尺。作为大模型训练与推理中最核心的计算载荷,GEMM 同时考验计算单元的利用效率、访存系统的带宽供给能力,以及二者之间的协同调度水平。
但硬件只是起点,软件才是终点。
硬件决定的理论计算上限,写在芯片规格书上。
经过算子优化、访存调度、流水线编排后,真正能交付的有效吞吐。
未经极致调优的算子与运行时环境,难以将纸面算力转化为实际有效吞吐。GEMM 既是验证硬件微架构与软件栈成熟度的标准测试用例,也是算子开发领域公认的高难度课题。
注:GEMM 的优化涉及寄存器分配、共享内存、流水线调度、向量化等多个维度,是衡量 GPU 软件栈成熟度的"通用语言"。
本次挑战赛的赛题非常聚焦:在摩尔线程 MTT S5000 智算卡上,基于 MUSA SDK 与 mcc 编译器,实现高性能的 FP16 C = A × B 矩阵乘法。参赛者需要在以下四个维度上同时发力:
其中,正确性是硬性门槛——计算结果须通过严格正确性验证,在此基础上最大化吞吐性能。这意味着一切优化技巧必须在不牺牲精度的前提下施展。
硬件平台方面,MTT S5000 是摩尔线程面向智算场景的全功能 GPU,报名后参赛者将获得远程开发环境的访问权限,无需自备硬件。
注:提交方式为 Gitee 仓库标准化流程,包括目录组织、build.sh 脚本与 README 说明,官方提供示例仓库供参考。
从报名到颁奖,整个赛季持续约 70 天。以下是完整的时间线:
优胜者权益:除了现金奖金,获奖者还将获得以下资源与机会:
注:赛程安排如因实际情况需调整,将另行通知,最终以官方公布为准。奖金具体金额未在公开信息中披露。
摩尔线程为参赛者准备了完整的学习路径,覆盖从工具链入门到算子优化实战的各个环节。以下是官方提供的核心资源类别:
所有课程与文档均通过摩尔学院官网与官方文档站提供,参赛者可根据自身基础选择学习路径。赛前培训环节(8 月 28 日)将提供技术团队的直接答疑,是快速上手的绝佳窗口。
此外,官方提供了作品示例仓库,用于说明 Gitee 提交方式、目录组织、build.sh 写法和 README 编写规范,帮助参赛者规避格式问题。
注:学习资源均为公开可获取,参赛者无需额外申请权限。建议优先完成 MUSA Tutorial 与 GEMM 优化实战两门课程。
这场算子挑战赛的独特之处,不在于奖金数额,也不在于参赛人数预期,而在于它精准地切中了当前国产算力产业链中最薄弱的环节——软件栈的深度优化能力。
国产 GPU 硬件在过去两年取得了长足进步,但硬件决定的是理论峰值,软件才决定实际可达性能。GEMM 作为大模型最核心的计算载荷,其优化水平直接反映了从芯片到编译器再到运行时环境的全栈成熟度。
一个诚实的注脚:
同样的硬件,经过极致调优的算子与未经优化的算子,吞吐差距可能达到数倍。这意味着,在算力竞争的下半场,软件工程能力正在成为比硬件参数更关键的变量。这场挑战赛本质上是在探索一个问题:国产 GPU 的软件栈,距离世界一流水平还有多远?
算子优化不是"锦上添花"的工程细节,而是决定国产算力能否兑现承诺的关键一跃。当硬件差距逐渐缩小,软件栈的深度将定义真正的竞争力。
挑战赛面向所有开发者开放,单人报名,登录摩尔学院官网即可完成注册。报名截止日期:2026 年 8 月 20 日。
摩尔学院官网报名 →