阿里 Qwen3.8 登顶英伟达 GPU 算子榜:力压腾讯混元、人类开发者与 Cursor
7 月 21 日,阿里千问 Qwen3.8 预览版登顶英伟达 SOL-ExecBench 的 FlashInfer-Bench 子集——一个专测「AI 写的 GPU 算子离硬件理论极限还有多远」的榜单。算子优化的反馈完全可量化、无法讨好评审,因此这个第一的另一重含义是:模型展示了无需人类标注、与真实硬件交互即可闭环自我改进的潜力。
7 月 21 日,阿里千问 Qwen3.8 预览版登顶英伟达 SOL-ExecBench 的 FlashInfer-Bench 子集——一个专测「AI 写的 GPU 算子离硬件理论极限还有多远」的榜单。算子优化的反馈完全可量化、无法讨好评审,因此这个第一的另一重含义是:模型展示了无需人类标注、与真实硬件交互即可闭环自我改进的潜力。
注:原始报道仅披露以上五个名次,未给出任何 SOL 具体分值;第 3/5/7/8/9 名未提及,其他项目「暂未找到公开打榜记录」。条形长度按名次折算(第 1 名=满格),仅示意先后,不代表分数差距。
现代数据中心里,没把硬件用满的 kernel 意味着算力与能源的双重浪费。而以往的基准只盯着「相对软件基线的加速比」,看不见内核距离硬件最优效率还差多远。为此英伟达推出 SOL-ExecBench:面向 Blackwell B200 架构,专测 AI 智能体、编译器与自动内核生成工具写出的 GPU 算子性能。
只看相对软件基线的加速比——「比参考实现快多少」,看不到与硬件最优之间的距离。
以 Speed-of-Light(光速极限)为尺——由 GPU 峰值算力与 HBM 带宽共同决定的理论性能上限,越接近 1 越逼近极限。
分数同时回答两个问题:比基准改进了多少,以及距离最大可实现的硬件性能还剩多少优化空间。
全套任务提取自商用及前沿 AI 模型,覆盖大语言模型、扩散、计算机视觉、音频、视频与混合架构,含 BF16 / FP8 / NVFP4 精度的前向与反向负载。Qwen3.8 登顶的 FlashInfer-Bench 子集专攻 LLM 推理算子:26 题源自 Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1,精度为 BF16 与 FP8,典型任务包括 Fused Attention、FP8 MoE、RMSNorm 等推理关键算子。
打分由英伟达 SOLAR 工具完成:从 FLOP 数量、字节数、GPU 峰值吞吐量与带宽四个维度算出硬件 SOL 界限,再结合预定义评分基准得出 SOL 分。为防「骗分」,套件内置沙盒评估工具,其智能优化算法能识别试图绕过评估机制换取提速的行为;所有提交均在真实 B200 上隔离执行,GPU 时钟锁定 1500MHz 保证可复现。
Kernel 优化是少数几个能提供清晰、客观、可量化反馈的真实工程任务之一:
运行时间、吞吐量、带宽利用率都可以精确测量。
距离硬件理论极限还有多远,没有歧义。
每一轮优化都可以作为下一轮的起点。
这意味着模型可以无需人类标注,在与真实硬件环境的交互中自主产生训练信号、评估自身输出质量并持续改进。在 FlashInfer-Bench 上排名靠前,对应四项实打实的能力优势:
优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需跨越长上下文进行一致性推理。
面对多轮工具调用,模型需根据每次执行反馈动态调整策略,而非机械执行预设步骤。
性能提升往往不是线性的,要在大量「看似合理但实际无效」的方向中识别真正有价值的优化路径。
从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向——可直接迁移至科学计算、编译器设计、芯片设计。
一句话:能在 SOL-ExecBench 上持续进化的模型,具备的是在客观物理约束下闭环自我改进的能力——这正是「自我进化 AI」最稀缺的实证。
据千问团队向行业媒体披露,团队围绕 Kernel Self-Evolving(算子自我进化)在训练、推理两侧都做了专项设计。
训练侧:让模型真正学会优化,而非背下代码模式。核心是一套基于真实 GPU 环境的大规模强化学习体系,三招分别是:
推理侧:阿里巴巴 Atrex Kernel Agent 框架承载算子优化的完整「分析—迭代」流程与经验沉淀机制。在 FlashInfer-Bench 评测中,模型就在这套循环里平均迭代了 29,354 轮工具调用:
在数万轮迭代中保持方向一致、持续产出有效优化、不陷入局部震荡——这正是长程持续优化能力与普通代码生成能力的分水岭。
Qwen3.8 登顶意味着模型有能力承担底层算力优化的复杂工程任务:直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环,人工介入算子开发的环节被进一步压缩。
自动化 GPU 算子生成赛道的长期竞争,将取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。
伴随模型能力升级,模型侧与编译层在算力优化上将形成持续双向反馈——硬件规格、算子实现、模型架构三者的协同演进,未来可能成为常态。
Kernel 是少数奖励无法作假的 AI 考场——在这里领先的模型,拿到的是闭环自我进化的入场券。
正式版尚未发布:千问团队 7 月 19 日宣布 Qwen3.8 将「很快发布并开源」,当前成绩来自预览版。开源后权重与代码预计经官方渠道放出,可先关注千问官方 GitHub 组织。
github.com/QwenLM → 关注正式版开源