🏆 GPU 算子 · 榜单速递

阿里 Qwen3.8 登顶英伟达 GPU 算子榜:力压腾讯混元、人类开发者与 Cursor

7 月 21 日,阿里千问 Qwen3.8 预览版登顶英伟达 SOL-ExecBench 的 FlashInfer-Bench 子集——一个专测「AI 写的 GPU 算子离硬件理论极限还有多远」的榜单。算子优化的反馈完全可量化、无法讨好评审,因此这个第一的另一重含义是:模型展示了无需人类标注、与真实硬件交互即可闭环自我改进的潜力。

来源:公开报道 2026-07-22 全文约 4 分钟读完
#Qwen3.8 #英伟达 SOL-ExecBench #GPU 算子优化 #强化学习 #AI 智能体
🥇 第 1 名 FlashInfer-Bench 子集 · LLM 推理 GPU 算子
29,354 单次评测平均工具调用迭代数
2.4T 模型参数 · 正式版已宣布即将开源

⚡ 30 秒速览

  • 赢了谁:排名超过腾讯混元 Hyra(第 2)、人类开发者 Amir M. Mir(第 4)、美国创企 doubleAI 的全自动内核生成系统(第 6)与 AI 编程独角兽 Cursor(第 10)。
  • 榜单硬在哪:英伟达今年 3 月推出,235 项 CUDA 内核任务提取自 124 个真实模型;以「光速极限(SOL)」为尺——0.5 分与基准相当,1.0 即触及硬件理论极限;真实 B200 隔离执行、锁频 1500MHz。
  • 怎么做到:训练侧搭建真实 GPU 环境的大规模强化学习(奖励来自真实编译执行),推理侧用阿里 Atrex Kernel Agent 框架,单次评测平均迭代 29,354 轮工具调用。
  • 为什么重要:算子优化反馈可精确测量、标准客观,模型借此自主产生训练信号、评估自身输出——这是「能自我进化的 AI」少有的实证场景。
  • 冷静一读:登顶的是 26 题的子集、非 235 题总榜;官方未公布具体 SOL 分数;训练细节为千问团队单方披露(详见下方「编辑视角」)。

01榜单已公开名次 Qwen3.8 预览版位居榜首

🥇 Qwen3.8(预览版)阿里千问 · 2.4T 参数,正式版即将开源
第 1 名
🥈 腾讯混元 Hyra腾讯
第 2 名
Amir M. Mir人类开发者 · 榜上唯一的个人选手
第 4 名
doubleAI 内核生成智能体美国 AI 创企 · 全自动 GPU 内核生成系统
第 6 名
CursorAI 编程独角兽
第 10 名

注:原始报道仅披露以上五个名次,未给出任何 SOL 具体分值;第 3/5/7/8/9 名未提及,其他项目「暂未找到公开打榜记录」。条形长度按名次折算(第 1 名=满格),仅示意先后,不代表分数差距。

📦 正式版即将开源:7 月 19 日阿里千问宣布,将很快发布并开源 Qwen3.8(2.4T 参数),官方称其「可能是除 Fable 5 之外最强大的模型」(注:官方表述,原文亦标注「可能」)。7 月 21 日晚,Qwen3.8-Max-Preview 更新,前端 WebDev 表现更好。

02SOL-ExecBench:拿「光速极限」当尺子 英伟达 2026 年 3 月推出

现代数据中心里,没把硬件用满的 kernel 意味着算力与能源的双重浪费。而以往的基准只盯着「相对软件基线的加速比」,看不见内核距离硬件最优效率还差多远。为此英伟达推出 SOL-ExecBench:面向 Blackwell B200 架构,专测 AI 智能体、编译器与自动内核生成工具写出的 GPU 算子性能。

传统内核基准

只看相对软件基线的加速比——「比参考实现快多少」,看不到与硬件最优之间的距离。

SOL-ExecBench

以 Speed-of-Light(光速极限)为尺——由 GPU 峰值算力与 HBM 带宽共同决定的理论性能上限,越接近 1 越逼近极限。

0 起点 0.5 = 与基准相当 1.0 = 硬件 SOL 极限

分数同时回答两个问题:比基准改进了多少,以及距离最大可实现的硬件性能还剩多少优化空间。

235CUDA 内核优化任务
124任务来源模型
26FlashInfer 子集题数
7–48每题动态形状输入配置

全套任务提取自商用及前沿 AI 模型,覆盖大语言模型、扩散、计算机视觉、音频、视频与混合架构,含 BF16 / FP8 / NVFP4 精度的前向与反向负载。Qwen3.8 登顶的 FlashInfer-Bench 子集专攻 LLM 推理算子:26 题源自 Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1,精度为 BF16 与 FP8,典型任务包括 Fused Attention、FP8 MoE、RMSNorm 等推理关键算子。

打分由英伟达 SOLAR 工具完成:从 FLOP 数量、字节数、GPU 峰值吞吐量与带宽四个维度算出硬件 SOL 界限,再结合预定义评分基准得出 SOL 分。为防「骗分」,套件内置沙盒评估工具,其智能优化算法能识别试图绕过评估机制换取提速的行为;所有提交均在真实 B200 上隔离执行,GPU 时钟锁定 1500MHz 保证可复现。

03这个第一,含金量在哪 算子优化是少数「无法作假」的 AI 考场

Kernel 优化是少数几个能提供清晰、客观、可量化反馈的真实工程任务之一:

反馈明确

运行时间、吞吐量、带宽利用率都可以精确测量。

标准客观

距离硬件理论极限还有多远,没有歧义。

迭代自然

每一轮优化都可以作为下一轮的起点。

这意味着模型可以无需人类标注,在与真实硬件环境的交互中自主产生训练信号、评估自身输出质量并持续改进。在 FlashInfer-Bench 上排名靠前,对应四项实打实的能力优势:

🧠 长程因果推理

优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需跨越长上下文进行一致性推理。

🛠️ 工具交互中的策略规划

面对多轮工具调用,模型需根据每次执行反馈动态调整策略,而非机械执行预设步骤。

🧭 稀疏反馈下的探索

性能提升往往不是线性的,要在大量「看似合理但实际无效」的方向中识别真正有价值的优化路径。

🔄 抽象与实现的双向翻译

从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向——可直接迁移至科学计算、编译器设计、芯片设计。

一句话:能在 SOL-ExecBench 上持续进化的模型,具备的是在客观物理约束下闭环自我改进的能力——这正是「自我进化 AI」最稀缺的实证。

04它是怎么练出来的 训练侧真实 GPU 强化学习 · 推理侧 Atrex 框架

据千问团队向行业媒体披露,团队围绕 Kernel Self-Evolving(算子自我进化)在训练、推理两侧都做了专项设计。

训练侧:让模型真正学会优化,而非背下代码模式。核心是一套基于真实 GPU 环境的大规模强化学习体系,三招分别是:

  1. 沙盒里的真实 GPU 环境:为模型提供丰富的硬件文档与可交互 Workspace,奖励信号来自真实编译、执行与性能测量,而非代理指标或模拟器——「确保每一个训练信号都有真实的物理意义」。
  2. 真实 kernel 仓库当训练数据:系统性收集大规模工程级 kernel 优化代码作为训练 query,相比合成数据,覆盖更广泛的优化模式、硬件适配策略与工程取舍,更接近生产场景。
  3. RL 基础设施专项优化:单次优化可能涉及数十至数百轮「编译—执行—分析」循环,属于超长工具调用序列;团队为此专门改造训练基础设施,让模型学会跨长序列的持续优化策略。

推理侧:阿里巴巴 Atrex Kernel Agent 框架承载算子优化的完整「分析—迭代」流程与经验沉淀机制。在 FlashInfer-Bench 评测中,模型就在这套循环里平均迭代了 29,354 轮工具调用

编译执行性能分析策略调整× 平均 29,354 轮

在数万轮迭代中保持方向一致、持续产出有效优化、不陷入局部震荡——这正是长程持续优化能力与普通代码生成能力的分水岭。

05这意味着什么 从手写算子到 AI 生成、调优

⚙️

压缩人工介入的自动化闭环

Qwen3.8 登顶意味着模型有能力承担底层算力优化的复杂工程任务:直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环,人工介入算子开发的环节被进一步压缩。

🧠

胜负手变成「综合智能」

自动化 GPU 算子生成赛道的长期竞争,将取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。

🔁

三层协同演进或成常态

伴随模型能力升级,模型侧与编译层在算力优化上将形成持续双向反馈——硬件规格、算子实现、模型架构三者的协同演进,未来可能成为常态。

编辑核心判断

Kernel 是少数奖励无法作假的 AI 考场——在这里领先的模型,拿到的是闭环自我进化的入场券。

如何跟进

正式版尚未发布:千问团队 7 月 19 日宣布 Qwen3.8 将「很快发布并开源」,当前成绩来自预览版。开源后权重与代码预计经官方渠道放出,可先关注千问官方 GitHub 组织。

github.com/QwenLM → 关注正式版开源