🏆 技术突破 · IJCAI 2026

华为 IJCAI 2026 论文揭示 AI 效率拐点:从「拼参数」到「拼设计」

四篇论文被 AI 顶会 IJCAI 2026 收录,覆盖视觉基础模型、视频理解、跨任务适配、语音翻译四大方向。没有一篇在堆算力——每一篇都在回答同一个问题:如何用更少的资源,换更高的智能产出。

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#华为 #IJCAI2026 #视觉基础模型 #AI效率 #层次化ViT #MoE
4 篇 IJCAI 2026 收录 · 四个方向
30B 层次化 ViT 最大参数量
89.0% ImageNet-1K 准确率(67亿激活)
79% 跨任务适配显存节省

⚡ 30 秒速览

  • 突破在哪:层次化 ViT 参数量从 2B 推至 30B,67 亿激活参数在 ImageNet 上超越 180 亿参数的普通 ViT。
  • 效率革命:LFS 可学习帧选择器让模型自己学会"该看什么",所有测试基准全线提升。
  • 成本骤降:RaMod 框架将跨任务适配的显存占用降低 79%,预填时间减少 83%。
  • 数据稀缺解法:语码转换语音翻译用 MoE 分工 + 渐进式训练,在数据最匮乏的赛道上超越 SeamlessM4T。
  • 深层信号:四篇论文来自四个不同团队——效率优先已不是个别偏好,而是华为的技术路线选择。

01趋势总览 从「规模密度」到「设计密度」

AI 算力成本居高不下,参数规模扩张带来的边际收益早已追不上边际成本。这个经济学现实正在重塑技术创新的底层逻辑——从"能不能做得更大"转向"能不能用得更省"

华为被 IJCAI 2026 收录的四篇论文,恰好从四个方向提供了技术路径参考:

旧范式:规模密度

堆参数、堆算力、堆数据。模型越大越好,训练成本被视为必要投入。

新范式:设计密度

更精巧的架构 + 更聪明的训练策略,用更少的资源换取更高的智能产出。

这不是某一篇论文的孤立选择,而是贯穿四篇论文的共同底色。它们分别来自基础研究、AI 数据、云服务和翻译服务中心——效率优先的逻辑已经写进了华为各个环节的技术决策里

注:四篇论文分别对应视觉基础模型、视频帧选择、跨任务泛化、语码转换语音翻译,以下逐一拆解。

02视觉基础模型 层次化 ViT 从 2B 到 30B 的跨越

普通 ViT 的规模化一路高歌猛进,从 6B 到 22B 不断刷新上限。但层次化 ViT 始终卡在 2B 参数以下——不是不想做大,是简单套用普通 ViT 的规模化方案行不通。

华为团队的工作把这一上限直接推到了 30B。核心在于两点:

结构上,设计了 Efficient Hierarchical ViT 架构,在保证多尺度特征提取能力的同时兼顾计算效率。训练上,采用两阶段流程——先在 ImageNet-21K 上做 MAE 自监督预训练,再从多个最先进的通用基础模型中蒸馏知识。

🥇 EHV-5B-MoE(华为)层次化 ViT · 67亿激活参数
89.0
EVA-CLIP-18B普通 ViT · 180亿参数
88.2

注:柱形自 85 分起缩放,非零起点;以标注分数为准。EHV-5B-MoE 总参数 30B,推理时仅激活 67 亿参数,准确率 89.0%,超越总参数更大的 EVA-CLIP-18B。

更关键的是,性能提升不局限于图像分类——视频分析和密集预测任务上同样表现优异。这说明 EHV 学到的不只是分类特征,而是真正高质量、可泛化的视觉表征

03视频帧选择 让模型自己学会「该看什么」

视频-大语言模型处理视频时,计算成本主要消耗在帧编码上。现有模型几乎都采用均匀采样——等间隔抽帧。但视频里的关键事件从来不会均匀分布。

一个重要的动作可能只持续一两秒,如果恰好落在两个采样点之间,就被彻底漏掉了。冗长的静态画面却被反复编码,浪费计算资源。

华为 AI 数据团队提出的 LFS(Learnable Frame Selector),想法很直接:与其靠人工规则选帧,不如让模型自己学会"该看什么"。

🎯 LFS 可学习帧选择器 即插即用

  • 评分网络:给每一帧打一个"事件重要性"分数。
  • 分段选帧:把视频切成多个时间段,在每个时间段里分别挑最重要的帧,保证时间轴分布均匀。
  • 以终为始:选好帧后喂给冻结的 Video-LLM 生成描述,与人工标注对比,反向传播更新帧选择器——大模型本身不动。
  • 自建基准:发现现有基准与人类认知有差距,自建 ICH-CC 基准,视频全部来源于中国非遗烹饪真实商业场景。
所有模型的 LFS 增强版,在所有测试基准上都高于基线模型,通用性得到验证

与其让模型在均匀采样的帧上"硬算",不如在输入端做一次智能筛选——选对了帧,下游任务的表现也随之提升。

04跨任务适配 显存降低 79%,预填时间减少 83%

大语言模型的跨任务泛化一直是个"说起来重要、做起来难"的问题。现有主流方案是 per-token 动态路由,计算量和显存占用都居高不下。

华为云团队与多所高校合作提出的 RaMod(Representation-Aware Modularity) 框架,把思路从"改模型"变成了"调表征":

-83%额外预填时间
-100%生成延迟降低
-79%显存占用减少
跨任务泛化效果提升

注:对比基线为原始 LLMs 全量微调方案。数据来自论文公开实验。

RaMod 的核心做法分两部分:双模块表征与参数微调——从中间层的隐藏表征里挑出策略筛选过的子集做模块化干预;异步调度器——需要哪些干预就分配显存,用完了就主动释放。

这种思路如果成立,大模型部署的经济学可能会被改写:一个底座模型配上若干轻量级干预模块,就能低成本地服务于截然不同的任务场景,而不必为每个场景单独训练或加载完整副本。

不过在"改写"之前,表征微调方法在复杂推理等高难度场景中,是否依然能在大幅节省算力成本的同时守住准确性,还需要进一步验证。

05语码转换语音翻译 在数据最匮乏的赛道,用架构弥补数据

前三篇解决"怎么更高效地用模型"。但很多任务还有一个更根本的现实挑战:如果连训练数据都不够呢?

语码转换(Code-Switching)语音翻译任务,需要将夹杂多种语言的语音翻译成目标语言。CS 数据的稀缺性,是一个大问题。

华为翻译服务中心团队与厦门大学、澳门大学合作的方案,思路很清晰:与其让模型自己摸索不同语言的语义表征,不如主动把它们对齐好——为每种语言单独建一个"专家团队"。

🌐 MoE 语音投影器 + 多阶段训练 超越 SeamlessM4T

  • MoE 语音投影器:给每种语言分配一组专门的"专家",路由机制自动把语音特征送到对应语言的专家组。
  • 两个辅助损失:语言特定损失确保每个专家真正学会对应语言特征;组内负载均衡损失防止 token 都挤到同一个专家。
  • 四步渐进式训练:ASR 预训练 → MoE 组装 → 单语 ST 过渡 → CS 适配。不是直接硬啃稀缺的 CS 数据,而是先用充足数据打牢基础。
在 Fisher 和 NTUML2021 四个测试集上,均超越 Whisper、SeamlessM4T、LLaST 等强基线,BLEU 最高 39.52,COMET 最高 81.33

需要注意的是,这项工作在语言数量有限、数据质量可控的场景下是有效的"尖刀方案",但在需要覆盖数十种语言的通用多语种翻译系统中,可扩展性还需进一步论证。

06为什么是华为做出来了?

四篇论文,四个方向,来自四个不同的团队——基础研究、AI 数据、云服务、翻译服务中心。这说明效率优先不是某个团队的偏好,而是被写进了整个公司的技术选择里

从架构逻辑看,这些工作的共同特征是:

识别瓶颈架构重构训练策略创新验证可泛化

30B 层次化 ViT 重构了模型骨架;LFS 在输入端做减法;RaMod 把全量微调压缩成表征层的定点编辑;语码转换翻译用 MoE 分工和渐进式训练弥补数据匮乏。

稀疏激活、智能筛选、模块化适配、渐进式训练——这些路径不依赖更多的芯片和算力,而依赖对问题本身更深刻的理解。

#稀疏激活 #智能筛选 #模块化适配 #渐进式训练 #表征微调 #MoE架构
编辑核心判断

AI 竞赛正在从"拼矿"转向"拼冶炼技术"。过去两年比的是谁有更多的芯片和参数,而 2026 年的信号已经很清晰:对现实落地问题的理解,以及系统化解决这些问题的工程能力,才是真正的决胜点。

关注 IJCAI 2026

IJCAI-ECAI 2026 将于 2026 年 8 月 15 日至 21 日在德国不来梅举行。四篇论文的完整细节可在会议 proceedings 中查阅。

ijcai-ecai-2026.org → 会议官网