🧭 技术大会 · 议题前瞻

多模态推理的算力瓶颈,正被「算法—系统协同设计」撕开缺口

8 月 21-22 日,AICon 全球人工智能开发与应用大会将在深圳举办。浙江大学百人计划研究员庄博涵将发表主题演讲《面向多模态推理的高效长上下文建模》——目标只有一个:把多模态推理最贵的账,一笔一笔降下来

来源:公开报道 2026-08 全文约 4 分钟读完
#AICon #多模态推理 #长上下文 #KV-Cache #效率工程
7.09× 注意力算子最高加速 · H20 / Wan2.1-14B / 720p
10.7× KV-cache 显存压缩 · AIME25 32K 生成
55× 三维缓存显存占用降低 · Mirage

阅读提示:三组数字分属注意力、记忆、缓存三条技术路线。它们各自在什么场景下测得、代价是什么,正文将逐一还原。

⚡ 30 秒速览

  • 大会信号:AI 竞争正从「模型能力比拼」转向「系统构建」,效率成为规模化落地的核心瓶颈。
  • 演讲主线:高效注意力(稀疏/线性)、高效记忆(KV-cache 压缩)、高效解码(并行解码)——一条链路的三个节点。
  • 世界模型战绩:Wan2.1-14B 生成 720p 视频,注意力算子最高加速 7.09×,端到端加速 4.96×
  • Agent 战绩:AIME25 长推理下 2.5× 吞吐提升或 10.7× 显存压缩;带 router 的编码任务得分高于 Opus、成本不到一半。
  • 诚实的注脚:效率手段伴随可控但非零的质量损失,最优配置随任务漂移,没有一套配置通吃所有场景。
  • 大会信息:8 月 21-22 日 · 深圳 · 10 大专题 + 1 个动手实验室 · 近 60 场议题。

01发生了什么 一场把「效率」推上台前的大会

大模型能力仍在演进,但产业的目光已经转向更远处:如何构建可靠的智能体、完善 AI 工程体系,让 AI 在复杂业务环境中稳定运行。AICon 深圳站讨论的主线,正是这条从能力突破走向系统构建的新路径。

而在这条路径上,「效率」是第一道绕不开的关卡

8.21–22深圳 · 大会时间
10专题论坛 + 动手实验室
60场重磅议题
50+产业一线技术专家
Agent 工程化大模型基础设施AI Native 研发具身智能Agent 安全推理工程与异构计算超级个体与蜂群智能

日程已 100% 上线。演讲阵容覆盖高校研究者与阿里、腾讯、华为、快手、Google Cloud 等团队的一线专家。

02演讲主线 一条「算法—系统协同」的效率链路

庄博涵的分享从一个朴素但昂贵的问题出发:多模态大模型正从「被动感知」走向「主动执行」,上下文不断变长、生成成本不断上升——效率成了规模化落地的核心瓶颈。

他的应对不是单点优化,而是三个层级的递进拆解。

第一层 · 注意力

高效注意力

用稀疏 / 线性注意力,化解注意力随序列长度二次增长的瓶颈,支撑长上下文理解与长视频生成。

第二层 · 记忆

高效记忆

通过 KV-cache 压缩与缓存管理,突破长序列推理的显存瓶颈——这是长上下文最贵的隐性成本。

第三层 · 解码

高效解码

用并行解码策略提升推理吞吐、降低生成时延,让生成速度真正跑上去。

阅读提示:注意力决定能「看」多长,记忆决定能「装」多少,解码决定能「跑」多快。任何一层掉队,整体吞吐都会被拖住——这就是协同设计的含义。

三个节点串起来,再往上,是多模态智能体的核心能力层:

🧠 理解有限算力下高效理解长视频,支撑空间推理与决策
🎨 生成以更低成本实现世界模型生成,覆盖 3D 重建与长视频
📏 评测用可诊断的基准牵引世界模型持续演进

能力层的顺序也有讲究:先看得懂,再生成得出,最后还要可衡量。效率技术在各层的作用点并不相同。

03实践验效 两场硬仗,已有数据跑出来

效率主张经不经得起验证?两组已公开的实测结果,比任何 PPT 都有说服力。

🎮 World Model 推理提速端到端最高 10×

  • FPSAttention 针对视频 DiT 的三维注意力做系统级改造:NVIDIA H20 上运行 Wan2.1-14B、生成 720p 视频时,注意力算子最高加速 7.09×,端到端视频生成加速 4.96×,生成质量基本无损。
  • FlashBlock 在 Block Diffusion 范式下探索新缓存机制:长文本与视频生成实验中,token 吞吐最高提升 1.44×,注意力耗时降低 1.6×,几乎不影响生成质量。
  • Mirage 把视频模型的空间记忆保存在潜空间:三维缓存显存占用降低最高 55×,端到端最高 10× 加速,并在 WorldScore 评测上取得最佳结果。
这些系统与算法成果正在被整合进统一框架 Inferix——面向 World Model 的 Block Diffusion 推理引擎,支持 KV-cache 管理、流式视频生成与交互式 world rollout。

🤖 Agent loop 里的隐性算力税成本低于 Opus 一半

  • 痛点很现实:在 Claude Code、Codex、OpenClaw 等主流 Agent 框架中,上下文越积越长,首轮 prefill 时间与 KV-cache 显存占用不断上升。
  • TriAttention 面向长推理做 KV-cache 压缩:AIME25 的 32K token 生成实验中,保持与完整注意力相当准确率的同时,实现 2.5× 吞吐提升或 10.7× 显存压缩。
  • R-Stitch 用熵来切换大小模型协同推理:不同尺寸模型上实现 3-4× 加速,同时保持接近完整大模型解码的准确率。
  • Agent-as-a-Router 把模型选择本身设计成 Agent Loop:在 2900 个编码任务上,带 router 的框架平均得分高于 Opus,成本不到一半。
长上下文是 Agent 规模化落地的隐性税——每一轮对话,都在为历史上下文付费。压缩与路由,是两套不同的省法。

以上数据均来自作者团队在特定硬件与基准上的公开结果;换一个任务、换一种模态,收益边界会移动。加速数字很美,但读法要带上下文。

04为什么可信 ZIP Lab 的「极致 Token 性价比」

为什么是他来讲这个题目?看研究底色就够了。

庄博涵

浙江大学百人计划研究员、博导 · 国家级高层次青年人才计划入选者

  • 曾任 Monash University 长聘助理教授并创立 ZIP Lab,与多家全球头部科技企业保持深度科研合作。
  • 研究主线是高效大模型算法与系统协同优化,目标写得很直白:极致 Token 性价比
  • 实验室首批 7 名博士毕业生全部进入顶尖企业或高校,其中包括 DeepSeek、ByteDance Seed;本科毕业生多赴世界一流高校攻读 PhD。
  • 研究版图延伸至 Agent Loops、World Models 与 Embodied AI——效率是贯穿这些方向的地基。

一个值得注意的细节:毕业生去向名单里出现 DeepSeek、ByteDance Seed 这类把推理效率写进产品基因的团队。这本身,就是效率工程方向产业价值的注脚。

05诚实的注脚 效率与质量的天平

所有加速手段都有标价。稀疏 / 线性注意力、KV-cache 压缩可以显著降本提速,但代价是可控但非零的质量损失

「最优适配区间会随任务、模态、序列长度发生漂移——没有一套配置能适配所有场景。每一次接入,都意味着大量的调参与验证。」

这也是效率工程最真实的另一面:加速与质量之间没有免费午餐。算法—系统协同设计能走多远,取决于团队愿不愿意把这笔账算清楚、算诚实。

编辑核心判断

模型参数的竞赛正在触顶,效率工程的竞赛才刚刚开始。同样的底座模型,配上不同的系统设计,推理成本与落地速度会拉开数量级差距——而能诚实标注每一倍加速背后的质量代价,才是效率工程走向成熟的第一步。

大会信息

全日程已 100% 上线。10 大专题 + 1 个动手实验室、近 60 场议题,关注 Agent 工程化与可靠智能体的构建路径。

8 月 21–22 日 · 深圳

票务咨询:132 6907 8023 · 现场席位以官方确认为准