🧭 技术大会 · 议题前瞻
多模态推理的算力瓶颈,正被「算法—系统协同设计」撕开缺口
8 月 21-22 日,AICon 全球人工智能开发与应用大会将在深圳举办。浙江大学百人计划研究员庄博涵将发表主题演讲《面向多模态推理的高效长上下文建模》——目标只有一个:把多模态推理最贵的账,一笔一笔降下来。
来源:公开报道•
2026-08•
全文约 4 分钟读完
#AICon
#多模态推理
#长上下文
#KV-Cache
#效率工程
7.09×
注意力算子最高加速 · H20 / Wan2.1-14B / 720p
10.7×
KV-cache 显存压缩 · AIME25 32K 生成
55×
三维缓存显存占用降低 · Mirage
阅读提示:三组数字分属注意力、记忆、缓存三条技术路线。它们各自在什么场景下测得、代价是什么,正文将逐一还原。
⚡ 30 秒速览
- 大会信号:AI 竞争正从「模型能力比拼」转向「系统构建」,效率成为规模化落地的核心瓶颈。
- 演讲主线:高效注意力(稀疏/线性)、高效记忆(KV-cache 压缩)、高效解码(并行解码)——一条链路的三个节点。
- 世界模型战绩:Wan2.1-14B 生成 720p 视频,注意力算子最高加速 7.09×,端到端加速 4.96×。
- Agent 战绩:AIME25 长推理下 2.5× 吞吐提升或 10.7× 显存压缩;带 router 的编码任务得分高于 Opus、成本不到一半。
- 诚实的注脚:效率手段伴随可控但非零的质量损失,最优配置随任务漂移,没有一套配置通吃所有场景。
- 大会信息:8 月 21-22 日 · 深圳 · 10 大专题 + 1 个动手实验室 · 近 60 场议题。
01发生了什么 一场把「效率」推上台前的大会
大模型能力仍在演进,但产业的目光已经转向更远处:如何构建可靠的智能体、完善 AI 工程体系,让 AI 在复杂业务环境中稳定运行。AICon 深圳站讨论的主线,正是这条从能力突破走向系统构建的新路径。
而在这条路径上,「效率」是第一道绕不开的关卡。
8.21–22深圳 · 大会时间
10专题论坛 + 动手实验室
60场重磅议题
50+产业一线技术专家
Agent 工程化大模型基础设施AI Native 研发具身智能Agent 安全推理工程与异构计算超级个体与蜂群智能
日程已 100% 上线。演讲阵容覆盖高校研究者与阿里、腾讯、华为、快手、Google Cloud 等团队的一线专家。
02演讲主线 一条「算法—系统协同」的效率链路
庄博涵的分享从一个朴素但昂贵的问题出发:多模态大模型正从「被动感知」走向「主动执行」,上下文不断变长、生成成本不断上升——效率成了规模化落地的核心瓶颈。
他的应对不是单点优化,而是三个层级的递进拆解。
第一层 · 注意力
高效注意力
用稀疏 / 线性注意力,化解注意力随序列长度二次增长的瓶颈,支撑长上下文理解与长视频生成。
第二层 · 记忆
高效记忆
通过 KV-cache 压缩与缓存管理,突破长序列推理的显存瓶颈——这是长上下文最贵的隐性成本。
第三层 · 解码
高效解码
用并行解码策略提升推理吞吐、降低生成时延,让生成速度真正跑上去。
阅读提示:注意力决定能「看」多长,记忆决定能「装」多少,解码决定能「跑」多快。任何一层掉队,整体吞吐都会被拖住——这就是协同设计的含义。
三个节点串起来,再往上,是多模态智能体的核心能力层:
🧠 理解有限算力下高效理解长视频,支撑空间推理与决策
🎨 生成以更低成本实现世界模型生成,覆盖 3D 重建与长视频
📏 评测用可诊断的基准牵引世界模型持续演进
能力层的顺序也有讲究:先看得懂,再生成得出,最后还要可衡量。效率技术在各层的作用点并不相同。
03实践验效 两场硬仗,已有数据跑出来
效率主张经不经得起验证?两组已公开的实测结果,比任何 PPT 都有说服力。
🎮 World Model 推理提速端到端最高 10×
- FPSAttention 针对视频 DiT 的三维注意力做系统级改造:NVIDIA H20 上运行 Wan2.1-14B、生成 720p 视频时,注意力算子最高加速 7.09×,端到端视频生成加速 4.96×,生成质量基本无损。
- FlashBlock 在 Block Diffusion 范式下探索新缓存机制:长文本与视频生成实验中,token 吞吐最高提升 1.44×,注意力耗时降低 1.6×,几乎不影响生成质量。
- Mirage 把视频模型的空间记忆保存在潜空间:三维缓存显存占用降低最高 55×,端到端最高 10× 加速,并在 WorldScore 评测上取得最佳结果。
这些系统与算法成果正在被整合进统一框架 Inferix——面向 World Model 的 Block Diffusion 推理引擎,支持 KV-cache 管理、流式视频生成与交互式 world rollout。
🤖 Agent loop 里的隐性算力税成本低于 Opus 一半
- 痛点很现实:在 Claude Code、Codex、OpenClaw 等主流 Agent 框架中,上下文越积越长,首轮 prefill 时间与 KV-cache 显存占用不断上升。
- TriAttention 面向长推理做 KV-cache 压缩:AIME25 的 32K token 生成实验中,保持与完整注意力相当准确率的同时,实现 2.5× 吞吐提升或 10.7× 显存压缩。
- R-Stitch 用熵来切换大小模型协同推理:不同尺寸模型上实现 3-4× 加速,同时保持接近完整大模型解码的准确率。
- Agent-as-a-Router 把模型选择本身设计成 Agent Loop:在 2900 个编码任务上,带 router 的框架平均得分高于 Opus,成本不到一半。
长上下文是 Agent 规模化落地的隐性税——每一轮对话,都在为历史上下文付费。压缩与路由,是两套不同的省法。
以上数据均来自作者团队在特定硬件与基准上的公开结果;换一个任务、换一种模态,收益边界会移动。加速数字很美,但读法要带上下文。
04为什么可信 ZIP Lab 的「极致 Token 性价比」
为什么是他来讲这个题目?看研究底色就够了。
庄
庄博涵
浙江大学百人计划研究员、博导 · 国家级高层次青年人才计划入选者
- 曾任 Monash University 长聘助理教授并创立 ZIP Lab,与多家全球头部科技企业保持深度科研合作。
- 研究主线是高效大模型算法与系统协同优化,目标写得很直白:极致 Token 性价比。
- 实验室首批 7 名博士毕业生全部进入顶尖企业或高校,其中包括 DeepSeek、ByteDance Seed;本科毕业生多赴世界一流高校攻读 PhD。
- 研究版图延伸至 Agent Loops、World Models 与 Embodied AI——效率是贯穿这些方向的地基。
一个值得注意的细节:毕业生去向名单里出现 DeepSeek、ByteDance Seed 这类把推理效率写进产品基因的团队。这本身,就是效率工程方向产业价值的注脚。
05诚实的注脚 效率与质量的天平
所有加速手段都有标价。稀疏 / 线性注意力、KV-cache 压缩可以显著降本提速,但代价是可控但非零的质量损失。
「最优适配区间会随任务、模态、序列长度发生漂移——没有一套配置能适配所有场景。每一次接入,都意味着大量的调参与验证。」
这也是效率工程最真实的另一面:加速与质量之间没有免费午餐。算法—系统协同设计能走多远,取决于团队愿不愿意把这笔账算清楚、算诚实。
编辑核心判断
模型参数的竞赛正在触顶,效率工程的竞赛才刚刚开始。同样的底座模型,配上不同的系统设计,推理成本与落地速度会拉开数量级差距——而能诚实标注每一倍加速背后的质量代价,才是效率工程走向成熟的第一步。
▶大会信息
全日程已 100% 上线。10 大专题 + 1 个动手实验室、近 60 场议题,关注 Agent 工程化与可靠智能体的构建路径。
8 月 21–22 日 · 深圳
票务咨询:132 6907 8023 · 现场席位以官方确认为准