🧠 技术突破 · 长视频理解

ViSAGE 登顶长视频理解榜单,自纠正记忆攻克"遗忘"难题

ViSAGE 框架以80.5% 准确率、18.6% 相对提升登顶 NExT-QA 长视频理解基准,超越所有此前方法。它用一套"自纠正记忆"机制,让模型在 15 分钟以上的长视频中精确追踪关键信息,终结了"看到后面忘前面"的顽疾。

来源:综合公开信息整理 2026-05-12 全文约 3 分钟读完
#ViSAGE #长视频理解 #自纠正记忆 #NExT-QA #EgoSchema
80.5% NExT-QA 准确率 · 公开榜首
+18.6% 相对提升,vs 此前最佳方法
3 个基准 NExT-QA / EgoSchema / MovieChat

⚡ 30 秒速览

  • 核心突破:ViSAGE 将长视频切分为"记忆单元",每个单元只保留关键信息,并设计"自纠正"机制——当新信息与旧记忆矛盾时,自动回溯修正,而非简单覆盖。
  • 拿的什么榜:NExT-QA(跨场景动作问答)、EgoSchema(第一人称长视频理解)、MovieChat(电影级对话)——三大高难度长视频基准,全部登顶。
  • 为什么难:长视频理解的关键不是"更大窗口",而是"记忆管理"。Token 窗口再大,也会在超过 15 分钟的视频中丢失早期关键细节。
  • 技术独特性:不是"更长的上下文窗口",也不是"更复杂的模型架构",而是用一套轻量级记忆管理模块,让现有模型能力翻倍。
  • 跟谁对比:超越 TimeChat、Video-LLaVA、LLaMA-VID 等此前主流方案,在 EgoSchema 上甚至超越 GPT-4o 的零样本结果。

01三项基准全部登顶 ViSAGE 凭什么

ViSAGE 在长视频理解的三项核心基准上均取得最优成绩。这个榜单考的不是"看过没有",而是"看完一部 15 分钟以上的视频后,能不能回答关于早期细节的问题"。

🥇 NExT-QA长视频动作问答
80.5
EgoSchema第一人称长视频
65.2
MovieChat电影级对话理解
48.7
TimeChat此前最佳方案
67.9
Video-LLaVA此前主流方案
62.3

注:柱形自 50 分起缩放,非零起点;分差以标注分数为准。ViSAGE 在 NExT-QA 的 80.5% 领先此前最佳方案 TimeChat 约 12.6 个百分点,相对提升 18.6%。

02长视频理解的真正战场:不是"窗口",是"记忆"

过去一年,主流思路是"把窗口做长"——从 4K 到 32K 甚至 128K tokens。但 ViSAGE 的研究者发现了一个残酷事实:窗口越长,早期信息在注意力计算中的权重越容易被稀释。 15 分钟的视频,前 3 分钟的关键细节在结尾处几乎不可恢复。

但 ViSAGE 给出了另一个答案。

传统方案:长窗口 + 全量编码

将所有帧全部编码进窗口,靠注意力机制自行筛选。问题是——早期帧的注意力权重会被后期帧淹没,导致"遗忘"成为必然。

ViSAGE:记忆单元 + 自纠正

将视频切分为"记忆单元",每个单元只保留最关键信息。当新信息与旧记忆矛盾时,触发回溯修正,保证记忆的一致性。

一个诚实的注脚:ViSAGE 并非"万能药"。它在极长视频(>60 分钟)上的表现尚未验证,且记忆单元的数量本身需要人工经验设定——但它的方向,可能比"堆窗口"更接近本质。

03四个维度拆解 ViSAGE 它做对了什么

记忆单元分段压缩关键语义
自纠正矛盾时回溯修正
可微分端到端训练
轻量级≈ 1 个额外 Transformer 层

ViSAGE 的核心模块是一个"记忆编码器",它接收视频帧的视觉特征和文本描述,输出一组紧凑的记忆向量。每次更新时,自动检测新旧信息的冲突,触发"修正"而非"覆盖"。

更具体地说:ViSAGE 的"记忆单元"不是简单的 token 聚合,而是语义级的关键信息提取。例如,看一段 20 分钟的烹饪视频,记忆单元会记住"第 3 分钟加入 200 克面粉,第 8 分钟烤箱预热 180°C"——这些细节在后续追问中可以被精确召回。

🔍 语义压缩 🔄 一致性检测 ⚡ 梯度回传 🧩 即插即用

04它到底能做什么?三个真实场景

🎬 电影级长视频问答:看懂《肖申克的救赎》全片MovieChat 最佳

  • 看完 142 分钟的电影后,回答"安迪在监狱中第一次见到瑞德时,他们之间发生了什么?"——关键细节出现在第 15 分钟,与结尾的呼应需要精确记忆。
  • ViSAGE 能精准定位早期场景,并理解其与后续情节的因果关系。
  • 传统方案在类似长视频中,早期细节的召回率下降超过 40%。
基于 LLM 的评审结论:早期细节保持率超过 90%,远优于此前方案。

🥽 第一人称视角:理解"我做了什么"EgoSchema 登顶

  • 佩戴 GoPro 拍摄 30 分钟的日常活动,之后提问:"在厨房里,你切完洋葱后做了什么?"
  • ViSAGE 能从长达 30 分钟的连续第一人称视频中,精确回溯到"切洋葱"动作后 2 分钟内的"洗手并打开冰箱"。
  • 在 EgoSchema 上,ViSAGE 甚至超越了 GPT-4o 的零样本结果。
核心统计:65.2% 准确率,超越此前最佳约 8 个百分点。

🎤 实时监控理解:从 15 分钟视频中定位异常事件NExT-QA 最佳

  • 给定一段 15 分钟的安全监控视频,提问:"在视频的第 8 分钟,画面左下方出现了什么异常?"
  • ViSAGE 不仅准确回答了异常事件,还能回溯其前因——"第 4 分钟时,有人将背包放在该位置"。
  • 这种跨时间段的因果推理,正是"自纠正记忆"的核心优势。
NExT-QA 评分:80.5% 准确率,全部维度均优于此前最佳。

05为什么 ViSAGE 做出来了?

答案藏在"记忆管理"这个被长期忽略的领域里。过去一年,多模态大模型的能力飞速迭代,但所有人都在卷"更大的训练数据"和"更长的上下文窗口"。ViSAGE 的研究者选择了一个更精巧的切入角度。

从架构逻辑看,ViSAGE 的"记忆单元"并非凭空创造——它借鉴了认知科学中"工作记忆"的更新机制:当新信息与已有记忆冲突时,不是简单覆盖,而是触发修正过程,保证记忆的一致性和完整性。

语义编码记忆检测一致性判定修正/更新

而且,ViSAGE 是一个"即插即用"模块——它可以适配几乎任何现有的多模态大模型,不需要重新训练整个模型。这意味着,随着 ViSAGE 的普及,现有模型的"长视频理解能力"可能立刻获得一次免费升级。

一个更底层的判断:ViSAGE 的成功说明,下一代能力的突破,可能来自"架构设计"而非"规模竞赛"——在模型能力已经很强的情况下,如何让现有能力被充分释放,才是更高效的路径。

编辑核心判断

ViSAGE 证明了一件事:长视频理解的天花板不在于模型"看到多少",而在于模型"记住多少"。当"记忆"成为一个可设计、可训练、可修正的模块,整个行业对"长上下文"的认知将被重新定义——不是窗口越大越好,而是记忆越智能越好。

论文与代码

ViSAGE 论文全文已在 arXiv 公开,代码仓库已开源,支持复现三项基准上的所有结果。

arXiv 论文 → 开放获取