ViSAGE 登顶长视频理解榜单,自纠正记忆攻克"遗忘"难题
ViSAGE 框架以80.5% 准确率、18.6% 相对提升登顶 NExT-QA 长视频理解基准,超越所有此前方法。它用一套"自纠正记忆"机制,让模型在 15 分钟以上的长视频中精确追踪关键信息,终结了"看到后面忘前面"的顽疾。
ViSAGE 框架以80.5% 准确率、18.6% 相对提升登顶 NExT-QA 长视频理解基准,超越所有此前方法。它用一套"自纠正记忆"机制,让模型在 15 分钟以上的长视频中精确追踪关键信息,终结了"看到后面忘前面"的顽疾。
ViSAGE 在长视频理解的三项核心基准上均取得最优成绩。这个榜单考的不是"看过没有",而是"看完一部 15 分钟以上的视频后,能不能回答关于早期细节的问题"。
注:柱形自 50 分起缩放,非零起点;分差以标注分数为准。ViSAGE 在 NExT-QA 的 80.5% 领先此前最佳方案 TimeChat 约 12.6 个百分点,相对提升 18.6%。
过去一年,主流思路是"把窗口做长"——从 4K 到 32K 甚至 128K tokens。但 ViSAGE 的研究者发现了一个残酷事实:窗口越长,早期信息在注意力计算中的权重越容易被稀释。 15 分钟的视频,前 3 分钟的关键细节在结尾处几乎不可恢复。
但 ViSAGE 给出了另一个答案。
将所有帧全部编码进窗口,靠注意力机制自行筛选。问题是——早期帧的注意力权重会被后期帧淹没,导致"遗忘"成为必然。
将视频切分为"记忆单元",每个单元只保留最关键信息。当新信息与旧记忆矛盾时,触发回溯修正,保证记忆的一致性。
一个诚实的注脚:ViSAGE 并非"万能药"。它在极长视频(>60 分钟)上的表现尚未验证,且记忆单元的数量本身需要人工经验设定——但它的方向,可能比"堆窗口"更接近本质。
ViSAGE 的核心模块是一个"记忆编码器",它接收视频帧的视觉特征和文本描述,输出一组紧凑的记忆向量。每次更新时,自动检测新旧信息的冲突,触发"修正"而非"覆盖"。
更具体地说:ViSAGE 的"记忆单元"不是简单的 token 聚合,而是语义级的关键信息提取。例如,看一段 20 分钟的烹饪视频,记忆单元会记住"第 3 分钟加入 200 克面粉,第 8 分钟烤箱预热 180°C"——这些细节在后续追问中可以被精确召回。
答案藏在"记忆管理"这个被长期忽略的领域里。过去一年,多模态大模型的能力飞速迭代,但所有人都在卷"更大的训练数据"和"更长的上下文窗口"。ViSAGE 的研究者选择了一个更精巧的切入角度。
从架构逻辑看,ViSAGE 的"记忆单元"并非凭空创造——它借鉴了认知科学中"工作记忆"的更新机制:当新信息与已有记忆冲突时,不是简单覆盖,而是触发修正过程,保证记忆的一致性和完整性。
而且,ViSAGE 是一个"即插即用"模块——它可以适配几乎任何现有的多模态大模型,不需要重新训练整个模型。这意味着,随着 ViSAGE 的普及,现有模型的"长视频理解能力"可能立刻获得一次免费升级。
一个更底层的判断:ViSAGE 的成功说明,下一代能力的突破,可能来自"架构设计"而非"规模竞赛"——在模型能力已经很强的情况下,如何让现有能力被充分释放,才是更高效的路径。
ViSAGE 证明了一件事:长视频理解的天花板不在于模型"看到多少",而在于模型"记住多少"。当"记忆"成为一个可设计、可训练、可修正的模块,整个行业对"长上下文"的认知将被重新定义——不是窗口越大越好,而是记忆越智能越好。
ViSAGE 论文全文已在 arXiv 公开,代码仓库已开源,支持复现三项基准上的所有结果。
arXiv 论文 → 开放获取