ICML 2026|美图提出BridgeRemoval,用VP-SDE随机桥解决视频目标移除穿帮问题
美图影像研究院(MT Lab)· ICML 2026 录用论文
核心论点:BridgeRemoval首次将视频目标移除重新定义为视频到视频的翻译任务,利用随机桥模型在背景保真度与生成灵活性之间取得最佳平衡,从而在移除目标的同时保持画面空间连贯与时序一致。
旧范式·扩散模型
高斯噪声 → 重建
参考帧辅助(复杂)
渐变·蓝→灰
新范式·随机桥
被遮挡视频 → 局部变换
天然结构锚点(简洁)
实线·绿→蓝
核心事件与问题背景
AI消除能力已从图片延伸到视频,但视频目标移除的难点在于:既要补全被移除目标的单帧内容,又要保证单帧内空间连贯性与帧间时序一致性,难度明显高于静态图片修复。
主流扩散模型方案与BridgeRemoval的随机桥方案在生成起点和结构约束上存在本质差异。
•
主流扩散模型:从无信息高斯噪声出发,逐步重建内容,丢弃源视频大量结构与场景先验,容易在大面积遮挡或复杂物理逻辑场景下消除不彻底或生成矛盾内容。
•
主流补充策略:引入参考帧引导机制来缓解上述问题,但显著增加系统复杂性,且仍依赖额外模块协调。
•
BridgeRemoval随机桥方案:将被遮挡源视频作为强前置约束,生成轨迹锚定在输入源视频结构上,只需对掩码区域做有选择性变换。
“首次将视频目标移除定义为视频到视频的翻译任务”
—— 美图影像研究院(MT Lab),ICML 2026录用论文 BridgeRemoval
BridgeRemoval技术方案解析
BridgeRemoval的架构核心是:源视频经冻结VAE编码器进入隐空间,基于VP-SDE Bridge构建从源视频先验到干净目标的直接插值轨迹,并将掩码隐变量与源视频隐变量拼接作为空间条件,连同文本嵌入一起输入DiT模型进行速度预测训练。
生成范式
VP-SDE随机桥而非标准扩散模型
从被遮挡源视频出发,而非从随机高斯噪声出发,训练目标为学习源到目标的速度场,而非去噪目标。
推理策略
基于SDE求解器的修正采样
从源视频隐变量出发,沿逆向SDE轨迹逐步逼近目标,通过解析推导保证生成轨迹严格服从桥约束,实现背景连贯、时序稳定且画面质量更优。
自适应掩码调制
动态调节对源视频结构的依赖程度
大面积遮挡区域适当放松结构约束,以生成合理的新区域;有效背景区域保持高度保真,避免过于忠实现有结构导致无法生成大面积新内容。
落地应用与行业影响
美图秀秀 / Wink
视频美型背景保护功能
解决瘦脸、瘦身等人像视频编辑时常出现的栏杆变弯、背景形变等问题。
开拍APP
智能全消功能
支持最长5分钟视频输入,能够自动识别并消除视频中的文字。
从技术论文到产品功能的快速落地,说明随机桥模型不仅具备学术价值,也具备处理真实用户场景中复杂视频编辑需求的实际可用性。
综合报道判断
BridgeRemoval是视频目标移除领域一次有明确问题意识的方法创新,用随机桥重新定义了任务边界,并在保真与生成之间找到了更优的平衡点。它不仅拿下了ICML 2026的学术背书,还已经进入美图系多款产品的实际功能中,属于少见的“论文发表即产品落地”案例。值得关注的是,这一技术路线是否会在更大范围视频编辑任务中取代参考帧引导的扩散方案,并成为视频生成编辑的新基础设施。
编辑观察:这篇报道的核心价值在于揭示了一个重要的技术转向:视频目标移除不再必须依赖“噪声到数据”的扩散生成范式,而是可以采用随机桥模型,将源视频本身作为生成过程的结构锚点。这一思路在理论上回答了扩散模型在视频编辑中“过度自由生成”与“参考帧复杂性”之间的两难问题,同时用产品落地证明了它的工程可行性。不过报道也应留意区分学术指标与真实体验之间的差距:PSNR和专家主观评分虽然领先,但仍需验证在更多真实场景、更长视频、更多遮挡类型下的稳定性。