MIDAS 通过互信息解耦与不确定性感知融合,为不完整多模态情感分析提供了首个兼具模态对齐、缺失适应与置信度建模的统一框架,将多模态 AI 在真实场景下的鲁棒性向前推进了一步。
在真实场景中,至少一个模态缺失的情况普遍存在,是制约多模态 AI 落地的主要障碍之一。
在真实世界的多模态情感分析中,文本、音频、视觉等模态经常因采集噪声、设备故障或隐私限制而出现缺失,传统模型在完整模态假设下训练,一旦输入不完整性能便急剧下降。
在短视频、会议录音、社交评论等真实应用中,至少一个模态缺失的情况普遍存在,是制约多模态 AI 落地的主要障碍之一。
MIDAS 以互信息解耦为核心,将每个模态的嵌入分解为模态不变部分与模态特有部分,在缺失情况下仍能保留跨模态共享的语义信息,从而避免因某个模态缺失导致的表征崩塌。
通过约束模态不变表示之间的互信息下界,使模型在训练时学会从任意可用模态中提取一致的语义核心。
每个模态的不确定性被动态估计,缺失模态对应的高不确定性会自动降低其融合权重,避免噪声主导最终预测。
多模态情感分析领域两个最主流的公开基准,覆盖音视频与文本的细粒度情感标注。
在随机缺失与模态定向缺失两种设置下,MIDAS 在全部缺失率上均优于现有方法。
在 MOSI 与 MOSEI 上的 Accuracy / F1 相对最强基线平均提升 4–6 个百分点,缺失率越高优势越明显。
MIDAS 的意义不止于刷新基准分数:它为多模态大模型在真实不完整数据环境下的部署提供了一种轻量、可插拔的鲁棒性增强方案。
通过显式解耦模态不变信息并对融合过程进行不确定性加权,MIDAS 能够在任意模态组合下保持稳定的情感判断能力。
凡是存在丢帧、断流、静音或画面遮挡的真实场景,MIDAS 都能提供比传统多模态模型更可靠的情感预测。
MIDAS 的价值在于它把多模态情感分析从"理想完整输入"的实验室假设推向"真实不完整输入"的工程实践,其不确定性感知融合机制具有较强的通用性,未来可迁移到多模态大模型的其他下游任务中。
这是一篇扎实且具有明确应用价值的 AI 研究工作,技术路线清晰,实验验证充分,在不完整多模态学习方向上具有标杆意义。