浙大 IJCAI 论文砸碎 CLIP 微调惯性:图像塔越调越崩,自适应刹车登顶 11 榜
浙江大学陈静远教授团队与斯旺西大学联合研究发现,在 VLM 少样本微调中,图像编码器调得越激进,域外泛化能力崩得越惨。团队提出自适应非对称适配器(Adaptive Asymmetric Adapter),根据置信度自动给视觉塔「踩刹车」,在 11 个视觉数据集上全面超越 CoOp、MaPLe、MMRL 等主流方法,且单卡 A800 即可训练。
浙江大学陈静远教授团队与斯旺西大学联合研究发现,在 VLM 少样本微调中,图像编码器调得越激进,域外泛化能力崩得越惨。团队提出自适应非对称适配器(Adaptive Asymmetric Adapter),根据置信度自动给视觉塔「踩刹车」,在 11 个视觉数据集上全面超越 CoOp、MaPLe、MMRL 等主流方法,且单卡 A800 即可训练。
研究团队在 11 个主流视觉数据集上做了严谨的交叉实验:给 CLIP 的图像塔和文本塔分别挂载基础 Adapter,在不同任务场景下对比性能。结果总结出三条推翻传统范式的「微调铁律」——
微调文本编码器带来的性能提升,显著高于微调图像编码器。文本包含高度抽象的高层语义,能以极小参数代价快速对齐新类别。
在分布内任务中,同时微调图像塔和文本塔能达到最佳表现。图像塔微调有助于捕捉特定领域内的细粒度视觉特征。
在 OOD 任务中,激进地微调图像塔不仅没收益,反而会严重破坏 CLIP 原有的通用视觉表达——准确率断崖式下跌。
注:OOD(Out-of-Distribution)指测试数据与训练数据分布不一致的场景,如跨数据集迁移、域泛化等。实验表明,在 OOD 场景下仅微调文本分支即可维持较高水准。
实验数据很清晰:图像塔微调在未知数据面前就是毒药。那遇到未知场景时,把图像塔的 Adapter 手动关掉不就行了?
问题在于——线上实时流入的数据,从来不会自己贴着「我是已知样本」还是「我是未知样本」的标签。你不可能在服务器旁边蹲守,每来一张奇怪的图片就手动去按开关。
不关开关,模型被改近视;想关开关,又根本无法预判数据。这种「开也不是,关也不是」的进退两难,正是过往 VLM 微调范式一直难以越过的天堑。
这套机制的核心思路是:不再死板地对称更新双塔,而是引入预测置信度,自动在合适的时候给视觉塔「踩刹车」。具体拆解为两个层面——
输入特征先经过 Down Matrix(信息精炼官)降维压缩,过滤任务噪声;然后同时送给多个 Up Expert Matrix(专家),每个专家擅长恢复不同视角的特征;Dynamic Router(动态路由器)根据输入特征为各专家打分,加权汇总输出最终修改量。所有专家共享同一个精炼官,形成统一的信息瓶颈,避免多套降维矩阵互相扯皮。
图像和文本对齐后,模型算出分类概率分布,系统挑出最高概率值作为置信度得分。如果置信度低,说明模型对这张图片非常困惑——极有可能是域外数据。L_bias 机制随即激活:强行将图像塔各层 Adapter 的总修正量压向 0,相当于一脚刹车,让模型退回到 CLIP 预训练好的原始图像特征。
为防止路由器只偏爱 1 号专家导致「1 号累死,2 号闲死」,训练时加入约束:处理一批数据时,各专家的平均派活概率不能偏离均分线太远。确保所有专家都能分到任务,维持认知多样性。
注:L_bias 相当于一个「动态减震器」——高置信度时不干预,让模型精细拟合;低置信度时惩罚激活,强制修正量归零,退回预训练底座。
为了证明方法的通用性,测试覆盖了从通用 ImageNet 到细粒度汽车、飞机、宠物,再到遥感卫星图、纹理识别、动作识别等 11 个数据集,与当前行业最顶尖的 11 种 Benchmark 方法(包括 CoOp、CoCoOp、MaPLe、MMA、MMRL、MMRL++ 等)正面交锋——
这套自适应机制最核心的优势场景是算力受限、标注样本匮乏的少样本快速迁移。但如果面对海量目标域标注数据(几十上百万张精标注图像),强行压制视觉塔的修改量可能会限制模型上限——此时全量微调或更激进的视觉塔重构依然可能取得更好的绝对性能。
注:实验在单张 A800 GPU 上完成,训练和推理开销远低于复杂的 Prompt 寻优方法(如 MMRL)。该方法同时兼容 ViT 和 ResNet-50 架构,具备广泛的模态骨干兼容性。
这篇论文的精妙之处,不仅在于它拿下了 11 个数据集的霸榜成绩,更在于它用极具优雅的数学解法,为整个 VLM 的微调范式指出了两条残酷却深刻的真相——
第一,尊重 VLM 的「非对称性」。预训练视觉塔在海量数据中积淀出的通用表达极其珍贵。在少样本场景下,对视觉塔的激进修改往往是「破坏大于建设」。
第二,用不确定性实现「软调控」。真正的智能调控不需要繁琐的人工规则,把控制权交给数据自身的置信度。遇到熟悉的知识放开拟合,遇到未知的世界及时退回底座。
VLM 微调的最高境界,从来不是盲目堆叠参数去改造大模型,而是在保留预训练底座原有灵性的同时,学会适时放手——在熟悉的领地里精准发力,在未知的迷雾中优雅退避。
「Adaptive Asymmetric Adapter for Efficient VLM Fine-Tuning」
已被 IJCAI 2026 接收,相关代码与模型权重已开源。
浙江大学 · 斯旺西大学 联合研究