🔬 模型 · 技术

浙大 IJCAI 论文砸碎 CLIP 微调惯性:图像塔越调越崩,自适应刹车登顶 11 榜

浙江大学陈静远教授团队与斯旺西大学联合研究发现,在 VLM 少样本微调中,图像编码器调得越激进,域外泛化能力崩得越惨。团队提出自适应非对称适配器(Adaptive Asymmetric Adapter),根据置信度自动给视觉塔「踩刹车」,在 11 个视觉数据集上全面超越 CoOp、MaPLe、MMRL 等主流方法,且单卡 A800 即可训练

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#VLM 微调 #CLIP #非对称适配器 #IJCAI 2026 #少样本学习
🏆 11 榜第一 全面超越 CoOp / MaPLe / MMRL 等主流方法
11 视觉数据集覆盖通用、细粒度、遥感、纹理、动作
1× A800 单卡训练,开销远低于 Prompt 寻优方法

⚡ 30 秒速览

  • 核心发现:图像塔微调越激进,OOD 泛化崩得越惨;文本塔微调收益反而更高——VLM 双塔存在严重的「非对称性」。
  • 三大洞察:① 文本分支改动收益更高;② 已知场景双管齐下;③ 未知场景图像微调是毒药。
  • 解决方案:自适应非对称适配器——用置信度自动判断是否给图像塔「踩刹车」,遇熟客精细拟合,遇生客退回原始底座。
  • 实验结果:在 11 个数据集上全面超越 11 种 Benchmark 方法,单卡 A800 训练,兼容 ViT 与 ResNet-50。
  • 工程意义:为少样本工业场景提供了天然的安全网——模型上线后遇到未知数据不会硬猜,自动退守预训练底座。

01三大洞察 推翻 CLIP 微调惯性思维

研究团队在 11 个主流视觉数据集上做了严谨的交叉实验:给 CLIP 的图像塔和文本塔分别挂载基础 Adapter,在不同任务场景下对比性能。结果总结出三条推翻传统范式的「微调铁律」——

洞察一

📈 文本分支收益更高

微调文本编码器带来的性能提升,显著高于微调图像编码器。文本包含高度抽象的高层语义,能以极小参数代价快速对齐新类别。

洞察二

🔄 已知场景双管齐下

在分布内任务中,同时微调图像塔和文本塔能达到最佳表现。图像塔微调有助于捕捉特定领域内的细粒度视觉特征。

洞察三

☠️ 未知场景图像微调是毒药

在 OOD 任务中,激进地微调图像塔不仅没收益,反而会严重破坏 CLIP 原有的通用视觉表达——准确率断崖式下跌。

注:OOD(Out-of-Distribution)指测试数据与训练数据分布不一致的场景,如跨数据集迁移、域泛化等。实验表明,在 OOD 场景下仅微调文本分支即可维持较高水准。

这三条洞察扎中了工程师的痛点——过去大家第一反应就是抓着图像塔猛调,结果模型在测试集上飞升,一上线遇到长尾图片就崩。

02「开也不是,关也不是」的死局

实验数据很清晰:图像塔微调在未知数据面前就是毒药。那遇到未知场景时,把图像塔的 Adapter 手动关掉不就行了?

问题在于——线上实时流入的数据,从来不会自己贴着「我是已知样本」还是「我是未知样本」的标签。你不可能在服务器旁边蹲守,每来一张奇怪的图片就手动去按开关。

不关开关,模型被改近视;想关开关,又根本无法预判数据。这种「开也不是,关也不是」的进退两难,正是过往 VLM 微调范式一直难以越过的天堑。

被逼到死胡同里,研究团队彻底抛弃了人工规则,把决定权交给了数据自己。

03自适应非对称适配器 让数据自己决定何时踩刹车

这套机制的核心思路是:不再死板地对称更新双塔,而是引入预测置信度,自动在合适的时候给视觉塔「踩刹车」。具体拆解为两个层面——

1

组件内部:1 个精炼官 + N 个专项专家

输入特征先经过 Down Matrix(信息精炼官)降维压缩,过滤任务噪声;然后同时送给多个 Up Expert Matrix(专家),每个专家擅长恢复不同视角的特征;Dynamic Router(动态路由器)根据输入特征为各专家打分,加权汇总输出最终修改量。所有专家共享同一个精炼官,形成统一的信息瓶颈,避免多套降维矩阵互相扯皮。

2

全局调控:置信度触发刹车

图像和文本对齐后,模型算出分类概率分布,系统挑出最高概率值作为置信度得分。如果置信度低,说明模型对这张图片非常困惑——极有可能是域外数据。L_bias 机制随即激活:强行将图像塔各层 Adapter 的总修正量压向 0,相当于一脚刹车,让模型退回到 CLIP 预训练好的原始图像特征。

3

防塌陷约束:专家公平轮岗

为防止路由器只偏爱 1 号专家导致「1 号累死,2 号闲死」,训练时加入约束:处理一批数据时,各专家的平均派活概率不能偏离均分线太远。确保所有专家都能分到任务,维持认知多样性

注:L_bias 相当于一个「动态减震器」——高置信度时不干预,让模型精细拟合;低置信度时惩罚激活,强制修正量归零,退回预训练底座。

简单说:遇到熟客放开拟合,遇到生客退回底座——把控制权交给数据自身的置信度。

04全面碾压:11 个数据集 + 11 种 Baseline

为了证明方法的通用性,测试覆盖了从通用 ImageNet 到细粒度汽车、飞机、宠物,再到遥感卫星图、纹理识别、动作识别等 11 个数据集,与当前行业最顶尖的 11 种 Benchmark 方法(包括 CoOp、CoCoOp、MaPLe、MMA、MMRL、MMRL++ 等)正面交锋——

📊 跨数据集评估 & 域泛化 全线领先

  • 跨数据集迁移:在从未见过的目标数据集上,自适应非对称适配器的性能曲线全程稳定压制所有主流 Baseline,平均领先第二名 3.2 个百分点
  • 域泛化:在光照变化、风格迁移等极端域外场景下,仅微调文本分支即可维持高水准,而激进微调图像塔的方法准确率暴跌 12-18%
  • 消融实验:去掉刹车机制(w.o. L_bias)后,模型在未知新类上的表现立刻出现显著下滑——证明「踩刹车」对保住泛化力至关重要。
验证结论:任何一个零件都不能少——去掉路由器、换成 LoRA、或给文本塔也装刹车,性能都有不同程度衰减。
一个诚实的注脚:任何技术都有其适用边界。

这套自适应机制最核心的优势场景是算力受限、标注样本匮乏的少样本快速迁移。但如果面对海量目标域标注数据(几十上百万张精标注图像),强行压制视觉塔的修改量可能会限制模型上限——此时全量微调或更激进的视觉塔重构依然可能取得更好的绝对性能。

注:实验在单张 A800 GPU 上完成,训练和推理开销远低于复杂的 Prompt 寻优方法(如 MMRL)。该方法同时兼容 ViT 和 ResNet-50 架构,具备广泛的模态骨干兼容性。

05为什么说这篇论文给行业泼了一盆冷水

这篇论文的精妙之处,不仅在于它拿下了 11 个数据集的霸榜成绩,更在于它用极具优雅的数学解法,为整个 VLM 的微调范式指出了两条残酷却深刻的真相——

第一,尊重 VLM 的「非对称性」。预训练视觉塔在海量数据中积淀出的通用表达极其珍贵。在少样本场景下,对视觉塔的激进修改往往是「破坏大于建设」。

第二,用不确定性实现「软调控」。真正的智能调控不需要繁琐的人工规则,把控制权交给数据自身的置信度。遇到熟悉的知识放开拟合,遇到未知的世界及时退回底座。

编辑核心判断

VLM 微调的最高境界,从来不是盲目堆叠参数去改造大模型,而是在保留预训练底座原有灵性的同时,学会适时放手——在熟悉的领地里精准发力,在未知的迷雾中优雅退避。

适用边界:少样本快速迁移场景是该方法的核心主场;海量标注数据场景下,全量微调或更激进的视觉塔重构仍可能取得更高绝对性能。

📄论文信息

「Adaptive Asymmetric Adapter for Efficient VLM Fine-Tuning」

已被 IJCAI 2026 接收,相关代码与模型权重已开源。

浙江大学 · 斯旺西大学 联合研究