当适应带来伤害:MedSAM 微调中表征漂移与 OOD 失败的关联
本文系统考察医学图像分割基础模型 MedSAM 在多种适应策略下的泛化能力。研究对比全模型微调、仅编码器 LoRA、浅层与深层视觉提示调参(VPT)、仅解码器微调等六种方法,在 ISIC 2018 上训练,于干净与加噪提示下,在分布内(IN)、近分布外(PH2)、远分布外(BUSI、CBIS-DDSM)等基准上评估。核心发现是适应策略能提升 IN 与近 OOD 性能,却常降低远 OOD 表现。全微调取得最佳平衡,仅编码器 LoRA 在远 OOD 偏移下优于标准 LoRA 与 VPT。借助中心化核对齐(CKA)分析,作者指出远 OOD 退化与解码器表征漂移强相关,编码器相似度无法单独解释鲁棒性。
这篇论文直击医学图像分割基础模型落地过程中的一个核心矛盾:MedSAM 这类基于提示的模型在跨域、跨模场景下往往表现出惊人的零样本或少样本泛化能力,但其实际性能高度依赖提示词质量以及模型对自定义数据集的适应方式。作者没有停留在性能数字的表层比较,而是系统性地追问一个更深层的问题——当我们对 MedSAM 进行微调以适应新数据时,究竟哪些适应策略真正有效,哪些反而会损害模型在未知分布上的鲁棒性。研究提出了一个清晰的评估框架,将六种主流适应策略纳入统一对比,并首次将表征漂移与分布外失败之间建立因果层面的联系,揭示了适应行为本身可能带来的隐性代价。这一工作的价值在于,它把实践中常见的"微调后在陌生数据上反而变差"的经验现象,上升到了可解释、可量化的科学层面,为后续选择微调方案提供了理论依据。在技术方法上,作者精心设计了六种适应策略进行横向对比,涵盖了当前参数高效微调与提示学习的主流范式。具体包括全模型微调与仅编码器 LoRA,前者更新全部参数而后者只低秩适配编码器;浅层与深层视觉提示调参(VPT),通过在视觉 Transformer 的不同深度注入可学习提示;以及仅解码器微调与全微调。
所有模型均在国际皮肤图像协作挑战(ISIC 2018)数据集上进行训练,随后在干净提示与逐渐加噪提示的设定下,于分布内数据、近分布外 PH2(皮肤镜)以及远分布外 BUSI(乳腺超声)与 CBIS-DDSM(乳腺 X 光)等基准上展开评估。为了探究性能背后的表征机制,作者引入中心化核对齐(CKA)这一表征相似度度量工具,分别追踪编码器与解码器在适应前后的表征漂移轨迹。这一方法设计的巧妙之处在于,它将编码器的特征保持与解码器的路径适应区分开来,从而能够精确诊断是哪一部分的表征变化导致了鲁棒性的丧失。实验结果揭示了一组看似反直觉却极具实践指导意义的发现。作者表明,适应策略确实能提升分布内与近分布外数据的性能,但在面对远分布外数据时却常常导致性能下降,这种"顾此失彼"的现象正是本文标题"当适应带来伤害"的由来。在策略对比中,全微调在各项指标间取得了最佳平衡,而仅编码器 LoRA 则成为最强的参数高效替代方案,在远分布外偏移下显著优于标准 LoRA 与 VPT。
CKA 分析进一步给出了机制解释:远分布外退化与解码器表征的漂移高度相关,而编码器相似度的变化本身并不能解释模型的鲁棒性。由此作者推断,仅编码器 LoRA 之所以更鲁棒,是因为它在适应视觉特征分布偏移的同时,保留了解码器路径的稳定性。另一个值得关注的发现是,对提示施加 0 到 100 像素的随机抖动,反而能训练出更鲁棒、性能更好的模型,这一数据增强思路为提升提示鲁棒性提供了简单有效的途径。这项工作在开源社区与工业落地层面都具有深远意义。在理论层面,它首次明确将表征漂移与分布外失败联系起来,提醒研究者与工程师:微调并非总是有益的,适应策略的选择必须同时考虑提示噪声暴露、分布偏移与表征保持三个维度,而非一味追求在训练集上的性能提升。在实践层面,仅编码器 LoRA 作为参数高效方案在远分布外场景下的优越表现,为资源受限下的医学模型部署提供了高性价比的选择,尤其适合那些需要快速适配新科室、新设备却缺乏大规模标注数据的医疗场景。作者公开了全部代码,这将有力推动社区对医学基础模型适应机制的深入研究,也为后续设计更智能的自适应微调方法奠定了坚实的实验基础与理论参照。
Sources
FAQ
MedSAM 微调的六种适应策略是什么,研究如何评估它们?
研究对比了全模型微调、仅编码器 LoRA、浅层与深层视觉提示调参(VPT)、仅解码器微调等六种策略,在 ISIC 2018 上训练,于干净与加噪提示下,在分布内、近 OOD(PH2)与远 OOD(BUSI、CBIS-DDSM)基准上评估。
为什么适应策略反而会损害模型在未知数据上的鲁棒性?
研究发现适应能提升分布内与近 OOD 性能,却常降低远分布外表现。CKA 分析显示远 OOD 退化与解码器表征漂移强相关,说明微调并非总是有益,可能带来隐性代价。
实践中应选择哪种微调方案,还有哪些提升手段?
全微调在各项指标间取得最佳平衡;仅编码器 LoRA 作为参数高效方案,在远 OOD 偏移下优于标准 LoRA 与 VPT。对提示加 0–100 像素随机抖动也能训练出更鲁棒的模型。