CVPR 2026 | MM-OVSeg: Multimodal Optical–SAR Fusion for Open-Vocabulary Segmentation in Remote Sense
基本信息
论文:MM-OVSeg: Multimodal Optical–SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing
作者:Yimin Wei1,2💐; Aoran Xiao2💐; Hongruixuan Chen1,2; Junshi Xia2; Naoto Yokoya1,2📮
单位:1 The University of Tokyo(东京大学);2 RIKEN AIP(理化学研究所 先进智能研究中心)
下载:https://arxiv.org/abs/2603.17528
代码:https://github.com/Jimmyxichen/MM-OVSeg
数据:https://huggingface.co/YiminJimmy/MM-OVSeg/tree/main
MM-OVSeg 开放词汇分割
这篇论文的核心出发点是针对现实遥感场景中云雾干扰导致光学信息丢失的痛点,通过融合具有全天候穿透力的 SAR 图像与光学图像,利用视觉语言大模型的强大泛化性,解决在恶劣天气下对未知类别地物(Open-Vocabulary)进行精准识别与分割的难题。
Q:什么是SAR图像?它有什么特点。
A:SAR(合成孔径雷达)是一种通过主动发射微波并接收回波成像的雷达系统。它具有全天候成像能力,能穿透云雾、黑夜和霾,捕捉地物的结构特征和物理属性。
02 !-OVSeg 技术与方法
跨模态统一过程(CMU)
该过程旨在打破模态壁垒,通过 25,087 对无标签的 RGB-SAR 图像对,利用 InfoNCE 对比损失函数进行无监督预训练。在该阶段,RGB DINO 编码器保持冻结,而 SAR DINO 编码器通过学习将雷达特征对齐到已有的视觉基础模型空间中,使模型能够像理解光学图像一样提取 SAR 的密集局部特征。
多模态密集特征聚合
在全模型训练阶段,DEF 模块首先从冻结的 RGB DINO 和预训练好的 SAR DINO 编码器中提取多尺度特征。这些特征经过特定层的卷积投影统一维度后,通过元素级加法进行融合,从而将光学图像的光谱语义与 SAR 图像的结构化回波信息有机整合,为后续的像素级分割提供丰富的空间线索。
全局与局部特征的文本对齐
为了实现开放词汇识别,模型利用 CLIP 视觉编码器提取全局语义,并与 CLIP 文本编码器生成的类别嵌入进行相似度计算。DEF 模块通过残差增强机制将全局视觉-文本相似度与密集的局部相似度进行拼接融合,这不仅保留了 CLIP 强大的语义泛化能力,还利用多模态特征提升了在复杂环境下(如云雾遮挡)的定位精度。
03 !-OVSeg 实验与结果
为了全方位验证 MM-OVSeg 的性能,论文通过下 Table 1 构建了涵盖清空、薄云、厚云及跨地域泛化等 6 种严苛的实验基准。Table 2 的定量结果显示,MM-OVSeg 在所有设定下均取得 SOTA 性能,其平均 mIoU 达到 51.7%,大幅领先于第二名 GSNet 的 45.6%。上图的定性可视化结果直观证明,在光学图像受云雾严重遮挡时,现有方法大多失效,而 MM-OVSeg 凭借对 SAR 结构信息的成功提取,依然能实现与GT高度一致的精准分割。
通过热力图直观展示了 DEF 模块在不同融合阶段的演进过程。可视化结果表明,CLIP 视觉编码器提取的全局特征 z_rgb 虽能捕捉语义,但定位较为粗糙且易受云雾干扰 ;而经过双编码器融合后的最终表示 h_fuse,不仅在空间定位上更加精细,还能使“已见过”和“从未见过”的类别(如水体、道路)与文本提示实现更精准的对齐。
表 3 和表 4 通过消融实验验证了模型各组件及损失函数的有效性。表 3 结果显示,引入 DEF 模块使 mIoU 提升了 9.1%,而结合 CMU 模块后性能进一步达到 73.1%,证明了多模态融合与跨模态对齐的互补性。表 4 则对比了不同的对齐损失函数,实验证明 InfoNCE 损失在促进 SAR 与 RGB 特征空间一致性方面表现最强,显著优于 MSE 和 L1 损失。
04 MM-OVSeg 创新与总结
首创全天候遥感开放词汇框架
针对遥感图像易受云雾干扰的痛点,首次提出融合光学与 SAR 数据的开放词汇分割(OVS)框架 MM-OVSeg 。利用 SAR 的穿透力弥补光学信息的缺失,解决了恶劣天气下对未知类别地物的识别难题 。
跨模态特征空间的精准对齐 (CMU)
通过跨模态统一过程(CMU),在 2.5 万对无标签 RGB-SAR 图像上进行对比学习预训练 。该模块成功将 SAR 的特征空间对齐到预训练视觉基础模型(如 DINO)中,打破了模态壁垒 。
全局语义与局部细节的高效融合 (DEF)
设计了双编码器融合模块(DEF),同时集成 CLIP 的全局语义泛化性与 DINO 的像素级局部细节 。通过多尺度特征融合与残差增强,显著提升了模型对“未见过”地物类别的分割精度。
本文提出了遥感领域首个融合光学与SAR数据的开放词汇分割框架MM-OVSeg,旨在解决云雾遮挡导致的光学信息缺失难题。通过跨模态统一(CMU)和双编码器融合(DEF)模块,该方法成功实现了雷达与光学特征的精准对齐及全局语义与局部细节的有机整合。多场景实验证明,MM-OVSeg在鲁棒性、泛化能力及分割精度上均显著优于现有的最先进模型。
