当前位置: 首页 > news >正文

CVPR 2026 | MM-OVSeg: Multimodal Optical–SAR Fusion for Open-Vocabulary Segmentation in Remote Sense

基本信息

论文:MM-OVSeg: Multimodal Optical–SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing

作者:Yimin Wei1,2💐; Aoran Xiao2💐; Hongruixuan Chen1,2; Junshi Xia2; Naoto Yokoya1,2📮

单位:1 The University of Tokyo(东京大学);2 RIKEN AIP(理化学研究所 先进智能研究中心)

下载:https://arxiv.org/abs/2603.17528

代码:https://github.com/Jimmyxichen/MM-OVSeg

数据:https://huggingface.co/YiminJimmy/MM-OVSeg/tree/main


MM-OVSeg 开放词汇分割

这篇论文的核心出发点是针对现实遥感场景中云雾干扰导致光学信息丢失的痛点,通过融合具有全天候穿透力的 SAR 图像与光学图像,利用视觉语言大模型的强大泛化性,解决在恶劣天气下对未知类别地物(Open-Vocabulary)进行精准识别与分割的难题。


Q:什么是SAR图像?它有什么特点。

A:SAR(合成孔径雷达)是一种通过主动发射微波并接收回波成像的雷达系统。它具有全天候成像能力,能穿透云雾、黑夜和霾,捕捉地物的结构特征和物理属性。


02 !-OVSeg 技术与方法

  1. 跨模态统一过程(CMU)

    该过程旨在打破模态壁垒,通过 25,087 对无标签的 RGB-SAR 图像对,利用 InfoNCE 对比损失函数进行无监督预训练。在该阶段,RGB DINO 编码器保持冻结,而 SAR DINO 编码器通过学习将雷达特征对齐到已有的视觉基础模型空间中,使模型能够像理解光学图像一样提取 SAR 的密集局部特征。

  2. 多模态密集特征聚合

    在全模型训练阶段,DEF 模块首先从冻结的 RGB DINO 和预训练好的 SAR DINO 编码器中提取多尺度特征。这些特征经过特定层的卷积投影统一维度后,通过元素级加法进行融合,从而将光学图像的光谱语义与 SAR 图像的结构化回波信息有机整合,为后续的像素级分割提供丰富的空间线索。

  3. 全局与局部特征的文本对齐

    为了实现开放词汇识别,模型利用 CLIP 视觉编码器提取全局语义,并与 CLIP 文本编码器生成的类别嵌入进行相似度计算。DEF 模块通过残差增强机制将全局视觉-文本相似度与密集的局部相似度进行拼接融合,这不仅保留了 CLIP 强大的语义泛化能力,还利用多模态特征提升了在复杂环境下(如云雾遮挡)的定位精度。


03 !-OVSeg 实验与结果

为了全方位验证 MM-OVSeg 的性能,论文通过下 Table 1 构建了涵盖清空、薄云、厚云及跨地域泛化等 6 种严苛的实验基准。Table 2 的定量结果显示,MM-OVSeg 在所有设定下均取得 SOTA 性能,其平均 mIoU 达到 51.7%,大幅领先于第二名 GSNet 的 45.6%。上图的定性可视化结果直观证明,在光学图像受云雾严重遮挡时,现有方法大多失效,而 MM-OVSeg 凭借对 SAR 结构信息的成功提取,依然能实现与GT高度一致的精准分割。

通过热力图直观展示了 DEF 模块在不同融合阶段的演进过程。可视化结果表明,CLIP 视觉编码器提取的全局特征 z_rgb 虽能捕捉语义,但定位较为粗糙且易受云雾干扰 ;而经过双编码器融合后的最终表示 h_fuse,不仅在空间定位上更加精细,还能使“已见过”和“从未见过”的类别(如水体、道路)与文本提示实现更精准的对齐。

表 3 和表 4 通过消融实验验证了模型各组件及损失函数的有效性。表 3 结果显示,引入 DEF 模块使 mIoU 提升了 9.1%,而结合 CMU 模块后性能进一步达到 73.1%,证明了多模态融合与跨模态对齐的互补性。表 4 则对比了不同的对齐损失函数,实验证明 InfoNCE 损失在促进 SAR 与 RGB 特征空间一致性方面表现最强,显著优于 MSE 和 L1 损失。


04 MM-OVSeg 创新与总结

  1. 首创全天候遥感开放词汇框架

    针对遥感图像易受云雾干扰的痛点,首次提出融合光学与 SAR 数据的开放词汇分割(OVS)框架 MM-OVSeg 。利用 SAR 的穿透力弥补光学信息的缺失,解决了恶劣天气下对未知类别地物的识别难题 。

  2. 跨模态特征空间的精准对齐 (CMU)

    通过跨模态统一过程(CMU),在 2.5 万对无标签 RGB-SAR 图像上进行对比学习预训练 。该模块成功将 SAR 的特征空间对齐到预训练视觉基础模型(如 DINO)中,打破了模态壁垒 。

  3. 全局语义与局部细节的高效融合 (DEF)

    设计了双编码器融合模块(DEF),同时集成 CLIP 的全局语义泛化性与 DINO 的像素级局部细节 。通过多尺度特征融合与残差增强,显著提升了模型对“未见过”地物类别的分割精度。

本文提出了遥感领域首个融合光学与SAR数据的开放词汇分割框架MM-OVSeg,旨在解决云雾遮挡导致的光学信息缺失难题。通过跨模态统一(CMU)和双编码器融合(DEF)模块,该方法成功实现了雷达与光学特征的精准对齐及全局语义与局部细节的有机整合。多场景实验证明,MM-OVSeg在鲁棒性、泛化能力及分割精度上均显著优于现有的最先进模型。


http://www.cnnetsun.cn/news/4302386.html

相关文章:

  • 从HashMap到Kafka:Java面试底层原理深度解析
  • SpringBoot3+Vue2前后端分离CMS内容管理系统实战解析
  • STM32H573 Secure Manager报错-129:PSA密钥生成权限排查与解决
  • MinIO 社区版下载与部署实战:从零搭建对象存储服务
  • 科沃斯十四年积累,服务机器人开放生态与应用定义权解析
  • STM32CubeIDE开发STEVAL-ESC002V1电调固件全攻略
  • 纯C语言实现BLF文件解析:格式拆解、工程实践与性能优化
  • 程序员算法笔试卷避坑指南:动态规划、贪心与KMP全复盘
  • 执行噪声下的多智能体意图推断:分离Aleatoric与Epistemic Uncertainty
  • 将LLM调用编译进传统数据管道:缓存、重试与确定性实践
  • 影栈是一款在线抖音内容下载工具
  • LSPIA曲面拟合:B样条渐进迭代逼近工程实践
  • Self-Guided Function Calling in Large Language Models via Stepwise Experience Recall
  • 爱家房产V9.39商业版:一站式房产门户系统部署与运营实战指南
  • 嵌入式中必会的Linux小操作(第二章)
  • 可白嫖源码---课程设计--毕业设计--springboot心情疗愈与疏导系统[编号:project57310](案件分析)
  • 品达物流TMS深度拆解:运输管理系统核心模块与实操指南
  • 用/review 做一次不改代码的 PR 审查:范围、优先级与验收
  • 从LLM到ComfyUI:AI短剧内容生产全链路实践
  • Python构建每日股票分析系统:数据获取到自动化报告全流程
  • 论文图表用黑白还是彩色?按期刊要求对比
  • Hugging Face 模型下载与 NVIDIA GPU 推理实战:从环境配置到部署
  • 从70亿token到本地部署:AI学习监督助手的技术拆解
  • 联邦知识图谱问答:垂直分区下多跳推理的隐私保护实现
  • 2026年仍不过时的Python数据分析三件套:NumPy+Pandas+Matplotlib
  • 基于区块链的医疗记录存储系统:从概念到毕业设计实践
  • 网易秋招笔试编程题实战解析:字符串、滑动窗口与动态规划
  • AI小说转视频工具 ArcReel
  • 深度学习系统实习生笔试题拆解:从算法基础到工程落地
  • 富士康秋招工程师笔试全拆解:题型、逻辑与备考策略