多智能体协作感知入门到精通:ICLR顶会SiMO论文全拆解,看这篇就够了!
01 Introduction
协作感知整合多智能体视角,以增强感知范围并克服遮挡问题。虽然现有多模态方法利用互补传感器提升性能,但它们极易失效——尤其是在关键传感器如激光雷达(LiDAR)无法使用时。根本原因是特征融合导致单模态特征与下游模块之间的语义不匹配。本文首次在协作感知领域探讨了这一挑战,提出了单模态可作多模态协作感知(SiMO)。通过采用所提议的长度自适应多模融合(LAMMA),SiMO 可以在模态失败时自适应处理剩余的模态特征,同时保持语义空间的一致性。此外,借助创新的“预训练-对齐-融合-研发”培训策略,SiMO 解决了模态竞争问题——这一问题通常被现有方法忽视——确保每个模态分支的独立性。实验表明,SiMO 在保持模态特有特征的同时,有效地对齐多模态特征,使其能够在所有模态上保持最佳性能。
02 Motivation
图 1:a)现有方法表现为串联电路,任何模态失效都会失效,而我们的方法则像并联电路,使用任何有效分支。b) 常见特征融合方法会导致空间偏移,使未融合的特征无法适应下游任务头。c) 融合前对齐特征可保持未融合、融合和多代理特征之间的一致性。
本文的动机源于以往方法仅考虑整合多模态信息以提高准确性,忽视了模态缺失或损坏可能导致整个系统失效的缺点,就像一个包含多元件的串联电路一样。尽管模态失效已在单智能体场景中被探索(Yan 等,2023;Ge 等,2023;Wang 等,2024a),MACP 面临一个独特且显著更复杂的挑战:异质模态失效。与主要要求代理内部功能与本地任务头对齐的单代理设置不同,MACP 要求严格的代理间对齐。在现实中的协作场景中,代理存在不同传感器故障(例如,利用激光雷达的自我载具与仅摄像头的邻居协作),其传输特征必须存在于严格统一的语义空间中,以实现有效交互。现有的单智能体鲁棒方法未能保证这种跨智能体语义一致性,导致多智能体融合模块的瓦解。此外,现有多模态方法通常忽视模态竞争(Huang 等,2022),这常常严重阻碍多模态联合学习。这导致模型偏向易于收敛的分支,导致更具挑战性分支的分支训练不足,无法在没有主导分支的情况下独立运作。即使是旨在单独提取多模态特征的双塔模型,如 BEVFusion(Liu 等,2023),也必须依赖唯一有效的分支,尽管其他分支本可以利用多传感器的冗余信息。据我们所知,我们的研究是首次解决 MACP 中动态、异构模态失效这一更为复杂的挑战。
03 Contribution
在协作感知领域,我们首次用 SiMO 解决了因缺失模态而导致的多模态感知失败,尤其是在仅有 RGB 图像的情况下。
我们指出融合前后特征的不一致是模态失效时系统崩溃的主要催化剂,并提出 LAMMA 以容纳不同数量的模态特征,并在结构上保持融合中的语义一致性。
我们指出,模态竞争是实现独立模态分支效能的障碍,并提出了 PAFR 培训策略解决这个问题,避免像现有方法那样平衡分支收敛的不确定性。
大量实验表明,SiMO 使每个模态分支能够独立运行,同时具有冗余的多模态特征,并保持 SOTA 级别的性能。
04 Method
图 2:a)SiMO 概述。b) LAMMA 自适应降级为自注意融合,以在模态失效时保持特征处理的一致性。c) SiMO 进行平衡的多模态学习,以保持模态特有特征以实现分支独立性。
- 为什么模型在单模态场景下失效
多模态协作常使用连接、卷积神经网络(CNN)、图神经网络(GNN)(Scarselli 等,2008)、注意力机制或变换器(Vaswani,2017)来融合来自不同模态的特征。这些方法要么通过合并不同模态的维度来结合其特征(Liu 等,2023;Qiao 和 Zulkernine,2023),或将特征整合到新的特征空间中(Xiang 等,2023;Zhao 等,2023)。这些融合造成融合前后特征空间的差异,使得为融合特征设计的下游任务头不适合未融合特征。因此,当缺乏某种模态且特征融合不适用时,这些方法的有效性就会丧失(见图 1(b))。
考虑到这些点,我们首先选择通过联合学习将来自不同模态的特征整合到单一特征空间。在联合学习框架内,经过相同模块的融合处理,可以推断多个分支的特征存在于同一特征空间内。随后,通过加法和融合这些特征,我们确保融合前后的特征空间保持一致。这种方法使得融合和单个模态特征都能顺畅地传递给下游任务头(见图 1(c))。
2.长度自适应多模态融合
加法融合依赖于多模态特征的有效对齐。正如 Wang 等人(2024a)强调的,联合多模态学习有助于实现这一目标,但一致性的特征处理架构对于语义对齐至关重要。然而,在 MACP 典型的异构场景中,多样的模态特征提取很常见。因此,我们致力于在聚变模块内部实现一致的多模态特征处理,避免对其他组件产生额外需求。此外,协作环境中的模态失效意味着输入特征数量可变,在复杂且不可预测的现实环境中检测和响应这一变化具有挑战性。为解决这些问题,我们提出了长度自适应多模融合(LAMMA),其结构设计用于一致性的多模态特征处理和自适应融合。
源自不同模态的提取特征在语义上存在显著差异,且未先行语义统一的多模态融合可能导致相互干扰,降低模型的效能。因此,我们应用 ConvNeXt(Liu 等,2022)作为 g 对应器,以在通道和像素层面对齐多模态特征 Z 的语义。然后,所有输入特征都通过一种与模态无关的位置嵌入添加,避免了模态特殊处理,并将特征空间投影到更紧凑的特征空间以实现长度自适应融合。基于注意力的长度自适应融合能够稳健地处理缺失模态,这也是基于 CNN、RNN 或 Transformer 现有方法的常见挑战。我们通过并行连接不同模态的查询实现这一点,实现了同时自关注和交叉关注。交叉注意力机制促进了互补信息的传递以及不同模态间共享特征的对齐。最终的集成多模态特征表示通过加法结合这些融合的自关注和交叉注意力结果推导出来。因此,我们的长度自适应聚变实现为:
其中[;]表示特征连接,W代表查询、键和值的线性权重,所有模态特征共享。A 和 B 的查询以 Q 形式串接,而键和值则以 k 和 V(m = A, B)分离。b、n、d 分别表示批次大小、令牌数量和特征维度。这里 A、B 用于指代不同但不具体的模态,因为我们不分配模态的顺序,LAMMA 应一致处理所有模态。Zattained 与多头注意力(MHA)被分为两部分,大小为(b, n, d),其中一部分用于自注意融合,另一部分用于交叉注意融合,然后按元素加法,使 Zas 对每种输入模态有增强的表示。在模态失败的情况下,查询中缺失的特征(例如 Z)为空,导致 Q = [0;因此,融合本质上可以被视为降级为自注意模块(SA),无需区分失败发生(图 2(b)):
鉴于模型无论有无模态都保持不变,且输入始终以完全相同的参数处理,语义解释融合特征应保持一致。因此,无论某一模态是否退出,融合后的特征都具有相同的语义,确保对后续任务头部的最佳适应性。
3.克服模态竞争
为了仅用单一模态实现物体检测,关键是分别从不同模态中提取完整特征,并通过多模态联合学习将它们对齐在共享空间中。然而,我们观察到(详见 A.9 节表 11)多模态模型联合训练的表现甚至不如最佳单模态(LiDAR)模型。Huang 等人(2022)称之为“模态竞争”这一反直觉现象,被认为是导致某些分支在天真联合学习中训练不足。先前研究(Wang 等,2020b;Huang 等,2022;Peng 等,2022;Javaloy 等,2022;Wei 等,2025;Yang 等,2024)将这些归因于优化距离变化或模型过拟合等因素,并提出了多种缓解策略。然而,我们认为这一现象源于不同模式在呈现任务相关信息的方式上更根本的差异。
基于这些观察和现有研究,特别是激光雷达模型的更快收敛,我们假设不同模态在提供“任务相关信息密度”方面的效率本质上存在差异。例如,从点云提取三维空间数据比从二维图像推断要直接得多。我们认为,这种“信息传递效率”的根本差异是模态竞争的主要驱动力。效率更高的模态(例如用于三维几何的 LiDAR)使其分支学习更快,从而主导联合优化过程,抑制与低效率模式相关的分支的全面训练(例如,从二维进行三维相机)。这一观点表明,诸如“变异优化距离”(Huang 等,2022)或“模型过拟合”(Wang 等,2020b)(可能指向更高效的模态)等问题,可以被视为这一潜在效率差距的表现。鉴于“信息传输效率”的内在差异,我们认为在传统的端到端联合训练范式中,模态竞争在很大程度上不可避免,因为在这些模式下,由于将不同模态与信息提取难易度差异地共同优化,自然会产生不平衡的学习动态。
图 3:SiMO 的训练过程。(1) 加载预训练特征提取器。(2)在提取器冻结状态下训练每个对齐器。(3) 训练 LAMMA 配备双模输入、冻结对准器和任务头(无 RD)。(4)微调带有 RD 的 LAMMA,以适应模态失效。
鉴于这一点,我们的研究从试图在这种框架内平衡竞争转向。相反,我们旨在通过孤立的多分支训练方法规避其负面影响(见图 3)。该策略涉及独立预训练每个特定模态分支,以开发全面的特征提取能力,然后再进行后续融合。我们的目标不是消除固有的模态差异,而是设计一种训练范式,防止这些差异引发负面竞争,尤其是在早期学习阶段,从而最大化每种模态的潜在贡献。
(步骤 1)我们认为,我们不同时培训两个模态,而是将各自独立培训以确保为两个模态提供足够的培训,这是一种更有把握的策略。因此,通过单模态学习预训练的特征提取器将在两分支融合后被直接采用。然后,我们将这些预训练的提取器保持冻结状态,同时推进特征对齐模块、融合模块和任务特定头的训练。
(步骤 2)鉴于预训练特征提取器提取的有效特征分布在不同的特征空间中,下一步是训练一个能够将这些特征对齐到与融合模块兼容空间的比对模块。我们从接受单模态输入(例如 LiDAR)开始训练过程,直到模型实现收敛。随后,我们冻结训练好的对齐模块(例如 g),并继续训练另一个对齐模块(仅用相机输入),直到模型再次收敛。这确保第二个对齐模块(g)也能有效地将其特征对齐到兼容 LAMMA 的空间。
(步骤3)最后,所有对齐模块冻结后,我们用多模输入训练剩余模块以实现最终收敛。所有共用模块的参数,包括多模融合、多代理融合和任务头,在没有模态符号的情况下,所有输入都共享,因此这些共同模态与模态无关。
(步骤 4)在特征提取器和融合模块的训练过程中,我们的方法是每次优先考虑一个分支,以防止模态竞争的出现,然后冻结这些分支用于共同模块的训练。在共同模收敛后,模型被微调,以 0.5 的可能性随机丢弃 LAMMA(RD)中的一个模态特征,以适应单模态失效情形。
05
—
Experiment
表1:3D检测模型的定量表现
我们以 BM2CP(Zhao 等,2023)作为基线,这是唯一一个开源的多模融合 MACP 方法,并通过加入金字塔融合实现多智能体协作,将 BEVFusion(Liu 等,2023)——一种流行的 SOTA 多模态方法——转移到协作感知领域,加入了多智能体协作。为了控制变量并将比较范围限制在多模聚变领域,我们用 PointPillar 替换了 BEVFusion 的 LiDAR BEV 特征提取器,在相同设置下用 SiMO 替代了。类似地,为了与单模态场景中 SOTA 方法求解模态失效的方法进行比较,我们采用 UniBEV 提出的 CNW(通道归一化权重)融合作为多模态融合,这与 SiMO 中使用的另一种设置相呼应,并用原论文中提出的模态脱离方法训练模型。此外,我们还考虑了与 AttFusion 和 HEAL 单模态模型的比较,后者是目前 SOTA 协作感知方法。表 1 显示,BM2CP、BEVFusion 和 UniBEV 在激光雷达故障时均无故障,而我们的 SiMOs 则能有效处理单模态或多模态,尤其是仅拍摄相机图像时。SiMO-AF 基于 AttFusion 的预训练模型,SiMO-PF 基于 Pyramid Fusion。在通过 RD 微调之前,SiMO-AF 和 SiMO-PF 分别保持 AttFusion 和 Pyramid Fusion(SOTA)的性能上限,这在可预测范围内,因为我们采用了预训练的 AttFusion 和 Pyramid Fusion 的相同特征提取器。SiMO 旨在提取激光雷达和摄像头的综合功能,使每个分支能够实现,从而导致激光雷达和摄像头的共同特性出现冗余。因此,结果表明 LAMMA 能够有效处理双模态特征的冗余。
图 5:SiMO-PF 和 HEAL(金字塔聚变)检测结果的可视化,地面信息及协作点云。(a)(b)(c) 是包含所有 15000、5000 个激光雷达点(通过遮蔽局部点云)的检测可视化,(d) 仅包含相机图像的检测可视化。
图 5(a)显示,在足够多的激光雷达点下,SiMO-PF 的检测质量与金字塔聚变相同。当 LiDAR 变得稀疏甚至失效时,SiMO-PF(上排)仍能实现合理的性能,如(c)所示。同时也揭示了需要采用更多方式来防止激光雷达失效带来的危险。(d)中的比较显示了 SiMO-PF(相机)的领先位置,这与上述分析一致,即 Pyramid Fusion 并未充分利用提取的相机特征。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
