华为:渐进解锁细粒度视觉感知
📖标题:FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions
🌐来源:arXiv, 2603.17326v1
🌟摘要
虽然多模态大语言模型(MLLM)经历了快速的发展,但其视觉编码器经常仍然是性能瓶颈。传统的基于CLIP的编码器由于低分辨率预训练造成的视觉细节丢失以及对噪声的依赖而难以处理密集的空间任务。为了克服这些限制,我们引入了FineViT,一种专门设计用于解锁细粒度感知的新型视觉编码器。通过用密集的重现替换粗糙的网络数据,我们通过渐进式训练范式系统地减轻信息丢失。首先,编码器在数十亿个全局重新捕获的图像-文本对上以高原生分辨率从头开始训练,建立鲁棒的、细节丰富的语义基础。随后,我们利用FineCap-450 M数据集,通过LLM对齐进一步增强其本地感知,该数据集包含超过4.5亿个高质量的本地字幕。大量实验验证了渐进策略的有效性。FineViT实现了最先进的零射击识别和检索性能,特别是在长上下文检索中,并始终优于多模态视觉编码器,如SigLIP 2和Qwen-ViT集成到MLLM。我们希望FineViT可以作为一个强大的新的基线细粒度视觉感知。
🛎️文章简介
🔸研究问题:如何解决现有基于 CLIP 的视觉编码器因低分辨率预训练和粗糙网络数据导致的细节丢失,从而突破多模态大模型在密集空间任务上的性能瓶颈?
🔸主要贡献:论文提出了 FineViT 视觉编码器及 FineCap-450M 数据集,通过渐进式训练范式实现了业界领先的细粒度视觉感知能力。
📝重点思路
🔸构建大规模细粒度重标注数据集 FineCap-450M,利用多模型集成对 18 亿图像进行全局重描述,并进一步生成包含 4.54 亿区域的高质量局部标注,涵盖自然场景、富文本及文档。
🔸设计三阶段渐进式训练策略:首先利用掩码图像建模(MIM)在无标签数据上建立基础空间感知;其次在高分辨率下进行大规模对比学习以对齐语义;最后结合大语言模型进行多粒度对齐训练。
🔸采用原生高分辨率输入机制,从预训练阶段的 448 分辨率逐步提升至对齐阶段的 1K 分辨率,并结合 2D RoPE 位置编码,有效保留图像中的细微空间结构和文本信息。
🔸将局部感知任务(如边界框到文本、文本到边界框、OCR 等)统一重构为序列生成任务,利用自回归损失函数强化模型对局部细节和空间坐标的精确理解。
🔎分析总结
🔸在零样本分类和检索任务中,FineViT 以少于 SigLIP2-g 的参数量取得了更具竞争力的成绩,特别是在长文本检索基准(DCI、Urban-1k)上大幅超越现有最优模型,接近饱和性能。
🔸集成到多模态大模型后,FineViT 在 OCR、图表理解及视觉定位等需要细粒度感知的任务上显著优于 Qwen-ViT 和 InternViT,证明了其在解析复杂视觉结构方面的优势。
🔸消融实验表明,第三阶段的局部对齐训练对于提升空间密集任务性能至关重要,且解冻视觉骨干网络能进一步挖掘其在精确定位任务中的潜力。
🔸随着后端大语言模型规模的扩大,FineViT 始终保持相对于基线模型的领先优势,显示出良好的可扩展性和与不同规模语言模型的兼容性。
💡个人观点
论文打破了传统视觉编码器依赖粗糙网络数据和固定低分辨率的局限,提出从粗到细、由全局至局部的系统化设计思路。
