当前位置: 首页 > news >正文

华为:渐进解锁细粒度视觉感知

📖标题:FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions
🌐来源:arXiv, 2603.17326v1

🌟摘要

虽然多模态大语言模型(MLLM)经历了快速的发展,但其视觉编码器经常仍然是性能瓶颈。传统的基于CLIP的编码器由于低分辨率预训练造成的视觉细节丢失以及对噪声的依赖而难以处理密集的空间任务。为了克服这些限制,我们引入了FineViT,一种专门设计用于解锁细粒度感知的新型视觉编码器。通过用密集的重现替换粗糙的网络数据,我们通过渐进式训练范式系统地减轻信息丢失。首先,编码器在数十亿个全局重新捕获的图像-文本对上以高原生分辨率从头开始训练,建立鲁棒的、细节丰富的语义基础。随后,我们利用FineCap-450 M数据集,通过LLM对齐进一步增强其本地感知,该数据集包含超过4.5亿个高质量的本地字幕。大量实验验证了渐进策略的有效性。FineViT实现了最先进的零射击识别和检索性能,特别是在长上下文检索中,并始终优于多模态视觉编码器,如SigLIP 2和Qwen-ViT集成到MLLM。我们希望FineViT可以作为一个强大的新的基线细粒度视觉感知。

🛎️文章简介

🔸研究问题:如何解决现有基于 CLIP 的视觉编码器因低分辨率预训练和粗糙网络数据导致的细节丢失,从而突破多模态大模型在密集空间任务上的性能瓶颈?
🔸主要贡献:论文提出了 FineViT 视觉编码器及 FineCap-450M 数据集,通过渐进式训练范式实现了业界领先的细粒度视觉感知能力。

📝重点思路

🔸构建大规模细粒度重标注数据集 FineCap-450M,利用多模型集成对 18 亿图像进行全局重描述,并进一步生成包含 4.54 亿区域的高质量局部标注,涵盖自然场景、富文本及文档。
🔸设计三阶段渐进式训练策略:首先利用掩码图像建模(MIM)在无标签数据上建立基础空间感知;其次在高分辨率下进行大规模对比学习以对齐语义;最后结合大语言模型进行多粒度对齐训练。
🔸采用原生高分辨率输入机制,从预训练阶段的 448 分辨率逐步提升至对齐阶段的 1K 分辨率,并结合 2D RoPE 位置编码,有效保留图像中的细微空间结构和文本信息。
🔸将局部感知任务(如边界框到文本、文本到边界框、OCR 等)统一重构为序列生成任务,利用自回归损失函数强化模型对局部细节和空间坐标的精确理解。

🔎分析总结

🔸在零样本分类和检索任务中,FineViT 以少于 SigLIP2-g 的参数量取得了更具竞争力的成绩,特别是在长文本检索基准(DCI、Urban-1k)上大幅超越现有最优模型,接近饱和性能。
🔸集成到多模态大模型后,FineViT 在 OCR、图表理解及视觉定位等需要细粒度感知的任务上显著优于 Qwen-ViT 和 InternViT,证明了其在解析复杂视觉结构方面的优势。
🔸消融实验表明,第三阶段的局部对齐训练对于提升空间密集任务性能至关重要,且解冻视觉骨干网络能进一步挖掘其在精确定位任务中的潜力。
🔸随着后端大语言模型规模的扩大,FineViT 始终保持相对于基线模型的领先优势,显示出良好的可扩展性和与不同规模语言模型的兼容性。

💡个人观点

论文打破了传统视觉编码器依赖粗糙网络数据和固定低分辨率的局限,提出从粗到细、由全局至局部的系统化设计思路。

🧩附录

http://www.cnnetsun.cn/news/1696631.html

相关文章:

  • 深度拆解 Linux Ext 系列文件系统:从硬件底层到软硬链接全流程
  • AI算力芯片黑马!“图灵进化”完成新一轮数千万级别融资
  • Android compose 可见性动画未执行问题修复
  • 告别命令行手敲:用Python脚本自动化你的第一个OpenFOAM腔体流动模拟
  • Ubuntu 16.04 图形界面循环登录问题排查指南:从驱动兼容到内核版本适配
  • python实现分离不同人声、wespeaker
  • RANSAC算法
  • 计算机毕业设计:Python新能源车型数据洞察与情感推荐引擎 Django框架 snowNLP 协同过滤推荐算法 requests爬虫 可视化(建议收藏)✅
  • 避坑指南:手把手教你用Java生成定制化词云图(解决中文乱码、背景图加载问题)
  • Python 3 CGI 编程
  • DOM EventListener
  • 别再死磕梯形图了!写给工控新手的ST语言入门指南(附常用指令速查表)
  • 别再用copy /b了!三种制作哥斯拉图片马的保姆级对比(含010 Editor实操)
  • B站缓存视频合并工具:让离线内容重获完整价值
  • Iron Beam高能激光武器系统
  • Gemma 4:Google扔出的开源AI重磅炸弹,手机也能跑的ChatGPT级大脑
  • VS2019项目重构实战:从命名空间到解决方案的全面重命名指南
  • 鸿蒙Flutter混合开发:如何优雅地实现离线TTS/STT的多语言动态切换?
  • 16 指挥AI写数据库SQL代码:增删改查与存储过程实现
  • 大车间降温新选择:蒸发冷省电空调凭关键词优势脱颖而出
  • javaweb小区车辆停车场车位预约管理系统 可视化
  • 从零设计一个AXI Master:手把手教你为Xilinx MIG DDR4控制器编写自定义测试逻辑
  • 宾州大学让AI学会“记忆管理“:多智能体协作破解长期对话难题
  • 残差缩放块改进YOLOv26可学习权重自适应特征融合双重突破
  • 技术文章大纲:用Anaconda驯服AI开发流
  • Canape实战指南:XCP工程配置与调试(一)
  • 算法解析 | 深入EGO Planner:无ESDF的实时避障与轨迹优化
  • YOLOv11 OBB实战:手把手构建旋转目标检测数据集
  • 网络连接故障的常见原因
  • Bert模型