当前位置: 首页 > news >正文

学习日记44:Words or Vision: Do Vision-Language Models Have Blind Faith in Text?

摘要:

视觉语言模型能再以视觉为中心的任务中很好的整合视觉和文本信息,但是对于模态间信息不一致的处理很不充分;作者通过实验发现当文本和视觉信息出现不一致时,VLMs盲目地相信文本数据而不信任视觉数据,导致在损坏的文本下显著的性能下降。分析了影响这个种文本偏向的因素,由此使用了增强文本的监督微调,并证明其在减少文本偏置的作用。

介绍:

作者探索了指令提示词,语言模型的大小,文本相关性,图像和文本token的顺序以及单模态对于当前任务的确定性对于这种盲目相信文本的情况的影响。

为了探索多模态模型对于文本信息的偏好,文章中设置了3种图文对,即Match(图片和文本信息完全一致),Corruption(图片和文本信息相关,但文本被歪曲,对图片的描述错误),Irrelevance(图片与文本完全无关,各说各的);分别评估相关信息的使用,误导信息的处理,模型忽略分心物的能力。

为了更好评估模型对于各个模态的依赖程度和模型的能力,作者设置了更多指标:

Text Preference Ratio (TPR)衡量当文本和视觉信息不一致时,模型选择文本的可能性来表示文本偏见:

Accuracy任意一组测试集 Q 的标准答题正确率:

Macro Accuracy是使用三种不同图文对的模型上的准确率的平均:

Normalized Accuracy衡量了模型受文本变化影响的程度,相对于基准准确率,即其在基准问题集B上的准确率。对于文本变化下的任意问题集Q计算相应的归一化准确率为(可以理解为相对于基准数据集上的准确率来说这个数据集上的准确率):

实验:

实验设置

这部分其实主要是测试现象,实际上的解决方法十分简单。

在四个不同领域的视觉问答 (VQA) 数据集上测试模型效果,分别是通用视觉问答,文档图文问答,视觉数学推理,网页品牌识别 / 钓鱼检测。作者实验GPT4o对正常文本对的文本部分进行处理得到三种文本对。

在提示词上,作者提醒模型注意潜在的错误,并鼓励谨慎使用文本信息。

并对当前数据进行测试,关掉图像输入,只把Match / Corruption / Irrelevance三类文本单独喂给模型答题,统计纯文本下的准确率,这部是检测文字本身单独存在时,能独立给出确定正确 / 错误答案; 如果不做,就无法区分:模型答错是「被错误文字误导」,还是「文字本身描述不清」,实验结论会失去说服力。

对文本的盲从

可以看到,在Match / Corruption / 中TPR的值都十分大,无论文本是否正确,模型都显示出来对文本信息的极大服从,只有在Irrelevanc情况下,文本显然与图片无关,模型才会对图像更细致的观察。

Base:只输入图片 + 问题不加任何额外文本时,模型答对题目的百分比。

Corruption:同时输入:图片 + 矛盾错误文本(Corrupted Text)+ 问题,模型答对的百分比。

强烈的文本偏好使得Corruption情况下的模型表现显著下降。

影响因素

指令语可以减少文本偏误,但具有局限性。

使用较大的语言模型进行训练可以减少文本偏差,但会出现饱和现象。

相关文本更可能影响视觉-语言模型(文本和问题越相关,模型越愿意相信这段文字,哪怕文字和画面矛盾)。

文本放在前面会大幅加剧文本偏置,TPR 显著升高。

模型会自动对比自己对图像、文字的自信程度,哪边把握大就采信哪边;只要文字侧模型很确定,哪怕图完全相反,也会放弃视觉信息。

解决方法

使用监督微调:具体来说,同时使用纯文本样本图文配对样本两类数据。 一共收集 1000 条微调样本,平均均匀分配到 5 种数据类型中:纯文本数据、原始标准 VQA 样本、附加匹配文本的 VQA 样本、附加污染(错误)文本的 VQA 样本、附加无关文本的 VQA 样本(以上后三类统称为文本增广样本)。

去掉纯文本数据微调:模型 TPR 大幅下降,但会过度排斥正常文本; 保留纯文本数据:模型能清晰区分匹配 / 污染文本,两者 TPR 差距最高 40%,既能采信正确文字、又抵抗错误文字,效果最优。

http://www.cnnetsun.cn/news/3732801.html

相关文章:

  • MAA Assistant Arknights完整教程:解放双手的明日方舟智能助手终极指南
  • AI病历质控系统上线倒计时:卫健委新规生效前必须完成的3项合规改造(含GDPR/《个人信息保护法》双适配清单)
  • KMS_VL_ALL_AIO实战指南:一站式解决Windows与Office激活难题的专业方案
  • BetterNCM安装器:3分钟搞定网易云插件管理的终极解决方案
  • 如何高效使用Bodymovin插件:3个核心场景与深度技术解析
  • 终极指南:如何彻底解决TranslucentTB安装错误并完美使用Windows任务栏透明化工具
  • 英雄联盟终极自动化工具:League Akari完整指南与安装教程
  • 300+款RPG Maker插件:让你从零打造专业级游戏的终极指南
  • AI预测ADMET失败率下降67%的关键参数设置:2023年Nature子刊复现失败后,我们重校准的8个物理化学约束条件
  • OceanBase DataPilot AIP:Ontology 承载AI能力面的另一条路
  • 如何对 eBPF 代码进行性能分析?实例展示完整流程
  • iOS微信插件终极指南:5分钟解锁防撤回、远程控制等10大实用功能
  • 【2024Q2最新实践】:融合图神经网络+强化学习的轻量化路径优化方案,单节点日均处理200万订单
  • USB协议转换器兼容性测试实战:从硬件到系统的全方位验证
  • AI玩具机芯技术选型:双栈架构与指令机芯的对比与评估框架
  • NBM7100A芯片在低功耗物联网设备中的高效电源管理方案
  • PUBG-Logitech压枪工具:从零到精通的实战配置指南
  • 硕士论文框架构建四维法与导师沟通技巧
  • 扣子定时任务设置全攻略:从零到上线的7个关键步骤,90%开发者都踩过的3个坑
  • 群晖NAS无法使用百度网盘?Docker容器化套件完美解决云端同步难题
  • 新手学尤克里里怎么选?入门进阶差异讲透,4款实测机型闭眼入
  • 本科论文和硕士论文降AI哪个更难:2026年不同学位论文降AI难点完整对比
  • SteamAutoCrack实用指南:3步实现Steam游戏自动破解备份
  • Vue3核心Hooks与状态管理实战指南
  • 3步拯救损坏视频:Untrunc开源修复工具完全指南
  • LENA-R8与STM32F756ZG的物联网定位通信方案解析
  • 物联网安全:SE050安全元件与MK64FX512VDC12的硬件级防护方案
  • 如何快速安装Apple移动设备驱动:Windows与iPhone无缝连接终极指南
  • Linux系统多版本Python源码编译安装与隔离管理实践指南
  • 无门槛立减8元!