学习日记44:Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
摘要:
视觉语言模型能再以视觉为中心的任务中很好的整合视觉和文本信息,但是对于模态间信息不一致的处理很不充分;作者通过实验发现当文本和视觉信息出现不一致时,VLMs盲目地相信文本数据而不信任视觉数据,导致在损坏的文本下显著的性能下降。分析了影响这个种文本偏向的因素,由此使用了增强文本的监督微调,并证明其在减少文本偏置的作用。
介绍:
作者探索了指令提示词,语言模型的大小,文本相关性,图像和文本token的顺序以及单模态对于当前任务的确定性对于这种盲目相信文本的情况的影响。
为了探索多模态模型对于文本信息的偏好,文章中设置了3种图文对,即Match(图片和文本信息完全一致),Corruption(图片和文本信息相关,但文本被歪曲,对图片的描述错误),Irrelevance(图片与文本完全无关,各说各的);分别评估相关信息的使用,误导信息的处理,模型忽略分心物的能力。
为了更好评估模型对于各个模态的依赖程度和模型的能力,作者设置了更多指标:
Text Preference Ratio (TPR)衡量当文本和视觉信息不一致时,模型选择文本的可能性来表示文本偏见:
Accuracy任意一组测试集 Q 的标准答题正确率:
Macro Accuracy是使用三种不同图文对的模型上的准确率的平均:
Normalized Accuracy衡量了模型受文本变化影响的程度,相对于基准准确率,即其在基准问题集B上的准确率。对于文本变化下的任意问题集Q计算相应的归一化准确率为(可以理解为相对于基准数据集上的准确率来说这个数据集上的准确率):
实验:
实验设置
这部分其实主要是测试现象,实际上的解决方法十分简单。
在四个不同领域的视觉问答 (VQA) 数据集上测试模型效果,分别是通用视觉问答,文档图文问答,视觉数学推理,网页品牌识别 / 钓鱼检测。作者实验GPT4o对正常文本对的文本部分进行处理得到三种文本对。
在提示词上,作者提醒模型注意潜在的错误,并鼓励谨慎使用文本信息。
并对当前数据进行测试,关掉图像输入,只把Match / Corruption / Irrelevance三类文本单独喂给模型答题,统计纯文本下的准确率,这部是检测文字本身单独存在时,能独立给出确定正确 / 错误答案; 如果不做,就无法区分:模型答错是「被错误文字误导」,还是「文字本身描述不清」,实验结论会失去说服力。
对文本的盲从
可以看到,在Match / Corruption / 中TPR的值都十分大,无论文本是否正确,模型都显示出来对文本信息的极大服从,只有在Irrelevanc情况下,文本显然与图片无关,模型才会对图像更细致的观察。
Base:只输入图片 + 问题,不加任何额外文本时,模型答对题目的百分比。
Corruption:同时输入:图片 + 矛盾错误文本(Corrupted Text)+ 问题,模型答对的百分比。
强烈的文本偏好使得Corruption情况下的模型表现显著下降。
影响因素
指令语可以减少文本偏误,但具有局限性。
使用较大的语言模型进行训练可以减少文本偏差,但会出现饱和现象。
相关文本更可能影响视觉-语言模型(文本和问题越相关,模型越愿意相信这段文字,哪怕文字和画面矛盾)。
文本放在前面会大幅加剧文本偏置,TPR 显著升高。
模型会自动对比自己对图像、文字的自信程度,哪边把握大就采信哪边;只要文字侧模型很确定,哪怕图完全相反,也会放弃视觉信息。
解决方法
使用监督微调:具体来说,同时使用纯文本样本和图文配对样本两类数据。 一共收集 1000 条微调样本,平均均匀分配到 5 种数据类型中:纯文本数据、原始标准 VQA 样本、附加匹配文本的 VQA 样本、附加污染(错误)文本的 VQA 样本、附加无关文本的 VQA 样本(以上后三类统称为文本增广样本)。
去掉纯文本数据微调:模型 TPR 大幅下降,但会过度排斥正常文本; 保留纯文本数据:模型能清晰区分匹配 / 污染文本,两者 TPR 差距最高 40%,既能采信正确文字、又抵抗错误文字,效果最优。
