当前位置: 首页 > news >正文

V-DyKnow A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models

V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models

Authors:Seyed Mahed Mousavi, Christian Moiola, Massimo Rizzoli, Simone Alghisi, Giuseppe Riccardi

Deep-Dive Summary:

V-DyKnow: 针对视觉语言模型中时效性知识的动态基准

摘要

视觉语言模型(VLMs)通常在文档、图像和文本的静态数据快照上进行训练。其训练数据和评估基准往往隐含地将事实知识视为不随时间变化的。然而,现实世界的事实本质上具有时效性,且会发生不规则或周期性的变化,导致模型的预测变得过时。本文提出了V-DyKnow,这是一个用于评估 VLMs 中时效性事实知识的视觉动态知识基准。利用 V-DyKnow,我们对开源和闭源 VLMs 进行了基准测试,并分析了:( a ) (a)(a)模型响应在不同模态和输入扰动下的可靠性(正确性和一致性);( b ) (b)(b)知识编辑和多模态检索增强生成(RAG)方法在跨模态知识更新中的有效性;( c ) (c)(c)通过数据和机制分析探究过时预测的来源。结果显示,VLMs 经常输出过时的事实,反映了其(预)训练阶段使用的旧数据快照。即使在实体被正确识别的情况下,事实可靠性也会从文本刺激向视觉刺激退化。此外,现有的对齐方法无法在不同模态间一致地更新模型知识。这些发现突显了当前 VLMs 在获取和更新跨模态时效性知识方面的根本局限性。

1 引言

视觉语言模型(VLM)越来越多地被用于根据视觉输入回答现实世界的事实问题。在这种场景下,模型需要将图像内容与存储的世界知识联系起来。与大语言模型(LLMs)类似,VLMs 是静态模型,其事实知识是从不同时间点收集的大型异构数据快照中获取的。这些快照捕捉了世界及其实体的不同状态,可能编码了同一事实的过时或冲突版本。

图 1:针对时效性事实知识进行多模态查询 VLMs 的示例。在视觉刺激下,VLM 首先错误识别了实体并检索了错误事实。在澄清实体后,模型生成了过时的答案。最后在文本中明确指出实体时,才返回正确事实。该示例强调了本项目研究的关键问题:VLMs 中过时知识的普遍性,以及视觉与文本刺激之间的性能差距。

现有的 VLM 知识评估主要使用具有固定地面真值(ground truth)的静态基准,忽略了事实的动态演变。为了解决这一问题,我们引入了V-DyKnow。该基准不再依赖固定标注,而是根据评估时从Wikidata获取的最新事实信息来验证模型输出。V-DyKnow 将事实查询表示为视觉实体(如肖像、国旗、Logo)与关系和属性的配对,每个实体都关联有时间有效区间。

2 V-DyKnow

V-DyKnow 旨在评估文本和视觉接地(grounding)下的时效性事实知识。

  • 事实表示:采用(主体 subject,属性 property,数值 attribute)三元组。基准包含 139 个时效性事实,涉及 47 个国家、28 名运动员和 22 个组织。
  • 视觉提示词:构建配对查询,对比主体实体以文本形式(如“Apple 的 CEO 是谁?”)或视觉形式(如提供 Apple 的 Logo 并问“这家公司的 CEO 是谁?”)出现时的表现。视觉表现包括国徽、国旗、人物肖像和公司 Logo。
  • 视觉实体识别:为了区分错误是源于视觉识别失败还是事实知识缺失,引入了辅助识别任务,要求模型识别图片中的实体。
  • 评估协议:响应被分为正确(Correct)(当前有效)、过时(Outdated)(历史有效但当前失效)和无关(Irrelevant)(从未有效)。
  • 策略:采用上界策略(Upper-Bound strategy),对每个查询使用三个具有微小词汇扰动的提示词,并取其中表现最好的结果。
  • 模型:评估了包括 LLaVA-1.5、LLaVA-OneVision、PaliGemma 2、Molmo、Qwen2-VL、Qwen2.5-VL、InternVL3.5、GPT-4 和 GPT-5 在内的 9 种模型。

表 1:视觉和文本提示下最先进 VLMs 在 V-DyKnow 上的评估结果。结果显示了使用上界策略时的正确、过时和无关响应的百分比。

(年份) 模型VLM 视觉提示VLM 文本提示LLM* 文本提示
正确过时无关正确过时无关正确过时无关
(2023) LLaVA-1.513%31%56%33%49%18%33%47%19%
(2024) LLaVA-OneVision22%36%42%31%45%24%37%42%22%
(2024) PaliGemma 23%4%93%0%0%100%62%28%10%
(2024) Molmo24%20%56%34%44%22%40%40%20%
(2024) Qwen2-VL28%38%34%36%44%20%37%42%22%
(2025) Qwen2.5-VL32%38%30%39%40%22%44%35%21%
(2025) InternVL3.526%21%53%40%29%31%51%29%19%
(2025) GPT-471%18%11%72%19%9%---
(2025) GPT-575%15%10%76%14%9%---

3 结果分析

A. 模型评估

过时事实响应非常普遍,往往超过正确答案。大多数模型在文本查询下的表现优于视觉查询。这种差距在 LLaVA-1.5 和 InternVL3.5 等模型中尤为明显,表明视觉识别与事实召回之间的交互存在局限。有趣的是,将 VLMs 与其基础 LLM 比较发现,多模态训练往往会降低事实召回率(PaliGemma 2 是典型例子)。

B. 输出一致性

模型对文本提示的一致性(Prompt Agreement)通常高于视觉提示。GPT-4/5 在两种模态下均表现出较高的稳定性,而其他模型对提示语形式非常敏感。

表 3:视觉和文本输入在三种不同词汇化提示下的一致性(Prompt Agreement)。

(年份) 模型提示语一致性
视觉文本
(2023) LLaVA-1.552%70%
(2024) LLaVA-OneVision66%80%
(2024) PaliGemma 225%100%
(2024) Molmo57%81%
(2024) Qwen2-VL46%79%
(2025) Qwen2.5-VL70%78%
(2025) InternVL3.558%75%
(2025) GPT-492%97%
(2025) GPT-584%90%

C. 更新 VLM 知识

在知识编辑方法中,只有 IKE 表现较好,而 WISE 和 GRACE 效果不佳(正确率低于6 % 6\%6%)。检索增强生成(RAG)在两种模型上均表现出较好的一致性,但其表现受检索质量限制,且模型的参数化知识有时会干扰外部证据,导致幻觉或持续输出过时信息。

表 5:对知识编辑和基于检索的对齐方法进行的定性错误分析。

模型正确错误
过时泛化回答幻觉
LLaVA-1.5
WISE3%73%0%24%
GRACE21%63%1%15%
IKE95%0%5%0%
RAG
检索文档74%2%0%23%
黄金文档85%3%0%12%
Qwen2-VL
WISE4%34%3%57%
GRACE34%51%0%14%
IKE100%0%0%0%
RAG
检索文档80%5%0%15%
黄金文档93%3%0%4%

4 深入分析

A. 数据区间估算

通过 Wikidata 的有效区间分析,我们发现尽管模型发布于 2023 年后,但大多数预测对应的知识有效期在 2020 年之前,表明训练数据主要反映了较早的世界状态。

图 2:基于 Wikidata 的模型响应时间分布。通过聚合正确和过时响应的有效区间,可以近似估算模型参数中编码的世界状态。

B. 响应与训练数据的关联

对 Molmo 的预训练语料(Wikipedia 部分)分析显示,若正确信息在训练快照的规范源中缺失,模型则无法获取最新事实。

C. 机制可解释性

层级探针分析显示,预训练模型通常只在最后一层分配高概率给候选属性。在成功的编辑中,WISE 仅修改最后一层,而 GRACE 影响了更广泛的中间层(20-28 层)。

图 3:Qwen2-VL 的机制分析,展示了编辑方法如何改变跨层级的事实预测概率。

5 & 6 讨论与结论

分析表明,过时知识在开源和闭源 VLMs 中都很常见。现有的训练范式依赖于静态快照,且对齐方法不足以维持一致且最新的知识。解决这些挑战可能需要能够显式建模时间有效性、整合动态知识源并支持持续更新的新学习范式。V-DyKnow 为研究这些问题提供了重要资源。

局限性

V-DyKnow 的 139 个事实涉及高频实体,因此结果应被视为性能上界。此外,本工作未评估知识编辑可能带来的侧面负面影响。出于资源限制,仅评估了 7B 规模的开源模型。

Original Abstract:Vision-Language Models (VLMs) are trained on data snapshots of documents, including images and texts. Their training data and evaluation benchmarks are typically static, implicitly treating factual knowledge as time-invariant. However, real-world facts are intrinsically time-sensitive and subject to erratic and periodic changes, causing model predictions to become outdated. We present V-DyKnow, a Visual Dynamic Knowledge benchmark for evaluating time-sensitive factual knowledge in VLMs. Using V-DyKnow, we benchmark closed- and open-source VLMs and analyze a) the reliability (correctness and consistency) of model responses across modalities and input perturbations; b) the efficacy of knowledge editing and multi-modal RAG methods for knowledge updates across modalities; and c) the sources of outdated predictions, through data and mechanistic analysis. Our results show that VLMs frequently output outdated facts, reflecting outdated snapshots used in the (pre-)training phase. Factual reliability degrades from textual to visual stimuli, even when entities are correctly recognized. Besides, existing alignment approaches fail to consistently update the models’ knowledge across modalities. Together, these findings highlight fundamental limitations in how current VLMs acquire and update time-sensitive knowledge across modalities. We release the benchmark, code, and evaluation data.

PDF Link:2603.16581v1

部分平台可能图片显示异常,请以我的博客内容为准

http://www.cnnetsun.cn/news/1349259.html

相关文章:

  • Qt导航栏组件A03:VS Code 风格的图标侧栏
  • 【Rust 语言编程知识与应用:表达式详解】
  • 增程式电动汽车自适应ECMS能量管理策略:基于工况的Matlab实现方案
  • C#全自动多线程上位机源码编程 0,纯源代码。 1,替代传统plc搭载的触摸屏。 2,工控屏幕...
  • comsol数值模拟。 金属合金凝固数值模拟,连铸过程数值模拟,相场流场温度场,坯壳厚度计算
  • 基于改进蛇优化算法(GOSO/ISO)优化极限梯度提升树的时间序列预测
  • 在现代工业自动化中,恒压供水系统是一个常见的应用场景,特别是在高楼大厦、工厂和住宅小区中。今天,我们来聊聊如何用三菱PLC和组态王实现三泵变频恒压供水系统
  • 从统一入口到角色化体验:全面理解 SAP Fiori Launchpad 与 SAP Fiori Apps 的实施逻辑
  • 工业检测实战:同轴光源LFV3系列在金属刻印字符识别中的5个关键技巧
  • Hunyuan MT1.5-1.8B API限流设计:生产环境稳定性保障
  • 华为NAT类型选型指南:为什么你的企业网络应该用NAPT而不是静态NAT?
  • dac/cap/lsm
  • Rust impl关键字实战:从封装到多态的全面解析
  • 别再滥用dynamic了!C#动态类型避坑指南与性能优化技巧
  • 从零到一:基于MaxKB与Ollama构建企业级私有化智能知识库
  • LayUI树形下拉选择器实战:5分钟搞定权限管理菜单的动态加载
  • #训练营# 基于GD32E230与CH342F的便携式多功能调试工具:简易示波器+双串口+交换机Console(DB9/蓝牙)
  • CLIP-GmP-ViT-L-14开源大模型教程:CLIP-GmP变体本地化图文评估新范式
  • 图图的嗨丝造相-Z-Image-Turbo实战落地:短视频团队日更100+张风格统一渔网袜封面图方案
  • Github贡献图变身贪吃蛇:自动化工作流配置全解析
  • Flutter嵌入式ARM64 Linux应用实战:从交叉编译到真机部署
  • MusePublic在电商场景的应用:快速生成商品模特图与时尚海报
  • 快速上手:使用Docker Compose一键部署LiuJuan模型及WebUI
  • 收下这6款消除背景工具,让你的PPT、海报、电商图都能再上台阶。
  • 利用GStreamer和SRT协议实现低延迟视频推流与VLC播放实战
  • 深求·墨鉴在学术场景的应用:高效提取论文图表与公式
  • 十八、基于HC32F4A0与天空星开发板的PWM呼吸灯实战:从TimerA配置到占空比动态调节
  • OmenSuperHub:惠普OMEN游戏本专属系统优化工具
  • 产生死锁的四个必要条件
  • 避开conda限制:企业环境下Pinocchio与CasADi源码编译实战(含Docker方案)