2025_NIPS_ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks
文章核心总结与翻译
一、主要内容
本文针对视觉语言模型(VLMs)在具身任务中难以对长序列视频帧进行有效推理的问题,提出了递归视频推理框架ROVER。该框架通过将长时程视频轨迹递归分解为对应子任务的片段,结合子任务专用滑动上下文窗口,在聚焦局部相关帧推理的同时保留全局任务上下文。研究构建了包含543个视频的机器人操作数据集(涵盖27项任务的专家与非专家轨迹),并在任务进度估计、帧级自然语言推理、视频问答三大任务上开展评估,结果显示ROVER在各类数据集(含OpenX Embodiment真实世界视频)中均优于GVL、TemporalConcat等基线方法,有效减少幻觉现象,且时间复杂度随视频长度线性增长。
二、创新点
- 提出ROVER递归框架:将复杂具身任务分解为子任务,实现局部聚焦推理与全局上下文的平衡,降低模型认知负荷。
- 设计子任务专用滑动窗口:每个子任务仅保留3帧关键帧(当前子任务首帧、最近前一帧、当前帧),使推理复杂度线性缩放。
- 构建多样化评估数据集:通过在专家轨迹中注入随机扰动,生成涵盖近最优到完全随机的多水平轨迹,附带细粒度进度标签。
- 建立多维度评估基准:涵盖帧级进度估计、帧级自然语言推理、视频问答,全面测试VLMs的视频时序理解能力。
三、核心章节翻译(Markdown格式)
Abstract
视觉语言模型(VLMs)在各类图像理解任务中展现出令
