2025_NIPS_FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models
文章总结与翻译
一、主要内容
本文聚焦大型视觉语言模型(LVLMs)因大量视觉tokens导致的高计算成本问题,从信息流动视角重新审视视觉token冗余的本质,提出了名为FlowCut的信息流感知剪枝框架,核心内容如下:
- 问题分析:现有剪枝方法依赖单层注意力分数识别冗余token,忽略了token与层间的复杂交互,存在冗余识别矛盾、准则单一等局限。
- 核心发现:
- CLS token充当全局信息中继器,其行为可近似整体信息流,简化复杂交互分析;
- 冗余通过逐层注意力集中逐步动态涌现,而非静态属性;
- 仅依赖单层注意力分数会导致冗余识别矛盾,验证现有准则的不足。
- 框架设计:
- 注意力分布感知剪枝率:基于CLS token的注意力熵自适应调整剪枝强度;
- 多准则评估器:融合注意力强度、语义相似度和信息密度(Value向量L1范数)评估token重要性;
- 累积流重要性追踪:聚合跨层历史与当前分数,降低单一层级噪声影响。
- 实验结果:
- 在LLaVA-1.5-7B上,88.9% token削减下性能超SOTA 1.6%;
- 在LLaVA-NeXT-7B上,94.4% token削减下性能超SOTA 4.3%,预填
