ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
Vi 论文 ViQ: Text-Aligned Visual Quantized Representations at Any Resolution 完整总结+分段双语翻译
一、论文整体概述与核心创新
(一)论文核心内容总结
本文由腾讯优视团队联合清华、南洋理工、中科院研究者提出ViQ——一款支持原生任意分辨率、文本对齐的离散视觉量化表征框架,解决多模态大模型(MLLM)中连续视觉特征与文本离散token不匹配、量化后细节/语义二选一、固定分辨率限制、训练开销巨大四大痛点。
现有视觉量化方案存在致命权衡:侧重重建的VQ类方法丢失高层语义;侧重多模态理解的量化模型压缩后底层细节严重丢失;同时主流CLIP/InternViT等视觉编码器仅支持固定输入尺寸,高维连续特征训练算力成本极高。
ViQ采用两阶段渐进式量化训练,打通“文本对齐预训练→渐进离散量化”完整流程,兼顾语义对齐、细粒度图像重建、任意分辨率自适应三大能力,同时大幅降低多模态训练耗时与图像存储体积。
大规模实验验证:
- 多模态理解:仅1.3B参数量的ViQ,搭配Qwen2.5-1.5B/7B主干,综合基准得分超越InternViT(6B参数量)等SOTA连续视觉编码器,大幅领先QLIP、UniTok等现有量化视觉模型,在OCR、文档、图表识别任务优势显著;<
