ServiceNow等机构造了一套“考场“,专门给视觉语言模型出难题
这项由ServiceNow AI研究院联合蒙特利尔大学和Mila人工智能研究所共同开展的研究,发表于2026年COLM(Conference on Language Modeling)会议,论文编号为arXiv:2607.10400v1,发布于2026年7月11日。有兴趣深入了解的读者可以通过该编号查询完整论文。
今天的人工智能模型处理文字已经越来越厉害,你随手扔给它一段英文合同、一份财报、甚至一本教科书,它往往能给出像模像样的回答。但有一类任务却一直让这些模型头疼——那就是处理几十上百页、图文表格混排的长篇文档。比如一份五十页的行业研究报告,里面既有大段文字分析,又穿插着各种折线图、柱状图、数据表格,还时不时会让你在第3页的图表和第47页的文字之间来回跳转才能回答一个问题。
这种场景,才是真实世界文档理解的日常。然而当研究人员想弄清楚,现有的视觉语言模型(也就是那种能同时"看图"和"读字"的AI)在这类任务上究竟哪里做得好、哪里彻底摔跟头,他们却发现手头没有合适的工具。现有的测试集要么只有单页文档,要么虽然文档很长但各种难度因素混在一起,根本没法说清楚模型到底是因为图表没看懂、还是因为证据分散在太多页、还是因为问题本身太复杂才答错的。
正是为了填补这个空白,研究团队构建了一套名为SynthDocBench的全合成、可控基准测试——用中文直译就是"合成文档测试台"。这套测试台的特别之处,在于它能像控制实验室实验一样,精确地调节文档的长度、版式结构、内容模态(是纯文字、还是图表、还是两者混合)以及问题难度,让每个因素都可以单独变化、独立分析。研究团队用它来考察了七款当前最前沿的视觉语言模型,结果发现了三种此前从未被系统揭示过的失败模式。
以下内容将带你走进这套测试台的设计逻辑和实验发现,整个过程可以用一个核心比喻来理解:把测试模型的过程看作一场精心设计的"驾照考试"。不同于以往那种把考生直接扔进真实路况的考法,SynthDocBench像是一个标准化驾考场,每条测试路线的坡度、弯道、限速牌都经过精确标定,这样才能准确判断考生是不会上坡、还是不会转弯、还是根本看不清路牌。
一、为什么需要一个"标准化驾考场"?
现有的文档理解测试集大多像是把考生直接扔进真实城市路况——文档来自真实的PDF报告、学术论文、法律合同,问题由人工标注,每份文档的版式、图表密度、文字风格都不一样。这种方式有其优点,因为它贴近现实。但当模型在这类测试上答错时,你根本没法确定原因:是图表太复杂了?是证据离得太远、横跨了太多页?是问题措辞有歧义?还是模型压根没在训练数据里见过这种版式?
早在几十年前,认知科学和NLP领域就发展出了一套解决这类困境的策略:合成数据。像bAbI任务集是专门用来测试语言推理基础能力的程序化生成问题集,CLEVR数据集是用来测试视觉关系推理的合成图像,PuzzleVQA则用抽象合成图案来诊断多模态推理瓶颈。这些工具的共同哲学是:牺牲一点生态效度(即与真实世界的相似程度),换取更高的因果可归因性。换句话说,驾考场里的路线虽然比真实路况简单,但正因为简单且标准,才能精确诊断你不会的那个动作。
SynthDocBench把这一哲学带进了长篇多模态文档理解领域。所有文档由程序化流水线从零生成,没有任何一份来自真实世界,这就确保了研究人员可以精确控制每个变量,然后独立分析每个因素对模型表现的影响。
二、这套"驾考场"是怎么造出来的?
SynthDocBench的文档生成过程分为三个紧密耦合的阶段,可以理解为先搭舞台、再布道具、最后写剧本。
搭舞台的阶段,流水线从一个话题种子出发——比如"气候变化政策"或"人工智能在教育中的应用"——利用大型语言模型从与该话题相关的公开信息中提取和重组内容,生成结构化的报告骨架,明确划分章节边界、标注哪些段落含有关键数据。
布道具的阶段,系统为每份文档选择一种版式风格。研究团队设计了六种版式原型,分别是杂志风格(大幅封面图、跨栏排版)、仪表盘风格(KPI卡片、密集图表网格)、学术风格(摘要框、编号章节)、编辑风格(大段落引用、章节标记)、信息图风格(全宽时间轴、数据标注)以及"野兽派"风格(厚重边框、等宽字体、超大数字)。系统有60%的概率按话题特点选择最匹配的版式,另外40%则完全随机分配,这个设计的目的是防止模型通过版式来猜测话题——就像驾考场会刻意混排不同难度的路线,让考生没法走捷径。
写剧本的阶段也是这套系统最精妙的环节。每个图表在生成时会同步输出两个版本:一个是视觉上真实可见的D3.js(一种网页图表渲染工具)渲染图,就是文档里读者能看到的那张图;另一个是隐藏的结构化元数据对象,记录着这张图的坐标轴标签、所有数据点的精确数值、以及从数据中可以派生的各种结论(最大值、最小值、趋势、异常点等)。这个"双层设计"是整套系统能避免人工标注的关键——所有标准答案都从这个隐藏的元数据对象中确定性地推导出来,不会有任何歧义。
整份文档最终以HTML格式组装完成,通过Playwright(一种网页自动化工具)渲染为PDF,同时输出配套的问答清单。最终的数据集包含200份合成报告,每份报告平均51.1页、约20568个单词、16.7张图表,覆盖24种不同的图表类型(从常见的柱状图、折线图、散点图,到视觉上更容易混淆的哑铃图、棒棒糖图、斜坡图、迷你折线网格等)以及6种版式原型。整个数据集共有1788道问题,按三类任务均分:图表阅读类597题、跨模态类594题、复杂多步推理类597题。三层质量控制机制确保了数据质量——对所有数值答案进行重新计算核验、用规则过滤器检查一致性、再对100道题进行人工抽查,接受率超过96%。
三、三类"考题"的设计逻辑
SynthDocBench的三类问题不是随便划分的,它们对应了三种在真实文档中最常见、也最具挑战性的信息提取场景。
图表阅读类问题,可以理解为"只看这张图,告诉我数字"。问题聚焦于单张图表的精确数值读取,分为三个子类型:直接读值(比如,这张柱状图里代表2019年的那根柱子有多高?)、比较(哪个类别的值最大?两者之间相差多少?)以及趋势判断(这条线在整体上是上升还是下降的?)。这类题看起来简单,但其实对模型的"像素级视觉解码"能力要求极高,因为答案必须精确,不能靠周围的文字来猜测。
跨模态类问题,则要求模型在文字和图表之间建立桥梁。以一个典型例子来理解:文档第8页某段话声称"过去十年间全球儿童早婚率显著下降",而对应的折线图在第12页,你必须先找到这张图,然后读出具体数字,才能确认或量化这个文字描述。这类问题被设计为图表和支撑文字故意不放在相邻位置,考察的是跨页面的模态整合能力。
复杂多步推理类问题,是难度最高的一档,需要模型从2到4个分散的证据单元中提取信息,然后组合推理得出答案。题目按难度分为L1到L5五级:L1是最直接的数值查询,L2是简单比较,L3是聚合计算(比如求平均或总和),L4是需要结合领域知识的推断(比如,为什么在给定背景下X会优于Y?),L5是最难的,要求解读视觉编码(比如,这张图里不同颜色的点各自代表什么含义?)。
四、七位"考生"进场,成绩单长什么样?
研究团队将七款前沿视觉语言模型送进了这个驾考场,分别是谷歌的Gemini-3.1-Pro、OpenAI的GPT-5.4和GPT-4o、Anthropic的Claude-Sonnet-4.5,以及开源阵营的Qwen3.5-VL-122B、Qwen3-VL-235B、InternVL3-78B,另外还加了一款相对小型的Qwen2.5-VL-7B做参照。
所有模型接受考试时,只能看到文档的渲染图像,完全无法访问底层HTML源码或元数据——就像驾照考试时考官只看你在真实路况下的操作,不接受"我知道理论上怎么做"。每份PDF被光栅化为144 DPI的页面图像,每5页拼接成一个垂直长图条,然后输入给模型。评分由GPT-5担任"考官",对每个(模型答案, 标准答案)对打出0到10分,6分及以上算"核心正确"。为了验证这位考官打分靠不靠谱,研究团队还用Gemini-3.1-Pro和Claude-Sonnet-4.5分别独立打分做交叉验证,结果GPT-5和Gemini作为考官时的分数差异在3.5个百分点以内,相关系数高于0.94,说明打分结果不会因为换个考官而大幅波动。
成绩单出来后,最引人注目的是整体排名:Gemini-3.1-Pro以0.725的整体准确率遥遥领先,位居第一;Qwen3.5-VL-122B(一款1220亿参数的开源混合专家模型)以0.655的准确率紧随其后;Qwen3-VL-235B排第三(0.586);GPT-5.4排第四(0.423),这个成绩出乎不少人预料——一款商业旗舰模型排在两款开源模型之后;GPT-4o(0.386)和InternVL3-78B(0.383)几乎打成平手,统计上无法区分;Claude-Sonnet-4.5排倒数第二(0.314);Qwen2.5-VL-7B以0.081的准确率垫底。
这个排名的另一面也很有意思:Gemini在DocVQA(单页文档理解)上只拿了93.4分,比Qwen3-VL-235B的96.5分低,但在SynthDocBench这个长文档战场上却反超了20多个百分点。这说明单页任务的能力和长文档处理能力之间的关联远比想象中复杂。
研究团队还专门做了一个OCR纯文字基线测试:用PyMuPDF工具从PDF里提取纯文本,然后让GPT-4o在没有任何图像的情况下只凭文字作答。结果非常有指向性——在复杂多步推理类问题上,纯文字模式的准确率高达0.798,而视觉模式只有0.360,说明这类问题的答案大多可以从文字中还原,模型需要的是文本理解能力而非视觉解码能力;但在图表阅读类问题上,结果完全反转,纯文字只有0.297,视觉模式有0.457,这证明图表问题真的需要看图,不能靠读文字蒙混过关。而Gemini在图表阅读上的准确率(0.759)比纯文字基线高出了整整46个百分点,清楚地表明视觉感知能力才是图表题的核心瓶颈。
五、被揭露的三种失败模式
考场设计的精妙之处,在于它让三种此前被遮蔽的失败模式清晰地浮出水面。这三种失败模式,就像驾考场把"不会上坡"、"不会倒车入库"和"看不清路牌"分开测试一样,终于被独立地观察和记录下来。
第一种失败模式是随推理深度加剧的性能退化。当问题从L1级(直接读值)上升到L5级(视觉编码解读),除Gemini之外所有模型的准确率都呈现出单调下降趋势。Claude-Sonnet-4.5从L1的0.382一路跌到L5的0.154,降幅高达23个百分点;GPT-4o在L1(0.271)上的表现甚至异常地低于L2(0.455),说明对它来说精确数值读取反而比组合推理更难,这是一个颇为奇特的反直觉现象。Gemini则是唯一一个在各难度级别上都保持相对平稳的模型(0.670到0.784之间波动),显示出更强的鲁棒性。
第二种失败模式是证据位置引发的系统性偏差。研究团队把每个图表在文档中的相对位置(第几张图/总图数)分成前三分之一、中间三分之一、后三分之一三个区间,然后分析图表阅读题的准确率与位置的关系。结果发现,八个被测模型中有五个在中间区域表现最差,比前三分之一区域低了5到18个百分点。Qwen3.5-VL-122B的这一降幅最为极端,从前段的0.820跌到中段的0.635,足足低了18.5个百分点,但有所回升地到了后段(0.660)。Claude-Sonnet-4.5则表现出从前到后单调下降的趋势(0.418→0.342→0.301,降幅11.7个百分点),是所有模型中这一趋势最陡峭的。Gemini-3.1-Pro则展现出一个典型的"U型"曲线(0.788→0.717→0.784),这与NLP领域早有记载的"迷失在中间"现象高度吻合——语言模型普遍对序列的开头和结尾记忆更清晰,而中间部分容易被稀释。
第三种失败模式是长文档背景下图表精确阅读能力的崩溃。这一点在与已有基准测试的比较中最为直观:同样的模型在ChartQA(单张独立图表问答)上能达到85%至91%的准确率,但放进五十多页的长文档背景后,图表阅读准确率普遍大幅下滑。OCR与视觉对比实验中那46个百分点的差距,以及模型在视觉幻觉错误(凭空报出图中不存在的数值)上的高度集中,都指向同一个结论:在长文档的"噪声"背景下,模型的像素级视觉解码能力出现了系统性退化,这与它们在孤立图表上的表现形成了鲜明反差。
六、细看错误,有哪些特别值得关注的发现?
研究团队从1788道题里挑出了所有被测模型都得分不超过3分的109道"全员失败题",并对失败原因进行了分类分析。在这109道题中,跨模态类问题占了58道(超过半数),而图表阅读类37道、复杂推理类14道。这说明在长文档场景下,最难攻克的挑战不是单纯的图表理解,而是在图表和文字之间建立准确的量化联系。
在具体的错误类型中,视觉幻觉(模型自信地报出了图中根本不存在的数值)是最主要的失败原因,集中出现在密集数值图表、哑铃图和多系列比较图上。模型定位到了图表,也识别出了目标元素,但在最后一步的像素级数值提取上出了错,而且报错通常非常有把握,不会说"我不确定"。图表未找到(模型说文档中找不到该图,但实际上该图确实存在)和精度错误(找对了图表和元素,但数字的量级或单位出错,比如把百分比当成绝对数值,或者把10亿级别读成百万级别)也是高频错误类型。
按问题细分类型来看,趋势与模式判断类问题是所有模型表现最好的,因为感知方向("上升"还是"下降")不需要精确数值提取,容错空间大;而数值读取和跨来源整合是最难的两类,分别对应了视觉精度瓶颈和跨模态对齐瓶颈。在复杂推理类问题中,技术性或定量推理题的模型间差距最大——Gemini得0.643,GPT-4o只有0.111,InternVL3只有0.156,这一64%对11%的鸿沟意味着定量多步推理能力才是区分顶级模型的真正试金石。
七、图像呈现方式如何影响成绩?
研究团队还对图像输入方式做了一系列消融实验(即单独改变一个参数观察效果的实验),发现了几个实用价值很高的规律。
首先是每条图像条中包含的页数。对Gemini来说,随着每条包含的页数从1增加到2、5、10,准确率从0.369持续上升至0.792,跨模态类问题的提升幅度最大(从0.339升至0.707),说明更多的上下文信息对于需要跨页整合证据的任务至关重要。但GPT-4o在每条2页时表现最好(0.396),增加到10页反而下降(0.354);Claude-Sonnet-4.5在每条5页时达到最优,之后保持平稳或略降。这表明不同模型对"最优信息密度"的需求不同,不存在一个对所有模型通用的最佳设置。
其次是图像分辨率。对Gemini来说,144 DPI是最优分辨率,提升到216 DPI性能反而略微下降,原因在于更高分辨率会增大图像文件大小,触发API的4MB压缩限制,JPEG压缩会损失图表的细节信息,得不偿失。
提示策略方面,对Claude来说,不使用系统提示词(直接让模型自由回答)时复杂推理类的准确率从0.337大幅跳升到0.515,说明"必须在2到4句话内回答"的指令约束反而压制了需要展开推理步骤的问题的表现。链式思维提示(让模型先拆分步骤再回答)对所有模型都有小幅提升,但在GPT-4o的图表阅读上反而有所下降,因为更长的输出增加了引入中间幻觉步骤的风险。
八、这套测试台的可信度有多高?
研究团队的外部效度检验(即验证这套测试的结果是否与真实世界的能力排名一致)给出了一个温和肯定的答案。SynthDocBench的整体准确率排名与MMLongBench-Doc(一个基于真实文档的长文档理解测试)的排名之间,Spearman等级相关系数为0.657,Pearson相关系数为0.683,说明两者之间存在中等程度的正相关——在SynthDocBench上表现好的模型,在MMLongBench-Doc上通常也不差,但排名并不完全一致。
有意思的偏差出现在GPT-4o身上:它在MMLongBench-Doc上排名第二,但在SynthDocBench上只排到第三。研究团队认为,这很可能是因为SynthDocBench对精确图表数值读取和跨模态对齐的要求远高于MMLongBench-Doc那个更异质化的真实文档题库,而这两项能力恰好是GPT-4o的薄弱环节。这种不完美的相关性本身就是一个有价值的信号:SynthDocBench测量的能力维度与现有测试并不完全重叠,它揭示的是额外的、此前被掩盖的模型局限。
研究团队在Gemini-3.1-Pro的突出优势上也保持了应有的审慎。Gemini与第二名(Qwen3.5-VL-122B,0.655)之间的差距高达7个百分点,与第三名的差距接近14个百分点。但研究团队指出,SynthDocBench使用HTML/D3.js渲染的图表,这种风格可能与Gemini的训练数据分布更相似,不能完全排除渲染风格熟悉程度对成绩的影响,未来需要用其他渲染后端重复验证才能确定。
归根结底,SynthDocBench做的事情,是给整个视觉语言模型领域设置了一个更精确的标尺。当前最强模型在DocVQA(单页文档)上已经逼近甚至超过人类基线,但在这套控制变量的长文档测试台上,即便是排名第一的Gemini也只拿到了72.5%——这还是在问题类型和文档结构都经过精心设计、相对公平的条件下。那些在图表上挣扎的模型、那些记不住文档中间内容的模型、那些随着问题变难而迅速崩溃的模型,它们在真实世界里处理一份复杂的商业报告或科研文献时,失败的风险会比这些数字所呈现的更高。
这对普通人来说意味着什么?如果你在工作中期望用AI来帮你处理那种又长又有图的报告,这项研究的结论是一个清醒的提醒:现在的AI在处理这类文档时,并不像它在处理短文本时那样可靠。它可能看漏了图表,可能把中间章节的数据搞混,也可能在需要对比第5页图表和第38页数字的问题上一败涂地。理解这些局限,才能更合理地使用这些工具,而不是把它们当作全知全能的"文档助手"。
至于研究团队本身,他们计划未来将SynthDocBench扩展到更多文档类型(如表格、表单、混合版式报告)、更长的上下文以及更多样化的推理任务,持续拓展这套"驾考场"的覆盖范围。
Q&A
Q1:SynthDocBench和DocVQA这类现有文档测试有什么本质区别?
A:DocVQA等测试使用的是真实文档,当模型答错时很难判断是因为图表难、还是文档太长、还是问题措辞模糊。SynthDocBench则完全合成生成,文档长度、图表数量、版式风格、问题难度都可以独立控制,像实验室实验一样逐一排查原因,这是它最核心的价值。
Q2:视觉语言模型在SynthDocBench上表现最差的是哪类题目?
A:跨模态类问题是所有模型共同的最难关,需要在不相邻的文字段落和图表之间建立量化联系。在所有模型集体失败的109道题中,跨模态题占了58道,超过了图表阅读类和复杂推理类的总和。
Q3:SynthDocBench里所说的"位置偏差"是什么意思?
A:研究发现,模型对文档中间部分的图表理解能力普遍弱于前段和后段,八个被测模型中有五个出现了这一规律,这被称为"迷失在中间"效应。最极端的例子是Qwen3.5-VL-122B,从前段到中段准确率下降了18.5个百分点。这意味着如果一份报告的关键图表恰好在中间,AI更可能在那里出错。
