让AI直接“看”论文原图,效果比读纯文本更好?这项研究给出了答案
核心结论
上海人工智能实验室联合中国科学技术大学、浙江大学、上海交通大学近日发布了一项研究成果,证明让AI大模型直接从科学论文的原始PDF页面图像中学习,比先将论文转换成纯文本再学习,在科学推理能力上表现更好,且只需消耗约四分之一的词元预算。
这篇题为《Scalable Visual Pretraining for Language Intelligence》的论文已于今年7月发布在arXiv平台。
一、一个被长期忽视的问题
目前主流的大模型预训练方式,都建立在同一个默认假设之上:所有值得学习的知识都可以无损地编码为文本词元序列。
基于这一假设,互联网上的论文、网页、文档在进入模型训练之前,都要经过一道“文字化”工序,要么解析HTML或LaTeX源码,要么用文档解析模型把PDF转成纯文本。
但科学论文的表达方式并不只有文字。
图表、排版的公式、页面的空间布局,这些视觉元素承载着大量文字难以完整转述的信息。举个例子,一张物理示意图中的几何关系、一组公式的排版结构、一张表格的行列对应关系,在转成纯文本的过程中往往会丢失或变形。
论文作者把这种现象称为“文字化损失”,将视觉信息压缩成纯文本的过程本身,就是一种有损压缩。

二、视觉预训练怎么做的
这项研究提出的方法叫做视觉预训练(简称VP),核心思路很简单:不再把论文PDF先转成文字再训练,而是直接把论文页面渲染成图像,让模型从图像中学习。
具体操作上,每一页论文图像先通过一个冻结的视觉编码器提取视觉特征。
系统会自动过滤掉页面中的空白区域(如页边距、空白处),只保留前景内容——文字、图表、公式等。
保留的视觉特征按照页面阅读顺序排列,通过一个线性投影层映射到大语言模型的隐藏空间,然后输入模型进行自回归训练。
训练目标也很有意思:模型需要预测下一个前景图像块的特征,而不是预测下一个文字词元。这个预测目标采用对比学习的方式,让模型学会区分正确的下一个图像块和其他图像块。
VP并不是完全抛弃文字训练。
实际的训练目标是将传统的文字词元预测和视觉特征预测结合起来,文字和视觉样本按固定比例混合训练。
三、实验结果
研究团队在Qwen3.5、Qwen3、Llama3.2 Vision和Llama3.1等多个主流模型上进行了对比实验。
所有实验都严格控制变量,VP和文字预训练(简称TP)使用完全相同的语料来源,唯一的区别是文档的表示方式。
结果如下:
在科学推理基准测试中,VP一致优于文字预训练。
以Qwen3.5为例,GPQA Diamond从76.24提升到79.29,提升了3.22个百分点;MMLU-Pro提升了约2.1个百分点。AIME 2025从74.99提升到76.98。在Llama 3.2 Vision上,GPQA Diamond从43.88提升到47.10,AIME从23.65提升到24.27。
效率方面的数据更值得关注。
处理同样的PDF语料库,VP只需要约200亿视觉词元,而TP需要处理约800亿文本词元。相当于用四分之一的数据量,达到了更好的效果。
研究还发现,VP的优势在视觉结构密度高的页面上尤为明显。在文字密集、结构简单的页面上,VP和TP表现相当;但在图表、公式、表格密集的页面上,VP的优势显著扩大。
此外,VP还能提升模型的多模态能力。
即便没有使用任何图像-文字配对的有监督数据,VP训练后的模型在多模态基准测试(如ChartQAPro、MathVista)上也有明显提升。
研究人员还发现,VP训练后,模型中视觉和文字两种模态的表示在向量空间中变得更加接近,全局聚类分离度从1.665下降到0.661,配对余弦相似度从0.631上升到0.907。

四、这意味着什么
这项研究的意义在于它挑战了一个行业默认的前提:训练语言模型必须用纯文本。
科学论文中的知识原本就以多模态的形式存在。
公式的拓扑结构、图表的空间关系、表格的对应逻辑——这些信息在转换成纯文本时会被削弱或扭曲。
VP的做法相当于绕过了这道有损压缩工序,让模型直接从原始文档中获取信息。
研究团队在论文的讨论部分也做了审慎的说明:VP并不是要取代文字预训练,而是在文字预训练的基础上增加一个视觉预训练阶段,让模型在保持文字暴露的同时,也能从文档的原始视觉形态中学习。
当然,这项研究也有局限性。
实验主要聚焦于高知识密度的科学PDF文档,这些文档中的视觉布局、图表、公式与语义含义高度耦合。
同样的策略能否推广到自然图像或视频等更广泛的视觉语料,还需要进一步研究。
但无论如何,这项研究指出了一个值得关注的方向,对于科学文档、图表、表格、公式这类视觉密度高的内容,让模型直接“看”原始页面,可能比先转成文字再“读”更高效,也更有信息量。

