让 AI 阅读上百页文档,像是要求人把每一页都放大细看后再回答问题:页数越多、图像越清晰,计算和显存负担就越重。Apple 的 LensVLM-9B 是一个 9B 规模的 VLM——能同时理解图像与文字的视觉语言模型——它尝试换一种读法:先扫描压缩后的页面图像,找到与问题可能相关的内容,再通过学到的工具,只把相关页面展开为未压缩版本。
这一步最值得注意,因为它把“全部精读”改成了“先浏览、后放大”,类似先看缩略图目录,再认真阅读少数关键页。对于既要识别文字、又要保留版式和图表关系的长文档,这提供了一条更节省计算的路线。不过,现有供稿未披露具体测试数字,因此目前能确认的是方法设计,尚不能据此判断它比其他方案快多少、准多少。