一张扫描报表里,数字本身不难读,难的是看懂它属于哪一行、哪一列。普通 RAG——先找资料、再交给大模型作答——若只检索抽出的文字,往往会丢掉表格、图表和空间位置。腾讯 EVIE 转而做视觉文档检索:把整页当作带版式的图像编码,直接寻找相关页面。
真正值得留意的是它对检索成本的处理。Reddit 帖文称,EVIE-4.5B 可把每页约 750 个向量压缩到 32 个;每百万页索引占 3.81 GiB。向量可以理解为页面内容的数字指纹,数量越多,越能保留细节,但存储和搜索也越重。该模型还允许在运行时把表示截成 64 至 2048 维,无须分别训练多套模型,方便按精度与成本取舍。
按帖文披露,EVIE-8B 在 ViDoRe V3 上取得 66.75 nDCG@10,EVIE-4.5B 为 66.02;nDCG@10 衡量前十项搜索结果是否相关、排序是否靠前。这些成绩与压缩效果均来自发布方材料,摘要未提供独立复核结果。