Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.025 — 2026-07-29
PAPER 约 1 分钟

文档模型学会指出证据

让模型先引用原文,再由检索器定位页面证据,绕开难学的坐标输出。

你让 AI 阅读一份长报告,它可能答对问题,却圈错支撑答案的段落。问题未必全在“没看懂”:要求模型直接报出边界框——用坐标圈定页面区域——本身就是一道额外难题。Liu 等人换了个接口:模型只需逐字引用证据,再由多模态检索器把引文对应到版面解析器划出的段落、表格或图片区域。

作者在 719 道经核验的双语 CiteVQA 问题上比较了六个开源视觉语言模型。其自述结果显示,改用引文后,证据召回率从坐标方案最高 8.1 提升至 25.9—46.9;“归因幻觉”——答案正确但证据区域错误——也从 82%—97%降至 39%—65%,而答案质量变化不大。这说明部分失败可能来自坐标表达,而非模型完全找不到依据。

这套“先引用、再定位”的流程还能辅助训练:无需人工标注证据区域,只用标准答案和检索到的页面裁剪图生成奖励。作者称,它把一个 8B 模型的严格归因准确率从 22.4 提高到 33.8。代价是系统仍依赖版面解析器、检索器和评审模型,可靠性不只取决于回答模型本身。


供稿材料 SOURCES — 1

← 返回 2026-07-29 · 学术板块