让 AI 从上千页报告里找答案,常见做法是先把文档切成小段,再把文字转成数字,按语义相似度搜索。问题是,“说得像”不等于“答得上”:切分还可能拆散表格、章节关系和跨页论证。PageIndex因此押注另一条路线,用推理式文档 RAG——先检索资料,再让模型回答——处理复杂长文档。
它不建向量数据库,也不固定切块,而是把文档整理成类似目录的层级树。收到问题后,大语言模型(LLM)先判断该看哪个章节,再逐层找到相关内容,像人翻目录查报告。最值得注意的一步是:树的骨架直接来自文档版式,模型只负责概括和修整;项目方称,这让索引阶段可使用较基础的模型,并让检索路径对应到明确位置。
这种方法保留了章节脉络,也能结合对话历史等上下文,但代价是每次检索都要让模型参与推理,计算量通常高于单纯的相似度搜索。项目页给出了成本和耗时估算,但现有材料未完整披露基准结果,实际准确率优势仍需更多证据支持。