Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.063 — 2026-09-05
NEWS 约 1 分钟

PDF表格进RAG,别先压成纯文本

PDF表格一旦压成纯文本,数字还在,行列坐标却没了;这套方法主张先还原结构,再交给RAG。

IMAGE — Towards Data Science

你问 AI“华东区第二季度收入是多少”,它也许找到了数字,却不知道这个数字属于哪个地区、哪个季度。问题常出在 PDF:页面看着是表格,文件里却可能只是按坐标摆放的一堆文字。常见的 RAG(先检索文档片段,再让模型据此回答)若直接把它压成纯文本,就会切断行标题、列标题与单元格之间的关系,模型只能猜数字的归属。

Kezhan Shi 的文章建议,别把表格当成难处理的段落,而要尽早恢复其二维结构,再把它当数据处理。作者提出一套诊断方法和五种可组合操作,并区分四种表格表示层级。其中一个具体起点是“每行一条”:把表格的每一行保存成 Markdown 表格行,同时保留它在页面上的位置,方便检索、标注和引用。核心不是追求一种万能解析法,而是让数字进入检索系统时,仍带着表题、表头和行标签这些“坐标”。文章未在所给材料中披露量化效果,因此它目前更像一份实用的工程起点,而非已经由对照实验验证的最优方案。


供稿材料 SOURCES — 1

← 返回 2026-09-05 · 数据板块