把财务报表里的数字搬进数据库,听起来像复制表格。问题在于,PDF 保存的往往只是文字和图形在页面上的位置;人眼看到的行列,程序读到的可能是一堆分散坐标。扫描件还要先经过 OCR——把图片里的字变成文本——但 OCR 并不会自动理解哪个数字对应哪个字段。
这则工程讨论来自一项概念验证:作者想抽取 PDF 数据,再写入 Delta 表——一种带事务日志、版本和格式约束的湖仓表,方便后续追加、更新和追溯。作者比较了 Databricks 的 IDP、Azure 方案和 Python 库后,观察到一个实际障碍:PDF 版式一旦不固定,多数工具的抽取逻辑就可能失败,或给出错误数据。IDP 是把 OCR、页面布局分析和字段抽取串起来的文档处理流程。
它值得作为方案选型入口,也正因为答案尚未给出:原帖没有披露最终采用的工具、准确率或生产架构。现有信息更像一张风险提示——写入 Delta 表只是末端,真正决定可靠性的,是系统如何应对模板变化,并发现错误抽取。