一份合同有几十页,逐页识字不难,难的是别把跨页表格拆散,也别弄乱标题和正文的顺序。百度开源的 Unlimited-OCR 想解决的正是这个问题:它一次处理整份长文档,把文字、公式、表格和阅读顺序整理成结构化 Markdown。OCR 即光学字符识别,是把图片或扫描件转成可搜索、可编辑数据的技术。
模型支持 32K 长上下文——也就是一次能参考较大范围的内容。它共有 30 亿参数,但采用 MoE(多个“专家”模块、每次只调用一部分),推理时仅激活 5 亿参数,因此可以在用户自己的设备上运行。文件不必上传云端,这对合同、财务资料等敏感文档尤其有吸引力。
据 @VaibhavSisinty 发布的信息,Unlimited-OCR 在标准基准上准确率为 93%,比基线高 6 个百分点;处理超过 40 页后,错误率仍低于 0.11。不过,现有供稿仅为社交平台转述,未提供基准名称、设备要求和测试细节,这些数字仍需独立核查。