让 AI 从病历或报告里整理姓名、日期和事件并不难,难的是追问一句:“这条结论原文在哪?”Google 开源的 Python 库 LangExtract,正是给抽取结果补上这张“出处卡”:它按用户指令把自由文本整理成固定字段,同时把每条结果绑定到原文中的准确位置,方便高亮回看,而不是只留下一个需要盲信的答案。
这对 RAG(检索增强生成,即先查资料、再据此回答)尤其有用。文档进入资料库前,LangExtract 可通过文本分块、并行处理和多轮扫描应对长文档,再生成一个可独立打开的交互式 HTML 页面,让人直接在上下文中审阅大量实体。用户只需给出任务说明和少量示例,无须微调模型;它既支持 Gemini 等云端模型,也可通过 Ollama 接入本地开源模型。项目同时提醒,推断是否准确,仍取决于所选模型、任务难度、提示词和示例质量。换句话说,它没有消除模型错误,但把最关键的核验路径保留下来了。