你让 AI 从合同里找月保费,原文明明写着“每月 124 美元”,它却给错了答案。问题未必是凭空编造,也可能是选错数字、单位或对象。Kezhan Shi 认为,RAG(先检索相关文档,再据此回答)中的许多错答,应沿着解析、提问、检索和抽取链条排查,而不是统称为“幻觉”。文章据此归纳了七类模式。
最具体的改法,是把答案从一句话变成“有类型的生成契约”——预先规定必须填写金额、币种、周期、证据行、是否找到答案和置信度等字段,并在展示前校验。比如系统不再只说“保费是每月 124 美元”,而是分别交出数值 124、USD、month,以及对应原文位置。这样一旦出错,团队能看出究竟错在数字、单位、证据,还是根本没找到答案。
文章还主张让模型只抽取原始值,把汇率换算等计算交给可复查的 Python 程序。这个框架的价值不在于保证永不答错,而在于把笼统的“AI 又幻觉了”,改造成能定位、能测试的工程问题;供稿未提供七种模式的完整内容与系统性实验结果。