你让 AI 查“各地区销售额”,先给它一份数据库导览,听起来总比让它自己摸索靠谱。但这次工程实测给出了相反结果:表摘要——用自然语言解释每张表和字段用途——没有改善 Text-to-SQL,也就是把日常提问翻译成数据库查询的效果,反而明显增加了输入成本。
作者 renatyv 从 BEAVER 基准随机抽取 300 个问题,把数据装入 MySQL,并让具备只读权限的 pi 编程代理自行查询。直接访问数据库时,代理答对 31/299 题,正确率 10.4%,每题使用约 4.5 万个输入 token(模型处理文字的计量单位)。加入表摘要后,结果是 27/285,正确率降至 9.5%,输入升至 7.8 万 token;再加入 JOIN 提示——帮助模型判断表与表如何连接——也只有 30/292,正确率 10.3%,输入达到 8.5 万 token。摘要确实把每题数据库查询次数从 11.4 次降到 3.6 次,但没有换来更高正确率。作者据此认为,至少在这套复杂、多表的测试里,朴素方案更简单也更省;这是一位工程师的一次公开实验,不能直接外推到所有模型和数据库。