同一句话问 AI 两次,模型、参数和随机种子都没变,答案却可能分叉。问题出在两个常用的省钱办法叠加后:前缀缓存会复用共享开头的中间结果,权重量化则像把模型参数的小数四舍五入。前者理应只提速,后者带来的细小误差,却可能让不同计算路径越走越远。
作者在两个推理引擎上运行 80 轮多回合工具调用任务,并固定请求顺序、采用单请求串行执行。开启缓存后,16 位精度下有 36.2% 的任务轨迹发生变化;降到四比特后,这一比例升至 75.0%。关闭缓存时,800 次重复执行则全部逐位一致。进一步恢复相同缓存状态后,缓存与重算两条路径各自都能在 40 项中完全复现,但两者仍有 14 项不同。换句话说,系统并非纯粹随机;答案还取决于请求里看不见、默认也不会重置的缓存历史。对需要测试、追踪故障或接受审计的线上服务,这意味着“相同请求”本身可能还不够。以上结果均为作者实验所述。