把答题交给更大的模型,不一定更稳。小模型答错时,大模型可能救回来;但小模型原本答对,大模型也可能把答案改错。模型级联——先用便宜的小模型,只把部分请求升级给昂贵模型——过去常把“它看起来很犹豫”当作升级理由,却没有回答更关键的问题:这次升级究竟会改善结果,还是添乱?
Signed Rescue Routing(SRR,带正负收益的救援路由)分别预测两件事:大模型纠正小模型的概率,以及大模型改错正确答案的概率,再用前者减后者,为请求排序。部署时,它只读取小模型给出的答案概率、置信差距、熵——也就是答案分布有多混乱——和题目长度等信息,不必预先运行大模型。
作者在 Qwen3-4B、Qwen3-8B 和 5,165 道选择题上的实验中,以准确率—算力曲线下面积衡量整体权衡:SRR 得到 0.6811,高于预测“小模型是否答错”的 0.6716,以及按熵路由的 0.6659。结果来自作者自述;它最值得注意的地方,是把路由目标从“哪里难”改成了“花这笔算力是否真有净收益”。