让Agent判断一张工单该交给账单、技术还是销售团队,通常没必要让大模型先写出一句话。Nokia Applied Research等团队推出的AnyJev,选择直接读取LLM的隐藏状态——模型对输入形成的内部数字表示——再由一个很小的“决策头”把它转换成选项概率。整个过程只做一次前向传播,也就是让输入经过模型各层完成一次计算,不再逐词生成和解析文本。
最值得注意的是,团队称模型并非越深越好:他们把Qwen2.5-7B从28个计算模块截到18个后,分类准确率略有提高,概率校准也更好,同时速度更快。其解释是,中间层更适合作为线性决策头的输入;靠后的层已在忙着把答案组织成文字。AnyJev还能借助vLLM部署为在线决策服务,并用100至300条标注数据拟合决策头。不过,上述效果来自项目方自测,跨模型、跨任务是否稳定仍待更多验证。