你让 AI 帮忙订旅行。它先问预算,再推荐目的地;如果你不满意,它应换方案;信息齐全后,才进入确认。AI 也许能一直陪你聊到“预订完成”,却可能漏问日期、跳过确认,甚至在条件不满足时提前结束。对聊天来说,它说完了;对办事来说,它办错了。
这正是 Simon Dennis、Kevin Shabahang、Hao Guo 和 Rivaan Patil 在论文《Procedural Knowledge Is Not Low-Rank》中追问的问题:已经成为常用微调方案的 LoRA,能否把这种带分支、状态和终点的多步流程真正写进模型?他们给出的答案是:在仍有参数效率优势的 rank 范围内,标准 LoRA 明显不如全量微调。不过,全部证据来自这篇论文自身,尚无外部复现。
省参数,究竟省掉了什么?
微调是在已有模型上继续训练,让它学会新任务。全量微调会改动大量原始参数;LoRA(Low-Rank Adaptation)则冻结原模型,只训练较小的增量参数,因此更省存储和计算。
LoRA 的关键假设是“低秩”:一张庞大的参数表,不必朝所有方向修改,用少数几个变化方向就能概括。rank 可以粗略理解为允许 LoRA 使用多少个这样的方向。方向越少,改动越紧凑,但表达空间也越受限。
这种做法适合不少适配任务。问题在于,程序性知识不是记住一个事实或模仿一种文风,而是知道“下一步该做什么”:它要根据前面对话保存状态,遇到条件时选择分支,必要时循环检查,最后抵达正确的终止状态。论文检验的,正是这类知识能否塞进紧凑的参数改动里。
能聊到底,不等于把事办对
研究者把流程表示成有向图:节点对应对话步骤,边表示下一步走向,其中一些边附带条件。实验覆盖旅行预订、Zoom 技术支持和保险理赔。旅行与 Zoom 流程各有 14 个节点;保险理赔有 55 个节点,还包含嵌套循环和跨阶段依赖。
训练对话由 Claude Sonnet 4.5 按流程路径合成。推理时,模型只能看到自然对话,看不到流程图或节点标记。研究者再让 Claude Sonnet 4.5 模拟用户,并按 1—5 分评价任务成功、信息准确、状态一致、异常处理和自然程度;GPT-4.1 作为另一名独立裁判,得到相同的比较方向。
最直观的结果来自 3B 参数的旅行预订模型。LoRA 从 增至 ,可训练参数由 1300 万增至 1.04 亿,但任务成功分始终只有 2.10—2.54;全量微调达到 4.11,所有差异均为 。在这组实验里,更高 rank 甚至没有带来稳定改善: 得 2.54, 降到 2.10。
但 LoRA 并没有“聊崩”。各配置仍完成了 95.5%—99.0% 的对话。这里的“完成”只表示抵达了某个终点,不表示路径正确。模型可以维持流畅的多轮交流,却会漏掉决策节点、遗漏必要信息或过早收尾。论文由此区分了两种能力:把对话维持到结束,和按正确流程把事情办成。
换到 8B 模型,结果仍朝同一方向。Zoom 支持中,LoRA 与全量微调的差距较小;到了结构最复杂的保险理赔, 的任务成功分为 2.10,全量微调为 4.47。把 rank 从 32 提到 128,在 Zoom 和保险任务上的五项平均分只分别改善 0.06 和 0.24,未能追上全量微调。
不是没学够,而是学偏了
一个自然反问是:LoRA 会不会只是训练不足?论文跟踪了留出数据上的逐词预测损失。损失越低,表示模型越擅长猜中下一段文本。
结果很反直觉。LoRA 在第 3 轮训练时,平均损失已降到 0.81,低于全量微调最终的 0.89;可它的流程表现仍更差。尤其到对话后段,LoRA 的损失从 0.92 回升到 0.97,而全量微调继续从 1.02 降到 1.00。作者据此认为,LoRA 更擅长贴合问候、措辞和局部接话模式,却没有同样学好“当前处于哪个状态、下一步该走哪条边”。说白了,它把句子学得更像训练数据,不代表把办事规则学进去了。
一百多个方向,装不下这次改动
研究者还用 SVD(奇异值分解——把一张参数改动表拆成若干主要变化方向)分析全量微调前后的权重差。三个领域中,更新的平均有效秩为 761—1,026; 最多只能覆盖这些更新平方 Frobenius 范数的 43%—51%。后者可理解为:若把完整改动看成一股分散在许多方向上的“能量”,128 个方向连一半左右都装不下。
瓶颈主要出现在 MLP 层——模型内部负责把当前表示进一步转换的前馈计算部分。部分 MLP 权重更新的有效秩超过 1,300,保险任务的一个投影达到 1,872。相比之下,注意力模块中的 K/V 矩阵较小, 覆盖得更多。
这为行为差距提供了结构上的解释:全量微调实际做出的修改分散在数百乃至上千个方向,而统一使用较低 rank 的 LoRA 只能表达其中一部分。不过,SVD 展示的是全量微调更新难以被低秩近似,不能单独证明“高秩不足”就是行为差距的唯一因果机制。
为什么值得关注
LoRA 的吸引力来自一个实用承诺:不必重训整个模型,也能低成本加入新能力。这篇论文提醒我们,这个承诺可能取决于“要加入什么”。若任务只是让模型继续自然对话,LoRA 看起来可以工作;若任务要求它长期保存状态、遵守条件、不能漏步,参数效率与流程可靠性之间可能存在真实取舍。
论文标题把结论概括为“程序性知识不是低秩”,正文还称这是 agentic applications——让模型代替人连续采取行动的应用——的“根本限制”。这两个说法都比现有证据更宽。实验支持的更克制结论是:在三类客服式流程、Qwen 3B 与 8B 模型以及统一 rank 的标准 LoRA 设置中,实际可用的低秩更新不足以匹配全量微调。
局限与未知
- 三个任务都属于“收集信息—条件分流—处理完成”的客服式流程。临床问诊、科学实验或其他程序是否也呈现相同结构,论文没有回答。
- 实验只使用 Qwen 2.5 3B Instruct 与 Qwen3-8B。结果能否扩展到其他模型家族,仍需复现。
- 各层统一使用相同 rank 未必是最佳分配。论文推测可以给 MLP 更高 rank、给较小的 K/V 矩阵更低 rank,在总参数不变时改善效果,但并未实际测试。