Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
PAPER 约 7 分钟

LoRA为何学不会多步流程

LoRA能把话说完,却常走错流程:省下的参数,可能正是复杂办事能力的代价。

你让 AI 帮忙订旅行。它先问预算,再推荐目的地;如果你不满意,它应换方案;信息齐全后,才进入确认。AI 也许能一直陪你聊到“预订完成”,却可能漏问日期、跳过确认,甚至在条件不满足时提前结束。对聊天来说,它说完了;对办事来说,它办错了。

这正是 Simon Dennis、Kevin Shabahang、Hao Guo 和 Rivaan Patil 在论文《Procedural Knowledge Is Not Low-Rank》中追问的问题:已经成为常用微调方案的 LoRA,能否把这种带分支、状态和终点的多步流程真正写进模型?他们给出的答案是:在仍有参数效率优势的 rank 范围内,标准 LoRA 明显不如全量微调。不过,全部证据来自这篇论文自身,尚无外部复现。

省参数,究竟省掉了什么?

微调是在已有模型上继续训练,让它学会新任务。全量微调会改动大量原始参数;LoRA(Low-Rank Adaptation)则冻结原模型,只训练较小的增量参数,因此更省存储和计算。

LoRA 的关键假设是“低秩”:一张庞大的参数表,不必朝所有方向修改,用少数几个变化方向就能概括。rank 可以粗略理解为允许 LoRA 使用多少个这样的方向。方向越少,改动越紧凑,但表达空间也越受限。

这种做法适合不少适配任务。问题在于,程序性知识不是记住一个事实或模仿一种文风,而是知道“下一步该做什么”:它要根据前面对话保存状态,遇到条件时选择分支,必要时循环检查,最后抵达正确的终止状态。论文检验的,正是这类知识能否塞进紧凑的参数改动里。

能聊到底,不等于把事办对

研究者把流程表示成有向图:节点对应对话步骤,边表示下一步走向,其中一些边附带条件。实验覆盖旅行预订、Zoom 技术支持和保险理赔。旅行与 Zoom 流程各有 14 个节点;保险理赔有 55 个节点,还包含嵌套循环和跨阶段依赖。

训练对话由 Claude Sonnet 4.5 按流程路径合成。推理时,模型只能看到自然对话,看不到流程图或节点标记。研究者再让 Claude Sonnet 4.5 模拟用户,并按 1—5 分评价任务成功、信息准确、状态一致、异常处理和自然程度;GPT-4.1 作为另一名独立裁判,得到相同的比较方向。

最直观的结果来自 3B 参数的旅行预订模型。LoRA 从 r=16 增至 r=128,可训练参数由 1300 万增至 1.04 亿,但任务成功分始终只有 2.10—2.54;全量微调达到 4.11,所有差异均为 p<0.001。在这组实验里,更高 rank 甚至没有带来稳定改善:r=32 得 2.54,r=128 降到 2.10。

但 LoRA 并没有“聊崩”。各配置仍完成了 95.5%—99.0% 的对话。这里的“完成”只表示抵达了某个终点,不表示路径正确。模型可以维持流畅的多轮交流,却会漏掉决策节点、遗漏必要信息或过早收尾。论文由此区分了两种能力:把对话维持到结束,和按正确流程把事情办成。

换到 8B 模型,结果仍朝同一方向。Zoom 支持中,LoRA 与全量微调的差距较小;到了结构最复杂的保险理赔,r=128 的任务成功分为 2.10,全量微调为 4.47。把 rank 从 32 提到 128,在 Zoom 和保险任务上的五项平均分只分别改善 0.06 和 0.24,未能追上全量微调。

不是没学够,而是学偏了

一个自然反问是:LoRA 会不会只是训练不足?论文跟踪了留出数据上的逐词预测损失。损失越低,表示模型越擅长猜中下一段文本。

结果很反直觉。LoRA 在第 3 轮训练时,平均损失已降到 0.81,低于全量微调最终的 0.89;可它的流程表现仍更差。尤其到对话后段,LoRA 的损失从 0.92 回升到 0.97,而全量微调继续从 1.02 降到 1.00。作者据此认为,LoRA 更擅长贴合问候、措辞和局部接话模式,却没有同样学好“当前处于哪个状态、下一步该走哪条边”。说白了,它把句子学得更像训练数据,不代表把办事规则学进去了。

一百多个方向,装不下这次改动

研究者还用 SVD(奇异值分解——把一张参数改动表拆成若干主要变化方向)分析全量微调前后的权重差。三个领域中,更新的平均有效秩为 761—1,026;r=128 最多只能覆盖这些更新平方 Frobenius 范数的 43%—51%。后者可理解为:若把完整改动看成一股分散在许多方向上的“能量”,128 个方向连一半左右都装不下。

瓶颈主要出现在 MLP 层——模型内部负责把当前表示进一步转换的前馈计算部分。部分 MLP 权重更新的有效秩超过 1,300,保险任务的一个投影达到 1,872。相比之下,注意力模块中的 K/V 矩阵较小,r=128 覆盖得更多。

这为行为差距提供了结构上的解释:全量微调实际做出的修改分散在数百乃至上千个方向,而统一使用较低 rank 的 LoRA 只能表达其中一部分。不过,SVD 展示的是全量微调更新难以被低秩近似,不能单独证明“高秩不足”就是行为差距的唯一因果机制。

为什么值得关注

LoRA 的吸引力来自一个实用承诺:不必重训整个模型,也能低成本加入新能力。这篇论文提醒我们,这个承诺可能取决于“要加入什么”。若任务只是让模型继续自然对话,LoRA 看起来可以工作;若任务要求它长期保存状态、遵守条件、不能漏步,参数效率与流程可靠性之间可能存在真实取舍。

论文标题把结论概括为“程序性知识不是低秩”,正文还称这是 agentic applications——让模型代替人连续采取行动的应用——的“根本限制”。这两个说法都比现有证据更宽。实验支持的更克制结论是:在三类客服式流程、Qwen 3B 与 8B 模型以及统一 rank 的标准 LoRA 设置中,实际可用的低秩更新不足以匹配全量微调。

局限与未知

  • 三个任务都属于“收集信息—条件分流—处理完成”的客服式流程。临床问诊、科学实验或其他程序是否也呈现相同结构,论文没有回答。
  • 实验只使用 Qwen 2.5 3B Instruct 与 Qwen3-8B。结果能否扩展到其他模型家族,仍需复现。
  • 各层统一使用相同 rank 未必是最佳分配。论文推测可以给 MLP 更高 rank、给较小的 K/V 矩阵更低 rank,在总参数不变时改善效果,但并未实际测试。

供稿材料 SOURCES — 1

← 返回 2026-07-30 · 学术板块