Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.072 — 2026-09-14
PAPER 约 1 分钟

回答太长,也能靠低秩后训练治

LOCUS用低秩后训练压缩回答长度,在尽量保住效用的同时降低输出成本。

AI 明明一句话能答完,却常铺陈好几段。问题不只在阅读体验:Token——模型生成文字时处理的小片段——越多,服务耗时和算力成本通常越高。偏好对齐又可能把“更长”误学成“更好”。LOCUS 瞄准的正是这种无益冗长。

它没有给模型硬塞“少说点”的提示,也没有改写原有偏好训练目标。做法更像只拧少数关键旋钮:冻结模型主体,用低秩适配(LoRA,一组规模很小的附加参数)训练多个候选方案,再从开发数据中选出满足效用约束、输出最短的一个。候选方案会改变附加参数的规模、安装位置、覆盖层数和训练步数;换句话说,LOCUS把“在哪一小块参数空间里学习”也当成长度控制手段。

作者在 Anthropic HH-RLHF 对话偏好数据上报告:Pythia-2.8B 的续写长度最多减少 39.84%,Qwen2.5-3B 减少 14.87%—17.58%,仅更新 0.24%—0.28% 的参数,内部偏好诊断没有实质变化。值得注意的是,这些是论文作者在两款约 30 亿参数模型上的结果,能否推广到更大模型和真实服务仍待验证。


供稿材料 SOURCES — 1

← 返回 2026-09-14 · 学术板块