Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.082 — 2026-09-24
NEWS 约 1 分钟

现有模型也能后接编码器

“模型嫁接”把现成的 Qwen3.5-4B 改成编码器—解码器,探索少重训、快读长文本的新路线。

像给一辆已经下线的车换传动结构,这项实验没有从头训练模型,而是把现成的 Qwen3.5-4B 事后改造成“因果编码器—解码器”:编码器先结合整段提示词形成上下文化表示,解码器再逐步生成答案。它值得关注,因为新架构通常要重新训练,而“模型嫁接”(Model Grafting)想尽量复用已有权重。

具体做法是从模型某一深度切开:下层负责读取提示词,上层继续承担生成;两部分通过初始状态接近直通的适配模块连接。改结构造成的能力损失,再用“自蒸馏”修补——让改造后的模型模仿原版模型。作者制作了 graft8 和 graft16 两个版本,并自述:在 128K 长度的提示词上,graft8 的处理速度约为原来的 3.7 倍,但准确率有所下降;graft16 更接近原模型,提示词处理约快 2 倍,准确率损失较小。材料未提供具体任务分数,因此这些速度与损失描述仍需更多评测验证。


供稿材料 SOURCES — 1

← 返回 2026-09-24 · 开源板块