Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.020 — 2026-07-24
NEWS 约 1 分钟

不重训,也能给旧模型扩词表

LFM2.5把旧模型词表从65K扩到128K,用更少 token 处理多语言,无需从头预训练。

IMAGE — r/LocalLLaMA 日榜

同一句话,如果被 AI 的分词器切得太碎,就像一句话要分很多次说完:更占上下文,也要更多生成步骤。LFM2.5-8B-A1B 公布了一套“原位扩词表”配方——保留已经训练好的模型主体,把词表(模型能直接识别的 token 集合)从 65K 扩到 128K,不必从头预训练。

最巧的一步是,新词并非随机加入。团队保留原有 BPE(逐步把常见字符组合合并成 token)的全部规则,再用多语言语料继续合并。这样,每个新 token 都能拆回一串旧 token;它对应的模型参数,直接取这些旧 token 参数的平均值。旧词则原样继承。团队还称,一次训练全部参数会损害原本已擅长的部分,因此改成分阶段适配。

据团队自述,扩词后,Hindi 和 Vietnamese 表示同样文本所需的 token 分别约减少到原来的 1/2.4 和 1/2.6,Thai 最多减少到 1/4;他们据此估算,设备端按字符计算的解码速度可提高 2.2 至 3.7 倍,而原先表现较好的语言质量保持稳定。价值不只在数字:它给旧模型补语言短板提供了一条更省成本的工程路径。


供稿材料 SOURCES — 1

← 返回 2026-07-24 · 开源板块