本地跑模型像请人逐字写稿:答案越长,等待越明显。llama.cpp——常用于个人电脑和服务器运行大模型的推理引擎——现已合入对GLM-5.2的NextN/MTP投机解码支持。它让额外预测模块先猜出多个后续词元,再交给主模型批量核对,目标是在不改变结果分布的前提下减少逐词等待。
这次更新也带来一个容易忽略的变化。据Reddit用户Shoddy_Bed3240提醒,近期版本会默认加载GGUF模型文件中的MTP/NextN张量,即使用户没有启用相关加速;过去这些权重只在开启投机解码时加载。多数社区GGUF会捆绑MTP模块,因此每次载入都可能增加RAM或显存占用,该用户估计约相当于多加载一层模型权重。换句话说,GLM-5.2终于可以借MTP提速,但本地玩家升级llama.cpp后,也应重新留意内存余量;现有材料没有给出实际提速幅度或不同配置下的占用数据。