想在普通电脑上跑大模型,模型够小还不够,推理工具也得“认识”它。llama.cpp——一款支持CPU及多种GPU的本地推理引擎——出现了适配 Spark-X2.5 的实现提案;同时,1.7B 与 4B 两个版本已有 GGUF 文件。这里的 B 表示十亿参数,GGUF 则把模型权重和运行信息装进一个便于本地工具加载的文件。对个人用户来说,这意味着又多了一组更省内存、启动更快的通用模型选择。
这次值得留意的具体设计,是模型以一层全局注意力搭配三层滑动窗口注意力:前者查看完整上下文,后者只关注邻近内容,以降低处理长文本的计算负担。XHToken 自述,两款模型原生支持最长 100 万 token、覆盖 200 多种语言,并面向对话、写作、翻译、推理和编程等任务。不过,现有材料没有给出独立测试数据;llama.cpp 支持目前来自 Pull Request,不能据此判断它已进入正式版本。