想在个人电脑上试一个大模型,光有模型介绍还不够,得先有本地工具能直接读取的文件。如今,K2-Horizon 的 GGUF 量化版已经开放下载。GGUF 量化版会用较低精度保存模型权重,以一定精度损失换取更低的内存门槛,方便 llama.cpp 一类本地推理工具运行。
据发布者 jacek2023 在 LocalLLaMA 社区列出的链接,目前可下载的版本包括 K2-Horizon 0.9B、3.7B、7B、32B,以及 K2-Horizon-MoVA-36B-A4B。后者是稀疏模型——每次运行只启用部分参数;“36B-A4B”通常表示总参数约 36B、单次激活约 4B。两者不能混为一谈:总参数更多影响文件大小和存储需求,激活参数则更直接关系计算成本。
这次进展的意义,是让讨论从榜单和配置估算走向真实机器上的测试。不过,发布帖同时提醒,相关 llama.cpp 合并请求仍在推进,当前需要使用专门的分支版本,而非直接依赖主线版本。