你让 AI 改一个真实项目,难点往往不是写出某一段代码,而是让它连续查文件、调用工具、修改多处内容,再确认整个任务真的完成。Kimi K2.7 Code 瞄准的正是这种长流程软件工程工作。它的官方成绩较上一代明显提高;与此同时,社区已尝试把第三方量化版塞进单台 DGX Spark。两件事放在一起看,恰好呈现了超大编码模型的两面:能力在向上走,本地运行却仍是一场存储与搬运的精细调度。
本文的模型信息和成绩来自 Moonshot AI 的 Hugging Face 页面;单机速度来自一名 Reddit 用户的特定配置实测,不能视为官方性能,也不能直接外推到其他电脑。
它想把代码任务做得更完整
Moonshot AI 将 Kimi K2.7 Code 定义为基于 Kimi K2.6 构建的编码智能体模型。编码模型,是以理解、生成和修改代码,以及使用软件工具为主要能力的大语言模型;“智能体”则强调它不只回答问题,还要连续执行多个步骤。
官方称,新模型重点改善真实世界中的长流程编码任务,并提高从接单到交付的端到端完成能力。它还减少了约 30% 的“思考 token”用量。token 可以理解为模型处理文字和代码时使用的小片段;思考 token 越少,意味着它在内部推理阶段消耗的生成量更低。不过,材料没有给出相应的时间或成本数据,因此不能把这 30% 直接换算成速度或费用降幅。
官方自测中,Kimi Code Bench v2 从 K2.6 的 50.9 升至 62.0,Program Bench 从 48.3 升至 53.6,MLS Bench Lite 从 26.7 升至 35.1。工具与智能体测试也有提升:MCP Atlas 从 69.4 升至 76.0,MCP Mark Verified 从 72.8 升至 81.1。
这些数字支持“较上一代进步”,却不支持“已经领先”。在同一张官方表格里,Kimi K2.7 Code 的多项成绩仍低于 GPT-5.5 或 Claude Opus 4.8。例如 Kimi Code Bench v2 得分为 62.0,对照模型分别为 69.0 和 67.4;但在 MCP Mark Verified 上,它的 81.1 高于 Claude Opus 4.8 的 76.4,仍低于 GPT-5.5 的 92.9。测试运行方式也并不完全一致:Kimi 使用 Kimi Code CLI,另外两款模型分别运行在 Codex 和 Claude Code 中。
万亿参数,不等于每次都算万亿次
Kimi K2.7 Code 采用 MoE(Mixture of Experts,混合专家)架构。可以把它想成一个很大的专家团队:团队共有许多成员,但每处理一个 token,只叫其中少数人上场。
官方页面列出的总参数量为 1T,即一万亿;每次激活约 32B,即 320 亿。模型共有 384 个专家,每个 token 选择其中 8 个,另有 1 个共享专家。这能减少单次计算量,却不会让其余权重凭空消失。全部专家仍要存放在某处,并在需要时及时搬到计算设备。
模型提供 256K 上下文长度,也就是一次可接收较长的代码和文字。官方页面列出了 Transformers、vLLM、SGLang 和 Docker 等调用或部署入口。页面还出现图文输入示例,并列出 MoonViT 视觉编码器;但现有材料可能包含 Hugging Face 自动模板内容,尚不足以稳妥确认其原生视觉能力,本文不把它称为多模态模型。
单台 DGX Spark 跑起来,关键是搬东西
社区测试使用的不是官方原始发布对象,而是第三方 Kimi-K2.7-Code.i1-IQ_S.gguf 量化文件。量化是用更紧凑的数字格式保存模型,以降低存储和运行负担。该文件约 204GB,帖子将其标为 1T.A32B,但这一标注没有得到官方材料交叉验证。
测试者使用 llama.cpp——一个常用于本地运行量化模型的开源推理工具——把 MoE 专家放在不同存储层之间调度。核心办法是“专家缓存”:把更可能用到的专家权重留在较快的位置,其余放进主机内存或通过磁盘映射读取。像把常用资料摊在桌上,不常用的先留在文件柜里;省下桌面空间的代价,是需要不断取放。
在单台 DGX Spark 的特定方案下,帖子报告 pp512 为 tokens/s,tg128 为 tokens/s。pp 可理解为模型阅读输入的速度,tg 则是逐步生成输出的速度。对照的纯 CPU mmap 方案分别只有 和 tokens/s。结果说明,缓存和卸载策略能显著改变同一设备上的表现,也说明“模型能加载”与“模型跑得实用”是两回事。
为什么值得关注
Kimi K2.7 Code 的看点,不只是又一个更大的编码模型。官方数据表明,它在多项长流程编码与工具测试中超过 K2.6;社区实验则展示了 MoE 的现实价值:虽然全部权重很大,每次真正参与计算的只是其中一部分,因此可以用缓存和数据搬运换取单机运行的可能。
但这也重新定义了“本地可运行”。约 204GB 的量化文件、统一内存、特定 llama.cpp 编译选项、专家卸载规则、批量大小和内存固定方式,都是成绩的一部分。这里的工程成果不是让硬件代价消失,而是更聪明地安排代价出现在哪里。
局限与未知
- 现有材料没有许可证、权重开放范围和训练信息,因此无法确认它是否符合严格意义上的“开源模型”。
- 官方未提供足够信息让读者独立判断各项基准的覆盖范围;其中 Kimi Code Bench v2 是内部基准,成绩应视为官方自报结果。
- DGX Spark 数据来自单一社区用户和特定第三方量化版,展示的是一套配置的可行性,不代表官方速度,也不代表普通电脑能复现。