Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.063 — 2026-09-05
NEWS 约 1 分钟

Nemotron Puzzle 75B接入llama.cpp

75B 混合架构模型现可通过 llama.cpp 本地运行,专用生成加速仍待接入。

IMAGE — r/LocalLLaMA 日榜

想在个人电脑上试跑新模型,第一关不是“跑得多快”,而是推理工具能不能读懂它。llama.cpp——让多种大模型在本地设备运行的常用项目——现已加入 NVIDIA Nemotron-3-Puzzle-75B-A9B 支持。这意味着,这款结构特殊的 75B 模型已经可以本地运行。

它把 Mamba、MoE 和 Attention 层交错排列:Mamba 用递推状态处理序列,Attention 会衡量上下文各处的重要性;MoE 则只调用部分“专家”参数参与每次计算。相比其母模型的 120.7B 总参数、12.8B 活跃参数,Puzzle 缩至 75.3B 和 9.3B,因此成为一个值得尝试的中间尺寸。

不过,目前接入只解决了“能跑”。模型支持的 MTP(一次提出多个后续 token,再验证是否可用)尚未在 llama.cpp 中实现,因此这项原本用于减少逐字生成等待的加速能力,还要继续补齐。


供稿材料 SOURCES — 1

← 返回 2026-09-05 · 开源板块