过去,想在本地流畅运行总参数达 125B 的大模型,往往需要更昂贵的硬件。如今,开发者 Yaniss916 称,Qwen3.8-Flash-Next 已能在一台配备 Ryzen AI Max+ 395 和 128GB 内存的 Strix Halo 迷你主机上运行,生成速度达到每秒 44至59个 token——token 是模型处理文字的基本单位。具体速度随任务变化:聊天约47,代码约58,重复内容较多的编辑接近60。
关键在于这是 MoE(混合专家)模型:虽然总参数为 125B,但每次只启用其中 6B。团队还用了推测解码——先批量猜出若干 token,再交给主模型验证,将 Decode(逐字生成回答的阶段)从每秒32.7个 token 提升到44至59个。作者称,这种加速不会改变普通解码原本会生成的 token,并会在每次发布时检查一致性。
输入处理也不慢:作者报告,Prefill(模型开始回答前读取提示的阶段)在 4K、32K 和 128K 上下文下分别达到每秒1412、1486和1367个 token。95GB 的 EXL3 权重及基于 ExLlamaV3 的开源推理引擎 Kyojin 已同步发布;不过这仍是首个版本,速度与质量数据均来自作者自测。