超大模型能不能在家用显卡上跑,第一关往往不是速度,而是能否装下。作者把 156 GB 的 DeepSeek V4-Flash-0731 完整官方权重,放进一台二手四路 Xeon DDR4 服务器,并搭配两张 RTX 3090:单个任务达到 33 tok/s,并行任务合计达到 68 tok/s。这里的 tok/s 是每秒生成的 token 数;“聚合吞吐”衡量整台机器同时服务多个任务的总产出,不等于单个用户看到的速度。
这个结果值得注意,因为它给消费级多卡部署补了一份具体参照。该模型是 284B 的 MoE——生成时只启用约 13B 参数,但完整权重仍要占据大量内存。作者采用 CPU-GPU 混合推理,把部分专家计算放进系统内存,并利用 NUMA 感知机制协调四路处理器的内存节点。权重没有再次量化,而是直接使用官方 checkpoint 中原生的 MXFP4 专家权重。以上速度与配置均来自作者自述;材料虽称其补测了 Prefill——模型先读完整段输入的阶段——但未给出具体数值,因此长提示词下的实际体验仍无法判断。