想在个人工作站跑大模型,常见难题不是机器完全算不动,而是模型连同加速组件根本装不下。sandropuppo称,他们把DeepSeek V4 Flash压缩到102.3GB,再加上11.3GB的投机草稿模型,一起塞进配有128GB统一内存的Ryzen AI MAX+ 395,并把生成速度推到约32 tok/s。统一内存就是CPU与集成GPU共用一池内存;投机解码则像让小模型先起草,再由大模型批量核对,以减少计算轮次。
这次压缩并非把所有参数一刀切成2位,而是按权重敏感程度混用约2至4位精度,最终平均约2.88位。作者称该成绩比7月25日LocalMaxxing上同款集成GPU的次快记录高68.5%,但也强调这不是受控对照测试。与此同时,llama.cpp正在审查DSpark投机解码支持,目前PR先覆盖Qwen3,DeepSeek V4仍列为后续;旧版V4 GGUF的聊天模板也需改用新版文件,否则可能破坏“保留思考”行为。