想在自己的电脑上跑大模型,常见难题不是模型不会答,而是显卡装不下、生成又太慢。这次,开发者 Azazelionide 扩展了 Garlic,让消费级 RTX 5060 Ti 运行 Qwen3.5 35B-A3B 的 FP8 版本。FP8 是用 8 位浮点数保存或计算数据,能减少显存和带宽开销,但也依赖软硬件配合,并可能涉及精度取舍。
35B-A3B 的意思是:模型总计约 350 亿参数,但生成每个 token 时只激活约 30 亿参数。它采用 MoE(混合专家模型),像一支按任务叫人上场的专家团队,不必每一步都动用全部参数。作者自述,实测速度为 55 tok/s;不录屏时可达 61 tok/s。tok/s 指每秒生成多少个文本片段,片段可能是一个字、词的一部分或标点。作者还称,这一结果未启用 MTP,且明显快于 llama.cpp 运行 Q8 量化版本;具体优化技巧仍待其后续文章披露。