把350亿参数的模型塞进一台普通笔记本,就像把一间仓库的货物放进小柜台:显卡装不下全部权重,只能不断从电脑内存取货,搬运过程很容易拖慢生成。InfoQ援引论文基准测试称,开源推理引擎 FreeToken 在8GB显存的 RTX 4060 笔记本上运行 Qwen3.6-35B,达到约每秒39个 Token——Token 是模型生成文字时处理的基本片段。
它的关键不是硬塞,而是边搬边算。面对混合专家模型(MoE,即每次只启用少数“专家”模块),FreeToken 会按实时传输带宽,把计算动态分给 CPU 和 GPU,并用双缓冲让权重通过 PCIe——内存与显卡之间的数据通道——传输时,GPU 继续工作。项目方还称,其解码速度比 Ollama 和 llama.cpp 快3至4倍。这个结果为消费级显卡本地部署大模型展示了新的优化空间,但目前数字来自论文及项目方测试,实际速度仍会受电脑内存、CPU和运行负载影响。