想在没有独立显卡的普通电脑上跑大模型,常见难题不是“能不能装”,而是“跑起来够不够快”。一则 Reddit 帖子称,POCKET-35B 无需 GPU,也不用修改 llama.cpp——一个跨平台的本地大模型运行工具——就能在 CPU 上达到 59 tok/s。tok/s 是每秒生成的 Token 数,可粗略理解为文字生成速度。
帖子列出了多个量化版本。量化就是用更低精度保存模型,以减少内存和计算量,但可能牺牲输出质量。其中 Q4_K_M 文件为 21 GB,建议配 32 GB 内存;Q2_K 为 13 GB,面向无 GPU 的迷你电脑;更激进的 IQ1_M 压到 8.2 GB,目标是 16 GB 内存设备。这个方向值得关注,因为它试图把 35B 规模模型带到消费级硬件上。不过,59 tok/s 目前只是帖子标题中的作者自述,材料未披露处理器型号、量化版本、上下文长度和测试设置,暂时无法公平比较,也仍需独立复测。