想在电脑上跑开源大模型,麻烦往往不在“模型能不能下载”,而在下载后才发现内存装不下,或速度慢得没法用。llmfit 把这道选型题压缩成一次 CLI 查询——CLI 就是输入命令来操作软件。它自动检查 CPU、系统内存 RAM、显卡及显存 VRAM,再按质量、速度、容量适配和上下文长度,为不同模型与运行方式给出建议。项目登上 GitHub Rust 热榜,单日新增 258 星。
它还会结合 GGUF、AWQ、GPTQ、EXL2 等量化格式估算资源需求;量化可以理解为压缩模型权重,用一定精度换取更低的内存占用。更值得注意的是,llmfit 支持直接在本机做 Benchmark——按固定条件测出实际生成速度,并把 tok/s(每秒生成多少个词元)保存下来,替换规格推算值;用户也可从终端界面提交结果,供相同硬件参考。不过估算终究不是实测,真实表现仍会受推理引擎和任务长度影响。