家里那张 RTX 3090 还没过时,但通用推理软件未必能把它的性能完全用出来。开发者 Brief-Tap-6616 为此做了 llamAmpere:一个从 llama.cpp 独立出来的 fork——也就是可单独维护和改造的仓库副本,专门围绕 Ampere 架构优化。Ampere 是 RTX 30 系显卡采用的一代 GPU 架构;llama.cpp 则负责把本地模型文件接到电脑的 CPU、GPU 上运行。
作者称,推荐配置运行其提供的 Qwen3.8-27B 量化模型时,在 10 万 token 范围内可达到每秒 90 多个 token,最长上下文可到 24 万 token。token 是模型切分文字的基本单位,每秒生成量(TPS)可粗略反映回复速度,但只有模型、上下文和设置一致时才适合横向比较。这条支线的意义很直接:它尝试用硬件专项优化,让大量 RTX 30 系存量显卡继续承担本地推理;代价是分支维护者还要自行跟进 llama.cpp 的更新和兼容问题。上述性能均为作者自述,材料未提供独立复测结果。