本地跑大模型,难点不只在“装下模型”,还要给长对话留记忆空间。显存就像一张有限的工作台:模型越大、读入的内容越长,越容易摆不下。这份配置指南给出了一个具体实例:作者称,RX 7800 XT 这张16GB AMD显卡可运行Qwen 3.8 27B的Q4量化版——用较低精度压缩模型体积——并把上下文撑到约10万 token(模型处理文字的基本单位),解码速度约30 token/s,且未启用MTP。
关键在于精打细算显存。作者用GGUF格式保存量化模型,通过llama.cpp的Vulkan后端调用AMD GPU,不依赖CUDA;同时把KV cache——模型阅读长文时保存注意力信息的“草稿纸”——分别降到q8和q5精度,减少长上下文带来的占用。指南还给出了完整启动参数,方便同类硬件照着复现。不过这些性能数字来自作者在Reddit的自述,材料未提供独立测试、输出质量对比或不同上下文长度下的速度变化。