给本地 AI 服务器加显卡,有点像多找几个人搬家:人手翻倍,不代表速度翻倍,因为大家还要不断交接箱子。一位 LocalLLaMA 用户正考虑把四张 RTX 3060 12GB 扩到八张,并用 vLLM 做多 GPU 推理——把模型或请求分给多张显卡运行。他担心的不是显存够不够,而是八卡会不会反而拖慢生成。
这块主板可让四卡各用 PCIe 4.0 x16,八卡时则拆成 x8。PCIe 是显卡之间传数据的通道;通道变窄后,多卡同步、通信和调度可能吃掉新增算力。发帖者目前用三张 3060、llama.cpp 分层运行 Qwen 3.8 27B Q6,自报约 25 tokens/s,并猜测四卡 vLLM 或许能到 50 tokens/s,但这只是预期。
关键边界也在这里:原帖没有提供四卡与八卡的实测数据,无法据此判断八卡会快多少,或是否低于现有速度。它真正提醒低预算装机者的是:加卡首先增加可用显存,生成速度却未必随卡数线性增长;是否值得继续堆卡,要看具体推理方式的跨卡通信量,而不能只数 GPU。