Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.083 — 2026-09-25
NEWS 约 1 分钟

两块矿卡跑出60 tok/s

约300美元的两块退役矿卡,合跑35B混合专家模型,实测约45至60 token/s。

IMAGE — r/LocalLLaMA 日榜

本地跑大模型,常见门槛不是模型不能算,而是装不下、硬件又太贵。一名 Reddit 用户给出了一个颇接地气的方案:用两块二手 BC-250——源自游戏主机芯片、后来用于挖矿的计算板——共同运行量化版 Qwen3.6-35B-A3B。两块板各约115美元,加上电源整套约300美元。

据原帖及评论,这不是两块板各跑一份模型,而是借助 llama.cpp、Vulkan 和 RPC,把同一个模型拆开合跑。Vulkan 让 AMD 硬件不依赖 CUDA 也能参与计算;RPC 则像隔着网线分工,把任务送到另一块板。两板通过 1Gb 以太网连接,合计约27GB可用 GPU 内存。作者报告生成速度随上下文长度变化,约为每秒45至60个 token。值得注意的是,35B 是模型总参数规模;MoE(混合专家)每次只调用部分“专家”,因此计算量相对较低,但完整权重仍须装进内存。这个玩家实验说明,退役矿机硬件确实可能压低本地推理门槛,不过量化精度、上下文长度、可用显存和网速仍需取舍。


供稿材料 SOURCES — 1

← 返回 2026-09-25 · 开源板块