Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.073 — 2026-09-15
NEWS 约 1 分钟

24GB显卡跑进144K上下文

一套 vLLM 配置让 RTX 3090 跑起 27B INT4 模型,并把上下文窗口推至 144K。

IMAGE — r/LocalLLaMA 日榜

一张 24GB 显卡,既要装下 27B 模型,又要让它一次读进很长的材料,难点就像小书桌上既要摊开整本书,还得留出草稿空间。Reddit 用户 Altruistic_Heat_9531 分享了一套实测配置:在 RTX 3090 上通过 vLLM——负责调度显存并运行大模型的开源推理引擎——部署 Qwen3.8-27B,将权重压成 INT4(用 4 位整数缩小模型体积),并把上下文窗口设为 147,456,约合 144K。

真正腾出空间的另一环是 FP8 KV 缓存。KV 缓存相当于模型阅读长文时留下的中间笔记,文章越长越占显存;改用 8 位浮点格式,可以进一步压低开销。作者称,这套配置处理 10K 和 90K 提示词时分别达到约 1000 和 744 token/s,生成速度约为 42.3 和 34 token/s;其配置的实测上限约为 154K,但最终选择 144K。部署并非即开即用:编译和 CUDA Graph 捕获还会额外占显存,作者是在多次试错后改用 AOT(提前编译)才跑通。以上均为单名 Reddit 用户的自述,材料未提供独立复现或精度损失测试。


供稿材料 SOURCES — 1

← 返回 2026-09-15 · 开源板块