一台电脑同时接待几路 AI 对话,难点不只是把模型装进内存,还要避免每段长对话反复从头计算。这位开发者在 96GB Mac Studio 上托管 Qwen3.5 122B,选择“并发但不并行”:请求串行执行,却能保留各自的会话状态,让多名用户感觉对话都在持续推进。
关键是磁盘 KV 缓存——把模型已经算过的上下文状态存到 SSD,之后直接恢复。作者称,在一次持续 20 分钟、包含三路会话的测试中,系统收到 789,351 个提示词 token,GPU 只重新计算了 48,996 个,其余 93.8% 从磁盘缓存取回。换算下来,预填充计算量约减少 16 倍;预填充就是模型先读完整段提示词、建立上下文记录的阶段。
作者还移除了内存热缓存路径,改进部分缓存存储和淘汰策略。它展示的不是三路任务真正同时运算,而是在 96GB 内存约束下,用 SSD 和串行调度换取多会话服务;目前效果来自作者自测,材料未披露生成速度与更长期负载表现。