Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.016 — 2026-07-20
NEWS 约 1 分钟

Mac Studio单机托管一队122B会话

96GB Mac Studio借助磁盘缓存,稳定托管三路Qwen 122B会话

一台电脑同时接待几路 AI 对话,难点不只是把模型装进内存,还要避免每段长对话反复从头计算。这位开发者在 96GB Mac Studio 上托管 Qwen3.5 122B,选择“并发但不并行”:请求串行执行,却能保留各自的会话状态,让多名用户感觉对话都在持续推进。

关键是磁盘 KV 缓存——把模型已经算过的上下文状态存到 SSD,之后直接恢复。作者称,在一次持续 20 分钟、包含三路会话的测试中,系统收到 789,351 个提示词 token,GPU 只重新计算了 48,996 个,其余 93.8% 从磁盘缓存取回。换算下来,预填充计算量约减少 16 倍;预填充就是模型先读完整段提示词、建立上下文记录的阶段。

作者还移除了内存热缓存路径,改进部分缓存存储和淘汰策略。它展示的不是三路任务真正同时运算,而是在 96GB 内存约束下,用 SSD 和串行调度换取多会话服务;目前效果来自作者自测,材料未披露生成速度与更长期负载表现。


供稿材料 SOURCES — 1

← 返回 2026-07-20 · 开源板块