Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.081 — 2026-09-23
NEWS 约 1 分钟

Gemma 4有了专用高并发引擎

Gewell为Blackwell上的Gemma 4 31B量身优化,用更省显存的缓存设计服务高并发请求。

IMAGE — r/LocalLLaMA 日榜

多人同时调用一个 AI 服务,就像一群顾客挤进同一家厨房:单道菜做得快还不够,关键是怎样安排大量订单,又不把有限空间塞满。Gewell 是一款专门运行 Gemma 4 31B 的推理引擎——也就是负责显存调度、批处理和计算加速的软件层。它瞄准 NVIDIA Blackwell GPU,以及大量请求同时到来的特定负载。

最具体的一点是缓存。KV Cache 是模型生成文字时保存的中间结果,能避免反复重算,但会占用显存。作者称,Gemma 4 的部分权重结构允许 Gewell 只保存 V 和四分之一的 K,将这块缓存无损压到通常方案的 0.625 倍;恢复计算会多花一点算力,但读取的内存更少,也能在同样显存中容纳更长上下文或更多可复用的提示词前缀。

Gewell 还围绕检查点、内存卸载、重复提示的缓存淘汰策略和显式缓存提示来设计。它的意义不在于取代 vLLM 等通用引擎,而在于展示一种趋势:热门模型开始催生针对固定模型、硬件和业务模式深挖的专用推理栈。上述优势来自项目作者自述,材料未提供独立基准测试。


供稿材料 SOURCES — 1

← 返回 2026-09-23 · 开源板块