Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
PAPER H 40 约 1 分钟

给KV缓存按重要性分层

HiKV把KV缓存分两层筛选,并用专用硬件缓解长上下文解码的显存瓶颈。

让 AI 处理长文,就像让人边写边保留越来越厚的草稿:内容越长,翻找越费时。这里的“草稿”叫 KV Cache——模型暂存在 GPU 显存里的中间结果,能避免每生成一个新词都从头计算。论文分析称,在 Llama3-8B-Instruct 上并行处理 64 个请求时,它占到超过 90% 的内存访问。

HiKV 的关键是把筛选做两遍。第一层按注意力——模型对历史内容分配的关注程度——淘汰不重要的 token(文字基本小块);第二层再检查留下 token 的内部向量,只读取影响较大的元素。换句话说,不仅决定“哪几页草稿值得留”,还只取每页真正有用的几行。团队同时设计了可重构排序器,让同一套专用硬件支持两种筛选,额外芯片面积为 8%。

作者报告,在准确率损失不超过 1% 时,HiKV 的注意力计算最高加速 7.95 倍、能耗降低 90%。这些结果来自论文自身评测,但它值得关注之处很明确:压缩策略若没有相应的数据访问和硬件设计,省下的显存未必能直接变成实际速度。


供稿材料 SOURCES — 1

← 返回 2026-07-30 · 学术板块