编码Agent像在一份越来越长的工作记录末尾反复添几行:每轮改动很少,系统却常把整份记录重新“分词”——切成模型实际读取的token编号。论文分析153,951次调用发现,中位数每轮仅新增约1,400个字符,整个服务的提示缓存命中率却达94.1%。也就是说,模型端已经能复用大部分旧内容,CPU前端仍可能从头切一遍。
TokTier把分词改成有状态计算:保存上一轮的token,只重算新增文字和旧文本末尾的一小段。难点是,新字符可能改变原有的切分边界,旧结果不能直接拼接。它会逐次检查是否找到稳定边界;找不到就扩大重算窗口,最终退回完整分词,以保证结果与参考分词器完全一致。
作者报告,增量修补在10万至300万字符下耗时0.5—1.1毫秒;接入vLLM后,高负载时首个token的中位等待时间降低16%—34%。其17类分词器测试、12.4 TB文本扫描和9.3万余次Agent步骤回放未发现差异,但这些正确性与性能结果目前均来自论文作者的实验。