复杂 Agent 每次回答前,都要重新带上一份很长的“员工手册”:它是谁、要守什么规则、能用哪些工具。手册越长,留给任务的上下文越少,处理成本也越高。Shopify 的 Gisting,做法是先把系统提示词压进少量“Gist 词元”——模型能读取、但并非供人阅读的主旨表示——再用它们代替原文参与推理。
据 InfoQ 报道,Shopify 将 Sidekick GraphQL 智能体约 6000 个词元的系统提示词压到 1500 个,压缩比为 4:1。团队自述,在每分钟 350 次请求的负载下,TTFT(请求发出到模型吐出第一个词元的时间)中位数从 438 毫秒降至 354 毫秒,端到端延迟从 6.8 秒降至 4.2 秒;QPS(每秒处理的请求数)则从 20.2 升至 23.4,且预测质量没有下降,因此可以减少 GPU 配置。
它的实用之处在于,训练完成后只需把学到的表示注册为特殊词元,不必改模型核心权重,也不需要另建推理路径。换句话说,这是一项 Agent 团队可以较快试验的工程优化;不过现有数字来自 Shopify 自述,材料未披露更广泛任务上的验证结果。