让几十个Agent同时尝试解题,就像复制几十间几乎一样的工作室:工具、项目文件和初始状态被反复存进内存,机器往往先耗尽内存,而不是算力。AgentZip瞄准的正是这类“高扇出”任务——一个任务派生许多并行沙箱。作者测得,76%至96%的内存页与初始模板或其他沙箱存在冗余。
它不要求两页内容完全相同,而是只记录沙箱页面相对模板的差异,并用共享字典收纳多个沙箱反复出现的字节模式。它还会压缩可能很快再次使用的“热”页面,再通过预取提前恢复;昂贵的压缩工作则安排在沙箱等待LLM生成下一条命令时进行。
据论文作者报告,在LLM训练和推理负载中,AgentZip最高把沙箱自有内存压缩到原来的约1/8.7,Linux配置约为1/2.1;预取和调度把激进压缩带来的最高3.1倍减速降至1.40倍,同时保留了几乎全部节省效果。