本地编码Agent常遇到一个朴素难题:既要一次读完大量代码和日志,又不能把消费级显卡撑爆。作者把生成更精简的Swift 1.5与加速方案HyperQwen组合,在一张24GB显存的RTX 3090上配置了150K上下文——约15万个token的输入容量,并测试约630个任务。
据作者自测,Swift 1.5的INT4输出头版本平均每项任务用时68.2秒,比HyperQwen的W4A16快速量化基线108.1秒少约37%。它的解码速度其实略低,为107.2 TPS(每秒生成的token数),对照组为112.1 TPS;真正省下时间的原因,是平均输出从8985个token降到5669个。换句话说,它不是单纯“说得更快”,而是少绕弯子、因而更早做完。
质量并非全面不变:该版本在100题LiveCodeBench中为91%,但严格IFBench为72.3%,低于对照组73.3%。这些结果来自帖子作者测试,材料未披露更多复现细节;150K容量也不等于模型一定能有效利用最远处的信息。