Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.023 — 2026-07-27
NEWS 约 1 分钟

Agent集群把推理提速六倍

AI Agent 集群自动改写 GPU 程序,40多小时将生成速度提升至约6倍

IMAGE — r/LocalLLaMA 日榜

模型生成文字慢,不一定是“脑子”算得慢,也可能像厨房里工序太碎:每做一步都要重新叫人、搬材料。xenovatech 在 Reddit 展示了一次自动优化实验:多个 AI Agent——能自主规划、调用工具并检查结果的程序——协作超过 40 小时,把一个类 Kimi K3 模型的生成速度从每秒 65 个 token 提至 406 个。token 是模型生成文字时使用的小单位。上述结果目前来自作者自述,完整优化框架尚未发布。

这次最具体的变化,是把原本拆成 331 个节点的执行图——模型各项计算的流程图——不断改写、合并,最终让每生成一个 token 只需发起 22 次 GPU 任务。Agent 找到的关键手段包括算子融合,也就是把多个计算步骤合成一次执行,减少等待和中间数据搬运;最大增益则来自为 KDA、MLA 和 MoE(混合专家模型)定制的 WebGPU kernel——直接在 GPU 上运行的小程序。值得关注的不是某个模型又快了多少,而是自动优化内核开始给出可量化收益;但在代码、硬件配置和复现实验公开前,这仍是一份演示性结果。


供稿材料 SOURCES — 1

← 返回 2026-07-27 · 开源板块