Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
PAPER H 1 约 1 分钟

全双工语音模型要按秒守时

DuplexCadence把语音服务变成按秒交卷:平均够快不算,次次准点才行。

语音 Agent 边听边说时,麻烦不只是“反应慢一点”。它每收到一秒声音,就得在下一秒到来前处理完,像每秒一班的车;偶尔误点,音频便会积压、卡顿。DuplexCadence因此把全双工语音——系统同时听取和生成语音——看成严格的周期调度问题,而不是只看平均延迟。

论文最具体的发现是:拖后腿的并非自回归生成——逐步产生语音表示的串行过程——而是把语音 token 转成音频波形的最后一段。这里有数千个小操作逐个送往 GPU,令其在总耗时中有 57%—65%处于等待;流解码器实际使用的工作区也只有已分配空间的七分之一。

DuplexCadence让模型把各处理环节的固定节拍和保留范围明确告诉运行时,据此只分配真正需要且地址稳定的状态内存,并提前记录所有可能出现的精确形状,整批重放操作而不填充。作者称,在四个已发布模型、三种解码器架构上,输出保持逐比特一致;实时说话阶段的平均耗时从超出一秒节拍14%,降到低于节拍2%。重点很朴素:语音 Agent 不仅要平均跑得快,还要每一秒都准时交卷。


供稿材料 SOURCES — 1

← 返回 2026-10-02 · 学术板块