让手机把一段播客脚本直接念成多人对话,难点不只是“能出声”,还要长时间记住不同人物的音色和轮次,同时不能撑爆内存。VibeVoice 1.5B正尝试把这种长篇、多说话人TTS(文字转语音)搬到iPhone本地运行。端侧推理意味着音频可留在设备上,也能少依赖云端。
据audio.cpp作者在Reddit发布帖自述,这个移动版约占2.2GB内存,生成速度最高为1.28倍实时;按生成吞吐量计算,即一分钟音频最快不到一分钟生成,但不代表声音能无延迟开始播放。作者还称,更长文本测试中的内存占用保持稳定。需要留意的是,公开演示约一分钟,生成过程经过加速播放,这些数字也尚未经过独立基准验证。截至发帖时,适配模型已上传,iOS示例源码、XCFramework(供iPhone或Mac应用接入的二进制库)和代码分支仍待发布。换句话说,手机端长语音生成已接近可用区间,但目前更像一次模型先行的实现展示。