给视频换一种语言配音,通常得先把每个字词钉在时间轴上:哪句话从第几秒说到第几秒,都要预先标好。Meta于9月3日提交的论文提出Text-Audiobox(Text-AB),让模型直接读取原始文本,自行学习文字与声音的对应关系,省去“强制对齐”和逐段预测时长。这不只简化配音流程,也适用于全双工对话——双方能同时说和听,系统还要处理插话、回应声与自然轮替。
据arXiv论文摘要,Text-AB先用DAC-VAE把48 kHz声音压缩为每秒25个“潜在表示”——可以理解为更短的声音内部编码——再交给Diffusion Transformer逐步合成音频。作者称,这比此前采用的EnCodec表示压缩率提高逾10倍,同时改善重建质量。模型以48万小时单语语音预训练,规模为30亿参数;一次可生成约一分钟语音,也能用multi-diffusion拼接更长内容。
作者报告称,系统在内部真实配音基准上改善了韵律、音色相似度和自然度,短对话接近人类录音。不过这些效果来自论文自述和内部基准,尚缺少独立验证。