做配音、整理口述稿,再让 AI Agent 开口,往往要在几个云端服务之间来回切换。开源项目 Voicebox 想把这套流程收进一个本地应用:声音样本、录音和模型都留在用户电脑上。项目登上 GitHub 趋势榜,单日获得 142 星,适合重视隐私、又不想被单一语音平台绑定的创作者留意。
据项目作者介绍,Voicebox 能用几秒录音进行语音克隆——学习一个人的音色,再合成相似声音;也能把文字转成人声,在任意输入框里听写。它集成 7 种 TTS(文本转语音)引擎,覆盖 23 种语言,并提供多轨故事编辑器,可编排对话、播客和叙事内容。通过 MCP——让 AI 应用统一连接工具的协议——兼容的 Agent 也能调用已克隆的声音说话。上述功能与“数据不离开设备”的说法来自项目自述;语音克隆仍需取得声音所有者授权,避免冒充与身份滥用。