想让本地 AI 用一段录音里的声音读出新文字,以前往往要另装专用工具、维护一套适配代码。现在,Qwen3-TTS 的语音克隆已经进入 llama.cpp 主线——也就是项目的主要开发分支,不再只是几个月前的实验演示。对已经采用 llama.cpp 的项目来说,本地语音输出由此少了一层自建适配。
据 Reddit 用户 BTA_Labs 介绍,目前支持 GGUF 格式的 Qwen3-TTS-12Hz-1.7B-Base,可把 WAV 或 MP3 作为说话人参考,并通过 llama-tts 命令行程序生成音频,覆盖中、英、日、韩等十种语言。语音克隆指的是从参考录音提取音色,再用相近声音朗读新文本;Qwen 称约三秒录音即可,但目前还没有独立测试证明 llama.cpp 版本在音色相似度和稳定性上能追平原始 PyTorch 实现。
边界也很清楚:当前只覆盖 1.7B Base 模型,服务器接口仍是草案,也缺少与专用实现的速度、内存和长文本稳定性对比。它的意义暂时不在性能胜负,而在于把语音克隆纳入一套更通用、有人持续维护的本地工具链。