Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.029 — 2026-08-02
NEWS 约 1 分钟

audio.cpp一次接入九款音频模型

audio.cpp 0.5 新接九款模型,本地配音能控情绪,也能跨语言保留音色。

IMAGE — r/LocalLLaMA 日榜

想让 AI 念一句台词并不难,难的是让它像演员一样紧张地低声说话,中间喘气、停顿,甚至笑到声音发颤。audio.cpp 0.5 正在把这种能力装进同一套本地工具链:模型直接在自己的电脑或服务器上运行,不必每换一款语音模型,就重搭一套 Python 服务。

据项目作者介绍,0.5 一次接入九款模型。最醒目的是 DramaBox:它属于 TTS(Text-to-Speech,即把文字合成为语音),但更接近“按提示配戏”,可用文字控制情绪、语气、笑声、叹息、停顿、转折和说话者行为。Confucius4-TTS 则支持跨语言音色迁移——给它一段参考声音,再用另一种受支持的语言合成,重点是换了语言仍尽量保留“像谁说”。

其余新增能力覆盖变声、人声分离、语音识别等方向,包括 RVC、BS-RoFormer、GLM-TTS、Kroko ASR、Parakeet-TDT、Inflect Micro v2 和 Fun-ASR-Nano。版本还初步加入 AMD GPU 所需的 HIP/ROCm 支持,并改进 Apple Silicon 上的 Metal、实时 PCM 音频输入和流式转写。不过作者也提醒,部分早期接入以功能对齐为先,尤其非 CUDA 后端仍缺少针对性优化。


供稿材料 SOURCES — 1

← 返回 2026-08-02 · 开源板块