Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
NEWS 约 1 分钟

VibeVoice ASR压向无GPU边缘CPU

VibeVoice-ASR 的 BitNet 压缩版可在普通 CPU 实时转写,让本地语音 Agent 少一道 GPU 门槛。

IMAGE — r/LocalLLaMA 日榜

想让电脑离线听写会议,或让本地语音 Agent 听懂指令,常见门槛是模型太大、还依赖独立 GPU。微软发布的 VibeVoice-ASR-BitNet,瞄准的正是普通电脑和终端设备:ASR(Automatic Speech Recognition,即把语音转成文字)直接在边缘 CPU 上运行,不必把录音送往云端。

它用 BitNet——把大量模型权重压到极少数取值的低比特方法——减轻存储和计算负担,并采用混合量化,把模型从 4.62 GB 压到 1.58 GB。项目方称,它在支持 AVX2 的 x86 或支持 NEON 的 ARM 设备上,只用至少 3 个 CPU 线程即可达到实时因子低于 1,也就是处理速度快于音频播放速度;推理速度为 Whisper.cpp 的 1.6 至 2.3 倍。

这条路线的意义不只是“模型更小”,而是把实时本地转写推进到无 GPU 设备上。项目已提供 llama.cpp、Ollama 等运行入口。不过,现有材料未披露具体测试硬件、语种准确率及完整对比条件,上述性能仍以项目方自述为准。


供稿材料 SOURCES — 1
01
microsoft/VibeVoice-ASR-BitNet r/LocalLLaMA 日榜 · NEWS
原文 ↗

← 返回 2026-07-30 · 开源板块