Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.085 — 2026-09-27
NEWS 约 1 分钟

临床说话人分离迎来同场实测

四类说话人分离模型同测医患对话,Nemotron 3在准确率与速度间表现突出。

IMAGE — r/LocalLLaMA 日榜

一段问诊录音里,AI不仅要听清说了什么,还得分清哪句话是谁说的。若把医生的话算到患者头上,后续病历整理就可能从源头错位。这次,Omi 的 MajesticAd2862 把 Nemotron 3、Pyannote、Sortformer 和 VibeVoice 放到同一批 15 段模拟医患对话上测试,共约 2.4 小时;系统事先不知道有两个人,更接近真实使用。

评测采用 DER——漏掉、误收或分错说话人的时长占比,越低越好,并统一允许句子边界有 ±250 毫秒偏差。作者报告,批处理时 Pyannote Precision-3 的 DER 最低,为 2.891%;Nemotron 3 为 4.803%,但每段仅需 0.688 秒,是本地模型中最快。作为对照,Sortformer v1 为 6.778%,VibeVoice-ASR 为 8.233%。

这组结果比通用榜单更贴近语音 Agent 的实际取舍:最准确和最快并非同一个模型。不过样本只有 15 段,参考标注经过 VAD(语音活动检测)修整;作者还在同一数据上调过自有运行时,因此其优化后成绩不宜视作独立验证。说话人分离也只标出“说话人 A、B”,不会自动认出谁是医生、谁是患者。


供稿材料 SOURCES — 1

← 返回 2026-09-27 · 开源板块