Microsoft Research发布了一项名为VibeVoice-ASR-Streaming的流式说话人归属语音识别技术报告。该技术基于VibeVoice-ASR模型,将说话人识别和语音识别两个任务统一在一个模型中。VibeVoice-ASR-Streaming能够实时输出“谁说了什么”,无需单独的说话人识别阶段。在转录准确性方面,该技术的7B模型在五个评估集中实现了最低的平均WER/CER。在说话人归属方面,它在13个评估设置中的12个中取得了最佳或并列最佳的成绩。此外,该技术还发布了1.5B和7B模型权重以及推理代码。
Microsoft Research 发布 VibeVoice-ASR-Streaming 技术报告,提出基于 LLM 的端到端流式说话人归属 ASR,将音频块、0.5 秒 lookahead 和已有文本交错在单一自回归上下文中,无需独立 diarization 阶段即可随语音到达输出谁说了什么。
原始发布方:HuggingFace Daily Papers(社区热门论文)
原文时间:2026-09-02 08:00:00 +08:00
