Microsoft Research 发布 VibeVoice-ASR-Streaming 流式说话人归属语音识别技术报告

内容摘要
Microsoft Research发布了一项名为VibeVoice-ASR-Streaming的流式说话人归属语音识别技术报告。该技术基于VibeVoice-ASR模型,将说话人识别和语音识别两个任务统一在一个模型中。VibeVoice-ASR-Streaming能够实时输出“谁说了什么”,无需单独的说话人识别阶段。在转录准确性方面,该技术的7B模型在五个评估集中实现了最低的平均WER/CER。在说话人归属方面,它在13个评估设置中的12个中取得了最佳或并列最佳的成绩。此外,该技术还发布了1.5B和7B模型权重以及推理代码。
Microsoft Research发布了一项名为VibeVoice-ASR-Streaming的流式说话人归属语音识别技术报告。该技术基于VibeVoice-ASR模型,将说话人识别和语音识别两个任务统一在一个模型中。VibeVoice-ASR-Streaming能够实时输出“谁说了什么”,无需单独的说话人识别阶段。在转录准确性方面,该技术的7B模型在五个评估集中实现了最低的平均WER/CER。在说话人归属方面,它在13个评估设置中的12个中取得了最佳或并列最佳的成绩。此外,该技术还发布了1.5B和7B模型权重以及推理代码。

Microsoft Research 发布 VibeVoice-ASR-Streaming 技术报告,提出基于 LLM 的端到端流式说话人归属 ASR,将音频块、0.5 秒 lookahead 和已有文本交错在单一自回归上下文中,无需独立 diarization 阶段即可随语音到达输出谁说了什么。

原始发布方:HuggingFace Daily Papers(社区热门论文)

原文时间:2026-09-02 08:00:00 +08:00

阅读原文 · 数据来源:AIHOT

提示

本文用于信息整理与经验分享。第三方订阅、支付及账号服务可能调整,实际规则、价格和可用性请以下单页面及服务方最新说明为准。

咨询 GPT 充值咨询充值