微软开源语音 AI 项目,通过混合量化将 ASR 模型从 4.62GB 压缩到 1.58GB,支持边缘 CPU 实时推理。对语音处理相关的开发者有直接参考价值。
2026-07-23:⚡ 我们发布了 VibeVoice-ASR-BitNet,一个用于 VibeVoice-ASR 的边缘 CPU 推理引擎。通过异构量化(I8_S + I2_S),模型从 4.62 GB 压缩至 1.58 GB,在 3+ 个 CPU 线程上实现实时推理(RTF < 1)— 无需 GPU。[Code] [Models] [Report]
2026-03-12:🚀 VibeVoice-ASR 现已集成到 Azure AI Foundry Labs!您现在可以直接通过 Microsoft Foundry 探索和测试我们统一的语音转文本功能。
2026-03-06:🚀 VibeVoice ASR 现已成为 Transformers 发布的一部分!您现在可以直接通过 Hugging Face Transformers 库使用我们的语音识别模型,以无缝集成到您的项目中。
2026-01-21:📣 我们开源了 VibeVoice-ASR,一个统一的语音转文本模型,设计用于在单次传递中处理长达 60 分钟的长形式音频,生成结构化转录文本,包含 Who(发言人)、When(时间戳)和 What(内容),并支持用户自定义上下文。在 Playground 中尝试。
⭐️ VibeVoice-ASR 原生支持多语言,支持超过 50 种语言 — 详见支持的语言列表。
🔥 VibeVoice-ASR 微调代码现已推出!
⚡️ 现已支持 vLLM 推理以加快推理速度;详见 vllm-asr。
📑 VibeVoice-ASR 技术报告已发布。
2025-12-16:📣 我们为 VibeVoice‑Realtime‑0.5B 添加了实验性语音,用于探索,包括九种语言的多语言语音(DE、FR、IT、JP、KR、NL、PL、PT、ES)和 11 种不同的英文风格语音。尝试一下。更多语音类型将不断添加。
2025-12-03:📣 我们开源了 VibeVoice‑Realtime‑0.5B,一个支持流式文本输入和强大的长形式语音生成的实时文本转语音模型。在 Colab 上尝试。
2025-09-05:VibeVoice 是一个开源研究框架,旨在促进语音合成社区的协作。发布后,我们发现该工具在某些方面的使用与规定的意图不符。由于负责任地使用 AI 是微软的指导原则之一,我们已从该仓库中删除了 VibeVoice-TTS 代码。
2025-08-25:📣 我们开源了 VibeVoice-TTS,一个长形式多语音者文本转语音模型,可以合成长达 90 分钟、最多 4 个不同语音者的语音。— 被接受为 ICLR 2026 口头报告!🔥
VibeVoice 是一个开源前沿语音 AI 模型家族,包括文本转语音(TTS)和自动语音识别(ASR)模型。
VibeVoice 的核心创新是使用以超低帧率 7.5 Hz 运行的连续语音分词器(声学和语义)。这些分词器能够高效保留音频保真度,同时显著提升处理长序列的计算效率。VibeVoice 采用下一个令牌扩散框架,利用大语言模型(LLM)理解文本上下文和对话流,以及扩散头生成高保真声学细节。
更多信息、演示和示例,请访问我们的项目页面。
VibeVoice-ASR 是一个统一的语音转文本模型,设计用于在单次传递中处理长达 60 分钟的长形式音频,生成包含 Who(发言人)、When(时间戳)和 What(内容)的结构化转录文本,并支持自定义热词。
🕒 60 分钟单次传递处理:与将音频切分为短块(通常会丢失全局上下文)的传统 ASR 模型不同,VibeVoice ASR 在 64K 令牌长度范围内接受长达 60 分钟的连续音频输入。这确保了在整个一小时内保持一致的发言人追踪和语义连贯性。
👤 自定义热词:用户可以提供自定义热词(例如特定名称、技术术语或背景信息)来指导识别过程,显著提高了特定领域内容的准确性。
📝 丰富的转录文本(Who、When、What):该模型联合执行 ASR、分说话人(diarization)和时间标记,生成表明谁说了什么和何时说的结构化输出。
📖 文档 | 🤗 Hugging Face | 🎮 Playground | 🛠️ 微调 | 📊 论文
最适用于:长形式对话音频、播客、多语音者对话
⏱️ 90 分钟长形式生成:在单次传递中合成长达 90 分钟的对话式/单语音者语音,在整个过程中保持语音者一致性和语义连贯性。
👥 多语音者支持:在单个对话中支持最多 4 个不同的语音者,具有自然的轮流和长对话中的语音者一致性。
🎭 表现力强的语音:生成表现力强、听起来自然的语音,捕捉对话动态和情感细微差别。
🌐 多语言支持:支持英语、中文及其他语言。
📖 文档 | 🤗 Hugging Face | 📊 论文
长对话(4 人)
VibeVoice-Realtime 是一个轻量级实时文本转语音模型,支持流式文本输入和强大的长形式语音生成。
参数大小:0.5B(部署友好)
实时 TTS(~300 毫秒首字可闻延迟)
强大的长形式语音生成(~10 分钟)
📖 文档 | 🤗 Hugging Face | 🚀 Colab
有关详细贡献指南,请参阅 CONTRIBUTING.md。
⚠️ 风险和局限
虽然已通过各种技术进行了优化,但它仍可能生成意外、有偏见或不准确的输出。VibeVoice 继承其基础模型(本次发布中特别是 Qwen2.5 1.5b)产生的任何偏见、错误或遗漏。深度伪造和虚假信息的可能性:高质量合成语音可能被滥用以创建令人信服的虚假音频内容,用于冒充、欺诈或传播虚假信息。用户必须确保转录文本可靠,检查内容准确性,避免以误导的方式使用生成的内容。用户应当以负责任的方式使用生成的内容并部署模型,完全遵守相关司法管辖区的所有适用法律和法规。在分享 AI 生成的内容时,最佳实践是披露 AI 的使用。
我们不建议在未经进一步测试和开发的情况下在商业或真实应用中使用 VibeVoice。本模型仅用于研究和开发目的。请负责任地使用。