ONNX 模型库
返回模型

说明文档

VibeVoice TTS - ONNX 浏览器版

微软的 VibeVoice-Realtime-0.5B 转换为 ONNX 格式,用于浏览器端推理。

架构

VibeVoice 采用双 LLM 架构,结合基于扩散的声码器:

  1. 文本 LM(187 MB INT8)- 处理输入文本生成隐藏状态
  2. TTS LM(417 MB INT8)- 自回归生成语音潜表示
  3. 扩散头(25 MB INT4)- 对潜表示进行去噪
  4. 声码器(339 MB INT4)- 将潜表示转换为 24kHz 音频
  5. 声学连接器(0.5 MB INT4)- 将语音反馈到 TTS LM

总计:约 969 MB 量化后(原始 3.8 GB)

文件

  • text_lm_int8.onnx - 文本编码器
  • tts_lm_int8.onnx - 语音 token 生成器
  • diffusion_head_int4.onnx - 潜表示去噪器
  • vocoder_int4.onnx - 音频合成器
  • acoustic_connector_int4.onnx - 语音反馈
  • tokenizer.json - Qwen2 分词器
  • config.json - 模型配置

使用方法

参见 demo.html 了解浏览器端使用示例。

许可证

Apache 2.0(与原始 VibeVoice 模型相同)

FluffyBunnies/vibevoice-onnx-v2

作者 FluffyBunnies

↓ 14 ♥ 5

创建时间: 2025-12-12 05:37:13+00:00

更新时间: 2025-12-12 05:37:42+00:00

在 Hugging Face 上查看

文件 (10)

.gitattributes
README.md
acoustic_connector_int4.onnx ONNX
config.json
diffusion_head_int4.onnx ONNX
text_lm_int8.onnx ONNX
tokenizer.json
tokenizer_config.json
tts_lm_int8.onnx ONNX
vocoder_int4.onnx ONNX