返回模型
说明文档
VibeVoice TTS - ONNX 浏览器版
微软的 VibeVoice-Realtime-0.5B 转换为 ONNX 格式,用于浏览器端推理。
架构
VibeVoice 采用双 LLM 架构,结合基于扩散的声码器:
- 文本 LM(187 MB INT8)- 处理输入文本生成隐藏状态
- TTS LM(417 MB INT8)- 自回归生成语音潜表示
- 扩散头(25 MB INT4)- 对潜表示进行去噪
- 声码器(339 MB INT4)- 将潜表示转换为 24kHz 音频
- 声学连接器(0.5 MB INT4)- 将语音反馈到 TTS LM
总计:约 969 MB 量化后(原始 3.8 GB)
文件
text_lm_int8.onnx- 文本编码器tts_lm_int8.onnx- 语音 token 生成器diffusion_head_int4.onnx- 潜表示去噪器vocoder_int4.onnx- 音频合成器acoustic_connector_int4.onnx- 语音反馈tokenizer.json- Qwen2 分词器config.json- 模型配置
使用方法
参见 demo.html 了解浏览器端使用示例。
许可证
Apache 2.0(与原始 VibeVoice 模型相同)
FluffyBunnies/vibevoice-onnx-v2
作者 FluffyBunnies
↓ 14
♥ 5
创建时间: 2025-12-12 05:37:13+00:00
更新时间: 2025-12-12 05:37:42+00:00
在 Hugging Face 上查看文件 (10)
.gitattributes
README.md
acoustic_connector_int4.onnx
ONNX
config.json
diffusion_head_int4.onnx
ONNX
text_lm_int8.onnx
ONNX
tokenizer.json
tokenizer_config.json
tts_lm_int8.onnx
ONNX
vocoder_int4.onnx
ONNX