ONNX 模型库
返回模型

说明文档

一个 SoundStream 解码器,用于从梅尔频谱图重建音频。

概述

该模型是一个 SoundStream 解码器,用于将使用下方示例中定义的特定超参数计算得到的梅尔频谱图进行逆转换。该模型在音乐数据上训练,并在 Multi-instrument Music Synthesis with Spectrogram Diffusion(ISMIR 2022)中使用。

一个典型的应用场景是通过预测梅尔频谱图(而非原始波形)来简化音乐生成,然后使用此模型重建音频。

如果您使用此模型,请考虑引用:

@article{zeghidour2021soundstream,
  title={Soundstream: An end-to-end neural audio codec},
  author={Zeghidour, Neil and Luebs, Alejandro and Omran, Ahmed and Skoglund, Jan and Tagliasacchi, Marco},
  journal={IEEE/ACM Transactions on Audio, Speech, and Language Processing},
  volume={30},
  pages={495--507},
  year={2021},
  publisher={IEEE}
}

使用示例

from diffusers import OnnxRuntimeModel


SAMPLE_RATE = 16000
N_FFT = 1024
HOP_LENGTH = 320
WIN_LENGTH = 640
N_MEL_CHANNELS = 128
MEL_FMIN = 0.0
MEL_FMAX = int(SAMPLE_RATE // 2)
CLIP_VALUE_MIN = 1e-5
CLIP_VALUE_MAX = 1e8

mel = ...

melgan = OnnxRuntimeModel.from_pretrained("kashif/soundstream_mel_decoder")

audio = melgan(input_features=mel.astype(np.float32))

kashif/soundstream_mel_decoder

作者 kashif

↓ 0 ♥ 1

创建时间: 2022-11-29 14:33:30+00:00

更新时间: 2022-12-09 09:47:39+00:00

在 Hugging Face 上查看

文件 (3)

.gitattributes
README.md
model.onnx ONNX