ONNX 模型库
返回模型

说明文档

Aina 项目的加泰罗尼亚语多说话人文本转语音模型

模型描述

该模型使用 Coqui TTS 工具包从头开始训练,训练数据集包括:Festcat、OpenSLR69 和 Common Voice v12。 训练过程中,我们使用了来自 255 位说话人的 487 小时录音数据。 我们对数据进行了裁剪和去噪处理,除 Common Voice 外的所有数据可在以下独立数据集中找到:festcat_trimmed_denoised 和 openslr69_trimmed_denoised。

在线推理演示可在我们的 Spaces 中找到,点击此处。

该模型需要我们 fork 的 espeak-ng 才能正常工作。关于安装和部署,请参阅我们推理演示的 Docker 文件。

预期用途与限制

您可以使用此模型生成不同声音的加泰罗尼亚语合成语音。

如何使用

用法

所需库:

pip install git+https://github.com/coqui-ai/TTS@dev#egg=TTS

使用 Python 合成语音:

from TTS.utils.synthesizer import Synthesizer

model_path = # Absolute path to the model checkpoint.pth
config_path = # Absolute path to the model config.json
speakers_file_path = # Absolute path to speakers.pth file

text = "Text to synthetize"
speaker_idx = "Speaker ID"

synthesizer = Synthesizer(
    model_path, config_path, speakers_file_path, None, None, None,
)
wavs = synthesizer.tts(text, speaker_idx)

训练

训练流程

数据准备

超参数

该模型基于 Kim et al 提出的 VITS 架构。以下是在 Coqui 框架中设置的超参数。

超参数 值
Model vits
Batch Size 16
Eval Batch Size 8
Mixed Precision false
Window Length 1024
Hop Length 256
FTT size 1024
Num Mels 80
Phonemizer espeak
Phoneme Lenguage ca
Text Cleaners multilingual_cleaners
Formatter vctk_old
Optimizer adam
Adam betas (0.8, 0.99)
Adam eps 1e-09
Adam weight decay 0.01
Learning Rate Gen 0.0001
Lr. schedurer Gen ExponentialLR
Lr. schedurer Gamma Gen 0.999875
Learning Rate Disc 0.0001
Lr. schedurer Disc ExponentialLR
Lr. schedurer Gamma Disc 0.999875

该模型训练了 730962 步。

附加信息

作者

巴塞罗那超级计算中心语言技术部

联系方式

如需更多信息,请发送邮件至 aina@bsc.es

版权

版权所有 (c) 2023 巴塞罗那超级计算中心语言技术部

许可信息

GPL-3.0

资助

本工作由 [加泰罗尼亚政府副总统兼数字与领土政策部](https://politiquesdigitals.gencat.cat/ca/inici/index.html#googtrans(ca|en) 在 Projecte AINA 框架内资助。

该模型的训练得益于加利西亚超级计算中心 CESGA(Centro de Supercomputación de Galicia)提供的计算时间。

免责声明

<details> <summary>点击展开</summary>

本仓库发布的模型旨在用于通用目的,并可供第三方使用。这些模型可能存在偏见和/或其他不良偏差。

当第三方使用任何这些模型(或使用基于这些模型的系统)部署或向其他方提供系统和服务,或成为模型用户时,应注意减轻其使用所产生的风险是他们的责任,并且在任何情况下都应遵守适用的法规,包括有关人工智能使用的法规。

在任何情况下,模型的所有者和创建者(BSC – 巴塞罗那超级计算中心)均不对第三方使用这些模型所产生的任何结果承担责任。 </details>

projecte-aina/tts-ca-coqui-vits-multispeaker

作者 projecte-aina

↓ 0 ♥ 4

创建时间: 2022-12-05 10:33:38+00:00

更新时间: 2025-07-17 09:55:24+00:00

在 Hugging Face 上查看

文件 (7)

.gitattributes
README.md
model/best_model.pth
model/config.json
model/config_multisteplr.json
model/speakers.pth
model/vits_ca.onnx ONNX