说明文档
Aina 项目的加泰罗尼亚语多说话人文本转语音模型
模型描述
该模型使用 Coqui TTS 工具包从头开始训练,训练数据集包括:Festcat、OpenSLR69 和 Common Voice v12。 训练过程中,我们使用了来自 255 位说话人的 487 小时录音数据。 我们对数据进行了裁剪和去噪处理,除 Common Voice 外的所有数据可在以下独立数据集中找到:festcat_trimmed_denoised 和 openslr69_trimmed_denoised。
在线推理演示可在我们的 Spaces 中找到,点击此处。
该模型需要我们 fork 的 espeak-ng 才能正常工作。关于安装和部署,请参阅我们推理演示的 Docker 文件。
预期用途与限制
您可以使用此模型生成不同声音的加泰罗尼亚语合成语音。
如何使用
用法
所需库:
pip install git+https://github.com/coqui-ai/TTS@dev#egg=TTS
使用 Python 合成语音:
from TTS.utils.synthesizer import Synthesizer
model_path = # Absolute path to the model checkpoint.pth
config_path = # Absolute path to the model config.json
speakers_file_path = # Absolute path to speakers.pth file
text = "Text to synthetize"
speaker_idx = "Speaker ID"
synthesizer = Synthesizer(
model_path, config_path, speakers_file_path, None, None, None,
)
wavs = synthesizer.tts(text, speaker_idx)
训练
训练流程
数据准备
超参数
该模型基于 Kim et al 提出的 VITS 架构。以下是在 Coqui 框架中设置的超参数。
| 超参数 | 值 |
|---|---|
| Model | vits |
| Batch Size | 16 |
| Eval Batch Size | 8 |
| Mixed Precision | false |
| Window Length | 1024 |
| Hop Length | 256 |
| FTT size | 1024 |
| Num Mels | 80 |
| Phonemizer | espeak |
| Phoneme Lenguage | ca |
| Text Cleaners | multilingual_cleaners |
| Formatter | vctk_old |
| Optimizer | adam |
| Adam betas | (0.8, 0.99) |
| Adam eps | 1e-09 |
| Adam weight decay | 0.01 |
| Learning Rate Gen | 0.0001 |
| Lr. schedurer Gen | ExponentialLR |
| Lr. schedurer Gamma Gen | 0.999875 |
| Learning Rate Disc | 0.0001 |
| Lr. schedurer Disc | ExponentialLR |
| Lr. schedurer Gamma Disc | 0.999875 |
该模型训练了 730962 步。
附加信息
作者
巴塞罗那超级计算中心语言技术部
联系方式
如需更多信息,请发送邮件至 aina@bsc.es
版权
版权所有 (c) 2023 巴塞罗那超级计算中心语言技术部
许可信息
资助
本工作由 [加泰罗尼亚政府副总统兼数字与领土政策部](https://politiquesdigitals.gencat.cat/ca/inici/index.html#googtrans(ca|en) 在 Projecte AINA 框架内资助。
该模型的训练得益于加利西亚超级计算中心 CESGA(Centro de Supercomputación de Galicia)提供的计算时间。
免责声明
<details> <summary>点击展开</summary>
本仓库发布的模型旨在用于通用目的,并可供第三方使用。这些模型可能存在偏见和/或其他不良偏差。
当第三方使用任何这些模型(或使用基于这些模型的系统)部署或向其他方提供系统和服务,或成为模型用户时,应注意减轻其使用所产生的风险是他们的责任,并且在任何情况下都应遵守适用的法规,包括有关人工智能使用的法规。
在任何情况下,模型的所有者和创建者(BSC – 巴塞罗那超级计算中心)均不对第三方使用这些模型所产生的任何结果承担责任。 </details>
projecte-aina/tts-ca-coqui-vits-multispeaker
作者 projecte-aina
创建时间: 2022-12-05 10:33:38+00:00
更新时间: 2025-07-17 09:55:24+00:00
在 Hugging Face 上查看