说明文档
This is a direct translation task. The README already contains bilingual content (Chinese + English). I'll provide a complete Chinese (Simplified) translation, keeping all code blocks, links, and markdown formatting intact.
<div align="center">
🎬 视频字幕转录和翻译
一个强大的、隐私优先的视频字幕转录和翻译工具
</div>
🔒 隐私保证
🚨 所有处理完全离线运行<br>
- 无需互联网连接,确保最大程度的隐私和数据安全<br>
- Github
🚀 快速入门
环境准备
# 安装 FFmpeg
conda install ffmpeg
pip install -r requirements.txt
# 安装 Python 依赖
# 请根据您的硬件平台安装正确的包
# ----------------------------------------
# 仅 CPU
# onnxruntime>=1.23.2
# ----------------------------------------
# Linux + AMD
# 请先按照以下链接设置 ROCm,然后再 pip install onnxruntime-rocm
# https://rocm.docs.amd.com/projects/radeon/en/latest/docs/install/native_linux/install-onnx.html
# https://onnxruntime.ai/docs/execution-providers/Vitis-AI-ExecutionProvider.html
# onnxruntime>=1.23.2
# onnxruntime-rocm>=1.23.0
# ----------------------------------------
# Windows + (Intel 或 AMD)
# onnxruntime>=1.23.2
# onnxruntime-directml>=1.23.0
# ----------------------------------------
# Intel OpenVINO CPU & GPU & NPU
# onnxruntime>=1.23.2
# onnxruntime-openvino>=1.23.0
# ----------------------------------------
# NVIDIA-CUDA
# onnxruntime>=1.23.2
# onnxruntime-gpu>=1.23.2
# ----------------------------------------
设置
- 下载模型: 从 HuggingFace 获取所需模型,只下载您想要的模型并保持文件夹路径与当前定义相同,无需全部下载。
- 下载脚本: 将
run.py放置在您的Transcribe_and_Translate_Subtitles文件夹中 - 添加媒体: 将您的音视频放置在
Transcribe_and_Translate_Subtitles/Media/目录下 - 运行: 务必在
Transcribe_and_Translate_Subtitles目录下执行python run.py并打开 Web 界面
结果
在以下位置找到您处理后的字幕:
Transcribe_and_Translate_Subtitles/Results/Subtitles/
准备好开始了吗? 🎉 <br> <br> <div align="center">

</div>
✨ 功能特性
🔇 降噪模型
🎤 语音活动检测 (VAD)
- Faster-Whisper-Silero
- Official-Silero-v6
- HumAware
- NVIDIA-NeMo-VAD-v2.0
- TEN-VAD
- Pyannote-Segmentation-3.0
- 注意:您需要接受 Pyannote 的使用条款并下载 Pyannote 的
pytorch_model.bin文件。将其放置在VAD/pyannote_segmentation文件夹中。
- 注意:您需要接受 Pyannote 的使用条款并下载 Pyannote 的
🗣️ 语音识别 (ASR)
多语言模型
- Fun-ASR-Nano-2512-多语言
- Fun-ASR-MLT-Nano-2512-多语言
- SenseVoice-Small-多语言
- Dolphin-Small-亚洲语言
- Paraformer-Large-中文
- Paraformer-Large-英语
- FireRedASR-AED-L 中文
- Official-Whisper-Large-v3-多语言
- Official-Whisper-Large-v3-Turbo-多语言
- 阿拉伯语
- 巴斯克语
- 粤语
- 中文
- 台湾客家话
- 台湾闽南语
- 台湾华语
- CrisperWhisper-多语言
- 丹麦语
- 印度英语
- 英语 v3.5
- 法语
- 瑞士德语
- 德语
- 希腊语
- 意大利语
- 日语-动漫
- 日语
- 韩语
- 马来语
- 波斯语
- 波兰语
- 葡萄牙语
- 俄语
- 塞尔维亚语
- 西班牙语
- 泰语
- 土耳其语
- 乌尔都语
- 越南语
🤖 翻译模型 (LLM)
- Qwen-3-4B-Instruct-2507-Abliterated
- Qwen-3-8B-Abliterated
- Hunyuan-MT-1.5-1.8B-Abliterated
- Hunyuan-MT-1.5-7B-Abliterated
- Seed-X-PRO-7B
🖥️ 硬件支持
<table> <tr> <td align="center"><strong>💻 中央处理器 (CPU)</strong></td> <td align="center"><strong>🎮 图形处理器 (GPU)</strong></td> <td align="center"><strong>🧠 神经网络处理单元 (NPU)</strong></td> </tr> <tr> <td valign="top"> <ul> <li>Apple Silicon</li> <li>AMD</li> <li>ARM</li> <li>Intel</li> </ul> </td> <td valign="top"> <ul> <li>Apple CoreML</li> <li>AMD ROCm</li> <li>Intel OpenVINO</li> <li>NVIDIA CUDA</li> <li>Windows DirectML</li> </ul> </td> <td valign="top"> <ul> <li>Apple CoreML</li> <li>AMD Ryzen-VitisAI</li> <li>Intel OpenVINO</li> </ul> </td> </tr> </table>
📊 性能基准测试
测试条件:Ubuntu 24.04, Intel i3-12300, 7602 秒视频
| 操作系统 | 后端 | 降噪器 | VAD | 语音识别 | 大语言模型 | 实时率 |
|---|---|---|---|---|---|---|
| Ubuntu-24.04 | CPU i3-12300 | - | Silero | SenseVoiceSmall | - | 0.08 |
| Ubuntu-24.04 | CPU i3-12300 | GTCRN | Silero | SenseVoiceSmall | Qwen2.5-7B-Instruct | 0.50 |
| Ubuntu-24.04 | CPU i3-12300 | GTCRN | FSMN | SenseVoiceSmall | - | 0.054 |
| Ubuntu-24.04 | CPU i3-12300 | ZipEnhancer | FSMN | SenseVoiceSmall | - | 0.39 |
| Ubuntu-24.04 | CPU i3-12300 | GTCRN | Silero | Whisper-Large-V3 | - | 0.20 |
| Ubuntu-24.04 | CPU i3-12300 | GTCRN | FSMN | Whisper-Large-V3-Turbo | - | 0.148 |
🛠️ 问题排查
常见问题
- Silero VAD 错误: 首次运行时只需重启应用程序
- libc++ 错误 (Linux):
sudo apt update sudo apt install libc++1 - Apple Silicon: 请避免安装
onnxruntime-openvino,因为它会导致错误
📋 更新历史
🆕 2026/1/4 - 更新
- ✅ 新增 ASR:
- FunASR-Nano-2512
- FunASR-Nano-MLT-2512
- ✅ 更新 LLM:
- 更新 Hunyuan-MT-1.5-1.8B-Abliterated
- 更新 Hunyuan-MT-1.5-7B-Abliterated
- ✅ 性能改进:
- 改善 SenseVoice & Paraformer 长音频的准确度
- 改善 Nvidia_VAD, Ten_VAD, HumAware_VAD 音频切割准确度
- 修复 LLM 在翻译时偶尔输出乱码文字
🆕 2025/9/19 - 重大更新
- ✅ 新增 ASR:
- 28 个地区微调的 Whisper 模型
- ✅ 新增降噪器: MossFormer2_SE_48K
- ✅ 新增 LLM 模型:
- Qwen3-4B-Instruct-2507-abliterated
- Qwen3-8B-abliterated-v2
- Hunyuan-MT-7B-abliterated
- Seed-X-PRO-7B
- ✅ 性能改进:
- 为类 Whisper 的 ASR 模型应用了束搜索和重复惩罚
- 应用 ONNX Runtime IOBinding 实现最大加速(比常规 ort_session.run() 快 10%以上)
- 支持单次推理处理 20 秒的音频片段
- 改进了多线程性能
- ✅ 硬件支持扩展:
- AMD-ROCm 执行提供程序
- AMD-MIGraphX 执行提供程序
- NVIDIA TensorRTX 执行提供程序
- (必须先配置环境,否则无法工作)
- ✅ 准确性改进:
- SenseVoice
- Paraformer
- FireRedASR
- Dolphin
- ZipEnhancer
- MossFormerGAN_SE_16K
- NVIDIA-NeMo-VAD
- ✅ 速度改进:
- MelBandRoformer (通过转换为单声道提升速度)
- ❌ 移除的模型:
- FSMN-VAD
- Qwen3-4B-Official
- Qwen3-8B-Official
- Gemma3-4B-it
- Gemma3-12B-it
- InternLM3
- Phi-4-Instruct
2025/7/5 - 降噪增强
- ✅ 新增降噪模型: MossFormerGAN_SE_16K
2025/6/11 - VAD 模型扩展
- ✅ 新增 VAD 模型:
- HumAware-VAD
- NVIDIA-NeMo-VAD
- TEN-VAD
2025/6/3 - 亚洲语言支持
- ✅ 新增 Dolphin ASR 模型以支持亚洲语言
2025/5/13 - GPU 加速
- ✅ 新增 Float16/32 ASR 模型以支持 CUDA/DirectML GPU 使用
- ✅ GPU 性能: 这些模型可以实现超过 99% 的 GPU 算子部署
2025/5/9 - 主要功能发布
- ✅ 灵活性改进:
- 新增不使用 VAD(语音活动检测)的选项
- ✅ 新增模型:
- 降噪: MelBandRoformer
- ASR: CrisperWhisper
- ASR: Whisper-Large-v3.5-Distil (英语微调)
- ASR: FireRedASR-AED-L (支持中文及方言)
- 三个日语动漫微调的 Whisper 模型
- ✅ 性能优化:
- 移除 IPEX-LLM 框架以提升整体性能
- 取消 LLM 量化选项,统一使用 Q4F32 格式
- Whisper 系列推理速度提升 10% 以上
- ✅ 准确性改进:
- 提升 FSMN-VAD 准确率
- 提升 Paraformer 识别准确率
- 提升 SenseVoice 识别准确率
- ✅ LLM 支持 ONNX Runtime 100% GPU 算子部署:
- Qwen3-4B/8B
- InternLM3-8B
- Phi-4-mini-Instruct
- Gemma3-4B/12B-it
- ✅ 硬件支持扩展:
- Intel OpenVINO
- NVIDIA CUDA GPU
- Windows DirectML GPU (支持集成显卡和独立显卡)
🗺️ 路线图
- [ ] LLM 束搜索
- [ ] 分离说话人
- [ ] 声纹识别
- [ ] 视频超分 / Video Upscaling - 提升分辨率
- [ ] 实时播放器 - 实时转录和翻译
H5N1AIDS/Transcribe_and_Translate_Subtitles
作者 H5N1AIDS
创建时间: 2025-05-08 03:51:45+00:00
更新时间: 2026-01-11 02:37:33+00:00
在 Hugging Face 上查看