text-to-speech - 如何在 Windows 系统上使用 CUDA 运行 Mozilla TTS/Coqui TTS 培训？-6ren

text-to-speech - 如何在 Windows 系统上使用 CUDA 运行 Mozilla TTS/Coqui TTS 培训？

转载作者：行者123 更新时间：2023-12-05 08:19:49

26

4

我有一台配备 Quadro P5000 显卡的机器，运行 Windows 10。我想在这个系统上训练 TTS 语音。我需要安装什么才能使它正常工作？

最佳答案

这是要安装/执行的操作:

Download并为 Windows 安装 Python 3.8(不是 3.9+)。在安装过程中，确保您:

选择为所有用户安装它。
选择将 Python 添加到 PATH。

Download并安装 CUDA Toolkit 10.1(不是 11.0+)。
Download “cuDNN v7.6.5(2019 年 11 月 5 日)，适用于 CUDA 10.1”(不是 cuDNN v8+)，解压它，然后将 cuda 文件夹中的内容复制到 C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v10.1.
Download eSpeak NG 的最新 64 位版本(无版本限制:-))。
Download适用于 Windows 的最新 64 位 Git 版本(无版本限制:-))。
打开 PowerShell 提示符到您要安装 Coqui TTS 的文件夹。
运行 git clone https://github.com/coqui-ai/TTS.git。
运行 cd TTS。
运行 python -m venv .。
运行 .\Scripts\pip install -e ..
运行以下命令(这与您从 the PyTorch website 获得的命令不同，因为 a known issue ):

.\Scripts\pip install torch==1.8.0+cu101 torchvision==0.9.0+cu101 torchaudio===0.8.0 -f https://download.pytorch.org/whl/torch_stable.html

将以下内容放入 TTS 文件夹中名为“test_cuda.py”的脚本中:

import torch
x = torch.rand(5, 3)
print(x)
print(torch.cuda.is_available())

通过 .\Scripts\python ./test_cuda.py 运行脚本并确认输出如下所示(第一部分应该只是随机数，但最后一行必须是 True；如果不是，则 CUDA 未正确安装):

tensor([[0.2141, 0.7808, 0.9298],
        [0.3107, 0.8569, 0.9562],
        [0.2878, 0.7515, 0.5547],
        [0.5007, 0.6904, 0.4136],
        [0.2443, 0.4158, 0.4245]])
True

将以下内容放入 TTS 文件夹中名为“train.bat”的脚本中，然后根据您的配置文件对其进行自定义:

set PYTHONIOENCODING=UTF-8
set PYTHONLEGACYWINDOWSSTDIO=UTF-8
set PHONEMIZER_ESPEAK_PATH=C:/Program Files/eSpeak NG/espeak-ng.exe

.\Scripts\python.exe ./TTS/bin/train_tacotron.py --config_path "C:/path/to/your/config.json"

通过 .\train.bat 运行脚本。

如果您使用的模型与 Tacotron 不同，或者需要将其他参数传递到训练脚本中，请随时进一步自定义 train.bat。

如果您刚刚开始一般的 TTS 培训，请查看 How do I get started training a custom voice model with Mozilla TTS on Ubuntu 20.04? .

关于text-to-speech - 如何在 Windows 系统上使用 CUDA 运行 Mozilla TTS/Coqui TTS 培训？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/66726331/

26

4

0

文章推荐： java - 使用另一个数组删除数组中的所有数字 0

文章推荐： php - Laragon 4.0.15 - 切换到 PHP 8 后 Apache 无法启动

文章推荐： Java编译器整数错误

speech-recognition - Microsoft.Speech.Synthesis 不适用于文本转语音但 System.Speech.Synthesis 有效。为什么？
我只是尝试使用 Microsoft.Speech.dll; 为文本转语音运行简单的 Microsoft 示例 using System; using Microsoft.Speech.Synthesi
speech-recognition - Microsoft Speech 产品/平台之间的差异
微软似乎提供了不少语音识别产品，我想知道它们之间的区别。有Microsoft Speech API ，或 SAPI。但不知何故Microsoft Cognitive Service Speech A
speech-recognition - 各种 Microsoft Speech 技术之间的差异
我希望编写一个应用程序，将语音到文本转换为仓库应用程序，反之亦然。主要用例是运算符(operator)将在仓库中佩戴耳机并将指令发送回服务器并从仓库软件接收指令以拣选和打包订单。我们将使用由 Wind
speech-recognition - 如何在python中使用google cloud speech api
我正在探索 python 中的谷歌云语音 api。我正在关注这个 link .我也提到了这个 stackoverflow link .但是我对设置环境变量感到震惊。我做过的事情: 1.安装gclou
speech-to-text - IBM Speech to Text 字母数字字符串识别？
在尝试让 Speech to Text(IBM 语音网关 IVR 应用程序)识别字母数字字符串时，我想知道我是否可以创建一个自定义语法或实体来限制 STT 仅识别单个字母和数字，不包括完全的话。例如，
speech - Web Speech API可以与Web Audio API一起使用吗？
是否可以将来自Web Speech API的合成语音用作Web Audio API音频上下文中的SourceNode？最佳答案实际上，我问过要在Web Speech邮件列表中添加此内容，并且基本上
speech-recognition - 语音到文本的大型音频文件 [Microsoft Speech API]
使用 Microsoft Speech API 转录中/大型音频文件(每个文件约 6-10 分钟)的最佳方法是什么？像批处理音频文件转录这样的东西？我使用了 https://docs.microso
speech-recognition - 408 请求超时 Microsoft Speech to Text
我的 .wav 文件长度只有 4 秒。即使在多次重试并在云端运行后，我仍然不断收到以下错误 * upload completely sent off: 12 out of 12 bytes
speech-recognition - 有人在生产中使用 Google Speech API 吗？
我找到了一些描述如何使用 Google 语音 API 的文章 ( http://mikepultz.com/2011/03/accessing-google-speech-api-chrome-11/
google-cloud-speech - 需要帮助 Speech-to-text，重试次数过多总是失败
我使用 google 语音转文本 API 从音频中获取字幕，但是当音频太长时，通常超过 60 分钟，重试次数过多会失败。它说:google.api_core.exceptions.GoogleAPIC
c# - System.Speech.Recognition 是否使用 "speech training"？
我有一些来自 System.Speech.Recognition 的简单代码可以正常工作: using (var recognizer = new SpeechRecognitionEngine(ne
text-to-speech - Speech API OneCore 中的 Sayaka 语音在哪里？
Windows 10。我在“设置”中安装了日语 TTS 语音。现在，当我在 Speech API 5.4 OneCore 中使用语音枚举时(虽然不是在 5.4 中)，我得到 6 个语音: 大卫齐拉
google-text-to-speech - Google Cloud Text-to-Speech 请求的最大大小
当我提交对太长文本的综合请求时，我收到以下错误: google.api_core.exceptions.ResourceExhausted: 429 Received message larger t
C# 和 Microsoft Speech.Recognition 和 Speech.Synthesis
我是 C# 的新手，也是 Speech.Recognition 的新手。我搜索了很长时间的教程，但没有找到那么多，我什至不确定我是否正确包含了所有内容。我下载了: SDK Runtime Langu
html - 是否可以使 "HTML to speech"与 "Text to speech"相同？
我有一个奇怪的要求，即在我现有的应用程序中我有 Text2Speech 并且为此，我使用了 AVSpeechSynthesizer 来语音文本，但现在要求改变了，现在我需要将 HTML 文件数据转换为
speech-recognition - 谷歌语音 API : Can recognize speech from OGG file
我使用 Google Speech API 通过 Python 识别 .OGG 文件音频中的越南语语音。但它不会返回任何结果。最佳答案至少在英文版的Google Speech API中，需要使用F
speech-recognition - 如何使用 Codename One 中的 Google Speech API？
我想从手机录制音频，然后将其发送到谷歌语音非流媒体 API。我可以使用 Capture.captureAudio() 进行录音，但是我不知道音频编码和采样率是什么，因为它们是必需的 for the a
speech-to-text - 在 google-cloud-speech 中识别 .wav 音频文件的问题
我使用谷歌云语音到文本 API 将音频转换为文本。对于 .raw文件它工作正常但是对于 .wav文件它给了我类似的错误: Google::Gax::RetryError Exception: Ga
.net - System.Speech.Recognition 和 Microsoft.Speech.Recognition 之间有什么区别？
.NET 中有两个类似的用于语音识别的命名空间和程序集。我试图了解其中的差异以及何时适合使用其中之一。程序集 System.Speech(在 System.Speech.dll 中)有 System
google-cloud-speech - Google Cloud Speech API 使用的端点/端口是什么
通过流式 API (Performing Streaming Speech Recognition on an Audio Stream) 使用 Google Cloud Speech API，我们

首页

博学

6Ren·AI

商城

text-to-speech - 如何在 Windows 系统上使用 CUDA 运行 Mozilla TTS/Coqui TTS 培训？