c# - ASP.NET MVC 中的超快速文本转语音(WAV -> MP3)-6ren

c# - ASP.NET MVC 中的超快速文本转语音(WAV -> MP3)

转载作者：太空狗更新时间：2023-10-30 01:23:02

这个问题本质上是关于 Microsoft 的语音 API (SAPI) 对服务器工作负载的适用性以及它是否可以在 w3wp 内部可靠地用于语音合成。我们有一个异步 Controller ，它使用 .NET 4 中的 native System.Speech 程序集(不是作为 Microsoft Speech Platform 的一部分提供的 Microsoft.Speech - 运行时版本11) 和lame.exe生成mp3如下:

       [CacheFilter]
        public void ListenAsync(string url)
        {
                string fileName = string.Format(@"C:\test\{0}.wav", Guid.NewGuid());                       

                try
                {
                    var t = new System.Threading.Thread(() =>
                    {
                        using (SpeechSynthesizer ss = new SpeechSynthesizer())
                        {
                            ss.SetOutputToWaveFile(fileName, new SpeechAudioFormatInfo(22050, AudioBitsPerSample.Eight, AudioChannel.Mono));
                            ss.Speak("Here is a test sentence...");
                            ss.SetOutputToNull();
                            ss.Dispose();
                        }

                        var process = new Process() { EnableRaisingEvents = true };
                        process.StartInfo.FileName = Path.Combine(AppDomain.CurrentDomain.BaseDirectory, @"bin\lame.exe");
                        process.StartInfo.Arguments = string.Format("-V2 {0} {1}", fileName, fileName.Replace(".wav", ".mp3"));
                        process.StartInfo.UseShellExecute = false;
                        process.StartInfo.RedirectStandardOutput = false;
                        process.StartInfo.RedirectStandardError = false;
                        process.Exited += (sender, e) =>
                        {
                            System.IO.File.Delete(fileName);

                            AsyncManager.OutstandingOperations.Decrement();
                        };

                        AsyncManager.OutstandingOperations.Increment();
                        process.Start();
                    });

                    t.Start();
                    t.Join();
                }
                catch { }

            AsyncManager.Parameters["fileName"] = fileName;
        }

        public FileResult ListenCompleted(string fileName)
        {
            return base.File(fileName.Replace(".wav", ".mp3"), "audio/mp3");
        }

问题是为什么 SpeechSynthesizer 需要像这样在单独的线程上运行才能返回(这在 SO here 和 here 的其他地方报告)以及是否为此请求实现 STAThreadRouteHandler 更多-比上述方法更高效/可扩展？

其次，在 ASP.NET(MVC 或 WebForms)上下文中运行 SpeakAsync 有哪些选项？我尝试过的所有选项似乎都不起作用(请参阅下面的更新)。

欢迎提出有关如何改进此模式的任何其他建议(即必须彼此串行执行但每个都具有异步支持的两个依赖项)。我不觉得这个方案在负载下是可持续的，特别是考虑到 SpeechSynthesizer 中的 known memory leaks。考虑在不同的堆栈上一起运行此服务。

更新:Speak 或 SpeakAsnc 选项似乎都无法在 STAThreadRouteHandler 下工作。前者产生:

System.InvalidOperationException: Asynchronous operations are not allowed in this context. Page starting an asynchronous operation has to have the Async attribute set to true and an asynchronous operation can only be started on a page prior to PreRenderComplete event. at System.Web.LegacyAspNetSynchronizationContext.OperationStarted() at System.ComponentModel.AsyncOperationManager.CreateOperation(Object userSuppliedState) at System.Speech.Internal.Synthesis.VoiceSynthesis..ctor(WeakReference speechSynthesizer) at System.Speech.Synthesis.SpeechSynthesizer.get_VoiceSynthesizer() at System.Speech.Synthesis.SpeechSynthesizer.SetOutputToWaveFile(String path, SpeechAudioFormatInfo formatInfo)

后者导致:

System.InvalidOperationException: The asynchronous action method 'Listen' cannot be executed synchronously. at System.Web.Mvc.Async.AsyncActionDescriptor.Execute(ControllerContext controllerContext, IDictionary`2 parameters)

似乎自定义 STA 线程池(具有 COM 对象的 ThreadStatic 实例)是更好的方法:http://marcinbudny.blogspot.ca/2012/04/dealing-with-sta-coms-in-web.html

更新 #2:System.Speech.SpeechSynthesizer 似乎不需要 STA 处理，似乎在 MTA 线程上运行良好，只要您遵循 Start/Join 模式。这是一个能够正确使用 SpeakAsync 的新版本(问题是过早地处理它!)并将 WAV 生成和 MP3 生成分解为两个单独的请求:

[CacheFilter]
[ActionName("listen-to-text")]
public void ListenToTextAsync(string text)
{
    AsyncManager.OutstandingOperations.Increment();   

    var t = new Thread(() =>
    {
        SpeechSynthesizer ss = new SpeechSynthesizer();
        string fileName = string.Format(@"C:\test\{0}.wav", Guid.NewGuid());

        ss.SetOutputToWaveFile(fileName, new SpeechAudioFormatInfo(22050,
                                                                   AudioBitsPerSample.Eight,
                                                                   AudioChannel.Mono));
        ss.SpeakCompleted += (sender, e) =>
        {
            ss.SetOutputToNull();
            ss.Dispose();

            AsyncManager.Parameters["fileName"] = fileName;
            AsyncManager.OutstandingOperations.Decrement();
        };

        CustomPromptBuilder pb = new CustomPromptBuilder(settings.DefaultVoiceName);
        pb.AppendParagraphText(text);
        ss.SpeakAsync(pb);               
    });

    t.Start();
    t.Join();                    
}

[CacheFilter]
public ActionResult ListenToTextCompleted(string fileName)
{
    return RedirectToAction("mp3", new { fileName = fileName });
}

[CacheFilter]
[ActionName("mp3")]
public void Mp3Async(string fileName) 
{
    var process = new Process()
    {
        EnableRaisingEvents = true,
        StartInfo = new ProcessStartInfo()
        {
            FileName = Path.Combine(AppDomain.CurrentDomain.BaseDirectory, @"bin\lame.exe"),
            Arguments = string.Format("-V2 {0} {1}", fileName, fileName.Replace(".wav", ".mp3")),
            UseShellExecute = false,
            RedirectStandardOutput = false,
            RedirectStandardError = false
        }
    };

    process.Exited += (sender, e) =>
    {
        System.IO.File.Delete(fileName);
        AsyncManager.Parameters["fileName"] = fileName;
        AsyncManager.OutstandingOperations.Decrement();
    };

    AsyncManager.OutstandingOperations.Increment();
    process.Start();
}

[CacheFilter]
public ActionResult Mp3Completed(string fileName) 
{
    return base.File(fileName.Replace(".wav", ".mp3"), "audio/mp3");
}

最佳答案

服务器上的 I/O 非常昂贵。您认为您可以在服务器硬盘驱动器上获得多少个 wav 写入流？为什么不在内存中完成所有操作，只在完全处理后才写入 mp3？ mp3 的体积要小得多，并且 I/O 会占用一小段时间。如果需要，您甚至可以更改代码以将流直接返回给用户，而不是保存到 mp3。

How do can I use LAME to encode an wav to an mp3 c#

关于c# - ASP.NET MVC 中的超快速文本转语音(WAV -> MP3)，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/12343249/

文章推荐： python - IDE教 child python？

文章推荐： c# - 如何运行一个 c# WinForm 应用程序实例？

文章推荐： python - 使用等距(弧长)标记绘制曲线

ios - 更改iOS应用中使用按钮播放的“语音”
我有一个说一些短语的音板应用程序，但是现在我希望能够从男声/女声中改变出来，问题是我不知道该怎么做。任何帮助，将不胜感激。我正在使用AVFoundation/AVAudioPlayer播放声音。谢
audio - 语音/音乐分类
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。我们不允许提问寻求书籍、工具、软件库等的推荐。您可以编辑问题，以便用事实和引用来回答。关闭 4 年前。
android - 如何在android中连续录制后台音频/语音？
因为我想在后台录制音频，所以我使用了服务..但是我无法在服务中录制音频。我在 Activity 中尝试了相同的代码，它对我有用。但是如何在输入语音/语音时在后台进行录音，这意味着如果有语音输入就应该
c# - 语音/语音转文本
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。我们不允许提问寻求书籍、工具、软件库等的推荐。您可以编辑问题，以便用事实和引用来回答。关闭 6 年前。
audio - 用于从音频流中提取单词(语音)的库？
我有一个音频流，我会从中提取单词(语音)。因此，例如使用 audio.wav 我会得到 001.wav、002.wav、003.wav 等，其中每个 XXX.wav 是一个词。我正在寻找一个库或程序
macos - NSSpeechSynthesizer 语音/语言关系
不幸的是，我只能说四种语言，那么如果我知道文本的语言，我如何知道我必须使用哪种 OS X 语音？我在Apple的文档中找不到任何有关它的信息。至少有一张有语音/语言的 table 吗？最佳答案您可
cmd - 来自命令行的 ms 语音
有没有办法从命令行使用 MS Speech 实用程序？我可以在 Mac 上完成，但在 Windows XP 上找不到任何引用。最佳答案我在这个主题上的 2 美分，命令行单行: 在 Win 上使用
javascript - 语音 channel 不设防
所以我开始了我的不和谐机器人的音乐部分。现在，正如我在上一个问题中所做的那样，这里只是音乐命令的片段:Pastebin #1 在显示 if (msg.member.voiceConnection ==
java - 如何在java中听(语音)文本
有谁知道有什么好的 API 或库可以听(语音)文本。我尝试听三种语言的(语音)文本，我想知道最好从哪里开始以及如何开始。我可以对所有三种语言使用通用语音吗？我将使用 eclipse 和 java 作为
c# - 语音 session ——如何让更多人参与进来？
首先，我只是一个爱好者，如果这是一个愚蠢的问题或者我太天真了，我很抱歉。 (这也意味着我买不起昂贵的库) 情况是这样的:我正在使用 C#.NET 构建一个简单的语音聊天应用程序(类似于 Ventril
c - 语音 ip 的服务类型字段集
我正在制作一个模块，可以生成和传输语音 IP 数据包。我知道我必须为服务类型字段设置一些值。这个值是多少？最佳答案该值应该是x。关于c - 语音 ip 的服务类型字段集，我们在Stack Ove
c++ - 文字转语音 SAPI 语音
有人能帮帮我吗？我使用 SAPI 语音文本，但我不能设置女声，这是代码，它用男声说话，但我想改变它，我想要女声 #include "stdafx.h" using namespace std; voi
java - 基于命令(语音)识别的项目
我正在寻找一种方法来为一个项目在 Java 中识别预注册的语音命令，但我还没有想出一个好的方法，我研究了快速傅里叶和处理 wave 文件的不同方法，但我无法决定我应该如何实现它。这个想法很简单，
android - 西类牙语语音(语音)识别
我在 android 的语音识别 API 工作。我是 Speech Recognition Api 的新手，我的要求是西类牙语语音，并从 Android 的语音识别 API 中获得西类牙语的最佳匹配
Java - 将效果应用于 MaryTTS 语音
我在 Java 中使用一组名为(MaryTTS[实际上还有更多])的库来将 text to speech 转换为该目的，使用以下代码: public class TextToSpeech {
javascript - webRTC 音频/语音
我正在尝试使用webRTC和php作为服务器端来实现单向语音传输。查看samples ，我无法理解webRTC机制。在我看来，流程应该是这样的: 调用者和接收者在服务器上注册接收者监听来电调用
c++ - Windows 语音 C++
我的名字是 Joey，我想知道是否有一种在 C++ 中使用语音的方法，如果有人可以给我指出引用资料和书籍，非常感谢...... 最佳答案你应该看看 Windows Text-To-Speech AP
c++ - 从零开始构建 IP 语音
关闭。这个问题需要更多focused .它目前不接受答案。想改进这个问题吗？更新问题，使其只关注一个问题 editing this post . 关闭 8 年前。 Improve this qu
Java 语音 API 空响应
我正在使用 Java 语音识别 API - Jarvis，位于 https://github.com/lkuza2/java-speech-api 但是，当我运行应用程序时，出现错误:服务器返回 HT
c# - 如何将阿拉伯文本转换为 SAMPA 语音？
我们正在做一个需要讲阿拉伯语的项目，我们找到了一个开源工具，Mbrola project , 可以做到这一点。但是，我还需要一些方法将阿拉伯语文本转换为 SAMPA 语音。那么有人可以帮助我将阿拉伯

太空狗

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

c# - ASP.NET MVC 中的超快速文本转语音(WAV -> MP3)