- mongodb - 在 MongoDB mapreduce 中,如何展平值对象?
- javascript - 对象传播与 Object.assign
- html - 输入类型 ="submit"Vs 按钮标签它们可以互换吗?
- sql - 使用 MongoDB 而不是 MS SQL Server 的优缺点
谁能推荐可靠的开源软件来在 wav 文件中转录英语语音?我研究过的两个主要程序是Sphinx和 Julius ,但是我从来没有能够让任何一个工作,而且每个关于转录文件的文档充其量是粗略的。
我正在 64 位 Ubuntu 10.04 上进行开发,其 repos 包括 sphinx2 和 julius,以及 voxforge 的 julius 英语声学模式。我专注于转录文件,而不是直接处理来自麦克风的声音,因为我已经放弃了期望像这样的项目可以与 Ubuntu 的音响系统一起使用。这不是对 Ubuntu 的打击,因为我可以使用 Audacity 完美地用我的麦克风录制声音,但是这两个系统似乎都无法访问我的麦克风,所以我希望我可以通过从文件中读取来简单地配置它们。
我首先尝试了 Sphinx2,来自 Ubuntu 软件包 sphinx2-bin。尽管示例 sphinx2-demo 似乎可以用于转录文件,但实际上没有关于配置的文档,所以我不确定如何自定义它以从任意 wav 读取。演示中使用的音频文件是一些未记录的“16k”格式,通过2个配置文件间接引用。有一个简短的说明,将 sphinx2-demo 描述为运行 sphinx2-batch,但检查脚本显示它实际上是在调用 sphinx2-continuous。更糟糕的是,每个脚本的 --help 文档列出了大约 6 打选项,并且没有提及哪些是必需的或可选的。总的来说,sphinx 文档的缺乏和现有文档的质量差让我抓狂。
我接下来尝试了 Julius,再次来自 Ubuntu 软件包,考虑到 Voxforge 的快速入门中使用的版本是 3.5,该软件包令人惊讶地是最近的 (4.1)。该软件包似乎包含更好的文档,甚至还有一个用 Python 编写的示例 (/usr/share/doc/julius-voxforge/examples/controlapp)。在阅读了示例的文档后,我尝试通过创建一个包含文本“hello.wav”的文件 filelist.txt
来调整它以从文件中读取,该文件指的是同名文件,其中包含记录有人说“你好”。将它们放在同一个目录中,我运行:
julius -input file -filelist filelist.txt -C julian.jconf
得到响应:
### read waveform input
Error: adin_file: sampling rate != 16000 (8000)
Error: adin_file: error in parsing wav header at hello.wav
Error: adin_file: failed to read speech data: "hello.wav"
0 files processed
通过为 filelist.txt 和 hello.wav 指定绝对文件名重试会产生相同的错误。
我还尝试了示例中使用的 Julius 调用,直接从麦克风录制:
julius -input mic -C julian.jconf
我调用了几次,响应因错误而异:
Cannot read /dev/dsp
和:
STAT: AD-in thread created
<<< please speak >>>
在后一种情况下,无论我对着麦克风说什么,都不会发生任何事情。我不知道它是否仍然无法读取麦克风,或者它是否正在读取某些内容,但只是无法转录音频。
我不知道该怎么做。我遇到的错误并没有给我留下太多的余地。为什么不能读wav?为什么它不能读取/dev/dsp?为什么它看起来能够读取/dev/dsp,但没有任何反应?
有没有其他人在开源语音识别器方面取得了任何成功,尤其是在 Linux 上?
最佳答案
Why can't it read a wav?
它告诉您文件的采样率 (8000) 错误,而不是请求的 (16000)。采样率对于语音识别软件来说非常重要。
Why can't it read /dev/dsp?
在最近的 Ubuntu 版本中,pulseaudio 框架被用来代替 OSS。您正在尝试的版本正在使用 OSS,因此您需要从您的发行版中安装 oss-compatibility 包以恢复对 OSS 的支持。
您可以尝试支持 pulseaudio 的新 Julius
Why does it then appear to be able to read /dev/dsp, but not react in any way?
音频输入无法正常工作。
Has anyone else had any success with open source speech recognizers, especially on Linux?
当然,观看此视频作为人们使用 CMUSphinx 的示例:
http://www.youtube.com/watch?v=vfaNLIowSyk
我建议您重新访问 CMUSphinx 软件包,它是领先的开源语音识别引擎。网站上有很多文件,你只需要阅读它们。请记住,语音识别是一个复杂的领域,您可以在其中获得出色的结果,但您还需要花时间了解该技术。就像任何其他域一样。
简而言之,要使用 CMUSPhinx 转录文件,您需要执行以下 3 个简单步骤:
sox input.wav -r 8000 -c 1 resampled.wav
apt-get install pocketsphinx
pocketsphinx_continuous -samprate 8000 -infile resampled.wav
结果将打印到标准输出。要抑制记录器,请将 stderr 重定向添加到/dev/null
pocketsphinx_continuous -infile resampled.wav 2> /dev/null
关于java - 用于在音频文件中转录语音的开源软件,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/7613089/
我在为 MacOSX 构建的独立包中添加 DMG 背景的自定义图标时遇到问题。我在项目的根目录中添加了一个包。正在从中加载自定义图标,但没有加载 DMG 背景图标。我正在使用 Java fx 2.2.
Qt for Symbian 和 Qt for MeeGo 有什么区别?我知道 Qt 是一个交叉编译平台。这是否意味着如果我使用来自 Qt 的库,完全相同的库可以在所有支持 Qt 的设备(例如 Sym
我正在尝试使用 C# .NET 3.5/4.0 务实地运行 SQL Server 数据库的备份。我已经找到了如何完成此操作,但是我似乎找不到用于备份的命名空间库。 我正在寻找 Microsoft.Sq
我最近在疯狂学习 Java,但我通常是一名 .NET 开发人员。 (所以请原谅我的新手问题。) 在 .Net 中,我可以在不使用 IIS 的情况下开发 ASP.Net 页面,因为它有一个简化的 Web
这post仅当打印命令中有字符串时才有用。现在我有大量的源代码,其中包含一条声明,例如 print milk,butter 应该格式化为 print(milk,butter) 用\n 捕获行尾并不成功
所以我的问题是: https://gist.github.com/panSarin/4a221a0923927115584a 当我保存这个表格时,我收到了标题中的错误 NoMethodError (u
如何让 Html5 音频在点击时播放声音? (ogg 用于 Firefox 等浏览器,mp3 用于 chrome 等浏览器) 到目前为止,我可以通过 onclick 更改为单个文件类型,但我无法像在普
如果it1和it2有什么区别? std::set s; auto it1 = std::inserter(s, s.begin()); auto it2 = std::inserter(s, s.en
4.0.0 com.amkit myapp SpringMVCFirst
我目前使用 Eclipse 作为其他语言的 IDE,而且我习惯于不必离开 IDE 做任何事情 - 但是我真的很难为纯 ECMAScript-262 找到相同或类似的设置。 澄清一下,我不是在寻找 DO
我想将带有字符串数组的C# 结构发送到C++ 函数,该函数接受void * 作为c# 结构和char** 作为c# 结构字符串数组成员。 我能够将结构发送到 c++ 函数,但问题是,无法从 c++ 函
我正在使用动态创建的链接: 我想为f:param附加自定义转换器,以从#{name}等中删除空格。 但是f:param中没有转换器
是否可以利用Redis为.NET创建后写或直写式缓存?理想情况下,透明的高速缓存是由单个进程写入的,并且支持从数据库加载丢失的数据,并每隔一段时间持久保存脏块? 我已经搜查了好几个小时,也许是goog
我正在通过bash执行命令的ssh脚本。 FILENAMES=( "export_production_20200604.tgz" "export_production_log_2020060
我需要一个正则表达式来出现 0 到 7 个字母或 0 到 7 个数字。 例如:匹配:1234、asdbs 不匹配:123456789、absbsafsfsf、asf12 我尝试了([a-zA-Z]{0
我有一个用于会计期间的表格,该表格具有期间结束和开始的开始日期和结束日期。我使用此表来确定何时发生服务交易以及何时在查询中收集收入,例如... SELECT p.PeriodID, p.FiscalY
我很难为只接受字符或数字的 Laravel 构建正则表达式验证。它是这样的: 你好<-好的 123 <- 好的 你好123 <-不行 我现在的正则表达式是这样的:[A-Za-z]|[0-9]。 reg
您实际上会在 Repeater 上使用 OnItemDataBound 做什么? 最佳答案 “此事件为您提供在客户端显示数据项之前访问数据项的最后机会。引发此事件后,数据项将被清空,不再可用。” ~
我有一个 fragment 工作正常的项目,我正在使用 jeremyfeinstein 的 actionbarsherlock 和滑动菜单, 一切正常,但是当我想自定义左侧抽屉列表单元格时,出现异常
最近几天,我似乎平均分配时间在构建我的第一个应用程序和在这里发布问题!! 这是我的第一个应用程序,也是我们的设计师完成的第一个应用程序。我试图满足他所做的事情的外观和感觉,但我认为他没有做适当的事情。
我是一名优秀的程序员,十分优秀!