ffmpeg - 如何使用 Google 的 Cloud Speech-to-Text REST API 转录视频-6ren

ffmpeg - 如何使用 Google 的 Cloud Speech-to-Text REST API 转录视频

转载作者：行者123 更新时间：2023-12-04 23:25:28

25

4

我想要 2 个人在视频中讲话的文字记录，但我从 Cloud Speech-to-Text API 得到一个空的响应

方法:

我有一个 56 分钟的视频文件，其中包含两个人之间的对话。我想要那次谈话的文字记录，我想使用 Google 的 Cloud Speech-to-Text API 来获得它。

为了在我的谷歌云存储上节省一点，我首先使用 mmpeg 将视频转换为音频。

首先，我尝试使用下面的命令找出音频编解码器，它看起来像 AAC。ffmpeg -i video.mp4

Input #0, mov,mp4,m4a,3gp,3g2,mj2, from 'videoplayback.mp4':
  Metadata:
    major_brand     : mp42
    minor_version   : 0
    compatible_brands: isommp42
    creation_time   : 2015-12-30T08:17:14.000000Z
  Duration: 00:56:03.99, start: 0.000000, bitrate: 362 kb/s
    Stream #0:0(und): Video: h264 (Constrained Baseline) (avc1 / 0x31637661), yuv420p, 490x360 [SAR 1:1 DAR 49:36], 264 kb/s,     29.97 fps, 29.97 tbr, 30k tbn, 59.94 tbc (default)
    Metadata:
      handler_name    : VideoHandler
    Stream #0:1(eng): Audio: aac (LC) (mp4a / 0x6134706D), 44100 Hz, stereo, fltp, 96 kb/s (default)
    Metadata:
      creation_time   : 2015-12-30T08:17:31.000000Z
      handler_name    : IsoMedia File Produced by Google, 5-11-2011

所以我从视频中使用: ffmpeg -i video.mp4 -vn -acodec copy myaudio.aac
到目前为止的详细信息: ffmpeg -i myaudio.aac输出:

Input #0, aac, from 'myaudio.aac':
  Duration: 00:56:47.49, bitrate: 97 kb/s
    Stream #0:0: Audio: aac (LC), 44100 Hz, stereo, fltp, 97 kb/s

之后我将其转换为 opus，因为有人告诉我 opus 更好 ffmpeg -i myaudio.aac -acodec libopus -b:a 97k -vbr on -compression_level 10 myaudio.opus
到目前为止的信息: opusinfo myaudio.opus

User comments section follows...
    encoder=Lavc58.18.100 libopus
Opus stream 1:
    Pre-skip: 312
    Playback gain: 0 dB
    Channels: 2
    Original sample rate: 48000Hz
    Packet duration:   20.0ms (max),   20.0ms (avg),   20.0ms (min)
    Page duration:   1000.0ms (max), 1000.0ms (avg), 1000.0ms (min)
    Total data length: 29956714 bytes (overhead: 0.872%)
    Playback length: 56m:03.990s
    Average bitrate: 71.24 kb/s, w/o overhead: 70.62 kb/s

我此时将 myaudio.opus 上传到了 Google Cloud Storage。

curl POST 1
我通过使用 curl 进行 POST 来开始语音识别:

curl --request POST  --header "Content-Type: application/json" --url 'https://speech.googleapis.com/v1/speech:longrunningrecognize?fields=done%2Cerror%2Cmetadata%2Cname%2Cresponse&key={MY_API_KEY}' --data '{"audio": {"uri": "gs://{MY_BUCKET}/myaudio.opus"},"config": {"encoding": "OGG_OPUS", "sampleRateHertz": 48000, "languageCode": "en-US"}}'

响应: {"name": "123456789"}123456789 不是实际值。

curl GET 1
现在我想得到结果:

curl --request GET --url 'https://speech.googleapis.com/v1/operations/123456789?fields=done%2Cerror%2Cmetadata%2Cname%2Cresponse&key={MY_API_KEY}'

这给了我错误:

Error : Unable to recognize speech, possible error in encoding or channel config. Please correct the config and retry the request.

所以我将编码配置从 OGG_OPUS 更新为 LINEAR16 。

curl POST 2
又发了个帖子:

curl --request POST  --header "Content-Type: application/json" --url 'https://speech.googleapis.com/v1/speech:longrunningrecognize?fields=done%2Cerror%2Cmetadata%2Cname%2Cresponse&key={MY_API_KEY}' --data '{"audio": {"uri": "gs://{MY_BUCKET}/myaudio.opus"},"config": {"encoding": "LINEAR16", "sampleRateHertz": 48000, "languageCode": "en-US"}}'

响应: {"name": "987654321"}
curl GET 2

curl --request GET --url 'https://speech.googleapis.com/v1/operations/987654321?fields=done%2Cerror%2Cmetadata%2Cname%2Cresponse&key={MY_API_KEY}'

回复:

{
  "name": "987654321",
  "metadata": {
    "@type": "type.googleapis.com/google.cloud.speech.v1.LongRunningRecognizeMetadata",
    "progressPercent": 100,
    "startTime": "2018-06-08T11:01:24.596504Z",
    "lastUpdateTime": "2018-06-08T11:01:51.825882Z"
  },
  "done": true
}

问题是我没有得到实际的转录。根据文档，在包含数据的响应中应该有一个 response 键。

由于我有点卡在这里，我想知道我是否做错了什么。我没有任何技术或资源限制，因此非常欢迎所有建议!也很高兴改变我的方法。

提前致谢!干杯

最佳答案

Looks like目前仅支持 WAV 和 FLAC。
使用 gcloud在本地命令，我成功了:

gcloud ml speech recognize-long-running gs://bucket-name/file.flac  --language-code en-US --include-word-time-offsets > my_transcription.json

使用本地文件时出现字节限制错误。 Says you can

关于ffmpeg - 如何使用 Google 的 Cloud Speech-to-Text REST API 转录视频，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/50760057/

25

4

0

文章推荐： Cassandra - 了解 PropertyFile Snitch 示例的机架概念

文章推荐： regex - Nutch regex-urlfilter 语法

文章推荐： kohana - 无法使用 Kohana 3.3.0 ORM Auth 登录

java - 使用 Java 转录
有谁知道是否有可能将俄语输入转录为拉丁语？有什么框架支持吗？我正在搜索字符集，但它不支持这种情况提前致谢。最佳答案 Map translit = new HashMap<>(); stati
java - Solr:支持希腊语的音译/转录
我已经为一些包含希腊字母的字段建立了索引(例如Στεφαν)。就像在谷歌中一样，当我搜索 Stefan 时，我想找到这些文档。是否支持希腊语单词的音译/转录？到目前为止，我已经尝试过 solr.AS
python - pyspeech (python) - 转录 mp3 文件？
我想使用 pyspeech API 转录 mp3(语音到文本)。不过，我不知道这是否可行。是吗？怎么办？最佳答案 pyspeech 似乎只是常规 Windows 语音 API 的 python 接
tensorflow - 使用 Tensorflow 进行 IPA(国际音标)转录
我正在考虑设计一个软件平台，以帮助语言学家和人类学家研究以前未研究过的语言。统计数据显示，大约有 1,000 种语言从未被各自语言群体之外的人研究过。我的目标是利用 TensorFlow 创建一个平
azure - Azure 转录 JSON 文件的 VTT 输出
我抬头发现了这个 - https://learn.microsoft.com/en-us/azure/cognitive-services/speech-service/captioning-conc
swift - Swift 中的 DNA 到 RNA 转录
我正在尝试在 Swift 中返回给定 DNA 链(字符串)的 RNA 互补序列。基本上，如果 DNA 有一个“T”，我会用“U”代替它。我的代码是: func toRNA(DNA: String)
linux - 通过 AWS CLI 进行 AWS 转录
我可以像这样通过 AWS CLI 使用 AWS S3 服务: aws s3 cp FileToUpload.txt s3://MyBucketName/file.txt 如何使用 AWS 转录服务？通
ios - iOS 应用程序上的 SFSpeechRecognizer(Siri 转录)超时错误
在我的 iOS 应用程序中，我尝试使用 iOS 10 的最新功能 Speech API 来转录预先录制的音频。多个来源，包括 documentation已声明语音 API(更具体地说是 SFSpee
Azure Batch 转录 : Error when downloading the recording URI. 状态代码:冲突(下载失败)
我正在尝试使用 Microsoft Azure 的批量转录。关注官方documentation我想应该是这样的: 我将音频发送到服务 (POST) 获取结果。 (使用帖子的参数获取) 但我什么也没得到
Azure Batch 转录 : Error when downloading the recording URI. 状态代码:冲突(下载失败)
我正在尝试使用 Microsoft Azure 的批量转录。关注官方documentation我想应该是这样的: 我将音频发送到服务 (POST) 获取结果。 (使用帖子的参数获取) 但我什么也没得到
speech-to-text - 使用 Bing Speech API(语音到文本)转录 MP3 音频文件
我有一个 MP3 格式的长录音(小时以上)。以下是我设法从 FFMPEG 获得的关于音频文件的信息: [mp3 @ 000001fe666da320] Skipping 0 bytes of junk

首页

博学

6Ren·AI

商城

ffmpeg - 如何使用 Google 的 Cloud Speech-to-Text REST API 转录视频