gpt4 book ai didi

speech-to-text - 使用 Bing Speech API(语音到文本)转录 MP3 音频文件

转载 作者:行者123 更新时间:2023-12-02 03:16:18 24 4
gpt4 key购买 nike

我有一个 MP3 格式的长录音(小时以上)。以下是我设法从 FFMPEG 获得的关于音频文件的信息:

[mp3 @ 000001fe666da320] Skipping 0 bytes of junk at 58650.
[mjpeg @ 000001fe666effe0] Changing bps to 8
[mp3 @ 000001fe666da320] Estimating duration from bitrate, this may be inaccurate
Input #0, mp3, from '1.mp3':
Duration: 00:57:18.52, start: 0.000000, bitrate: 192 kb/s
Stream #0:0: Audio: mp3, 44100 Hz, mono, s16p, 192 kb/s
Stream #0:1: Video: mjpeg, yuvj420p(pc, bt470bg/unknown/unknown), 1300x1370, 90k tbr, 90k tbn, 90k tbc

我想使用 Bing Speech API (Microsoft Oxford - 认知服务 - 语音 API)转录此文件(语音到文本)。

我相信这可以通过使用类似下面的代码来实现。

选项 1:在发送任何音频数据之前,您必须先发送一个 SpeechAudioFormat 描述符,以通过 DataRecognitionClient 的 sendAudioFormat() 方法描述原始音频数据的布局和格式。 您能否提供此选项的代码示例?

选项 2: 将文件转换为目标可接受的格式。我已经用 FFMPEG 做到了,这就是我得到的:

Duration: 00:57:23.67, bitrate: 256 kb/s
Stream #0:0: Audio: pcm_s16le ([1][0][0][0] / 0x0001), 16000 Hz, 1 channels, s16, 256 kb/s

据我了解 documentation ,这应该是可以接受的:音频必须是 PCM、单声道、16 位采样,采样率为 8000 Hz 或 16000 Hz。

我试图将音频发送到服务器但没有得到任何回复。我在正确的轨道上吗?最大缓冲区大小是多少?

您是否看到其他可能更简单的选项来转录我的音频文件?

private void SendAudioHelper(string wavFileName)
{
using (FileStream fileStream = new FileStream(wavFileName, FileMode.Open, FileAccess.Read))
{
int bytesRead = 0;
byte[] buffer = new byte[1024];

try
{
do
{
// Get more Audio data to send into byte buffer.
bytesRead = fileStream.Read(buffer, 0, buffer.Length);

// Send of audio data to service.
this.dataClient.SendAudio(buffer, bytesRead);
}
while (bytesRead > 0);
}
finally
{
// We are done sending audio. Final recognition results will arrive in OnResponseReceived event call.
this.dataClient.EndAudio();
}
}
}

最佳答案

使用 REST 实现时有 15 秒的限制。 SDK 有 2 分钟的限制。

必应语音团队

关于speech-to-text - 使用 Bing Speech API(语音到文本)转录 MP3 音频文件,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/36833220/

24 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com