【问题标题】:FFMpeg library: how to precisely seek in an audio fileFFMpeg 库:如何在音频文件中精确查找
【发布时间】:2018-10-26 20:05:01
【问题描述】:

在我的 Android 应用程序中使用 FFMpeg 库,我试图了解如何在音频文件中寻找一个非常精确的位置。

例如,我想将文件中的当前位置设置为帧#1234567(在以 44100 Hz 编码的文件中),这相当于在 27994.717 毫秒处查找。

为此,我尝试了以下方法:

// this:
av_seek_frame(formatContext, -1, 27994717, 0);

// or this:
av_seek_frame(formatContext, -1, 27994717, AVSEEK_FLAG_ANY);

// or even this:
avformat_seek_file(formatContext, -1, 27994617, 27994717, 27994817, 0);

使用以微秒为单位的位置给了我迄今为止最好的结果。

但由于某种原因,定位并不完全准确:当我从音频文件中提取样本时,它并没有完全从预期的位置开始。有大约 30-40 毫秒的轻微延迟(即使我寻找位置 0,令人惊讶的是......)。

我是否以正确的方式使用函数,甚至是正确的函数?

编辑

这是我获得职位的方法:

AVPacket packet;
AVStream *stream = NULL;
AVFormatContext *formatContext = NULL;
AVCodec *dec = NULL;

// initialization:
avformat_open_input(&formatContext, filename, NULL, NULL);
avformat_find_stream_info(formatContext, NULL);
int audio_stream_index = av_find_best_stream(formatContext, AVMEDIA_TYPE_AUDIO, -1, -1, &dec, 0);
stream = formatContext->streams[audio_stream_index];

...

// later, when I extract samples, here is how I get my position, in microseconds:
av_read_frame(formatContext, &packet);
long position = (long) (1000000 * (packet.pts * ((float) stream->time_base.num / stream->time_base.den)));

感谢那段代码,我可以获得当前帧开始的位置(帧 = 样本块,大小取决于音频格式 - mp3 为 1152 个样本,ogg 为 128 到 1152 个样本,.. .)

问题是:我在position 中得到的值不准确:实际上大约晚了 30 毫秒。比如说1000000,实际位置大概是1030000...

我做错了什么?这是 FFMpeg 中的错误吗?

感谢您的帮助。

【问题讨论】:

  • 我很想知道您的 actual 应用程序在哪里 40ms 延迟/偏移实际上很重要?对于大多数桌面应用程序或游戏来说,40 毫秒的延迟很可能是微不足道的。你在做什么,这实际上很重要?即使在视频中,40 毫秒的音频延迟也不太可能引起注意。
  • @JesperJuhl 因为我正在开发某种 DJ 应用程序,所以我正在混音的每首歌曲的位置必须尽可能精确(所以我尝试将延迟控制在 1 毫秒以下)
  • 感谢您的解释。这是有道理的。
  • 我想添加那个可能使用相同库的 MPlayer,也有定位故障。它总是在播放 mp3 时报告位置,并且定位到该位置或多或少是准确的,除非您使用“seek +-N sec”控件,之后报告的位置会出错,有时会在 5 分钟内出错记录。 MPlayer 问题的人工解决方法是以 2 倍到 4 倍的速度播放,而不是使用“向前搜索”功能。

标签: android c++ ffmpeg


【解决方案1】:

这取决于编解码器。例如,aac 的分辨率为每帧 1024 个样本,无论采样率如何,它也有可能被丢弃的启动样本。 MP3 每帧有 576 或 1152 个样本,具体取决于层。

如果您需要完美,请使用未压缩的格式,如 wav 或 riff。

【讨论】:

  • 谢谢,但我确信有办法:其他库能够做我想做的事情,即使是 mp3。似乎 FFMpeg 也可以做到这一点,但由于某种原因,它并不完全准确。那么,当我正在考虑一种解决方法时,是否有可能获得实际的当前位置?
  • 有一种方法,需要添加第二步。 ffmpeg解码到大概位置后,需要把不需要的样本丢掉,实现子帧搜索。
【解决方案2】:

晚了,但希望它可以帮助某人。这个想法是在寻找时保存时间戳,然后将 AVPacket->pts 与该值进行比较(您可以使用 AVStream->dts 来做到这一点,但效果不佳结果在我的实验中)。如果 pts 仍然低于我们的目标时间戳,则使用 AVPacket->side_dataAV_PKT_DATA_SKIP_SAMPLES 能力跳过帧。

求方法代码:

void audio_decoder::seek(float seconds) {
    auto stream = m_format_ctx->streams[m_packet->stream_index];

    // convert seconds provided by the user to a timestamp in a correct base,
    // then save it for later.
    m_target_ts = av_rescale_q(seconds * AV_TIME_BASE, AV_TIME_BASE_Q, stream->time_base);

    avcodec_flush_buffers(m_codec_ctx.get());

    // Here we seek within given stream index and the correct timestamp 
    // for that stream. Using AVSEEK_FLAG_BACKWARD to make sure we're 
    // always *before* requested timestamp.
    if(int err = av_seek_frame(m_format_ctx.get(), m_packet->stream_index, m_target_ts, AVSEEK_FLAG_BACKWARD)) {
        error("audio_decoder: Error while seeking ({})", av_err_str(err));
    }
}

及解码方法代码:

void audio_decoder::decode() {
   <...>

   while(is_decoding) {
       // Read data as usual.
       av_read_frame(m_format_ctx.get(), m_packet.get());

       // Here is the juicy part. We were seeking, but the seek 
       // wasn't precise enough so we need to drop some frames.
       if(m_packet->pts > 0 && m_target_ts > 0 && m_packet->pts < m_target_ts) {
            auto stream = m_format_ctx->streams[m_packet->stream_index];

            // Conversion from delta timestamp to frames.
            auto time_delta = static_cast<float>(m_target_ts - m_packet->pts) / stream->time_base.den;
            int64_t skip_frames = time_delta * m_codec_ctx->time_base.den / m_codec_ctx->time_base.num;

            // Next step: we need to provide side data to our packet,
            // and it will tell the codec to drop frames.
            uint8_t *data = av_packet_get_side_data(m_packet.get(), AV_PKT_DATA_SKIP_SAMPLES, nullptr);
            if(!data) {
                 data = av_packet_new_side_data(m_packet.get(), AV_PKT_DATA_SKIP_SAMPLES, 10);
            }

            // Define parameters of side data. You can check them here:
            // https://ffmpeg.org/doxygen/trunk/group__lavc__packet.html#ga9a80bfcacc586b483a973272800edb97
            *reinterpret_cast<uint32_t*>(data) = skip_frames;
            data[8] = 0;
        }

        // Send packet as usual.
        avcodec_send_packet(m_codec_ctx.get(), m_packet.get());

        // Proceed to the receiving frames as usual, nothing to change there.
   }
   <...>
}

如果没有上下文不清楚,你可以在我的项目audio_decoder.cpp中查看相同的代码。

【讨论】:

  • 谢谢,值得一试。我稍后会尝试。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2019-03-05
  • 2019-11-20
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多